יום שישי, 21 באוגוסט 2026 מתעדכן אוטומטית כל שעה

כל מה שחם בעולם הבינה המלאכותית · בעברית

📚 בית הספר ל-AI ✈️ הצטרפו לערוץ הטלגרם

בנושא: SWE-bench

משתמש בדק את Ox Alpha מול בעיות קוד אמיתיות: 96% הצלחה, מעל Fable 5 — אך גם ספקנות עצמית

משתמש ב-Reddit הריץ את המודל Ox Alpha על תת-קבוצה של 50 משימות מתוך בנצ'מרק SWE-bench Verified, וקיבל שיעור פתרון של 96%, העולה על ציון Fable 5 של Anthropic. עם זאת, מפרסם הבדיקה עצמו הביע ספקנות כלפי התוצאה שלו, וזו בדיקה בודדת ולא בהכרח מאומתת באופן עצמאי ומלא.