משתמש ב-Reddit הריץ את המודל Ox Alpha על תת-קבוצה של 50 משימות מתוך בנצ'מרק SWE-bench Verified, וקיבל שיעור פתרון של 96%, העולה על ציון Fable 5 של Anthropic. עם זאת, מפרסם הבדיקה עצמו הביע ספקנות כלפי התוצאה שלו, וזו בדיקה בודדת ולא בהכרח מאומתת באופן עצמאי ומלא.
משתמש בפורום r/LocalLLaMA פרסם תוצאות של בדיקה שהריץ בעצמו על המודל Ox Alpha, במסגרתה בחן את יכולתו לפתור באגים אמיתיים בקוד. הבדיקה בוצעה על SWE-bench Verified Mini — תת-קבוצה של 50 משימות מתוך בנצ'מרק SWE-bench Verified, שנחשב לאחד הכלים המקובלים בתעשייה למדידת יכולת מודלי שפה לתקן תקלות בקוד אמיתי מתוך פרויקטי קוד פתוח.
לפי הפרסום, Ox Alpha פתר 48 מתוך 50 המשימות, כלומר 96%. הבדיקה בוצעה עם ה-scaffold הרשמי בשם mini-swe-agent — אותו מסגרת סוכן המשמשת ללוח התוצאות הרשמי "Bash-Only" באתר swebench.com — וההערכה בוצעה מקומית באמצעות ה-harness הרשמי של SWE-bench, המריץ כל תיקון בסביבת Docker מבודדת ובודק אם הבדיקות (tests) עוברות בפועל.
לצורך השוואה, מפרסם הבדיקה מציין כי מודל Fable 5 של Anthropic משיג ציון של 95% — אך זאת כאשר הוא פועל עם ה-scaffold המותאם והמכוונן במיוחד על ידי Anthropic עצמה, לא עם מסגרת גנרית. באותה בדיקה, וכאשר משתמשים באותו scaffold גנרי מבוסס Bash שבו נבדק Ox Alpha, המודלים המובילים האחרים מגיעים לכ-77% בלבד על מלוא 500 המשימות של הבנצ'מרק המלא.
הפער הזה הוא שהדליק אצל מפרסם הבדיקה נורת אזהרה. הוא מציין במפורש שהתוצאה "נראית טובה מכדי להיות אמיתית", ושזו בדיוק הסיבה שבגללה בחר לפרסם אותה — כדי לזמן ביקורת מהקהילה ולבדוק אם יש טעות מתודולוגית, זיהום נתונים (data contamination) או הסבר אחר לציון החריג. מדובר בבדיקה שביצע משתמש בודד על מדגם חלקי של 50 משימות מתוך 500, ולא באימות עצמאי, מלא ורשמי של תוצאה כזו.
המשמעות המיידית, ככל שהתוצאה תישמר גם בבדיקות נוספות ורחבות יותר, היא שמודל שמתואר כזמין בשכבת חינם (free-tier) הצליח, לפי הבדיקה החד-פעמית הזו, לעקוף ציון של מודל מוביל בתשלום גם כשלזה האחרון יש יתרון של scaffold מותאם אישית. אולם מכיוון שמדובר בדגימה קטנה יחסית ובפרסום שמפרסמו עצמו מטיל בו ספק, יש להמתין לאימותים נוספים ובלתי-תלויים לפני שניתן לקבוע שמדובר במגמה אמיתית ולא בחריגה סטטיסטית או בעיה מתודולוגית.