משתמש בדק את Ox Alpha מול בעיות קוד אמיתיות: 96% הצלחה, מעל Fable 5 — אך גם ספקנות עצמית
משתמש ב-Reddit הריץ את המודל Ox Alpha על תת-קבוצה של 50 משימות מתוך בנצ'מרק SWE-bench Verified, וקיבל שיעור פתרון של 96%, העולה על ציון Fable 5 של Anthropic. עם זאת, מפרסם הבדיקה עצמו הביע ספקנות כלפי התוצאה שלו, וזו בדיקה בודדת ולא בהכרח מאומתת באופן עצמאי ומלא.