Astra מקדימה את Fable 5.1 במבחן המדעי. הטענה על ניקוד מושלם במבחן IQ עדיין לא מאומתת
לפי OpenAI, המודל החדש שלה GPT-6 Astra השיג 64.6% בבנצ'מרק Terminal-Bench Science 0.1. באותו מבחן השיג Claude Fable 5.1 של אנתרופיק 52.6%, יותר מכפול מהציון של הדור הקודם. במקביל מופצת ברשת טענה ששני המודלים קיבלו ציון מושלם במבחן ה-IQ של Mensa Norway, אבל עד עכשיו לא נמצא לה מקור שמאמת אותה.
OpenAI השיקה ב-3 בספטמבר את GPT-6 Astra. לפי הנתונים שפרסמה החברה, המודל השיג 64.6% בבנצ'מרק Terminal-Bench Science 0.1. הוא עקף את Claude Fable 5.1, המודל החדש של אנתרופיק, שהשיג 52.6%, ואת GPT-5.6 Sol, המודל הקודם של OpenAI, שהשיג 22.4%. כך דווח ב-Yahoo Finance. בימים האחרונים מופצת ברשתות גם טענה ששני המודלים קיבלו ציון מושלם במבחן ה-IQ של Mensa Norway. זה אולי נשמע כמו "תיקו בצמרת", אבל נכון לעכשיו אין מקור שמאמת את הטענה.
מה ידוע: פער של 12 נקודות
נשיא OpenAI, גרג ברוקמן, סיים את התדריך על Astra במשפט "Welcome to the AGI era" (ברוכים הבאים לעידן ה-AGI). לפני כן אמר שלדעתו האישית OpenAI כבר הגיעה ל-AGI, כלומר לבינה מלאכותית כללית ברמה אנושית.
גם הנתונים של אנתרופיק עצמה מעמידים את Fable 5.1 על 52.6%. לפי אותם נתונים, הדור הקודם, Fable 5, השיג במבחן 24.7% בלבד, כך שהציון יותר מהוכפל. לפי הכתבה, כל חברה הריצה את המבחן בסביבת הרצה (harness) קצת שונה, ומרווחי הטעות הסטטיסטית שדווחו שונים. המסקנה הכללית בכל זאת לא משתנה: Fable קפץ קדימה, ו-Astra עדיין מובילה.
סדרת Terminal-Bench בודקת עד כמה מודל מצליח לבצע משימות אמיתיות בסביבת שורת פקודה (terminal). גרסת ה-Science מתמקדת ככל הנראה במשימות מחקר מדעי. המבחן בודק ביצוע של עבודה ולא רק ידע, ולכן קפיצה כזאת משמעותית כנראה יותר מעוד כמה נקודות במבחן ידע כללי.
הטענה על Mensa Norway
הטענה ש-Fable 5.1 ו-Astra השיגו שניהם ציון מושלם במבחן Mensa Norway פורסמה בפוסט בפורום r/singularity ברדיט. לפוסט לא מצורף מקור, תוצאה רשמית או פרטים על אופן ההרצה. לכן צריך להתייחס אליה כדיווח לא מאומת.
Mensa Norway הוא מבחן IQ מקוון ופתוח לציבור, שמבוסס על שאלות של השלמת דפוסים חזותיים. בשנים האחרונות משתמשים בו גם כדי להשוות בין מודלי שפה. אם הטענה תאומת, המשמעות תהיה ככל הנראה פחות "שוויון" בין המודלים ויותר "אפקט תקרה": המבחן כבר לא מבחין בין המודלים המובילים. חשוב גם לזכור שהשאלות במבחן זמינות ברשת כבר שנים, ולכן תמיד קיים חשש שהמודלים נחשפו אליהן באימון.
למה זה חשוב
שני המודלים זמינים כבר עכשיו באותה פלטפורמה: מיקרוסופט התחילה להציע את Astra דרך Microsoft Foundry ב-3 בספטמבר, ו-Fable 5.1 זמין שם גם הוא. לפי הדיווח, גם מיקרוסופט וגם אמזון השקיעו או התחייבו להשקיע גם ב-OpenAI וגם באנתרופיק. כך שענקיות הענן מרוויחות מהתחרות בלי קשר למי שמוביל בבנצ'מרק מסוים.
לקוראים כדאי לזכור שהמספרים מגיעים בעיקר מהחברות עצמן ונמדדו בתנאים לא אחידים. הקפיצה של Fable ממחישה עד כמה מהר הדירוג יכול להשתנות בין דור לדור. עד שיתפרסמו מדידות עצמאיות, התמונה ככל הנראה ברורה פחות ממה שהכותרות מציגות.