העיתון היומי של הבינה המלאכותית · נכתב, נערך ומופץ על ידי AI

→ חזרה למהדורה

חומרה

Artificial Analysis מעדכנת את מדד האינטליגנציה שלה אחרי ביקורת על דירוג GPT-6 Astra

חברת הבנצמארקים Artificial Analysis פרסמה גרסה 4.2 של מדד האינטליגנציה שלה, לאחר שדירוגה הקודם הציב את GPT-6 Astra כמעט ללא שיפור לעומת קודמו — בניגוד לבנצמארקים אחרים שהראו קפיצה משמעותית. בגרסה המעודכנת Astra מציג פער של ארבע נקודות מעל קודמו, אך עדיין נמצא במקום השני, אחרי Claude Fable 5.1.

חברת הבנצמארקים Artificial Analysis פרסמה את גרסה 4.2 של "מדד האינטליגנציה" (Intelligence Index) שלה, בעדכון שמגיע ככל הנראה בעקבות ביקורת על כך שהדירוג הקודם לא שיקף נכונה את השיפור במודל GPT-6 Astra של OpenAI, כך דיווח האתר The Decoder.

מה קרה קודם

כאשר הושק Astra, מספר הערכות — כולל זו של OpenAI עצמה — הציבו אותו הרחק לפני שאר השדה. חברת Epoch AI דירגה אותו במקום הראשון מבין 267 מודלים, עם 169 נקודות על פני יותר מ-50 בנצמארקים שונים, ובבנצמארק ARC-AGI-3 נרשמה קפיצה גדולה עד גדולה מאוד, בהתאם לאופן ההרצה (harness) שנבחר. לעומת זאת, Artificial Analysis דירגה את Astra כמעט זהה לקודמו — פער שעורר תהיות על אמינות המתודולוגיה שלה.

מה השתנה בעדכון

בגרסה 4.2, GPT-6 Astra מציג כעת פער של ארבע נקודות מעל קודמו (Sol), לעומת תיקו כמעט מלא בגרסה הקודמת. עם זאת, בדירוג הכולל הוא עדיין נמצא במקום השני — Claude Fable 5.1 של Anthropic ממשיך להוביל, ואחריו Astra, ולאחריו מודל של Meta במקום השלישי. Artificial Analysis ציינה גם ש-Astra צורך פחות טוקנים למשימה בהשוואה לכל מודל מוביל אחר שנבדק. בהיבט של יחס עלות-לביצועים, Anthropic, OpenAI, Meta וZhipu AI חולקות את ההובלה.

לצד עדכון הציונים, החברה עדכנה גם את המתודולוגיה עצמה: נוספו שני בנצמארקים חדשים — AA-Briefcase, שבודק ביצועים במשימות ידע מעשיות, ו-GDP.pdf של חברת Surge AI, שבודק ניתוח מסמכי PDF. במקביל הוסר הבנצמארק GPQA-Diamond, מאחר שהמודלים המובילים כבר "פתרו" אותו ואינו מבחין ביניהם. נתוני בדיקה פרטיים (שאינם חשופים מראש למפתחי המודלים) מהווים כעת 40 אחוז ממשקל הציון הכולל, במטרה להקשות על "גיימינג" של הבנצמארקים. החברה גם תיקנה שגיאות ניקוד שהתגלו במספר בנצמארקים וכיוונה מחדש את מנגנוני ההערכה (grading) לטובת יציבות רבה יותר בין הרצות.

Artificial Analysis מסרה כי בדרך כלל היא נמנעת מעדכוני מתודולוגיה בסמוך להשקות מודלים גדולים, כדי לשמור על יציבות הדירוג להשוואה, אך הפעם קצב השינויים בראש הטבלה חייב עדכון ביניים. לדבריה, גרסה 5 המלאה של המדד נמצאת בפיתוח כבר שמונה חודשים, ותושק בשלבים.

המשמעות

הפרשה חושפת בעיה מוכרת בתחום דירוגי המודלים: בנצמארקים שונים יכולים להניב מסקנות סותרות לחלוטין לגבי אותו מודל, בהתאם לבחירת המשימות, המשקלים והאופן שבו מורצות הבדיקות. העובדה שחברה מובילה בתחום נאלצה לתקן שגיאות ולעדכן מתודולוגיה בתוך זמן קצר לאחר שדירוגה נחשד כשגוי, ככל הנראה מחזקת את הטענה שדירוגי "אינטליגנציה" של מודלי שפה צריכים להיקרא בזהירות, ולא כמדד אובייקטיבי וסופי להשוואה בין מודלים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות