יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

בנצ'מארק חדש: GPT-6 Astra ו-Claude Fable 5.1 חולקות את הראשונות, DeepSeek הסינית עדיין מאחור

חברת המחקר Artificial Analysis פרסמה גרסה מעודכנת של מדד האינטליגנציה שלה, ולפיה GPT-6 Astra של OpenAI ו-Claude Fable 5.1 של אנתרופיק חולקות את הראשונות בציון זהה. בקרב מודלי ה-open weights מובילה DeepSeek V4 Pro, אך בפער ניכר מטה. טענה שהופצה ברשת החברתית רדיט על ניצחון של מודל סיני אחר על Astra אינה מגובה במקור הרשמי.

חברת המחקר Artificial Analysis פרסמה ב-7 בספטמבר 2026 עדכון למדד האינטליגנציה שלה, Intelligence Index, הגרסה v4.3. המדד המעודכן משלב עשרה מבחני הערכה (benchmarks) שונים, ומחליף את מבחן ה-𝜏³-Banking במבחן חדש בשם AutomationBench-AA, שפותח בשיתוף עם חברת Zapier ובודק ביצוע משימות אוטומציה עסקיות. בנוסף שודרג מבחן Terminal-Bench, הבודק יכולת של מודלים לבצע משימות מורכבות דרך שורת פקודה, מגרסה 2.1 לגרסה 4.0, עם 66 משימות קשות יותר בתחומי תוכנה, למידת מכונה, מדע, תפעול, אבטחה, חומרה ומדיה.

בראש הטבלה נמצאות שתי חברות אמריקאיות במקום ראשון משותף: GPT-6 Astra של OpenAI (בתצורת max) ו-Claude Fable 5.1 של אנתרופיק (בתצורת max with fallback), שתיהן עם ציון 53 מתוך 100 במדד הכולל. מיד אחריהם Claude Opus 5 עם ציון 51, Claude Fable 5 עם ציון 50, Muse Spark 1.3 עם ציון 48 ו-GPT-5.6 Sol עם ציון 47.

בקרב מודלי קוד פתוח (open weights) המוביל הוא GLM-5.3 Flash עם ציון 42, ואחריו Qwen3.8 2.4T A95B עם ציון 40. המודל הסיני של DeepSeek המדורג הכי גבוה במדד הוא DeepSeek V4 Pro 0813, עם ציון 36 — פער של 17 נקודות מתחת לציון המוביל של GPT-6 Astra ו-Claude Fable 5.1.

במבחן Terminal-Bench v4.0 הפער בין GPT-6 Astra למתחרים בולט עוד יותר: המודל של OpenAI השיג 59.1% הצלחה, לעומת 52.0% ל-Claude Fable 5.1 ו-49.0% ל-Claude Opus 5. Astra הקדימה את GPT-5.6 Sol (39.9%) בפער של 19.2 נקודות אחוז.

Artificial Analysis מציינת גם שחמש רמות ה"מאמץ נימוקי" (reasoning effort) השונות של GPT-6 Astra ממוקמות על "גבול הפארטו" של יחס עלות-לתועלת — כלומר, ברוב רמות האינטליגנציה, Astra מציעה את העלות הנמוכה ביותר למשימה. מודלים נוספים על אותו גבול הם MiMo-V2.5-Pro, GLM-5.3-Flash ו-Claude Fable 5.1.

לגבי הטענה שהופצה ברשת — פוסט בפורום r/LocalLLaMA ברדיט נשא כותרת לפיה מודל בשם "DeepSeek V4.1 Flash" הכה את GPT-6 Astra באותו מדד. חשוב להבהיר: מאמר המתודולוגיה הרשמי של Artificial Analysis, שאליו מפנה הפוסט עצמו, אינו מזכיר מודל בשם הזה כלל, ומודל ה-DeepSeek היחיד שמופיע בו — V4 Pro 0813 — מדורג עם ציון נמוך משמעותית מזה של Astra. הטענה שברדיט אינה מאומתת מול המקור המקושר, ואין לראות בה עובדה מבוססת.

ככל הנראה, מה שהעדכון בפועל משקף הוא התכנסות בין המעבדות המובילות בארה"ב בשיא היכולות הכלליות, לצד פער שעדיין נשמר בין מודלים סגורים למודלים פתוחים, כולל אלו שמקורם בסין. השינוי המתודולוגי המרכזי — הגדלת משקל המבחנים עם קבוצות בדיקה פרטיות מ-40% ל-45% מהציון הכולל — נועד להקשות על "לימוד" המבחנים מראש (gaming), ומעיד ככל הנראה על מגמה רחבה יותר בתעשייה של בניית מדדי הערכה עמידים יותר מול מודלים שמותאמים במיוחד לבנצ'מארקים ציבוריים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות