יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

בנצ'מארק

בנצ'מארק חדש: GPT-6 Astra ו-Claude Fable 5.1 חולקות את הראשונות, DeepSeek הסינית עדיין מאחור

חברת המחקר Artificial Analysis פרסמה גרסה מעודכנת של מדד האינטליגנציה שלה, ולפיה GPT-6 Astra של OpenAI ו-Claude Fable 5.1 של אנתרופיק חולקות את הראשונות בציון זהה. בקרב מודלי ה-open weights מובילה DeepSeek V4 Pro, אך בפער ניכר מטה. טענה שהופצה ברשת החברתית רדיט על ניצחון של מודל סיני אחר על Astra אינה מגובה במקור הרשמי.

OpenAI משיקה את GPT-6 Astra: ביצועים מובילים במתמטיקה, גם בלי שהתמקדו בזה

GPT-6 Astra, המודל החדש של OpenAI, תפס את המקום הראשון בבנצ'מארק המתמטי ErdosBench, על אף שהמדען הראשי של החברה, ג'קוב פחוצקי, אמר במפורש שמתמטיקה לא הייתה בעדיפות בפיתוחו. החברה מתעדפת מחקר בתחום ה-RSI (שיפור עצמי רקורסיבי) ויישור אוטומטי, וההישג המתמטי מצטייר כתוצר לוואי.

האם AI יכולה לעצב מעגלים אלקטרוניים?

בעקבות הדגמה של OpenAI למודל שמתכנן לוח מעגלים ב-KiCad, פרויקט הבנצ'מארק EEBench בוחן איך אפשר בכלל למדוד אם תכנון חומרה של AI תקין. הכלי משתמש בשפת קוד דקלרטיבית במקום ממשק גרפי, ומריץ סימולציות SPICE על משימות כמו החזקת מעבד בזמן הפסקת חשמל ותכנון מסנני תדרים תחת סטיות ייצור קיצוניות.

קלוד פייבל 5.1 עלה על הביצועים האנושיים ופענח חידה בת 373 שנה מהמאה ה-17

מודל השפה Claude Fable 5.1 של Anthropic עמד לאחרונה בשני מבחנים נפרדים: לפי עדכון של לוח התוצאות של SimpleBench הוא חצה לראשונה את הרף האנושי בבנצ'מארק שנועד לבחון היגיון יומיומי, ובמקביל פענח, לפי חברת ההערכה Vals AI, חידת מספרים בת 373 שנה מהמאה ה-17 שנותרה פתוחה עד היום. שני האירועים ממחישים שיפור ביכולת התמדה במשימות ארוכות, אך שניהם מבוססים על מדגמים קטנים ולא נבדקו באופן עצמאי נוסף.

טענה ברשת: DeepSeek V4 Flash מנצח את קלוד בבנצ'מארק טרמינל - במחיר נמוך פי 11

פוסט שהתפרסם בפורום r/singularity טוען כי מודל חדש של DeepSeek, המכונה V4 Flash, עוקף את Claude Fable 5 של אנתרופיק בבנצ'מארק Terminal-Bench 2.1 בזכות יכולת 'אימות עצמי' (self-verification), ובמחיר הנמוך פי 11 ממחיר המודל המתחרה. מדובר בטענה שעלתה ברשת ולא בהכרזה רשמית מגובה בנתונים מלאים.