יום שני, 5 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

בנצ'מרקים

מחקר

Sonnet 5.5 אמור להוזיל משימות, אבל מדידה עצמאית מצאה שבמאמץ מקסימלי הוא יקר יותר

אנתרופיק השיקה את Claude Sonnet 5.5 באותו מחיר לטוקן כמו קודמו, וטוענת שהמודל החדש מבצע משימות בעלות נמוכה בעד 30%. לפי מדידה עצמאית של Artificial Analysis, ברמת המאמץ המקסימלית משימה עולה יותר מאשר ב-Sonnet 5 ואפילו יותר מאשר ב-Opus 5.5. משתמשים כבר בודקים אם מודלים מתחרים, כולל מודלים פתוחים, נותנים יותר תמורה לדולר.

מחקר

להגיע לאותה רמת ביצועים של AI עולה פי 13 פחות בכל שנה, אבל המודלים המובילים לא נעשים זולים יותר

לפי ארגון המחקר Epoch AI, העלות להגיע לציון קבוע במבחני AI יורדת בכ-47% בכל רבעון, כלומר פי 13 בערך בשנה. חוקרים מ-MIT מעריכים שהשיפור האלגוריתמי עצמו קטן בהרבה, בערך פי 3 בשנה. בינתיים, הפעלת מודלי ה-reasoning המתקדמים ביותר עולה לפעמים יותר, ולא פחות.

מחקר

Astra מקדימה את Fable 5.1 במבחן המדעי. הטענה על ניקוד מושלם במבחן IQ עדיין לא מאומתת

לפי OpenAI, המודל החדש שלה GPT-6 Astra השיג 64.6% בבנצ'מרק Terminal-Bench Science 0.1. באותו מבחן השיג Claude Fable 5.1 של אנתרופיק 52.6%, יותר מכפול מהציון של הדור הקודם. במקביל מופצת ברשת טענה ששני המודלים קיבלו ציון מושלם במבחן ה-IQ של Mensa Norway, אבל עד עכשיו לא נמצא לה מקור שמאמת אותה.

מחקר

OpenAI חותכת בחצי את מחירי GPT-6 Sol ו-Luna, אבל Claude עדיין מובילה במבחני התכנות

OpenAI השיקה את GPT-6 Sol ו-GPT-6 Luna במחיר נמוך ב-50% מהדור הקודם, והיא מציגה אותם כחלופה זולה לדגמים של אנתרופיק. לפי הנתונים ש-OpenAI עצמה פרסמה, המודלים החדשים מתקרבים לציונים של Claude בעלות נמוכה בהרבה. עם זאת, Claude Opus 5 עדיין משיג את הציונים הגבוהים ביותר במבחני התכנות.

חומרה ורובוטיקה

מתמטיקאי דגול מזהיר מ'מרוץ אחרי מדדים' בעולם ה-AI

טרנס טאו, מהמתמטיקאים הבולטים בעולם, פרסם שרשור ב-Mastodon ובו הוא מזהיר כי מרוץ מעבדות ה-AI אחר שיפור מדדים מתמטיים מתחיל לפגוע בתחום. הטריגר: תוצאה חדשה בבעיית הפערים בין ראשוניים, שבעקבותיה כמה מעבדות AI מיהרו לפרסם שיפורים משלהן — לדבריו, תוך התעלמות ממה שבאמת חשוב במחקר מתמטי.

רגולציה ואבטחה

GPT-6 Astra של OpenAI יוצא לדרך: תקלות הפצה וחששות בטיחות בצל טענות AGI

OpenAI השיקה את GPT-6 Astra וכינתה אותו תחילת "עידן ה-AGI", אך ההשקה נתקלה בבעיות גישה שהותירו מנויים משלמים ממתינים ובביקורת בטיחות סביב שקיפות מופחתת בשרשרת המחשבה של המודל, רק שבועות אחרי פריצת אבטחה ל-Hugging Face. תוצאות בנצ'מרק סותרות מציבות את Astra בראש מבחן אחד ושקול לקודמו במבחן אחר, עם קפיצה בולטת דווקא במבחן ARC-AGI-3.

מחקר

משתמש בדק את Ox Alpha מול בעיות קוד אמיתיות: 96% הצלחה, מעל Fable 5 — אך גם ספקנות עצמית

משתמש ב-Reddit הריץ את המודל Ox Alpha על תת-קבוצה של 50 משימות מתוך בנצ'מרק SWE-bench Verified, וקיבל שיעור פתרון של 96%, העולה על ציון Fable 5 של Anthropic. עם זאת, מפרסם הבדיקה עצמו הביע ספקנות כלפי התוצאה שלו, וזו בדיקה בודדת ולא בהכרח מאומתת באופן עצמאי ומלא.