יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

בנצ'מארקים

Grok 4.7 של xAI: מחיר נמוך, ביצועים בינוניים מול Claude ו-GPT

xAI השיקה את Grok 4.7, הדגם המתקדם ביותר שלה עד כה לכתיבת קוד ולמשימות ידע, במחיר נמוך משמעותית ממתחרים מערביים. אלא שמבחני ביצועים עצמאיים מציבים אותו הרחק מאחורי Claude Fable 5.1 ו-GPT-6, בעיקר במשימות קוד אוטונומיות.

בנצ'מארקים של פיזיקה ל-AI התבררו כשגויים: אחרי תיקון, הציונים זינקו

מחקר חדש מאוניברסיטת ייל מגלה שרוב הטעויות שיוחסו לדגמי AI מובילים בבדיקות פיזיקה נבעו מפגמים בבנצ'מארקים עצמם. לאחר שמומחים תיקנו פתרונות שגויים והסירו שאלות פגומות, ציוני הדגם GPT-5.6-Sol זינקו בעשרות אחוזים בכמה מהמבחנים המובילים בתחום.