בנצ'מארקים של פיזיקה ל-AI התבררו כשגויים: אחרי תיקון, הציונים זינקו
מחקר חדש מאוניברסיטת ייל מגלה שרוב הטעויות שיוחסו לדגמי AI מובילים בבדיקות פיזיקה נבעו מפגמים בבנצ'מארקים עצמם. לאחר שמומחים תיקנו פתרונות שגויים והסירו שאלות פגומות, ציוני הדגם GPT-5.6-Sol זינקו בעשרות אחוזים בכמה מהמבחנים המובילים בתחום.
מחקר חדש מטיל ספק ביכולת של בנצ'מארקים נפוצים בתחום הפיזיקה לשקף נכונה את יכולות ההיגיון של דגמי שפה מתקדמים (LLM). לפי המאמר, שהועלה לארכיון arXiv ב-11 בספטמבר 2026 בידי צוות בן 51 חוקרים — ובהם חברי סגל ותלמידי מחקר בפיזיקה מאוניברסיטת ייל — כאשר מומחים בדקו מחדש תשובות שסומנו כשגויות בבדיקות אוטומטיות, התברר שרובן נבעו מטעויות בפתרונות הייחוס, משגיאות בתהליך הבדיקה עצמו או משאלות מנוסחות בעמימות — ולא מכשל אמיתי בהיגיון הפיזיקלי של הדגם.
הצוות בחן שישה בנצ'מארקים נפוצים להערכת פיזיקה, ביניהם HLE-Physics, CMT-Benchmark ו-CritPt. עבור כל תת-תחום, מומחים בעלי רקע רלוונטי עברו ידנית על ניסוח השאלות, פתרונות הייחוס ותשובות הדגמים, כדי להפריד בין טעויות אמיתיות של הדגם לבין פגמים בבדיקה עצמה. לאחר תיקון הפתרונות השגויים ותיקון או השמטה של שאלות פגומות, הציון הממוצע (mean@4) של הדגם GPT-5.6-Sol בבנצ'מארק HLE-Physics עלה מ-47.3% ל-78.7%, ובבנצ'מארק CMT-Benchmark מ-61.0% ל-87.2%. בבנצ'מארק CritPt, לאחר סינון ל-54 אתגרים שנותרו תקפים, ציון ה-pass@4 המתוקן של אותו דגם הגיע ל-94.4%. גם בבנצ'מארקים נוספים שנבדקו — UGPhysics, PRISM-Physics ו-PHYBench — נרשמה עלייה ניכרת בציונים לאחר התיקון.
בפוסט שפרסם אחד השותפים למחקר, מתואר הרקע לפרויקט: לוחות מובילים פומביים כגון Artificial Analysis הציגו את הפיזיקה כאחד מתחומי הידע הבודדים שבהם דגמי AI עדיין מפגרים באופן ניכר — הדגם GPT-5.6-Sol קיבל ציון של 32% בלבד ב-CritPt, בנצ'מארק אתגרים ברמת מחקר, ולפי הפוסט גם הדגם המאוחר יותר GPT-6 Astra לא הציג שיפור בציון הזה. לפני התיקון עמד ציונו של אותו דגם על כ-47% בחלק הפיזיקה של Humanity's Last Exam. הכותב מסביר שהפער בין הציונים הנמוכים לבין ההתרשמות של פיזיקאים העובדים בפועל עם הדגמים הוא שהוביל את הצוות לבדוק את השאלות עצמן לעומק, ולא רק לנתח את הסטטיסטיקה של התוצאות.
המשמעות המרכזית של הממצאים, כפי שמנוסחת במאמר, היא שהבנצ'מארקים הנוכחיים ככל הנראה מציגים תמונה מוטה כלפי מטה של יכולת הדגמים המובילים לפתור בעיות פיזיקה מוגדרות היטב. החוקרים מציינים שהקרבה לרוויה (near-saturation) שהתגלתה בחלק מהמבחנים לאחר התיקון — כלומר מצב שבו הדגמים כבר פותרים כמעט את כל השאלות התקפות בהצלחה — מחייבת בנייה של בדיקות תובעניות יותר, המאומתות מראש בידי מומחי תוכן.
עבור כל מי שעוקב אחרי ההשוואות בין חברות ה-AI, הממצא מעורר שאלה רחבה יותר: אם בנצ'מארק מדעי מוביל אחד התברר כשגוי בשיעור כזה, סביר להניח שבעיות דומות קיימות גם בבנצ'מארקים אחרים המשמשים לדירוג דגמים — כך שהשוואות המבוססות עליהם בלבד עשויות להיות פחות אמינות ממה שנהוג להניח כיום.