דיווח: GPT-6.1 פתרה את כל הבעיות בדרג הקשה ביותר של FrontierMath
לפי דיווח ברשת, גרסה של GPT-6.1 הגיעה ל-100% ב-Tier 4 של FrontierMath, הדרג הקשה ביותר בבנצ'מארק המתמטיקה של Epoch AI. התוצאה עצמה לא מופיעה בחומרי המקור שעמדו לרשותנו, ולכן בשלב זה היא דיווח לא-מאומת. מדובר ב-43 בעיות ברמת מחקר שפתרון אחת מהן יכול לקחת למתמטיקאי מומחה כמה ימים.
גרסה של GPT-6.1 של OpenAI, שמכונה "sol (max)", הגיעה לפי דיווח ל-100% ב-FrontierMath Tier 4. זה הדרג הקשה ביותר בבנצ'מארק המתמטיקה של מכון המחקר Epoch AI. אם התוצאה תאומת, ככל הנראה תהיה זו הפעם הראשונה שמודל שפה פותר את כל הבעיות במבחן שנבנה בדיוק כדי שמודלים לא יוכלו לפתור את כולו.
חשוב לסייג: הטענה על ציון מושלם הופיעה בפוסט ברדיט, שמפנה לטבלת התוצאות באתר של Epoch AI. בחומר מהעמוד הזה שעמד לרשותנו אין את הציון עצמו, ולכן בשלב זה מדובר בדיווח לא-מאומת.
מה בודק FrontierMath
לפי Epoch AI, הבנצ'מארק כולל מאות בעיות מתמטיקה מקוריות וקשות במיוחד, שמתמטיקאים מומחים כתבו ובדקו. הבעיות מכסות את רוב הענפים של המתמטיקה המודרנית: מבעיות חישוביות בתורת המספרים ובאנליזה ממשית ועד שאלות מופשטות בגאומטריה אלגברית ובתורת הקטגוריות. לפתרון בעיה טיפוסית חוקר בתחום צריך כמה שעות עבודה, ולבעיות הקשות ביותר כמה ימים.
ב-12 ביוני 2026 פרסם המכון עדכון גדול שתיקן שגיאות ב-42% מהבעיות. אחרי העדכון המאגר המלא כולל 338 בעיות: 295 בעיות בסט הבסיס (Tiers 1-3) ו-43 בעיות "קשות במיוחד" ב-Tier 4. רק שתים-עשרה בעיות פורסמו לציבור, עשר מהדרגים 1-3 ושתיים מ-Tier 4. כל הציונים באתר מחושבים על הסטים הפרטיים, אלא אם צוין אחרת. לכן ציון של 100% ב-Tier 4 פירושו, ככל הנראה, שהמודל פתר את כל הבעיות בסט הפרטי של הדרג.
איך נבחנים המודלים
המודל לא כותב תשובה חופשית. הוא צריך להגיש פונקציית Python בשם answer() שמחזירה את הפתרון, בדרך כלל מספר שלם או אובייקט של ספריית sympy. במהלך העבודה המודל יכול להריץ קוד Python עם ספריות מתמטיות כמו numpy, scipy ו-sympy. יש לו מגבלה קשיחה של 1,000,000 טוקנים (יחידות טקסט), וכשהוא מגיע ל-660,000 טוקנים הוא חייב להגיש תשובה. לפונקציה שמוגשת יש 30 שניות ריצה לכל היותר. תשובה נכונה מקבלת נקודה אחת, ותשובה שגויה או חסרה מקבלת אפס.
ניגוד העניינים
Epoch AI מציינת בגלוי ש-FrontierMath פותח במימון של OpenAI, ושלחברה יש גישה בלעדית לחלק מהבעיות. הפרט הזה רלוונטי כאן במיוחד, כי המודל שעליו מדובר הוא של OpenAI. אין בכך כדי להעיד שהתוצאה לא תקינה. עם זאת, ככל הנראה חוקרים ומתחרים יבקשו לבדוק אותה בזהירות רבה יותר.
למה זה חשוב
FrontierMath נחשב לאחד המבחנים שמודלי שפה אמורים להתקשות בהם במיוחד. הבעיות בו מקוריות, ולכן קשה למצוא את התשובות בנתוני האימון, והן דורשות שרשרת ארוכה של חשיבה וחישוב. אם יאומת ש-GPT-6.1 פתרה את כל בעיות Tier 4, המשמעות היא שכנראה הבנצ'מארק הזה כבר לא יכול להבדיל בין המודלים המתקדמים ביותר. זה ידחוף את התחום לחפש מבחנים קשים עוד יותר.
גם ציון מושלם לא מוכיח שהמודל "שולט במתמטיקה מתקדמת" במובן הרחב. מדובר בכמה עשרות בעיות עם תשובה סופית שאפשר לבדוק אוטומטית. זה לא כמו לנסח השערות חדשות או לכתוב הוכחות מלאות. השלב הבא הוא לחכות לנתונים הרשמיים של Epoch AI, ולפרטים על תנאי ההרצה של הגרסה "max".