OpenAI משיקה את GPT-6 Astra: ביצועים מובילים במתמטיקה, גם בלי שהתמקדו בזה
GPT-6 Astra, המודל החדש של OpenAI, תפס את המקום הראשון בבנצ'מארק המתמטי ErdosBench, על אף שהמדען הראשי של החברה, ג'קוב פחוצקי, אמר במפורש שמתמטיקה לא הייתה בעדיפות בפיתוחו. החברה מתעדפת מחקר בתחום ה-RSI (שיפור עצמי רקורסיבי) ויישור אוטומטי, וההישג המתמטי מצטייר כתוצר לוואי.
✦ נכתב אוטומטית על ידי AIמבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
OpenAI השיקה את המודל החדש שלה, GPT-6 Astra, שתפס את המקום הראשון בבנצ'מארק המתמטי ErdosBench של חברת ulam.ai — אף שלפי דברי המדען הראשי של OpenAI, ג'קוב פחוצקי, החברה כלל לא הפכה את המתמטיקה ליעד מרכזי בפיתוח המודל.
ErdosBench בוחן ביצועים על פני 226 בעיות מתמטיות פתוחות, בהשראת בעיות ארדש המפורסמות. Astra סיים במקום הראשון עם ציון 3.23 ופתר 106 בעיות, מתוכן 43 באופן מלא, והפריך 27 בעיות נוספות. בהשוואה, GPT-5.6 Sol, הדגם הקודם, פתר 78 בעיות במצב "reasoning" מקסימלי וקיבל ציון 3.12.
מפתח הבנצ'מארק, פשמק חויצקי, תיאר את הקפיצה כ"שיפור מוצק של 5%-10% במגוון כישורי מחקר מתמטי שנבדקו", אך הדגיש שהבנצ'מארק עדיין רחוק מרוויה — כלומר נותרו עוד הרבה בעיות שאף מודל לא פתר. מעבר למספרים, Astra הפגין לפי הדיווח כתיבה מדעית טובה יותר מזו של Sol, ונטה פחות להצגת תוצאות מוגזמות; במקרים מסוימים אף המעיט בערך ההישגים שלו.
החלטה מכוונת לא להשקיע במתמטיקה
הנקודה המעניינת בסיפור נוגעת דווקא להחלטה שמאחורי הקלעים. פחוצקי כתב במסה שפרסם תחת הכותרת "An Alien Mind" כי "אנחנו מאמינים שיכולנו לשפר את המודלים במיוחד עבור מחקר מתמטי עם התמקדות נוספת, אך אנחנו לא מתעדפים כיוון זה בשל הדחיפות שאנחנו חשים סביב RSI [שיפור עצמי רקורסיבי] ומחקר יישור אוטומטי (automated alignment research)". לדבריו, OpenAI מפנה את משאביה בעיקר לכיוון הזה מכיוון שהיא "מאמינה שזו הדרך היחידה להישאר בחזית מחקר הבינה המלאכותית".
כלומר, ההישג המתמטי של Astra הוא ככל הנראה תוצר לוואי של עדיפויות אחרות בחברה, ולא תוצאה של אופטימיזציה ממוקדת. יצוין כי מאז פרסום המסה של פחוצקי, לפי דיווחים, OpenAI אימנה מודלים פנימיים חזקים יותר במתמטיקה — סיפור שעדיין לא התבהר במלואו.
מה זה אומר על הדרך ל-AGI
העובדה שמעבדת הבינה המלאכותית המובילה כרגע לא יכולה לדחוף קדימה בכל התחומים בו-זמנית תומכת, כך נראה, בתזה המכונה "spiky" — התפתחות "מחודדת" שבה מודלים מגיעים ליכולות קיצוניות בתחומים ספציפיים כמו קוד ומתמטיקה, אך נשארים ברמה נמוכה יותר, ואפילו נסוגים, בתחומים אחרים כמו איכות שפה, שכל ישר או הבנה חברתית. זאת בניגוד לתזת ה"מיינסטרים" של AGI, שלפיה מודלים משתפרים בהדרגה ובאופן רחב עד שהם מכסים את כלל המשימות האנושיות. חוקר קיימברידג' אדם האנט הציג השוואה חזותית בין שני המסלולים האפשריים. אם התזה ה"מחודדת" נכונה, מדובר במודל מתמחה מאוד, ולא בהכרח במה שרוב האנשים יגדירו כבינה מלאכותית כללית (AGI).
מאחורי ההחלטה לתעדף RSI עומדת ככל הנראה תקווה בתוך OpenAI: שהמודל עצמו יבצע בסופו של דבר את האופטימיזציות הללו, ויאיץ שיפור רחב יותר בכל התחומים — כולל במתמטיקה.