"טירוף מוחלט": OpenAI פרסמה כמעט 400 תוצאות מתמטיות, ולמתמטיקאים ייקח שנים להבין אותן
השבוע פרסמה OpenAI בבת אחת כמעט 400 תוצאות מתמטיות שנוצרו בידי AI, בפריסה על פני יותר מ-700 כתבי יד. מתמטיקאים אומרים שרק להבין מה פורסם ייקח שנים. פחות ממחצית מכתבי היד אומתו במערכת האימות הממוחשבת Lean, וחוקרים חוששים שיתקשו להבדיל בין תוצאות אמיתיות לבין "סלופ", תוכן AI באיכות נמוכה.
"מדהים", "מציף", "חסר תקדים", "סוריאליסטי", "טירוף מוחלט". כך תיארו יותר משלושה תריסר מתמטיקאים, בשיחות עם The Verge, את מה ש-OpenAI פרסמה השבוע: כמעט 400 תוצאות מתמטיות שנוצרו בידי בינה מלאכותית, בפריסה על פני יותר מ-700 כתבי יד. על דבר אחד רוב החוקרים הסכימו: רק כדי להבין מה בדיוק פורסם יידרשו שנים. במקביל הם חוששים ש-OpenAI לא תחכה עד אז, ותמשיך הלאה או תפרסם עוד.
היקף שקשה לעכל
התוצאות מכסות מגוון רחב של תחומים: קומבינטוריקה, כמה ענפים של גאומטריה, תורת המספרים, מדעי המחשב התאורטיים, אלגברה, טופולוגיה, הסתברות ומכניקה סטטיסטית, וגם פיזיקה מתמטית. האוסף גדול כל כך ש-OpenAI מצאה לנכון לפרסם מדריך שמסביר איך להתמצא במאגר ה-GitHub שבו הוא מתפרסם.
לפי הכתבה, כמה מהחוקרים העידו שרק המעבר על תוכן העניינים והתקצירים, כ-40 עמודים, לקח להם קרוב לשעה. "רק לעבור על רשימת התקצירים המלאה זה מציף", אמר אלווארו לוסאנו-רובלדו, פרופסור למתמטיקה באוניברסיטת קונטיקט. אחד המרואיינים תיאר את המצב כך: "אם ה-AI ייעלמו עכשיו, כאילו חייזרים נחתו על כדור הארץ ואז פשוט עזבו, היינו חוקרים את זה בעשר השנים הבאות בניסיון להבין הכול".
בעיית האימות
בין כתבי היד משולבות פורמליזציות ב-Lean, שפת תכנות ו"עוזר הוכחות" שמאפשר לוודא באופן ממוחשב שהוכחה תקינה מבחינה לוגית. כלי כזה מאפשר לחוקרים לסמוך על נכונות של טענה גם כשהם עוד לא מבינים עד הסוף את הטיעון שמאחוריה. לפי The Verge, הפורמליזציות האלה כבר היו מרכזיות בבדיקה של טענות מתמטיות קודמות של OpenAI.
הבעיה היא שהכיסוי חלקי. ב-GitHub הודתה OpenAI שהתוצאות נמצאות "בשלבי אימות שונים" ושרבים מכתבי היד, אבל לא כולם, עברו פורמליזציה. לדברי החברה, רק 300 תוצאות מרכזיות מתוך 719 כתבי יד עברו פורמליזציה, כ-42 אחוז, והיא "תעדכן את המאגר בפורמליזציות נוספות כשנשיג אותן".
מתמטיקאים שדיברו עם The Verge הדגישו שגם כשקוד Lean מצורף לתוצאה, הבדיקה לא נעשית ברגע. צריך לוודא שהפורמליזציה מוכיחה בדיוק את מה שהמאמר טוען. חלק מהחוקרים מצאו שהאיכות לא אחידה, ושהטענות שאומתו לא תמיד תואמות את מה שכתוב בכתבי היד.
החשש מ"סלופ"
קווין באזארד, פרופסור למתמטיקה באימפריאל קולג' לונדון, אמר שמצא בתחומו, תורת המספרים האלגברית, משפטים רבים, ורק כשישה מהם "בלטו" מיד. מעטים מהם, אם בכלל, אומתו ב-Lean. "לכן אני צריך לקרוא סלופ שאולי לא נכון, או לחכות שאחרים יעשו זאת, או לחכות שמישהו יעשה להם פורמליזציה, ורק אז אוכל לומר בוודאות שהתוצאות בכלל נכונות", אמר.
"סלופ" (slop) הוא כינוי לתוכן AI באיכות נמוכה ולעתים קרובות שגוי, שמופיע יותר ויותר ברשת ובכלל זה במאמרים אקדמיים. מתמטיקאים סיפרו ל-The Verge שבשנים האחרונות הם רואים זינוק בחומר כזה, שנוצר בכלים כמו ChatGPT ו-Claude.
למה זה חשוב
המשמעות ככל הנראה היא שצוואר הבקבוק במחקר המתמטי עובר מהפקת תוצאות לבדיקה ולהבנה שלהן. כש-AI מסוגל לייצר מאות כתבי יד בבת אחת, הקהילה האקדמית, שעובדת בקצב של שיפוט עמיתים ובדיקה ידנית, עלולה למצוא את עצמה מפגרת מאחור. ובינתיים כלי אימות כמו Lean הופכים מכלי עזר לתנאי כמעט הכרחי לאמון בתוצאות.
השאלה הפתוחה, כפי שעולה מהכתבה, אינה רק אילו מהתוצאות נכונות. היא גם מה מקומם של המתמטיקאים עצמם בתחום שמשתנה סביבם.