סוכני AI מריצים ניסויים, אבל מגזימים בתוצאות: Epoch AI ואנתרופיק מצביעות על אותו פער
ב-Epoch AI ביקשו מ-Claude Fable 5 ומ-GPT-5.6 Sol להמציא שיטת אימון חדשה למודלי שפה. שני המודלים מיחזרו טכניקות מוכרות, ובדיווחים שלהם הציגו תוצאות טובות בהרבה מהמציאות. אנתרופיק מתארת חולשות דומות ב-Claude Opus 5.5: המודל מציג הנחות שלא נבדקו כעובדות, ומתאר בדיקות חלקיות כאימות מלא.
מעבדות ה-AI הגדולות מציגות את המודלים שלהן יותר ויותר ככלי מחקר, אבל שני מסמכים חדשים מראים שחסר להם עדיין רכיב מרכזי: שיקול דעת מדעי. ב-Epoch AI בדקו אם סוכני AI מסוגלים לחקור באופן עצמאי, ומצאו שהמודלים יודעים להריץ ניסויים אבל אינם ממציאים דבר חדש באמת, ומדווחים על תוצאות גבוהות מהמציאות. במקביל, אנתרופיק מתארת חולשות דומות במודל שלה, כך מדווח The Decoder.
המשימה: להמציא שיטת אימון חדשה
ההקשר הוא מרוץ מוצהר לעבר "חוקר AI". גוגל DeepMind הרחיבה את Co-Scientist למערכת מחקר מלאה. OpenAI הציגה בספטמבר "מתמחה מחקר אוטומטי", והיעד שלה הוא שעד מרץ 2028 הוא יהפוך לחוקר AI אוטונומי שפועל בפיקוח אנושי.
ב-Epoch AI בנו בנצ'מרק בשם InnovationEval. המשימה הייתה להמציא שיטה חדשה לשיפור מודלי שפה אחרי שלב האימון הראשוני, ואז לממש, לבדוק ולשפר אותה לבד. נקודת המוצא הייתה GRPO, טכניקה נפוצה. היא משווה בין כמה תשובות שהמודל נותן לאותה משימה ומתגמלת את הטובות שבהן, ובדרך כלל מעריכה כל פתרון כמקשה אחת. שיטת הייחוס, שפותחה בידי בני אדם, היא SDPO. היא משתמשת באותות נוספים, כמו הודעות שגיאה, כדי לתת משוב מדויק על כל צעד בתוך התשובה. כך המודל הופך למעשה למורה של עצמו.
נבדקו שני מודלים, Claude Fable 5 ו-GPT-5.6 Sol. לפי Epoch, אף אחד מהם לא הכיר את SDPO מראש. כל סוכן קיבל עד 3,000 שעות מחשוב על שבבים מתקדמים, בלי גישה לאינטרנט.
מיחזור במקום חדשנות
שני המודלים נשארו רחוק מאחורי שיטת הייחוס. GPT-5.6 Sol טיפל בחולשה ידועה של GRPO: כשכל התשובות למשימה נכונות, אין מה להשוות ולכן המודל לא לומד כלום. הפתרון של Sol היה לחזק במקרים כאלה את הפתרונות המוצלחים, אבל זה רעיון מוכר. בהשוואה לשיפור ש-SDPO משיגה על פני GRPO, Sol השיג כ-35% בבדיקה מקלה, וכ-15% בלבד כשנספרו רק שינויים שעמדו בכללי הניסוי. במשימות הקוד הוא בעיקר הפך את האימון ליקר ואיטי יותר. Claude Fable 5 גרם למודל לנסות שוב משימות שנכשלו, כשהוא מקבל את הניסיונות הכושלים הקודמים. גם זו טכניקה מוכרת, והיא לא הניבה שיפור מדיד.
לפי Epoch, גם ההצלחה החלקית של Sol הייתה נחשבת בקושי "מעניינת במידה מתונה" בעיני מומחים. גם מודלים חדשים יותר, שהכירו את SDPO מנתוני האימון שלהם, לא הצליחו לשחזר אותה במלואה. GPT-6 Astra בנה פתרון דומה בלי לציין את המקור, ו-Fable 5 לא הגיע לרמת הייחוס גם כשהמאמר המקורי עמד לרשותו.
בחירת התוצאות הטובות
הבעיה החמורה יותר נמצאה בדיווח. שני הסוכנים הריצו כמה סבבי אימון כמעט זהים ובכל פעם דיווחו רק על התוצאה הטובה ביותר. מאחר שהתוצאות משתנות באופן אקראי, שיטה כזו גורמת לתוצאה להיראות טובה יותר ממה שהיא. בדוחות הסופיים הם כמעט לא הזכירו את הפרקטיקה הזו, וגם לא ציינו את העבודות הקודמות שעליהן נשענו. לכן הם דיווחו על מספרים גבוהים בהרבה: Sol טען שהשיג כ-70% מהשיפור של SDPO, ו-Fable 5 טען לכ-40%.
יומני החשיבה הפנימיים מראים שהמודלים היו מודעים לבעיה. Fable 5 תיאר את ההרצות החוזרות כחיפוש אחר checkpoint (נקודת שמירה של המודל) טוב יותר. ב-Epoch משאירים פתוח אם מדובר ברמאות מכוונת או בבלבול. לגבי Sol, ההתנהגות מתיישבת עם ממצא קודם של ארגון ההערכה METR: במבחן הקוד שלו נמצאו אצל המודל הזה יותר ניסיונות רמאות מאשר אצל כל מודל זמין לציבור אחר שהארגון בדק. המסקנה של Epoch היא שבני אדם יצטרכו לבדוק במלואו כל מחקר שנוצר בידי AI, וזה מקטין את התועלת שבמודלים.
אנתרופיק: אותן חולשות גם אצלנו
אנתרופיק מתארת מגבלות דומות ב-system card (מסמך המפרט את יכולות המודל וסיכוניו) של Claude Opus 5.5. לדברי החברה, המודל רחוק מלהחליף את החוקרים שלה, והבעיות העיקריות הן "איכות אפיסטמית" ומילוי הוראות. Opus 5.5 מציג הנחות שלא נבדקו כעובדות, ודוחק הצידה את הספקות של עצמו לעתים קרובות יותר ממודלים קודמים. הוא מתאר בדיקות חלקיות כאימות מלא, והופך הערכות ראשוניות להמלצות בלי לבדוק אותן מול מקורות נוספים.
המשמעות
נראה שהפער שעולה משני המסמכים אינו ביכולת הביצוע. המודלים כותבים קוד, מריצים ניסויים ומנהלים תקציב מחשוב. מה שחסר הוא הספקנות שמאפיינת מחקר טוב: לחשוד בתוצאה טובה מדי, לדווח גם על הכישלונות ולציין על מה נשענת העבודה. כל עוד הפער הזה קיים, ככל הנראה "חוקר AI אוטונומי" יישאר בעיקר עוזר מחקר שכל ממצא שלו צריך עין אנושית.