חוקרי גוגל מציגים שיטה שמונעת מסוכני AI משפרים-את-עצמם "לשנן" את המבחנים
חוקרים מ-Google Cloud AI Research וממספר אוניברסיטאות מציגים את RRSI, שיטה שמגבילה את האופן שבו סוכני AI משכתבים את סביבת העבודה שלהם, כדי שלא יתאימו את עצמם יותר מדי למשימות המבחן. לפי המאמר, השיטה ויתרה על חלק מהשיפור במשימות האימון, ובתמורה שיפרה את הביצועים במשימות חדשות וחסכה כ-30% בטוקנים.
חוקרים מ-Google Cloud AI Research וממספר אוניברסיטאות מציגים שיטה חדשה בשם RRSI, שנועדה לפתור בעיה שמלווה סוכני AI שמשפרים את עצמם: הנטייה שלהם "לשנן" את משימות המבחן שעליהן הם מתאמנים, במקום להשתפר באמת. לפי הדיווח ב-The Decoder, השיטה שיפרה את הביצועים גם במשימות שהסוכן לא ראה קודם, ובמקביל הורידה את צריכת המשאבים.
מה זה harness, ולמה צריך לרסן אותו
סוכן AI מודרני בנוי ממודל שפה (LLM) קבוע, שעוטפת אותו מסגרת שנקראת harness: אוסף של הנחיות (prompts), תהליכי עבודה, כלים, זיכרון ולוגיקה, שקובע מה המודל רואה בכל שלב. ה-harness הוא שמחליט, למשל, אם הסוכן יקרא את הקובץ הנכון לפני שהוא משנה אותו, אם יתאושש מטעות ואם יגיש את התוצאה בצורה מסודרת. לפי המאמר, חלק גדול מההתקדמות האחרונה בסוכנים מגיע דווקא מעבודה על ה-harness, ולא ממודלים חדשים.
עד לאחרונה העבודה הזו נעשתה ידנית: אנשים עברו על ריצות שנכשלו ותיקנו את ה-harness. שיטות חדשות יותר הפכו את התהליך לאוטומטי, ומודל שפה משכתב את ה-harness שוב ושוב על סמך המשוב ממשימות המבחן. החוקרים מכנים זאת צורה מעשית של שיפור עצמי רקורסיבי (recursive self-improvement).
הבעיה היא שהסוכן עובד שוב ושוב על אותו מאגר מצומצם של משימות, ובסוף מתאים את עצמו אליו יותר מדי. במונחי למידת מכונה זו התאמת יתר (overfitting). לפי החוקרים, זה קורה בכמה דרכים: החיפוש נתפס לדפוסים שמתאימים רק למבחן מסוים, מעדיף גרסאות שקיבלו ציון גבוה במקרה, ומוסיף מורכבות מיותרת שמעלה את הציון בלי לשפר את הסוכן. התוצאה: הציונים במשימות האימון עולים, והשיפור במשימות חדשות מצטמצם או נעלם לגמרי.
תקציב עריכה שמצטמצם ומבקר קפדני
RRSI (קיצור של Regularized Recursive Self-Improvement of Agent Harnesses) מתערבת בשתי נקודות בתהליך: כשמוצעים שינויים, וכשמחליטים אילו מהם יישארו ב-harness דרך קבע. בשלב ההצעה, תקציב מגביל את מספר העריכות הבלתי תלויות שאפשר לאגד בהצעה אחת, והתקציב הזה הולך וקטן. בסבבים הראשונים מותרים שכתובים גדולים, ובהמשך רק שינויים קטנים שאפשר לקשר בבירור לתוצאה. המערכת גם זוכרת ניסיונות קודמים כדי לא לחזור על רעיונות שנכשלו, וכשההתקדמות נתקעת, היא מתנסה בכוונה בחלקים של ה-harness שעוד לא שינתה.
בשלב הבחירה, מבקר (critic) בודק כל הצעה ופוסל כל שינוי שמקבע בקוד שמות של משימות, פתרונות או טריקים שמתאימים למבחן מסוים. כלל נוסף מאשר עלות חישוב גבוהה יותר רק אם היא מביאה שיפור מדיד בביצועים, ורכיבים שכבר לא תורמים מוסרים.
פחות שיפור באימון, יותר שיפור במשימות חדשות
החוקרים בחנו את RRSI על שמונה מבחני ביצועים (benchmarks) בתחומי תכנות, עבודה משרדית אוטונומית ותכנון הנדסי. המודל שבבסיס, Claude Opus 4.8 של אנתרופיק, נשאר קבוע לאורך כל הניסוי. השיטה הושוותה ל-harness הבסיסי ללא שינוי ולארבע שיטות אופטימיזציה עדכניות.
לפי המאמר, RRSI השיגה שיפור של עד 14.1 נקודות במשימות האימון ועד 4.7 נקודות בחמישה מבחנים שלא ראתה. השיפור הגדול ביותר מבין המבחנים החדשים נרשם ב-JobBench. השיטה גם צרכה כ-30% פחות טוקנים בזמן ריצה בהשוואה לגרסה ללא הריסון, ובאף אחד מהמבחנים החדשים הביצועים שלה לא ירדו מתחת לבסיס.
כל השיטות הצליחו במשימות האימון, אבל במשימות החדשות התמונה התהפכה: שתי שיטות אף ירדו מתחת ל-harness הבסיסי. ל-RRSI היה השיפור הקטן ביותר באימון, והיא הייתה השיטה היחידה שעלתה בפער ניכר מעל הבסיס במשימות חדשות. מבין ה-harnesses שעברו אופטימיזציה, היא צרכה הכי מעט טוקנים וצעדים, אם כי ה-harness הבסיסי, ללא שינוי, חסכוני ממנה עוד יותר.
ממצא נוסף: harness לתכנות שעבר אופטימיזציה עם Gemini 3.5 Flash של גוגל העלה את הדיוק של המודל החלש בהרבה Gemini 3.1 Flash Lite מ-11.2 ל-14.6 נקודות, בלי שום שינוי. לפי החוקרים, המנגנונים שהמערכת מצאה אינם תלויים ביכולות של המודל שגילה אותם.
למה זה חשוב
ככל שחלק גדול יותר מההתקדמות בסוכנים מגיע מהמעטפת ולא מהמודל עצמו, השאלה אם אופטימיזציה אוטומטית באמת משפרת את הסוכן, או רק את הציון שלו במבחן, נעשית מרכזית יותר. המשמעות של התוצאות היא ככל הנראה שוויתור מכוון על חלק מהשיפור במבחני האימון עשוי להשתלם במשימות מהעולם האמיתי, שבהן הסוכן נתקל במצבים חדשים. ממצא ההעברה בין מודלים מרמז, לפי הערכה זו, שאפשר לייעל harness בעזרת מודל חזק ולהשתמש בו גם עם מודלים זולים יותר.
עם זאת, המחברים מציינים שהמחקר עוסק רק ב-harnesses שבנויים סביב מודלים קבועים, כלומר לא בתרחיש שבו גם המודל עצמו משתנה לאורך התהליך.