צוותי סוכני AI עולים עד פי 5.1, אבל כמעט לא משפרים את התוצאות
מבדקים של חברת Vals AI מראים שצוותים של סוכני AI עולים פי 1.8 עד פי 5.1 מסוכן בודד, ורק באחת מארבע ההשוואות נמדד שיפור מובהק סטטיסטית. גם בניסויים של אנתרופיק עצמה, המעבר מעשרה סוכנים ל-100 שיפר את הציונים רק במעט.
צוותים של סוכני AI, כלומר כמה עותקים של מודל שפה שעובדים יחד על אותה משימה, משיגים תוצאות טובות רק במעט מסוכן יחיד, והעלות שלהם גבוהה בהרבה. זו המסקנה של מבדקים שערכה חברת ה-evals (הערכת מודלים) Vals AI, כפי שדווח ב-The Decoder. גם הנתונים שפרסמה אנתרופיק על המודל שלה מצביעים על אותה מגמה: מעל עשרה סוכנים, השיפור באיכות כמעט נעצר.
ארבע השוואות, שיפור מובהק אחד
Vals AI בדקה את GPT-6 Sol ואת Claude Opus 5.5 במבחן Vibe Code Bench, שמודד בניית אפליקציות באמצעות קוד. כל מודל נבדק פעם כסוכן בודד ופעם כחלק מצוות, בשתי רמות של מאמץ חשיבה (reasoning effort): בינונית ומקסימלית.
הצוותים עלו פי 1.8 עד פי 5.1 יותר מהסוכנים הבודדים. מתוך ארבע ההשוואות, רק באחת נמדד שיפור מובהק סטטיסטית: GPT-6 Sol ברמת חשיבה בינונית, שבה הצוות השיג ציון גבוה ב-7.3 נקודות. ברמת החשיבה המקסימלית, העבודה בצוות לא נתנה יתרון ממשי לאף אחד משני המודלים.
ככל הנראה, המשמעות היא שכאשר המודל כבר מנצל את מלוא כוח החישוב שלו, צירוף סוכנים נוספים מוסיף בעיקר עלות.
הנתונים של אנתרופיק: מהירות כן, איכות כמעט לא
אנתרופיק בדקה את Opus 5.5 בשתי משימות, עם מספר סוכנים הולך וגדל. הציונים קפצו במעבר מסוכן אחד לעשרה, ומשם כמעט לא זזו:
| משימה | סוכן 1 | 10 סוכנים | 30 סוכנים | 100 סוכנים |
|---|---|---|---|---|
| מאגר ידע (Knowledge base) | 0.53 | 0.70 | 0.71 | 0.74 |
| הוכחת משפטים ב-Lean | 0.39 | 0.66 | 0.66 | 0.68 |
צוותים גדולים יותר הגיעו לרמת ביצועים נתונה מהר יותר, אבל אחרי 24 שעות המעבר מעשרה ל-100 סוכנים העלה את הציון רק במעט. בבדיקות נפרדות במבחן ProgramBench, הרווח במהירות בא עם צריכה גבוהה יותר של טוקנים (יחידות הטקסט שלפיהן מתומחר השימוש במודלים).
המודל Fable 5.1 הראה שיפור חזק יותר במשימת הוכחת המשפטים מעל עשרה סוכנים, אבל ציוניו נשארו נמוכים מאלה של Opus 5.5 בכל המבחנים. במשימת מאגר הידע, הציון של Fable אף ירד מעט במעבר מ-30 ל-100 סוכנים.
"מס תיאום"
גם ב-OpenAI מגיעים למסקנות דומות. החוקר נועם בראון אמר ב-Dwarkesh Podcast שמערכות מרובות סוכנים קונות בעיקר מהירות, לא איכות: ארבעה סוכנים פתרו משימות פי שניים מהר יותר, אבל גם עלו פי שניים. ב-16 סוכנים הדפוס נשמר, ביעילות מעט נמוכה יותר.
לדברי בראון, הכול תלוי במשימה. מחקר ברשת ומתמטיקה מתחלקים היטב בין כמה סוכנים, אבל כתיבת רומן לא. להפעיל 10,000 סוכנים על רומן, לדבריו, יהיה חסר טעם בדיוק כמו להושיב 10,000 אנשים לכתוב אותו. הוא הודה שהפעלה של מספר גדול מאוד של סוכנים כמעט לא נחקרה עדיין, פשוט כי העלויות גבוהות מדי.
המפתח אריק פרובנשר מ-OpenAI הזהיר לאחרונה מפני "נחילי סוכנים" מאותה סיבה. לדבריו, ברוב המקרים זה בזבוז כסף, משום שהתיאום בין הסוכנים מתפרק. לתופעה הוא קרא "מס התיאום" (coordination tax).
למה זה חשוב
חברות שבונות מוצרים על סוכני AI משלמות לפי צריכת טוקנים, ולכן לפער בין עלות לתועלת יש מחיר ישיר. הנתונים מרמזים שבמקום להוסיף עוד ועוד סוכנים, עדיף כנראה לבחור מודל חזק ולתת לו מאמץ חשיבה גבוה. צוות סוכנים מצדיק את עצמו בעיקר כשמהירות קריטית והמשימה מתחלקת בקלות לחלקים נפרדים.