יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

אנבידיה מקצצת כמעט בחצי את צריכת ה-tokens של סוכני קוד, בלי לגעת במודל

חוקרי אנבידיה הציגו את SoL-Pi, מערכת שמשפרת באופן אוטומטי את ה-harness, שכבת הבקרה של סוכני קוד. בגרסה החסכונית ביותר צריכת ה-tokens ירדה ב-49 אחוז, והמערכת הגיעה ל-93.7 אחוז מהציון של ה-harness המקורי. אחרי הבדיקות הסתכמה העלות ב-894 דולר במקום 1,339.

חוקרים מאנבידיה פרסמו מחקר על מערכת בשם SoL-Pi. המערכת משפרת באופן אוטומטי את ה-harness של סוכני קוד, כלומר את שכבת הבקרה שיושבת בין מודל השפה לסביבה שבה הוא פועל. לפי הדיווח ב-The Decoder, צריכת ה-tokens (יחידות הטקסט שלפיהן מחויבים שירותי AI) ירדה כמעט בחצי, והביצועים נשארו בערך באותה רמה.

למה דווקא ה-harness

ככל שסוכן AI עובד זמן רב יותר בלי השגחה, הוא עולה יותר. תשובה בודדת הופכת לשרשרת ארוכה של שלבי חשיבה, קריאות לכלים ולולאות משוב, ובכל שלב מצטברים tokens. רוב שיטות ההתייעלות עד היום הוזילו את מחיר ה-token עצמו: attention kernels מהירים יותר, תשתית הרצה משופרת, דחיסת מודלים כמו quantization, או מעבר למודלים זולים יותר.

אנבידיה בחרה לתקוף את השכבה שמעל המודל. ה-harness קובע איך הסוכן רואה את מצב העבודה, איך הוא מבצע פעולות ואיך הוא מעבד משוב. מערכות כמו Codex, Claude Code ו-OpenClaw בנויות סביב שכבה כזו. הקושי הוא שהחלקים שלה תלויים זה בזה: שימוש בכלים, ניהול הקשר, אימות והחלטה מתי לעצור. שינוי שחוסך tokens במקום אחד עלול לגרום לשגיאות במקום אחר, או סתם לדחות את העלות לשלב מאוחר יותר. בדרך כלל מהנדסים עוברים ידנית על יומני ריצה ארוכים ומתרגמים דפוסי כשל חוזרים לקוד.

סוכן שמשפר סוכן

ב-SoL-Pi את העבודה הזו עושה סוכן מחקר. הוא עוקב אחרי יומני הריצה של סוכן אחר, מציע שינויים ובודק אותם בסביבות מוכנות מראש. רק מועמדים שעוברים בדיקות של יכולת ושל יעילות נשארים. החיפוש כלל 535 סביבות הרצה: 495 משימות שנבנו מזוגות של issue ו-pull request ב-GitHub, ועוד 40 מקרי בדיקה סינתטיים. בסך הכול נבדקו 152 כיווני שיפור, ביותר מ-3,000 ריצות ויותר מ-60,000 אינטראקציות בין הסוכן לסביבה.

מחקרים קודמים הראו ש-harness שעבר אופטימיזציה אוטומטית נוטה להתאים את עצמו יותר מדי למשימות שעליהן אומן (overfitting), ולתרום מעט במשימות חדשות. כדי להתמודד עם זה, החוקרים הפרידו לגמרי בין החיפוש להערכה. ה-benchmark שנבחר לבדיקה, EdgeBench, לא השתתף בחיפוש בכלל. מתוך 51 המשימות הציבוריות שלו, 11 שימשו לאימות חד-פעמי של מועמדים מוגמרים, ו-40 נשמרו להערכה הסופית. התוצאות שלהן לא הוזנו בחזרה לחיפוש.

ארבעה מנגנונים

מהחיפוש יצאו ארבעה מנגנונים:

  • Action Fusion מאחד שני צעדים עוקבים לצעד אחד, למשל עריכת קוד והרצת בדיקה, וכך נחסכת קריאה שלמה למודל.
  • Online Context Compact רץ אחרי כל שלב תכנון ומקצץ את ההקשר שהצטבר, כשאפשר לעשות זאת בלי לאבד מידע חשוב.
  • ObservationPack מעביר לארכיון פלטים ארוכים של כלים, ובצעדים הבאים שולח סיכום קצר במקום הטקסט המלא.
  • Evidence-Preserving Reducer מעביר יומני שגיאות ובדיקות גדולים למודל זול יותר שמתמצת אותם. שלב אימות אוטומטי תופס רמזים קריטיים שנשמטו בדרך.

המספרים

ב-EdgeBench, הגרסה החסכונית ביותר משלבת את ארבעת המנגנונים. היא צורכת 49 אחוז פחות tokens מה-harness המקורי, Pi, ומגיעה ל-93.7 אחוז מהציון שלו. העלות ירדה מ-1,339 דולר ל-894 דולר. מי שמעדיף ביצועים יכול לבחור רק את המנגנון החזק ביותר, ולקבל ציון גבוה ב-5.3 אחוז מזה של Pi, עדיין עם חיסכון ב-tokens. בשתי הגרסאות הירידה בצריכה נעה בין 44.7 ל-49 אחוז. בהשוואה ל-harness המקוריים של Codex ו-Claude Code, החיסכון עומד על 50 ו-54.3 אחוז, בהתאמה.

במונחי כסף, לפי מחירי ה-API הנוכחיים, החוקרים מעריכים חיסכון של 8.75 עד 13.50 דולר לשעה לעומת Codex ו-Claude Code, ושל 4.36 עד 5.71 דולר לשעה לעומת Pi. המערכת פותחה עם GPT-5.6 Sol בלבד. כשהוחלה ללא שינויים על Opus 5, היא שמרה על 94.3 אחוז מהביצועים של Pi.

המשמעות

המחקר מראה שחלק ניכר מהעלות של סוכני קוד נובע ככל הנראה מהדרך שבה הם מנוהלים, ולא רק מהמודל עצמו. העובדה שהשיפורים עברו ממודל של חברה אחת למודל של חברה אחרת מרמזת שמדובר בשיפורים לשכבה עצמה, ולא בהתאמה למודל מסוים. עם זאת, מדובר בבדיקה על מודל נוסף אחד בלבד. אם התוצאות יחזיקו גם מחוץ למעבדה, ה-harness עשוי להפוך לזירת תחרות נוספת לצד המודלים עצמם.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות