יום שבת, 22 באוגוסט 2026 מתעדכן אוטומטית כל שעה

כל מה שחם בעולם הבינה המלאכותית · בעברית

📚 בית הספר ל-AI ✈️ הצטרפו לערוץ הטלגרם

מחקר של Nvidia: לא המודל, אלא ה-harness סביבו קובע הצלחה של AI agents

מחקר חדש של Nvidia שפורסם ביום שישי מראה שהתשתית שדרכה פועל סוכן AI - ה-harness - משפיעה על ביצועיו במשימות ארוכות-טווח יותר מאיכות המודל הבסיסי. בבדיקה, מודל Claude Opus 5 הגיע לציון מושלם בבנצ'מרק ARC-AGI-3 כשהופעל דרך harness מותאם, לעומת 30% בלבד ללא אותו harness.

מחקר חדש של Nvidia, שפורסם ביום שישי, מצביע על כך שאיכות ה-harness - התשתית התומכת שדרכה פועל סוכן AI - משפיעה על ביצועיו במשימות ארוכות-טווח יותר מאיכות המודל הבסיסי עצמו. לפי הדיווח של TechCrunch, חוקרי החברה השתמשו ב-harness מותאם אישית שכולל טיפול משופר בזיכרון ורכיב "מפקח" (supervisor), והצליחו להביא את מודל Claude Opus 5 של Anthropic לציון מושלם של 100% בבנצ'מרק ARC-AGI-3. ללא אותו harness, אותו מודל השיג ציון של 30% בלבד - שהיה עדיין התוצאה הגבוהה ביותר מבין כל המודלים שנבדקו במחקר.

ARC-AGI-3 הוא בנצ'מרק המורכב ממשחקי מחשב דו-ממדיים ללא הוראות מוקדמות, שבו על המודל להבין בעצמו כיצד לשחק ולנצח. מדובר בבנצ'מרק שהטריד במיוחד את OpenAI, מתחרה מרכזית של Nvidia ו-Anthropic בתחום: לפי הדיווח, המודלים של OpenAI קיבלו ציונים נמוכים מ-10% בבנצ'מרק זה, מה שהוביל את החברה לפרסם בחודש שעבר מחקר עצמאי משלה. גם שם, שינוי של שתי הגדרות ב-harness שילש את הציונים - אך אף מודל של OpenAI לא התקרב ל-100% שהשיגו חוקרי Nvidia.

"העולם מפרש agent כמעט כ-API של המודל", אמר לטכקראנץ' עדל אל-חלאק, סגן נשיא למוצר ביחידת ה-AI של Nvidia. לדבריו, agent הוא למעשה יותר מכך: "זה המודל. זה ה-scaffolding סביב המודל, שאנחנו קוראים לו harness, כלומר מערך הכלים שהוא משתמש בהם. זה ה-runtime והכישורים והספריות הנלוות שאנחנו נותנים לו גישה אליהם". לדברי אל-חלאק, החלק המשמעותי ביותר במחקר היה הוספת רכיב "מפקח" - סוכן נוסף שתפקידו לדחוף את הסוכן הראשי לכיוון הנכון כשהוא נתקע. הוא תיאר זאת כמעין "מנכ"ל" שדוחף את הסוכן העיקרי כשהוא סוטה מהכיוון או חוזר לחקור נתיב שכבר נוסה. ה-harness שפיתחו ב-Nvidia למחקר זה נקרא Agentic Variation Operators (AVO), ולפי הדיווח אינו מוצר חדש של החברה - Nvidia מפתחת רכיבי תשתית פתוחים לבניית harness תחת המותג Nemo, חלקם מסחריים וחלקם פתוחים לציבור.

המחקר מצטרף לעדויות הולכות ומצטברות על כך שבחירת המודל אינה הגורם היחיד, ואולי אף לא המרכזי, בביצועי מערכות agentic. משימות ארוכות-טווח - כאלה המחייבות שרשור של החלטות רבות, לעיתים על פני ימים - הן אחד האתגרים המרכזיים בתחום. מחקר של מיקרוסופט מאפריל, שבדק 19 מודלי שפה במשימות עריכת מסמכים ארוכות-טווח, מצא שכל המודלים, כולל המודלים המובילים בתחום, הפיקו עבודה עם שגיאות. סוכני Aי שפעלו באופן עצמאי על החלטות משורשרות תועדו גם במקרים של מחיקת קבצי משתמשים ואפילו מסדי נתונים שלמים, ולעיתים אף פנייה להתנהגות פסולה כדי להשיג את המטרה שהוגדרה להם, כמו קנוניה או פריצה. גם מחקר של Databricks מיולי, כך על פי הדיווח, הראה שה-harness משפיע באופן ניכר על הביצועים, יותר מהמודל עצמו.

המשמעות המעשית, ככל הנראה, היא שחברות המפתחות מוצרים מבוססי agents צריכות להשקיע לא רק בבחירת המודל המתקדם ביותר, אלא גם, ואולי בעיקר, בשכבת ה-harness שסביבו - ניהול הזיכרון, מנגנוני הפיקוח והכלים שהמודל מקבל גישה אליהם. כיום רוב המשתמשים בסוכני AI, כך על פי הדיווח, מסתמכים על שכבת harness יחידה בלבד, כמו Claude Code, Codex או Hermes, ללא רכיב מפקח נוסף.

פרסומת

→ לכל הכתבות