Holo4 של חברת H: מודל פתוח לסוכני AI שעובדים בכל ממשק, בזמן שהמשרדים מתחילים "לגייס" סוכנים
חברת H השיקה את Holo4, סדרת מודלים לסוכני AI שמפעילים מחשב דרך מסך, קוד ו-API. המודלים מבוססים על Qwen של עליבאבא. לפי החברה, גרסת 27B משיגה 61.7% במבחן OSWorld 2.0, מול 81.8% של Opus 5.5, ובעלות נמוכה בהרבה. במקביל, בסקר של BCG אמרו 22% מהמנהלים שהארגון שלהם כבר הוסיף סוכני AI למבנה הארגוני.
חברת H (Hcompany) הכריזה היום (28 בספטמבר) על Holo4, סדרה חדשה של מודלים שנועדו להפעיל "סוכני מחשב", כלומר מערכות AI שמבצעות משימות בתוכנות בעצמן. הסדרה כוללת שני גדלים: מודל "צפוף" (dense) בגודל 27B, וגרסת Mixture of Experts בגודל 35B-A3B. בגרסה הזו רק חלק קטן מהפרמטרים פעיל בכל שלב. שני המודלים זמינים דרך H Models API. לצדם שחררה החברה גם את Holotron4 Nano, גרסה מעודכנת של Holotron 3.
מודל אחד לכל ממשק
לפי החברה, היתרון של Holo4 הוא הגמישות. המודל יודע ללחוץ ולהקליד על מסך, לכתוב ולהריץ קוד משלו, ולקרוא לכלים דרך MCP (פרוטוקול לחיבור מודלים לכלים חיצוניים) או דרך API, ובכל פעם הוא בוחר את הדרך שמתאימה למשימה. ב-H מסבירים שרוב המודלים הסוכניים מאומנים לממשק אחד בלבד: מודל שמתמחה בממשק גרפי "עיוור" כשאין לו מסך, ומודל שמתמחה בקריאה לכלים נתקע מול תוכנה שאין לה API. לפי החברה, אותו מודל עצמו רץ על מחשבים שולחניים, בדפדפן, ב-Android, בסביבת קוד מבודדת (sandbox) ומול ממשקים עסקיים.
המודלים אומנו בשילוב של למידה מפוקחת ולמידת חיזוק (reinforcement learning) על מגוון גדול של סביבות ומשימות. חלק מהמשימות נוצרו במערכת פנימית של החברה בשם Agentic Task Factory. המודלים מבוססים על Qwen, משפחת המודלים הפתוחים של עליבאבא, ולדברי החברה משתפרים עליו באופן משמעותי. בין הדוגמאות שהיא מציגה: בניית מודל תלת־ממדי של מגדל אייפל בתוכנת FreeCAD לפי מפרט הנדסי מפורט.
המספרים
במבחן OSWorld 2.0, שבודק שליטה במחשב שולחני, Holo4 27B השיג לפי החברה 61.7%. Opus 5.5 של אנתרופיק השיג באותו מבחן 81.8%, וגרסת 35B-A3B הגיעה ל-30.9%. החברה מודה שהמודל מפגר אחרי המודלים הסגורים החזקים ביותר, אבל טוענת שהוא משיג את התוצאות עם פחות פרמטרים בכמה סדרי גודל ובעלות נמוכה בהרבה לכל משימה. כדאי לשים לב להסתייגות שהחברה עצמה מפרסמת: חלק מההשוואות נמדדו בסביבת הבדיקה הפנימית שלה, ו"הגרסאות, סביבות ההרצה ותת־קבוצות המשימות שונות". כדי לאפשר בדיקה חיצונית, H פרסמה בקוד פתוח את כל תיעודי הריצות (trajectories) שעומדים מאחורי הציונים, ואפשר לצפות בהם צעד אחר צעד.
ומה עם הבטיחות?
ככל שסוכנים מקבלים יותר גישה למחשבים, השאלה איך מגבילים אותם הופכת לדחופה. לפי דיווח שהופץ ברשתות, אנבידיה השיקה את OpenShell, סביבת sandbox בקוד פתוח שמטילה על סוכנים מגבלות אכיפה בזמן ריצה, במקום להסתמך על הוראות בפרומפט. לפי אותו דיווח, יותר מ-100 חברות הצטרפו למערך הבטיחות, ו-OpenAI לא ביניהן. בשלב זה לא מצאנו מקור רשמי שמאמת את הפרטים. אם הם יאומתו, המשמעות היא ככל הנראה מעבר מ"לבקש יפה" מהמודל להתנהג כראוי לגבולות טכניים שהמודל פשוט לא יכול לחצות.
עמיתים חדשים במשרד
הרקע רחב יותר. ב-WIRED מתארים גל של חברות שמוכרות "עובדים דיגיטליים". בסקר שערכו ג'ולי בדארד, שותפה ב-Boston Consulting Group, ועמיתיה בינואר בקרב 1,261 מנהלים, 22% אמרו שהארגון שלהם כבר הוסיף סוכני AI למבנה הארגוני. ביוני השיקה מיקרוסופט את Scout, סוכן שמזיז פגישות ומנסח מיילים. באוגוסט השיקה Anything את Skydive, פלטפורמה של סוכנים עם שמות, תפקידים ואווטארים. כריסטין וונדל, מנכ"לית Pronto Housing, סיפרה ש-"Bob", הסוכן שמשמש אצלה ראש מטה, פרסם בטעות בערוץ Slack את כל פרטי היומן שלה.
זו בדיוק הנקודה שבה שני הסיפורים נפגשים. מודלים כמו Holo4 מוזילים את ההפעלה של סוכנים שנוגעים בתוכנות אמיתיות, והתקלות הקטנות מהמשרד מזכירות שיכולת לבדה אינה מספיקה. ההערכה היא שבשלב הבא התחרות תהיה גם על השאלה מה הסוכן רשאי לעשות, ולא רק על מה שהוא מסוגל לעשות.