יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מחקר: סוכני AI מציעים שיטות עבודה בפיתוח מודלים, אבל בני אדם מקבלים יותר מ-85% מההחלטות

צוות מחקר שכולל חוקרים מאוניברסיטת פודאן בסין בחן איך בני אדם וסוכני AI עבדו יחד על פיתוח מודל שפה חדש. לפי הממצאים, AI שימש כמעט בכל המשימות ובחלק מסוגי ההחלטות סיפק עד 55% מההצעות, אבל בני אדם קיבלו 85.5% מההחלטות על שיטות ופרמטרים ו-93.4% מההחלטות על מטרות והיקף.

סוכני AI עושים חלק גדל והולך מהעבודה בפיתוח מודלים חדשים, אבל את ההחלטות עדיין מקבלים בני אדם. זה הממצא המרכזי של מחקר שבו צוות, הכולל חוקרים מאוניברסיטת פודאן בסין, בחן את הפרויקט שלו עצמו. החוקרים ניתחו יותר מ-700 יומני משימות של 56 משתתפים, יחד עם היומנים של הסוכנים שבהם השתמשו. ההחלטות על שיטות ופרמטרים התקבלו ב-85.5% מהמקרים בידי בני אדם, וב-9.2% בלבד בידי ה-AI.

המודל שבמרכז הניסוי

הפרויקט עסק בפיתוח Atria Dawn Preview, מודל שפה "סוכני" (agentic), כלומר מודל שנועד לבצע משימות בעצמו ולא רק לענות על שאלות. המודל בנוי בארכיטקטורת mixture-of-experts (מבנה שבו רק חלק מהרשת מופעל בכל שלב), כולל 744 מיליארד פרמטרים, ומיועד למשימות מחקר והנדסה. באימון שלו כל משימה מחוברת לסביבת הרצה אמיתית: המודל מפעיל כלים, מייצר תוצאות ביניים ונבדק מול אותות חיצוניים כמו בדיקות, מדדים או ראיות ממקורות.

לפי הצוות, המודל מוביל בחמישה מתוך 16 מבחני ביצועים (benchmarks), ביניהם AutomationBench, CyberGym ו-MLE-Bench Lite, אבל הוא אינו עדיף באופן כללי על המתחרים ומפגר ב-GDPval וב-SWE-Bench Pro.

יותר עבודה לסוכן, לא יותר אוטונומיה

AI שימש ב-96.5% מהמשימות שנבדקו. במהלך ארבעה שבועות עלה החציון של מספר פעולות הסוכן על כל קלט אנושי מ-11 ל-28.5. החוקרים מזהירים שאין לפרש זאת כעלייה באוטונומיה: כל החלטה אנושית הובילה ליותר צעדי ביצוע של הסוכן, אבל הסוכנים לא קיבלו יותר החלטות בעצמם.

נתון בולט נוסף: המשתתפים נשאלו אם היו מסוגלים להשלים את חלקם במשימה בלי AI, באותו היקף ובאותה איכות. מתוך 455 משימות שהושלמו בעזרת AI, 151 (בערך שליש) דורגו כבלתי ישימות בלעדיו. המשימות האלה התפזרו בין 27 מתוך 56 המשתתפים, כך שלא מדובר רק בקומץ משתמשים כבדים. במקרים האלה ה-AI לא האיץ עבודה קיימת, אלא איפשר עבודה שלא הייתה מתחילה בכלל.

ה-AI מציע, האדם בוחר

בהחלטות על שיטות ופרמטרים, הדפוס הנפוץ ביותר (55.4%) היה "ה-AI מציע, האדם בוחר". חלקו של ה-AI בהצעות נע בין 17% ל-55%, בהתאם לסוג ההחלטה, אבל חלקו בהחלטות הסופיות נשאר חד-ספרתי. על מטרות והיקף החליטו בני אדם ב-93.4% מהמקרים. גם ב-151 המשימות שדורגו כבלתי אפשריות בלי AI, בני אדם בחרו את המטרה ב-95.4% מהמקרים.

אותה תמונה עולה כשמשהו משתבש. מתוך 588 משימות שבהן תועד קושי, 76% התקדמו בזכות התערבות אנושית, וב-23% הסוכן פתר את הבעיה בעצמו. ההתערבות האנושית הייתה כמעט תמיד מידע ולא עבודה: הוספת הקשר או הבהרת דרישות (35.2%), או אבחון הבעיה ומעבר לשיטה אחרת (34.7%). עריכות חלקיות היוו 3.2% מהמקרים, והשתלטות מלאה על המשימה רק 0.7%. כשתוצרי ה-AI דרשו תיקון, הוא ביצע את השינויים בעצמו ב-75.4% מהמקרים לאחר שקיבל משוב אנושי. במילים אחרות, צוואר הבקבוק היה שיקול הדעת האנושי, לא הביצוע.

מה זה אומר

הצוות מתאר שלושה שלבים בתפקיד ה-AI: מושא מחקר, כלי למשימות בודדות, ועכשיו שותף לפרויקט שמנסח ומתאים תוכניות בתוך מטרות שקבעו בני אדם. שלב רביעי, ספקולטיבי, יהיה שיפור עצמי רקורסיבי, שבו מודלים חזקים מייצרים יורשים חזקים יותר. אבל לדברי המחברים, מודל יכול להשתפר במשימות האימון שלו בלי להשתפר בפיתוח היורש שלו. עדיין לא ברור איך AI יוכל להציע כיווני מחקר מגוונים ולהעריך את ערכם לפני שיש תוצאות.

המשמעות, ככל הנראה, היא שבשלב הזה השאלה המעשית אינה אם סוכנים יחליפו את המפתחים, אלא איך שומרים על שיקול דעת אנושי אמיתי. הכתבה מצביעה גם על סיכון של "חותמת גומי": כשכל החלטה נשענת על שרשרת ארוכה יותר של עבודת סוכנים, קשה יותר לבדוק אותה לעומק. אם ההחלטה נשארת בידי אדם אבל הבחירה מצטמצמת לאישור הצעות מוכנות, השליטה האנושית עלולה להפוך לפורמלית יותר ומהותית פחות.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות