יום ראשון, 30 באוגוסט 2026 מתעדכן אוטומטית כל שעה
🗞️ חזרה למהדורה

מחקר: לסוכני AI אין תחושת זמן - והם גם מעריכים יתר על המידה את הביצועים שלהם

מחקר חדש שנערך במסגרת תוכנית המחקר MATS מצא שסוכני קידוד מבוססי AI, כולל Claude Code ו-Codex, כמעט ואינם מסוגלים להעריך כמה זמן ייקח להם לבצע משימה וכמה זמן כבר חלף מאז שהחלו לעבוד עליה. הסוכנים גם נוטים להעריך את איכות העבודה שלהם הרבה מעל התוצאה בפועל, ולפי החוקרים מדובר בבעיה משמעותית עבור משימות ארוכות טווח.

הסוכנים התקשו גם להעריך נכון את איכות העבודה שלהם עצמים. Claude ו-Codex נתנו לעצמם ציון גבוה בכ-20 נקודות בממוצע מהתוצאה בפועל. מודלים ותיקים יותר, Opus 4.8 ו-GPT-5.5, גם הם הגזימו בהערכה שלהם, כולל במשימות שנכשלו לחלוטין. במקרה אחד ההערכה העצמית של שני המודלים עמדה על כ-70% הצלחה, בעוד שהציון בפועל עמד על 7% ו-14.5% בהתאמה.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות