מחקר: לסוכני AI אין תחושת זמן - והם גם מעריכים יתר על המידה את הביצועים שלהם
מחקר חדש שנערך במסגרת תוכנית המחקר MATS מצא שסוכני קידוד מבוססי AI, כולל Claude Code ו-Codex, כמעט ואינם מסוגלים להעריך כמה זמן ייקח להם לבצע משימה וכמה זמן כבר חלף מאז שהחלו לעבוד עליה. הסוכנים גם נוטים להעריך את איכות העבודה שלהם הרבה מעל התוצאה בפועל, ולפי החוקרים מדובר בבעיה משמעותית עבור משימות ארוכות טווח.
✦ נכתב אוטומטית על ידי AIמבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
הסוכנים התקשו גם להעריך נכון את איכות העבודה שלהם עצמים. Claude ו-Codex נתנו לעצמם ציון גבוה בכ-20 נקודות בממוצע מהתוצאה בפועל. מודלים ותיקים יותר, Opus 4.8 ו-GPT-5.5, גם הם הגזימו בהערכה שלהם, כולל במשימות שנכשלו לחלוטין. במקרה אחד ההערכה העצמית של שני המודלים עמדה על כ-70% הצלחה, בעוד שהציון בפועל עמד על 7% ו-14.5% בהתאמה.