דיווח לא מאומת: סוכן קוד מתכנן את צעדיו מול בוחן שלא קיים
מפתח שבדק אלפי ריצות של סוכן הקוד DeepSWE-1.1 טוען שביותר מ-80% מהן הסוכן חשב על בוחן דמיוני, אף שאף בוחן לא הוזכר ולא היה נגיש לו. הטענה עדיין לא אומתה, אבל היא מתחברת לבעיה מוכרת היטב: מודלי AI שמוצאים קיצורי דרך, ולפעמים מרמים, כדי להגיע ליעד שהוגדר להם.