מחקר חדש: שלבי החשיבה של מודלי AI משאירים חתימה ברורה בשכבות הפנימיות
חוקרים מ-KAIST ו-Naver AI Lab בדקו האם שלבי החשיבה הכתובים של מודלי שפה מתכתבים עם דפוסים ברורים בייצוגים הפנימיים של הרשת - ומצאו שכן, כשהאיתות החזק ביותר מופיע בשכבות האמצע. הממצא, שנבדק על כמה מודלים ומשימות מתמטיות, נותר עדיין בשלב מחקרי אך עשוי להיות רלוונטי למאמצי פיקוח על תהליכי החשיבה של מודלי AI.
✦ נכתב אוטומטית על ידי AIמבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
כשמודל שפה עם יכולת "חשיבה" (reasoning) פותר בעיה שלב אחר שלב, הוא מבצע בדרך פעולות שונות: שליפת נתונים, פירוק הבעיה, היזכרות בנוסחה, חישוב. מחקר חדש של צוות מ-KAIST (המכון הקוריאני למדע וטכנולוגיה) ומ-Naver AI Lab בדק האם השלבים האלה, הנראים לעין בטקסט הפלט, מתכתבים גם עם דפוסים ברורים בייצוגים המספריים הפנימיים של המודל. לפי הדיווח באתר The Decoder, התשובה חיובית - וההפרדה החדה ביותר בין השלבים מופיעה דווקא בשכבות האמצע של הרשת.
הצוות הגדיר שמונה פעולות חשיבה חוזרות, ובהן חילוץ מידע (extraction), פירוק הבעיה (decomposition), היזכרות בנוסחה, הסקה (deduction) וחישוב. כדי לבדוק את ההשערה, החוקרים הריצו שלושה מודלים - Qwen2.5-7B, Qwen3-8B ו-Gemma4-31B - על בעיות מתמטיות, פיצלו את מסלולי הפתרון למקטעים, והשתמשו במודל GPT-5 כדי לתייג כל מקטע לפי סוג הפעולה שבוצעה בו.
התוצאה הייתה שניתן להפריד באופן עקבי בין סוגי הפעולות בייצוגים הפנימיים של שלושת המודלים. החוקרים בדקו גם אם הבדלי ניסוח פשוטים מסבירים את התופעה, אך מסווג (classifier) שהתבסס רק על המילים בטקסט תפקד פחות טוב ממסווג שניתח את הייצוגים הפנימיים; גם המיקום של המקטע במסלול הפתרון לא הסביר את ההפרדה. המשמעות היא שהמצבים הפנימיים של המודל נושאים מידע על סוג שלב החשיבה שחורג מהניסוח החיצוני של המילים.
ממצא נוסף נגע למילות פונקציה נפוצות כמו "a", "is" או "the": בשכבות המוקדמות של הרשת הייצוג הפנימי שלהן מעורבב, אך בשכבות האמצע והמאוחרות הן נפרדות בהתאם לפעולת החשיבה שבה הן משובצות - כלומר אותה מילה מקבלת ייצוג שונה בהתאם להקשר. כשהחוקרים חסמו באופן ממוקד את תשומת הלב (attention) ל-30 האסימונים (tokens) שקדמו למקטע, האיתות של אותה פעולת חשיבה נחלש, מה שמצביע על כך ששלבי החשיבה אינם נוצרים בבידוד אלא נבנים על ההקשר שקדם להם.
ממצא נוסף התייחס לפתרונות שגויים: גם כשהמודל טעה בפתרון הבעיה, סוג הפעולה שביצע נותר ניתן לזיהוי - שלב חישוב פגום עדיין "נראה" פנימית כמו שלב חישוב, גם כשהתוצאה הייתה שגויה. הממצאים נשחזרו גם על המודל Llama-3-8B, ועבור Qwen3-8B המסווגים שאומנו על סט הנתונים המקורי הועברו בהצלחה למבחנים GPQA-Diamond ו-MATH-500. עם זאת, החוקרים מציינים כי הניסויים הוגבלו למשימות מתמטיות ולמספר מצומצם של מודלים, והשאלה אם ניתן להשתמש בממצאים כדי לזהות שגיאות או "לכוון" מודל תוך כדי תהליך היצירה (generation) נותרה פתוחה למחקר עתידי.
הקשר בין הטקסט שהמודל כותב לבין החישוב הפנימי שהוא מבצע נוגע ישירות לתחום בטיחות ה-AI. קריאת "שרשרת המחשבה" (chain of thought) שהמודל כותב היא אחד מכלי הפיקוח המעטים הזמינים כיום, כך לפי OpenAI - אך Anthropic הראתה בעבר שמודלים חושפים בפועל את הרמזים ששימשו אותם רק ב-25 עד 39 אחוז מהמקרים. בנוסף, שיטה שמתרגמת וקטורים פנימיים של מודל לטקסט קריא גילתה ש-Claude Opus 4.6 מעבד יותר מידע ממה שמופיע בפועל בטקסט החשיבה שהוא מציג.
לאור זאת, ממצאי המחקר החדש - שמראים כי לפעולות חשיבה יש חתימה פנימית עקבית וניתנת לזיהוי גם כשהפלט הטקסטואלי שגוי - עשויים, ככל הנראה, לתרום בעתיד לפיתוח כלי פיקוח שאינם תלויים רק בטקסט שהמודל בוחר לחשוף. עם זאת, מדובר בשלב מחקרי מוקדם: יישום מעשי של הממצאים ליכולת לתפוס שגיאות בזמן אמת או להתערב בתהליך החשיבה של מודל טרם הודגם.