Goodfire משיקה ניטור לסוכני AI שמציץ אל תוך המודל, בעלות נמוכה בהרבה מניטור חיצוני
חברת הסטארט-אפ Goodfire השיקה כלי שמנטר סוכני AI באמצעות קריאת האותות הפנימיים של המודל בזמן שהוא עובד, במקום להפעיל מודל נוסף שיקרא את כל מה שהסוכן כותב. בניסויי החברה על המודל הפתוח Kimi K3, הניטור של כ-1,500 סשנים עלה כ-51 דולר. לשם השוואה, מודל ניטור זול עלה 233 דולר, ומודל מהשורה הראשונה עלה כ-10,000 דולר.
חברת הסטארט-אפ Goodfire, שעוסקת ב-interpretability (המחקר שמנסה להבין איך מודלי AI פועלים מבפנים), השיקה ביום חמישי כלי ניטור חדש לסוכני AI. הכלי לא קורא את מה שהסוכן כותב. הוא עוקב אחרי מה שקורה בתוך המודל בזמן שהוא עובד. לפי החברה, השיטה מזהה את רוב הסשנים הזדוניים ועולה רק חלק קטן ממה שעולות השיטות המקובלות.
הכלי זמין ללקוחות של Baseten, חברה שמארחת ומריצה מודלי AI עבור חברות אחרות. בחודש שעבר הודיעה Base Labs, זרוע של Baseten, על שותפות בתחום הבטיחות עם Goodfire ועם פלטפורמת Hugging Face.
הבעיה: שומר שקורא כל מילה
כיום, הדרך המקובלת לפקח על סוכן AI היא להציב לידו מודל AI שני שקורא את כל מה שהוא עושה. הבעיה היא העלות. סוכנים יכולים לרוץ שעות ולעבד טקסט בהיקף של כמה רומנים, ומודל הניטור צריך לקרוא את כל הטקסט הזה מחדש.
Goodfire משווה את השיטה שלה לבידוק ביטחוני בשדה תעופה. גלאים קטנים שנקראים probes קוראים את האותות הפנימיים של המודל בכל שלב בעבודת הסוכן, כמו שער גלאי מתכות שכל נוסע עובר בו. רק כשגלאי מתריע, נכנס לפעולה מודל AI נפרד שבודק את המקרה לעומק, בדומה לבידוק ידני.
החיסכון נובע מכך שה-probes משתמשים בחישובים שהמודל כבר מבצע בכל מקרה. "מוניטורים של אקטיבציות פנימיות זולים מאוד, כי הם עושים שימוש חוזר בחישובים של ה-forward pass", הסביר מנכ"ל החברה, אריק הו, בפודקאסט MAD של המשקיע מאט טרק. "המודל כבר מחשב את הטוקן הזה. כל מה שאנחנו עושים זה לקחת את האקטיבציות העצביות שהוא כבר חישב בשלבי הביניים ולהריץ עליהן classifier", כלומר מודל סיווג.
המספרים
בניסויים של Goodfire על המודל הפתוח Kimi K3, הניטור של כ-1,500 סשנים עלה כ-51 דולר. מודל AI זול שבודק כל שלב עלה 233 דולר, ומודל מהשורה הראשונה עלה כ-10,000 דולר. ה-probes זיהו 94% מסשני הפריצה הזדוניים, ושלחו 8.7% מהסשנים התמימים לבדיקה נוספת. לפי החברה, הפעלה של ארבעה probes במקביל האריכה בפחות מ-2% את הזמן שעובר עד שהמודל מתחיל להשיב.
לקוחות Baseten בוחרים מאילו סיכונים להתגונן, ובהם פריצה התקפית, שימוש לרעה לפיתוח נשק כימי או ביולוגי, ו-reward hacking (מצב שבו המודל "מרמה" כדי לעמוד ביעד שהוגדר לו). הם גם מגדירים מה יקרה כשמתגלה בעיה: תיעוד האירוע, העברה לבדיקה אנושית או סירוב לבקשה.
למה דווקא מודלים פתוחים
ההשקה מגיעה אחרי שורת אירועים השנה שבהם סוכני AI חמקו מסביבות הניסוי שלהם, בהם סוכנים של OpenAI שפרצו ל-Hugging Face. Kimi K3, המודל שסביבו בנתה Goodfire את המוניטור הראשון שלה, ניצל בקיץ דליפה ב-sandbox (סביבת ההרצה המבודדת שלו) כדי לגשת לאינטרנט ולמידע ב-GitHub.
Goodfire מכוונת בעיקר למודלים פתוחים. מפתחים יכולים להוריד אותם ולהסיר מהם את מנגנוני ההגנה, ואין להם מערכות ניטור כמו אלה שהמעבדות הסגורות מפעילות על המודלים שלהן. "הנזק שאדם יחיד יכול לגרום עם מודל פתוח הוא קטן בהשוואה למה שאפשר לעשות עם אשכולות מחשוב, כמו אצל ספקי inference, ושם נמצאת רוב האחריות", אמר דן בלסם, CTO ואחד ממייסדי החברה. לפי מחקר שפרסמה Goodfire לאחרונה, מודלים פתוחים מובילים, ובהם Kimi K3 ו-GLM 5.2, ביצעו reward hacking ב-50% עד 96% מההרצות במבחנים לסוכני AI.
Goodfire לא הראשונה שמנסה את הגישה הזאת. גוגל DeepMind מסרה בינואר שהמחקר שלה סייע לפריסה של probes לזיהוי שימוש לרעה ב-Gemini.
המשמעות
אם המספרים של Goodfire יתקיימו גם מחוץ לניסויים של החברה, הניטור הפנימי עשוי להפוך את הפיקוח על סוכנים מהוצאה כבדה לתוספת שולית. ככל הנראה, זה רלוונטי במיוחד לספקים שמריצים מודלים פתוחים בהיקפים גדולים. עם זאת, הנתונים הם של החברה עצמה ונבדקו על מודל אחד. שיעור של 8.7% "התרעות שווא" אומר שעדיין יש צורך בשכבת בדיקה נוספת.
בלסם מתאר את המוניטורים כצעד ראשון במטרה מחקרית רחבה יותר: לפרק LLM לרכיביו כך שאפשר יהיה לאתר באיזה שלב באימון נוצרה כל התנהגות. "אנחנו מקווים להפוך את הקסם של אימון מודלים להנדסה מדויקת", אמר.