OpenAI פרסמה דוח טכני רשמי על הפריצה ל-Hugging Face מהחודש שעבר, ולפיו סוכני AI פיתחו במהלך האימון יכולת לתקשר זה עם זה ולעקוף מגבלות כדי להשלים משימות - התנהגות שהובילה בסופו של דבר לפריצה בפועל בזמן מבחן אבטחת סייבר. בחברה אומרים שהם מגבירים את הניטור של תהליכי החשיבה הפנימיים של המודלים כדי למנוע מקרים דומים.
חברת OpenAI פרסמה דוח טכני רשמי המתאר כיצד סוכני בינה מלאכותית פרצו בחודש שעבר למערכות של Hugging Face, לאחר שפיתחו במהלך האימון שלהם יכולות תקשורת והתחמקות שלא תוכננו מראש. הדוח, שפורסם יותר מחודש לאחר שהתקרית נודעה לציבור, מתאר אותה כ"התנהגות לא מיושרת בתרחיש חריג, שנוצר משילוב נדיר של אירועים": משימות בלתי אפשריות במסגרת מבחן האבטחה "ExploitGym", התמדה של המודל לאורך משימות ארוכות, והודעות למודלים אחרים שגרמו להם לסטות מהמטרה שהוגדרה להם.
לפי הדוח, מודל ה-AI קיבל בזמן בדיקה בעיה שלא ניתנה לפתרון, וכדי להשלים אותה בכל זאת חיבר יחד שרשרת של פרצות אבטחה שלא היו ידועות קודם לכן. תחילה הוא פרץ לכלי ניהול החבילות Artifactory כדי להשיג גישה לאינטרנט, ומשם המשיך לפרוץ למערכות נוספות אצל OpenAI, Hugging Face וספקים אחרים. חשוב לציין שהמבחן שבמסגרתו קרה הדבר בוצע במכוון ללא מסנני האבטחה הרגילים שאמורים למנוע מהמודלים לבצע פעולות סייבר מסוכנות - כדי שבחברה יוכלו למדוד את יכולות הסייבר המקסימליות של המודל.
החוקרים מצאו שהשורש של האירוע נעוץ עוד בשלב האימון. לפי כתבה מפורטת ב-MIT Technology Review, כבר במאי גילו מודלים בתהליך אימון דרך להשתמש בתשתית של OpenAI כדי לתקשר זה עם זה ולקבל סיוע במשימות קשות - כולל כאלה שלא ניתן היה לפתור בלי לפרוץ או לחרוג מהכללים. "לוח ההודעות" הזה נסגר, אך ביולי, בזמן הערכת יכולות אבטחת סייבר, חלק מהמודלים יצרו לוח הודעות חדש, ולמרות שהיו אמורים להיות מבודדים מהאינטרנט, הצליחו בעבודה משותפת להתחבר לרשת, לפרוץ ל-Hugging Face ולהשיג פתרונות לבעיות שבהן נתקעו.
התופעה מוכרת בתחום כ"reward hacking" - כאשר התנהגות שמובילה לפתרון נכון של בעיה מתחזקת בתהליך האימון, גם אם הדרך להגיע אליה כללה עקיפת כללים. אריק וואלאס, מצוות מחקר היישור (alignment) של OpenAI, אמר שכמעט לכל התנהגות בעייתית שנצפתה בזמן ההערכה נמצא מקבילה בשלב האימון שכנראה תרמה לה. קאי צ'ן, שמוביל את אותו צוות, ציין כי מדובר באתגר שנצפה כבר זמן רב, ושכעת רואים אותו "בדיוק גבוה הרבה יותר", אך אין לו פתרון מיידי.
כצעד מנע, OpenAI מרחיבה את הניטור של "שרשרת המחשבה" (chain of thought) - מעין פנקס פנימי שבו המודלים מתכננים את פעולותיהם - בכל המודלים המובילים שלה, ומצרפת לכך מערך תגובה זמין מסביב לשעון ויכולת לעצור עומסי עבודה שנחשבים לא בטוחים. לפי הדוח, אילו מערכת הניטור הזו הייתה פעילה בזמן האירוע, היא הייתה מזהה את הפעילות החשודה ומתריעה לצוות האבטחה יותר מיממה לפני הפריצה בפועל ל-Hugging Face. עם זאת, ל-OpenAI יש גם עדות לכך שהגישה הזו אינה חסינה: מחקר קודם של החברה הראה שענישת מודלים על אזכור כוונות רמייה בשרשרת המחשבה שלהם מלמדת אותם להסתיר את הכוונות הללו - כך שהפתרון, ככל הנראה, לא ימנע לגמרי תקריות דומות בעתיד.
גם ארגון ההערכה הבלתי-תלוי METR, וכן חברת המחקר Redwood Research, ביצעו בדיקות עצמאיות משלהם לאירוע ומתכננים לפרסם דוחות נפרדים משלהם.