OpenAI: שיבשנו קמפיין מתואם לחילוץ החשיבה המוגנת של המודלים שלנו
OpenAI מודיעה ששיבשה קמפיין מתואם שניסה לחלץ מהמודלים שלה את תהליך החשיבה המוגן שלהם, בשיטה שנקראת distillation. החברה מוסיפה שהיא מחזקת את ההגנות מפני ניסיונות כאלה. זו תזכורת לכך שתפוקות של מודל הן נכס שמתחרים עשויים לנסות לנצל.
OpenAI פרסמה הודעה רשמית ובה היא מספרת ששיבשה קמפיין מתואם של model distillation, כלומר ניסיון שיטתי לחלץ מהמודלים שלה את "החשיבה המוגנת" שלהם (protected model reasoning). לדברי החברה, היא גם מחזקת את ההגנות שלה מפני מה שהיא מכנה distillation עוין (adversarial distillation).
בחומר שפורסם עד כה אין פירוט על מי עמד מאחורי הקמפיין, כמה זמן הוא נמשך או עד כמה הצליח. לכן אי אפשר כרגע לקבוע אם התוקפים השיגו משהו ממשי ומה בדיוק הם השיגו.
מה זה distillation, ולמה זה מדאיג
Distillation ("זיקוק" בתרגום חופשי) היא טכניקה מוכרת ולגיטימית בעולם הלמידה העמוקה: מאמנים מודל "תלמיד", בדרך כלל קטן וזול יותר, על התשובות של מודל "מורה" גדול וחזק יותר. כך אפשר להעביר חלק מהיכולות של המודל הגדול בלי לשלם על אימון מאפס. חברות רבות משתמשות בה כדי לבנות גרסאות מהירות וזולות של המודלים שלהן.
הבעיה מתחילה כשצד שלישי עושה את זה בלי רשות, ושולף בהיקף גדול תשובות ממודל של חברה אחרת כדי לאמן מודל מתחרה. זה מה ש-OpenAI מכנה distillation עוין. המילה "מתואם" בהודעה מרמזת, ככל הנראה, על פעילות מאורגנת ולא על משתמש בודד ששלח הרבה שאילתות.
למה דווקא "חשיבה"
הדגש על חילוץ חשיבה מוגנת הוא כנראה הפרט המעניין ביותר בהודעה. מודלי reasoning, כלומר מודלים ש"חושבים" בכמה שלבים לפני שהם עונים, הם כיום אחד התחומים התחרותיים ביותר בתעשייה. שרשרת החשיבה של מודל כזה יכולה לשמש חומר אימון יקר ערך: היא מלמדת לא רק מה התשובה, אלא גם איך מגיעים אליה. סביר להניח שזו הסיבה שחברות נוטות להסתיר חלק מתהליך החשיבה של המודלים שלהן מהמשתמשים, ושזו גם הסיבה שצדדים שלישיים ינסו להגיע אליו.
המשמעות
ההודעה של OpenAI משקפת, ככל הנראה, מתח שהולך ומתחדד בתעשייה. חברות משקיעות סכומים עצומים באימון מודלים, ואז מנגישות אותם לכל העולם דרך API וממשקי צ'אט. מאותו רגע כל תשובה של המודל היא גם דאטה שמישהו יכול לאסוף. ההגנה על מודל כבר לא מסתכמת בשמירה על המשקולות שלו. היא כוללת גם ניטור של דפוסי שימוש חשודים וחסימה שלהם.
לצד זה חשוב לזכור שמדובר בגרסה של צד אחד. ההודעה מגיעה מ-OpenAI עצמה, ובחומר הזמין אין פרטים שמאפשרים לבדוק באופן עצמאי את היקף הקמפיין או את מידת הצלחתו. אם החברה או גורמים אחרים יפרסמו פרטים נוספים, למשל על זהות הגורמים המעורבים או על אמצעי ההגנה החדשים, יהיה אפשר להבין טוב יותר עד כמה האיום מוחשי ואיך הוא עשוי להשפיע על האופן שבו מודלים מסחריים נפתחים לשימוש.