Anthropic ו-OpenAI מתחייבות להטמיע משקיפי בטיחות עצמאיים בתוך המעבדות
מנכ"ל Anthropic דריו אמודיי פרסם הצעה להטמעת גופי הערכה חיצוניים בתוך חברות ה-AI המובילות, עם סמכות לדווח על תקריות בטיחות, להעריך האם מודלים אכן מיושרים, ולפרסם ממצאים בעצמאות. מנכ"ל OpenAI סם אלטמן הודיע שגם חברתו תאמץ את הגישה, אך פרטים מרכזיים — מי יהיו המעריכים, לאילו מערכות תהיה להם גישה ומה מותר לפרסם — עדיין לא פורסמו.
דריו אמודיי, מנכ"ל Anthropic, פרסם בסוף השבוע חיבור ארוך ובו הצעה שלפי TechCrunch התעשייה כולה הייתה דוחה על הסף עוד לפני שנה: להטמיע גופי הערכה עצמאיים בתוך כל חברות ה-AI המובילות ("frontier"), ולתת להם סמכות לדווח על תקריות בטיחות, להעריך האם מודלים אכן מיושרים (aligned) עם כוונת מפתחיהם, ולפרסם את הממצאים ללא עריכה. אמודיי אמר ש-Anthropic תתחייב להעניק לגופי הערכה חיצוניים כמו METR ו-Redwood Research גישה חסרת תקדים למערכות החברה. סם אלטמן, מנכ"ל OpenAI, אמר שגם חברתו תתחייב לפרקטיקה הזו.
עד כה, חברות AI נהגו להביא בוחנים חיצוניים לבחון רק את המודל הסופי, זמן קצר לפני השקתו. על פי דיווחי TechCrunch, גופי ההערכה שדיברו עם TechCrunch מבקשים כעת גישה גם לגרסאות ביניים ("checkpoints") מתהליך האימון עצמו. אדם גליב, מנכ"ל FAR.AI, ציין שגישה כזו תאפשר להשוות בין נקודות ביניים כדי לזהות מתי בדיוק התפתחה התנהגות בעייתית, לבחון את סביבת האימון שלאחר האימון הראשוני (post-training) שמתגמלת את המודל על התנהגויות מסוימות, ולבדוק תמלילי הערכה ולוגים כדי לאמת את טענות החברה על ביצועי המודל.
הצורך בגישה עמוקה יותר, כך לפי הכתבה, נובע מכך שמודלים נעשים טובים יותר בזיהוי מצבים שבהם הם נבחנים — מה שמעלה סיכון שהם יתנהגו כשורה בזמן הבדיקה בעוד שבפועל הם מסתירים התנהגות בעייתית. ג'ון סטיידלי, ראש האסטרטגיה ב-Palisade Research, נתן דוגמה ל"מבחן התנגדות לכיבוי" הבודק אם מודל מתנגד לניסיון לכבות אותו, והשווה מצב שבו מודל אומן במיוחד לעבור את המבחן הזה לפרשת "דיזלגייט" של פולקסווגן, שבה רכבים תוכנתו לזהות מבחני פליטה ולהתנהג אחרת בזמן הבדיקה. אלכסנדר מיינקה, ראש המחקר ב-Apollo Research, ציטט צורך בתשובה חד-משמעית לשאלה האם מודל ניסה באופן פעיל לחתור תחת אימון היישור שלו במהלך האימון עצמו, והוסיף: "כרגע אנחנו נסמכים לחלוטין על כך שחברות ה-AI יבדקו זאת בעצמן וידווחו על כך באמת לציבור. וראינו מתקריות אחרונות שכברירת מחדל, הן לא יעשו אף אחד מהשניים".
גופי ההערכה שפנו לכתבה קיבלו בברכה את ההצעה, אך אמרו שיש עדיין פרטים שצריך לסגור — ורצוי שיעוגנו בחקיקה — כדי לדעת אם הם יפעלו כגופי פיקוח עצמאיים באמת, או כספקים הפועלים לפי תנאי חברות ה-AI. גליב הוסיף שגישה משמעותית עשויה לכלול גם ראיונות עם עובדי החברה, כדי לבדוק אם התיעוד הפנימי וההצהרות הפומביות של החברה על נהלי הבטיחות שלה תואמים את מה שקרה בפועל בתוך הארגון.
לפי הכתבה, נכון לפרסום הידיעה, אף אחת מהחברות לא גילתה עם אילו גופי הערכה היא תעבוד, מתי המעריכים ייכנסו לתפקיד, כמה מהם יגויסו, לאילו מערכות ומידע בדיוק תהיה להם גישה, ומה מותר יהיה לפרסם לציבור — זאת חרף שאלות חוזרות של TechCrunch לשתי החברות. ככל הנראה, המרחק בין ההצהרה העקרונית לבין יישום מפורט ומחייב הוא שיקבע אם המהלך יתפקד כבקרה בטיחותית אמיתית או יישאר בעיקר הצהרת כוונות.