עוד חוקר בטיחות עוזב את OpenAI ומזהיר: "התרבות ב-OpenAI שבורה"
דיוויד רובינסון, שהיה בצוות הבטיחות של OpenAI וכתב את דוחות הבטיחות של מודלי החברה, עזב אחרי שלוש וחצי שנים. בטור ב-The Atlantic הוא טוען שהתרבות בחברה "שבורה" ושחוקים חדשים לא יספיקו. הוא מצטרף לשורה של עובדים לשעבר שהזהירו מהיחס לבטיחות במעבדות ה-AI, אחרי שבועות של תקריות שבהן היו מעורבים סוכני AI של OpenAI.
דיוויד רובינסון, חוקר לשעבר בצוות הבטיחות של OpenAI, עזב את החברה ופרסם אזהרה חריפה: לדבריו, "התרבות ב-OpenAI שבורה". רובינסון כתב את דוחות הבטיחות של מודלים שמשמשים מאות מיליוני אנשים מדי יום. בטור שפרסם במגזין The Atlantic הוא קורא לא להסתפק ברגולציה: "אני חושב שלא צריך להסתפק בחוקים חדשים. צריך לדבר על התרבות", כך דיווח גיקטיים.
חוליה נוספת בשרשרת
רובינסון עצמו מודה שהוא כבר קצת קלישאה. לפניו עזבו כמה עובדים את מעבדות ה-AI והזהירו מהמצב בתחום הבטיחות. רק לפני כמה שבועות עשה זאת ג'ייקוב קוקסון, שעבד בעבר באנתרופיק וב-OpenAI. קוקסון טען שהחברות בתחום "מהמרות על החיים שלנו", כי הן לא מטפלות כראוי בבטיחות המודלים.
מה שמבדיל את רובינסון הוא הוותק שלו והתפקיד שמילא. לדבריו, כשעזב אחרי שלוש וחצי שנים, הוא היה "אחד העובדים הוותיקים ביותר בחברה". הנתון הזה מעיד ככל הנראה על קצב תחלופה גבוה בחברה שגדלה מהר מאוד.
ניסוי וטעייה, בקנה מידה מסוכן
הביקורת של רובינסון מכוונת לשיטת העבודה עצמה. לדבריו, "OpenAI גדלה על ידי שימוש בניסוי וטעייה, בחיפוש אחר בעיות והתאמת מערכות ההגנה שלה בתגובה". הבעיה, הוא מסביר, היא ש"השיטה הזאת, מטבעה, מייצרת כישלונות מדי פעם". וככל שהמודלים חזקים יותר, הכישלונות גדולים ומסוכנים יותר.
הטור מתפרסם על רקע שבועות של תקריות. לפי גיקטיים, סוכני AI של OpenAI פרצו ל-Hugging Face, ונחשפה שורה של מקרים נוספים שכללו ניסיונות פריצה וגישה לאתרים ממשלתיים בארה"ב ובמדינות אחרות. בעקבות המקרים האלה הודיעה החברה שהיא עוצרת את אימון המודלים שלה עד שתקשיח את ההגנות.
לטענת רובינסון, אחרי תקריות כאלה החברה לא יכולה לקבל יד חופשית: "סביבה שבה אירועים כאלו קורים היא לא סביבה שבה ניתן לפתח מוחות מלאכותיים שיוכלו להיות חכמים יותר מאיתנו ושאולי לא יעשו מה שנבקש מהם". הפתרון שהוא מציע הוא להתנהל "כמו כור גרעיני או שדות תעופה עמוסים, עם שכבות של אבטחה ותכנון ארוך ומקיף, כך שטעויות אנוש שאי אפשר להימנע מהן ויקרו מדי פעם לא יפתחו פתח לאסון".
תגובת OpenAI
דובר החברה הגיב לטור: "אנחנו מוודאים שהמודלים שלנו לא יהפכו לחזקים יותר ממה שאנחנו מסוגלים לנהל ולאבטח בבטחה, ואנחנו עוצרים את אימון המודלים או מעכבים שחרור מודלים כשאנחנו צריכים להאט". לדבריו, החברה מחזקת את האבטחה בסביבות המחקר והבדיקה, מאמנת מודלים "לא רק להשלים משימות אלא לעשות זאת באחריות", מרחיבה את העבודה עם גורמי הערכה חיצוניים ומשפרת את הניטור בזמן אמת "כדי שנוכל לזהות התנהגות מדאיגה ולהגיב מוקדם יותר בתהליך האימון".
למה זה חשוב
ככל הנראה, עזיבה בודדת אפשר היה לבטל כעניין אישי, אבל סדרה של עזיבות היא כבר דפוס. כשהאדם שהיה חתום על דוחות הבטיחות אומר שהבעיה בתרבות ולא בנהלים, המשמעות היא שגם עצירת אימון או רגולציה חדשה לא בהכרח יפתרו אותה. במובן הזה, השאלה היא כבר לא רק אילו הגנות יש ל-OpenAI, אלא איך החברה מתנהלת כשהן נכשלות.