גל אזהרות על קיום: חוקרי בטיחות ב-OpenAI, Google DeepMind ו-Anthropic מתריעים - וחלקם עוזבים
חוקר capabilities בכיר ב-OpenAI פרסם השבוע הצהרה פומבית על חששותיו מסיכון קיומי מ-AI, בעוד טענה של לשעבר עובד באנתרופיק לפיה חוקרים רבים בחברה מאמינים ש-AI "עלול להרוג את כולנו עד סוף העשור" עוררה ויכוח על האחריות שבהתרעה פומבית. במקביל מדווח, ללא אימות עצמאי, על עזיבות נוספות של חוקרי בטיחות בגוגל דיפ מיינד.
בשבועות האחרונים מצטברים סימנים לכך שחוקרי בטיחות (safety researchers) בכמה מחברות ה-AI המובילות מביעים בפומבי חשש מסיכון קיומי (existential risk) שלדעתם נשקף מקצב הפיתוח הנוכחי של מערכות בינה מלאכותית. חלקם משתפים את החששות בפומבי, ולפי דיווחים - חלקם גם עוזבים.
הביטוי הבולט ביותר השבוע הגיע מתוך OpenAI עצמה. דן סלסאם (Dan Selsam), חוקר capabilities בחברה מאז 2022, פרסם הצהרה אישית על סיכוני AI. מכיוון שאין לו חשבון ב-X, הוא שלח אותה לדניאל קוקוטאיילו (Daniel Kokotajlo) - מחבר תרחישי "AI 2027" שסלסאם היה, לדבריו של קוקוטאיילו, "הבוס שלו לזמן מה" - וביקש שיפרסם אותה בשמו. בציוץ שבו שיתף את ההצהרה מצוטט סלסאם אומר: "עבדתי על AI במשך יותר מחמש עשרה שנים, על פני פרדיגמות רבות ושונות". לפי התיאור שצורף לפרסום, אחד הגורמים שמניעים חוקרים בתעשייה לחשוש הוא עלייה במודעות המצבית (situational awareness) של מודלים - כלומר אינדיקציות לכך שמודלים "מזהים" שהם נמצאים דווקא בתהליך של הערכת alignment.
במקביל, מסתובבים גם דיווחים - שלא אומתו במקור עצמאי - על עזיבות נוספות של חוקרי בטיחות בצוות המקביל בגוגל דיפ מיינד.
באנתרופיק המתח מקבל ביטוי אחר. לפי רשומה בבלוג של סיימון ווילסון, ג'ייקוב קוקסון (Jacob Coxon), לשעבר עובד אנתרופיק, טען בציוץ שחוקרים רבים בחברה מאמינים ש-AI "עלול להרוג את כולנו עד סוף העשור". בריאן קנטריל (Bryan Cantrill), ממארחי הפודקאסט Oxide and Friends, הגיב לטענה בפוסט שכותרתו "הידבקות בפחד" (The Contagion of Fear), והזהיר מפני הפצת טענות מבהילות בלי ביסוס מספק. קנטריל ציין שקוקסון הזכיר "פריצה לתשתיות קריטיות" ו"נשק ביולוגי ברמת השמדה" בלי לפרט כיצד בדיוק תרחיש כזה עשוי להתרחש, וטען שדווקא משום שהציבור אינו יכול להעריך בעצמו טענות טכניות כאלה, המומחים - לא פחות מהציבור - חייבים להיות זהירים בניסוח שלהן. בפרק פודקאסט נוסף הרחיב קנטריל ספציפית את ספקותיו לגבי הטענות על נשק ביולוגי, וקרא לשלב בדיון מומחים מתחום הביולוגיה עצמו.
המשמעות: נראה שנפער פער בין שתי גישות בקרב אנשי מקצוע בתעשיית ה-AI. מצד אחד, חוקרים כמו סלסאם, שבוחרים לפרסם בפומבי את חששותיהם מסיכון קיומי - לעיתים תוך שימוש בערוצים עקיפים כמו קוקוטאיילו, כדי להגיע לקהל רחב. מצד שני, קולות כמו זה של קנטריל, שמזהירים כי אזהרות דרמטיות ללא פירוט טכני עלולות לשחוק את אמון הציבור במומחים - גם כשהכוונה שמאחוריהן כנה. ככל הנראה, הוויכוח הזה - לא רק על רמת הסיכון עצמה, אלא על האחריות שבתקשורת שלו כלפי ציבור שאינו יכול להעריך את הטענות בעצמו - ילך ויתחדד ככל שהמודלים ימשיכו להתקדם.