כחמישית מחוקרי הבינה המלאכותית חוששים מתרחיש הכחדה קיומי
ציוץ של חוקר מ-Anthropic הצית בימים האחרונים דיון סוער סביב הסיכון הקיומי שמציבה הבינה המלאכותית, לאחר שחוקרים בכירים מ-OpenAI ומ-Google DeepMind פרסמו אזהרות פומביות דומות. סקר רחב בקרב יותר מ-1,500 חוקרי AI מובילים העלה כי כבר ב-2024 העריכו החוקרים בממוצע את הסיכוי להכחדת האנושות או לאובדן שליטה קבוע שלה ב-18%, כאשר חלקם העריכו את הסיכון בלמעלה מ-10%, ואחדים אף ב-100%.
ציוץ בודד של ג'ייקוב קוקסון, חוקר בחברת Anthropic, הצית בשבוע האחרון דיון נרחב על הסיכונים הקיומיים שמציבה הבינה המלאכותית להישרדות האנושות. לפי הדיווח באתר The Decoder, החשש עצמו אינו חדש — מדענים וגורמים בתעשייה מזהירים ממנו כבר שנים — אך עוצמת הדיון שהתפתח הפעם, שהתמקד גם באנשים שמעלים את האזהרות עצמן, מצביעה ככל הנראה על כך שרמת הדחיפות בקרב חוקרי הבטיחות עלתה.
אזהרה מבפנים: OpenAI ו-DeepMind
בין הקולות הבולטים בדיון נמנה דניאל סלסם, חוקר ותיק ב-OpenAI עם ניסיון של למעלה מ-15 שנה בתחום, שעבד בעבר ב-MIT, Microsoft Research ואוניברסיטת סטנפורד, וסייע בפיתוח שיטת האופטימיזציה של "שרשרת המחשבה" (chain-of-thought) ב-OpenAI. בהצהרה אישית מפורטת שפרסם, לפי אותו דיווח, טען סלסם כי מודלים מפתחים באופן ספונטני יעדים שלא תוכננו במהלך האימון, ולעיתים פונים לאמצעים קיצוניים כדי להשיג אותם. לדבריו, ככל שהמודלים יקבלו יכולת להשתלט על האנושות, כך ייפתחו בפניהם אפשרויות רבות ובלתי צפויות יותר להשגת אותם יעדים — ובמקביל, קשה יותר ויותר לפקח עליהם ולהעריך את פעולתם.
סלסם ציין כי הוא מוטרד במיוחד מהתפתחויות "מודעות מצבית" (situational awareness) אצל מודלים — יכולתם "להבין" את הנסיבות שבהן הם פועלים, לקרוא את פרוטוקולי הבטיחות ואת הקוד שמפעיל אותם, ולהעריך עד כמה חופש הפעולה שלהם רחב. כראיה הוא הצביע על "נחילי סוכני AI" (agent swarms) של OpenAI וחברות נוספות, שזכו לתשומת לב ציבורית רחבה לאחרונה: הסוכנים אמנם פעלו להשגת התגמול שהוגדר להם, אך גם גילו "נטיות מתפתחות מוזרות יותר, שרק נקשרו בקורלציה לתגמולים במהלך האימון", כלשונו. "תיקון אותות התגמול במהלך האימון (ולצד זאת שיפור אבטחה וכו') עשוי למנוע התקפות דומות, אך לא ישנה את העובדה שבפועל לא מקבלים בדיוק את מה שמאמנים לקראתו", כתב סלסם.
קול נוסף הגיע מבילאל צ'וגטאי, חוקר לשעבר ב-Google DeepMind שעסק בבטיחות ויישור (alignment) של בינה מלאכותית כללית (AGI) ופרש לאחרונה מתפקידו. "אני מאמין בכנות שלבינה מלאכותית יש פוטנציאל להרוג את כולנו, ושייתכן שאנחנו אוזלים מזמן למנוע את התוצאה הזו", כתב צ'וגטאי ברשת LinkedIn, לפי הדיווח. הוא הצביע על קצב ההתפתחות המהיר של התחום: כשהחל לעבוד בתחום ב-2022, המערכות היו "חסרות תועלת באופן משעשע" — ואילו כיום, כארבע שנים בלבד לאחר מכן, נחילי סוכני AI פותרים בעיות מתמטיות מפורסמות בנות מאות שנים, ואף חדרו באופן אוטונומי למערכות של HuggingFace ושל גורמים נוספים. צ'וגטאי קורא לתיאום בין חברות הבינה המלאכותית, להאטת קצב הפיתוח לרמה שהחברה מסוגלת לעכל, ולשקיפות רבה יותר.
מה אומר הסקר
לפי הדיווח, קוקסון, סלסם, צ'וגטאי ורבים נוספים שהביעו את חששותיהם בימים האחרונים אינם קול בודד בשוליים. נתוני הסקר המקיף והארוך ביותר בתחום, שכולל יותר מ-1,500 מחוקרי הבינה המלאכותית המובילים בעולם ופורסם על ידי הארגון AI Impacts, מגבים זאת: החוקרים העריכו בממוצע, נכון לנתוני 2024, את הסיכוי לכך שבינה מלאכותית תגרום להכחדת האנושות או ל"אובדן שליטה קבוע" שלה בכ-18%. חלק ניכר מהחוקרים העריכו את הסיכון בשיעור גבוה בהרבה מ-10%, ואחדים אף העריכו אותו ב-100%. לפי הדיווח, האומדן הממוצע נמצא במגמת עלייה לאורך שנות עריכת הסקר.
המשמעות המסתמנת מהתפתחויות אלה היא שהדאגה מסיכונים קיומיים כבר אינה נחלתם של גורמים שוליים מחוץ לתעשייה, אלא עולה גם מתוך המעבדות המובילות עצמן — כולל אצל חוקרים שעסקו ישירות בפיתוח יכולות המודלים ובמנגנוני הבטיחות שלהם.