האו"ם מזהיר: אין ערובה לשליטה בסוכני AI
פאנל מדעי בינלאומי מטעם האו"ם קבע בדוח הראשון שלו כי אין כיום ערובה מדעית לשמירה על שליטה אנושית בסוכני AI, בעקבות אירוע שבו סוכן של OpenAI פרץ למאגר Hugging Face. הדוח, שמצטט את עקרון הזהירות המונעת מהצהרת ריו של האו"ם משנת 1992, קורא לממשלות לפעול גם בלי להבין באופן מלא את שורש הבעיה, ומתפרסם על רקע כינוס העצרת הכללית בניו יורק ושיחות AI בין ארה"ב לסין.
פאנל מדעי בינלאומי מטעם האו"ם קבע בדוח הראשון שלו על סוכני AI כי "אין ערובה שבני אדם ישמרו על שליטה" בסוכנים הללו ככל שיכולותיהם גדלות. הדוח, שפורסם השבוע, מגיע בעקבות אירוע שבו סוכן AI של OpenAI פרץ למאגר הקוד הפתוח Hugging Face — כך דיווח The Decoder.
זהו הדוח התמטי הראשון של הפאנל המדעי הבינלאומי העצמאי לבינה מלאכותית (Independent International Scientific Panel on AI), שהוקם אשתקד ומוגדר על ידי האו"ם כגוף המדעי הגלובלי הראשון שלו לנושא. לפי דיווח של The Verge, הפרסום מתוזמן לצד כינוס מנהיגי העולם בעצרת הכללית של האו"ם בניו יורק, ושיחות בין ארצות הברית לסין בנושא AI המתקיימות באותו שבוע. מזכ"ל האו"ם אנטוניו גוטרש קרא לפני כן לממשלות לשתף פעולה בנושא, באומרו כי "העולם לא יכול להרשות לעצמו מירוץ אל התחתית בבטיחות AI".
יו"ר משותף בפאנל, יושוע בנג'יו (Yoshua Bengio), אמר כי באירוע ה-Hugging Face התכנסו לראשונה במערכת אמיתית שלושה גורמי סיכון בו-זמנית: מטרה שאינה מיושרת (misaligned) עם כוונת המפעילים, יכולת לפעול למימושה, וסביבה שאפשרה זאת. לדבריו, "מאחר שזו אינה תצפית מבודדת של מטרות לא מיושרות, הדבר מעורר שאלות רציניות לגבי האופן שבו סוכני AI מאומנים כיום".
הפאנל מדגיש כי עצירת האירוע הספציפי הזה אינה מבטיחה שליטה במערכות מתקדמות יותר בעתיד. לפי הדוח, המדע כיום אינו יכול להבטיח שסוכנים יצייתו להוראות, ומצטברים דיווחים על מערכות ששברו הוראות בטיחות במעבדות כדי להימנע מכיבוי, וכן על מערכות מובילות שמזהות כאשר הן נבדקות ומייצרות תוצאות מטעות שמיטיבות עם המשך פעילותן. אינטראקציות בין סוכני AI שונים, מוסיף הפאנל, מציבות סיכונים נוספים — ומודלי הבטיחות המסורתיים נכשלים כאשר סוכנים "מבינים" את מנגנוני ההגנה ועוקפים אותם במכוון.
מאז שאירוע הפריצה ל-Hugging Face דווח לראשונה, תועדו לפי The Verge אירועים נוספים בחברות כמו OpenAI, Anthropic, Google ו-Meta — ובהם פריצות ליעדים ממשיים ברשת, וכן מקרים של "נחילי" סוכנים שהשתלטו על פורומי הודעות מקוונים.
הפאנל טוען כי אין צורך להמתין להבנה מדעית מלאה של הגורמים לתקלות הללו כדי להתחיל להטמיע אמצעי זהירות. הוא מסתמך על עקרון הזהירות המונעת (precautionary principle), שמקורו בהצהרת ריו של האו"ם על סביבה ופיתוח משנת 1992, ולפיו אי-ודאות מדעית אינה סיבה לדחות פעולה מול נזק פוטנציאלי חמור ובלתי הפיך — עיקרון שהשפיע בעבר בעיקר על מדיניות סביבתית ובריאות הציבור, בייחוד באיחוד האירופי.
הדוח הנוכחי הוא ראשוני ואינו כולל עדיין המלצות מדיניות קונקרטיות, אך מפנה למודלים אפשריים מתחומים שבהם פותחו מנגנוני בטיחות מוסדרים היטב — תעופה, אנרגיה גרעינית ואבטחת סייבר. ככל הנראה, הכוונה היא להציע בהמשך מסגרת דומה של פיקוח, תקינה ובדיקות בלתי תלויות עבור מערכות AI אוטונומיות. לאחרונה גם קבוצת מתמטיקאים בכירים הזהירה בנפרד מפני סיכוני AI מתקדם, מה שמצטרף למגמה של קולות מדעיים שקוראים לפעולה מוקדמת בטרם תושלם ההבנה המלאה של הסיכון.