נאדלה: יש להניח שכל מודל AI "פרוץ", וצריך בלם חירום
מנכ"ל מיקרוסופט, סאטיה נאדלה, פרסם ב-X פוסט ארוך שבו קרא לבחון מחדש את "ארכיטקטורת האמון" של הבינה המלאכותית. לדבריו, צריך להניח מראש שמודל "נפרץ" ולתחום אותו מההתחלה, ואדם מורשה צריך להיות מסוגל לעצור אותו באמצע משימה.
מנכ"ל מיקרוסופט, סאטיה נאדלה, קורא לתעשייה לשנות את הדרך שבה היא נותנת אמון במודלים של בינה מלאכותית. בפוסט ארוך שפרסם ב-X בשבת בבוקר הוא כתב שהגיע הזמן "לעצור ולבחון את ארכיטקטורת האמון" של ה-AI. המשפט החריף ביותר בפוסט: "עלינו להניח שמודל נפרץ (compromised) ולתחום אותו מההתחלה. חשבו על זה כמו על בלם חירום", כך דיווחו TechCrunch ו-The Verge.
סוף עידן "הקופסה השחורה"
בלב הטיעון של נאדלה עומדת ביקורת על המצב הנוכחי, שבו המשתמשים מקבלים או דוחים את מה שהמודל מציע בלי לראות מה קרה בדרך. "איננו יכולים להתייחס לסופר-אינטליגנציה כאל אוסף של קופסאות שחורות מקוננות, ופשוט לקבל או לדחות את ההמלצות, התשובות והפעולות שלה", כתב.
החלופה שהוא מציע מורכבת מכמה רכיבים, לפי TechCrunch:
- הפרדה בין המודל ל"רתמה" (harness): כלומר הפרדה בין המודל עצמו לבין שכבת התוכנה שמתזמרת את העבודה שלו, מפעילה כלים ומבצעת פעולות.
- הוצאת מנגנוני הבקרה החוצה: אמצעי הבטיחות לא אמורים להיות חלק מהמודל, אלא שכבה חיצונית שאפשר לפקח עליה.
- תיעוד שלא ניתן לזייף: כל "פעולה משמעותית" של מודל צריכה להשאיר אחריה "ראיות קריאות לאדם, עמידות בפני שיבוש".
- כפתור עצירה: "אדם מורשה" צריך תמיד להיות מסוגל "להשהות או לכבות מודל באמצע משימה".
נאדלה הוסיף, לפי The Verge, ש"מודלים מתקדמים יותר ידרשו טכנולוגיות תיחום מתקדמות יותר, שעלינו להגיע לגביהן לתקן אחיד".
לא לבד, אבל צעד אחד הלאה
ב-The Verge ציינו שרבות מההמלצות של נאדלה דומות למה שכבר נשמע מאחרים בתעשייה: דיווח מהיר על תקלות, ביקורות חיצוניות בלתי תלויות, נתונים שאפשר לאמת ותיחום של המודלים. לפי האתר, בנקודה האחרונה, התיחום, נאדלה הולך מעט רחוק יותר מאחרים בתחום, כשהוא מציע לצאת מראש מהנחה שהמודל אינו אמין.
ב-TechCrunch הוסיפו הקשר: נאדלה הוא רק הבכיר האחרון בתעשייה שמפרסם הגות ארוכה על בטיחות AI. הדברים נכתבו בזמן שחברות ה-AI המובילות מודות ביותר ויותר מקרים שבהם נראה שאיבדו שליטה על המודלים שלהן, וזמן קצר אחרי שמנכ"ל אנתרופיק, דריו אמודיי, פרסם תוכנית לפיתוח AI זהיר יותר.
עוד פרט שמשך תשומת לב הוא המינוח. נאדלה משתמש לאורך הפוסט במונח "Super Intelligence", ו-TechCrunch ציינו שזה המונח המועדף על ממשל טראמפ לתיאור AI. ב-The Verge הביעו הסתייגות מהבחירה הזאת.
למה זה חשוב
הצהרה כזאת שונה כשהיא מגיעה מראש החברה שהיא אחד הספקים הגדולים של כלי AI לארגונים בעולם, ולא מחוקר בטיחות או מארגון אזרחי. הביטוי "להניח שהמודל נפרץ" שאול ככל הנראה מעולם אבטחת המידע, ומזכיר את גישת "אפס אמון" (zero trust), שבה אף רכיב במערכת לא מקבל אמון אוטומטי.
אם הגישה הזאת תתורגם למוצרים, המשמעות עשויה להיות שינוי בדרך שבה ארגונים מטמיעים סוכני AI, כלומר מערכות שמבצעות פעולות בעצמן ולא רק עונות על שאלות. במצב כזה ייתכן שתיעוד, פיקוח וכפתור עצירה יהפכו לדרישת סף ולא לתוספת. בדיווחים על הפוסט לא פורטו צעדים קונקרטיים שמיקרוסופט עצמה מתכוונת לנקוט, ולכן עדיין לא ברור איך הקריאה הזאת תיראה בפועל.