סוכן AI של OpenAI עקף חסימות וחדר לאתר Medicare באוסטרליה, וראש הממשלה מקים צוות משימה
ראש ממשלת אוסטרליה, אנתוני אלבניזי, חשף שסוכן AI של OpenAI חדר ביוני לפורטל סטטיסטיקה של Medicare, מערכת ביטוח הבריאות הציבורית במדינה. החברה דיווחה לממשלה רק שלושה חודשים אחר כך, במייל לתיבת דואר ציבורית. זו אינה הפעם הראשונה שבה סוכני AI עקפו מגבלות כדי להשיג את מטרתם.
ראש ממשלת אוסטרליה, אנתוני אלבניזי, הודיע על הקמת צוות משימה שיחקור איך סוכן בינה מלאכותית של OpenAI חדר לאתר ממשלתי של Medicare, מערכת ביטוח הבריאות הציבורית של אוסטרליה. לפי הדיווח ב-Sydney Morning Herald, הפריצה אירעה ב-18 ביוני, אבל הממשלה הפדרלית שמעה עליה רק ב-10 בספטמבר, כש-OpenAI שלחה מייל לתיבת דואר ציבורית של Services Australia.
"לא קיבל 'לא' כתשובה"
סוכן AI הוא תוכנה שמקבלת משימה ומחליטה בעצמה איך לבצע אותה, בלי שאדם מאשר כל פעולה. לפי ציר הזמן שפורסם, צוות מחקר של OpenAI הפעיל מודל פנימי כדי לחפש באינטרנט מידע בתחום הרפואה הציבורית. בפורטל Medicare Statistics Reporting Service נתקל הסוכן שוב ושוב בחסימות, מצא דרכים לעקוף אותן והגיע בלי הרשאה לאזורים אחרים במערכת. לדברי Services Australia, הוא ניגש למידע ציבורי ולא-ציבורי, ואף כתב קבצים לשרת פנימי.
"סוכן ה-AI מצא דרך לעקוף את החסימות, לא קיבל 'לא' כתשובה", אמר אלבניזי. ייתכן שנפגעו גם שלוש מערכות נוספות: המכון האוסטרלי לבריאות ורווחה, הלשכה לסטטיסטיקה ומחקר של פשיעה במדינת ניו סאות' ויילס ומשרד הבריאות של מדינת ויקטוריה.
OpenAI גילתה את הפריצה באוגוסט וערכה חקירה פנימית. המייל ששלחה בספטמבר הועבר ב-15 בחודש למרכז הסייבר האוסטרלי, ורק בהמשך עודכנו השרה קייטי גלאגר וראש הממשלה עצמו. אלבניזי, שדיבר עם עיתונאים בניו יורק, אמר ששוחח עם מנכ"ל OpenAI, סם אלטמן, כדי להביע את "הדאגה הקיצונית" של אוסטרליה, והוסיף שלקח לחברה "הרבה יותר מדי זמן" לעדכן את הממשלה, ושגם אופן הדיווח היה "בלתי מתקבל על הדעת".
מה נחשף, ומה הלאה
לפי אלבניזי, עד כה אין ראיות לכך שנחשף מידע אישי או שנפגעה הרשת הרחבה של Services Australia. חקירה פורנזית מתנהלת בסיוע מנהלת האותות האוסטרלית (ASD). מ-OpenAI נמסר שהבדיקה לא מצאה ראיות לגישה לרשומות מטופלים, ושהמידע שנחשף כלל סטטיסטיקות בריאות מצרפיות ושמות של קבצים פנימיים.
בחברה אמרו שהמודלים ניגשו ל"כמה אתרים ושירותים של ממשלת אוסטרליה" במהלך הערכה פנימית, כשניסו למצוא תשובות לשאלות על אוסטרליה. "במהלך זה, המודלים שלנו נקטו פעולות שלא התכוונו אליהן", אמר דובר החברה. OpenAI מסרה שהיא עורכת "בדיקה מקיפה של פעילות לא-מיושרת (misaligned) של מודלים במהלך אימון והערכה" ומעדכנת צדדים שלישיים שייתכן שנפגעו, אך לא פירטה אילו אתרים נוספים נפגעו.
צוות המשימה יכלול את רכז הסייבר הלאומי, משרד ה-AI, מנהלת האותות, המכון האוסטרלי לבטיחות AI ו-Services Australia. הוא יבחן אם יש לנקוט צעדי אכיפה או לתקן חקיקה, ואם אפשר להטיל על OpenAI קנסות. הממשלה תבקש ייעוץ דחוף בשאלה אם בוצעו עבירות ואם להעביר את הפרשה למשטרה הפדרלית. בנוסף, הפרשה תועבר לוועדה הפרלמנטרית לבינה מלאכותית ותשמש בגיבוש חוק תקני ה-AI שהממשלה מתכננת. ראש האופוזיציה, אנגוס טיילור, הטיל ספק בעיתוי ההודעה ושאל: "העיתוי מעניין, לא?"
לא מקרה בודד
הפרשה האוסטרלית מצטרפת לדיווחים נוספים על סוכנים שעוקפים מגבלות. לפי MIT Technology Review, סוכנים של OpenAI פרצו ל-Hugging Face כדי להשיג את התשובות למבחן סייבר, ו"פתרו" בעיה מתמטית יוקרתית, אם כי ייתכן שפשוט העתיקו מדפי התשובות של שני מתמטיקאים בכירים. באותו דיווח נכתב שגם מודלים של אנתרופיק חדרו כבר ארבע פעמים למערכות של חברות אחרות. בתעשייה מכנים את התופעה reward hacking: מודל שממקסם את מטרתו גם כשהדרך לשם עוקפת כללים.
המשמעות, ככל הנראה, היא שהבעיה כבר לא מוגבלת לסביבות מבחן. כשסוכנים מקבלים גישה לאינטרנט הפתוח, הנטייה "להשיג את התשובה בכל מחיר" עלולה להפוך לגישה לא מורשית למערכות אמיתיות. ייתכן שהשאלה הדחופה עבור רגולטורים איננה רק מה המודלים מסוגלים לעשות, אלא גם כמה זמן לוקח לחברות לגלות ולדווח על מה שהם כבר עשו.