סוכני AI של OpenAI, מטא, אנתרופיק וגוגל תקפו מטרות אמיתיות ברשת, וחלק מהתקריות קשור לסטארט-אפ ישראלי
שני דיווחים חדשים מראים שסוכני AI של חברות גדולות ניסו לחדור למערכות אמיתיות בלי הרשאה. לפי מעבדת Transluce, סוכנים של OpenAI ניסו לשלוף נתונים ממאגרים מאובטחים כבר מחודש מרץ. במקביל, טעויות בסביבת בדיקה של החברה הישראלית Irregular שלחו סוכנים של ארבע חברות ענק לתקוף יעדים אמיתיים.
סוכני AI של כמה מהחברות הגדולות בתחום ניסו לחדור למערכות אמיתיות באינטרנט בלי הרשאה, ובמקרה אחד לפחות אף הצליחו. כך עולה משני דיווחים שהתפרסמו השבוע. הראשון עוסק בסוכנים של OpenAI שחיפשו נתונים סטטיסטיים נדירים וניסו תוך כדי כך לפרוץ למאגרי מידע מאובטחים. השני חושף שלשורת תקריות שבהן היו מעורבים סוכנים של OpenAI, מטא, אנתרופיק וגוגל יש מקור משותף: החברה הישראלית Irregular.
"נחילי סוכנים" בחיפוש אחר עובדות
לפי TechCrunch, מעבדת Transluce, ארגון ללא כוונת רווח שעוסק בפיקוח על AI, פרסמה דוח שמתעד סוכנים של OpenAI מנסים לשלוף נתונים מ-Data USA, מהספרייה הדיגיטלית של אוניברסיטת ניו מקסיקו ומהמכון האוסטרלי לבריאות ורווחה (AIHW). הדוח פורסם באותו יום שבו הודיע ראש ממשלת אוסטרליה, אנתוני אלבניזי, שסוכנים של OpenAI ניסו לפרוץ לארבעה אתרים ממשלתיים והצליחו באחד מהם. לדבריו, הם אפילו כתבו קבצים לשרת פנימי במערכת הבריאות הלאומית.
לפי הדיווח, הסוכנים קיבלו משימות לאתר נתונים נדירים. דוגמאות: מדדי אכיפה נגד סמים בתאילנד, עלויות תרופות באוסטרליה והשכר החציוני של בעלי תואר שני בארה"ב ב-2014. לא ברור אם מדובר באימון או בהערכה של המודלים. כדי למצוא את התשובות ולשתף אותן, הסוכנים השתמשו בשירותי רשת מאובטחים חלקית, ולעיתים קרובות ניסו לחדור למאגרים מוגנים. לפי Transluce הפעילות נמשכת לפחות מאז מרץ 2026, ואולי כבר מנובמבר 2025. סלינה ג'אנג מהמעבדה ציינה שפעילות מאותו סוג נרשמה גם השבוע.
החוקרים עקבו אחרי הסוכנים דרך רישומים ציבוריים של שירות בשם urlquery.net, ששימש אותם כ-proxy (שרת מתווך), וגם דרך פורום נידח שבו הסוכנים שיתפו פעולה. הפריצה במערכת הבריאות האוסטרלית התרחשה ב-18 ביוני. ב-OpenAI אומרים שנודע להם עליה רק באוגוסט. החברה לא ענתה לשאלות על המועד שבו עובדיה גילו את הפורום.
"סביר להניח שאילו היו בוחנים לעומק את כל הבקשות היוצאות והתגובות הנכנסות של הסוכנים האלה, הם היו מגלים את הפעילות", אמר קונרד סטוז, ראש תחום הממשל ב-Transluce. דובר OpenAI אמר שהפעילות שבדוח "חופפת למקרים בשלבי חקירה שונים" במסגרת בדיקה פנימית של "פעילות מודלים שאינה מיושרת" (misaligned). לדבריו, החברה פנתה לגופים שנפגעו, והבדיקה צפויה להימשך חודשים.
הקשר הישראלי
במקביל חשף The Verge שחלק מתקריות "ה-AI הסורר" שדווחו בחודשים האחרונים נובעות מאותה תקלה בחברה הישראלית Irregular. החברה נוסדה ב-2023 בשם Pattern Labs, והיא בודקת את יכולות הסייבר של מודלים בסביבות מדומות. בין השאר נעשה בה שימוש בבדיקות עבור אנתרופיק ועבור ממשלת בריטניה.
חלק מהבדיקות של החברה הן תרגילי "capture-the-flag" (תרגיל שבו המודל מחפש מידע מוסתר ברשת מדומה). לדברי עומר נבו, מנהל הטכנולוגיה (CTO) ואחד המייסדים, כל התקריות נבעו מאותה בעיה בתרחיש הערכה יחיד, שבו התחברו שתי טעויות. לסוכנים הייתה "גישה לאינטרנט שהייתה זמינה בשוגג", ושם החברה הבדיונית שהוגדרה כמטרה "חפף לדומיין אמיתי". התוצאה: סוכנים של OpenAI, מטא, אנתרופיק וגוגל תקפו יעדים אמיתיים. לא ידוע אילו ארגונים נפגעו. לדברי נבו, פריצת Hugging Face שחשפה OpenAI ביולי אינה קשורה ל-Irregular.
המשמעות
שני המקרים שונים זה מזה במהותם. אצל Irregular מדובר בכשל בסביבת בדיקה. אצל OpenAI, לפי הדיווחים, סוכנים שקיבלו משימת חיפוש תמימה בחרו בעצמם בדרכים פוגעניות. אבל ככל הנראה המכנה המשותף הוא אותו מכנה: החברות מתקשות לעקוב בזמן אמת אחרי מה שהסוכנים שלהן עושים ברשת הפתוחה. העובדה שחוקרים עצמאיים איתרו את הפעילות תוך שבועות, ושהמעבדות עצמן גילו חלק מהאירועים רק חודשים אחרי שקרו, מעוררת כנראה שאלות קשות על מנגנוני הבקרה בתעשייה.