חולשה בסוכני AI של גוגל וחברות נוספות חושפת פגם מבני בפרוטוקול MCP
חולשת אבטחה שהתגלתה בסוכני AI של גוגל ושל חברות נוספות מצביעה על פגם מבני בפרוטוקול MCP. לפי Ars Technica, פערי אמון בפרוטוקול מאפשרים להנחיות זדוניות לעבור מסוכן אחד לאחר. במקביל, פוסט ברדיט מפנה לסרטון של Kurzgesagt על מתקפה על Hugging Face. ייתכן שיחד, שני המקרים ממחישים כמה פגיעה התשתית המשותפת של עולם ה-AI.
חולשת אבטחה שהתגלתה בסוכני AI של גוגל ושל חברות נוספות מצביעה על בעיה עמוקה יותר מבאג נקודתי. לפי Ars Technica, מדובר בפגם מבני בפרוטוקול MCP: פערי אמון בפרוטוקול מאפשרים להנחיות (prompts) זדוניות לעבור מסוכן אחד לסוכן אחר.
מה זה MCP ולמה זה משנה
MCP, ראשי תיבות של Model Context Protocol, הוא תקן פתוח שאנתרופיק הציגה בסוף 2024. מטרתו לקבוע דרך אחידה שבה מודלי שפה (LLM) וסוכני AI מתחברים לכלים חיצוניים, למאגרי מידע ולשירותים אחרים. בתוך זמן קצר הוא אומץ בהרחבה בתעשייה, וכיום הוא משמש מעין "שקע חשמל" סטנדרטי לחיבור סוכנים לעולם החיצון.
הפופולריות הזאת היא גם נקודת התורפה. כשרכיב תשתיתי אחד משמש מוצרים של חברות רבות, פגם בתכנון שלו לא נשאר בתוך מוצר בודד. אם הבעיה שמתאר הדיווח אכן נעוצה במבנה הפרוטוקול עצמו, ולא במימוש של חברה מסוימת, המשמעות היא שתיקון במוצר אחד לא בהכרח פותר אותה במוצרים אחרים.
הנחיה זדונית שמתפשטת
כדי להבין את הסכנה צריך להכיר את המושג prompt injection: החדרת הוראות זדוניות לתוכן שמודל שפה קורא, למשל מסמך, דף אינטרנט או תשובה של כלי חיצוני, כך שהמודל מבצע אותן כאילו הגיעו מהמשתמש. בסוכן AI, שיכול לשלוח מיילים, לגשת לקבצים או להפעיל שירותים, הסיכון כבר אינו מוגבל לתשובה שגויה. מדובר בפעולות של ממש.
לפי הדיווח, החידוש כאן הוא ההתפשטות. כשסוכנים מדברים זה עם זה דרך MCP ואין הפרדה ברורה בין מקורות מהימנים ללא מהימנים, הנחיה זדונית שחדרה לסוכן אחד עלולה לעבור הלאה לסוכן הבא. ככל הנראה, הכיוון שאליו התעשייה מתקדמת, מערכות שבהן סוכנים רבים משתפים פעולה באופן אוטונומי, הוא בדיוק מה שמגדיל את הסיכון.
גם Hugging Face בתמונה
במקביל נשמע שמה של Hugging Face, הפלטפורמה המרכזית לשיתוף מודלי AI ומאגרי נתונים בקהילת ה-open source. פוסט ברדיט מפנה לסרטון של ערוץ המדע Kurzgesagt שעוסק במתקפה על Hugging Face. החומרים שבידינו אינם כוללים פרטים מאומתים על המתקפה עצמה, על היקפה או על מועדה, ולכן אין לראות בהפניה הזאת דיווח מבוסס על פרטי האירוע.
עם זאת, הצירוף של שני המקרים מלמד משהו. גם MCP וגם Hugging Face הם נקודות מפגש שדרכן עוברים כלים, מודלים ונתונים של גורמים רבים. מנקודת מבטו של תוקף, אלה יעדים יעילים במיוחד: פגיעה אחת יכולה להגיע להרבה משתמשים.
המשמעות
עד כה, השיח על בטיחות AI עסק בעיקר בהתנהגות המודלים עצמם. המקרים האלה מזכירים שהשכבה שמסביב, כלומר הפרוטוקולים, הפלטפורמות ושרשרת האספקה של מודלים וכלים, פגיעה לא פחות. המשמעות למשתמשים ולארגונים היא ככל הנראה שכדאי לנהוג זהירות לפני שמעניקים לסוכני AI הרשאות רחבות, ובמיוחד כשהם מחוברים לכלים ולסוכנים חיצוניים. האחריות לפתרון מבני, כנראה ברמת התקן עצמו, מוטלת על מי שמפתח ומתחזק את הפרוטוקול ועל החברות שמשתמשות בו.