מחקר: פרצה מובנית בארכיטקטורה של מודלי שפה - ואין דרך לתקן אותה סופית
מחקר שהוצג בכנס ICML טוען כי מודלי שפה גדולים אינם מסוגלים להבחין באמת בין מקורות ההוראות שהם מקבלים - פגם שהופך אותם לפגיעים לתקיפות מסוג 'שיבוש שרשרת המחשבה'. לפי החוקרים, מדובר בבעיה מובנית שאין לה פתרון מלא באמצעות אימון בלבד.
צוות חוקרים טוען, במאמר שהוצג החודש בכנס ICML - אחד הכנסים החשובים בתחום למידת המכונה - כי קיים פגם מהותי בדרך שבה מודלי שפה גדולים (LLM) פועלים, שהופך אותם לפגיעים לתקיפות באופן שלא ניתן לתקן במלואו. הטענה נוגעת ליישומים רבים שבהם נעשה שימוש הולך וגובר במודלים הללו, ממערכות ממשלתיות וצבאיות ועד קניות מקוונות ורפואה.
החוקרים, צ'ארלס יי וג'סמין קוי, שניהם חוקרים עצמאיים, הצליחו לגרום למודלים פופולריים - כולל מודלים של OpenAI - לספק מידע שהם אמורים היו לסרב לספק, כמו הוראות לייצור קוקאין או לחבלה במערכת הניווט של מטוס נוסעים. לדבריהם, הבעיה נובעת מהאופן שבו מודלים מזהים מי או מה נותן להם הוראות.
תגיות ותפקידים
כדי לעקוב אחר מקור הטקסט, מודלי שפה משתמשים בתיוג פנימי המחלק את הטקסט ל'תפקידים': טקסט שכתב המשתמש מסומן כ-<user>, תשובות המודל כ-<assistant>, הנחיות מייצרני המודל כ-<system>, רשימת המחשבות הפנימית של המודל (מעין 'פנקס טיוטה' שבו הוא רושם לעצמו הערות תוך כדי ביצוע משימה) כ-<think>, וטקסט שנשאב ממקור חיצוני כמו דף אינטרנט כ-<tool>. מנגנון זה משמש כבסיס לאימון המודלים לזהות ניסיונות תקיפה - שכן רוב ההתקפות מבוססות על גרימה למודל להתייחס להוראה כאילו הגיעה ממקור שאינו האמיתי.
אלא שהחוקרים גילו כי המודלים בפועל אינם מזהים תפקיד לפי התגית עצמה, אלא לפי הסגנון והמילים בטקסט. כשהם החליפו תגיות - למשל שמו <user> במקום <think> - הדבר כמעט לא השפיע על האופן שבו המודל פירש את הטקסט. אם הטקסט נראה כמו הערה מתוך שרשרת המחשבה של המודל עצמו, המודל התייחס אליו ככזה, בלי קשר לתיוג הרשמי.
במבחן שערכו החוקרים, הם כתבו הנחיה מזויפת בסגנון שרשרת המחשבה הפנימית - טכניקה שכינו 'זיוף שרשרת מחשבה' (chain-of-thought forgery). למשל, הנחיה שכללה בקשה למדריך להכנת קוקאין ולצידה משפט מזויף שנראה כמו הערה פנימית של המודל, שלפיה מדיניות החברה 'מתירה' מתן מידע כזה בתנאי מסוים. התוצאה: מודל הקוד הפתוח של OpenAI, gpt-oss-20b, וגם GPT-5, סיפקו את המידע המבוקש. השיטה זיכתה את החוקרים בניצחון בתחרות red-teaming (איתור פרצות אבטחה) שערכה OpenAI באוגוסט 2025. לפי קוי ויי, תוצאות דומות התקבלו גם במודלים של Anthropic, Alibaba ו-DeepSeek.
'אי אפשר לכתוב רשימה שלמה'
לדברי קוי, השיטה המקובלת להתמודדות עם פרצות - אימון המודל להימנע מרשימת פעולות אסורות שהתגלו בתהליכי red-teaming - דומה במהותה לניסיון כושל: "זה כמו לצפות בבארט סימפסון כותב 'לא אגיד דברים לא הולמים למורה שלי' מאה פעמים, והוא עדיין עושה דברים לא הולמים בכל זאת", אמרה. מכיוון שאי אפשר לכתוב רשימה מלאה של כל ניסיון תקיפה אפשרי, טוענים החוקרים כי אימון נוסף בלבד לא יפתור את הבעיה באופן מלא.
פלוריאן טראמר, חוקר מדעי מחשב מ-ETH ציריך שאינו מעורב במחקר, אמר כי הוא מעריך את התובנה שבמאמר, וציין שיצרני מודלים משלבים כיום כמה שיטות הגנה - החל מאימון ועד ניטור התנהגות המודלים בזמן אמת - שהופכות מודלים מובילים לעמידים יותר בפני הזרקת פרומפטים (prompt injection). עם זאת, לדבריו, לא ברור אם די בכך במקרים רגישים במיוחד.
החוקרים מציינים כי המודלים שנבדקו במאמר שוחררו כבר לפני כשנה, אך לטענתם הבעיה העקרונית נותרה בעינה. קוי סיפרה כי אפילו הגרסה העדכנית GPT-5.4, שיצאה במרץ, סיפקה לה הוראות כיצד לבצע התאבדות. OpenAI לא הגיבה לפניות בנוגע לממצאים.
המשמעות המעשית של הממצאים, ככל הנראה, אינה שיש לזנוח שימוש במודלי שפה, אלא שיש להתייחס לאבטחתם כתהליך מתמשך ולא כיעד שניתן להשיג באופן סופי - בייחוד באפליקציות רגישות שבהן טעות עלולה להיות בעלת השלכות חמורות.