יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מחקר: הטמעת סימני מים בטקסט של מודלי AI עלולה לפגוע בהגנות הבטיחות שלהם

מחקר של חוקרת אבטחה מחברת Lasso Security מראה שהטמעת סימני מים (watermarking) בטקסט שמייצרים מודלי AI — בטכנולוגיית SynthID-Text של גוגל, שAnthropic הודיעה כי תיישם במודלי Claude העתידיים שלה — עלולה לגרום למודלים להפר הנחיות בטיחות, במיוחד מול prompts עוינים. הממצא מעלה שאלות לגבי חברות שמיישמות סימני מים כדי לעמוד בדרישות רגולציה כמו זו של האיחוד האירופי.

מחקר חדש מצביע על כך שהטמעת סימני מים (watermarking) בטקסט שמייצרים מודלי שפה עלולה לגרום להם להפר הנחיות בטיחות שהוטמעו בהם באימון — בעיקר כשהם מותקפים באמצעות prompts עוינים. הממצאים, שפרסמה חוקרת האבטחה אנדראה סיפוסובה מחברת Lasso Security, מדווחים ב-Ars Technica, נוגעים ישירות לטכנולוגיית SynthID-Text של גוגל — מערכת קוד-פתוח ש-Anthropic הודיעה כי תיישם במודלי Claude העתידיים שלה, בעקבות חוק חדש באיחוד האירופי המחייב סימון תוכן שנוצר בידי AI.

איך עובדת הטמעת סימני המים

SynthID-Text פועלת על תהליך בחירת המילה הבאה שמבצע המודל בכל שלב ביצירת טקסט. במקום מחולל מספרים אקראי רגיל, המערכת מזריקה לתהליך מפתח סודי, שמשנה בעדינות אילו מילים נבחרות — למשל, החלפת "מעונן" ב"קודר". מי שמכיר את המפתח יכול לבדוק ברצף המילים את הסבירות שהטקסט נוצר באמצעות אותו מפתח, ובכך לזהות את מקור התוכן. מרכיב מרכזי בשיטה הוא מה שנקרא "tournament sampling": המערכת בוחנת מספר גדול של מועמדים למילה הבאה, מעניקה להם באמצעות המפתח הסודי ציוני הסתברות נסתרים, ומעמידה אותם בתחרות זוגית — כמו טורניר ספורט — עד שנקבע "המנצח" הסופי.

הפרצה שהתגלתה

סיפוסובה בדקה את התצורה "non-distortionary" של SynthID-Text, באמצעות הכלי הלא-מתוקן SynthIDTextWatermarkLogitsProcessor מבית Hugging Face. היא הזינה בקשות פוגעניות לשישה מודלים בקוד פתוח (open-weight), והשוותה את התגובות עם ובלי הטמעת סימני מים. לדבריה, "הטמעת סימני המים משנה את התנהגות הסירוב בבקשות פוגעניות ישירות, אך האפקט בולט הרבה יותר כשאותן בקשות משולבות בטכניקת prompt injection... אצל כמה מודלים, הטמעת סימני המים הופכת את המודל לנוטה יותר לענות על בקשות פוגעניות שבמצב רגיל היה מסרב להן".

בשיחה עם Ars Technica אמרה סיפוסובה: "בהשוואה לאותם מודלים ללא סימני מים, ההתנהגות שלהם בהחלט משתנה — במיוחד בתנאים עוינים, או כשאנחנו גורמים למודלים האלה להפעיל כלים (tools) כשהם משמשים סוכן (agent)... הטמעת סימני מים נועדה להיות בלתי מורגשת לקורא, אבל אנחנו יודעים שכל שינוי במה שהמודל מייצר גורר פשרות שיתבטאו איפשהו".

למה זה חשוב

הממצא מרמז שהשפעת סימני המים אינה מוגבלת לניסוח — היא עשויה להשליך גם על אילו כלים סוכן AI מפעיל, ועל הסבירות שיחשוף מידע רגיש כמו סיסמאות כשהוא מותקף באמצעות prompt injection. ככל הנראה, המשמעות המעשית היא שחברות שמאמצות סימני מים כדי לעמוד בדרישות רגולציה כמו זו של האיחוד האירופי, יצטרכו לבדוק מחדש את התנהגות הבטיחות של המודלים והסוכנים שלהן בתנאי הטמעה — ולא להניח שהוספת השכבה הזו היא ניטרלית מבחינת בטיחות.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות