אנתרופיק: GLM-5.3 הצליח להשתלט על זרימת הריצה של תוכנות ב-4% מהניסיונות – סף חדש ביכולות תקיפה של מודלי AI
צוות ה-Frontier Red Team של אנתרופיק מדווח שהמודל GLM-5.3 הצליח לבצע השתלטות מלאה על זרימת הריצה של תוכנות ב-4% מהניסיונות במבחן פנימי לניצול חולשות בקוד בינארי, לעומת 6% של Claude Mythos Preview. המספרים עדיין נמוכים, אבל לפי אנתרופיק נחצה "סף משמעותי": מודלים מהדור הקודם לא הצליחו באף משימה.
צוות ה-Frontier Red Team של אנתרופיק, הצוות שבודק אילו יכולות מסוכנות יש למודלים המתקדמים, פרסם ממצאים שלפיהם מודלי שפה מתחילים להצליח במשימה מתקדמת בתחום הסייבר ההתקפי: השתלטות מלאה על זרימת הריצה של תוכנה (control flow hijack). המחקר, שכותרתו "GLM-5.3 and the spread of advanced cyber capabilities", בדק כמה מודלים על 100 משימות שנבחרו באקראי ממבחן פנימי של החברה לניצול חולשות בקוד בינארי (Binary Exploitation).
המספרים
על פי הממצאים, כפי שצוטטו בבלוג של סיימון וויליסון, GLM-5.3 הגיע להשתלטות מלאה על זרימת הריצה ב-4% מהניסיונות. Claude Mythos Preview, המודל של אנתרופיק עצמה, הצליח ב-6%. מודלים מוקדמים יותר, כמו Claude Opus 4.6 ו-GLM-5.2, לא הצליחו באף אחת מהמשימות.
אנתרופיק מסכמת: "אף ש-GLM-5.3 מציג ביצועים נמוכים מאלה של Claude Mythos Preview, ברור שנחצה כאן סף משמעותי".
מה זה בעצם אומר
ניצול חולשות בקוד בינארי הוא אחד התחומים הקשים באבטחת מידע. החוקר או התוקף עובד מול תוכנה מהודרת, בלי קוד המקור שלה, מחפש בה פגם ובונה סביבו מתקפה. השתלטות על זרימת הריצה פירושה שהתוקף מכתיב לתוכנה איזה קוד להריץ. בדרך כלל זה השלב שבו מציאת באג הופכת למתקפה ממשית.
שיעורי הצלחה של 4% ו-6% נשמעים נמוכים, ובמובן מסוים הם באמת נמוכים. אבל מה שחשוב כאן הוא הכיוון. המעבר מאפס הצלחות לשיעור הצלחה כלשהו מסמן, ככל הנראה, את הנקודה שבה יכולת עוברת מתיאוריה למציאות. מספיק שמודל מצליח לפעמים: כשאפשר להריץ אותו שוב ושוב, בעלות נמוכה ובאופן אוטומטי, גם סיכוי נמוך לכל ניסיון בודד יכול להצטבר לתוצאה ממשית.
למה דווקא GLM
כותרת המחקר מדברת על "התפשטות" של יכולות סייבר מתקדמות, וזו כנראה הנקודה המרכזית. סדרת GLM מפותחת בסין, ופרסום של סיימון וויליסון משייך את הידיעה לנושא ה-AI בסין. המשמעות, ככל הנראה, היא שיכולת שעד לאחרונה נמדדה רק במודל חזיתי של מעבדה אמריקאית מופיעה עכשיו גם אצל מפתח נוסף, בפער לא גדול. ההבדל בין 4% ל-6% קטן בהרבה מההבדל בין 0% ל-4%.
אם זה המצב, קשה יותר להגביל את היכולות האלה רק באמצעות מדיניות השימוש של חברה אחת. היכולות מתפשטות בתעשייה כולה, ואיתן השאלה מי יכול להשתמש בהן ולאיזו מטרה.
המשמעות
הממצאים מעלים שתי שאלות לתעשיית הסייבר. הראשונה נוגעת לצד המגן: אותן יכולות יכולות לשמש גם חוקרי אבטחה שמחפשים חולשות לפני התוקפים. השנייה נוגעת לצד התוקף: ככל שהיכולת זמינה יותר, סף הכניסה לפיתוח מתקפות מתקדמות צפוי לרדת.
במחקר עצמו מדובר במבחן פנימי של אנתרופיק על מדגם של 100 משימות, והנתונים שפורסמו לא מאפשרים לדעת עד כמה התוצאות משקפות מערכות אמיתיות. אבל הכיוון ברור: אנתרופיק, שמפתחת בעצמה את אחד המודלים שנבדקו, בחרה להגדיר את התוצאה כחציית סף ולא כסטייה סטטיסטית.