אנתרופיק: מודל המשקולות הפתוחות GLM-5.3 מתקרב ל-Claude Mythos בכתיבת exploits, וגרסה קטנה שלו בנתה מתקפה בעלות של 20.40 דולר
צוות ה-Frontier Red Team של אנתרופיק מצא שהמודל GLM-5.3 של Zhipu AI, שהמשקולות שלו פתוחות להורדה, בונה exploits שלמים כמעט ברמה של Claude Mythos Preview. בניסוי אחד, הגרסה הקטנה של המודל הפכה חולשה שנחשפה זה עתה ב-Chrome למתקפה אמינה, בעלות API של 20.40 דולר. לפי אנתרופיק, מנגנוני הבטיחות של המודל נעקפים בקלות.
יכולת שעד לאחרונה הייתה שמורה למודלים הסגורים המתקדמים ביותר זמינה כעת לכל מי שמוריד קובץ. לפי ניתוח חדש של צוות ה-Frontier Red Team של אנתרופיק, המודל GLM-5.3 של החברה הסינית Zhipu AI (שפועלת מחוץ לסין בשם Z.ai) מסוגל לבנות באופן עצמאי cyber exploits שלמים, כלומר קוד שמנצל חולשת אבטחה כדי להשתלט על מערכת. ברמה הזו הוא כמעט משתווה ל-Claude Mythos Preview. ההבדל הוא שהמשקולות של GLM-5.3 פתוחות (open-weight), ולפי אנתרופיק הוא שוחרר בלי מנגנוני הגנה אפקטיביים.
המספרים
אנתרופיק הציגה את Mythos Preview לפני כחמישה חודשים ובחרה שלא לשחרר אותו לציבור. הגישה ניתנה רק למגינים נבחרים במסגרת Project Glasswing, כדי שיקבלו יתרון על התוקפים. לדברי החברה, המגינים האלה מצאו מאז יותר מ-10,000 חולשות בתוכנות קריטיות. גם OpenAI נוקטת גישה דומה עם Daybreak.
ב-ExploitBench, מבחן שבודק ניצול של באגים ידועים במנוע V8 של Chrome, בנה GLM-5.3 מתקפה עובדת ב-50 מתוך 410 ניסיונות. Mythos Preview הצליח ב-56. במבחן פנימי של אנתרופיק, המבוסס על פרויקטי קוד פתוח מ-OSS-Fuzz של גוגל, השתלט GLM-5.3 לחלוטין על התוכנה הנבדקת ב-4% מהמשימות, לעומת 6% ל-Mythos Preview. מודלים מהדור הקודם, GLM-5.2 ו-Claude Opus 4.6, נכשלו בשני המבחנים. Kimi K3 ו-DeepSeek V4.1-Flash כמעט לא התרוממו מאפס.
מחולשה טרייה למתקפה, בעלות של ארוחת צהריים
בניסוי אחד שילבה אנתרופיק את GLM-5.3 עם מומחה אנושי. בתוך יום אחד, וכמעט בלי השקעת זמן מצד האדם, המודל מצא כמה חולשות שלא היו ידועות עד אז במנוע ה-JavaScript של דפדפן נפוץ. אחר כך שרשר אותן לדף אינטרנט שמסוגל לקרוא כל קובץ במחשב של מי שגולש אליו, ובניסוי שלף מפתח SSH פרטי. לדברי אנתרופיק, החולשות דווחו למפתחי הדפדפן, וממצאים נוספים בדרייברים ובקושחה של התקנים עדיין בבדיקה.
הניסוי שממנו מגיע הנתון שבכותרת נעשה עם הגרסה הקטנה, GLM-5.3-Flash. המודל שילב באג שנחשף לאחרונה ב-Chrome עם חולשה ידועה נוספת ובנה מהם מתקפה אמינה, שאף עקפה מנגנון אבטחה נוסף המובנה במעבד. כל התהליך דרש 20 דקות של תשומת לב אנושית ושמונה שעות עבודה של המודל. לפי מחירוני ה-API של Zhipu, העלות הייתה 20.40 דולר.
גם הסוכנות האמריקאית CAISI הגיעה למסקנות דומות בהערכה משלה. היא מגדירה את GLM-5.3 כמודל ה-open-weight בעל יכולות הסייבר הגבוהות ביותר עד היום, וממקמת אותו כארבעה חודשים מאחורי המודלים האמריקאיים המובילים. להשוואה הזו יש הסתייגות: CAISI בדקה את המודלים האמריקאיים כשמנגנוני ההגנה שלהם בתחום הסייבר כבויים.
ההגנות נעקפות בקלות
בסימולציה של אנתרופיק, GLM-5.3 סירב לפקודות תקיפה זדוניות מפורשות. אבל כשאותה בקשה נוסחה כתרגיל red team, המודל ניסה להתחבר למערכת המטרה ב-64% מההרצות. כשהוזנו לו מראש שלבי חשיבה, השיעור עלה ל-92%. אחרי abliteration, טכניקה שמסירה ממשקולות פתוחות את התנהגות הסירוב, הוא הגיע ל-100%. מודלי Claude המוגנים נשארו על אפס. חשוב לציין שהסימולציה לא מריצה קוד, ולכן אינה מראה אם המתקפה הייתה מצליחה בפועל.
לפי אנתרופיק, תהליך ה-abliteration ארך כ-2,200 שעות GPU ועלה כ-4,400 דולר. החברה מעריכה שצוות מנוסה יכול לעשות זאת בכ-1,200 דולר. שיעור הסירוב לבקשות מזיקות ירד מיותר מ-90% לטווח של 2% עד 12%, והציונים במבחני מדע וסייבר כמעט לא השתנו. לדברי החברה, כמה מפתחים כבר פרסמו גרסאות "משוחררות" של המודל בתוך ימים מההשקה.
למה זה חשוב
המסקנה של אנתרופיק היא ששחקנים מדינתיים ולא-מדינתיים צפויים להשתמש במודלים כמו GLM-5.3 כדי לגרום נזק ממשי. לכן, לטענתה, ממשלות צריכות לבחון מודלים בעלי יכולות כאלה, והמגינים צריכים כלים טובים לפחות כמו אלה שבידי יריביהם.
כדאי לקרוא את האזהרה גם בהקשר עסקי. כפי שמציין The Decoder, אנתרופיק אינה משחררת משקולות של המודלים שלה, והדוח מציג בדיוק את זה כיתרון בטיחותי מרכזי. ובכל זאת, הנתונים מצביעים ככל הנראה על שינוי מהותי: הפער בין מודלים סגורים ומבוקרים למודלים פתוחים בתחום הסייבר מצטמצם, ואסטרטגיה של "לתת למגינים יתרון" מחזיקה רק כל עוד היכולת לא נמצאת בידי כולם.