GLM-5.3 Flash: מודל פתוח שמפעיל רק חלק קטן מעצמו, ועדות לא מאומתת על שימוש בו בקוד בייצור
חברת Z.ai הסינית שחררה את GLM-5.3-Flash כמודל עם משקולות פתוחות. לדבריה, הוא זול פי 10 להרצה מהדור הקודם. מפתח שלא נחשף בשמו טוען שבחברה שבה הוא עובד משתמשים במודל במקום במודלי החזית לעבודת קוד יומיומית, בפרויקטים של מיליוני שורות. העדות הזאת עדיין לא אומתה.
חברת Z.ai הסינית (Zhipu AI) שחררה בסוף אוגוסט את GLM-5.3-Flash. זהו מודל שפה (LLM) שהמשקולות שלו פתוחות להורדה, ולפי החברה הוא זול פי 10 להרצה מהמודל של הדור הקודם. עכשיו מגיעות העדויות הראשונות על שימוש בו בעבודת פיתוח אמיתית, אבל בשלב זה הן עדיין לא מאומתות.
מ-Ox Alpha ל-GLM-5.3-Flash
המודל הופיע לראשונה בשם הקוד Ox Alpha. פלטפורמת OpenRouter, שמציעה גישה למודלי שפה רבים, השיקה גרסה חינמית שלו ולא חשפה מי פיתח אותו. המהלך משך תשומת לב רבה בתעשייה, ומשתמשים החלו לשער שמאחוריו עומדת Z.ai. ב-26 באוגוסט החברה אישרה זאת והעלתה את המשקולות ל-Hugging Face.
למרות הכינוי Flash, זה לא מודל זעיר. הוא בנוי בארכיטקטורת mixture of experts, כלומר מחולק לתתי-רשתות "מומחיות", ורק חלק מהן מופעל בכל בקשה. מתוך 320 מיליארד פרמטרים בסך הכול, כל תשובה מפעילה רק 18 מיליארד. המודל יכול לקבל קלט של עד מיליון טוקנים, שכולל טקסט, תמונות ווידאו, ולהחזיר תשובות באורך של עד 131,072 טוקנים.
איך מורידים את העלות
השינוי המרכזי הוא במנגנון ה-attention, החלק במודל שמזהה את הפרטים החשובים בפרומפט. במקום לבדוק כל טוקן מול כל טוקן אחר, המודל משתמש ב-sparse attention ובוחן רק את הטוקנים הרלוונטיים ביותר. בנוסף הוא משתמש ב-linear attention: בדרך כלל, כשאורך הפרומפט מוכפל, צריכת הזיכרון של מנגנון ה-attention גדלה פי ארבעה. בשיטה הזו היא גדלה רק פי שניים. המודל אומן על 30 טריליון טוקנים.
Z.ai השוותה את המודל ל-Claude Opus 4.8, ל-GPT-5.6 Terra ול-Gemini 3.7 Flash. לפי החברה, הוא השיג את הציון הגבוה ביותר ב-GDPval-AA v2, מבחן של עבודת ידע, ודורג שני ב-AutomationBench, שבודק ביצוע משימות באפליקציות ענן. אלה השוואות שהחברה עצמה ערכה, והדיווח על ההשקה לא כולל תוצאות במבחני קוד ייעודיים.
עדות מהשטח, בינתיים לא מאומתת
מפתח שלא פרסם את שמו כתב שבחברה שבה הוא עובד משתמשים ב-GLM-5.3 Flash לעבודת הפיתוח היומיומית, בפרויקטים שמסתכמים במיליוני שורות קוד, ולא נעזרים במודלי החזית. לדבריו המודל מהיר מאוד, מתמודד היטב עם מאגרי קוד גדולים ומבין את הארכיטקטורה הקיימת. שם החברה לא נמסר ולא הוצגו נתונים, ולכן מדובר בעדות אישית בלבד.
הצל של סדרת GLM-5.3
הסדרה כולה נמצאת תחת זרקור ביטחוני. דוח של אנתרופיק מ-29 בספטמבר עוסק במודל המלא GLM-5.3, ולא בגרסת ה-Flash. לפי הדוח, המודל המלא מסוגל לפתח exploits (קוד שמנצל פרצות אבטחה) מקצה לקצה: הוא הצליח ב-50 מתוך 410 ניסיונות, לעומת 56 של Claude Mythos Preview. במבחנים מדומים של אנתרופיק, שיטות פשוטות עקפו את מנגנוני ההגנה שלו ב-64% עד 100% מהמקרים. גם CAISI, מרכז התקינה לבינה מלאכותית של NIST האמריקאי, הגדיר את GLM-5.3 כ"מודל המשקולות הפתוחות בעל יכולות הסייבר הגבוהות ביותר שפורסם עד כה". לפי המרכז, הוא מפגר אחרי החזית האמריקאית בכארבעה חודשים.
המשמעות
אם עדויות כמו זו יאומתו, ייתכן שחברות יוכלו להריץ עבודת קוד בהיקף גדול על מודל פתוח בתשתית שלהן, ולא לשלם על API של מודלי חזית. יתרון נוסף הוא שהקוד לא יוצא מהארגון. עם זאת, הנתונים שפורסמו עד כה מגיעים בעיקר מהחברה המפתחת ומעדות אנונימית אחת. מי ששוקל לאמץ את המודל צריך ככל הנראה לבדוק אותו בעצמו, על הקוד שלו, וגם לשקול את השאלות הביטחוניות שעולות סביב הסדרה.