Alibaba שחררה גרסה מעודכנת של מודל השפה Qwen3.8-Max, תחת השם Qwen3.8-Max-0902, עם 2.4 טריליון פרמטרים וחלון הקשר של מיליון טוקנים, לאחר אימון נוסף בתחומי קוד ועבודה משותפת. במקביל, דיווח משתמש בפורום r/LocalLLaMA מתאר קשיים בעריכות קוד קטנות מול הגרסה הקודמת, 3.6.
חברת Alibaba שחררה גרסה מעודכנת למודל השפה שלה, Qwen3.8-Max, תחת השם Qwen3.8-Max-0902 — כך עולה מהודעה שפורסמה בפורום r/LocalLLaMA ב-Reddit. המודל כולל 2.4 טריליון פרמטרים וחלון הקשר (context window) של עד מיליון טוקנים. לפי ההודעה, הוא עבר אימון נוסף בתחומי הקוד (Coding) ועבודה משותפת (Cowork), במטרה לחזק את הביצועים בשני התחומים.
תוך ימים ספורים מהשחרור עלה באותה קהילה דיון נפרד, שבו משתמש שעבד עם המודל כשבוע ימים בעבודתו השוטפת מתאר תמונה מורכבת יותר. בכותרת הפוסט הוא מציין ששקל לחזור לגרסה הקודמת, 3.6, ומסכם את חוויתו במשפט: "Qwen 3.8 is a damn good coder, but a terrible collaborator" ("קוואן 3.8 הוא מתכנת טוב מאוד, אבל שותף לעבודה גרוע").
לדברי המשתמש, הבעיה המרכזית מתעוררת דווקא במשימות עריכה קטנות: בקשה לשינוי שאמור להסתכם בשתי שורות קוד (במסגרת מה שמכונה בעגה המקצועית "PR", pull request) מניבה מהמודל שינוי של כמאה שורות, בסגנון שמזכיר עיבוד אוטומטי של linter — כלי לבדיקת ואכיפת סגנון קוד. לפי התיאור, המודל מתקשה לשמר סגנון קוד קיים: כאשר מוזן לו סקריפט עם מוסכמות שמות ומבנה מסוימות, הגרסה הקודמת, 3.6, הייתה מבצעת שינויים קטנים המתאימים למבנה הקיים בפעולה אחת. לעומת זאת, 3.8, כך נטען, נוטה להוסיף קוד שנראה מתקדם יותר — כולל טיפול בשגיאות (error handling) ובדיקות טיפוסים מחמירות (strict type checks) — גם כשמדובר בפעולה פנימית שאינה דורשת זאת.
הפער בין הודעת השחרור הרשמית לבין הדיווח מהשטח ממחיש דילמה מוכרת בתחום מודלי הקוד: שיפור ביכולת לייצר קוד "תקין" מבחינה טכנית לא בהכרח מתורגם לשיפור בעבודה שיתופית עם מפתחים אנושיים, שבה שמירה על סגנון וקונבנציות קיימות חשובה לא פחות מנכונות הפתרון עצמו. ככל הנראה, צוותי פיתוח שמשלבים מודלי שפה בזרימת עבודה יומיומית — ולא רק במשימות כתיבה חד-פעמיות — יצטרכו לשקול איזון בין דור מודלים "חכם" יותר לבין דור שמתנהג בצורה צפויה וממושמעת יותר בתוך קוד בסיס קיים.
יצוין כי שני המקורות הם דיווחים מקהילת Reddit ולא בנצ'מארקים רשמיים או נתונים שפרסמה Alibaba עצמה, כך שהיקף התופעה בקרב כלל המשתמשים אינו ידוע, ואין בנמצא נתוני השוואה כמותיים בין הגרסאות.