יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

עליבאבא משחררת את Qwen3.8-Flash-Next: מודל פתוח ורב-מודאלי עם הצצה לארכיטקטורת Qwen4

צוות Qwen של עליבאבא שחרר ב-26 באוגוסט את Qwen3.8-Flash-Next, מודל רב-מודאלי במשקולות פתוחות שנבנה על הארכיטקטורה המתוכננת לסדרת Qwen4. המודל כולל 125 מיליארד פרמטרים אך מפעיל רק 6 מיליארד בכל חישוב, תומך בחלון הקשר של עד מיליון טוקנים, וגרסת הענן שלו תוצע במחיר של 0.16 דולר למיליון טוקני קלט. לפי הדיווח, זמן האימון שלו היה תשיעית מזה של Qwen3.8-27B.

צוות המחקר Qwen של עליבאבא שחרר ב-26 באוגוסט 2026 את Qwen3.8-Flash-Next, מודל שפה רב-מודאלי חדש במשקולות פתוחות (open-weight). לפי הדיווח ב-Gigazine, המודל נבנה על הארכיטקטורה של הדור הבא, זו שמתוכננת לשמש את סדרת Qwen4, ומוצג על ידי החברה כ"הצצה מוקדמת" לאותה ארכיטקטורה. הדגש המרכזי של ההשקה הוא יעילות: ביצועים גבוהים לצד עלויות אימון והרצה נמוכות.

מה בפנים

המספרים שפרסמה Qwen מספרים את הסיפור. למודל 125 מיליארד פרמטרים בסך הכול, אך הוא מפעיל רק 6 מיליארד מהם בכל חישוב, בשיטת Mixture of Experts (MoE) שבה רק חלק מהרשת עובד על כל בקשה. בנוסף, 51 מיליארד פרמטרים מוקדשים למנגנון בשם N-gram Embedding, שמאפשר להרחיב את אוצר המילים שהמודל מסוגל לייצג כמעט ללא תוספת חישוב.

הארכיטקטורה משלבת שני רכיבים נוספים: Gated DeltaNet (GDN) לדחיסה יעילה של היסטוריית השיחה, ו-Qwen Sparse Attention (QSA) שמוזיל משמעותית את מנגנון ה-attention, החלק היקר ביותר בעיבוד טקסטים ארוכים. התוצאה, לפי הבלוג הרשמי של Qwen, היא חלון הקשר של 262,144 טוקנים כברירת מחדל, שניתן להרחיב עד מיליון טוקנים באמצעות טכניקת YaRN.

הנתון הבולט ביותר נוגע למהירות: בעיבוד מיליון טוקנים, שלב ה-prefill (קריאת הקלט לפני תחילת התשובה) מהיר פי 8.6 מזה של Qwen3.7-Plus. בנוסף, Qwen מדווחת שתקופת האימון של המודל הייתה תשיעית מזו שנדרשה ל-Qwen3.8-27B.

מול המתחרים

בטבלת הבנצ'מרקים שפרסמה החברה הושווה המודל ל-Qwen3.8-27B, ל-Qwen3.7-Plus, ל-DeepSeek-V4-Flash-0731 ול-Claude Opus 4.8 (Max) של Anthropic. לפי Gigazine, Qwen3.8-Flash-Next עוקף את Claude Opus 4.8 (Max) במבחנים רבים. ראוי לזכור שמדובר בבנצ'מרקים שפרסמה החברה עצמה, ותוצאות עצמאיות טרם פורסמו.

זמינות ומחיר

המודל זמין להורדה ב-Hugging Face וב-ModelScope. גרסת הייצור, Qwen3.8-Flash, תוצע בקרוב דרך QwenCloud API במחיר של 0.16 דולר למיליון טוקני קלט ו-0.47 דולר למיליון טוקני פלט.

למי שרוצה להריץ את המודל מקומית, חברת Unsloth שחררה כבר ביום ההכרזה גרסה מכווצת (quantized) בפורמט GGUF. לפי Gigazine, הגרסה ב-1 ביט רצה על מחשבים עם 75GB זיכרון RAM ומעלה ושומרת על 80% מהדיוק של המודל המלא. Unsloth טוענת שגם כשהמודל נטען לזיכרון RAM רגיל, ולא לזיכרון של כרטיס המסך, הביצועים נשמרים.

במקביל, בקהילת LocalLLaMA דווח על גרסה נוספת בשם Qwen3.8-Omni-Flash, ככל הנראה הווריאנט של Qwen שמיועד לקלט ופלט של אודיו ווידאו לצד טקסט. פרטים רשמיים על גרסה זו לא נכללו בחומרים שלפנינו, ולכן לא ניתן לאמת את יכולותיה בשלב זה.

למה זה חשוב

המהלך ממשיך מגמה ברורה של עליבאבא: לשחרר מודלים פתוחים חזקים במחירים נמוכים, ובכך להפעיל לחץ על ספקי המודלים הסגורים. אם הנתונים שפרסמה החברה יאומתו בבדיקות עצמאיות, המשמעות היא שמודל שמתחרה במודלי הדגל של Anthropic זמין כעת בחינם להורדה, ובענן במחיר של סנטים בודדים למיליון טוקנים.

חשוב לא פחות, ההשקה מספקת הצצה ראשונה למה שצפוי ב-Qwen4. השילוב של MoE דליל, דחיסת היסטוריה ו-attention חסכוני מרמז שהדור הבא של עליבאבא יתמקד בטיפול יעיל בטקסטים ארוכים מאוד, תכונה שהופכת קריטית ככל שסוכני AI נדרשים לעבד מסמכים שלמים ובסיסי קוד גדולים בבקשה אחת.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות