Xiaomi משדרת בשידור חי את אימון MiMo 2.6, שבועות אחרי שיא מהירות ההסקה של הדור הקודם
Xiaomi פתחה לציבור לוח מעקב חי אחרי שלב ה-post-training של הדור הבא של מודלי MiMo, V2.6 Pro ו-Flash, על פי דיווחים בקהילת המפתחים. המהלך מגיע חודשים ספורים אחרי שהחברה הכריזה על מצב UltraSpeed למודל MiMo-V2.5-Pro, שלטענתה חצה 1,000 טוקנים בשנייה על GPU רגיל. הצירוף של שקיפות תהליכית וקצב שדרוגים מהיר מציב את Xiaomi כמתחרה סינית שכדאי לעקוב אחריה.
Xiaomi, שרוב הציבור מכיר בעיקר בזכות הטלפונים והקורקינטים שלה, מנסה למצב את עצמה גם כשחקנית רצינית בעולם המודלים הפתוחים. לפי דיווחים שהופצו בקהילת המפתחים r/LocalLLaMA, החברה משדרת בשידור חי לוח מעקב אחרי שלב ה-post-training של שני מודלים חדשים: MiMo-V2.6-Pro ו-MiMo-V2.6-Flash. Post-training הוא השלב שאחרי האימון הבסיסי, שבו המודל מלוטש בדרך כלל באמצעות למידת חיזוק (RL) ונתוני הוראות, והוא זה שקובע במידה רבה איך המודל מתנהג בפועל מול משתמשים.
חשוב לסייג: הדיווח על השידור החי מגיע כרגע מפוסטים של משתמשים, ולא מהודעה רשמית שנבדקה. אחד המשתמשים העריך, על סמך הנתונים שהוצגו בלוח, שעלות האימון מסתכמת בכ-10 דולר לשנייה, אבל זו הערכה לא מאומתת ואין לה אישור מ-Xiaomi. עצם החשיפה של תהליך אימון תוך כדי ריצה היא צעד יוצא דופן: מעבדות רוב הזמן מפרסמות מודל מוגמר ודוח טכני, ולא את העקומות בזמן אמת.
הרקע: רצף של הכרזות סביב MiMo-V2.5
השידור החי מגיע על רקע שורה של הכרזות מהחודשים האחרונים. לפי דיווח ב-Securities Times (证券时报), ב-8 ביוני השיקה Xiaomi את מצב UltraSpeed למודל MiMo-V2.5-Pro, ולטענתה זהו המודל הראשון בעולם עם טריליון פרמטרים שחוצה 1,000 טוקנים בשנייה על GPU כללי, בלי שבבים ייעודיים. אותו דיווח מונה גם שני צעדים קודמים: ב-23 באפריל דורג MiMo-V2.5-Pro במקום הראשון (בשיתוף) בין המודלים הפתוחים במדד האינטליגנציה ובמדד ה-Agent של Artificial Analysis, וב-27 במאי הודיעה החברה על הוזלה של עד 99% במחירי ה-API של סדרת V2.5.
לפי Gizchina, בהדגמות שיא נמדדו כ-1,200 טוקנים בשנייה, וכל זה על שרת סטנדרטי אחד עם שמונה GPU. ההאצה מבוססת על שלוש שכבות הנדסיות: קוונטיזציה ל-FP4 בשכבות ה-Experts בלבד, פענוח ספקולטיבי בשם DFlash, וסביבת ריצה של השותפה TileRT שמארגנת מחדש את ביצוע החישוב על ה-GPU. לצורך השוואה, האתר מציין ש-Claude Opus 4.6 מגיע לכ-71 טוקנים בשנייה ו-Gemini Flash לכ-192. Xiaomi פרסמה checkpoint פתוח בשם MiMo-V2.5-Pro-FP4-DFlash ב-Hugging Face, ו-TileRT שחררה חלק מהמודולים שלה ב-GitHub כ-open source.
יש גם מחיר: לפי Gizchina, ה-API במצב UltraSpeed עולה פי שלושה מהתעריף הרגיל, תמורת מהירות פלט של פי עשרה בערך. הגישה ניתנה בשלב הניסיון לפי בקשה בלבד, בין 9 ל-23 ביוני, עם עדיפות לחברות ולמפתחים מקצועיים. נקודה מהותית: נכון לפרסום, לא הייתה מדידה עצמאית של צד שלישי, והמספרים מגיעים מ-Xiaomi עצמה. ה-checkpoint הפתוח נועד בין היתר לאפשר לקהילה לבדוק את הטענות.
למה זה חשוב
התחרות בין מעבדות סיניות על המודל הפתוח המוביל רק מתחממת, ו-Xiaomi מנסה להתבלט לא רק בציוני benchmark אלא בשני ממדים אחרים: מהירות הסקה ושקיפות. ככל הנראה, שידור חי של תהליך אימון הוא בראש ובראשונה מהלך של בניית אמון ומיצוב מול קהילת המפתחים, במיוחד לאור העובדה שטענות המהירות של הדור הקודם עדיין ממתינות לאימות חיצוני.
המשמעות למשתמשים ולמפתחים, אם המספרים יחזיקו מעמד, היא שמודלי ענק פתוחים עשויים להפוך לרלוונטיים למשימות שדורשות תגובה כמעט מיידית, כמו סוכני AI שמבצעים עשרות קריאות ברצף. עד שיפורסמו פרטים רשמיים על V2.6, כדאי להתייחס לשידור החי כאל הצצה מעניינת, ולא כאל הכרזת מוצר.