שיאומי חושפת הכל: שידור חי של אימון MiMo-V2.6 חשף עלות של 1.13 מיליון דולר בשני ימים
שיאומי (Xiaomi) פרסמה את סדרת מודלי השפה MiMo-V2.6 - כולל דגם Pro, דגם Flash קל יותר וגרסה מזוקקת בת 9 מיליארד פרמטרים - תוך חשיפה חסרת תקדים של שלב האימון בשידור חי: עלויות לכל צעד, הרכב נתוני האימון וציוני ביצועים. תוך יומיים בלבד צרכה החברה יותר מ-1.13 מיליון דולר, סכום שעולה על עלויות האימון המשולבות של DeepSeek-R1 ו-MiniMax-M1.
צוות מודלי השפה הגדולים של שיאומי (Xiaomi) העביר את שלב האימון שלאחר האימון הראשוני (post-training) - השלב שבו המודל "מתאמן" על פתרון בעיות בפועל - לדף שידור חי בכתובת mimo.xiaomi.com/rl/, כך דווח ב-BigGo. הדף, שמתעדכן ישירות מיומני האימון, חושף לציבור נתונים שמעבדות בינה מלאכותית שומרות בדרך כלל בסוד: עלות לכל צעד אימון, הרכב מאגרי הנתונים, יומני כשלים וציוני מבחן בקידוד (DeepSWE).
תוך יומיים בלבד צרכו שני קווי המודלים המוצגים בשידור - MiMo-V2.6-Pro ו-MiMo-V2.6-Flash - יותר מ-1.13 מיליון דולר. קו ה-Pro עולה כ-74 אלף דולר לכל צעד אימון, ואילו קו ה-Flash זול משמעותית - כ-20 אלף דולר לצעד. נכון לזמן הפרסום צבר קו ה-Pro כ-830 אלף דולר וקו ה-Flash כ-360 אלף דולר, כששני הקווים ממשיכים לרוץ. לשם השוואה, כל שלב למידת החיזוקים (reinforcement learning, RL) של DeepSeek-R1 עלה 294 אלף דולר על 512 שבבי H800, ושל MiniMax-M1 - 535 אלף דולר על אותו מספר שבבים לאורך שלושה שבועות. כלומר ההוצאה של שיאומי בשני ימים בלבד עולה על סכום עלויות שני הפרויקטים המתחרים יחד, ואימון שני המודלים עדיין לא הסתיים.
בכל צעד אימון מנסה המודל לפתור 1,568 בעיות תכנות אמיתיות, ב-16 ניסיונות לכל בעיה - כ-25 אלף רשומות תשובה בסך הכול, באצווה (batch) בגודל 1,568×16. כל בעיה כוללת בממוצע 55 סבבי קריאה לכלים (tool calls) וחלון הקשר של כ-90 אלף טוקנים. צעד אימון בודד בקו ה-Pro אורך כשעתיים ו-6 דקות: 58 דקות הסקה (inference) ו-64 דקות עדכון פרמטרים.
לראשונה חברה סינית חושפת גם את הרכב הנתונים המדויק ששימש בשלב הלמידה: כשני שלישים מהמאגר הם נתוני קוד, 13.1% נתוני ראייה ורק כ-3% נתוני שיחה - פירוט שברוב המעבדות, כולל DeepSeek, נשאר חסוי. בין המגיבים לשידור היה שאו האן (Xiao Han), מייסד חברת Jina AI, שכתב: "אל תתנו למנכ"ל הכספים לראות את זה". את היוזמה הכריזה לוּאוֹ פוּלי (Luo Fuli), ראש צוות ה-MiMo בשיאומי וחברה לשעבר בצוות הליבה של DeepSeek, שציינה כי הצוות בילה חצי שנה בבדיקת שאלה אחת - עד כמה ניתן להרחיב בפועל את היקף למידת החיזוקים. לדבריה, פרטים נוספים ייחשפו בקוד פתוח בהדרגה בשבועות הקרובים.
זו כבר היוזמה הרביעית של שיאומי בתחום הבינה המלאכותית השנה, אחרי השקת MiMo-V2-Pro, פתיחת קוד המקור של סדרת V2.5 ושחרור גרסת UltraSpeed. במקביל לשידור עלו לפלטפורמת Hugging Face משקלי הדגמים Pro-RL ו-Flash-RL, לצד גרסה מזוקקת קטנה בהרבה - MiMo-V2.6-Distill-Qwen בת 9 מיליארד פרמטרים, המבוססת על משפחת המודלים Qwen. הפרסום עורר עניין מיידי בקהילת המודלים הפתוחים, וכבר עלו השוואות בין גרסת ה-Flash-RL הקטנה יחסית למודלים פתוחים אחרים בגודל דומה - אם כי מדובר בבדיקות עצמאיות של משתמשים בפורומים, שטרם אומתו באופן רשמי.
המשמעות המרכזית היא שיאומי הפכה שקיפות עלויות ונתוני אימון לכלי תחרותי בפני עצמו, בזמן שרוב המעבדות - הסיניות והמערביות כאחד - שומרות פרטים כאלה חסויים. הפרסום המקביל של הגרסה המזוקקת בת 9 מיליארד הפרמטרים משקף ככל הנראה גם מגמה רחבה יותר בשוק המודלים הפתוחים: דחיפה למודלים קומפקטיים שניתן להריץ בעלות תפעול נמוכה משמעותית, תוך שאיפה לשמר ביצועים קרובים לאלה של מודלים גדולים וסגורים בהרבה.