שיאומי מובילה בין המודלים הפתוחים עם MiMo-V2.6-Pro, אך אנתרופיק טוענת לשאיבת נתונים מ-Claude
שיאומי פרסמה את MiMo-V2.6-Pro, שמוביל כעת את דירוג המודלים הפתוחים החזקים בעולם במחיר נמוך משמעותית ממתחרים, הודות להרחבה גדולה של למידת חיזוק. במקביל, אנתרופיק מאשימה את שיאומי ושש מעבדות סיניות נוספות בשאיבה בלתי חוקית של יכולות Claude לצורך אימון המודלים שלהן.
שיאומי (Xiaomi) פרסמה את משפחת המודלים הפתוחים MiMo-V2.6, כשהדגל שבהם, MiMo-V2.6-Pro, מוביל כעת את דירוג המודלים הפתוחים החזקים ביותר בעולם — ותוך כדי כך מסתבכת בהאשמה מצד אנתרופיק (Anthropic) על שימוש פסול במודל Claude שלה לצורכי אימון.
דירוג מוביל במחיר נמוך
לפי the-decoder, MiMo-V2.6-Pro קיבל ציון 46 במדד האינטליגנציה (Intelligence Index) של חברת הניתוח Artificial Analysis — הציון הגבוה ביותר כיום בין מודלים פתוחים, לפני מתחרים כמו Kimi K3 ו-Qwen. הנתון הבולט לא פחות הוא המחיר: 0.435 דולר למיליון טוקני קלט ו-0.87 דולר למיליון טוקני פלט, כשלפי חישוב Artificial Analysis משימת בדיקה בודדת עולה כ-0.13 דולר בלבד — שבר ממחיר מודלים ברמת ביצועים דומה. השילוב הזה ממקם את המודל על מה שמכונה "חזית פארטו" של אינטליגנציה מול עלות.
מבחינה טכנית, Pro הוא מודל mixture-of-experts עם 1.02 טריליון פרמטרים, מתוכם רק 42 מיליארד פעילים בכל בקשה. לצידו יצאה גרסה קטנה ויעילה יותר, MiMo-V2.6-Flash, וגם וריאנט מהיר במיוחד בשם Pro-UltraSpeed, עם מהירות פלט גבוהה עד פי 20.
הקפיצה מגיעה מלמידת חיזוק
שיאומי מייחסת את השיפור בביצועים להרחבה משמעותית של שלב הלמידה המבוססת חיזוק (reinforcement learning) — אימון באמצעות ניסוי, משוב ותגמול — שהורחב בשלושה צירים: יותר נתונים בכל צעד אימון, מגוון רחב יותר של סביבות משימה, ויותר כוח חישוב לבדיקת הפתרונות. לפי החברה, ריצת האימון ארכה פחות משישה ימים ועלתה כ-2.62 מיליון דולר עבור Pro ו-0.85 מיליון דולר עבור Flash. במבחן הקוד DeepSWE טיפס הציון של Pro מ-58.4 ל-72.6, ושל Flash מ-48.8 ל-65.7. כדי לשמור על יציבות האימון בקנה מידה כזה, החברה "הקפיאה" מנגנון פנימי במודל והוסיפה הגנות נגד "ריגוש תגמול" (reward hacking) — טריקים שבהם מודל "מרמה" את מנגנון התגמול בלי לפתור בפועל את המשימה.
בצעד נוסף לשקיפות, שיאומי פרסמה בפתיחות את כלי ה-RL שלה: הדוח הטכני, מסגרת האימון המלאה, מודל קטן להמשך אימון, וכ-7,000 משימות מוכנות עם מנגנוני בדיקה אוטומטיים בתחומי פיתוח תוכנה, אבטחת סייבר, עבודה משרדית ועיצוב אתרים, לצד כ-1,000 משימות בקומפוזיציה מוזיקלית. חלק מהמשימות מבוססות על בקשות משיכה (pull requests) אמיתיות מ-GitHub ושאילתות משתמשים, ואחרות נוצרו על ידי מודל שפה; משימות הסייבר מסתמכות על מאגר OSS-Fuzz של עשרות אלפי פרצות תוכנה אמיתיות.
ההאשמה מצד אנתרופיק
הפתיחות המוצגת עומדת בניגוד לטענות שהעלתה אנתרופיק כשבועיים קודם לכן. בדוח מודיעין איומים שבחן מקרי שימוש לרעה ב-Claude בין דצמבר 2025 לאוגוסט 2026, אנתרופיק ציינה שבע מעבדות סיניות — אליבאבא, Moonshot AI, DeepSeek, Zhipu, שיאומי, MiniMax ו-SenseTime — שלטענתה היו מעורבות במסע שיטתי נגד המודל. לפי אנתרופיק, המעבדות יצרו יחד כ-190 מיליון חילופי הודעות שנועדו "לשאוב" את יכולות Claude לצורך אימון המודלים שלהן, טכניקה שהיא מכנה "זיקוק בלתי חוקי" (illegal distillation). שיאומי מוזכרת בדוח בשמה, במקרה המתויג GTG-16008.
למה זה חשוב
אם הנתונים שפרסמה שיאומי מדויקים, מדובר בירידת מחיר משמעותית עבור מודל שנמצא כרגע בראש דירוג המודלים הפתוחים — מה שעשוי להאיץ את התחרות מול מעבדות אמריקאיות וסיניות אחרות כאחד. יחד עם זאת, ההאשמה של אנתרופיק, אם תתברר כמבוססת, מעלה שאלות על המקורות שעליהם אומן המודל בפועל, מעבר לתהליך ה-RL השקוף שהחברה בחרה להציג. הפער בין המחווה הפומבית לפתיחות לבין הטענה על שאיבת נתונים ממודל מתחרה ממחיש, ככל הנראה, את המתח הגובר סביב גבולות הלמידה והשימוש ההוגן בתעשיית ה-AI.