חברת Sand.ai פרסמה בקוד פתוח את המשקלים וקוד ה-inference של MAGI-2 Preview, מודל וידאו המבוסס על ארכיטקטורת MoE נדירה לתחום. המודל, שמייצר קטעי וידאו של 10 שניות עם פס קול סינכרוני, מוריד את עלות ההסקה פי כ-10 ומטפס למקום השישי בלידרבורד Artificial Analysis.
חברת Sand.ai פרסמה השבוע בקוד פתוח את המשקלים ואת קוד ה-inference של MAGI-2 Preview, מודל ליצירת וידאו הבנוי על ארכיטקטורת single-stream ומסוגל להפיק קטעי וידאו באורך 10 שניות יחד עם פס קול סינכרוני הנוצר במקביל.
המאפיין הבולט של המודל הוא השימוש בארכיטקטורת fine-grained MoE (Mixture of Experts) — טכניקה שנפוצה במודלי שפה גדולים אך נדירה יחסית בעולם מודלי הווידאו. הרעיון מאחורי MoE הוא לחלק את הרשת הנוירונית ל"מומחים" קטנים יותר, כשבכל שלב חישוב מופעל רק חלק מהם במקום כל הרשת כולה.
במקרה של MAGI-2, המודל כולל בסך הכול 114 מיליארד פרמטרים, אך עבור כל טוקן בתהליך היצירה מופעלים בפועל רק 6 מיליארד פרמטרים. המשמעות המעשית היא נפח חישוב נמוך משמעותית לכל צעד יצירה, בהשוואה למודלים "צפופים" (dense) שבהם כל הפרמטרים פועלים תמיד — כמו MiniMax H3 בעל 33 מיליארד פרמטרים, שמולו MAGI-2 קל בהרבה מבחינה חישובית לפי הדיווח.
החיסכון הזה מתורגם, לפי הנתונים שפרסמה Sand.ai, לירידה של פי כ-10 בעלות ה-inference — כלומר בעלות התפעול בפועל של המודל בזמן ייצור וידאו. ירידה בעלות ההרצה היא פרמטר קריטי עבור מודלי וידאו, שנחשבים באופן מסורתי לגרסניים במיוחד מבחינת משאבי חישוב, בשל הצורך לעבד רצפים ארוכים של פריימים ולשמור על עקביות ויזואלית לאורך זמן.
השילוב בין היעילות החישובית לאיכות התוצרים הוביל את MAGI-2 למקום השישי בלידרבורד המוכר של Artificial Analysis, פלטפורמה שמדרגת ומשווה מודלים מובילים בתחומי ה-AI השונים על בסיס מבחני השוואה שיטתיים. טיפוס למקום כה גבוה של מודל קוד פתוח, מול מודלים סגורים ומסחריים רבים המככבים בדרך כלל בראש הטבלאות הללו, מעיד ככל הנראה על כך שהפער בין מודלים פתוחים לסגורים בתחום הווידאו הולך ומצטמצם.
עצם השחרור של המשקלים וקוד ה-inference בקוד פתוח מאפשר למפתחים וחוקרים ברחבי העולם להריץ, לבחון ולשפר את המודל באופן עצמאי, ללא תלות בגישה מוגבלת או בתשלום לחברה המפתחת. מהלך כזה עשוי להאיץ ניסויים ופיתוחים נוספים בתחום יצירת הווידאו מבוססת AI, בפרט כשמדובר בארכיטקטורה חסכונית יחסית שמאפשרת להריץ את המודל בעלות נמוכה יותר מהנהוג כיום בתחום.