יאנדקס פרסמה את המשקלים של Alice AI Foundation: מודל MoE של 80 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל צעד
ענקית הטכנולוגיה הרוסית יאנדקס פרסמה ב-Hugging Face, תחת רישיון Apache 2.0, את המשקלים של מודל בסיס ניסיוני בגודל 80 מיליארד פרמטרים. המודל אומן מאפס על כ-18 טריליון טוקנים. זה עדיין לא צ'טבוט מוכן: יאנדקס מגדירה אותו כשדה ניסוי לדור הבא של העוזרת Alice AI ולסוכני AI עתידיים.
יאנדקס פרסמה את המשקלים של Alice AI Foundation LLM, מודל שפה ניסיוני בגודל 80 מיליארד פרמטרים. לפי הדיווח באתר Iznanka, המודל זמין ב-Hugging Face תחת רישיון Apache 2.0. המשמעות היא שמפתחים יכולים להריץ אותו על התשתית שלהם, לבצע עליו אימון נוסף (fine-tuning) ולהשתמש בו גם במוצרים מסחריים.
מודל בסיס, לא צ'טבוט
המילה החשובה בהודעה היא Foundation. יאנדקס לא שחררה גרסה חדשה של העוזרת הקולית Alice, אלא מודל בסיס (pretrain): מודל שפה שעבר רק את שלב האימון המרכזי. ברמה הזו המודל כבר מחזיק ידע, יודע להמשיך טקסט ופותר חלק מבעיות המתמטיקה והתכנות. כדי לנהל שיחה יציבה, לציית להוראות ולפעול בבטחה בשירות לצרכנים, הוא עדיין צריך שלבי אימון נוספים.
השם הרשמי של המודל הוא AliceAI-Foundation-80B-A3B-Base. לפי יאנדקס, הוא ישמש מעבדה לבחינת פתרונות ארכיטקטורה עבור "מודל חשיבה (reasoning) מאוחד" עתידי. המודל הזה אמור לשמש בסיס ליכולות סוכניות (agentic) ב-Alice AI, כלומר תרחישים שבהם העוזרת לא רק עונה בטקסט אלא מבצעת רצף פעולות בשביל המשתמש.
איך 80 מיליארד הופכים ל-3 מיליארד
המודל בנוי בארכיטקטורת Mixture of Experts (MoE). במקום רשת אחת שכל חלקיה עובדים על כל מילה, המודל מחולק למאות "מומחים" מתמחים. בכל טוקן (יחידת טקסט) מופעלים רק כ-3 מיליארד פרמטרים מתוך 80 המיליארד. כך המודל שומר על קיבולת כוללת גדולה, אבל כל צעד בייצור התשובה דורש פחות חישוב.
יש לזה מגבלה: המודל לא הופך למודל קטן. עדיין צריך לאחסן ולטעון את כל המשקלים, וזה דורש זיכרון רב. החיסכון הוא בכוח החישוב בזמן יצירת התשובה.
לפי יאנדקס, המודל אומן מאפס, בלי להתבסס על משקלים של מודלים פתוחים אחרים. החברה בנתה מחדש את מאגר האימון, בחרה את הארכיטקטורה וכיווננה את ההיפר-פרמטרים. היקף האימון הכולל היה כ-18 טריליון טוקנים, וחלון ההקשר מגיע ל-262,144 טוקנים. זה מאפשר לעבד כמויות טקסט גדולות מאוד במעבר אחד.
הארכיטקטורה כוללת 48 בלוקים, שכבות MoE עם מאות מומחים ומנגנון attention היברידי. המהנדסים ייעלו גם את העברת הנתונים בין כרטיסי המסך, כך שהיא מתבצעת במקביל לחישוב. לפי החברה, זה הכפיל בערך את מהירותם של חלק משלבי האופטימיזציה. כדי לסנן את נתוני האימון נעשה שימוש במדרג של מסווגים (classifiers): המודלים היקרים העריכו רק את החלק שכבר עבר סינון מוקדם.
דגש על ידע ברוסית
יחד עם המודל פרסמה יאנדקס שני מבחני ביצועים (benchmarks) משלה. WikiWebFacts בודק ידע על תאריכים, אירועים, הגדרות ואישים. HardMultiQA נבנה מזרם אנונימי של שאלות שמשתמשים שלחו ל-Alice AI, והוא כולל נושאים נדירים יותר, ממשפט ורפואה ועד IT ואמנות. החברה פרסמה גם את התשובות הנכונות ואת נוהלי ההערכה, כך שאפשר לשחזר את התוצאות באופן עצמאי.
לפי המדידות הפנימיות של יאנדקס, בשורה של משימות המודל משתווה למודלים פתוחים גדולים ממנו. בחלק מהמבחנים בתכנות, במתמטיקה ובעובדות בשפה הרוסית הוא אף עוקף אותם. חשוב לזכור שאלה תוצאות שמדווח המפתח עצמו, ועדיין אין מספיק בדיקות עצמאיות שמאשרות אותן.
למה זה חשוב
הצעד מצטרף למגמה של חברות טכנולוגיה גדולות מחוץ לארצות הברית שמשחררות מודלים עם משקלים פתוחים. ככל הנראה, העניין המרכזי כאן אינו רק הביצועים. יאנדקס מוציאה החוצה חלק מעבודת המחקר שלה ומאפשרת לכל אחד לבדוק את הטענות שלה על החומרה והנתונים שלו, ולא רק לסמוך על מצגת.
ההערכה היא שהמבחן האמיתי יגיע בהמשך: האם הארכיטקטורה תעמוד בטענות בבדיקות עצמאיות, וכמה מהר ניתן יהיה לבנות על הבסיס הזה סוכן חשיבה יציב. בינתיים מוקדם לקרוא למודל "Alice החדשה". מדובר בתשתית טכנולוגית שהערך שלה ייקבע במידה רבה לפי מה שמפתחים עצמאיים יצליחו לבנות ממנה.