Aleph Alpha משיקה את Kolibri: מודל פתוח בן 78 מיליארד פרמטרים כחלק מהמאבק על ריבונות AI אירופית
חברת ה-AI הגרמנית Aleph Alpha שחררה את Kolibri, מודל שפה גרמני-אנגלי בן 78 מיליארד פרמטרים, שהמשקולות שלו זמינות בחינם תחת רישיון Apache 2.0. המודל אומן על שרתים בגרמניה ובפינלנד, פותח מתוך התחשבות ב-EU AI Act ומיועד למגזר הציבורי, לתעופה ולתעשייה.
חברת ה-AI הגרמנית Aleph Alpha שחררה את Kolibri, מודל שפה בגרמנית ובאנגלית עם 78 מיליארד פרמטרים. המשקולות של המודל, כלומר הערכים המספריים שנלמדו באימון ומאפשרים להריץ אותו, זמינות להורדה חופשית ב-Hugging Face תחת רישיון Apache 2.0, שמתיר גם שימוש מסחרי. המהלך מוצג כטיעון בעד ריבונות אירופית בתחום ה-AI: מודל שפותח ואומן באירופה, לפי החוק האירופי, ושארגונים יכולים להריץ על התשתית שלהם בלי להיות תלויים בספקים אמריקאיים.
גדול על הנייר, חסכוני בפועל
המודל בנוי בארכיטקטורת mixture-of-experts (MoE). זו שיטה שבה המודל מחולק ל"מומחים" שונים, ובכל שלב מופעל רק חלק קטן מהם. לפי החברה, מתוך 78 מיליארד הפרמטרים רק כשלושה מיליארד פעילים בכל token, יחידת הטקסט הבסיסית שהמודל מעבד. המשמעות המעשית היא ככל הנראה עלות הרצה נמוכה בהרבה ממה שהגודל הכולל רומז, וזה שיקול מרכזי עבור ארגונים שרוצים להריץ את המודל בעצמם.
Aleph Alpha טוענת ש-Kolibri נמצא על "חזית פארטו" של איכות מול עלות תפעול בשתי השפות. במילים פשוטות, החברה אומרת שאין מודל דומה שטוב ממנו גם באיכות וגם בעלות. לפי נתוני החברה, המודל משיג 71% במבחני ביצועים בגרמנית ומפיק טקסט מהר יותר ממודלים בעלי ארכיטקטורה דומה, כמו GPT OSS A5B, Qwen 3.6 A3B ו-Gemma 4 A4B. יש לסייג: אלה נתונים של החברה עצמה, וחלק מהמודלים שאליהם היא משווה, ממרץ ואפריל 2026, ישנים משמעותית. בתחום שמתקדם בקצב כזה, לפער של כמה חודשים יש משקל.
גרמנית במרכז, ומודלים סיניים ברקע
21.3% מנתוני האימון הם בגרמנית, ולשם כך בנתה החברה צינור נתונים ייעודי לגרמנית. רוב המודלים הגדולים אומנו בעיקר על טקסט באנגלית, ולכן הגרמנית שלהם לעיתים פחות טובה. ההשקעה בנתונים בשפה המקומית היא ככל הנראה היתרון התחרותי ש-Aleph Alpha מנסה לבנות לעצמה.
פרט מעניין, ובמידה מסוימת אירוני: כדי לייצר נתוני אימון סינתטיים, כלומר טקסטים שנוצרו בידי מודל אחר לצורך אימון, השתמשה החברה גם במודלים סיניים. מהלך שנועד לצמצם תלות טכנולוגית במעצמה אחת נשען אפוא בחלקו על כלים של מעצמה אחרת. זה מדגים עד כמה קשה לבנות היום מודל שפה "ריבוני" לגמרי.
למי זה מיועד
לפי הדוח הטכני, המודל אומן על 768 מעבדי B200 של אנבידיה במרכזי נתונים בגרמניה ובפינלנד. הוא תומך בחלון הקשר של עד מיליון tokens, כלומר יכול לעבד בבת אחת כמויות טקסט גדולות מאוד, כמו מסמכים משפטיים ארוכים או תיקי תיעוד טכני. החברה מכוונת את Kolibri למנהל הציבורי, לתעופה ולתעשייה, ומדגישה שהוא פותח לפי החוק האירופי ומתוך התחשבות ב-EU AI Act, חוק ה-AI האירופי.
למה זה חשוב
בשביל משרד ממשלתי או חברה תעשייתית באירופה, מודל פתוח שאפשר להריץ על שרתים מקומיים פותר כמה בעיות בבת אחת. המידע לא יוצא מהארגון, אין תלות במחירים ובתנאי שימוש של חברה זרה, וקל יותר לעמוד בדרישות הרגולציה. Kolibri לא צפוי להתחרות בראש הטבלה במודלים הגדולים של גוגל או של OpenAI, וככל הנראה גם לא נועד לכך. הוא מנסה להוכיח שאירופה יכולה לספק לעצמה מודל "טוב מספיק", זול להרצה ומותאם לשפה ולחוק המקומיים. האם הטענה הזאת תחזיק תלוי במבחנים עצמאיים, שעדיין לא פורסמו.