NaiveAI משחררת את Naive-N0.5-Flash: מודל קוד פתוח עם 309 מיליארד פרמטרים והקשר של מיליון טוקנים
חברת NaiveAI פרסמה את Naive-N0.5-Flash, מודל MoE עם 309 מיליארד פרמטרים, מתוכם 15.5 מיליארד פעילים. המודל נבנה לפיתוח קוד ולמחקר AI, תומך בהקשר של מיליון טוקנים בלי שכבות full attention, והמשקולות שלו משוחררות ברישיון MIT. לדברי החברה, מודלי AI שלה היו שותפים לתכנון הארכיטקטורה של המודל עצמו.
חברת NaiveAI הכריזה על Naive-N0.5-Flash, מודל שפה שנבנה במיוחד לפיתוח קוד ולמחקר ופיתוח של AI. זה מודל מסוג MoE (Mixture of Experts, "תערובת מומחים") עם 309 מיליארד פרמטרים בסך הכול, אבל רק 15.5 מיליארד מהם פעילים בכל שלב של יצירת טקסט. הוא תומך באופן מובנה בחלון הקשר של מיליון טוקנים. המשקולות וקוד ההרצה משוחררים ברישיון MIT, שהוא אחד מרישיונות הקוד הפתוח המתירניים ביותר.
ארכיטקטורה בלי full attention
הארכיטקטורה היא החלק המעניין מבחינה טכנית. ברוב מודלי השפה יש שכבות full attention, שבהן כל טוקן "מסתכל" על כל הטוקנים שקדמו לו. זו פעולה שעלותה גדלה מהר מאוד ככל שההקשר מתארך. לפי NaiveAI, המודל החדש מוותר עליהן לגמרי. הוא משלב Sliding-Window Attention (SWA), שבו כל טוקן מתייחס רק לחלון מקומי של טוקנים סמוכים, עם גרסה קלה של DeepSeek Sparse Attention (DSA), מנגנון קשב דליל שבוחר רק חלק מהטוקנים. שני המנגנונים משולבים עם GQA4, ורוב הרשת בנויה ביחס של חמש שכבות SWA לכל שכבת DSA. בלשון החברה, "הרשת כולה נשארת מקומית או דלילה".
המשמעות המעשית, ככל הנראה, היא שעבודה עם קלט ארוך מאוד זולה ומהירה יותר, למשל מאגר קוד שלם או היסטוריית ניסויים ארוכה.
מהירות ומחיר
לצד המודל פיתחה החברה מערכת הרצה משלה בשם NaiveRT. היא משלבת כמה טכניקות אופטימיזציה, ובהן mega-kernel fusion ו-speculative decoding (שיטה שבה מודל קטן "מנחש" טוקנים והמודל הגדול מאשר אותם). לפי החברה, המהירות היא 50 טוקנים בשנייה למשתמש במצב Standard, ועד 2,000 טוקנים בשנייה במצב Ultrafast. בתרחיש פנימי של אימון בלמידת חיזוק (RL), מדווחת החברה על שיא של 2,122 טוקנים בשנייה בזרם יחיד.
החברה תציע גם גישה דרך API. המחירים המוצהרים הם 0.10 דולר למיליון טוקני קלט, 0.40 דולר למיליון טוקני פלט ו-0.01 דולר למיליון טוקנים שנקראים מהמטמון (cache).
AI שבונה AI
לפי NaiveAI, הגישה שלה שונה מהמקובל: מודלי AI כותבים קוד, מריצים ניסויים ומנתחים תוצאות, והחוקרים האנושיים קובעים את הכיוון ומקבלים את ההחלטות הקריטיות. החברה מספרת שהתשתית שלה מפעילה קרוב לעשרה מיליון סביבות עבודה מבודדות (sandboxes) בשבוע, ובשיא יש עד 100 אלף מהן פעילות במקביל. לדבריה, Naive-N0.5-Flash עצמו נבנה כך: מודלי AI חקרו ותכננו את ארכיטקטורת הקשב ההיברידית שלו, והם גם ביצעו אופטימיזציה למערכות האימון וההרצה. החברה אף מציגה את המודל כ"פותח נתיב" לשיפור עצמי רקורסיבי (RSI). זו טענה שאפתנית שקשה לבחון מבחוץ.
החברה פרסמה השוואות ביצועים מול מודלים רבים, בהם Qwen, Kimi, GLM, DeepSeek ומודלים של אנתרופיק ו-OpenAI, במבחנים כמו SWE-Bench Pro ו-Terminal-Bench 2.1. ההערכות נערכו בסביבת Claude Code של אנתרופיק, עם גישה לקבצים ול-Bash בלבד. חשוב לזכור שמדובר בתוצאות שהחברה עצמה פרסמה, ושחלק מציוני המתחרים נלקחו ממקורות חיצוניים שונים.
למה זה חשוב
השילוב של משקולות פתוחות ברישיון MIT, מחיר API נמוך ומספר קטן יחסית של פרמטרים פעילים מציב את Naive-N0.5-Flash כחלופה אפשרית לסוכני קוד במחיר נמוך. אם הביצועים יעמדו בבדיקות עצמאיות, הוויתור המוחלט על full attention עשוי להשפיע על האופן שבו יתוכננו מודלים עם הקשר ארוך בהמשך.