PrismML משיקה מודל שפה זעיר: הימור על AI שרץ על הטלפון בלי לפגוע בביצועים
הסטארטאפ PrismML, שהוקם על ידי חוקרים מ-Caltech, השיק את Bonsai 2 27B — גרסה דחוסה של מודל הקוד הפתוח Qwen3.8 27B של עליבאבא שמצטמצמת ל-5.9 ג'יגה-בייט בלבד, פי 9 עד 10 פחות מהמקור. החברה טוענת שהמודל הדחוס שומר על 98% מביצועי המקור, ומייעדת אותו להרצה על מחשבים אישיים וסמארטפונים מתקדמים.
חברת הבינה המלאכותית הצעירה PrismML הציגה ביום חמישי את Bonsai 2 27B, הדור השני במשפחת מודלים שמטרתה לדחוס מודלי שפה גדולים (LLM) כך שיוכלו לרוץ על מכשירי קצה — מחשבים אישיים וטלפונים חכמים — במקום על שרתי ענן בלבד, לפי TechCrunch.
המודל החדש מבוסס על Qwen3.8 27B, מודל קוד פתוח נפוץ של עליבאבא, אותו PrismML הצליחה לכווץ לגודל של 5.9 ג'יגה-בייט בלבד — צמצום של פי 9 עד 10 בזיכרון הנדרש לעומת המודל המקורי. גודל כזה, לדברי החברה, מאפשר הרצה על מחשב רגיל ואולי גם על סמארטפון ברמה גבוהה.
מי עומד מאחורי החברה
PrismML הוקמה על ידי קבוצת חוקרים מ-Caltech ומובלת על ידי בבק חסיבי (Babak Hassibi), פרופסור ב-Caltech ומומחה לטכנולוגיות דחיסה. בין היועצים לחברה נמנה איון סטויקה (Ion Stoica), ממייסדי Databricks ומנהל מעבדת Sky Computing הידועה של ברקלי, שהצמיחה בעבר פרויקטים כמו Letta ו-SGLang. בין המשקיעים בחברה: Khosla Ventures, Cerberus Capital ו-Caltech, לאחר סבב גיוס ראשוני (seed) בהיקף של 22.25 מיליון דולר. לפי TechCrunch מתקיימות שמועות על שיחות בין החברה לאפל, אך חסיבי סירב להגיב לכך.
איך הדחיסה עובדת
הטכניקה שעליה מבוססת PrismML נקראת "משקלים טרנריים" (ternary weights). בעוד שבמודלי שפה רגילים כל "משקל" — פרטי המידע שהמודל לומד ושומר באימון — דורש 16 סיביות, השיטה של PrismML מצמצמת כל משקל לאחד משלושה ערכים בלבד: 1+, 1- או 0. הצמצום הדרסטי הזה בגודל הנתונים לכל משקל הוא שמאפשר את הקיטון החד בנפח הכולל של המודל. פרטים טכניים נוספים על השיטה זמינים בדף הפרויקט ב-Hugging Face, שם ניתן גם להריץ את Bonsai 2 27B ישירות בדפדפן באמצעות WebGPU.
לפי הנתונים שמסרה החברה, Bonsai 2 שומר על 98% מהציון המצטבר של Qwen במבחני בנצ'מארק — שיפור לעומת 95% שהושגו בדגם הראשון במשפחה, Bonsai, שהושק כחודשיים קודם לכן במרץ. אותו דגם ראשון הורד למעלה מ-11 מיליון פעמים, ומודלים קטנים יותר שהחברה שחררה מאז נוספו להם 2.6 מיליון הורדות נוספות, כך לפי הנתונים שמסרה PrismML ל-TechCrunch.
PrismML אינה לבד בזירת דחיסת המודלים — מתחרה בולטת היא Multiverse Computing, שהוקמה בידי פרופסור ממכון הפיזיקה הבינלאומי דונוסטיה שבספרד וגייסה סכומים גדולים יותר. חסיבי טוען כי היתרון של החברה שלו הוא בשמירה כמעט מלאה על ביצועי המודל המקורי חרף הדחיסה.
לגבי העתיד, חסיבי אמר כי בחודשים הקרובים החברה מתכננת להחיל את שיטת הדחיסה על מודלים גדולים בהרבה, בטווח של מאות מיליארדי פרמטרים, והעריך כי ככל שהמודל המקורי גדול יותר, כך קל יותר לדחוס אותו בלי לפגוע ב"אינטליגנציה" שלו.
סטויקה, היועץ לחברה, תיאר את המשמעות הפוטנציאלית עבור המשתמש הקצה: אינטליגנציה מלאכותית שרצה על המכשיר שכבר בבעלות המשתמש — ולכן, לדבריו, בחינם ובאופן פרטי יותר, מאחר שהנתונים לא נשלחים לשרת חיצוני. מדובר בהערכה של גורם מטעם החברה, ולא בעובדה מוכחת — ונותר לראות אם דחיסה כזו אכן תשנה את אופן השימוש ההמוני ב-AI, כפי שהחברה מקווה.