מפתח פרסם ברשת Reddit מודל שפה בגודל 250 מיליון פרמטרים שאימן מאפס על 30 מיליארד טוקנים, וכיווץ אותו לפחות משתי סיביות לפרמטר עד לגודל קובץ של 60 מגה-בייט בלבד. המודל רץ ללא כרטיס גרפי במהירות של כ-400 טוקנים בשנייה על מעבד מחשב נייד רגיל, וזכה לתגובות חיוביות בפורומי בינה מלאכותית.
מפתח שעובד לבדו על הפרויקט פרסם בפורום r/LocalLLaMA ברשת Reddit מודל שפה (LLM) שאותו אימן מאפס בעצמו, בגודל של 250 מיליון פרמטרים. המודל אומן על 30 מיליארד טוקנים מתוך מאגר הנתונים fineweb, המשמש לרוב לאימון מודלי שפה בקוד פתוח.
החידוש המרכזי בפרויקט הוא תהליך הכיווץ: המפתח דחס את המודל לפחות משתי סיביות לכל פרמטר (quantization), כך שקובץ הפריסה הסופי שוקל 60 מגה-בייט בלבד, והרצתו דורשת כ-80 מגה-בייט של זיכרון RAM. לפי הדיווח, המודל רץ במהירות של כ-400 טוקנים בשנייה על מעבד (CPU) של מחשב נייד רגיל, ללא צורך בכרטיס גרפי (GPU) ייעודי.
הפוסט הופיע לראשונה בפורום r/MachineLearning, שם לדברי המפתח זכה לתגובה טובה מהצפוי — למעלה מ-300 הצבעות חיוביות ושאלות ענייניות, ללא ביקורת שלילית. בעקבות ההצלחה הוא שיתף את הפרויקט מחדש גם ב-r/LocalLLaMA. מאגר הקוד של הפרויקט ב-GitHub עומד על כ-35 כוכבים (stars) נכון לפרסום.
למה זה מעניין
כיווץ קיצוני כזה — לפחות מ-2 סיביות לפרמטר, לעומת ה-16 או 32 סיביות המקובלות באימון סטנדרטי — הוא טכניקה שנועדה לצמצם דרמטית את גודל המודל ואת דרישות החומרה להרצתו, במחיר של פגיעה מסוימת בדיוק. העובדה שמדובר בפרויקט שהושלם על ידי מפתח יחיד, ולא צוות מחקר של חברת בינה מלאכותית גדולה, ממחישה ככל הנראה מגמה רחבה יותר: הכלים והמאגרים הפתוחים הדרושים לאימון מודלי שפה מאפס הפכו נגישים מספיק כדי שיחידים יוכלו להתנסות בהם באופן עצמאי, מבלי להסתמך על תשתית ענן יקרה או צבר כרטיסי GPU.
הרצה על מעבד רגיל, ללא כרטיס גרפי, מוזילה משמעותית את עלות ההרצה של מודל כזה בהשוואה למודלים גדולים יותר, ועשויה להקל על שילובו במכשירי קצה עם משאבים מוגבלים. עם זאת, גודלו הקטן של המודל — 250 מיליון פרמטרים בלבד, שברירי אחוז מגודלם של מודלי השפה המובילים בשוק — מעיד ככל הנראה גם על מגבלות ביכולותיו בהשוואה למודלים המסחריים הגדולים.