יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מודלים של מאות מיליארדי פרמטרים על מחשב ביתי: FreeToken,‏ Colibrì ו-Splash מקדמים את ה-inference המקומי

כמה פרויקטי open source חדשים מנסים להריץ מודלי שפה ענקיים על חומרה ביתית. הם מפזרים את משקלי המודל בין כרטיס המסך, זיכרון ה-RAM והדיסק. FreeToken ו-Colibrì מכוונים למחשבים עם כרטיסי אנבידיה ולמעבדים רגילים, Splash 1.1.0 מתמקד במחשבי Mac, ומפתח עצמאי מדווח על הרצה של DeepSeek-V4-Flash על כרטיס מסך עם 12GB בלבד.

הרצה של מודל שפה גדול דורשת בדרך כלל שרתים יקרים בענן. כמה כלים חדשים בקוד פתוח מנסים לשנות את זה: הם מפזרים את המודל בין כרטיס המסך, זיכרון ה-RAM והדיסק, כך שמודלים של מאות מיליארדי פרמטרים יכולים לרוץ על מחשב גיימינג או על Mac, בלי להשכיר חומרה.

מודלים שלא נכנסים לזיכרון

רוב המודלים שהכלים האלה מריצים בנויים בארכיטקטורת Mixture-of-Experts ‏(MoE). במודל כזה פועל בכל שלב רק חלק קטן מתוך הרבה תת-רשתות ("מומחים"). לכן לא צריך להחזיק את כל המשקלים בזיכרון המהיר בבת אחת. אפשר לשמור בכרטיס המסך רק את המומחים שנמצאים בשימוש כרגע, ולהביא את השאר מה-RAM או מהדיסק כשצריך.

FreeToken מגדיר את עצמו כמנוע הרצה למודלי MoE שמיועד לחומרה אישית. לפי המאגר, הוא מתאים את חלוקת העבודה בין המעבד לכרטיס המסך לרוחב הפס הזמין, שומר את המומחים שבשימוש בזיכרון מטמון (cache), ומאפשר להעביר זיכרון וידאו (VRAM) בין רכיבים בלי להפעיל את המנוע מחדש. הוא תומך במודלים כמו DeepSeek-V4-Flash,‏ Qwen3.6-35B-A3B ו-GLM-5.2, ובכרטיסי אנבידיה מסדרות RTX 30, 40 ו-50. בנוסף הוא מציע API שתואם לאנתרופיק ול-OpenAI, כך שאפשר לחבר אליו כלים כמו Claude Code ו-Codex. הפרויקט מלווה במאמר מחקר שבין מחבריו איון סטויקה, מתאי זהריה וסונג האן.

Colibrì הולך רחוק יותר. הוא כתוב ב-C בלי תלויות חיצוניות, ומתייחס ל-VRAM, ל-RAM ולכונן ה-NVMe כמדרג אחד. לפי המאגר, הוא מכוון למודלים בגודל של 744 מיליארד עד 2.8 טריליון פרמטרים, כמו GLM-5.2 ו-Kimi K3, ותומך גם במודלים קטנים יותר כמו DeepSeek V4 Flash. בדוגמה שמופיעה במאגר, GLM-5.2 בגודל 744 מיליארד פרמטרים עלה עם 9.9GB בלבד בזיכרון. המחיר הוא מהירות: במדידה אחרת במאגר, Qwen3.6 על מחשב בלי כרטיס מסך ייצר 2.9 טוקנים בשנייה. המפתחים כותבים במפורש שאין להם התחייבות למהירות. ההתחייבות היחידה שלהם היא שמחסור בזיכרון מהיר יאט את המודל, אבל לא ישנה את הדיוק שלו או את אופן ניתוב הבקשות בין המומחים.

Overspill: דיסק כשכבה נוספת

מפתח עצמאי פרסם את Overspill, הרחבה ניסיונית ל-FreeToken שמוסיפה את הדיסק כשכבת אחסון. לדבריו, הרעיון נוצר בהשראת הגישה של Colibrì. לפי דיווחו, שלא אומת באופן עצמאי, הוא הריץ את DeepSeek-V4-Flash בגודל 85GB במהירות של כ-3 טוקנים בשנייה, על כרטיס RTX 3060 עם 12GB ועם 64GB זיכרון DDR5. זו מהירות איטית לשיחה רגילה, אבל החומרה הזו זולה בהרבה מהחומרה שנדרשת בדרך כלל להרצת מודל בגודל כזה.

Splash: אותו רעיון ב-Mac

גם בעולם של אפל יש התקדמות. Splash 1.1.0 מוסיף תמיכה במודלים בפורמטים GGUF ו-MLX ובגרסאות כיווץ (quantization) של Unsloth, שמקטינות את המודל בתמורה לפגיעה מסוימת באיכות. לפי הודעת השחרור, הגרסאות הקטנות מאפשרות להריץ את Qwen3.8-27B ו-Qwen3.6-35B-A3B על מחשבי Mac עם 24GB זיכרון.

במדידות של המפתחים על M5 Pro ו-M3 Max, קצב יצירת הטקסט (decode) של Splash היה פי 2.5–3.2 מזה של llama.cpp, הכלי הנפוץ להרצה מקומית, במודל ה-35B, ופי 4.5–5.3 במודל ה-27B. המפתחים מדגישים שבדיקות ההתאמה שהם פרסמו משוות רק את הטוקן הבא שכל כלי בוחר, ואינן מודדות ביצועים במשימות. הגרסה מוסיפה גם שכבת מטמון אופציונלית על ה-SSD. היא דורשת מעבד M3 ומעלה ו-macOS 26.4 לפחות. משתמש אחד דיווח שהוא עובד עם Qwen3.8 27B במהירות של כ-50 טוקנים בשנייה על M5 Pro עם 64GB, אבל זה דיווח אישי שלא נבדק.

המשמעות

כל הכלים האלה מוותרים על מהירות כדי להריץ מודלים גדולים יותר על חומרה צנועה. ככל הנראה הם לא יחליפו את הענן בעבודה יומיומית שדורשת תגובה מהירה. עם זאת, הם מאפשרים להריץ מודלים פתוחים גדולים באופן פרטי, בלי לשלם על כל שימוש ובלי לשלוח מידע לשרתים חיצוניים. התמיכה ב-API תואם לאנתרופיק ול-OpenAI מרמזת על הכיוון: מפתחים ירצו לחבר את המודלים המקומיים ישירות לכלי התכנות והסוכנים שהם כבר עובדים איתם.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות