קהילת המשתמשים בפורום r/LocalLLaMA פרסמה השבוע שני פרויקטים נפרדים המאפשרים להריץ את המודל Qwen3.8-Flash-Next על חומרה שלא נועדה במקור לכך: מערך של ארבעה כרטיסי Nvidia V100 ותיקים מצד אחד, ומחשב Mac ביתי עם שבב M1 Max מצד שני. שני הפרויקטים מבוססים על שיטות כימות (quantization) והזרמת נתונים המצמצמות את דרישות הזיכרון הנדרשות להרצת המודל.
קהילת המפתחים העצמאיים סביב מודלי שפה פתוחים ממשיכה למצוא דרכים להריץ מודלים גדולים על חומרה שלא נבנתה במקור בשבילם. השבוע פורסמו בפורום r/LocalLLaMA שני פוסטים נפרדים שמתעדים הרצה של המודל Qwen3.8-Flash-Next - מהמשפחה הפתוחה של מודלי Qwen - הן על מערך כרטיסי Nvidia ישנים והן על מחשב Mac ביתי.
ארבעה כרטיסי V100 ישנים
לפי פוסט שפורסם בפורום, הגרסה הכמתית RadixArk/Qwen3.8-Flash-Next-NVFP4 נתמכת כעת במנוע ההסקה (inference engine) SGLang-V100 - גרסה מותאמת של הכלי הפופולרי SGLang שנועדה במיוחד לכרטיסי Nvidia V100. לדברי בעל הפוסט, ההרצה בוצעה על ארבעה כרטיסי V100 עם 32GB זיכרון כל אחד, תוך שמירה על אורך הקשר (context) המלא של המודל. כ-50GB נוספים, כך נכתב בפוסט, הוסטו (offloaded) לזיכרון ה-RAM של המערכת.
כרטיסי V100 הם דור ישן יחסית של מאיצי שרתים של Nvidia, שממשיך להיות זמין במחירים נמוכים יחסית בשוק המשומש לעומת דורות מאיצים חדישים יותר. הפורמט NVFP4 הוא שיטת כימות בת 4 סיביות שמטרתה לצמצם את כמות הזיכרון הנדרשת להרצת מודל, ובכך לאפשר הרצה של מודלים גדולים גם על חומרה עם קיבולת זיכרון מוגבלת יחסית לגודל המודל.
הזרמה מכונן SSD על מאק
בפוסט מקביל, משתמש אחר תיאר הרצה של אותו מודל על מחשב Mac עם שבב M1 Max ו-64GB זיכרון מאוחד. לפי הפוסט, ההרצה מתאפשרת הודות לשילוב של כמה טכניקות: הזרמה (streaming) של הטנסורים (tensors) ישירות מכונן ה-SSD, הזרמה דומה עבור רכיב שכונה בפוסט "engrams" - מונח שמשמעותו המדויקת לא פורטה במקור - והזרמה עבור מנגנון שכונה MTP. בנוסף צוין שימוש בכימות מותאם אישית מסוג Q4, שלפי הפוסט נבדק במיוחד מול טנסורי Metal, סביבת החישוב הגרפי של אפל. פרטים נוספים על תהליך הבדיקה לא נמסרו במקור.
למה זה מעניין
שני הפוסטים משקפים דפוס מוכר בקהילת המודלים הפתוחים: זמן קצר לאחר צאתו של מודל חדש, מפתחים עצמאיים משחררים גרסאות כמותיות ושיטות הרצה המותאמות לחומרה שאינה יעד ה-"ברירת מחדל" של יצרן המודל - בין אם מדובר בכרטיסי שרתים ישנים שכבר אינם בשימוש מסחרי פעיל, ובין אם במחשבי מאק ביתיים עם זיכרון מוגבל יחסית לגודל מודלים מתקדמים. ככל הנראה, המשמעות המעשית היא הרחבת הנגישות למודלים חדישים גם למי שאין ברשותו מאיצי GPU עדכניים ויקרים.
יש לציין שמדובר בפוסטים שפורסמו על ידי חברי קהילה בפורום, ולא בהודעה רשמית מטעם מפתחי המודל. פרטים כמו מהירות ההסקה בפועל, איכות הפלט ביחס לגרסה המקורית, או היקף ההרצה שנבדק, לא צוינו במקורות ולכן אינם ניתנים לאימות במסגרת כתבה זו.