מריצים מודלים מקומית: המדריך המלא ל-Ollama
איך מריצים מודלי שפה על המחשב שלכם עם Ollama — התקנה, בחירת מודל שמתאים לחומרה, עבודה יומיומית וחיבור לכלים אחרים. פרטיות מלאה, בלי ענן.
יש משהו משחרר בלהריץ מודל שפה על המחשב שלכם: שום מילה לא עוזבת את המכונה, אין מכסות שימוש, אין תלות בחיבור לאינטרנט — והכול בלי עלות נוספת אחרי שהחומרה כבר אצלכם. Ollama — כלי חינמי בקוד פתוח — הפך את זה מפרויקט למתכנתים מיומנים לעניין של כמה פקודות. המדריך הזה לוקח אתכם מאפס לסביבת עבודה מקומית מתפקדת: התקנה, בחירת מודל שמתאים לחומרה שלכם, עבודה יומיומית, ממשק גרפי וחיבור לכלים אחרים.
1. מודלים פתוחים: מושגי יסוד בלי כאב ראש
כשאתם משתמשים ב-ChatGPT או ב-Claude, המודל רץ על שרתים של החברה, והמשקולות שלו — “המוח” — הן סוד מסחרי. מודל פתוח הוא ההפך: החברה שאימנה אותו (Meta עם משפחת Llama, Mistral, Google עם Gemma, Alibaba עם Qwen, Microsoft עם Phi ועוד) פרסמה את המשקולות לציבור, וכל אחד יכול להוריד ולהריץ אותן על מכונה משלו.
ארבעה מושגים שיחזרו לאורך המדריך:
- פרמטרים. גודל המודל נמדד במיליארדי פרמטרים, ומסומן ב-B (למשל 3B, 8B, 70B). ככלל: יותר פרמטרים = מודל חכם יותר, אבל גם כבד יותר להרצה. רוב העבודה המקומית הביתית קורית בטווח שבין 3B ל-14B.
- קוונטיזציה (quantization). דחיסה של המשקולות לדיוק נומרי נמוך יותר, כדי שהמודל יתפוס פחות זיכרון וירוץ מהר יותר — במחיר פגיעה קלה באיכות. Ollama מוריד כברירת מחדל גרסאות מקוונטזות, ולרוב זה בדיוק מה שאתם רוצים.
- גרסאות ונגזרות. לכל משפחת מודלים יש גדלים שונים וגרסאות שונות, וקהילת הקוד הפתוח מייצרת נגזרות מותאמות (למשל למשימות קוד או לשפות מסוימות). לכן הרשימה בספריית Ollama נראית אינסופית — אל תיבהלו, נלמד לבחור.
- חלון הקשר (context). כמה טקסט המודל יכול “להחזיק בראש” בשיחה אחת. חלון גדול יותר צורך יותר זיכרון — עוד סיבה שהחומרה קובעת.
2. חומרה: מה המחשב שלכם באמת יכול להריץ
כלל האצבע החשוב ביותר: המודל צריך להיכנס לזיכרון. במחשבי Mac עם Apple Silicon הזיכרון משותף למעבד ולגרפיקה, ולכן הם מצוינים למשימה. במחשבי Windows/Linux, כרטיס מסך עם הרבה זיכרון וידאו (VRAM) הוא היתרון הגדול; בלעדיו המודל ירוץ על המעבד וה-RAM — יעבוד, אבל לאט יותר.
הערכה גסה, לגרסאות מקוונטזות סטנדרטיות:
- 8GB זיכרון — מודלים קטנים (בערך עד 3B–4B) ירוצו בנוח. זה מספיק לסיכומים, ניסוחים ומשימות פשוטות.
- 16GB — נקודת העבודה הנוחה: מודלים בטווח 7B–9B רצים היטב, וזו הליגה שבה מודלים פתוחים מתחילים להרגיש רציניים.
- 32GB ומעלה — מודלים בטווח 12B–30B, שכבר נותנים איכות גבוהה למשימות מורכבות.
- מודלי ענק (70B+) — דורשים חומרה חזקה במיוחד; לרוב המשתמשים הביתיים זה לא הכיוון, וזה בסדר גמור.
אלה סדרי גודל, לא מספרים מדויקים — הצריכה בפועל תלויה בקוונטיזציה ובחלון ההקשר. הדרך האמינה לדעת: פשוט לנסות (פקודת ollama ps בפרק הבא תראה לכם בדיוק מה קורה). ואם המודל רץ אבל “נחנק” — עוברים לגודל אחד למטה. מודל קטן שרץ מהר שימושי פי כמה ממודל גדול שמגמגם.
3. התקנת Ollama והרצת מודל ראשון
ההתקנה פשוטה בכל מערכות ההפעלה: נכנסים לאתר הרשמי ollama.com, מורידים את המתקין ל-macOS או ל-Windows ומריצים אותו. בלינוקס מריצים את פקודת ההתקנה שמופיעה באתר. אחרי ההתקנה Ollama רץ ברקע כשירות מקומי.
עכשיו פותחים טרמינל (Terminal ב-Mac/Linux, PowerShell ב-Windows) ומורידים מודל ראשון. מודל קטן ומהיר הוא התחלה טובה — בדקו בספרייה שבאתר Ollama מהי הגרסה הקטנה העדכנית של אחת המשפחות המובילות. בדוגמאות כאן נשתמש בשם llama3.2; החליפו בשם המודל שבחרתם:
ollama run llama3.2
הפקודה מורידה את המודל (בפעם הראשונה זה ייקח כמה דקות — קובץ של כמה ג’יגה) ופותחת שיחה ישר בטרמינל. כתבו לו משהו — זהו, אתם מדברים עם מודל שרץ כולו על המחשב שלכם. יוצאים מהשיחה עם /bye.
פקודות היום-יום:
ollama pull <שם מודל>— הורדת מודל בלי לפתוח שיחה.ollama list— אילו מודלים מותקנים אצלכם וכמה מקום הם תופסים.ollama ps— מה רץ כרגע, כמה זיכרון הוא צורך, והאם הוא רץ על הגרפיקה (GPU) או על המעבד (CPU).ollama rm <שם מודל>— מחיקת מודל שסיימתם איתו (הקבצים גדולים; שווה לנקות).
בדיקת יעילות חשובה: בזמן שהמודל עונה, הריצו בטרמינל שני ollama ps. אם בעמודת המעבד/גרפיקה מופיע שהמודל רץ ברובו על GPU (או על Metal ב-Mac) — מצוין. אם הוא רץ בעיקר על CPU והתשובות איטיות — כנראה שהמודל גדול מדי לזיכרון הגרפי שלכם; נסו גודל קטן יותר.
4. בחירת מודל לפי משימה — וגם לעברית
בספריית המודלים באתר Ollama יש עשרות משפחות. במקום ללכת לאיבוד, חשבו לפי משימה:
- שיחה, ניסוח וסיכום כלליים — מודלי הדגל הפתוחים בגודל שמתאים לחומרה שלכם: משפחות כמו Llama, Mistral, Gemma ו-Qwen הן נקודת פתיחה טובה. נסו שניים-שלושה על אותה משימה אמיתית שלכם והשוו — ההבדלים בטעם אישי גדולים מההבדלים “האובייקטיביים”.
- קוד — יש נגזרות ייעודיות לקוד (חפשו “coder” בספרייה). למשימות השלמה ותיקון קוד הן לרוב עדיפות על מודל כללי באותו גודל.
- מכונה חלשה — המודלים הקטנים (בסביבות 1B–4B) של המשפחות הגדולות מפתיעים לטובה במשימות ממוקדות: תיוג, סיכום קצר, טיוטות.
ועכשיו לשאלה הישראלית: עברית. בואו נתאם ציפיות ביושר: מודלים פתוחים בגדלים ביתיים חלשים בעברית משמעותית מהמודלים המסחריים הגדולים. האימון שלהם נשען בעיקר על אנגלית, והעברית — על מורפולוגיה העשירה שלה — סובלת ראשונה. מה זה אומר בפועל:
- מודלים גדולים ורב-לשוניים במשפחות המובילות יתמודדו עם עברית בסיסית: סיכום, תרגום פשוט, שאלות-תשובות. צפו לשגיאות ניסוח מדי פעם, במיוחד בהטיות ובמגדר.
- מודלים קטנים (מתחת ל-7B בערך) עלולים לייצר עברית שבורה. אל תשפטו לפיהם את כל התחום.
- טריק שעובד: לכתוב את ההנחיה באנגלית ולבקש את התוצר בעברית — או לעבוד באנגלית ולתרגם בנפרד.
- כדאי לדעת שקיימות גם יוזמות ישראליות לאימון מודלים פתוחים מותאמים לעברית — שווה חיפוש עדכני, כי התחום זז מהר.
השורה התחתונה: לעבודה שרובה עברית, מודל מקומי הוא כלי עזר — לא תחליף מלא לענן. איך משלבים נכון — בפרק 7.
5. ממשק גרפי מעל Ollama: עבודה נוחה יותר
הטרמינל נהדר לבדיקות, אבל לעבודה יומיומית נעים יותר ממשק צ’אט אמיתי: היסטוריית שיחות, העלאת קבצים, החלפת מודלים בקליק, ותצוגה נוחה — כולל כיווניות טובה יותר לעברית, שבטרמינל היא לפעמים סבל של ממש.
האפשרות המוכרת ביותר היא Open WebUI — פרויקט קוד פתוח חינמי שנותן ממשק בדפדפן בסגנון ChatGPT מעל Ollama. מתקינים לפי ההוראות באתר הרשמי של הפרויקט (הדרך הנפוצה היא דרך Docker), נכנסים לכתובת מקומית בדפדפן, והממשק מזהה אוטומטית את המודלים שהתקנתם ב-Ollama. משם העבודה מרגישה כמו כל צ’אטבוט מסחרי: שיחות שמורות, בחירת מודל מתפריט, העלאת מסמכים לשיחה — רק שהכול נשאר על המחשב שלכם.
יש גם אפליקציות שולחניות שיודעות להתחבר ל-Ollama כמנוע — ההיצע משתנה תדיר, וחיפוש קצר של “Ollama GUI” יציג את האפשרויות העדכניות. מה שחשוב להבין: כולן שכבת נוחות מעל אותו Ollama שכבר רץ אצלכם. אפשר להחליף ממשק בלי לאבד כלום.
טיפ לעברית: בממשק גרפי בדקו את יישור הטקסט — ברוב הממשקים אפשר להגדיר כיווניות אוטומטית, וזה משנה את חוויית העבודה בעברית מקצה לקצה.
6. Ollama כשרת מקומי: חיבור לכלים אחרים
כאן Ollama הופך מ“צעצוע” לתשתית. מרגע ההתקנה, Ollama מאזין בכתובת מקומית (ברירת המחדל: http://localhost:11434) ומציע ממשק API שכל תוכנה על המחשב יכולה לדבר איתו. המשמעות: כל כלי שיודע לעבוד עם “מודל שפה” יכול להשתמש במודלים המקומיים שלכם במקום בענן.
דוגמה לבקשה ישירות מהטרמינל:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "סכם בשני משפטים: מה זה מודל שפה?",
"stream": false
}'
אם קיבלתם תשובת JSON עם טקסט — יש לכם שרת AI מקומי עובד. ומה עושים איתו:
- עורכי קוד וכלי כתיבה. תוספים רבים לעורכי טקסט וסביבות פיתוח מאפשרים לבחור ב-Ollama כמנוע — השלמות ועריכה בלי שהקוד או הטקסט עוזבים את המחשב.
- כלי אוטומציה מקומיים. סקריפטים ותהליכים (למשל: סיכום אוטומטי של קבצים בתיקייה) שפונים ל-API המקומי.
- תאימות רחבה. Ollama תומך גם בפורמט ה-API הנפוץ בתעשייה, כך שכלים רבים שנבנו מול ספקי ענן יעבדו מולו בשינוי כתובת בלבד. הפרטים המדויקים — בתיעוד הרשמי של Ollama.
הערת אבטחה אחת וחשובה: כברירת מחדל השרת מאזין רק למחשב שלכם, וכך כדאי להשאיר. אם תרצו לפתוח גישה ממכשירים אחרים ברשת הביתית — עשו זאת במודע, והבינו שכל מי שברשת יוכל לפנות למודל שלכם.
7. מגבלות וציפיות: מקומי מול ענן, ומתי לשלב
נסיים בתיאום ציפיות, כי הוא שיקבע אם תתמידו.
מה מודל מקומי עושה מצוין: סיכום וניסוח, טיוטות, תיוג וסיווג, עבודה עם מידע רגיש שאסור לו לצאת החוצה, משימות אוטומציה חוזרות בהיקף גדול (בלי מכסות!), עבודה בלי אינטרנט, וניסויים — כשאין מחיר לכל הודעה, אתם חופשיים לשחק, ללמוד ולטעות.
איפה הוא יתקשה מול המודלים הגדולים בענן: היגיון מורכב רב-שלבי, ידע עדכני (מודל מקומי לא מחובר לרשת ולא יודע כלום על מה שקרה אחרי האימון שלו), עברית עשירה כפי שראינו, וחלונות הקשר ענקיים. מודל 8B על הלפטופ הוא לא מתחרה של מודל הדגל בענן — הוא כלי אחר.
לכן שגרת העבודה הנבונה היא שילוב:
- ברירת המחדל למשימות רגישות — מקומי. כל מה שנוגע במסמכים פרטיים, כספים, מידע של לקוחות: קודם נשאל אם המודל המקומי מספיק, ורק אם לא — נסיר פרטים מזהים ונעלה לענן.
- ברירת המחדל למשימות מורכבות — ענן. מחקר, כתיבה ארוכה בעברית, קוד מסובך: הכלים הגדולים פשוט טובים יותר, ואין טעם להתעקש.
- המסה החוזרת — מקומי. משימות שרצות עשרות פעמים ביום (סיכומים, תיוגים, טיוטות ראשונות) הן המקום שבו המקומי מנצח: מהיר מספיק, פרטי לחלוטין, בלי מכסות.
ההמלצה המסכמת: השבוע הקרוב — עבדו עם מודל מקומי אחד על משימה אמיתית אחת (למשל: סיכום כל מסמך שאתם קוראים). תוך שבוע תדעו בדיוק איפה הוא מספיק לכם ואיפה לא, ותבנו את השילוב הנכון לכם — לא לפי הבטחות של אף אחד, אלא לפי הידיים שלכם על המקלדת.