גוגל משחררת את EmbeddingGemma 2: מודל embedding פתוח וקטן שמקודד טקסט, קוד, תמונות, וידאו ושמע ישירות על המכשיר
גוגל דיפמיינד שחררה את EmbeddingGemma 2, מודל embedding פתוח עם 740 מיליון פרמטרים שממפה טקסט, קוד, תמונות, וידאו ושמע למרחב משותף אחד, ורץ מקומית בלי לשלוח מידע לשרתים חיצוניים. לפי גוגל, הוא מוביל בין המודלים שמתחת למיליארד פרמטרים, ובחלק מהמשימות עוקף גם מודלים ייעודיים שגדולים ממנו פי שניים ויותר.
גוגל דיפמיינד הכריזה היום (6 באוקטובר) על EmbeddingGemma 2, הדור השני של מודל ה-embedding הקל שלה. בניגוד לגרסה הקודמת, שעבדה עם טקסט בלבד, המודל החדש מקודד גם קוד, תמונות, וידאו ושמע, וממפה את כולם ל"מרחב embedding" משותף אחד. המודל מכיל 740 מיליון פרמטרים, מבוסס על הארכיטקטורה של Gemma 4 ומשוחרר ברישיון Apache 2.0, שמתיר גם שימוש מסחרי.
מה זה מודל embedding ולמה זה חשוב
מודל embedding הופך תוכן לוקטור, כלומר לרשימה של מספרים שמייצגת את המשמעות שלו. כך אפשר לחפש לפי משמעות ולא רק לפי מילים מדויקות, ולמצוא תוכן דומה. זהו הבסיס של מערכות RAG (retrieval augmented generation), שבהן מודל שפה שולף מידע רלוונטי ממאגר לפני שהוא עונה. כשכל סוגי המדיה נמצאים באותו מרחב, אפשר למשל לפי גוגל לאתר קטע וידאו מסוים בעזרת הקלטה קולית, או לחפש בשעות של הקלטות שמע באמצעות שאילתה כתובה.
הנקודה המרכזית היא שהכול קורה על המכשיר עצמו. כפי שמציין The Decoder, המודל רץ מקומית בלי מפתח API. בשילוב עם מודל גנרטיבי קטן כמו Gemma 4 אפשר לבנות אפליקציות RAG שעובדות offline, בלי לשלוח נתונים לשרתים חיצוניים.
המספרים
לפי גוגל, EmbeddingGemma 2 משיג את הציונים הגבוהים ביותר בקטגוריה של מודלי embedding רב-מודאליים שמתחת למיליארד פרמטרים, במבחנים כמו MTEB Code ו-MAEB (מבחן embedding לשמע). בחלק מהמשימות הוא משתווה למודלים גדולים ממנו ואף עוקף כמה מודלים ייעודיים שגדולים ממנו פי שניים ויותר. ב-MTEB Code הציון עלה מ-68.76 בגרסה הקודמת ל-78.68, שיפור של 9.92 נקודות. גוגל מציינת שהמודל מתאים לאינדוקס של מאגרי קוד מקומיים, לחיפוש סמנטי בקוד ולשליפת מידע עבור סוכני קוד.
עוד נתונים מההודעה הרשמית:
- מבנה מודולרי: למשימות טקסט בלבד מספיקים 270 מיליון פרמטרים. מקודד הראייה (170 מיליון) ומקודד השמע (300 מיליון) הם רכיבים אופציונליים.
- חיסכון באחסון: בזכות טכניקת Matryoshka Representation Learning אפשר לקצר את הווקטורים מ-768 ממדים ל-512, ל-256 או ל-128, וכך לחסוך עד פי 6 באחסון ובזיכרון.
- צריכת זיכרון: אחרי quantization (דחיסת המשקלים), על Pixel 11 Pro המודל דורש כ-191MB של RAM פעיל לגרסת הטקסט, וכ-567MB לגרסה הרב-מודאלית המלאה.
- חלון הקשר: 8K טוקנים, פי ארבעה מהגרסה הקודמת. זה מספיק לעד 5.5 דקות שמע, 29 תמונות או 58 פריימים של וידאו.
לפי The Decoder, כל שאילתה בדפדפן דרך WebGPU נמשכת כ-20 עד 70 מילישניות.
הרקע: 20 מיליון הורדות
הגרסה הראשונה של EmbeddingGemma יצאה בשנה שעברה, ולפי גוגל הורדה יותר מ-20 מיליון פעמים. מפתחים השתמשו בה לכלי חיפוש על המכשיר ולמערכות RAG שמגינות על הפרטיות. הגרסה החדשה משתמשת באותו tokenizer טקסט ובאותו מקודד שמע של Gemma 4, ולכן לדברי גוגל אפשר להריץ את שני המודלים יחד בצריכת זיכרון כוללת נמוכה יותר. המשקלים זמינים ב-Hugging Face וב-Kaggle.
המשמעות
ההכרזה משתלבת במגמה רחבה של העברת יכולות AI מהענן אל המכשיר עצמו. ככל הנראה המשמעות המעשית היא שאפליקציות יוכלו לחפש בגלריית תמונות, בהקלטות או בקבצים אישיים בלי שהתוכן יעזוב את הטלפון. לצד הפרטיות, זה עשוי גם לחסוך בעלויות שרת ולקצר את זמני התגובה. חשוב לזכור שנתוני הביצועים מגיעים מגוגל עצמה, ומבחנים בלתי תלויים עוד יצטרכו לאשר אותם.