יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

גוגל משיקה את Gemini 4 עם תוצאות מרשימות במבחני ביצועים, אבל בתוך החברה יש ספקנות לגבי יכולות התכנות שלו

גוגל החלה להפיץ את Gemini 4 Argon, מודל הדגל החדש שלה, ומציגה תוצאות מובילות בכמה מבחני ביצועים. לפי Bloomberg, בתוך החברה יש ספקנות לגבי הביצועים של המודל בתחומים מרכזיים, ובראשם תכנות.

גוגל החלה להפיץ את Gemini 4 Argon, מודל הבינה המלאכותית החדש שלה, שחיכו לו זמן רב. החברה אומרת שהמודל השיג תוצאות מובילות בכמה מבחני ביצועים (benchmarks). במקביל, לפי דיווח של Bloomberg, גוגל מתמודדת עם ספקנות פנימית לגבי הביצועים של המודל בתחומים מרכזיים, ובהם תכנות.

השקה הדרגתית, שמתחילה באבטחת סייבר

לפי הכתבה של ג'וליה לאב ודייבי אלבה ב-Bloomberg, גוגל הציגה את המודל ביום רביעי לקבוצה קטנה של שותפים מתחום אבטחת הסייבר. החברה מסרה שתרחיב את הגישה אליו אחרי בדיקות נוספות, ושהמנויים בתשלום יקבלו אותו ראשונים.

גוגל אומרת ש-Gemini 4 הגיע לתוצאות מובילות בכמה מבחני ביצועים. באחד מהם, שבודק מיומנויות אבטחה, הוא עקף את מודל Astra של OpenAI. ההחלטה לפתוח את המודל קודם לשותפי סייבר מתאימה לנתון הזה. היא עשויה גם להעיד על זהירות: השקה מצומצמת נותנת לחברה זמן לבדוק את המודל לפני שהוא מגיע לקהל רחב.

פער בין המבחנים לעבודה בפועל

לפי Bloomberg, עיקר הספקנות בגוגל נוגע ליכולות התכנות של המודל. בפוסט שהפנה לכתבה הובא ציטוט ממנה, ולפיו עובדים שיש להם גישה ישירה לפרויקט אומרים שהמודל מתקשה בחלק ממשימות התכנות, ושהוא מתפקד פחות טוב כשמשתמשים בו בעבודה אמיתית ולא במבחנים. את המשפט המלא לא ניתן היה לאמת מתוך הקטע שעמד לרשותנו מהכתבה. את הספקנות לגבי התכנות Bloomberg מאשר בעצמו.

הבעיה מוכרת בתעשייה. מבחני ביצועים הם סט קבוע של משימות, והחברות לומדות עם הזמן לשפר את המודלים דווקא בהן. עבודה אמיתית בתכנות היא משהו אחר: קוד קיים, דרישות שלא הוגדרו עד הסוף ותהליכים ארוכים עם הרבה שלבים. מודל יכול להצליח מאוד בראשון ולהתקשות בשני.

הנתונים שמסתובבים ברשת

אחרי ההשקה פורסמו ב-Reddit פוסטים שלפיהם Gemini 4 השיג במבחן של Artificial Analysis ציון זהה לזה של GPT 6 Astra, במחיר נמוך בכ-40%. פוסט אחר טען שהמודל קיבל ציון 53 במדד האינטליגנציה של אותו מבחן, ושמחירו כשליש ממחיר Claude Opus 5.5 של אנתרופיק. לא מצאנו אישור לנתונים האלה במקור מקושר, ולכן יש להתייחס אליהם כאל דיווח שלא אומת.

למה זה חשוב

הדיווח של Bloomberg לא מוכיח שיש בעיה עם המודל. הוא כן מבליט שאלה שחוזרת בכל השקה של מודל גדול: עד כמה אפשר לסמוך על ציונים במבחנים כדי להבין איך המודל יתפקד בשימוש יומיומי.

המשמעות לגוגל ככל הנראה כפולה. תוצאות טובות במבחנים, ובמיוחד ניצחון על OpenAI במבחן אבטחה, נותנות לה יתרון שיווקי. אבל תכנות הוא כיום אחד התחומים שבהם מודלים מסחריים מתחרים בחריפות, ולקוחות עסקיים ומפתחים בוחנים מודלים לפי מה שהם עושים בפועל ולא לפי טבלאות תוצאות. אם הספקנות הפנימית תתברר כמוצדקת, השאלה שתקבע תהיה איך המודל יתפקד כשיגיע למנויים בתשלום, ולא הציון שלו במבחנים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות