גוגל הכריזה על Gemini 4 Argon, מודל הדגל החדש שלה, אבל בינתיים הוא לא פתוח לציבור
גוגל הכריזה על Gemini 4 Argon, מודל הדגל החדש שלה. לפי החברה הוא מוביל במשימות תוכנה ארוכות, בעבודה משפטית ופיננסית ובהגנת סייבר. בשלב הראשון המודל נפתח רק לקבוצת מגיני סייבר נבחרים, ומחירו לכשיושק יעמוד על 2 דולר למיליון טוקנים בקלט ו-10 דולר למיליון טוקנים בפלט.
גוגל הכריזה היום (30 בספטמבר) על Gemini 4 Argon, מודל הדגל החדש שלה. לפי ההודעה הרשמית בבלוג של Google DeepMind, המודל נועד לבצע היטב תהליכי עבודה מורכבים וארוכים: פיתוח תוכנה בעולם האמיתי, עבודת ידע ארגונית בתחומים כמו משפטים ופיננסים, והגנת סייבר. יש כאן הסתייגות חשובה: כפי שציינו ב-Ars Technica, עדיין אי אפשר להשתמש במודל.
השקה בשלבים, ובראשונה למגיני סייבר
את ההכרזה חתום קוראי קבוקצ'וגלו (Koray Kavukcuoglu), סגן נשיא בכיר ב-Google DeepMind והארכיטקט הראשי של גוגל לתחום ה-AI. לדבריו, Argon נפתח בשלב זה רק ל"מגיני סייבר מהימנים" במסגרת תוכנית שנקראת Fairwind. גוגל מסבירה ששחרור בטוח של יכולות ברמה כזו מחייב השקה בשלבים. החברה מציינת שהיא משתתפת בתהליך הוולונטרי של ממשלת ארה"ב, שבמסגרתו הממשל מקבל גישה למודלים לפני שחרורם. לצד זאת היא תמשיך לאסוף משוב מבודקים מוקדמים ולשפר את מנגנוני ההגנה לפני שהמודל ייפתח למפתחים, לארגונים ולצרכנים. גוגל לא נקבה בתאריך, ורק כתבה שזה יקרה "בהקדם האפשרי".
המחיר כבר ידוע. בתקופת ההשקה Argon יעלה 2 דולר למיליון טוקנים (יחידות הטקסט שהמודל מעבד) בקלט ו-10 דולר למיליון טוקנים בפלט. טוקנים שמורים (cached), כלומר קלט שחוזר על עצמו בין בקשות, יתומחרו בהנחה של 95%.
כותרת המשנה של Ars Technica, "So much for Gemini 3.5 Pro", מרמזת ככל הנראה שגוגל דילגה על גרסת ביניים שרבים ציפו לה ועברה ישר למספור 4.
פלט של מיליון טוקנים
החידוש הטכני הבולט הוא מגבלת הפלט. גוגל מרחיבה אותה ל-1M טוקנים, לעומת 64K בדור הקודם, ומגדירה אותה כמובילה בתעשייה. המשמעות המעשית היא שהמודל יכול "לחשוב" ולהפיק מאות אלפי טוקנים ברצף אחד, וכך לפתור בעיה מורכבת במהלך אחד במקום לפרק אותה לסבבים רבים.
בתחום הקוד Argon קבע לפי גוגל שיא חדש (state of the art) במבחן DeepSWE v1.1, עם ציון של 77.9%. המבחן בודק משימות הנדסת תוכנה ארוכות מהעולם האמיתי.
מה Argon עושה כבר עכשיו בתוך גוגל
לפי החברה, אלפי עובדים כבר משתמשים במודל בעבודה השוטפת. גוגל מביאה כמה דוגמאות:
- מחשוב קוונטי: המודל עוזר לחוקרים לצמצם את המשאבים (מספר קיוביטים כפול מספר שערים) שדורשות תת-שגרות שמאטות יישומים חשובים. באחת הדוגמאות הוא עקף את הבסיס שפורסם ב-40% תוך דקות.
- זיכרון בחוות השרתים: סוכני Argon ניתחו נתוני ניטור מכל הצי, ואיתרו והחילו בעצמם אופטימיזציות זיכרון. לפי גוגל הן פינו יותר מ-300 TiB, והחיסכון הכולל מוערך ב-500 TiB עד 1 PiB.
- הסבת קוד ל-Rust: סוכנים מעבירים קוד C/C++ ל-Rust, שפה שמונעת מראש סוגים נפוצים של באגי זיכרון. ההסבות נעות מעשרות אלפי שורות בספריות כמו re2 ו-libgav1 ועד יותר מ-800 אלף שורות בליבת Zircon של מערכת ההפעלה Fuchsia. גוגל מדגישה שהקוד עובר ביקורת אוטומטית וידנית לפני שהוא מגיע לסביבת הייצור.
ב-libgav1, מפענח הווידאו בקוד פתוח של גוגל, הסוכנים לקחו גרסת Rust קיימת והחליפו 32 אלף שורות של קוד SIMD, כלומר קוד שמותאם ידנית לעיבוד מקבילי. בסוף התהליך התקבל מפענח בטוח-זיכרון שרץ מהר פי 2.7 מגרסת ה-Rust המקורית ומפיק וידאו זהה.
מה עם ההשוואה למתחרים?
ברשתות החברתיות הופצו טבלאות שלפיהן Argon מקדים את Fable 5.1 ו-Opus 5.5 של אנתרופיק ואת GPT-6 Astra של OpenAI ב-12 מתוך 18 מבחנים. מדובר בדיווח לא מאומת. בחומר הרשמי שעמד לרשותנו מופיע רק הציון ב-DeepSWE, ולכן אי אפשר עדיין לקבוע איפה בדיוק Argon עומד מול המתחרים.
למה זה חשוב
המהלך מראה ככל הנראה שהשקת מודלים מתקדמים משתנה. במקום שחרור מיידי לכולם, גוגל מתחילה עם קהל מצומצם ורגיש, כמו מגיני סייבר, ומשתפת את הממשל האמריקאי לפני ההפצה. המחיר שהוכרז מראש והדגש על משימות ארוכות מלמדים שגוגל מכוונת בעיקר לשוק הארגוני ולסוכנים אוטונומיים. השאלה המרכזית היא מתי המודל ייפתח לשימוש רחב, ואם הביצועים שגוגל מציגה יחזיקו גם במבחנים עצמאיים.