שמועה: גוגל בוחנת בפנים מודל AI בשם הקוד "carbon", ויש מי שמשווים אותו ל-Opus בכתיבת קוד
לפי דיווח ב-Business Insider, גוגל עומדת להשיק מודל AI חדש, ועובדים בחברה כבר בודקים מודל נוסף שלדבריהם טוב ממנו בהרבה. ברשת מסתובבת הטענה שאחד המודלים, "carbon", כותב קוד ברמה של Claude Opus של אנתרופיק, אבל לטענה הזאת אין כרגע אישור ממקור מוסמך, וגוגל לא הכריזה רשמית על המודל.
גוגל עומדת להשיק מודל בינה מלאכותית חדש, ובמקביל עובדים בחברה כבר בודקים מודל נוסף, שלדבריהם טוב ממנו בהרבה. כך עולה מכתבה שפרסם Business Insider. הכתובת של הכתבה מזכירה את Gemini 4 ושלושה שמות שנשמעים כמו שמות קוד: argon, barium ו-carbon. ברשתות החברתיות התחילה בעקבות זאת לרוץ טענה נוספת: לפי "דיווחים מוקדמים", המודל carbon כותב קוד ברמה של Opus, מודל הדגל של אנתרופיק.
חשוב להדגיש: גוגל לא הכריזה רשמית על מודל בשם carbon, ולא פרסמה עליו שום נתונים. כל מה שידוע כרגע מבוסס על דיווח שמסתמך על עדויות של עובדים, ולא על הודעה של החברה.
מאיפה הגיעה ההשוואה ל-Opus
ההשוואה בין carbon ל-Opus בכתיבת קוד הופיעה בכותרת של פוסט בקהילת r/singularity ברדיט. הפוסט מפנה לכתבה ב-Business Insider, אבל בחומרים שעמדו לרשותנו לא מצאנו שהכתבה עצמה משווה את carbon ל-Opus. לכן כדאי להתייחס להשוואה הזאת כטענה שלא אומתה. היא לא מבוססת על מבחני ביצועים (benchmarks) שפורסמו, ולא על השוואה מסודרת בין המודלים.
עוד לא ברור איזה מבין המודלים הוא זה שעומד לצאת, ואיזה מהם הוא המודל המתקדם יותר שנבדק בפנים. בחומרים שעמדו לרשותנו גם לא נמצאו פרטים על מועד ההשקה או על היכולות המדויקות.
למה בכלל משווים ל-Opus
כתיבת קוד הפכה בשנים האחרונות לאחד הקריטריונים המרכזיים שלפיהם משווים בין מודלי שפה גדולים (LLM). יש לזה סיבה פשוטה: מפתחים וחברות תוכנה הם מהלקוחות הכי משמעותיים של שירותי ה-API, כלומר הממשקים שדרכם תוכנות אחרות מתחברות למודל. כלים לכתיבת קוד אוטומטית, ו"סוכנים" שמבצעים משימות פיתוח שלמות כמעט בעצמם, הפכו לשוק תחרותי מאוד. בשוק הזה אנתרופיק מבססת חלק גדול מהמוניטין שלה על משפחת Claude.
לכן, אם גוגל אכן מפתחת מודל שמגיע לרמה של Opus בתחום הזה, ככל הנראה המטרה היא לצמצם פער באחד התחומים שבהם התחרות בין מעבדות ה-AI הכי ישירה. בכל מקרה, זו הערכה. בלי נתונים רשמיים אי אפשר לדעת אם ההשוואה מבוססת, או שמדובר ברושם ראשוני של כמה בודקים.
איך לקרוא את הדיווח
דיווחים על מודלים שנבדקים בפנים, עם שמות קוד שדולפים החוצה, כבר הפכו לחלק קבוע מהמרוץ בתעשייה. לפעמים הם מתבררים כמדויקים, ולפעמים המוצר שיוצא שונה מאוד ממה שתואר. גם כשהעובדים מתלהבים בצדק, ביצועים בבדיקות פנימיות לא בהכרח נשמרים כשהמודל מגיע למשתמשים בהיקף רחב.
המשמעות המעשית לקורא: יש סיבה לצפות להכרזה של גוגל על מודל חדש בקרוב, לפחות לפי Business Insider. את הטענות על יכולות הקוד של carbon כדאי לבחון רק כשהחברה תפרסם נתונים, או כשמפתחים יוכלו לנסות את המודל בעצמם.