יום שלישי, 1 בספטמבר 2026 מתעדכן אוטומטית כל שעה
🗞️ חזרה למהדורה

גוגל DeepMind משיקה ראיית וידאו אגנטית ב-Gemini, ומצהירה: רק הובלה בחזית ה-AI חשובה

גוגל DeepMind השיקה יכולת "הבנת וידאו אגנטית" בדגמי Gemini 3.7/3.6 Flash ו-3.5 Flash-Lite, שמצמצמת עלויות וטוקנים תוך שיפור דיוק בניתוח וידאו ארוך. ההשקה מגיעה במקביל להצהרות תקיפות של ראש DeepMind החדש, קוריי קבוקצ'ואולו, על מחויבות גוגל להובלת חזית ה-AI, תוך שהוא מודה שהמודלים הנוכחיים עדיין מתחת לחזית.

גוגל DeepMind הכריזה היום (1 בספטמבר) על יכולת חדשה בשם "agentic video understanding" (הבנת וידאו אגנטית), הזמינה כעת בשלושה מדגמי Gemini: 3.7 Flash, 3.6 Flash ו-3.5 Flash-Lite. לפי ההודעה הרשמית, היכולת מצמצמת את צריכת הטוקנים בניתוח וידאו בעד 88%, מוזילה עלויות בעד 66% ומשפרת את הדיוק בעד 7%, בהשוואה לשיטת העיבוד ה"סטטית" הקודמת.

בעיבוד סטטי, המודל בולע את הווידאו בקצב פריימים קבוע — כברירת מחדל פריים אחד לשנייה, ניתן לכיוון דרך ה-API. ביכולת החדשה, לעומת זאת, המודל פועל בלולאה אגנטית: הוא מפעיל כלים פנימיים כדי לחפש, לסרוק ולבחון קטעי וידאו ספציפיים — פריימים חזותיים, אודיו ותמלול — ובוחר בעצמו מה לצפות בו, באיזה קצב ובאיזה ערוץ מידע, במקום לעבד את כל הקובץ באופן אחיד. לפי גוגל, הגישה הזו מאפשרת בין השאר איתור רגעים ברזולוציה של פחות משנייה, זיהוי אנומליות מדויק יותר וספירה מדויקת של אובייקטים בווידאו.

היתרון בולט במיוחד בווידאו ארוך — ממדריכים בני עשר דקות ועד הרצאות ומצלמות רשומות בנות שעה וחצי ומעלה — שם עיבוד סטטי מציב לרוב את המפתחים בפני בחירה בין עלות טוקנים גבוהה לבין ויתור על פרטים. גוגל מציינת ש-Gemini 3.7 Flash עם היכולת האגנטית מציג את שילוב הדיוק-מול-עלות הטוב ביותר מבין הדגמים שנבדקו. היכולת זמינה כעת להעלאות וידאו ולסרטוני YouTube דרך Gemini API ב-Google AI Studio ובפלטפורמת Gemini Enterprise Agent Platform, ומופעלת על ידי הגדרת תצורת ה-API כ"agentic".

ההשקה מגיעה על רקע הצהרות תקיפות של ראש Google DeepMind החדש, קוריי קבוקצ'ואולו (Koray Kavukcuoglu), שדיבר השבוע על מיקומה האסטרטגי של החברה. לפי דיווח ב-The Decoder, קבוקצ'ואולו דחה את הטענה שגוגל מוותרת מרצון על מירוץ ההובלה בין מודלי ה-AI לטובת יחס מחיר-ביצועים: "אין שום דבר חשוב לנו מלבד להיות בחזית. אני בטוח במאה אחוז שנהיה בחזית", אמר, תוך שהוא מודה שהמודלים הנוכחיים של גוגל "קצת מתחת לחזית" כרגע.

באשר לדגמים העתידיים, קבוקצ'ואולו חזר על כך ש-Gemini 4 הוא "הריצה השאפתנית ביותר" של החברה עד כה, ללא פרטים חדשים, ולא מסר עדכון על Gemini 3.5 Pro, שעל פי הדיווח נמצא בפיתוח כבר חודשים מעבר ללוח הזמנים המקורי. במקום זאת הוא הצביע על ההתקדמות המהירה בסדרת Flash — מ-3.5 דרך 3.6 ל-3.7 — כעדות למעבר, לדבריו, "ממודל שפה לסוכן קוד": "בעצם, להפוך את כל זה לסוכן, ממודל לסוכן... הנדסת תוכנה היא התחום הקריטי ביותר שבו רוצים שהמערכות שלכם יצליחו".

הצירוף של השקת יכולת וידאו אגנטית ממשית עם הצהרות עמומות יותר על החזית מרמז ככל הנראה על אסטרטגיה של גוגל להציג התקדמות מוחשית בשכבת המוצר (Flash, כלים אגנטיים) בזמן שהדגמים הדגלים המתקדמים ביותר עדיין מתעכבים. המשמעות עבור מפתחים היא כלי מעשי וזמין כבר עכשיו לניתוח וידאו זול ומדויק יותר; המשמעות עבור מירוץ ה-AI הרחב יותר היא שגוגל בוחרת להתמקד בפומבי בהנדסת תוכנה וסוכנות כזירת ההוכחה המרכזית שלה, לפחות עד שדגם דגל חדש יגיע.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות