יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

גוגל מציגה "במאי-שותף" מבוסס AI: ארבע מערכות סוכנים שאמורות להפוך קליפים קצרים לסרטונים רציפים של כמה דקות

Google Research הציגה חבילה של ארבע מסגרות אגנטיות שמתפקדות כ"במאי-שותף" ליצירת וידאו ארוך. המטרה: לחבר קליפים קצרים לסיפור רציף באורך של כמה דקות, ולטפל בשתי התקלות שמפילות היום את רוב מערכות הווידאו מרובות השוטים: "סחיפת זהות" של דמויות וטעויות מצטברות.

חטיבת המחקר של גוגל, Google Research, הציגה מה שהיא מכנה במאי-שותף מבוסס AI ליצירת וידאו ארוך. מדובר בחבילה של ארבע מסגרות אגנטיות (agentic frameworks), כלומר מערכות שבהן כמה רכיבי AI מתכננים, מבצעים ובודקים משימות בעצמם. המטרה שלהן היא לקחת קליפים קצרים ולהפוך אותם לסיפור רציף באורך של כמה דקות.

לפי הדיווח, המערכת מכוונת לשתי בעיות מוגדרות: סחיפת זהות (identity drift) וטעויות מצטברות (cascading errors). אלה שתי התקלות שמפילות כיום את רוב מערכות הווידאו שעובדות עם כמה שוטים ברצף.

למה סרטוני AI ארוכים מתפרקים

מודלי דיפוזיה (diffusion models), המשפחה הטכנולוגית שמאחורי רוב מחוללי התמונה והווידאו הנוכחיים, מסוגלים כבר היום לייצר קליפים קצרים באיכות גבוהה. הקושי מתחיל כשמנסים לחבר כמה קליפים כאלה לסיפור אחד.

סחיפת זהות היא התופעה המוכרת למי שניסה לייצר סרטון עם דמות קבועה. בשוט הראשון לגיבורה יש שיער חום ומעיל אדום, וכמה שוטים אחר כך היא נראית כמו אדם אחר. כל קליפ נוצר בנפרד, והמודל לא תמיד "זוכר" איך הדמות נראתה קודם. בסרט, שבו הצופה צריך לעקוב אחרי אותם אנשים לאורך זמן, זו בעיה בסיסית.

טעויות מצטברות הן בעיה מבנית של כל תהליך שמתבצע בשרשרת. כשכל שוט נבנה על בסיס השוט הקודם, סטייה קטנה בהתחלה, כמו פרט לא נכון ברקע, תנוחה שגויה או שינוי בתאורה, עוברת הלאה ומתעצמת. אחרי כמה שלבים התוצאה כבר רחוקה מהכוונה המקורית.

מה עושה "במאי-שותף"

הבחירה במונח "במאי-שותף" מרמזת על הגישה: במקום לבקש ממודל יחיד לייצר סרטון ארוך במכה אחת, העבודה מחולקת בין כמה סוכנים. זה דומה לאופן שבו מופק סרט אמיתי, עם שלבים של תכנון, צילום ובקרת רציפות. חומרי המקור הזמינים אינם מפרטים את שמות ארבע המסגרות או את אופן החלוקה ביניהן, ולכן אי אפשר לומר בוודאות איזו מהן מטפלת בכל בעיה.

ככל הנראה, ההיגיון הכללי הוא להוסיף שכבה של פיקוח ותכנון מעל מחולל הווידאו עצמו. שכבה כזו אמורה לשמור על עקביות של דמויות לאורך השוטים, ולזהות סטיות לפני שהן מתגלגלות הלאה.

המשמעות

בשנים האחרונות הפער בווידאו גנרטיבי כבר לא נמצא באיכות של פריים בודד. הוא נמצא ביכולת לספר סיפור. קליפ מרשים של כמה שניות הוא כבר עניין שגרתי, אבל סרטון של כמה דקות שבו אותה דמות מופיעה בכמה סצנות ונשארת עקבית עדיין קשה להשגה.

המשמעות האפשרית של המחקר היא מעבר מ"מחולל קליפים" לכלי שמסוגל לשמש בסיס לתוכן נרטיבי: פרסומות, סרטוני הדרכה, תוכן לרשתות ואולי גם שלבים מוקדמים בהפקות קולנוע וטלוויזיה. עם זאת, מדובר בעבודת מחקר. הדיווח אינו מציין אם ומתי היכולות האלה ישולבו במוצרים המסחריים של גוגל, ועד שיתפרסמו תוצאות מפורטות והשוואות, קשה להעריך עד כמה הבעיות אכן נפתרו ולא רק צומצמו.

הכיוון עצמו משתלב במגמה רחבה בתעשייה: שימוש בסוכנים, מערכות שמפרקות משימה מורכבת לשלבים ובודקות את עצמן בדרך, כדי לעקוף מגבלות של מודל יחיד. בווידאו, שבו כל טעות נראית לעין, ייתכן שזה אחד התחומים שבהם הגישה הזו תיבחן בצורה הישירה ביותר.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות