Runway חושפת מחקר ליצירת וידאו AI בזמן אמת: מפרומפט לשידור חי
Runway הציגה מחקר על יצירת וידאו ב-AI בזמן אמת, שבו המשתמש מכוון את הסרטון תוך כדי צפייה במקום להמתין לתוצאה סופית. הגישה מבוססת על GWM-1, מודל העולם של החברה, ומיועדת - לפי רנוויי - להוזיל עלויות חישוב ולפתוח יישומים חדשים בחינוך, גיימינג ורובוטיקה.
חברת יצירת הווידאו Runway חשפה מחקר על יצירת וידאו ב-AI בזמן אמת: במקום להזין פרומפט ולחכות דקות ארוכות לתוצאה סופית, המשתמש יוכל להזרים (stream) את הווידאו תוך כדי שהוא מתאר אותו, ולכוון אותו בזמן שהוא נוצר. כך מדווחת The Decoder.
מהתהליך הנוכחי לשידור חי
מודלי וידאו כיום עובדים בשלבים נפרדים: המשתמש מזין פרומפט, ממתין שניות עד דקות, ומקבל סרטון גמור. אם התוצאה לא מתאימה - צריך להתחיל מחדש. לפי רנוויי, משתמשים מדווחים שוב ושוב שהם מאבדים את רוב הזמן בשלבי היצירה והתיקון, ולכן החברה שואפת לצמצם את הזמן עד לפריים הראשון, ומשם להזרים וידאו בזמן שהמשתמש ממשיך להנחות אותו.
הגישה נבחנה לראשונה במרץ במסגרת Runway Characters, והיא מבוססת על GWM-1 - "מודל העולם הכללי" (General World Model) הראשון של החברה, שהוצג בדצמבר 2025 ונשען על מנוע היצירה Gen-4.5. המודל יוצר וידאו פריים אחר פריים ומקבל כקלט תנועות מצלמה, פקודות לרובוטים או אודיו. לפני מספר שבועות הציגה רנוויי גם את Solaris, מערכת שמייצרת ממשקי משתמש פריים אחר פריים בתגובה ללחיצות או פקודות קול, בשימוש באותה תשתית.
הבעיה: טעויות שמצטברות
מודל וידאו שמייצר בזמן אמת יוצר כל מקטע חדש על בסיס כל הפריימים שנוצרו לפניו. רנוויי מציינת שזה ההבדל המרכזי מול מודלי שפה (LLM): מודל טקסט יכול לתקן את עצמו באמצע משפט, אבל מודל וידאו בונה כל פריים על גבי הקודם - כך שטעות קטנה יכולה לגדול לעיוות משמעותי ככל שהיצירה נמשכת. הפתרון של רנוויי הוא לאמן את המודל גם על הפלטים שלו עצמו, ולא רק על קלט "נקי", כדי ללמד אותו לתקן סטיות במקום להעצים אותן. גישה דומה איפיינה גם את הסטארטאפ Decart, שאימן במכוון את המודל שלו בזמן אמת, MirageLSD, על תמונות פגומות ומעוותות. לשם השוואה, גוגל דיפמיינד מדווחת שמודל העולם שלה, Genie 3, שומר על עקביות בעולמות אינטראקטיביים למשך מספר דקות, ב-24 פריימים לשנייה וברזולוציית 720p.
לפי רנוויי, המעבר ליצירה בזמן אמת מזיז את עיקר עומס החישוב משלב האימון לשלב השימוש: המודל צריך להפיק כל פריים מהר מספיק כדי לעמוד בקצב הצפייה, תוך הרצה על חומרה משותפת בין כמה משתמשים בו-זמנית. החברה טוענת שהעלות לפלט באיכות נתונה היא זו שקובעת אילו יישומים כדאיים כלכלית - ויצירה מיידית עשויה להוריד את הרף הזה ולהפוך יישומים שלא היו רווחיים בעבר לישימים.
למה זה חשוב: מעבר לתוכן, גם לרובוטים ולרכבים אוטונומיים
רנוויי רואה ביישומים אינטראקטיביים - ולא רק בסרטונים גמורים - את השימוש המרכזי ארוך הטווח של מדיה מיוצרת AI. לדבריה, חינוך, גיימינג ורובוטיקה זקוקים לווידאו שמגיב במהירות של הצופה עצמו, ובדיקת האופן שבו רובוטים או רכבים אוטונומיים פועלים בעולם דורשת גם היא סביבות שנוצרות בזמן אמת ומגיבות מיידית למצבי קצה. החברה כבר הציגה בעבר את GWM Robotics, גרסה של GWM-1 שמייצרת נתוני אימון סינתטיים לרובוטים.
גישה דומה נוקטת גם Waymo, עם מודל עולם משלה המבוסס על Genie 3 ומותאם לתנועה בכביש. לפי החברה, המודל מאפשר לה לדמות מצבים שהצי שלה מעולם לא נתקל בהם בפועל - למשל מפגש עם פיל, טורנדו, או שכונת מגורים מוצפת - כשלטענת Waymo, הרכב הנהג האוטונומי שלה "נוסע" מיליארדי קילומטרים בעולמות וירטואליים לפני שהוא נתקל בתרחישים דומים בדרכים האמיתיות. רנוויי עצמה הציגה כבר במרץ תצוגה מקדימה מחקרית של מודל בזמן אמת שפיתחה יחד עם Nvidia, בכנס GTC של החברה.
בשלב זה מדובר במחקר שרנוויי שיתפה בו הצצה, ולא בהשקה מסחרית - כך שהיישום בפועל, קצב ההפצה שלו והשפעתו על עלויות הפקת וידאו ב-AI עדיין פתוחים.