IROS 2026: מודלי VLA, חישת מגע ודיפוזיה לתנועה בולטים בכנס הרובוטיקה
לפי רשמים של משתתף, בכנס IROS 2026 בלטו שלוש מגמות: מודלי VLA שממירים תמונה ופקודה טקסטואלית לפעולות של רובוט, חישת כוח ומגע, ושימוש בדיפוזיה כדי לייצר תנועה. במקביל פרסמה Black Forest Labs את FLUX 3 Action, מודל פתוח שלפי נתוני החברה עוקף את המודלים הפתוחים המובילים במדד RoboLab.
בכנס הרובוטיקה הבינלאומי IROS 2026 בלטו כמה מגמות: מודלים שמתרגמים תמונה ופקודה בשפה טבעית ישירות לתנועות של רובוט, מחקרים רבים על חישת כוח ומגע, ושימוש בטכניקות דיפוזיה כדי לתכנן תנועה במקום לייצר תמונות. כך לפחות עולה מרשמים שפרסם משתתף בכנס אחרי סיבוב בין מושבי הפוסטרים. מדובר בהתרשמות אישית ולא בסיכום רשמי של הכנס. עם זאת, מודל חדש שפרסמה Black Forest Labs מדגים היטב את הכיוון שהוא מתאר.
שלוש מגמות, כפי שדווחו
VLA בכל מקום. מודלי Vision-Language-Action, או בקיצור VLA, מקבלים תמונה ממצלמה והוראה בטקסט ומחזירים ישירות את הפעולה שהרובוט צריך לבצע. לפי הדיווח, שלא אומת, הוקדשו להם שמונה מושבים נפרדים בתוכנית הכנס.
רובוטים שמרגישים. לפי אותו משתתף, עבודות רבות עסקו בכוח, במגע ובחיישני מישוש. המסקנה שהוא מציע היא שכדי לעבוד עם ידיים, מצלמות לבדן לא מספיקות. ככל הנראה המשמעות היא שהתחום מבין שראייה ממוחשבת טובה לא מבטיחה שהרובוט יצליח לאחוז בחפץ שביר או להרכיב חלקים.
דיפוזיה לתנועה. דיפוזיה ו-flow matching הן שיטות שהתפרסמו בזכות מחוללי תמונות. לפי הדיווח, הן משמשות עכשיו לייצור תנועות של רובוט.
המשתתף ציין גם נוכחות גדולה של רובוטים דמויי אדם (humanoids), מהליכה ועד שליטה בכל הגוף.
FLUX 3 Action: הדגמה מעשית
Black Forest Labs, המוכרת ממודלי יצירת התמונות FLUX, פרסמה את FLUX 3 Action (F3A). יחד עם המשקולות היא פרסמה דו"ח שמפרט את כל שלבי האימון וההתאמה. החברה מדגישה שברובוטיקה "מתכון ה-fine-tuning חשוב בדיוק כמו המשקולות".
הדו"ח מתאר בחירה קשה שעומדת היום בפני מפתחים. מצד אחד יש מודלי World Action Models (WAM), שחוזים וידאו ופעולות יחד. הם מובילים במדד RoboLab, אבל הם יקרים להרצה. מצד שני יש מודלי VLA, שמהירים יותר אבל מצליחים פחות. לפי הנתונים בדו"ח, Cosmos 3 Nano, מודל WAM, מצליח ב-36.8% מהמשימות. Pi0.5, מודל ה-VLA הפתוח החזק ביותר, מצליח ב-28.0%. על כרטיס B200, מודל Cosmos דורש בערך פי 4.7 זמן עיבוד מ-Pi0.5 לכל שנייה של תנועת רובוט.
לפי החברה, F3A מצמצם את הפשרה הזו. גרסת 7B שלו מגיעה ל-38.3% הצלחה ב-RoboLab, והיא מהירה פי 1.34 עד 2.28 מ-Pi0.5 לכל שנייה של תנועה, על כרטיסי GPU לתחנות עבודה ולמרכזי נתונים. החברה מבהירה שהמדד הוא קצב ביחס לזמן אמת ולא השהיה (latency) של כל קריאה: F3A חוזה 2.13 שניות של תנועה בכל פעם, לעומת שנייה אחת ב-Pi0.5. גרסה נוספת, שבה החברה ויתרה על חלק מהמהירות, מגיעה לפי הדו"ח ל-42.2% הצלחה.
בנוסף בדקה החברה מערכות היברידיות, שבהן מודל מהיר שולט בתנועה ומודל חשיבה (reasoning) מתקדם מתכנן. לפי הדו"ח, השילוב מגדיל את ההצלחה ביחס לעלות בעד 53.64%. החברה בוחנת גם משחקי וידאו כסביבת ניסוי לניווט, כהכנה לסוכנים שמפעילים מחשב.
למה זה חשוב
המגמות שתוארו מ-IROS וההשקה של F3A מצביעות ככל הנראה על אותו כיוון: טכניקות שפותחו ליצירת תמונות ווידאו עוברות לעולם הפיזי. הסיבה, לפי ההסבר של Black Forest Labs, היא שאימון על תמונות, וידאו ושמע מספק הרבה יותר נתונים מאשר הדגמות של פעולות רובוט בלבד, וכך המודל לומד להכליל טוב יותר. השאלה שנשארת פתוחה היא אם התוצאות במדדים כמו RoboLab יתורגמו לביצועים דומים מחוץ למעבדה.