HapticVLA: רובוטים לומדים לאחוז בעדינות בלי חיישני מגע בזמן הפעולה
צוות חוקרים הציג את HapticVLA, מודל לשליטה ברובוטים. המודל לומד מנתוני חיישני מגע רק בשלב האימון, ובזמן הפעולה מסתפק במצלמה ובנתוני המצב של הרובוט. בניסויים בעולם האמיתי הוא הגיע לשיעור הצלחה ממוצע של 86.7%, ולפי החוקרים עקף גם מודלים שקיבלו משוב מגע ישיר.
רובוט שאוחז בביצה צריך לדעת בכמה כוח ללחוץ: מעט מדי והיא תחליק, יותר מדי והיא תישבר. בדרך כלל התשובה היא חיישני מגע. מחקר חדש שפורסם ב-arXiv מציע דרך אחרת: להשתמש בחיישני המגע רק בזמן האימון, ולוותר עליהם כשהרובוט כבר עובד. לפי המחברים, המודל שלהם, HapticVLA, הגיע לשיעור הצלחה ממוצע של 86.7% בניסויים בעולם האמיתי.
מה זה VLA, ולמה מגע חשוב
מודלי VLA (ראשי תיבות של Vision-Language-Action, "ראייה-שפה-פעולה") הם מודלי AI שמקבלים תמונה מהמצלמה והוראה בשפה טבעית, ומתרגמים אותן לתנועות של זרוע רובוטית. בשנים האחרונות הם הפכו לאחד הכיוונים המרכזיים במחקר על Physical AI, כלומר בינה מלאכותית שפועלת בעולם הפיזי.
לפי תקציר המאמר, חישת מגע היא יכולת חיונית במודלים כאלה, כי היא מאפשרת מניפולציה עדינה ובטוחה במשימות שכרוכות במגע פיזי רב (contact-rich). הבעיה, כותבים החוקרים, היא שחומרת מגע ייעודית מייקרת את הרובוט ומקשה לשחזר את התוצאות בפלטפורמות רובוטיות אחרות.
איך זה עובד: מורה ותלמיד
הטענה המרכזית במאמר היא שאפשר ללמוד מניפולציה "מודעת מגע" באופן offline, כלומר מראש, ולהפעיל אותה בלי משוב מגע ישיר בזמן הפעולה (inference). השיטה בנויה משני שלבים שקשורים זה בזה:
- SA-RWFM (Safety-Aware Reward-Weighted Flow Matching): בשלב הזה מאמנים רכיב שמייצר פעולות, מה שהמאמר מכנה "action expert", בטכניקה שנקראת flow matching. האימון משלב "תגמולים" מבוססי מגע שחושבו מראש. התגמולים האלה מענישים את המודל על כוח אחיזה מופרז ועל מסלולי אחיזה לא מיטביים.
- Tactile Distillation (זיקוק מגע): המודל מהשלב הראשון משמש "מורה". ממנו מופק ייצוג דחוס של תחושת המגע, token קומפקטי. לאחר מכן מאמנים מודל VLA "תלמיד" רגיל לנבא את ה-token הזה מתוך התמונה ומנתוני המצב של הרובוט בלבד.
בפועל, התלמיד לומד להסיק ממה שהוא רואה מה הוא היה אמור להרגיש. כך, לפי המחברים, נשמרת היכולת לפעול בהתאם לתחושת המגע גם בלי חיישנים על הרובוט עצמו.
התוצאות
בניסויים בעולם האמיתי השיג HapticVLA שיעור הצלחה ממוצע של 86.7%. לפי המאמר, הוא עקף באופן עקבי מודלי VLA שהושוו אליו, כולל גרסאות שקיבלו משוב מגע ישיר מחיישנים בזמן הפעולה. זו אולי הטענה המעניינת ביותר במחקר: מודל שרק "מדמיין" את המגע ביצע טוב יותר ממודלים שחשו אותו בפועל. ייתכן שהסיבה היא שהאימון עם תגמולי הבטיחות מלמד את המודל התנהגות זהירה יותר, אבל זו השערה, והמאמר עצמו הוא שצריך לבסס אותה.
המאמר נכתב בידי עשרה חוקרים, ביניהם קונסטנטין גוברנטורוב (Konstantin Gubernatorov) ודמיטרי צטסרוקו (Dzmitry Tsetserukou). הגרסה הראשונה הוגשה ל-arXiv ב-16 במרץ 2026, והגרסה המעודכנת פורסמה ב-2 באוגוסט 2026. חשוב לזכור ש-arXiv הוא מאגר של מאמרים טרום-פרסום, והעבודה לא בהכרח עברה ביקורת עמיתים.
למה זה חשוב
אם השיטה תעמוד במבחן השחזור, המשמעות היא שאפשר יהיה להשתמש בחיישני מגע יקרים רק במעבדה, בשלב האימון, ולפרוס רובוטים זולים יותר שמסתמכים על מצלמה בלבד. זה עשוי להקל על הכנסת רובוטים למשימות שדורשות עדינות, כמו טיפול בחפצים שבירים. עם זאת, 86.7% הוא ממוצע ממספר מוגבל של ניסויים. עד שהשיטה תיבחן במגוון רחב יותר של רובוטים ומשימות, מוקדם לקבוע עד כמה היא אמינה מחוץ למעבדה.