Reka AI משיקה את Rho-1: רשת אחת לטקסט, תמונה, וידאו ושליטה ברובוטים
חברת Reka AI פרסמה גרסת מחקר מוקדמת של Rho-1, מודל בן 19 מיליארד פרמטרים שמעבד ומייצר טקסט, תמונות, וידאו ופקודות שליטה לרובוטים, כולם ברשת נוירונים אחת ובחלון הקשר משותף. המודל מייצר וידאו רציף בזמן אמת, ואת המחסור בנתוני אימון לרובוטיקה החברה עקפה בעזרת הפקת אותות שליטה מסרטוני אינטרנט רגילים.
חברת Reka AI פרסמה גרסת מחקר מוקדמת (research preview) של Rho-1. זה מודל בן 19 מיליארד פרמטרים שמעבד ומייצר טקסט, תמונות, וידאו ופעולות שליטה ברובוטים, והכול ברשת נוירונים אחת. החברה מגדירה אותו "omni-model", כלומר מודל אחד שמטפל בכל סוגי המידע (מודליות).
בלי מודלים חיצוניים ובלי קריאות לכלים
רוב מערכות ה-AI שמטפלות בכמה סוגי תוכן עובדות כמו מרכזייה. מודל מרכזי מקבל את הבקשה ומעביר אותה למודל ייעודי: אחד ליצירת תמונות, אחר לווידאו, ולפעמים מערכת נפרדת לגמרי לשליטה ברובוט. Rho-1 בנוי אחרת. לפי הדיווח ב-The Decoder, כל המודליות מיוצגות בו כ-tokens, יחידות המידע הבסיסיות שמודלי שפה עובדים איתן. כולן נמצאות באותו חלון הקשר (context window), בלי קריאות לכלים (tool calls) ובלי מודלים חיצוניים.
היכולת המוחשית ביותר שהחברה מציגה היא יצירת וידאו רציף בזמן אמת. המודל מגיב להוראות חדשות תוך כדי יצירה, בלי להתחיל מחדש. פרט מעניין נוסף: אותם משקלים (weights) שחוזים את התמונות שתראה מצלמה הם גם אלה שמניעים את תנועות הרובוט. המשמעות, ככל הנראה, היא שהמודל לומד במקביל "מה אני רואה" ו"מה אני עושה", במקום ששני רכיבים נפרדים ינסו לתאם ביניהם.
לעקוף את המחסור בנתוני רובוטיקה
אחד החסמים הידועים בתחום הרובוטיקה הוא מחסור בנתוני אימון. טקסט ותמונות יש באינטרנט בכמויות עצומות, אבל הקלטות של רובוטים שמבצעים משימות, יחד עם פקודות השליטה המדויקות שהפעילו אותם, נדירות ויקרות לאיסוף. כדי לעקוף את הבעיה, Reka AI בנתה inverse dynamics model, מודל שמסיק בדיעבד מאילו פעולות נוצרה התנועה שרואים בסרטון. בעזרתו החברה מפיקה אותות שליטה מסרטוני אינטרנט רגילים. אם הגישה תעבוד בקנה מידה רחב, היא עשויה להפוך את מאגר הווידאו הקיים ברשת למקור לאימון רובוטים.
Rho-1 אומן על 320 מעבדי H100 במשך כשלושה חודשים.
לא הצעד הראשון של החברה
Reka AI כבר עבדה על AI רב-מודלי. באפריל 2024 השיקה החברה את Reka Core, מודל שפה רב-מודלי שהתחרה במבחני ביצועים (benchmarks) ב-GPT-4, ב-Claude 3 וב-Gemini Ultra.
ההשקה הנוכחית משתלבת במגמה רחבה במחקר ה-AI שמכוונת למה שמכונה world models, "מודלי עולם". הכוונה למערכות שאמורות ללמוד איך העולם הפיזי מתנהג ולחזות מה יקרה בו, ולא רק לייצר טקסט.
למה זה חשוב
לשלב מודליות שונות כל כך, מטקסט ועד פקודות מנוע לרובוט, במודל אחד ובגודל של 19 מיליארד פרמטרים, זה הישג טכני של ממש. זה נכון במיוחד כשהמודל גם מייצר וידאו בזמן אמת. ככל הנראה המשמעות היא שהמודל מחזיק ייצוג משותף של מה שהוא רואה, אומר ועושה, ולא רק מעביר מידע בין רכיבים נפרדים.
עם זאת, מדובר בגרסת מחקר מוקדמת. מחומרי המקור לא ברור עדיין איך Rho-1 מתמודד מול מודלים ייעודיים בכל אחד מהתחומים, ואם ומתי הוא יהיה זמין לשימוש רחב. השאלה המעשית, כנראה, היא אם מודל אחד שעושה הכול יכול להתקרב לביצועים של מודלים שמתמחים בדבר אחד, או שהיתרון שלו הוא דווקא ביכולת לחבר בין המודליות.