יום שבת, 3 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

reinforcement learning

חומרה ורובוטיקה

רובוטים אנושיים עולים לבמה: מהמחצית במונדיאל ועד שיאי ריצה בבייג'ינג

רובוטים אנושיים מופיעים יותר ויותר מול קהל חי: Atlas של Boston Dynamics הופיע במחצית של משחק בשמינית הגמר של המונדיאל, ובמשחקי הרובוטים האנושיים בבייג'ינג רובוט רץ 100 מטר מהר יותר מהשיא של יוסיין בולט. הממצא המעניין ביותר מגיע דווקא מרובוט שלמד בעצמו סגנון ריצה שמהנדסיו לא תכננו.

חומרה ורובוטיקה

שיאומי מובילה בין המודלים הפתוחים עם MiMo-V2.6-Pro, אך אנתרופיק טוענת לשאיבת נתונים מ-Claude

שיאומי פרסמה את MiMo-V2.6-Pro, שמוביל כעת את דירוג המודלים הפתוחים החזקים בעולם במחיר נמוך משמעותית ממתחרים, הודות להרחבה גדולה של למידת חיזוק. במקביל, אנתרופיק מאשימה את שיאומי ושש מעבדות סיניות נוספות בשאיבה בלתי חוקית של יכולות Claude לצורך אימון המודלים שלהן.

סין

Cognition משיקה את SWE-2: מודל קוד שמתקרב ל-Fable 5.1 בעלות נמוכה ב-64%

חברת Cognition, המפתחת את סוכן הקידוד Devin, שחררה את SWE-2 — מודל קוד שעבר אימון post-training בשיטת reinforcement learning על גבי המודל הפתוח Kimi K3 של Moonshot AI. לפי הדיווח, המודל השיג 50.0% במבחן FrontierCode 1.1 Main, קרוב לנקודת אחוז מציון Fable 5.1, אך בעלות הנמוכה ב-64%.

חומרה ורובוטיקה

יזם AI מפתח סוכנים שיודעים לתכנן קדימה למצבים בלתי צפויים

דניאל הפנר (Danijar Hafner), חוקר AI לשעבר בגוגל ברֵיין וגוגל דיפמיינד, מקים בסן פרנסיסקו סטארטאפ חדשה בשלב stealth שמפתחת סוכני AI המסוגלים לתכנן קדימה למצבי אי-ודאות, ומטמיעה אותם ברובוטים הומנואידים. הפנר נכלל ברשימת "2026 Innovators Under 35" של MIT Technology Review, שבמסגרתה תואר תהליך הפיתוח שלו.

מודלים וכלים

סאם אלטמן מסביר: השהיית אימון RL ב-OpenAI נובעת מקצב מהיר מדי של שיפור היכולות

מנכ״ל OpenAI סאם אלטמן התייחס לדיווחים על השהיית תהליכי אימון מבוססי reinforcement learning (RL) בחברה, וטען כי ההתקדמות של המודלים מהירה כיום באופן חריג. לדבריו, החברה התחייבה מראש לפעול אם תחוש שהיכולות עוקפות את קצב הבטיחות וה-alignment.