יום שלישי, 6 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מקוביות בסגנון מיינקראפט ועד Blender: זירות חדשות בודקות אם מודלי AI מבינים מרחב

שתי זירות השוואה פתוחות מבקשות ממודלי שפה ומסוכני AI לבנות עצמים תלת-ממדיים, והגולשים מצביעים בעיוורון על התוצאה הטובה יותר. MineBench מדרגת מודלים לפי מבנים מקוביות, ו-Render Arena בודקת בניית מודלים ב-Blender. במקביל מופיע דיווח, שעדיין לא אומת, על מודל בשם Kolibri-1 שמשחק Breakout בזמן אמת.

אפשר לבדוק אם מודל שפה מבין מרחב בלי ללמד אותו לראות: מבקשים ממנו לבנות משהו, ונותנים לבני אדם להחליט מה יצא טוב יותר. על הרעיון הזה בנויות שתי זירות השוואה פתוחות לציבור: MineBench, שבה מודלים בונים מבנים מקוביות, ו-Render Arena, שבה סוכני AI בונים מודלים תלת-ממדיים בתוכנת Blender.

בונים בתיאור מילולי בלבד

המודלים ב-MineBench מקבלים תיאור בשפה טבעית, למשל "בקתת עץ חמימה ליד בריכה, עם ארובת אבן, מזח קטן וכמה עצים". בתגובה הם מחזירים רשימה של קואורדינטות וסוגי קוביות (עץ אלון, אבן וכדומה) בפורמט JSON. לפי האתר, המודלים לא מקבלים תמונות ולא כלי תלת-ממד. הפלט מוצג כמו שהוא, בלי עיבוד נוסף.

אחר כך המשתמשים רואים שני מבנים זה לצד זה ומצביעים: A ניצח, B ניצח, תיקו או "שניהם גרועים". הקולות מזינים טבלת דירוג חיה בשיטת Elo, אותה שיטה שמדרגת שחקני שחמט. בתרשים שמסביר באתר איך השיטה עובדת מופיעים GPT-5.4 עם 2150 נקודות, Claude 4.5 עם 2108 ו-Gemini 3 Pro עם 2091. מהעמוד לא ברור אם אלה נתוני הטבלה העדכנית או דוגמה להמחשה. בנוסף, האתר מאפשר לכל אחד לנסות פרומפטים משלו, ולפי הכתוב בו, לזמן מוגבל אפשר לייצר בלי הגבלה עם Gemini 3.8 Flash בלי מפתח API.

הסיבה שהשיטה מעניינת: מודל שפה מעבד טקסט ברצף, מילה אחרי מילה. כדי לבנות בקתה שהארובה שלה באמת עומדת על הגג, הוא צריך לעקוב בראש אחרי מיקום של מאות קוביות ושל הקשרים ביניהן. זה כנראה מבחן ישיר יותר ליכולת הזאת מרוב המבחנים המקובלים.

גם ה"רתמה" נכנסת לתמונה

Render Arena לוקחת את הרעיון צעד קדימה. כאן לא מבקשים רשימת קוביות, אלא שסוכן AI יעבוד בתוך Blender, תוכנה מקצועית לעיצוב תלת-ממדי. גם כאן ההשוואה עיוורת: שני מועמדים, A ו-B, שאפשר לסובב ולבחון כמודל תלת-ממדי בפורמט GLB, לצד תמונה מעובדת (render) של הסצנה.

לפי הפוסט שבו השיק היוצר את הזירה, הוא הריץ יותר מ-1,200 סשנים של בנייה ב-Blender עם מודלים שונים. הוא גם מציין שהזירה נוצרה בהשראת MineBench ושהפרומפטים הראשונים נלקחו ממנה. אלה נתונים שהיוצר עצמו מסר, ולא אומתו באופן עצמאי. החידוש שהוא מדגיש הוא השוואה של ה-harness ולא רק של המודל. ה-harness, או "הרתמה", היא שכבת התוכנה שמפעילה את המודל כסוכן: מעבירה לו את ההוראות, נותנת לו כלים ומריצה את הפעולות שלו. ככל הנראה המטרה היא לבדוק עד כמה התוצאה תלויה בסביבה שבה המודל רץ, ולא רק במודל עצמו.

ובינתיים, Breakout

בקהילת המודלים המקומיים הופיע גם דיווח על מודל בשם Kolibri-1. לפי הדיווח, המודל מתרגם הסתברויות לפעולות ומשחק את משחק הארקייד הקלאסי Breakout עד הסוף, עם פחות מ-25 אלפיות שנייה לכל מהלך. לדיווח לא צורף מקור עצמאי, ולכן אין לו כרגע אימות, ואין גם פרטים על גודל המודל או על שיטת האימון.

למה זה חשוב

המשותף לכל הניסויים האלה הוא מעבר ממבחנים שבודקים מה המודל יודע למבחנים שבודקים מה הוא מסוגל לעשות: לבנות, לתמרן ולהגיב בזמן אמת. ההצבעה של בני אדם קרובה יותר לשאלה שמשתמשים באמת שואלים ("מה נראה טוב יותר?"), אבל יש לה גם מגבלות. היא תלויה בטעם של המצביעים ובמספר הקולות. ההכללה של ה-harness בהשוואה מרמזת ככל הנראה על כיוון רחב יותר בתחום: כשמודלים הופכים לסוכנים, "איזה מודל הכי טוב" כבר לא שאלה מספיקה, וצריך לשאול גם באיזו מערכת הוא רץ.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות