יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

GPT-6 Astra עולה למקום הראשון ב-MazeBench, אבל רוב המבוך עדיין לא נפתר

GPT-6 Astra של OpenAI הגיע למקום הראשון ב-MazeBench, מבחן חשיבה מרחבית בתלת-ממד, עם 14% וללא Python. הציון גבוה מכל מה שהשיגו המודלים הקודמים, אבל עדיין רחוק מפתרון המבחן. במקביל מפתחים מפרסמים שימושים יצירתיים במודל, כמו מפת משחק בתלת-ממד שנבנתה ב-Blender, שמראים גם את היכולות שלו וגם את המגבלות.

GPT-6 Astra של OpenAI הגיע למקום הראשון ב-MazeBench, מבחן חדש שבודק חשיבה מרחבית בעולם תלת-ממדי. לפי דיווח שפורסם ב-36Kr, המודל רץ יותר מ-60 שעות וצבר ציון של 14%, בלי להשתמש ב-Python. זה הציון הגבוה ביותר שנרשם במבחן עד היום. בזמן שהמספרים מצביעים על יתרון בביצועים, משתמשים מפרסמים שימושים יצירתיים במודל: מפות משחק בתלת-ממד וסרטונים שהמודל מייצר בעזרת קוד.

מבוך של 200 חדרים

את MazeBench יצרו ג'ונתן פאפאס ודיוויד פאפאס בסוף יולי. זהו עולם תלת-ממדי עם יותר מ-200 חדרים, ובתוכם מוסתרות 100 אבני חן. כל אבן שווה נקודה אחת, והציון המקסימלי הוא 100. החדרים מלאים בחידות של דחיפת קופסאות, מעליות, קירות שנפתחים ונסגרים ומשטחי קרח חלקלקים. המודל מפעיל את העולם דרך MCP, פרוטוקול שמחבר מודלי שפה לכלים חיצוניים, ויש לו רק 11 פעולות: ארבעה כיווני תנועה, ארבעה סיבובי מצלמה, ביטול, איפוס ושיגור חזרה לחדר שכבר ביקר בו. חידה אחת דורשת בדרך כלל תכנון של יותר מ-100 צעדים.

כשהמבחן פורסם, הוא היה קשה מאוד למודלים המובילים. לפי הדיווח, GPT-5.6 Sol השיג 13% עם Python, ‏Fable 5 של אנתרופיק השיג 11% ו-Opus 5 השיג 9%. בלי Python אף אחד מהם לא הגיע ל-1%. Astra השיג 14% בלי Python בכלל. במפת חום שפורסמה, שמראה אילו אזורים כל מודל חקר, Astra עבר כמעט בכל המפה. Fable 5.1 הסתובב במעגל קטן בפינה ונעצר.

כדי לחסוך בעלויות, צוות המבחן ביקש מ-Astra לבצע פעולות באצוות: לתכנן 10 עד 20 צעדים קדימה בכל פעם, במקום להחזיר תשובה אחרי כל צעד. לפי הדיווח, השיטה הזו הקטינה את צריכת ה-tokens (יחידות הטקסט שהמודל מעבד ושלפיהן מחושבת העלות) מ-3 מיליארד ל-350 מיליון.

ההטיה של המודל

14% הם עדיין ציון נמוך. הדיווח מצביע על הטיה במודל: Astra נוטה להסתכל על השלבים מלמעלה, ולכן הוא מתייחס לקירות שנראים רק מזווית תלת-ממדית כאילו אינם קיימים. הוא עובר את שלבי ההדרכה, אבל נתקע לגמרי בחידות שבהן הבלוקים מוערמים ביותר משלוש שכבות. ככל הנראה, המשמעות היא שהמודל מוביל בפער, אבל הבנה מרחבית מלאה עדיין רחוקה.

מ-Blender לסרטון

לצד המבחנים, משתמשים בודקים את Astra במשימות מעשיות. בבלוג Agent Workflow Lab פורסם ניסוי שבו המודל התבקש לבנות סמטה בסגנון ניאו-סאיטאמה, העיר מסדרת "Ninja Slayer", כמפה למשחק תפקידים שולחני (TRPG). Astra לא הזיז אובייקטים ידנית ב-Blender. הוא הריץ קוד Python באצוות דרך Blender MCP של Hermes. התוצאה כוללת דוכן ראמן, מרפאה לניתוחי סייבר, שער טורי, מקדש קטן ומעברים בין הגגות. בסוף המודל הפיק גם סרטון של קפיצה מהגג מנקודת המבט של נינג'ה, כולל נחיתה וקולות צעדים שהכותב לא ביקש.

הכותב מציין גם חסרונות: לבניינים אין פנים, והמפה לא מוכנה לשימוש במנוע משחק. גם השלטים יצאו "תקינים מדי". "Cyber Surgery" מתאים לסייבר-פאנק, אבל חסרים בו הניסוחים המוזרים שמאפיינים את הסדרה. לדבריו, התוצאה היא יותר טיוטה תלת-ממדית למנחה המשחק מאשר מוצר גמור.

ברשת מופצות דוגמאות נוספות, שלא אומתו. משתמש ברדיט טען שביקש מ-Astra סרטון על "זמן", וקיבל סרטון שנכתב כולו ב-JavaScript: מהמפץ הגדול ועד המודל עצמו שכותב את הקוד של הסרטון.

למה זה חשוב

שני סוגי המקורות מתחברים לתמונה אחת: מדדים מספריים מראים ש-Astra מוביל, ושימושים יצירתיים מראים איך היתרון הזה נראה בפועל. ככל הנראה OpenAI מחזקת בכך את מעמדה בצמרת. עם זאת, המקורות עצמם מראים את הגבולות: 14% במבחן מרחבי, ומפות שעדיין צריכות עבודה של אדם כדי להפוך למוצר שמיש.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות