יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

GPT-6 Astra של OpenAI מוביל במבחן חדש: זיהוי טעויות בהרכבת רהיטי איקאה

Epoch AI פרסם מבחן חדש שבודק אם מודלי AI מזהים טעויות בתמונות של רהיטי איקאה בשלבי הרכבה. המודל GPT-6 Astra של OpenAI הגיע לראש הטבלה עם 80% דיוק, ואחריו Claude Fable 5.1 ו-Claude Opus 5 של אנתרופיק. לפני עשרה חודשים בלבד התוצאה הטובה ביותר עמדה על 28%.

מכון המחקר Epoch AI פרסם מבחן חדש, Furniture Assembly Benchmark (FAB), שבודק אם מודלי בינה מלאכותית מסוגלים לזהות טעויות בתמונות של רהיטי איקאה בשלבי הרכבה שונים. בראש הטבלה נמצא GPT-6 Astra של OpenAI, עם 80% דיוק. במקומות הבאים: Claude Fable 5.1 של אנתרופיק עם 70% ו-Claude Opus 5 עם 61%.

חשוב לדייק: אף מודל במבחן לא הרכיב רהיט בפועל. המבחן בודק הבנה חזותית ומרחבית, כלומר את היכולת להסתכל על תמונה, להשוות אותה להוראות ההרכבה ולקבוע אם ואיפה משהו השתבש.

איך המבחן בנוי

החוקרים קנו שלושה רהיטי איקאה ברמות קושי שונות: מתקן הנעליים STÄLL (הרכבה משוערת של שעה וחצי לאדם), מסגרת המיטה TONSTAD (שלוש וחצי שעות) והשידה GULLABERG (חמש שעות). את הקושי מדד "מדד המורכבות של איקאה", שמכפיל את מספר השלבים במספר החלקים. הציונים נעים בין 4,032 למתקן הנעליים ל-21,320 לשידה.

במהלך ההרכבה צילמו החוקרים את התהליך ושתלו בכוונה טעויות מציאותיות. במקרים רבים הם גם המשיכו לבנות אחרי הטעות, כדי שיהיה קשה יותר לאתר אותה. דוגמה אחת: לוח שהצד המצופה שלו פונה פנימה במקום החוצה. המבחן כולל 60 תמונות, חלקן של הרכבה תקינה וחלקן עם טעויות.

כל מודל קיבל את חוברת ההוראות כקובץ PDF, כלי זום לבחינת פרטים בתמונה ומפרש Python. הוא גם הוגבל ל-80 צעדים לכל תמונה, אבל בפחות מ-5% מהמקרים המודלים הגיעו לתקרה הזו. כדי לקבל ניקוד, המודל צריך לזהות את כל השלבים שבהם נפלה טעות ולתאר כל טעות בצורה סבירה. את התיאורים בדק מודל שופט, GPT-5.6 Sol, שהונחה לנהוג בסלחנות.

קפיצה גדולה בתוך פחות משנה

לפי Epoch AI, בנובמבר 2025 התוצאה הגבוהה ביותר במבחן הייתה 28%, והיא הושגה על ידי Claude Opus 4.5 של אנתרופיק. עשרה חודשים אחר כך המודל המוביל מגיע ל-80%. GPT-6 Astra בולט גם במהירות: הזמן החציוני שלו הוא שלוש דקות לתמונה, המהיר ביותר מכל המודלים שנבדקו. לפי החוקרים, זה פי שניים עד פי עשרה מהר יותר מהמודלים שהובילו לפניו.

בסך הכול נבדקו 21 מודלים של OpenAI, אנתרופיק, גוגל, Moonshot ועליבאבא. בתחתית הטבלה נמצא Qwen3.8 Max של עליבאבא עם 20%. לפי החוקרים, המקום הראשון תמיד היה שמור למודל סגור (closed-weight), ומודלים סיניים בקוד פתוח (open-weight), שהמשקולות שלהם זמינות לציבור, מפגרים אחרי החזית בשבעה חודשים לפחות.

ממצא מעניין נוסף: לא נמצא קשר ברור בין מדד המורכבות של הרהיט לבין הקושי של המודלים. החוקרים מעריכים שגורמים אחרים השפיעו יותר, למשל עד כמה הטעות עדינה, מאיזו זווית צולמה התמונה וכמה רחוק המשיכה ההרכבה אחרי הטעות.

למה זה חשוב

החוקרים מציגים את המבחן כמדד עקיף למשימות בעלות ערך כלכלי שדורשות חשיבה חזותית ומרחבית דומה, כמו תיקון רכב או מכשירי חשמל ביתיים. לדבריהם, אם המודלים יגיעו לרמה מספיק מהירה ומדויקת בתחום הזה, סביר ש-AI יוכל בקרוב לתת הנחיה אמינה בזמן אמת במשימות הרכבה ותיקון מורכבות.

עם זאת, יש כמה הסתייגויות. המבחן קטן יחסית, 60 תמונות משלושה רהיטים בלבד. הביצועים של בני אדם עדיין לא נמדדו, אף שהחוקרים מעריכים שרבות מהטעויות יהיו קשות לזיהוי למי שלא מכיר את ההרכבה. ובנוסף, השיפוט נעשה על ידי מודל שפה מקל. המשמעות, ככל הנראה, היא שהתוצאות מצביעות על מגמה ברורה של שיפור, אבל עוד מוקדם לראות בהן הוכחה שמודל יכול להחליף טכנאי מנוסה.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות