יום שבת, 3 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

סוכני AI בונים סצנות 3D מתמונה אחת, אבל לא יודעים להעריך אם צדקו

חוקרים מאוניברסיטת מרילנד ומ-AWS הראו שסוכני קוד מסוגלים לשחזר סצנת 3D מתמונה אחת בעזרת קוד ל-Blender. עם זאת, כשהסוכנים נדרשים לשפוט את הדיוק הגיאומטרי של מה שבנו, הם מצליחים בערך כמו הטלת מטבע. כלי שבנו החוקרים, שמחליף את השיפוט העצמי במדידות, שיפר את כל המודלים שנבדקו.

סוכני AI שכותבים קוד כבר מסוגלים לבנות סצנת תלת-ממד שאפשר לערוך מתוך תמונה אחת. עם זאת, מחקר חדש מצביע על חולשה בסיסית: הם כמעט לא מסוגלים לדעת אם התוצאה מדויקת. כשהמודלים נדרשו לבחור איזו מבין שתי גרסאות של סצנה קרובה יותר למקור, השיפוט הגיאומטרי שלהם יצא ברמת ניחוש אקראי או מתחתיה.

מתמונה לתוכנית הרצה

את הפרויקט, LEGO-Anything, פיתחו חוקרים מאוניברסיטת מרילנד ומ-AWS. הגישה נקראת Image-to-Code: סוכן קוד מקבל תמונה אחת וכותב קוד ל-Blender, תוכנת תלת-הממד הנפוצה. הסוכן לא מייצר את הסצנה במהלך אחד. הוא כותב קוד, מריץ אותו, בוחן את התוצאה ומתקן, וחוזר על התהליך עד שהסצנה תואמת את התמונה המקורית.

התוצר הוא תוכנית ולא רק תמונה, ולכן היא מגדירה במפורש את האובייקטים, הגיאומטריה, הפריסה ומיקום המצלמה. אפשר להריץ אותה, לבדוק אותה ולשנות אותה כמו כל קוד אחר. ככל הנראה זה היתרון המרכזי של הגישה: התוצאה שקופה וניתנת לבדיקה, לא קופסה שחורה.

מבחן עם תשובות ידועות מראש

כדי למדוד את ביצועי הסוכנים בנו החוקרים מבחן ייעודי בשם LEGO-Bench. הוא כולל 208 תמונות מ-104 סצנות פנים וחוץ, ומשתמש ב-443 נכסים דיגיטליים רשומים. לתמונות אמיתיות אין "תשובה נכונה" תלת-ממדית מדויקת להשוואה, וסצנות סינתטיות פשוטות נראות לא אמינות. לכן החוקרים בחרו בדרך ביניים: הם רינדרו את התמונות מסצנות סימולציה שנבנו באופן מקצועי. התמונות נראות טבעיות, והגיאומטריה המדויקת, העומק ושיוך האובייקטים נשמרים בסתר ומשמשים כמפתח תשובות לציון אוטומטי.

כל סצנה מקבלת ציון בשלושה צירים: תקינות (האם התקבל תוצר שמיש בכלל), שחזור (עד כמה הגיאומטריה הנראית מדויקת) ומראה (עד כמה הסצנה דומה למקור בהשוואה פיקסל-מול-פיקסל).

תוצר שמיש, גיאומטריה חלשה

כמעט בכל הרצה, כל שש התצורות של GPT שנבדקו סיפקו סצנה עובדת. הדיוק, לעומת זאת, השתנה מאוד בין התצורות. המודל החזק ביותר, GPT-6 Astra, הגיע ל-53.4 אחוז בסצנות פנים ול-39.6 אחוז בסצנות חוץ. תצורות חלשות יותר קיבלו כ-15 אחוז. ככל שהסצנה מורכבת יותר הדיוק יורד, וסצנות חוץ קשות יותר מסצנות פנים. כשהחוקרים הגדילו את "תקציב החשיבה" של המודלים, הציון של Astra בתת-קבוצת סצנות משרד קפץ מ-32.3 ל-61.8 אחוז.

ניתוח שלבי העבודה של הסוכנים העלה שלוש בעיות שחזרו שוב ושוב: ניסיון פתיחה חלש, תיקונים שמבטלים התקדמות קודמת, והערכה עצמית לא אמינה. אפילו GPT-6 Astra הרס את הסצנה שלו בשלב מאוחר של אחת ההרצות, והציון צנח מ-33.9 ל-4.4 אחוז.

הפתרון: מדידה במקום שיפוט עצמי

החוקרים הסיקו שתהליך השיפור צריך להישען על מדידות קונקרטיות ולא על שיפוט הסוכן עצמו. על בסיס זה בנו את LEGO-Plugin, הרחבה שלא דורשת אימון נוסף. היא מעגנת את סצנת הפתיחה בתמונת הייחוס, מחליפה את השיפוט העצמי במדידות, ומגינה על התקדמות נכונה מפני עריכות שמחזירות את הסצנה לאחור. התוסף שיפר את כל ששת המודלים. החלשים נהנו ממנו יותר מכולם, עם שיפור של עד 62.7 אחוז, ואילו המודל המוביל הרוויח רק כשתי נקודות אחוז.

לבסוף, החוקרים בדקו אם הסצנות המשוחזרות יכולות לשמש בסיס למשימות ראייה ממוחשבת סטנדרטיות: זיהוי אובייקטים, סגמנטציה (חלוקת התמונה לאזורים לפי אובייקטים) והערכת עומק. ללא אימון נוסף התוצאות היו שמישות אבל לא בולטות. הכי טוב הלך בזיהוי אובייקטים, שהגיע לכמחצית מהביצועים של מערכות ייעודיות.

למה זה חשוב

המשמעות רחבה יותר מתחום התלת-ממד. סוכני AI רבים עובדים בלולאה של ניסיון, בדיקה עצמית ותיקון, והמחקר מרמז שהחוליה החלשה בלולאה הזו היא הבדיקה העצמית. אם סוכן לא יודע להבחין בין שיפור להרעה, כל סבב נוסף עלול להזיק במקום לעזור. ככל הנראה, הלקח המעשי למפתחים הוא לבנות לסוכנים מנגנוני מדידה חיצוניים ולא לסמוך על כך שהם יזהו את הטעויות של עצמם.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות