GPT-6 אסטרה כובשת תחומים: מגיימינג לקריפטוגרפיה
מודל GPT-6 Astra של OpenAI מפגין בשבוע האחרון יכולת חריגה לעבור בין תחומים רחוקים: שיאי השלמה במשחקי וידאו מורכבים כמו פוקימון ומיינקראפט, ופענוח הודעת צבא גרמני מוצפנת מ-1941 שנותרה בלתי פתורה 83 שנה. לצד זה מדווחים משתמשים גם על ניסויים חובבניים, כמו ניסיון להתאים מערכת הפעלה חדשה לסמארטפון נדיר בעל שני מסכים — דיווח שטרם אומת באופן עצמאי.
כותרת: GPT-6 אסטרה כובשת תחומים: מגיימינג לקריפטוגרפיה
תקציר: מודל GPT-6 Astra של OpenAI מפגין בשבוע האחרון יכולת חריגה לעבור בין תחומים רחוקים: שיאי השלמה במשחקי וידאו מורכבים כמו פוקימון ומיינקראפט, ופענוח הודעת צבא גרמני מוצפנת מ-1941 שנותרה בלתי פתורה 83 שנה. לצד זה מדווחים משתמשים גם על ניסויים חובבניים, כמו ניסיון להתאים מערכת הפעלה חדשה לסמארטפון נדיר בעל שני מסכים — דיווח שטרם אומת באופן עצמאי.
מודל GPT-6 Astra של OpenAI צובר בימים האחרונים שורת הישגים שמדגימה, לפי גורמים שבדקו אותו, גמישות יוצאת דופן בין תחומים שאין ביניהם דבר משותף לכאורה — ממשחקי וידאו ועד קריפטואנליזה היסטורית.
שיאים בגיימינג
לפי דיווח באתר The Decoder, בפרויקט הקהילתי "GPT Plays Pokemon" השלים Astra את המשחק Pokemon FireRed והפך לאלוף תוך 18 שעות ו-12 דקות — לעומת 96 שעות ו-35 דקות שנדרשו לדגם הקודם GPT-5.6 Sol, ומודל GPT-5.5 שלא הצליח לסיים את המשחק גם אחרי יותר מ-218 שעות.
בבדיקה של חברת Vals AI, המודל שיחק במיינקראפט 141 שעות ברצף עד שהריצה הופסקה, לאחר שהגיע רחוק יותר מכל מערכת AI שנבדקה קודם לכן: בנה חוות בלייז חצי-אוטומטית וכינס את המרכיבים ל"עיני אندר" הנדרשות למציאת שער הקרב הסופי. בדרך גם קרתה תקלה — קריפר פוצץ תיבת אחסון עם כל השלל, ולפי הדיווח Astra תיעד לעצמו הערה על השיעור שלמד ("לעולם לא לאחסן פריטים קריטיים בתיבה לא מוגנת") ואז השקיע שעות בגידול תפוחי אדמה. לשם השוואה, מודל ה-AI הראשון שנבחן במיינקראפט, VPT של OpenAI מ-2022, הגיע לקרדום יהלום ב-2.5% מהריצות.
גם ב-Factorio: Space Age, דרך ממשק Lua מותאם, ייצר Astra "חבילות מדע כחולות" כעבור כשעתיים ושיגר טיל תוך כ-10 שעות — הישג שמודלים מתחרים, GPT-5.6 Luna ו-Fable 5.1, לא הגיעו אליו כלל באותה סביבה. Astra גם השלים לפי הדיווח את Portal עד הקרדיטים, את Fallout 2 תוך 22 שעות ואת עלילת Fallout 3 המרכזית תוך כ-59 שעות.
התמונה מתחדדת בבנצ'מארק ARC-AGI-3, שבודק יכולת להבין חוקי משחק לא מוכרים תוך כדי משחק בפועל: Astra קיבל ציון 62.7% בממשק הסטנדרטי (וכ-99.9% בממשק הקנייני של OpenAI), לעומת 7.78% בלבד ל-GPT-5.6 Sol ומעט מעל 30% ל-Claude Opus 5. לפי ARC Prize, הארגון שמפעיל את הבנצ'מארק, המודל מתרגם מכניקות משחק לא מוכרות לייצוג סמלי מצומצם שהוא בונה בעצמו — כלומר, מה שחוקרים בפרויקטים קודמים כמו Voyager (2023, בשיתוף Nvidia ו-Caltech) תכנתו ידנית סביב המודל, Astra כעת מבצע בעצמו וללא ממשק ייעודי למשחק, רק דרך מסך, עכבר ומקלדת.
פענוח הודעת אניגמה בת 83 שנה
בזירה שונה לחלוטין, דיווח נוסף מתאר כיצד קרטר לפן, מפתח מוצר בבלומברג בניו יורק, השתמש ב-Astra כדי לפענח הודעת רדיו גרמנית מוצפנת באניגמה מה-10 ביולי 1941, שבה דיווח חייל שממתין להוראות מסע וביקש תשובה מיידית. ההודעה, בת 82 תווים, הופיעה כבלתי פתורה בארכיון הודעות צבא גרמני מיורטות. לפי לפן, גרסת "Astra Extra High" עבדה כ-10 שעות על הבעיה — חיפוש בארכיונים, בניית סימולטור אניגמה, כתיבת קוד קריפטואנליזה והרצת ניסויים מקבילים. הפריצה הגיעה מהודעה אחרת מאותו יום שכללה פעמיים את שם העיר רוזנוב, ומחולשה ידועה באניגמה שלפיה המכונה מעולם לא מצפינה אות כאת עצמה. הטקסט המפוענח כלל את הביטויים הגרמניים "תשובת רדיו מיידית" ו"פירוט מסלול המסע", ואומת מול כותרת הודעה שנשמרה בנפרד בארכיון. לפי לפן, קוד המקור, נתוני החיפוש וסימולטור תלת-ממדי של אניגמה פורסמו להורדה, אך הוא מציין שהם מאמתים את החישוב בלבד — לא את הזהות ההיסטורית של ההודעה או את ייחודיות הפתרון, ושקביעה סופית תלויה בבדיקת מומחים בלתי תלויים.
דיווחים לא מאומתים על שימושים נוספים
בצד הקהילתי, משתמש דיווח ברשת כי הוא הפעיל את Astra כדי לנסות להעביר את הטלפון הסיני הנדיר שלו, Hisense A6L — מכשיר בעל שני מסכים (LCD ו-E-ink) התקוע על אנדרואיד 9 וללא רום מותאם זמין — לגרסת אנדרואיד 17. מדובר בדיווח ראשוני של המשתמש עצמו על משימה שהוא מתאר כ"מונומנטלית מבחינת מורכבות", ללא אישור עצמאי להשלמתה.
למה זה חשוב
ככל הנראה, מה שמבדיל את Astra מדגמים קודמים אינו רק גודל או ידע, אלא היכולת לבנות לעצמו, תוך כדי עבודה, ייצוג מופשט של בעיה חדשה ולתרגם אותו לתוכנית פעולה — תכונה שעד כה דרשה בדרך כלל מהנדסים אנושיים שיבנו מסביב למודל מנגנון ייעודי. אם המגמה הזו תישמר מעבר לדוגמאות הבודדות שפורסמו עד כה, המשמעות היא צמצום הפער בין "מודל שפה" לבין סוכן שמסוגל להתמודד עצמאית עם משימות מגוונות בעולם האמיתי.