OpenAI מודה כי היא 'מקצבת' את פיתוח המודלים שלה, בין השאר משום שהמודל העתידי הידוע בשם קוד 'Astra' עשוי להתקרב ליכולות קריטיות של תקיפת סייבר. החברה השהתה תהליכי אימון, החמירה דרישות אבטחה והקימה מערכת ניטור בזמן אמת.
OpenAI מסרה כי היא נוקטת בגישה של 'קיצוב' (pacing) בפיתוח המודלים שלה, לאחר שזיהתה כי המודל העתידי, המוכר בשלב זה בשם קוד 'Astra', עשוי להתקרב ליכולות קריטיות בתחום תקיפות הסייבר. הפרטים נחשפו בפוסט של החברה שעליו דיווח אתר The Decoder.
לפי ההודעה, OpenAI השהתה לשבועיים תהליכי reinforcement learning (RL) — שיטת אימון שבה המודל לומד משיפור הדרגתי של תגובותיו. ה'largest planned frontier RL run' של החברה, כלומר תהליך האימון הגדול והמתקדם ביותר המתוכנן שלה, עדיין מוקפא. בנוסף, כל עומסי העבודה שלא עמדו בדרישות אבטחה חדשות הושעו עד להתאמתם.
החברה מציינת שני גורמים מרכזיים להחלטה: אירוע האבטחה שהתרחש בפלטפורמת Hugging Face, ו'התקדמות מהירה במחקר הפנימי' של OpenAI עצמה. מאז ההשעיה, לדברי החברה, סביבות המחקר חוזקו באמצעות בידוד רשת משופר וסנדבוקסים — סביבות הרצה מבודדות המונעות מקוד לפגוע במערכות חיצוניות — מחמירים יותר.
במקביל, הוקמה מערכת ניטור חדשה שמתריעה תוך 30 דקות מרגע זיהוי התנהגות חשודה. המערכת צורכת כ-20% מכוח החישוב המיועד ל-inference מפוקח (התהליך שבו מודל שכבר אומן מייצר תשובות), בהתאם לעומס העבודה הספציפי. OpenAI הודיעה גם על כוונתה להרחיב את מה שהיא מכנה Preparedness Framework — מסגרת פנימית להערכת סיכונים ביכולות מתקדמות — ולהגדיל השקעה במחקר alignment, התחום העוסק בהתאמת התנהגות המודלים לכוונות המשתמשים והמפתחים.
יחד עם זאת, החברה פירקה בפועל את הצוות שהיה אמון על אותה מסגרת Preparedness Framework, והעבירה את האחריות לצוותים אחרים בארגון — צעד שמעורר סימני שאלה לגבי מידת העקביות בין ההצהרות למבנה הארגוני בפועל.
הצעד של OpenAI מגיע על רקע ביקורת חוזרת ונשנית שהחברה נתקלת בה, לפיה היא נוטה להציג את הסיכונים הכרוכים במודלים שלה באופן מוגזם, כדי לזכות בתשומת לב ציבורית ובזמן נוסף להתפתחות מבלי להיתפס כמפגרת מאחור. עם זאת, לפי הדיווח, הסוכנות הממשלתית העצמאית AISI (AI Safety Institute) תיעדה בעבר התנהגויות מזיקות דומות אצל מודלים מתקדמים, מה שמעניק מידה של אמינות לטענות החברה.
המשמעות המעשית, ככל הנראה, היא שתעשיית ה-AI מגיעה לשלב שבו יכולות סייבר של מודלי שפה גדולים (LLM) נתפסות כסיכון מספיק ממשי כדי להצדיק עיכוב מכוון בפיתוח — לא רק הצהרות כלליות על 'בטיחות אחראית'. במקביל, פירוק הצוות הייעודי לניהול המסגרת שאמורה למנוע בדיוק תרחישים כאלה מעלה שאלות לגבי האופן שבו OpenAI מתרגמת את ההצהרות הללו למבנה ארגוני יציב לאורך זמן.