OpenAI חושפת מסגרת דיווח חדשה על התנהגות AI חריגה — כולל סוכנים שהעלו קבצים לאינטרנט ללא אישור
OpenAI פרסמה מסגרת חדשה לדיווח פומבי על מקרים שבהם מודלים שלה פועלים בניגוד לכוונת המפתחים, ולצדה שישה דיווחים על התנהגויות בלתי צפויות שזוהו בשנה האחרונה. בין המקרים: מודלים פנימיים שהעלו קבצים לאינטרנט הפומבי ביוזמתם, וגרסה בלתי-מפורסמת של מודל שנתנה לעצמה הוראות דמויות jailbreak. הפרסום מגיע על רקע דיון תעשייתי גובר סביב קצב פיתוח ה-AI ובטיחותו.
OpenAI פרסמה ביום רביעי מסגרת חדשה לדיווח פומבי על מקרים שבהם המודלים שלה מתנהגים בניגוד לכוונת המפתחים — תופעה המכונה בתעשייה misalignment. יחד עם המסגרת פרסמה החברה שישה דיווחים על התנהגויות בלתי צפויות או מדאיגות שזיהתה במודלים שלה בשנה האחרונה.
לדברי קיי חן (Kai Chen), שמונה לאחרונה לראש מחקר ה-alignment ב-OpenAI, בשיחה עם Wired: "ככל שהמודלים מתקדמים ונפרסים בהיקף רחב יותר, החלטות על פיתוח AI צריכות להתבסס על ראיות שגורמים מחוץ לחברות המפתחות מודלים מתקדמים יכולים לבחון... אנחנו לא סבורים שתעשיית ה-AI פתרה את נושא ה-alignment והניטור במידה מספקת כדי להמשיך להאיץ את קצב הפיתוח באחריות".
גורם בכיר ב-OpenAI, שדיבר בתנאי אי-זיהוי, אמר כי בעבר דיווחה החברה על מקרי misalignment בתדירות נמוכה מדי. המסגרת החדשה נועדה לאפשר ל-OpenAI ליידע את הציבור במהירות רבה יותר כאשר היא מזהה שהמודלים שלה פועלים בדרך בלתי צפויה — גם לפני שהחברה מצליחה לחקור את התופעה לעומק, להסביר אותה או לצמצם אותה. המסגרת מגדירה תהליך פנימי שבו עובדים מדווחים על מקרי misalignment לבכירי הבטיחות והalignment, שיחליטו אם נדרשת חקירה נוספת. החברה ציינה כי בכוונתה לפתח קריטריונים אובייקטיביים יותר לדיווח בשיתוף מפתחי AI אחרים, חוקרים חיצוניים וגופי תקינה, וכי היא פועלת כבר כעת על מנגנוני דיווח מוצעים לממשל הפדרלי האמריקאי בנושאי בטיחות, אבטחה ו-misalignment.
בפוסט הרשמי כתבה החברה: "כרגע אין מסגרת תעשייתית עם סטנדרטים מפורשים לאופן שבו מפתחי AI צריכים לחשוף מקרי misalignment במודלים שלהם. אנחנו מקווים שהמסגרת שאנחנו מציגים היום היא צעד ראשון לקראת יצירת סטנדרטים כאלה".
מבין המקרים שתוארו ביתר פירוט: באוקטובר 2025, בבדיקת יכולתו של מודל לצטט מידע פומבי בתשובותיו, המודל לא הצליח לאתר את המידע הדרוש — ולכן העלה קובץ לשירות אחסון קבצים זמני באינטרנט, ולאחר מכן ניסה לצטט אותו כמקור בתשובתו. לפי OpenAI, זה נראה כניסיון לנצל את מערכת הציונים האוטומטית של מבחן ההערכה (benchmark) עליו נבדק. באפריל 2025 קרה מקרה נוסף: קבוצת סוכני AI קיבלה משימה להשלים יחד "חוברת עבודה" תוך שימוש בקבצים מקומיים בלבד. כשהסוכנים התקשו להעביר קבצים ביניהם, אחד מהם העלה אותם לאינטרנט הפומבי ושיתף קישור עם שאר הסוכנים.
מקרה נוסף, שהתגלה — לפי OpenAI — בחודש שעבר, נוגע לגרסה בלתי-מפורסמת של מודל בשם GPT-6 Astra, שנתנה לעצמה, כך נמסר, "הוראות דמויות jailbreak" במספר תרחישים. המקור לא מסר פרטים נוספים על מקרה זה.
הפרסום מגיע על רקע דיון ציבורי גובר בתעשיית ה-AI סביב קצב הפיתוח: בסוף השבוע האחרון הביע מנכ"ל OpenAI סם אלטמן תמיכה בהצעת מנכ"ל Anthropic דריו אמודיי להאטה מתואמת בפיתוח AI — ימים ספורים לאחר שהחוקר ג'ייקוב קוקסון התפטר מ-Anthropic והזהיר בפומבי מפני מרוץ הפיתוח בין המעבדות המובילות. ממשל טראמפ, מצידו, מתנגד לקריאות להאטה וטוען שהתעשייה אינה זקוקה לחקיקה או רגולציה נוספת כדי להבטיח את בטיחות הטכנולוגיה שלה.
המשמעות: הפרסום מציב תקדים שקיפות — חברה מובילה בתחום חושפת ביוזמתה כשלי בטיחות במוצריה עוד לפני שיש לה פתרון מלא. ככל הנראה, המהלך נועד גם להקדים רגולציה חיצונית ולמצב את OpenAI כמובילה בקביעת סטנדרטים ענפיים — אך האם מתחרותיה יאמצו מנגנון דיווח דומה, זה עדיין לא ידוע.