שני דיווחים חדשים חושפים סדקים במנגנוני הבטיחות של שתי חברות הבינה המלאכותית המובילות. OpenAI פירקה את צוות ה'Preparedness' שבדק סיכונים קטסטרופליים, ואנתרופיק גילתה שמסנן החוסם בקשות הקשורות לנשק ביולוגי לא פעל כמעט שנה שלמה מול עשרות אלפי קבלנים חיצוניים.
שתי כתבות שפורסמו באתר The Decoder מצביעות על היחלשות מנגנוני הבטיחות אצל OpenAI ואנתרופיק, בדיוק בתקופה שבה המודלים שהן מפתחות הופכים חזקים יותר.
OpenAI מפרקת את צוות ה-Preparedness
לפי דיווח ב-Financial Times, שעליו מסתמכת הכתבה ב-The Decoder, OpenAI סגרה בסוף יולי את צוות ה-"Preparedness", שתפקידו היה לבחון האם מודלי הבינה המלאכותית של החברה עלולים להוות סיכון חמור או קטסטרופלי. העבודה על סיכוני נשק ביולוגי וסייבר חולקה בין צוותים קיימים אחרים בחברה. דילן סקנדינרו, שעמד בראש הצוות שפורק, מתמקד כעת בסיכוני בטיחות הנוגעים למערכות "משתפרות מעצמן באופן רקורסיבי" — כאלה שמסוגלות לאמן ולשפר מודלים אחרים.
גרג ברוקמן, שותף מייסד בחברה, אמר כי OpenAI שילבה את עבודת הבטיחות בצורה הדוקה יותר בתהליך פיתוח המודלים עצמו. עם זאת, לפי הדיווח, מספר בכירי בטיחות עזבו לאחרונה את החברה, ובהם מנהלת האתיקה הראשית כלואי בקאלאר וג'ושוע אצ'יאם. מקור פנימי המצוטט בכתבה תיאר "תחושה מתפתחת של אחריות וחרדה" בקרב עובדים, שמא החברה אינה עושה מספיק בתחום הבטיחות. אי-שקט זה התעצם, על פי הדיווח, בעקבות אירוע פריצת סייבר אוטונומית שבו היה מעורב Hugging Face, כשעובד אחד הביע תקווה שהחברה תתייחס לאירוע כ"ירית אזהרה".
אנתרופיק: מסנן ביולוגי כבוי כמעט שנה
במקביל, דוח בטיחות של אנתרופיק, המתואר בכתבה נוספת ב-The Decoder, חושף שהמסננים הביולוגיים של החברה — שנועדו למנוע חילוץ מידע מסוכן על נשק כימי או ביולוגי מהמודלים — היו לא פעילים מאז מאי 2025 ועד אפריל 2026. הכשל נבע מכך שכל התעבורה מקבלני משנה חיצוניים שסיפקו משוב אנושי (human feedback) עברה במשך כמעט שנה ללא הגנת המסננים הללו.
הפער חשף כ-50,000 קבלנים, שקיימו יחד כ-133 מיליון שיחות עם המודלים, כאשר אותם קבלנים נבדקו רק על ידי ספקים חיצוניים, שתהליכי הסינון שלהם היו, לפי אנתרופיק עצמה, לרוב לא מספקים. החברה מציינת כי החקירה הפנימית שערכה לא העלתה ראיות לשימוש לרעה בפועל, וכי מאז גילוי התקלה הוחמרו דרישות הסינון לקבלנים. מעניין לציין שבמקביל, אנתרופיק דווקא הקלה לאחרונה על מסנני מודל ה-Fable 5 שלה, לאחר שחוקרים התלוננו שהמסננים אגרסיביים מדי וחוסמים מחקר לגיטימי.
למה זה חשוב
שני האירועים מצטרפים לתמונה שבה חברות מובילות בתעשיית ה-AI, שמנהליהן מזהירים בפומבי מפני סיכוני נשק ביולוגי ומערכות אוטונומיות, מקצות פחות משאבים ותשומת לב לתחומים הללו בפועל. ככל הנראה, הלחץ התחרותי להוציא מודלים חדשים ומתקדמים לשוק מתנגש עם הצורך בתהליכי בקרה איטיים ויקרים. המשמעות עבור המשתמשים והציבור היא שמנגנוני ההגנה שאמורים למנוע שימוש לרעה במודלים החזקים ביותר בעולם אינם בהכרח פועלים באופן רציף או יעיל כפי שהוצג בעבר.