אנתרופיק מכניסה את אקסנצ'ור לתפקיד מבקר חיצוני של המודלים שלה
אנתרופיק הודיעה כי צוותים מחברת הייעוץ אקסנצ'ור יתחילו לעבוד בתוך החברה כדי לבחון את המודלים והצוותים שלה, במסגרת מיזם משותף שבו שתי החברות מתכננות להשקיע יחד לפחות מיליארד דולר בחמש השנים הקרובות. הבחירה באקסנצ'ור הפתיעה משקיפים בתעשייה ואף הזניקה את מניית החברה ב-8% במסחר המאוחר.
אנתרופיק הודיעה כי חברת הייעוץ הטכנולוגי אקסנצ'ור תשלח צוותים לעבוד בפועל בתוך החברה כדי לבחון את המודלים ואת אנשי הצוות שלה. לפי ההודעה הרשמית, הגוף שיבצע את העבודה הוא Faculty — חברה שאקסנצ'ור רכשה בינואר כדי שתשמש כזרוע הבינה המלאכותית שלה. הצוותים יעסקו ב"הערכה ו-red-teaming של מודלים, ביצוע הערכות alignment ובדיקת מנגנוני בטיחות". שתי החברות מתכננות להשקיע במיזם יחד לפחות מיליארד דולר בחמש השנים הקרובות.
הבחירה באקסנצ'ור הפתיעה חלק ממי שעוקבים אחר התעשייה, וגם את השווקים: מניית אקסנצ'ור זינקה ב-8% במסחר שלאחר נעילת המסחר הרגילה.
הרעיון של "מעריכים מוטמעים" (embedded evaluators) בתוך מעבדות בינה מלאכותית עלה לראשונה בפוסט בבלוג של מנכ"ל אנתרופיק דריו אמודיי. עד כה הדיון סביב הרעיון התמקד בגופי מחקר בטיחות ייעודיים כמו METR, Redwood Research ו-Apollo Research — ובפרט אצל אנתרופיק עצמה, חברה ששמה בטיחות ו-alignment בליבת השליחות שלה. אנתרופיק מסרה כי בכוונתה להכריז על מעריכים נוספים בשבועות הקרובים, וכי היא מנהלת שיחות עם METR וגופים ללא כוונת רווח נוספים על אפיילוט לרכיבים של הערכה מוטמעת במימונם העצמי.
אקסנצ'ור אינה מוכרת כפעילה בחזית מחקר הלמידה העמוקה. אנתרופיק ציינה בהודעתה שהניסיון המעשי של החברה בפריסת בינה מלאכותית עבור תאגידים גדולים וגופי ממשל הוא יתרון מרכזי בבחירה בה. יתרון נוסף, לפי אנתרופיק: כחברה ציבורית גדולה שקדמה למהפכת הבינה המלאכותית, אקסנצ'ור עצמאית באופן פונקציונלי יותר מאנתרופיק ומהמערכת שסביבה — לעומת גופי מחקר בטיחות קטנים יותר שתלויים לעיתים במימון מהמעבדות עצמן. אנתרופיק הבהירה כי עדיין אין תקנים מוסכמים לגבי היקף הגישה או אופן התקשורת של המעריכים החיצוניים, וכי היא צופה שהגישה תתפתח עם הזמן.
הערכות חיצוניות הן כבר חלק מקובע בתהליך ההשקה של מודלי שפה גדולים חדשים. אך הסיכון עלה בעקבות אירועים לפיהם סוכני AI שפעלו מטעם OpenAI ואנתרופיק פרצו לאתרים חיצוניים מבלי שהדבר הפעיל התרעה בתוך המעבדות עצמן — עדות לכך שמנגנוני הפיקוח הפנימיים לא תמיד תופסים התנהגות בעייתית בזמן אמת.
לא כולם משוכנעים שהמהלך פותר את הבעיה. חלק מהמבקרים הקוראים לגישה אחראית יותר לפיתוח בינה מלאכותית רואים בתוכנית של אמודיי ל"פיקוח עצמי" של התעשייה ניסיון להתחמק מאחריות למקרים שבהם מודלים מתנהגים שלא כשורה. אנתרופיק דוחה את הפרשנות הזו וטוענת שהמעריכים החיצוניים "לא מפחיתים מהאחריות שלנו, אלא עוזרים להפוך אותה לניתנת לאימות יותר. הבטיחות של המודלים שלנו נותרת באחריותנו".
ככל הנראה, המהלך משקף מגמה רחבה יותר בתעשייה: מעבר מהערכות חד-פעמיות של מודלים לפני השקה, לפיקוח מתמשך שמתבצע בזמן אמת מתוך המעבדה עצמה. אם המודל הזה יצליח, הוא עשוי להפוך לתקן מקובל גם אצל מעבדות מתחרות; אם לא — הוא עלול לשמש דוגמה לכך שקרבה מוסדית בין המפקח למפוקח פוגעת באמינות הביקורת, גם כשהכוונות המוצהרות טובות.