מסמכים פנימיים חושפים: במיקרוסופט הזהירו מ"גניבת העבודה הגדולה בהיסטוריה האנושית" באימון AI על תוכן חדשותי
מסמכים פנימיים שנחשפו השבוע בתביעת הזכויות שמובילה הניו יורק טיימס נגד מיקרוסופט ו-OpenAI מגלים שבכירים בשתי החברות הזהירו כבר לפני שנים מהנזק הכלכלי שגורמת גריפת תוכן חדשותי לאימון מודלים ללא רישוי. מנהל בכיר במיקרוסופט תיאר את הגריפה כ"גניבת העבודה הגדולה בהיסטוריה האנושית", ונתוני החברה עצמה מראים צניחה של עד 93% בשיעורי ההקלקה מ-Copilot לאתרי חדשות.
מסמכים פנימיים שנחשפו השבוע בתביעת זכויות היוצרים שמובילה הניו יורק טיימס נגד מיקרוסופט ו-OpenAI מגלים שבכירים בשתי החברות הזהירו כבר לפני שנים מפני הנזק שגורמת גריפת תוכן חדשותי לאימון מודלים שפה. לפי דיווח של Ars Technica, ברנט הכט, מנהל מדעי היישום (Director of Applied Science) במיקרוסופט, כתב במסמכים פנימיים שגריפת תוכן חדשותי לאימון AI היא "גניבה מדהימה בממדים חסרי תקדים", ובמקום אחר תיאר אותה כ"אולי גניבת העבודה הגדולה בהיסטוריה האנושית". לטענת התובעים, הכט קבע במסמך נוסף שהתוכנית לגרוף תוכן חדשותי בהיקף נרחב "עושה צחוק מוחלט מהרעיון של שימוש הוגן" (fair use) — ההגנה המשפטית שעליה נשענות מיקרוסופט ו-OpenAI בתביעה.
ב-OpenAI, ניק טרלי, ראש תחום ChatGPT, כתב בהודעה פנימית שמו"לים ניצבים מול "איום קיומי" מצד מוצרים מסחריים המאומנים על תוכן חדשותי ומסוגלים להחליף אותם, והוסיף שהמוצרים "תחליפיים ברובם, נקודה" ויהיו "תחליפיים יותר ויותר ככל שישתפרו". מסמך פנימי נוסף של מיקרוסופט, מינואר 2024, תיאר "לולאת אבדון" (doom loop) שבה ירידת ההכנסות של גופי התקשורת "תפגע בביצועי המודלים שלנו וברשת כולה בו-זמנית" — משום ש"זה חריג ביותר שמוצר קצה מאיים על היסודות הכלכליים של הספקים החיוניים לו".
הטענות נתמכות, לפי התובעים, בנתונים שמיקרוסופט עצמה אספה: שיעורי ההקלקה (click-through rate) מ-Copilot אל אתרי חלק מהתובעים צנחו ב-83% עד 93%, ואצל אחרים ב-51% עד 94%. לפי דיווח TechCrunch, התנועה מ-Bing אל אתר הניו יורק טיימס צנחה בעד 93% לעומת תוצאות חיפוש רגילות, מאז הפעלת מנוע התשובות של Copilot. מהנדס תוכנה ב-OpenAI כתב בהודעה פנימית נפרדת כי "לא משנה כמה בולט נציג את הקישורים, משתמשים לא ילחצו עליהם", וטרלי עצמו אמר שאין "סיבה טובה ללחוץ" כשהצ'אטבוט מספק את המידע ישירות.
הממצאים כוללים גם עדות של מנכ"ל מיקרוסופט סאטיה נאדלה, שאמר תחת שבועה כי חברות AI לא אמורות לעקוף את תנאי השימוש של אתרי חדשות כדי לדלג על חומות תשלום, וכי "כל דבר שנמצא מאחורי חומת תשלום צריך להיות מורשה על ידי מי שרוצה להשתמש בו... לצורך אימות (grounding) או אימון". לדבריו, אילו ידע ש-OpenAI אימנה מודלים על תוכן שהיה מאחורי חומת תשלום, היה דורש ממנה לאמן מחדש את המודלים. עם זאת, הודעות פנימיות שצוטטו בכתב התביעה מראות שכאשר עובד ב-OpenAI דיווח לנשיא החברה גרג ברוקמן על "פריצה" שמאפשרת לזחלני OpenAI לעקוף את חומת התשלום של הניו יורק טיימס, השיב ברוקמן: "יפה" ("ah nice"). לפי TechCrunch, מסדי הנתונים ששימשו לאימון-הביניים (mid-training) של OpenAI כוללים למעלה מ-91,692 עותקים של יצירות שפרסמה הניו יורק טיימס.
חשוב לציין: חלק ניכר מהציטוטים שנחשפו מגיעים מכתב הטיעון של הניו יורק טיימס עצמו, ולא מהמסמכים הגולמיים שעליהם הוא מתבסס — אלה עדיין חסויים, כך שהציטוטים עלולים להיות מוצגים ללא ההקשר המלא שבו נאמרו במקור.
המשמעות המשפטית עשויה להיות משמעותית: הגנת "שימוש הוגן" תלויה, בין היתר, בשאלה האם השימוש בתוכן המקורי פוגע בשוק שלו או מחליף אותו. אם התובעים יצליחו להוכיח בבית המשפט שהצ'אטבוטים אכן "תחליפיים" לחדשות המקוריות — כלשונם של בכירי OpenAI עצמם — הדבר עלול לערער אחד מעמודי התווך של טענת ההגנה. מנגד, שופטים עד כה נטו להכריע לטובת חברות ה-AI בשאלת השימוש ההוגן באימון, ומוקדם יותר החודש הגיש ממשל טראמפ תזכיר התומך בעמדת OpenAI. התביעה, שהוגשה לפני כשלוש שנים, צפויה כעת להתקדם לקראת דיון עובדתי מלא בבית המשפט.