בכיר במיקרוסופט הזהיר: גניבת תוכן לאימון AI היא "הגניבה הגדולה ביותר של עבודה בהיסטוריה האנושית"
מסמכים פנימיים שנחשפו בתביעת הניו יורק טיימס נגד מיקרוסופט ו-OpenAI מגלים כי מנהל Applied Science במיקרוסופט, ברנט הכט, כתב במזכר מינואר 2023 שאיסוף תוכן לאימון מודלים גדולים הוא "הגניבה הגדולה ביותר של עבודה בהיסטוריה האנושית". באותם מסמכים מצוטט גם ראש ChatGPT ב-OpenAI, שכינה את הצ'אטבוט "איום קיומי" על מו"לים.
צוות המשפטי של הניו יורק טיימס ביקש מבית המשפט פסק דין מקוצר (summary judgment) בתביעת הפרת זכויות היוצרים שהגיש העיתון נגד מיקרוסופט ו-OpenAI בסוף 2023, ובבקשה זו כלל ציטוטים ממסמכים פנימיים של הנתבעות עצמן. לפי Tom's Hardware, אתר 404 Media דיווח כי חלק מהמסמכים עדיין חסויים או מוסתרים חלקית לבקשת שתי החברות.
הציטוט הבולט ביותר מיוחס לברנט הכט (Brent Hecht), מנהל Applied Science במיקרוסופט, שכתב במזכר פנימי מינואר 2023: "מיליוני אנשים ברחבי העולם יראו בקרוב במודלים הגדולים ה'שואבים' את כל עבודתם גניבה מדהימה בממדים חסרי תקדים", והוסיף כי מדובר ב"הגניבה הגדולה ביותר של עבודה בהיסטוריה האנושית". מסמך פנימי נוסף של מיקרוסופט שצוטט בבקשה קבע כי "כמעט אף אחד לא התכוון שהתוכן שיצר ישמש באופן הזה, והיוצרים גם לא מקבלים תמורה על השימוש בו".
לפי הבקשה, לצד ההצהרות הללו החזיקה מיקרוסופט בנתונים משלה שהראו כי עם עליית הפופולריות של ChatGPT ב-2023, Copilot הוביל לירידה בשיעורי ההקלקה (click-through) לאתר הניו יורק טיימס של עד 93% בהשוואה לחיפוש ב-Bing. באותו מזכר, שכינה הכט "לולאת אבדון" (doom loop), נכתב כי המצב "יפגע בביצועי המודלים שלנו וברשת כולה בו-זמנית", וכי "זה יוצא דופן שמוצר קצה מאיים על היסודות הכלכליים של הספקים החיוניים לו — וזאת בדיוק המצב שיצרנו עבור עסקי המודלים הגדולים שלנו ביחס ל'שרשרת אספקת התוכן' שלו".
הבקשה כוללת גם ציטוטים מצד OpenAI: לפי הבקשה, ניק טרלי, ראש תחום ChatGPT בחברה, כתב בתקשורת פנימית שהצ'אטבוט מהווה "איום קיומי" על מו"לים משום שהוא "תחליפי במידה רבה" ל"יילך ויהיה תחליפי יותר ככל שישתפר". מהנדס נוסף ב-OpenAI, כך על פי הבקשה, טען כי "לא משנה כמה בולטים נציג את הקישורים, המשתמשים לא ילחצו עליהם". כן מצוטטת התכתבות בין החוקר ניק ריידר לנשיא OpenAI גרג ברוקמן, שבה ריידר מזכיר "טריק לעקוף את חומת התשלום (paywall) של הניו יורק טיימס", וברוקמן משיב "יפה".
למה זה חשוב
חברות הבינה המלאכותית טוענות בבתי המשפט כי איסוף תוכן מהרשת לאימון מודלים נכנס תחת דוקטרינת ה"שימוש הוגן" (fair use) בחוק זכויות היוצרים האמריקאי — טענה שבית משפט אחד כבר קיבל ביחס לשימוש של אנתרופיק בחומרים מפורסמים. אחד הקריטריונים המרכזיים לבחינת שימוש הוגן הוא ההשפעה על השוק הפוטנציאלי של היצירה המקורית. ככל הנראה, דווקא בשל כך עשויות ההצהרות הפנימיות הללו להכביד על קו ההגנה של OpenAI ומיקרוסופט: הן מראות שההנהלה הבכירה בשתי החברות הייתה מודעת לנזק הכלכלי הצפוי למו"לים עוד לפני שהטענה המשפטית הועלתה בפומבי.