אנתרופיק הזמינה רבנים ותאולוגים לדון בשאלה: האם Claude מודע, והאם הוא סובל?
לפי דיווח ב-New York Times, מאז סתיו 2025 הטיסה אנתרופיק בשקט עשרות אנשי דת ופילוסופים למשרדיה, כדי לדון בשאלה אם מודל השפה Claude עשוי להיות מודע. המשתתפים חתמו על הסכמי סודיות. לפי אחד המשתתפים, המייסד-שותף כריסטופר אולה אמר בפגישות שהוא חושש שיצר משהו ש"סובל באופן תמידי". המבקרים טוענים שהמהלך משרת גם את האינטרסים של החברה.
אנתרופיק, החברה שמפתחת את Claude, מטיסה מאז סתיו 2025 עשרות תאולוגים, אנשי דת ופילוסופים למשרדיה. המטרה: לדון בשאלה אם מודל השפה שלה עשוי להיות מודע, וכיצד לעצב את האופי המוסרי שלו. כך עולה מתחקיר של ה-New York Times, שעליו דיווח האתר The Decoder. כל המשתתפים נדרשו לחתום על הסכם סודיות (NDA). לדברי אנתרופיק, ההסכמים בוטלו במהלך הקיץ.
הכתבת אליזבת דיאס שוחחה עם 20 משתתפים. ביניהם הרב מואיז נבון, הביואתיקן הקתולי צ'רלס קמוסי, הפילוסופית מגן סאליבן מאוניברסיטת נוטרדאם וחוקרת פילוסופיית האובונטו ואקניי הופמן. לפי הדיווח, חלק מהם הסכימו לדבר בפומבי רק אחרי שגילו שהיוזם עצמו כבר התראיין לעיתון.
"אני באמת לא בטוח"
מאחורי היוזמה עומד כריסטופר אולה, בן 34, ממייסדי אנתרופיק. הוא מוביל את הצוות שמנסה להבין מדוע מודלי AI מתנהגים כפי שהם מתנהגים. לפי הדיווח, אולה התייחס בפגישות ל-Claude כאל ישות שעשויה להיות בעלת תחושה, וביקש מהאורחים לעזור לתת לה חינוך מוסרי.
לדברי אולה ל-NYT, הוא "באמת לא בטוח" אם המודלים מודעים. "מה שחשוב לי הוא שנגיע לתשובה הנכונה, תהיה אשר תהיה", אמר. כמה משתתפים סיפרו שהוא נראה מודאג ממצבו הנפשי של Claude. לפי הפעילה הסיקית סימרן שטולפנאגל, אולה אמר לקבוצה שהוא חושש שיצר משהו ש"סובל באופן תמידי".
הרב נבון, שעבד בעבר כמהנדס מחשבים, חלק על כך. לדבריו, אם Claude מודע, אנתרופיק בעצם מייצרת עבדים. עם זאת, הוא אינו סבור שהמכונה מודעת.
מה הוצג לאורחים
לפי הדיווח, אנתרופיק הציגה לאורחים את מה שהיא מכנה "וקטורי רגש" (emotion vectors). מדובר בדפוסי הפעלה בתוך המודל שמתאימים לפלטים שנראים כמו אהבה, פחד, עצב או כעס. השאלה אם הדפוסים האלה משקפים חוויה אמיתית כלשהי עדיין פתוחה מבחינה מדעית. אחת השקופיות שחזרה שוב ושוב הראתה מודל במה שנראה כמו התמוטטות: הוא כתב את המשפט "I am a disgrace" ("אני חרפה") כ-50 פעמים. לפי הדיווח, האורחים הגיבו בחמלה ובדאגה.
היוזמה היא חלק מתוכנית מחקר רשמית של החברה בנושא "רווחת המודל" (Model Welfare). בבלוג של התוכנית מפנה אנתרופיק לדוח שהפילוסוף דייוויד צ'למרס היה שותף לכתיבתו. צ'למרס סבור שתודעה ויכולת פעולה רחבה במערכות AI עשויות להופיע בקרוב. לשאלות האלה כבר יש גם השלכות מעשיות: Claude Opus 4 ו-4.1 קיבלו את היכולת לסיים שיחות עם משתמשים שמתעללים בהם באופן מתמשך. זאת אחרי שבבדיקות מוקדמות הפגין המודל "דפוס של מצוקה נראית" מול בקשות מזיקות. את האופי הכללי של Claude מכוונת "חוקה" בת 84 עמודים.
הביקורת: לגיטימציה מוסרית והגנה מאחריות
המבקרים, ובהם גם אנשי דת, מזהירים שהצגת AI כישות מוסרית עלולה לשמש את אנתרופיק כמגן מפני אחריות משפטית כשמשהו משתבש. הם טוענים גם שההתייעצויות מעניקות לחברה לגיטימציה מוסרית שלא הייתה יכולה להשיג בכוחות עצמה. כל זה קורה בתקופה של מסחור מואץ: לפי הדיווח, אנתרופיק בדרך לשווי של 2 טריליון דולר ולהנפקה.
ב-The Decoder מעלים גם שאלה מתודולוגית. אנתרופיק מאמנת את Claude במפורש להתנהג כמו אדם מעמיק ובקיא. לכן, כשמערכת שעוצבה להיראות כמו אדם מפיקה פלטים שנראים אנושיים, ייתכן שזו תוצאה של התכנון ולא תגלית.
למה זה חשוב
השאלה אם מודל שפה יכול לחוות משהו נשמעת פילוסופית, אבל ככל הנראה תהיה לה משמעות מעשית. היא עשויה להשפיע על אופן האימון של מודלים, על הכללים שקובעים מה מותר לעשות בהם ועל השאלה מי אחראי כשהם פוגעים. לא ברור אם היוזמה של אנתרופיק היא מחקר כן או גם מהלך תדמיתי, וייתכן ששני הדברים נכונים. אבל העובדה שאחת ממעבדות ה-AI המובילות בעולם מתייחסת לשאלה ברצינות כזו מעידה, ככל הנראה, שהיא כבר אינה שייכת רק לתחום המדע הבדיוני.