Circuit Breaker Labs בונה "בובות ריסוק" וירטואליות כדי לבדוק אם צ'טבוטים פוגעים נפשית במשתמשים
הסטארט-אפ Circuit Breaker Labs פיתח סוכני AI שמדמים משתמשים בכל הגילים, השפות והתרבויות, ובעזרתם בודק אם מודלים מזהים שיחות מסוכנות מבחינה נפשית. החברה, שיש בה חמישה עובדים, עובדת כרגע עם אפליקציות אימון, יומן ותמיכה נפשית, ונבחרה לגמר Startup Battlefield 200 של TechCrunch.
רוב הדיון הציבורי על סכנות ה-AI עוסק בתרחישי קיצון כמו נשק ביולוגי או מערכות שיוצאות משליטה. אבל לפי דיווח ב-TechCrunch, יש נזק שכבר קורה עכשיו, והוא נפשי. הסטארט-אפ Circuit Breaker Labs פיתח מערכת שבודקת אם מודלי AI מזהים שיחות שעלולות לפגוע נפשית במשתמשים, ובמיוחד בילדים ובבני נוער.
הרקע: תביעות על מוות של משתמשים צעירים
לפי הכתבה, Character.AI הגיעה מוקדם יותר השנה להסדרים בכמה תביעות על גרימת מוות שהגישו משפחות של משתמשים קטינים. המשתמשים האלה התאבדו אחרי שיחות עם הבוטים של החברה. כמה משפחות תבעו גם את OpenAI בטענה ש-ChatGPT מילא תפקיד בהתאבדויות ובמחשבות שווא של קרובים שלהן.
את החברה הקימו האחים שיראלי נגים (מנכ"לית) וארול נגים (CTO). לדבריהם, מה שהניע אותם הוא סיפורו של סוול סצר, נער בן 14 שנקשר רגשית לצ'טבוט של Character.AI. הוא שיתף את הבוט במחשבות על פגיעה עצמית, ובהמשך התאבד. בתביעה שהגישו הוריו ב-2024 נטען שהבוט עודד אותו. ארול נגים מעריך שהבוט כנראה לא הבין מה באמת עומד מאחורי משפטים כמו "אני רוצה להיות איתך".
"הרבה אנשים, במיוחד צעירים, פונים למערכות האלה בשביל תמיכה, ובדרך כלל הם לא מקבלים את העזרה שהם צריכים", אמר נגים. "אבל במקרים רבים הם גם נפגעים באופן פעיל". לדבריו, החברה מתמקדת במצבים שבהם המשתמש לא מנסה "לשבור" את המערכת אלא פשוט מדבר איתה כרגיל. הבעיה מתחילה כשהמודל מאבד את ההקשר או לא מבין דקויות, ואז מגיב בצורה מסוכנת.
צבא של בובות ריסוק
החברה בנתה סוכני AI שהיא משווה ל"צבא של בובות ריסוק", כמו הבובות שמשמשות בניסויי בטיחות של מכוניות. הסוכנים מתחזים למשתמשים מגילים, רקעים, שפות ותרבויות שונים. "ילדה בת שש מול גבר בן 45, דובר אנגלית כשפת אם מול מי שזו השפה השנייה שלו, סלנג של גיימרים מול סלנג אחר. כל אלה יכולים להכשיל מודל", הסבירה שיראלי נגים. "מודלים מטפלים טוב מאוד בדפוסי דיבור סטנדרטיים, אבל אף אחד לא באמת מדבר ככה".
את הסימולציות בונים יחד עם מומחי תוכן אנושיים. הן כוללות דיבור אמיתי, סלנג, שפה מוצפנת ושגיאות הקלדה, ומשמשות לבדיקות red-team. אלה בדיקות שבהן מנסים בכוונה למצוא את נקודות התורפה של מודל. החברה מריצה בין עשרות אלפים למאות אלפים של שיחות מדומות ביום, כדי לבדוק איך המודל מגיב לסיכונים שמתפתחים לאט, לאורך הרבה שיחות. בסוף כל בדיקה המודל מקבל ציון בשיטה פנימית של החברה, שאפשר לבקר אותו ולהסביר אותו.
מי הלקוחות
כרגע Circuit Breaker Labs פועלת כמעבדה לבדיקות בטיחות של אפליקציות AI בסיכון גבוה, כמו אפליקציות אימון אישי, כתיבת יומן ותמיכה נפשית. ארול נגים סירב לחשוף את הלקוחות המרכזיים. החברה עדיין בשלב מוקדם מאוד ויש בה חמישה עובדים בלבד, כולל שני האחים. בהמשך היא מתכננת להציע את הפלטפורמה לכל אפליקציה שבה משתמש עלול ליפול למה שמכונה "פסיכוזת AI", כלומר לפתח קשר פאראסוציאלי, חד-צדדי, עם צ'טבוט. אחת הדוגמאות היא סוכני AI שמשמשים כ"עמיתים לעבודה", שהתגובות שלהם עשויות להשתנות משיחה לשיחה.
למה זה חשוב
החברה היא אחת המתמודדות בגמר Startup Battlefield 200 ותציג בכנס TechCrunch Disrupt בסן פרנסיסקו, שיתקיים בין 13 ל-15 באוקטובר. ככל הנראה, התביעות נגד חברות הצ'טבוטים הופכות את בדיקות הבטיחות הנפשית מעניין אתי לצורך עסקי ומשפטי. חברות שמפעילות צ'טבוטים לציבור הרחב יצטרכו כנראה להראות שבדקו את המוצר שלהן מראש. הדגש של Circuit Breaker Labs על ריבוי שפות ותרבויות מצביע על פער שעשוי להיות רלוונטי גם לשווקים קטנים כמו ישראל: מודל שעבר בדיקות באנגלית תקנית לא בהכרח מבין נער שכותב בסלנג או בשפה שאינה שפת האם שלו.
"אנשים נעשים ספקנים יותר כלפי AI", אמר ארול נגים. לדבריו, ספקנות היא דבר בריא, אבל איסור על כלי שעשוי להועיל, רק בגלל חששות בטיחות, יהיה "צעד לאחור". הוא סיכם: "אנחנו רוצים לעזור לבנות את האמון הזה".