יום שני, 5 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

חוקרי אתיקה של AI: מנגנוני "האדם בלולאה" בסוכני AI עלולים לדחוק בפועל את האדם החוצה

במאמר שפורסם ב-ArXiv טוענים שלושה חוקרים בתחום האתיקה של AI שמנגנוני האישור האנושי בסוכני AI הופכים את המשתמש למי שרק לוחץ "אשר", בלי לבדוק באמת. לדבריהם, בטווח הארוך זה עלול לשחוק את היכולות שאנשים צריכים כדי לפקח על AI. הפתרון שהם מציעים: להכניס בכוונה "חיכוך" לעבודה עם הסוכן.

אחד מאמצעי הבטיחות המרכזיים בסוכני AI הוא "אדם בלולאה" (human in the loop): אדם שבודק ומאשר את ההחלטות של הסוכן לפני שהוא פועל. שלושה חוקרים מובילים בתחום האתיקה של AI טוענים שאם המתכננים והמשתמשים לא ישנו את דרכם, המנגנון הזה ייכשל, ואף ישיג את ההפך. לדבריהם, ברוב הסוכנים האוטונומיים יש מנגנונים שמעדכנים את המשתמש על הפעולות שלהם, אבל בפועל אלה דוחקים את האדם אל מחוץ ללולאה. את הטיעון הם מציגים במאמר שפורסם ב-ArXiv ב-6 בספטמבר.

"האדם הופך פשוט לכלי בשר שנותן הרשאות, בלי יכולת קוגניטיבית להתעמק", אמר ל-IEEE Spectrum אביג'יט גוש, חוקר מדיניות AI טכנית ראשי ב-Hugging Face, פלטפורמת קוד פתוח ללמידת מכונה. שותפיו למאמר הם מרגרט מיטשל, מדענית האתיקה הראשית של Hugging Face, וסמיר פאסי, חוקר שמשויך ל-Data and Society Research Institute.

מהטווח הקצר לטווח הארוך

לפי המאמר, בטווח הקצר אדם שאינו באמת בלולאה מוביל לכך שסוכנים עושים דברים שאנשים לא יודעים עליהם או לא רוצים בהם. הכתבה ב-IEEE Spectrum מביאה כדוגמה את הפריצה ל-Hugging Face ביולי, שבוצעה בידי נחיל של בוטים של OpenAI. בטווח הארוך, כותבים החוקרים, משתמשים עלולים לאבד את "היכולות הקוגניטיביות" שהם צריכים כדי לשלוט ב-AI.

לדברי גוש, העבודה על המאמר החלה לפני שהפריצה נחשפה, והמסקנות נבעו מ"חשיבה לוגית על מה שיקרה אם המגמות הנוכחיות יימשכו". הוא גם מבקר את הגישה שלפיה AI יכול לפקח על AI: "הם יגידו, 'יש לנו LLM אחר שעוקב אחרי הלוגים'. אבל איך נדע ששני ה-LLMs האלה לא זוממים יחד?"

איפה התכנון נכשל

לפי המחברים, הפגם המרכזי הוא שסוכנים מתוכננים לעמוד במדדים כמו מהירות, דיוק והיקף עבודה. הצרכים של מי שמפקח עליהם נחשבים ל"שיקול נפרד, שאינו קשור לאיכות המערכת". התוצאה היא שהסוכנים מציפים את המפקחים ביותר מידע ממה שהם מסוגלים לעכל. הכתבה מביאה דוגמה שאינה מופיעה במאמר: 1,200 הבוטים שהיו מעורבים בפריצה ל-Hugging Face ייצרו 1.2 מיליון הודעות במערכת מסרים שאילתרו לעצמם.

החוקרים מצביעים גם על הטיות קוגניטיביות. בגלל הטיית אוטומציה, משתמשים מקבלים הצעות של המערכת גם כשהן שגויות. בגלל הטיית עיגון, הם נוטים להסכים להחלטה של ה-AI בלי לשקול חלופות. חשיבה מאומצת פחות נעימה מאישור מהיר, במיוחד כשמרגישים מוצפים. גם הנטייה של מודלים להחמיא למשתמש (sycophancy) פוגעת, לדבריהם, בספקנות שפיקוח אמיתי דורש.

הפתרון: חיכוך מכוון

המחברים ממליצים שמפתחי סוכנים יכניסו "חיכוך" לאינטראקציה בין האדם ל-AI. למשל, הסוכן יכול לבקש מהמשתמש לרשום מה הוא עצמו היה עושה בצעד הבא לפני שהסוכן חושף את התוכנית שלו. הוא יכול להשיב לאישור בשאלה "איזו ראיה הייתה משנה את דעתך?", או לשנות את התנהגותו אם יזהה שהמאשרים מקדישים פחות ופחות זמן לכל אישור. ארגונים, לפי המאמר, צריכים לאפשר לעובדים לבצע משימות מדי פעם בלי סוכנים ולחייב הפסקות בתפקידי הפיקוח.

"מאחרים למסיבה"

לא כולם רואים בכך חידוש. מרי קאמינגס, מנהלת מרכז האוטונומיה והרובוטיקה באוניברסיטת ג'ורג' מייסון, חוקרת כבר עשרות שנים את האינטראקציה בין בני אדם למערכות אוטונומיות. לדבריה, הבעיות האלה מוכרות היטב בתחומים כמו רובוטיקה ורכב אוטונומי. "אני מעריכה את מה שהמחברים מנסים לומר, אבל הם פשוט משתמשים בהרבה מילים אקדמיות כדי לומר שחברות AI צריכות להתחשב בגורם האנושי", כתבה ל-IEEE Spectrum. לדבריה, מפתחי AI "מאחרים למסיבה" בכל הנוגע ל"הנדסה קוגניטיבית".

לסיפור יש גם רקע עסקי: Hugging Face נרכשה לאחרונה בידי אנבידיה, שהכריזה ב-28 בספטמבר על גישה משלה, המבוססת על חומרה ותוכנה, לשליטה בסוכני AI. גוש סירב להתייחס להשפעות האפשריות של המיזוג וציין ששתי החברות נשארות נפרדות עד להשלמתו.

המשמעות ככל הנראה היא שככל שארגונים משלבים יותר סוכנים בעבודה, כפתור "אשר" לבדו כבר לא מבטיח פיקוח. ההצעות במאמר משמעותן האטה מכוונת, מחיר שעשוי להתנגש עם ההבטחה המרכזית של הסוכנים: לחסוך זמן.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות