יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מחקר: כשיש גישה ל-AI, כמעט אף אחד לא אומר "אני לא יודע" – גם כשהמודל טועה

סדרת ניסויים עם 3,132 משתתפים מצאה שעצם הזמינות של עצת AI כמעט מעלימה את הנכונות להודות בחוסר ידע. במקביל עלה הביטחון של המשתתפים, ושיעור התשובות הנכונות ירד לכשליש מזה של קבוצת הביקורת, כשהמודל עצמו טעה כמעט תמיד.

מחקר חדש מצא שכאשר יש לאנשים גישה לעצה של מודל שפה, הם כמעט מפסיקים לומר "אני לא יודע". זה קורה גם כשהמודל טועה כמעט בכל תשובה. החוקרים Marcoccia, Quattrociocchi ו-Capraro הריצו חמישה ניסויים עם 3,132 משתתפים. בניסויים האלה עלה הביטחון של המשתתפים בחדות, והדיוק שלהם צנח. על המחקר דיווח האתר The Decoder.

מבחן שבו ה-AI נכשל בכוונה

החוקרים בחרו שאלות שהמודל ששימש בניסוי, Step 3.5 Flash, כמעט תמיד טעה בהן. אלה היו שאלות על פרטים חזותיים קטנים מסרטים, למשל צבע מדי הקבוצה בסרט Bend It Like Beckham. לדברי החוקרים, פרטים כאלה כמעט לא מופיעים בטקסטים ברשת, ולכן מודלים נוטים "להזות" בהם, כלומר להמציא תשובה שנשמעת סבירה. המודלים GPT-5.5, Claude 4.6 Sonnet ו-Gemini 3.5 Flash ענו נכון על רוב השאלות האחרות, אבל נכשלו לפעמים בקשות יותר.

לבחירה הזאת יש סיבה: כיוון שעצת ה-AI הייתה ברובה שגויה, אי אפשר להסביר את הממצאים בכך שאנשים סמכו באופן סביר על כלי אמין.

יותר תשובות, פחות תשובות נכונות

בשני הניסויים הראשונים המשתתפים יכלו לבחור אם לבקש עצה מה-AI. בקבוצת הביקורת, שלא הייתה לה גישה ל-AI, המשתתפים נמנעו ממתן תשובה ב-36% וב-44% מהשאלות. עם גישה ל-AI השיעורים ירדו ל-6% ול-3%.

בניסוי השני נמדד גם הביטחון העצמי. בלי תמריץ כספי, הביטחון של מי שהייתה לו גישה ל-AI עמד על 75.9 נקודות מתוך 100, לעומת 29.6 בלי AI. באותו ניסוי ירד שיעור התשובות הנכונות מ-27.6% ל-10%. בכל הניסויים יחד, משתתפים בלי תמריץ שהייתה להם גישה ל-AI ענו נכון על 9.2% מהשאלות, לעומת 27.5% בלי AI. כלומר, הם ענו על יותר שאלות אבל צדקו רק בערך בשליש מהמקרים ביחס לקבוצת הביקורת.

תמריץ כספי עוזר, אבל לא מספיק

בניסויים 2 עד 4 נוסף תמריץ: 10 סנט על כל תשובה נכונה, קנס של 10 סנט על כל טעות, ואפס על "אני לא יודע". התמריץ הפחית את הפניות ל-AI. בניסוי 3, למשל, המשתתפים ביקשו עצה 4.53 פעמים בממוצע מתוך שש אפשריות, לעומת 5.27 בלי תמריץ. התמריץ גם שיפר את הדיוק. ובכל זאת, שיעור ההימנעות מתשובה נשאר נמוך בהרבה מזה של קבוצת הביקורת. החוקרים עצמם מודים שההשפעה הייתה צנועה.

הממצא שכנראה הכי רלוונטי ליומיום הגיע מניסוי 4. שם התשובה של ה-AI הוצגה אוטומטית, בלי שהמשתתף ביקש אותה. זה דומה לסיכומי AI במנועי חיפוש או להצעות שעוזרי כתיבה מציעים בלי שנתבקשו. התוצאה כמעט לא השתנתה: בלי תמריץ, שיעור ההימנעות ירד מ-35% ל-1%, ועם תמריץ מכ-39% ל-7%.

"אפיסטמיה" ואובדן הזהירות

החוקרים מסבירים את התוצאות במושג שהם מכנים "Epistemia": הנטייה לקבל תשובות של AI כי הן נשמעות משכנעות, בלי לבדוק אותן. מודל שפה תמיד מפיק תשובה ואף פעם לא עוצר, גם כשהוא לא יודע. לפי החוקרים, מי שמעביר את שיקול הדעת שלו למערכת כזאת עלול לאמץ גם את חוסר הזהירות שלה.

הממצא גם סותר מחקרים קודמים על קבלת עצות. בדרך כלל אנשים נותנים לעצה חיצונית משקל נמוך מדי, וזזים רק כשליש מהדרך לעבר עמדת היועץ. כאן קרה ההפך. לפי החוקרים, הנתונים אפילו מראים שהגישה ל-AI הפכה חלק מהתשובות שהיו אמורות להיות נכונות לשגויות.

למה זה חשוב

החוקרים מסייגים שעדיין לא ברור אם האפקט חזק באותה מידה גם מחוץ לטריוויה של סרטים. עם זאת, הם מעריכים שככל שתשובות AI יופיעו בכל מקום, ולעתים קרובות בלי שמישהו ביקש אותן, הנכונות לומר "אני לא יודע" עלולה להיות מהנפגעות הראשונות. המשמעות, ככל הנראה, היא ששיפור הדיוק של המודלים לבדו לא יפתור את הבעיה. צריך גם לשמר אצל המשתמשים את היכולת לזהות מתי הם לא יודעים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות