יום חמישי, 20 באוגוסט 2026 מתעדכן אוטומטית כל שעה

כל מה שחם בעולם הבינה המלאכותית · בעברית

📚 בית הספר ל-AI ✈️ הצטרפו לערוץ הטלגרם

דיון ברשת: מודלים נעשו אמינים יותר, אבל לא בהכרח חכמים יותר

דיון שהתפתח ברשת החברתית Reddit טוען שחברות הבינה המלאכותית התמקדו בתיקון תקלות פומביות מביכות של מודלים — כמו ספירת אותיות שגויה במילה 'strawberry' והשוואה מוטעית בין 9.11 ל-9.9 — במקום בשיפור היכולות המהותיות. הפוסט מפנה לבנץ'מארק בשם SciCode כתמיכה לטענה שהמודלים לא בהכרח נעשו חכמים יותר.

פוסט שעלה בפורום r/singularity ברשת Reddit מעלה טענה שמעוררת דיון בקהילת הבינה המלאכותית: לדברי הכותב, חברות ה-AI הגדולות השקיעו בתיקון תקלות ספציפיות ופומביות של המודלים שלהן, אך לא בהכרח שיפרו את היכולות הקוגניטיביות הבסיסיות שלהם. הפוסט המלא זמין ב-Reddit.

הכותב מתייחס לשתי תקלות שהפכו לסמל בציבור הרחב סביב מגבלות ה-LLM (מודלי שפה גדולים): הקושי של מודלים לספור נכון את מספר האותיות 'r' במילה האנגלית 'strawberry', והנטייה של חלק מהמודלים לקבוע בטעות ש-9.11 גדול מ-9.9 (בלבול בין ערך עשרוני לפורמט של מספרי גרסאות). שתי הדוגמאות הללו הפכו בשנה האחרונה למוקד ללעג ציבורי כלפי חברות הבינה המלאכותית, ולפי הפוסט — הובילו את המעבדות להתמקד בתיקון נקודתי של תקלות כאלה.

הטענה המרכזית של הפוסט היא שהמאמץ הזה הניב מודלים 'אמינים' יותר במובן הצר — פחות טעויות מביכות בבעיות פשוטות ונפוצות — אך לא בהכרח שיפור מקביל ביכולות פתרון בעיות מורכבות. כראייה, הפוסט מפנה לבנץ'מארק בשם SciCode, מבחן שנועד להעריך יכולת של מודלים לכתוב קוד לצורך פתרון בעיות מדעיות מורכבות. הטיעון המרומז הוא שהביצועים בבנץ'מארק זה אינם מראים את אותה מגמת שיפור שנראית במבחנים פשוטים יותר.

חשוב להדגיש: הפוסט המקורי מציג טענה ופרשנות של משתמש ברשת חברתית, ולא דוח מחקר רשמי עם נתונים מלאים וניתוח שיטתי. הקטע שפורסם אינו כולל מספרים או ציוני בנץ'מארק קונקרטיים, ולכן אי אפשר לאמת מתוך המקור בכמה בדיוק ירדו או נותרו יציבים הציונים במבחנים המורכבים. ככל הנראה, מדובר בתצפית סובייקטיבית שמבוססת על שימוש יומיומי במודלים ועל השוואה לתוצאות בנץ'מארק, ולא בניתוח סטטיסטי מלא שפורסם על ידי גורם מחקרי.

פרסומת

→ לכל הכתבות