דיון ברשת: מודלים נעשו אמינים יותר, אבל לא בהכרח חכמים יותר
דיון שהתפתח ברשת החברתית Reddit טוען שחברות הבינה המלאכותית התמקדו בתיקון תקלות פומביות מביכות של מודלים — כמו ספירת אותיות שגויה במילה 'strawberry' והשוואה מוטעית בין 9.11 ל-9.9 — במקום בשיפור היכולות המהותיות. הפוסט מפנה לבנץ'מארק בשם SciCode כתמיכה לטענה שהמודלים לא בהכרח נעשו חכמים יותר.
✦ נכתב אוטומטית על ידי AI מבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
פוסט שעלה בפורום r/singularity ברשת Reddit מעלה טענה שמעוררת דיון בקהילת הבינה המלאכותית: לדברי הכותב, חברות ה-AI הגדולות השקיעו בתיקון תקלות ספציפיות ופומביות של המודלים שלהן, אך לא בהכרח שיפרו את היכולות הקוגניטיביות הבסיסיות שלהם. הפוסט המלא זמין ב-Reddit.
הכותב מתייחס לשתי תקלות שהפכו לסמל בציבור הרחב סביב מגבלות ה-LLM (מודלי שפה גדולים): הקושי של מודלים לספור נכון את מספר האותיות 'r' במילה האנגלית 'strawberry', והנטייה של חלק מהמודלים לקבוע בטעות ש-9.11 גדול מ-9.9 (בלבול בין ערך עשרוני לפורמט של מספרי גרסאות). שתי הדוגמאות הללו הפכו בשנה האחרונה למוקד ללעג ציבורי כלפי חברות הבינה המלאכותית, ולפי הפוסט — הובילו את המעבדות להתמקד בתיקון נקודתי של תקלות כאלה.
הטענה המרכזית של הפוסט היא שהמאמץ הזה הניב מודלים 'אמינים' יותר במובן הצר — פחות טעויות מביכות בבעיות פשוטות ונפוצות — אך לא בהכרח שיפור מקביל ביכולות פתרון בעיות מורכבות. כראייה, הפוסט מפנה לבנץ'מארק בשם SciCode, מבחן שנועד להעריך יכולת של מודלים לכתוב קוד לצורך פתרון בעיות מדעיות מורכבות. הטיעון המרומז הוא שהביצועים בבנץ'מארק זה אינם מראים את אותה מגמת שיפור שנראית במבחנים פשוטים יותר.
חשוב להדגיש: הפוסט המקורי מציג טענה ופרשנות של משתמש ברשת חברתית, ולא דוח מחקר רשמי עם נתונים מלאים וניתוח שיטתי. הקטע שפורסם אינו כולל מספרים או ציוני בנץ'מארק קונקרטיים, ולכן אי אפשר לאמת מתוך המקור בכמה בדיוק ירדו או נותרו יציבים הציונים במבחנים המורכבים. ככל הנראה, מדובר בתצפית סובייקטיבית שמבוססת על שימוש יומיומי במודלים ועל השוואה לתוצאות בנץ'מארק, ולא בניתוח סטטיסטי מלא שפורסם על ידי גורם מחקרי.
פרסומת
הכתבה הבאה
זוכה פרס טיורינג יוצא נגד הטרנד: 'דאטה סינתטי היא טעות גדולה' באימון בינה מלאכותית ריצ'רד סאטון, זוכה פרס טיורינג ומאבות תחום הלמידה המחזקת, טוען שדאטה סינתטי לא יפתור את בעיית קיצור הנתונים באימון מודלי שפה, מכיוון שהעולם מורכב מכדי שניתן לדמות אותו בסימולציה. לדבריו, החלופה היא סוכני AI שלומדים מהניסיון שלהם עצמם ולא מפסיקים ללמוד לאחר האימון. → לכל הכתבות