קלוד פייבל 5.1 עלה על הביצועים האנושיים ופענח חידה בת 373 שנה מהמאה ה-17
מודל השפה Claude Fable 5.1 של Anthropic עמד לאחרונה בשני מבחנים נפרדים: לפי עדכון של לוח התוצאות של SimpleBench הוא חצה לראשונה את הרף האנושי בבנצ'מארק שנועד לבחון היגיון יומיומי, ובמקביל פענח, לפי חברת ההערכה Vals AI, חידת מספרים בת 373 שנה מהמאה ה-17 שנותרה פתוחה עד היום. שני האירועים ממחישים שיפור ביכולת התמדה במשימות ארוכות, אך שניהם מבוססים על מדגמים קטנים ולא נבדקו באופן עצמאי נוסף.
✦ נכתב אוטומטית על ידי AIמבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
מודל השפה Claude Fable 5.1 של Anthropic עמד החודש בשני מבחנים שונים לחלוטין באופיים. לפי עדכון עדכני של לוח התוצאות של SimpleBench, הוא הגיע לציון של 86.6% במבחן היגיון יומיומי — מעל הרף האנושי שנקבע על 83.7%. במקביל, לפי דיווח באתר The Decoder, פענח המודל, ללא סיוע אנושי, חידת מספרים בת 373 שנה מהמאה ה-17 שנחשבה בלתי פתורה.
מבחן שבו בני אדם עדיין מנצחים
SimpleBench הוא מבחן רב-ברירה הכולל למעלה מ-200 שאלות הבודקות היגיון מרחבי-זמני, אינטליגנציה חברתית ועמידות בפני שאלות מלכודת מבחינה לשונית. לפי דף הבנצ'מארק, ברוב מבחני הטקסט הקיימים מודלים מובילים כבר עוקפים ביצועים אנושיים לא-מקצועיים ואף ביצועים של מומחים, ו-SimpleBench נבנה כדי לאתר תחום שבו זה עדיין לא כך: הרף האנושי, שנמדד על מדגם קטן של תשעה נבדקים, עמד על 83.7%, לעומת 81.9% בלבד עבור "Claude Fable" (הגרסה שקדמה ל-5.1), אז המודל המוביל בזמנו.
עדכון מאוחר יותר של הלוח, שכלל את הדגם החדש יותר קלוד פייבל 5.1, הציג תמונה שונה: קלוד פייבל 5.1 דורג ראשון עם 86.6%, מעל הרף האנושי, כשג'מיני 3.8 פלאש (82.4%) ומיוז ספארק 1.3 (81.8%) נותרו מתחתיו יחד עם הגרסה הקודמת של פייבל.
חידה בת 373 שנה
בנפרד, פורסם דיווח על שימוש באותו מודל לפענוח חידה היסטורית. לפי הדיווח ב-The Decoder, חברת ההערכה Vals AI העמידה את קלוד פייבל 5.1 במשימה פתוחה: לאתר בעצמו חידה בלתי פתורה ולנסות לפצח אותה. המודל בחר ב"Cyphral Distich" — יצירה של הסופר הסקוטי סר תומאס אורקהרט משנת 1653, המורכבת משתי שורות בנות 32 מספרים כל אחת. לפי Vals AI, הפענוח המלא הושג תוך 44 דקות, ללא כל התערבות אנושית.
מפתח הפתרון היה חבוי ביצירה המקורית עצמה: כל מספר הפנה למילה בתוך אחד מ-32 הפרקים בפרסום של אורקהרט. האותיות הראשונות של אותן מילים הרכיבו את המשפט "O God uphold King Charls the Second and make him the supreme ruler of this land" — קריאה רויאליסטית לתמיכה בצ'רלס השני, מתקופת מלחמת האזרחים באנגליה. לפי הדיווח, מי שערך את הבדיקה מטעם Vals AI בחן קודם לכן מודלים מובילים אחרים על חידות בלתי פתורות במשך חודשים, ואף אחד מהם לא הפיק פתרון שניתן לאימות.
לדברי Vals AI, ההצלחה של קלוד פייבל 5.1 לא נבעה מיכולת קריפטואנליטית מתוחכמת יותר משל מודלים אחרים, אלא מניסוי וטעייה שיטתי והתמדה. בדיעבד, כך צוין, הפתרון פשוט יחסית, וסביר שגם בני אדם יכלו לפצח אותו — אלמלא איש לא ניסה ברצינות.
המשמעות
שני האירועים מצביעים ככל הנראה על אותו כיוון: שיפור לא רק ב"ידע" הגלום במודל אלא ביכולתו להתמיד במשימות ארוכות וסבלניות ללא ליווי אנושי. עם זאת, ראוי להיזהר מהכללה מהירה. הרף האנושי ב-SimpleBench מבוסס על מדגם קטן של תשעה משתתפים בלבד, כך שהפער המדווח בין המודל לממוצע האנושי עשוי להיות פחות יציב סטטיסטית ממה שנראה במבט ראשון. גם סיפור חידת אורקהרט מבוסס כרגע על דיווח יחיד של חברה חיצונית אחת, ולא אומת באופן עצמאי במקור נוסף.