Claude Sonnet 5.5 הושק: קרוב ל-Opus בביצועים ובעלות נמוכה יותר, וטענה לא מאומתת על הוכחה מתמטית שכתבו סוכנים
אנתרופיק השיקה את Claude Sonnet 5.5. לפי הנתונים שפורסמו, הוא מהיר ביותר מ-30% מ-Sonnet 5, מוזיל את העלות למשימה בעד 30% ומתקרב ל-Opus 5.5 במבחני עבודת ידע. במקביל מתפרסמת ברשת טענה, שעדיין לא אומתה, שעשרה סוכנים מבוססי המודל עבדו 15 שעות ברציפות והפיקו הוכחה מתמטית של 17,895 שורות.
אנתרופיק הכריזה על Claude Sonnet 5.5, הגרסה החדשה של מודל הביניים שלה. לפי סיכום ההכרזה והנתונים הרשמיים, המודל מפיק פלט מהר יותר ביותר מ-30% בהשוואה ל-Sonnet 5, והעלות לביצוע משימה ירדה בעד 30%. במבחני עבודת ידע הוא כמעט משתווה ל-Opus 5.5, מודל הדגל של החברה שיצא רק שבוע קודם.
ההשקה מגיעה יחד עם טענה שמסתובבת ברשתות. לפי פוסט שעלה ברדיט, עשרה סוכנים מבוססי Sonnet 5.5 ביצעו 15 שעות של מחקר אוטונומי על בעיה מתמטית מ-1904, וחזרו עם הוכחה באורך 17,895 שורות. בשלב זה זה דיווח לא מאומת. בחומרים שבידינו אין מקור רשמי או מאמר שמפרט מהי הבעיה, מי הריץ את הניסוי והאם ההוכחה נבדקה.
לא הוזלה במחיר, אלא פחות טוקנים
המחיר ל-API לא השתנה: 2 דולר למיליון טוקנים בקלט ו-10 דולר בפלט, כמו ב-Sonnet 5. החיסכון נובע מכך שהמודל צריך פחות טוקנים (יחידות הטקסט שהמודל מעבד) כדי לסיים את אותה משימה. חשוב להדגיש שלא מדובר בהנחה במנויים החודשיים.
אלה הנתונים הבולטים מדף ההשוואה הרשמי, כפי שסוכמו:
- עבודת ידע (GDPval-AA): ל-Sonnet 5.5 יש 1844 נקודות, ל-Opus 5.5 יש 1846, ול-Sonnet 5 היו 1449.
- הפעלת מחשב (OSWorld): 80.1% לעומת 81.8% של Opus 5.5.
- פיתוח בטרמינל (Terminal-Bench 4.0): 70.6%, יותר מ-66.4% של Opus 5.5.
אנתרופיק עצמה מסייגת. לפי ההכרזה, Opus 5.5 "חזק בבירור" במשימות מורכבות וארוכות שבהן שיקול הדעת נבנה לאורך זמן. ציונים דומים במבחנים לא הופכים את Sonnet לבחירה הנכונה בכל מקרה.
יותר חשיבה זה לא תמיד יותר טוב
פרט מעניין בהכרזה נוגע לרמת ה-effort, כלומר כמה "מאמץ חשיבה" המודל משקיע. לפי הנתונים, גם ברמות Low ו-Medium יש מקרים שבהם Sonnet 5.5 עוקף את הציונים הגבוהים ביותר של Sonnet 5, בכעשירית מהעלות. ברירת המחדל באפליקציה וב-Claude Code היא Medium, וב-API היא High. בהגדרה המקסימלית העלות מגיעה בערך לזו של Opus 5.5.
במבחן הקוד FrontierCode הגדרת Xhigh השיגה ציון גבוה יותר מ-Max. ההסבר שניתן הוא שבהגדרת Max המודל ביצע סקירות שאיש לא ביקש, וערך קוד מחוץ לגבולות המשימה.
הסוכנים כבר עובדים בתוך אנתרופיק
ההקשר הרחב הוא העבודה עם סוכנים. לאחרונה פרסמה אנתרופיק איך האיצה את claude.ai פי שלושה בספרינט של שבועיים באוגוסט. Claude איתר את נקודות האיטיות, בנה כלים למדידה, יישם את השיפורים וניטר אותם אחרי העלייה לאוויר, והכול במקביל ביותר מ-150 שרשורים. בסך הכול מוזגו יותר מ-3,000 שינויים. זמן הטעינה הראשוני ירד מ-3.1 שניות ל-0.55 שנייה, והאנשים בצוות התמקדו בהגדרת יעדים ובאישור ההחלטות.
למה זה חשוב
אם הטענה על ההוכחה המתמטית תאומת, זו תהיה ככל הנראה דוגמה לכיוון שהתעשייה מתקדמת אליו: צוותי סוכנים שעובדים שעות ארוכות בלי התערבות אנושית על בעיה פתוחה. עם זאת, הוכחה באורך של כמעט 18 אלף שורות צריכה בדיקה קפדנית, רצוי בכלי אימות פורמליים או על ידי מתמטיקאים, לפני שאפשר לקבוע שהבעיה נפתרה.
מה שכבר מבוסס הוא השינוי בכלכלה של המודלים. ביצועים שהיו שמורים עד לאחרונה למודל הדגל זמינים עכשיו במחיר של מודל הביניים. המשמעות היא שהשאלה המעשית עוברת כנראה מ"איזה מודל לבחור" ל"כמה מאמץ להקצות לכל משימה".