Sonnet 5.5 אמור להוזיל משימות, אבל מדידה עצמאית מצאה שבמאמץ מקסימלי הוא יקר יותר
אנתרופיק השיקה את Claude Sonnet 5.5 באותו מחיר לטוקן כמו קודמו, וטוענת שהמודל החדש מבצע משימות בעלות נמוכה בעד 30%. לפי מדידה עצמאית של Artificial Analysis, ברמת המאמץ המקסימלית משימה עולה יותר מאשר ב-Sonnet 5 ואפילו יותר מאשר ב-Opus 5.5. משתמשים כבר בודקים אם מודלים מתחרים, כולל מודלים פתוחים, נותנים יותר תמורה לדולר.
אנתרופיק השיקה את Claude Sonnet 5.5. לפי החברה, המודל עושה את אותה עבודה כמו Sonnet 5 בעלות נמוכה בעד 30% למשימה, ומייצר פלט מהר ביותר מ-30%. אבל מדידה עצמאית של חברת Artificial Analysis, שעליה דיווח אתר WinBuzzer, מציגה תמונה אחרת: ברמת המאמץ המקסימלית, משימה ממוצעת עלתה יותר מאשר ב-Sonnet 5, ואפילו יותר מאשר ב-Opus 5.5, מודל הדגל של החברה.
אותו מחיר לטוקן, חשבון שונה
המחירון לא השתנה: 2 דולר למיליון טוקנים בקלט (input), 10 דולר למיליון טוקנים בפלט (output) ו-0.20 דולר למיליון טוקנים שנקראים מהמטמון (cache). טוקנים הם יחידות הטקסט שלפיהן מחייבים את השימוש. אנתרופיק טוענת שהמודל החדש צריך הרבה פחות טוקנים כדי לבצע את אותה עבודה, ולכן החשבון הסופי יורד.
יש כאן כמה הסתייגויות. ראשית, לפי WinBuzzer, הנתון של "עד 30%" מגיע מבדיקות פנימיות של אנתרופיק, והחברה לא פרסמה על אילו משימות נבדק. שנית, גם טוקני ה"חשיבה" של המודל (reasoning) מחויבים כפלט, ולכן הרבה תלוי ברמת המאמץ (effort) שנבחרה. ברירת המחדל היא Medium באפליקציות של Claude וב-Claude Code, ו-High למפתחים שעובדים דרך ה-API.
קפיצה חדה בביצועים
בביצועים השיפור חד. במבחן Terminal-Bench 4.0, שבודק ביצוע של משימות תכנות מרובות שלבים בשורת הפקודה, קיבל Sonnet 5.5 ציון של 70.6%, לעומת 10.3% של Sonnet 5 ו-66.4% של Opus 5.5. לפי WinBuzzer, אנתרופיק לא ציינה באיזו רמת מאמץ נמדד הציון של Sonnet 5 בטבלה. גם אנתרופיק עצמה מסייגת: לדבריה, Opus 5.5 "נשאר חזק יותר באופן ברור" בעבודה מורכבת ופתוחה שדורשת שיקול דעת לאורך זמן.
מה מצאה Artificial Analysis
Artificial Analysis מפרסמת את Intelligence Index, מדד שמשקלל עשרה מבחנים. היא בדקה את Sonnet 5.5 במאמץ מקסימלי, וקיבלה ציון של 56, לעומת 38 של Sonnet 5. אבל העלות המשוקללת למשימה הייתה 7.60 דולר, לעומת 5.09 דולר של Sonnet 5. Opus 5.5 קיבל באותה סוללת מבחנים ציון של 58, בעלות של 5.98 דולר למשימה: ציון מעט גבוה יותר ועלות נמוכה יותר.
גם כאן צריך לקרוא את הנתונים בזהירות. מדובר בעלות לכל משימה במבחן, ולא לכל משימה שהושלמה בהצלחה. בנוסף, תמהיל המשימות שונה מזה של אנתרופיק.
המשתמשים עושים חשבון
בקהילות המפתחים כבר מתחילים לנתח את הנתונים. בפוסטים ב-r/singularity (כאן וכאן) משתמשים טוענים שלכל רמת מאמץ של Sonnet 5.5 יש חלופה זולה יותר מבין GPT-6 Sol של OpenAI ו-Opus 5.5, עם ציון זהה או גבוה יותר. הם גם ממליצים לוותר על מצב Max. אלה פרשנויות של משתמשים ולא ממצאים מאומתים. ב-r/LocalLLaMA פורסמה השוואה בין גרסאות Qwen 3.8, משפחת המודלים הפתוחים של עליבאבא, לבין Sonnet 5.5 ברמות Low ו-Medium, והכותב טוען שמודלים מקומיים הגיעו לחזית. הנתונים שעליהם נשענת הטענה לא נכללו בחומרים שבידינו, ולכן אין לה אימות.
הנתונים של אנתרופיק עצמה דווקא מתיישבים עם חלק מהטענות האלה. לפי החברה, בכמה מבחנים Sonnet 5.5 ברמת Low או Medium עוקף את הציון הטוב ביותר של Sonnet 5 בערך בעשירית מהעלות למשימה. ברמות מאמץ גבוהות, לדבריה, הוא מגיע לביצועים דומים לאלה של Opus 5.5 בעלות דומה.
למה זה חשוב
המשמעות ככל הנראה היא שהמחיר לטוקן כבר לא מספר את כל הסיפור. מה שקובע את החשבון הוא כמה טוקנים המודל "שורף" בכל רמת מאמץ, ועל איזה סוג עבודה. נראה ש-Sonnet 5.5 משתלם בעיקר ברמות המאמץ הנמוכות, ושבמצב Max הוא מאבד את היתרון מול Opus 5.5. לחברות ולמפתחים בישראל, ההמלצה המעשית היא לא להסתמך על הצהרות היצרן או על מדדים כלליים, אלא למדוד עלות לכל משימה שהושלמה על העבודה שלהם עצמם, ולהשוות גם לחלופות זולות יותר.