יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

אנתרופיק משיקה את Claude Sonnet 5.5: מתקרב ל-Opus בחלק מהמבחנים, מהיר ביותר מ-30% וזול יותר לכל משימה

אנתרופיק השיקה את Claude Sonnet 5.5, מודל הביניים החדש שלה. לפי החברה הוא מייצר פלט מהר יותר ביותר מ-30% לעומת Sonnet 5, עולה עד 30% פחות לכל משימה, ובחלק מהמבחנים מגיע כמעט לתוצאות של Opus 5.5, המודל החזק ביותר במשפחת Claude 5.5. מחיר הטוקנים לא השתנה, אבל המודל צורך פחות טוקנים כדי להשלים את אותה עבודה.

אנתרופיק השיקה היום את Claude Sonnet 5.5, המודל השני במשפחת Claude 5.5. לפי החברה, המודל החדש מייצר פלט מהר יותר ביותר מ-30% לעומת קודמו Sonnet 5, ועולה עד 30% פחות לכל משימה ברוב סוגי העבודה. בכמה מבחני ביצועים הוא מגיע קרוב מאוד ל-Opus 5.5, המודל החזק ביותר במשפחה.

אותו מחיר, פחות טוקנים

המחיר הרשמי נשאר כמו של Sonnet 5: שני דולר למיליון טוקנים (יחידות הטקסט שהמודל מעבד) בקלט, עשרה דולר למיליון טוקנים בפלט, ו-0.20 דולר למיליון טוקנים בקריאה מהמטמון (cache). החיסכון מגיע ממקום אחר: לדברי אנתרופיק, המודל צריך הרבה פחות טוקנים כדי לבצע את אותה עבודה. לפי The Decoder, המודל גם מאגד קריאות לכלים חיצוניים לעתים קרובות יותר, וכך הוא משלים משימות בפחות שלבים. המודל זמין כבר עכשיו גם דרך AWS,‏ Google Cloud ו-Azure.

אנתרופיק מציגה את Sonnet 5.5 כהשלמה זולה ומהירה ל-Opus 5.5. ‏Opus מיועד לעבודה מורכבת שדורשת שיקול דעת זהיר, ואילו Sonnet מיועד למשימות יומיומיות מוגדרות היטב: תיקון באגים ויצירת מסמכים, מצגות וגיליונות אלקטרוניים.

הקפיצה הגדולה: קוד

השיפור הבולט ביותר, לפי נתוני החברה, הוא בתכנות אוטונומי (agentic coding). במבחן Terminal-Bench 4.0, שבודק ביצוע משימות מקצועיות מרובות שלבים בשורת הפקודה, Sonnet 5.5 קיבל 70.6%. ‏Sonnet 5 קיבל במבחן הזה 10.3% בלבד, ו-Opus 5.5 קיבל 66.4%. במבחן CursorBench 4.0 הציון עלה מ-34.1% ל-55.5%, כשתי נקודות מתחת ל-Opus 5.5.

גם בעבודה משרדית הפער מ-Opus כמעט נסגר. במבחן GDPval-AA, שבודק משימות אמיתיות ממגוון מקצועות, Sonnet 5.5 קיבל 1,844 נקודות. ‏Opus 5.5 קיבל 1,846 ו-Sonnet 5 קיבל 1,449. בזיהוי תרשימים (Chartography) הציון זינק מ-15.6% ל-61.6%. לפי אנתרופיק, זה גם מודל ה-Sonnet הראשון שמצליח לסיים את המשחק Pokémon Red כשהוא רואה רק צילומי מסך.

יש גם הסתייגויות. החברה עצמה מציינת שציוני מבחנים משקפים רק היבט אחד של יכולות המודל, ושבבדיקות שלה ושל בודקים חיצוניים Opus 5.5 "נשאר חזק יותר בבירור" בעבודה מורכבת ופתוחה. ב-FrontierCode, מבחן שבודק אם שינויי הקוד של המודל היו מתקבלים לפרויקט, Sonnet 5.5 קיבל ציון נמוך יותר ברמת המאמץ הגבוהה ביותר (Max, ‏46.2%) מאשר ברמה שמתחתיה (Xhigh, ‏52.1%). לפי אנתרופיק, ברמת Max המודל מפעיל לעתים קרובות יותר תהליך סקירת קוד שמפצל את העבודה בין כמה סוכני משנה, ובחלק מהמקרים זה הוביל לחריגה ממגבלת הזמן או לשינויים מחוץ לתחום המשימה.

לראשונה: הגנות סייבר גם ב-Sonnet

לפי אנתרופיק, יכולות הסייבר של Sonnet 5.5 דומות לאלה של Opus 5. בעקבות זאת זה מודל ה-Sonnet הראשון שמושק עם אותן הגנות סייבר שהחברה מפעילה על המודלים החזקים ביותר שלה. לפי TechCrunch, מדובר באותן הגנות שחלות על Fable ו-Opus. ההגנות בתחום הביולוגיה זהות לאלה של Sonnet 5. לדברי החברה, שתיהן מכוונות לקבוצה מצומצמת של בקשות בסיכון גבוה, ולא משפיעות על פיתוח תוכנה שגרתי.

למה זה חשוב

Sonnet 5 הוכרז לפני כשלושה חודשים בלבד. ההשקה מגיעה שבוע אחרי ש-OpenAI שחררה גרסאות משופרות של Sol ו-Luna, מודלי הביניים והתקציב שלה. ‏The Decoder מעריך שפערי הביצועים בין המודלים המקבילים של שתי החברות קטנים מספיק, כך שהמחיר עשוי להיות הגורם המכריע. אנתרופיק גובה יותר בכל הדרגות. המשמעות, ככל הנראה, היא שהמאבק עובר מ"מי הכי חכם" ל"כמה עולה כל משימה". מבחינת מפתחים וחברות, אם המודל האמצעי מתקרב למודל החזק ביותר במשפחה, חלק מהעבודה יכול לעבור אליו בלי לוותר על הרבה איכות. השלב הבא כבר הוכרז: Claude Haiku 5.5, המודל הקטן והזול במשפחה, מיועד לשימושים בנפח גבוה ועם רגישות לעלויות, ויצטרף בשבועות הקרובים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות