פוסט שהתפרסם בפורום r/singularity טוען כי מודל חדש של DeepSeek, המכונה V4 Flash, עוקף את Claude Fable 5 של אנתרופיק בבנצ'מארק Terminal-Bench 2.1 בזכות יכולת 'אימות עצמי' (self-verification), ובמחיר הנמוך פי 11 ממחיר המודל המתחרה. מדובר בטענה שעלתה ברשת ולא בהכרזה רשמית מגובה בנתונים מלאים.
פוסט שפורסם בפורום r/singularity מדווח כי מודל חדש של חברת הבינה המלאכותית הסינית DeepSeek, המכונה V4 Flash, הצליח לעקוף את Claude Fable 5 של אנתרופיק בבנצ'מארק Terminal-Bench 2.1 - כלי הערכה הבודק יכולת של מודלי שפה לבצע משימות במסוף מחשב (terminal) בצורה אוטונומית, כגון הרצת פקודות, תיקון שגיאות וניהול קבצים.
לפי הפוסט, ההצלחה של V4 Flash נשענת על יכולת המכונה 'הרחבת אימות עצמי' (scaling self-verification) - כלומר, המודל בודק ומתקן את עצמו במהלך ביצוע המשימה, במקום לסמוך על תשובה חד-פעמית. גישה כזו נפוצה יותר ויותר בפיתוח מודלים המיועדים למשימות מורכבות רבות-שלבים, שכן היא מאפשרת למודל לזהות טעויות באמצע התהליך ולא רק בסופו.
הנתון הבולט בפוסט הוא הפער במחיר: לפי הדיווח, V4 Flash זול פי 11 מהמודל המתחרה של אנתרופיק. חשוב לציין כי מדובר בפוסט שפורסם בפורום דיון ציבורי, ללא פירוט מלא של מתודולוגיית הבדיקה, מספרי הציון המדויקים בבנצ'מארק או מקור הנתונים המקורי - ולכן יש להתייחס לטענות כאל דיווח ראשוני שטרם אומת באופן עצמאי.
הקשר: תחרות מחירים מתמשכת
DeepSeek, שעוררה סערה עולמית בתחילת 2025 עם השקת מודל שהציג ביצועים גבוהים במחיר פיתוח נמוך משמעותית ממודלים מערביים מקבילים, ממשיכה להיתפס כגורם מרכזי בתחרות המחירים בתעשיית הבינה המלאכותית. חברות סיניות, ובהן DeepSeek, נוהגות להציע גישה למודלים שלהן במחירי API נמוכים משמעותית מאלה של OpenAI, Anthropic וגוגל, תוך שהן מתחרות גם על ביצועים בבנצ'מארקים ייעודיים כמו Terminal-Bench.
בנצ'מארקים כאלה הפכו בשנה האחרונה לכלי מדידה מרכזי עבור מודלים המיועדים ל'סוכנים' (agents) - מערכות בינה מלאכותית שמבצעות משימות מורכבות באופן אוטונומי, ולא רק עונות על שאלות. יכולת אימות עצמי נחשבת מרכיב מפתח בהתפתחות כזו, משום שהיא מקטינה את הצורך בפיקוח אנושי צמוד על כל שלב בביצוע המשימה.
למה זה חשוב
אם הטענות בדיווח אכן יאומתו במקורות נוספים, המשמעות עשויה להיות שהפער בין מודלים סיניים למודלים מערביים מובילים ביכולות סוכניות ממשיך להצטמצם, תוך שמירה על יתרון מחיר משמעותי. עם זאת, בהיעדר פרסום רשמי או נתוני בנצ'מארק מלאים ומאומתים מצד DeepSeek או גורם שלישי ניטרלי, יש להתייחס לנתונים הנוכחיים בזהירות - ולהמתין לאישושים נוספים לפני הסקת מסקנות רחבות על מאזן הכוחות בשוק המודלים.