Cognition משיקה את SWE-2: מודל קוד שמתקרב ל-Fable 5.1 בעלות נמוכה ב-64%
חברת Cognition, המפתחת את סוכן הקידוד Devin, שחררה את SWE-2 — מודל קוד שעבר אימון post-training בשיטת reinforcement learning על גבי המודל הפתוח Kimi K3 של Moonshot AI. לפי הדיווח, המודל השיג 50.0% במבחן FrontierCode 1.1 Main, קרוב לנקודת אחוז מציון Fable 5.1, אך בעלות הנמוכה ב-64%.
Cognition, החברה שמפתחת את סוכן הקידוד Devin, הכריזה על שחרור SWE-2 — המודל המתקדם ביותר שהחברה פיתחה עד כה לכתיבת קוד. לפי הדיווח ב-MarkTechPost, המודל אינו נבנה מאפס אלא עבר post-training (אימון המשך) בשיטת reinforcement learning על גבי Kimi K3 — מודל בקוד פתוח של חברת Moonshot AI, בעל 2.8 טריליון פרמטרים.
התוצאה שמדווחת: 50% במבחן FrontierCode
לפי המקור, SWE-2 השיג ציון של 50.0% במבחן FrontierCode 1.1 Main — אחד ממבחני ההשוואה שנועדו לבחון יכולת פתרון משימות תכנות מורכבות של מודלי שפה. ציון זה נמוך בנקודת אחוז בודדת בלבד מהציון של Fable 5.1, ולפי הדיווח הושג בעלות הנמוכה ב-64% מהעלות של הפעלת Fable 5.1.
המקור אינו מפרט את מספרי העלות המדויקים (דולר לטוקן או למשימה), ואת מתודולוגיית החישוב המלאה של פער העלות — כך שהנתון "64%" מובא כפי שדווח, ללא אפשרות לאמת את הרכיבים שמרכיבים אותו.
ההקשר: אימון המשך על מודלים פתוחים
הבחירה של Cognition להתבסס על Kimi K3 — מודל קוד פתוח — ולא לבנות מודל משלה מאפס, ממחישה מגמה רחבה יותר בתעשייה: חברות מתמחות משתמשות במודלי יסוד פתוחים וגדולים ומתאימות אותם למשימה ספציפית, במקום לשאת בעלות האדירה של אימון מודל חדש לגמרי. Devin, מוצר הדגל של Cognition, הוא סוכן אוטונומי שמיועד לבצע משימות תכנות שלמות — כתיבה, דיבוג ותחזוקת קוד — ולא רק להשלים שורות בודדות כמו כלי השלמת קוד מסורתיים. שיפור המודל שמפעיל אותו נועד ישירות לשרת את היכולת הזו.
למה זה חשוב
אם הנתונים שמדווחת Cognition אכן משקפים ביצועים בפועל ולא רק תנאי מעבדה, המשמעות היא שהפער בין מודלים "יקרים" מובילים לבין מודלים זולים יותר שעברו אימון ממוקד-משימה מצטמצם — לפחות במשימות תכנות ספציפיות שנבדקות ב-FrontierCode. עבור חברות שמפעילות סוכני קוד בקנה מידה גדול, שבהן עלות ההסקה (inference) על כל בקשה מצטברת למשמעות תקציבית ממשית, מודל שמתקרב לביצועי מודל מוביל בעלות נמוכה משמעותית עשוי להשפיע על בחירת הספק. עם זאת, מדובר במבחן השוואה יחיד (FrontierCode 1.1 Main), וכפי שקורה לעיתים קרובות בתעשיית ה-AI, ביצועים במבחן אחד אינם ערובה ליכולת דומה במשימות תכנות מגוונות בעולם האמיתי.
Cognition לא פרסמה, לפי המקור הזמין, מסמך טכני מפורט יותר על תהליך האימון או על מדדים נוספים מעבר לציון שצוין.