יום חמישי, 8 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

JetBrains משיקה את Mellum2.1: מודל קוד פתוח לסוכני קוד, שקפץ מ-2 ל-47 נקודות ב-SWE-bench

JetBrains שחררה את Mellum2.1, מודל "חושב" בקוד פתוח ברישיון Apache 2.0 שבנוי בארכיטקטורת mixture-of-experts. יש לו 12 מיליארד פרמטרים, ומתוכם 2.5 מיליארד פעילים בכל רגע. לפי הדיווח, אימון בשיטת reinforcement learning על מאגרי קוד אמיתיים העלה את הציון שלו ב-SWE-bench Verified מ-2.0 ל-47.0.

חברת JetBrains, שמפתחת סביבות פיתוח מוכרות כמו IntelliJ IDEA ו-PyCharm, שחררה את Mellum2.1. זה מודל שפה בקוד פתוח שנועד לשמש סוכני קוד (coding agents), כלומר מערכות AI שמבצעות בעצמן משימות תכנות שלמות ולא רק משלימות שורת קוד. המספר הבולט בהודעה הוא הציון ב-SWE-bench Verified: לפי הדיווח, אחרי אימון בשיטת reinforcement learning (RL) במאגרי קוד אמיתיים, הציון עלה מ-2.0 ל-47.0.

מה יש בתוך המודל

Mellum2.1 משוחרר ברישיון Apache 2.0. זה רישיון קוד פתוח מתירני שמאפשר גם שימוש מסחרי, שינוי והפצה מחדש. המודל בנוי בארכיטקטורת mixture-of-experts (MoE), שבה המודל מחולק לכמה "מומחים" פנימיים, ובכל שלב בעיבוד רק חלק מהם פועל. לכן, למרות שיש למודל 12 מיליארד פרמטרים בסך הכול, רק 2.5 מיליארד פעילים בכל רגע נתון.

המשמעות המעשית של ארכיטקטורה כזאת היא שעלות ההרצה ומהירות התגובה קרובות יותר לאלה של מודל קטן, בזמן שהמודל עצמו מכיל יותר ידע. במודל שמיועד לסוכני קוד, שמבצעים הרבה קריאות ברצף כדי לפתור משימה אחת, זה שיקול חשוב.

עוד פרט: Mellum2.1 מוגדר כ-thinking model, מודל שמפיק שרשרת חשיבה פנימית לפני שהוא נותן תשובה. ההנחה המקובלת היא שגישה כזאת עוזרת במיוחד במשימות מרובות שלבים, כמו איתור באג וכתיבת תיקון.

למה הקפיצה ב-SWE-bench מעניינת

SWE-bench Verified הוא אחד המבחנים הנפוצים כיום להערכת סוכני קוד. במקום לבדוק אם המודל כותב פונקציה בודדת, המבחן מציג לו בעיות אמיתיות שנפתחו בפרויקטי קוד פתוח, ובודק אם התיקון שהוא מציע עובר את הבדיקות של הפרויקט. הגרסה ה-Verified היא תת-קבוצה של בעיות שאנשים עברו עליהן וסיננו אותן.

ציון 2.0 אומר שהמודל כמעט לא הצליח לפתור את המשימות. ציון 47.0 אומר שהוא פותר קרוב למחצית מהן. לפי הדיווח, את הפער סגר אימון RL "במאגרי קוד אמיתיים". ככל הנראה המודל תרגל עבודה בסביבות פיתוח ממשיות וקיבל משוב לפי ההצלחה בפועל, ולא רק למד מדוגמאות קוד סטטיות. החומרים שבידינו לא מפרטים איך נבנו סביבות האימון ולא מציגים השוואה למודלים מתחרים, ולכן קשה לקבוע איפה בדיוק המודל עומד ביחס לשוק.

המשמעות

המהלך של JetBrains משקף, ככל הנראה, כמה מגמות רחבות בשוק כלי הקוד:

  • מעבר מהשלמה לסוכנים. כלי קוד מבוססי AI התחילו בהשלמה אוטומטית של שורות, ועוברים בהדרגה למודלים שמסוגלים לנווט במאגר שלם, להריץ בדיקות ולהציע תיקון.
  • מודלים קטנים ויעילים. מודל עם 2.5 מיליארד פרמטרים פעילים יכול לרוץ, לפחות בתיאוריה, גם על חומרה צנועה יחסית. לארגונים שלא רוצים לשלוח קוד פנימי לשירותי ענן חיצוניים זה יתרון ממשי.
  • כוחו של RL. הקפיצה מ-2 ל-47 מראה, לפי הנתונים שפורסמו, שאופן האימון יכול להשפיע על היכולות לא פחות מגודל המודל.

עבור מפתחים וחברות בישראל, השילוב של רישיון מתירני, גודל צנוע ומיקוד בעבודה סוכנית יכול להפוך את Mellum2.1 לאפשרות שכדאי לבדוק, בעיקר בסביבות שבהן פרטיות הקוד ועלויות ההרצה חשובות. עדיין חסרות השוואות עצמאיות לביצועים מול מודלים אחרים, ועד שיתפרסמו, כדאי להתייחס למספרים כהצהרה של החברה.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות