מיקרוסופט משיקה את Microsoft-Decision-1: מודל שמחזיר הסתברויות במקום טקסט
מיקרוסופט השיקה את Microsoft-Decision-1, מודל שמבוסס על Qwen3.5-9B של עליבאבא. במקום לכתוב תשובה, המודל מחזיר הסתברות מכוילת לכל אחת מהאפשרויות שהוגדרו לו מראש. הוא מיועד לניתוב, לסיווג, לאימות ולבקרה על סוכני AI, וזמין כבר עכשיו ב-Microsoft Foundry וב-OpenRouter.
מיקרוסופט השיקה את Microsoft-Decision-1, שהחברה מגדירה "מודל החלטות". הוא בנוי אחרת ממודלי השפה המוכרים. הוא לא מנסח תשובה במילים. הוא מקבל רשימה קבועה של אפשרויות ומחזיר לכל אחת מהן הסתברות מכוילת. המודל עבר post-training (שלב אימון נוסף על מודל קיים) על בסיס Qwen3.5-9B של עליבאבא, והוא זמין כבר עכשיו ב-Microsoft Foundry וב-OpenRouter.
מה זה "מודל החלטות"
מודל שפה רגיל (LLM) מייצר טקסט, מילה אחר מילה. זה נוח בצ'אט, אבל במערכות אוטומטיות רבות התשובה הנדרשת היא בחירה אחת מתוך כמה. לאיזה מודל להעביר את הבקשה? לאיזו קטגוריה שייכת הפנייה? האם התשובה שהתקבלה נכונה? האם הסוכן רשאי לבצע את הפעולה הבאה?
Microsoft-Decision-1 בנוי לשאלות כאלה. לפי הדיווח, המודל מיועד לארבעה שימושים עיקריים: ניתוב (routing), סיווג, אימות ובקרת סוכנים (agent control). בכל אחד מהם הוא מחזיר ציון הסתברות לכל אפשרות במקום טקסט חופשי.
למה "מכוילת" זו המילה החשובה
הסתברות מכוילת (calibrated) אמורה לשקף את רמת הביטחון האמיתית. כשהמודל מעריך סיכוי של 80%, הוא אמור לצדוק בערך בשמונה מכל עשרה מקרים כאלה. למודלי שפה רגילים יש נטייה ידועה להישמע בטוחים בעצמם גם כשהם טועים. מי שמנסה לחלץ מהם ציון ביטחון נתקל לעיתים קרובות במספרים שלא אומרים הרבה.
כשההסתברויות אמינות, מפתחים יכולים ככל הנראה לקבוע ספים מסודרים. למשל: מעל רמת ביטחון מסוימת הפעולה מתבצעת אוטומטית, ומתחתיה היא עוברת לבדיקה אנושית או למודל גדול ויקר יותר. ההבטחה היא שליטה טובה יותר על סיכונים בתוך מערכות אוטומטיות. בחומר שעמד לרשותנו לא פורטה שיטת הכיול עצמה.
מודל קטן לתפקיד צר
הבחירה במודל בסיס של 9 מיליארד פרמטרים, ולא באחד מהמודלים הגדולים בשוק, נראית מכוונת. החלטות ניתוב וסיווג מתקבלות לעיתים אלפי פעמים בדקה, ולכן מהירות ועלות חשובות בהן יותר מיכולת לנסח טקסט. כנראה גם לא מקרי שמיקרוסופט בנתה את המודל על Qwen, משפחת מודלי ה-open weights של עליבאבא. זה ממחיש עד כמה מודלים פתוחים מסין הפכו לבסיס מקובל גם אצל ענקיות טכנולוגיה מערביות.
ברשתות החברתיות הופצו נתוני ביצועים שמיוחסים למודל: ציון של 83.5% על פני 36 מבחני ביצועים (benchmarks), וזמן תגובה חציוני (p50) של 85 אלפיות שנייה. הנתונים האלה לא מופיעים במקור המקושר שעמד לרשותנו, ולכן יש להתייחס אליהם כדיווח שלא אומת.
המשמעות
מערכות AI בנויות היום יותר ויותר מכמה רכיבים שעובדים יחד: מודל אחד מתכנן, אחר מבצע, ושלישי בודק את העבודה. Microsoft-Decision-1 מכוון לשכבת הבקרה שבין הרכיבים, כלומר לנקודות שבהן צריך להחליט לאן הבקשה ממשיכה, אם התוצאה תקינה ואם מותר להמשיך. ככל הנראה מיקרוסופט מהמרת שבתפקידים האלה עדיף רכיב צר ומהיר, שמחזיר מספר אמין, על פני מודל כללי שמנסח תשובה ארוכה. הזמינות גם ב-Foundry, הפלטפורמה של מיקרוסופט, וגם ב-OpenRouter, שירות צד שלישי שמרכז גישה למודלים רבים, מרמזת שהחברה רוצה שהמודל יגיע גם למפתחים שלא עובדים בתוך האקוסיסטם שלה.