יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מיקרוסופט משחררת מודלי תמלול ודיבור חדשים לסוכני קול

Microsoft AI השיקה את MAI-Transcribe-2-Streaming, מודל לתמלול בזמן אמת ב-60 שפות, ולצדו שני מודלים חדשים להמרת טקסט לדיבור. המודלים מיועדים לסוכני קול, כלומר מערכות AI שמנהלות שיחה מדוברת, וההשקה מחזקת ככל הנראה את מעמדה של מיקרוסופט בתחרות על שכבת הקול של ה-AI.

חטיבת Microsoft AI של מיקרוסופט שחררה שלושה מודלים חדשים לעבודה עם קול: מודל לתמלול דיבור בזמן אמת ושני מודלים להמרת טקסט לדיבור (text-to-speech). המודלים מיועדים בעיקר לסוכני קול (voice agents), כלומר מערכות AI שמנהלות שיחה מדוברת עם בני אדם, למשל במוקדי שירות או בעוזרים קוליים.

תמלול שמתחיל לפני שהמשפט נגמר

המודל המרכזי בהשקה נקרא MAI-Transcribe-2-Streaming. לפי מיקרוסופט, הוא מדורג במקום הראשון בדיוק בטבלאות של Artificial Analysis, גוף שמשווה בין מודלי AI. המודל מתמלל 60 שפות ומחזיר תוצאות חלקיות ראשונות בתוך קצת יותר מ-100 מילישניות.

הנתון הזה חשוב יותר ממה שנראה במבט ראשון. לדברי מיקרוסופט, המהירות מאפשרת לסוכן קולי להתחיל להגיב עוד בזמן שהאדם שמולו באמצע המשפט. אחת הבעיות המוכרות בשיחה עם מערכות קוליות היא ההשהיה המביכה בין סוף הדיבור לתחילת התשובה, ותמלול מהיר הוא ככל הנראה תנאי בסיסי לשיחה שמרגישה טבעית.

עד סוף השנה גובה מיקרוסופט מחיר היכרות של 0.54 דולר לשעת אודיו.

קול אחד, 23 שפות

לצד מודל התמלול השיקה החברה שני מודלים להמרת טקסט לדיבור. MAI-Voice-2.1 נועד לדבר 23 שפות באותו קול, ובכל שפה במבטא של דובר ילידי. המשמעות המעשית היא שמותג יכול ככל הנראה לשמור על "קול" אחיד מול לקוחות במדינות שונות, בלי להקליט או לבנות קול נפרד לכל שוק.

הגרסה המהירה, MAI-Voice-2.1-Flash, מגיעה לפי מיקרוסופט להשהיה (latency) של 150 מילישניות, ועולה 15 דולר למיליון תווים במקום 22 דולר.

שני מודלי הקול יכולים לשכפל קול מתוך כמה שניות בלבד של הקלטת ייחוס. מיקרוסופט מציינת שהמודלים כוללים מנגנוני הגנה מובנים שאמורים למנוע שימוש לרעה, אבל לא ברור מהפרסום איך בדיוק הם פועלים. בניסוי שערכה החברה עם כ-4,000 משתתפים, כמחציתם חשבו שהקולות שייכים לאדם אמיתי.

איפה אפשר להשתמש בהם

המודלים זמינים, בין השאר, דרך Microsoft Foundry, פלטפורמת הפיתוח של החברה, ודרך MAI Playground. שני מודלי הקול זמינים גם ב-OpenRouter, שירות שמרכז גישה למודלים של ספקים שונים דרך API אחד.

למה זה חשוב

התחרות בין חברות ה-AI התמקדה עד היום בעיקר במודלי שפה גדולים (LLM) ובטקסט. ההשקה הזו מצטרפת למגמה שבה הקול, כלומר היכולת לשמוע, להבין ולדבר בזמן אמת, הופך לחזית נפרדת. סוכן קולי שימושי צריך יותר מ"מוח" טוב. הוא צריך גם אוזניים מהירות ופה משכנע, וכל עיכוב של עשרות מילישניות מורגש בשיחה.

העובדה שמיקרוסופט מפתחת את המודלים האלה בעצמה, תחת המותג MAI, מצביעה ככל הנראה על רצון לשלוט ברכיבים מרכזיים בשרשרת של סוכני ה-AI ולהציע ללקוחות הארגוניים שלה חבילה שלמה. השילוב של מחיר היכרות נמוך לתמלול והוזלה בגרסת ה-Flash נראה כמו ניסיון לגייס מפתחים בשלב מוקדם של השוק.

לצד זה, היכולת לשכפל קול מכמה שניות של הקלטה, יחד עם הממצא שכמחצית מהמשתתפים בניסוי לא הבחינו שמדובר בקול מלאכותי, מחדדת את השאלה כמה מנגנוני ההגנה יעמדו בשימוש בעולם האמיתי. מדובר בשאלה שתעסיק ככל הנראה רגולטורים וחברות כאחד, ככל שקולות סינתטיים יהיו קשים יותר להבחנה מקולות אנושיים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות