מעבדת Meta Superintelligence Labs הכריזה על Muse Voice Transcribe, מודל יחיד שמבצע בו-זמנית תמלול בזמן אמת, זיהוי דוברים וזיהוי סיום דיבור — שלוש משימות שבמערכות קול מקובלות מטופלות בשלושה מודלים נפרדים. לפי החברה, איחוד המשימות במודל אוטורגרסיבי אחד נועד לצמצם את נקודות התקלה וההשהיה שנוצרות במעברים בין מערכות.
מעבדת Meta Superintelligence Labs הכריזה השבוע על Muse Voice Transcribe, מודל בודד שמטפל בו-זמנית בשלוש משימות שבעיבוד קול בזמן אמת נהוג להריץ בנפרד: תמלול זורם של דיבור (streaming ASR), זיהוי דוברים (diarization) — כלומר קביעה מי מהדוברים אמר מה — וזיהוי סיום דיבור (endpointing), שמחליט מתי המשתמש הפסיק לדבר.
שלוש מערכות שהפכו לאחת
לפי התיאור שפרסמה החברה, כך בנויים כיום רוב מערכות הקול בפרודקשן: מודל אחד מתמלל את הדיבור, מודל שני מפריד בין הדוברים, וגלאי נפרד מחליט מתי לסיים את ה"תור" ולתת למערכת להגיב. כל מעבר בין שלוש הרכיבים מוסיף השהיה (latency) ופותח נקודת תקלה נוספת — למשל מצב שבו גלאי סיום הדיבור טועה ו"חותך" את המשתמש באמצע משפט, גם אם מנוע התמלול עדיין פועל כשורה.
Muse Voice Transcribe, כפי שמתואר במקור, מכווץ את שלוש המשימות למודל אוטורגרסיבי יחיד — כלומר מודל שמייצר את הפלט שלב אחר שלב, כשכל תחזית מתבססת על מה שנוצר לפניה, בדומה לאופן שבו מודלי שפה מייצרים טקסט מילה אחר מילה. במקום לחשב תמלול, זיהוי דובר וזיהוי סיום דיבור כשלושה תהליכים מקבילים שצריך לתאם ביניהם, המודל היחיד מבצע את כל השלוש בתוך אותו תהליך רציף.
למה זה חשוב
ההיגיון העסקי מאחורי המהלך, ככל הנראה, נוגע בעיקר למפתחי מוצרי קול — עוזרים קוליים, מוקדי שירות אוטומטיים, כלי תמלול לשיחות — שנאלצים כיום לשלב, לכייל ולתחזק שלוש מערכות נפרדות כדי לבנות חוויית שיחה בזמן אמת. איחוד המשימות במודל אחד עשוי לפשט את הארכיטקטורה של מוצרים כאלה ולצמצם את מספר נקודות התקלה שבין הרכיבים, מה שעשוי לתרום גם לצמצום ההשהיה שמורגשת בשיחה בין אדם למערכת.
עם זאת, מהתיאור שפורסם לא ניתן לדעת בשלב זה פרטים כמו ביצועי המודל במבחני דיוק מול פתרונות קיימים, זמינותו (למשל דרך API, כקוד פתוח, או ככלי פנימי בלבד), או לוח הזמנים להשקה רחבה. אלה פרטים שיתבררו ככל שיתפרסם מידע נוסף על המודל.