עליבאבא משיקה מודל קול דו-כיווני שמחליט בעצמו מתי לדבר
צוות Qwen של עליבאבא השיק את Qwen-Audio-3.1-Realtime, מודל קול בזמן אמת שיכול להקשיב ולדבר בו-זמנית, להפעיל כלים ולהחליט מתי נכון לענות. בבדיקה שפרסמה החברה שיעור התגובות השגויות לדיבור ברקע ירד מ-73% ל-13%. המודל זמין כבר עכשיו כ-API בפלטפורמת QwenCloud.
צוות Qwen של עליבאבא השיק את Qwen-Audio-3.1-Realtime, מודל קולי מסוג full-duplex, כלומר מודל שיכול להקשיב ולדבר באותו זמן. לפי הדיווח, המודל אומן להסיק מסקנות (reasoning), להפעיל כלים חיצוניים, ובעיקר להחליט בעצמו מתי נכון לדבר ומתי עדיף לשתוק. הוא זמין כבר עכשיו כ-API בפלטפורמת הענן של החברה, QwenCloud.
הבעיה: עוזר קולי שעונה לכל רעש
מי שדיבר פעם עם עוזר קולי בסביבה רועשת מכיר את זה. מישהו בחדר אומר משהו, טלוויזיה פועלת ברקע, והעוזר קוטע את השיחה ועונה למי שבכלל לא פנה אליו. במודלים קוליים רבים ההחלטה מתי לדבר נשענת בעיקר על זיהוי שקט או על מנגנון תזמון פשוט, בלי הבנה אמיתית של מי מדבר ולמי.
ב-Qwen-Audio-3.1-Realtime החליטו בעליבאבא להפוך את השאלה "מתי לדבר" לחלק ממה שהמודל עצמו לומד. על פי הנתונים שפורסמו, שיעור התגובות של המודל לדיבור ברקע ירד מ-73% ל-13%. במילים אחרות, במקום להגיב לרוב הדיבור שאינו מופנה אליו, המודל מגיב כעת רק למיעוט קטן ממנו.
הצלחה במשימות, לא רק בשיחה
מעבר לשאלת התזמון, המודל נבדק גם ביכולת להשלים משימות. בגרסה מותאמת של τ-Voice, מבחן להערכת סוכנים קוליים שצריכים לבצע משימות בשיחה, שיעור ההצלחה עלה ל-82.0%, לעומת 78.4%. זה שיפור מתון יחסית, אבל בתחום הסוכנים הקוליים כל נקודת אחוז משקפת שיחות שבהן המשתמש קיבל את מה שביקש בלי להתחיל מחדש.
היכולת להפעיל כלים (tool calling) היא מה שמבדיל סוכן קולי מצ'טבוט שמדבר. המשמעות היא שהמודל אמור לא רק לענות בקול, אלא גם לבצע פעולות תוך כדי שיחה, למשל לשלוף מידע ממערכת חיצונית או לעדכן נתונים, ולשלב את התוצאה בתשובה.
למה זה חשוב
המודל של עליבאבא מצטרף למגמה רחבה בתעשייה, שבה חברות ה-AI הגדולות מנסות להפוך את האינטראקציה הקולית לטבעית יותר: שיחה שבה אפשר לקטוע, להתלבט ולדבר בחופשיות, ולא רק תור של שאלה ותשובה. ככל הנראה, דווקא ההחלטה מתי לא לדבר היא אחד המכשולים המרכזיים בדרך לשם, ובייחוד בשימושים כמו מוקדי שירות, רכבים או בתים חכמים, שבהם יש כמה דוברים ורעשי רקע.
הירידה מ-73% ל-13% בתגובות לדיבור ברקע היא הנתון הבולט בהשקה. אם היא תחזיק גם מחוץ לתנאי המבחן, עוזרים קוליים שנבנו על המודל עשויים להיות פחות מתסכלים לשימוש יומיומי. עם זאת, מדובר בנתונים שפרסמה החברה עצמה, ומוקדם לדעת איך המודל יתפקד בשימוש אמיתי.
ההחלטה להציע את המודל מיד כ-API ב-QwenCloud מלמדת ככל הנראה שעליבאבא מכוונת בראש ובראשונה למפתחים ולעסקים שבונים מוצרים קוליים, ולא רק לשימוש בתוך המוצרים שלה.