עליבאבא משיקה את Qwen Audio 3.1: חמישה מודלים קוליים, כולל זיהוי דוברים ורגשות, והוזלות של עד 95%
צוות Qwen של עליבאבא השיק את Qwen-Audio-3.1, סדרה של חמישה מודלים לזיהוי דיבור, להקראת טקסט ולשיחה בזמן אמת. גרסת ASR-Next מזהה כמה דוברים, רגשות וצלילי רקע. במקביל החברה מורידה את המחירים: עד 95% פחות על זיהוי דיבור, כ-85% פחות על המודל בזמן אמת וכ-70% פחות על הקראת טקסט.
צוות ה-AI של עליבאבא, Qwen, השיק את Qwen-Audio-3.1. זו סדרה של חמישה מודלים שמטפלים בקול בשני הכיוונים: זיהוי דיבור (ASR, Automatic Speech Recognition), הקראת טקסט בקול סינתטי (TTS, Text-to-Speech) ושיחה קולית בזמן אמת. יחד עם ההשקה החברה מודיעה על הורדת מחירים חדה: עד 95% פחות על שירות זיהוי הדיבור.
מה יש בסדרה
ASR הוא מודל התמלול הבסיסי. לפי הדיווח ב-The Decoder, הוא מזהה טוב יותר שפות וניבים שונים, ומנקה מהתמלול מילות מילוי וחזרות, כמו "אממ" ומשפטים שהדובר התחיל פעמיים.
ASR-Next מוסיף שכבה של הבנת ההקשר: הוא מבחין בין כמה דוברים באותה הקלטה ומסמן מתי כל אחד דיבר (timestamps). הוא גם מזהה רגשות, צלילי סביבה ורעשי מכונות. היכולת להבחין בין דוברים, שנקראת diarization, חשובה בעיקר בתמלול ישיבות, ראיונות ושיחות עם מוקדי שירות, שם צריך לדעת לא רק מה נאמר אלא גם מי אמר את זה.
TTS מקריא טקסט בכמה שפות ויודע להעביר קול משפה לשפה כך שיישמע טבעי. המשתמש קובע את הרגש, הקצב והסגנון בהוראה פשוטה בטקסט. הדוגמה שמביאה Qwen היא הוראה (במקור באנגלית) להקריא את הטקסט "בטון חד ותקיף, שדורש כבוד".
TTS-Next משלב מודל שפה עם שיטת diffusion, אותה משפחת טכניקות שעומדת מאחורי מחוללי תמונות רבים. כך הוא מייצר בבת אחת את הדיבור, את אפקטי הסאונד ואת מוזיקת הרקע, במקום להרכיב אותם משלושה כלים נפרדים.
מודל ה-Realtime מיועד לשיחה קולית: הוא יכול לדבר ולהקשיב באותו זמן, והמשתמש יכול לקטוע אותו באמצע משפט. לפי Qwen, כשהמודל מזהה שהמשתמש במצב רוח ירוד הוא עונה לאט יותר ובאמפתיה רבה יותר.
המחירים יורדים
שירות ה-TTS יוזל בכ-70%, מודל ה-Realtime בכ-85% וזיהוי הדיבור בעד 95%. המקור לא מפרט מחירים מוחלטים, רק את שיעורי ההוזלה. לפי הדיווח, פרטים נוספים מופיעים בבלוג של Qwen ובפלטפורמת Qwen Cloud.
למה זה חשוב
ההוזלה היא ככל הנראה החלק המשמעותי ביותר בהשקה. תמלול ובוטים קוליים הם שירותים שמשלמים עליהם לפי דקה או לפי שימוש. כשהמחיר יורד בסדר גודל, שימושים שלא השתלמו קודם, כמו תמלול רציף של כל שיחות השירות בחברה, עשויים להפוך לכדאיים כלכלית.
עליבאבא משתמשת כבר כמה שנים במשפחת Qwen כדי להתחרות בחברות ה-AI האמריקאיות ובחברות סיניות אחרות, ומחיר נמוך הוא אחד הכלים המרכזיים שלה בתחרות הזו. בתחום הקולי המהלך מעמיד ככל הנראה לחץ על ספקים שמתמחים בתמלול ובהקראה, וגם על ענקיות הענן שמציעות שירותים דומים.
השילוב של זיהוי רגשות עם שיחה בזמן אמת מלמד על הכיוון שבו התחום מתקדם: מעבר מתמלול "יבש" לממשקים קוליים שמגיבים גם לטון הדיבור ולא רק לתוכן. זה פותח אפשרויות לשירות לקוחות ולנגישות, אבל גם מעלה שאלות על פרטיות, כשמערכת מנתחת את מצב הרוח של מי שמדבר איתה.
לא ידוע עדיין עד כמה המודלים יתמודדו עם עברית. המקור מדבר על תמיכה רב-לשונית אבל לא מפרט אילו שפות נתמכות, ולכן מפתחים ישראלים יצטרכו לבדוק את זה בעצמם.