Qwen של אליבאבא משיקה מודל תרגום סימולטני עם עיכוב ממוצע של 2.3 שניות
צוות Qwen של אליבאבא השיק את Qwen3.8-LiveTranslate, מודל לתרגום סימולטני בזמן אמת המבוסס על ארכיטקטורה חדשה בשם Interleave. המודל מבין 60 שפות ודובר 29 מהן, ומצמצם את פער הזמן הממוצע בין דיבור לתרגום מ-2.8 שניות ל-2.3 שניות. הוא זמין כעת דרך WebSocket API בפלטפורמות הענן של אליבאבא.
צוות Qwen של אליבאבא הכריז על Qwen3.8-LiveTranslate, מודל תרגום סימולטני בזמן אמת המבוסס על ארכיטקטורה חדשה שמכונה Interleave. לפי המקור, המודל מצמצם את פער הזמן הממוצע בין רגע הדיבור לרגע הופעת התרגום — מדד המכונה בתחום ה-LAAL (Average Lagging) — מ-2.8 שניות ל-2.3 שניות.
מה חדש במודל
מעבר לשיפור בזמן התגובה, Qwen3.8-LiveTranslate מוסיף כמה יכולות שלא היו חלק סטנדרטי ממודלי תרגום קודמים של החברה: זיהוי דוברים בזמן אמת (speaker diarization) המלווה בשכפול קול יציב (voice cloning), כך שהתרגום נשמע בקול הדומה לדובר המקורי; תצוגה דו-לשונית מסונכרנת, המציגה את הטקסט המקורי לצד התרגום במקביל; ויכולת פענוח הקשר ארוך-טווח (long-context disambiguation) לשמות פרטיים ומונחים ייחודיים — נקודת תורפה מוכרת במערכות תרגום סימולטני, שבהן שמות ומונחים מקצועיים נוטים להתפרש לא נכון כשאין להם הקשר משפטי מלא.
מבחינת כיסוי שפתי, המודל מבין 60 שפות אך דובר רק 29 מתוכן — כלומר יכולת ההבנה שלו רחבה משמעותית מיכולת הפלט הקולי.
המודל זמין כעת כ-API מבוסס WebSocket דרך שתי פלטפורמות הענן של אליבאבא: Alibaba Cloud Model Studio ו-QwenCloud, מה שמאפשר למפתחים לשלב את היכולת ישירות באפליקציות תרגום, כלי ועידה או שירותי נגישות.
למה זה חשוב
תרגום סימולטני נחשב באופן מסורתי לאחד האתגרים הקשים ביותר ב-AI לשפה, משום שהמערכת נדרשת להתחיל לתרגם לפני שהמשפט המקורי הושלם — פשרה מובנית בין מהירות לדיוק. כל שבריר שנייה של עיכוב פחות משמעותי לשיחה טבעית, בדומה לאופן שבו מתורגמנים אנושיים בכנסים בינלאומיים נמדדים על פי קצב תגובתם.
שילוב זיהוי דוברים ושכפול קול, אם יעמוד בציפיות בשימוש מעשי, עשוי להפוך תרגום מכונה חי לחוויה קרובה יותר לתרגום אנושי — כזו שבה כל דובר בשיחה רב-משתתפים נשמע כ"עצמו", ולא כקול גנרי אחיד. זמינות המודל כ-API ציבורי, ולא רק כהדגמה פנימית, מסמנת ככל הנראה שאליבאבא מתכוונת למקם את הכלי כתחרות ישירה למוצרי תרגום סימולטני מסחריים קיימים, ולא רק כפרויקט מחקר.
עם זאת, המקור אינו כולל נתוני ביצועים בתנאי רעש, מבטאים כבדים או שיחות חופפות (crosstalk) — תרחישים שבהם מערכות תרגום סימולטני נוטות להיכשל בפועל, ושבהם יתברר אם השיפור הנמדד במעבדה מחזיק מעמד גם בשטח.