יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

טנסנט חושפת Gander: מודל AI שממשיך לדבר גם כשהוא עסוק במשימה ברקע

חטיבת Hunyuan Speech של טנסנט הציגה את Gander, מודל מחקרי שמנהל שיחה קולית בזמן אמת במקביל לביצוע משימות מורכבות ברקע, באמצעות פיצול בין רכיב "צרבלום" לניהול השיחה לרכיב "מוח" להסקה. בבדיקות מול מתחרים מסחריים המודל הצטיין בתזמון השיחה אך פיגר בדיוק ביצוע המשימות.

חטיבת Hunyuan Speech של טנסנט, בשיתוף חוקרים מכמה אוניברסיטאות, הציגה את Gander — מודל בינה מלאכותית מחקרי שמנסה לפתור בעיה מוכרת בעוזרים קוליים: היכולת לנהל שיחה בזמן אמת ובמקביל לבצע משימה מורכבת ברקע, בלי לעצור את הדיאלוג. לפי הדיווח באתר The Decoder, Gander מעבד בו-זמנית דיבור, תמונות וטקסט, ומאפשר למשתמש לקטוע אותו בכל רגע.

הרעיון המרכזי, על פי הדוח הטכני של הצוות, הוא שרוב עוזרי הקול הקיימים פועלים במתכונת של "תור" — כל צד מדבר בנפרד. בשיחה אנושית אמיתית, לעומת זאת, אנשים קוטעים זה את זה, נותנים משוב קצר תוך כדי הקשבה, ומדברים ומקשיבים במקביל. Gander נבנה כדי לדמות את הדפוס הזה: הוא ממשיך לעבד וידאו, דיבור וטקסט גם בזמן שהוא עצמו מדבר, ויכול ביוזמתו לשאול שאלות המשך או לעדכן במצב התקדמות של משימה.

כדי לאפשר את זה, הצוות חילק את העבודה בין שני רכיבים שמכונים, בהשאלה מאנטומיה אנושית, "צרבלום" (cerebellum) ו"מוח" (brain). הצרבלום אחראי על ניהול השיחה בזמן אמת — הוא מחלק את הדיאלוג למקטעים של שנייה אחת ומחליט בכל מקטע אם להקשיב, לדבר או להיעצר אם המשתמש קוטע אותו, תוך שימוש בזיכרון של כשתי דקות שיחה אחרונות ובלי מודול נפרד לזיהוי תחילת וסוף דיבור. ה"מוח", לעומת זאת, מטפל בחשיבה ובמשימות מורכבות ברקע — למשל תיקון באג בקוד או המתנה להופעת שקופית מסוימת — וניתן להחליף אותו במערכות agent חיצוניות כמו Codex או Claude Code בלי לאמן מחדש את מודל השיחה. בבדיקות של הצוות שימש ברכיב זה מודל לא-מזוהה ממשפחת GPT-5.6 של OpenAI.

מבחינת ביצועים, טנסנט בדקה את Gander מול Full-Duplex-Bench v3, מדד שבוחן עוזרים קוליים על פני תרחישי משימה שונים, מכיוון שלדברי החוקרים אין עדיין מדד ייעודי למודלים מהסוג הזה. לפי הדוח, Gander התחיל לדבר ברגע הנכון בכל 100 התרחישים שנבדקו, וקטע את המשתמש ב-8% מהמקרים בלבד — לעומת 13.5% אצל GPT-Realtime של OpenAI, וכ-48% אצל המתחרה החלש ביותר שנבדק. הצוות מציין כי Gander משתמש במודל קטן יחסית כדי להתמודד מול מערכות מסחריות כמו GPT-Realtime, Gemini Live ו-Grok.

מנגד, הדיוק בביצוע המשימות עצמן היה נקודת התורפה של Gander: הדוח מציין שהמודל פיגר מעט אחרי המתחרה החלש ביותר בקטגוריה הזו, והראה חולשות בהבנת וידאו ואודיו. כך מתקבלת תמונה של פשרה — Gander מצטיין בתזמון השיחה, אך ככל הנראה משלם על כך מחיר מסוים ביכולת לבצע את המשימה ברקע בצורה מדויקת.

טנסנט מתכננת לפרסם את משקלי המודל ואת נתוני האימון, ומאגר GitHub עם הקוד כבר קיים כעת. אם המגמה הזו תימשך, ייתכן שהיא תשפיע על האופן שבו מפתחים אחרים יגשו לתכנון עוזרים קוליים — הפרדה בין מהירות תגובה בשיחה לבין עומק חשיבה במשימה, כשני רכיבים נפרדים במקום מודל יחיד שנדרש לאזן בין השניים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות