יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

קיוטאי משחררת את Voice of Reason: מודל דיבור פתוח שפותר בעיות מתמטיקה בלי לעבור דרך טקסט

מעבדת המחקר קיוטאי שחררה את Voice of Reason, שני מודלים בקוד פתוח שמקבלים שאלה בדיבור ועונים בדיבור, בלי שלב תמלול ובלי מודל טקסט באמצע. בעזרת fine-tuning ו-reinforcement learning, הדיוק בגרסה המדוברת של מבחן המתמטיקה GSM8K עלה מ-27.3% ל-77.1%.

מעבדת המחקר קיוטאי (Kyutai) שחררה את Voice of Reason. מדובר בשני מודלים מסוג speech-to-speech, כלומר מודלים שמקבלים דיבור ומחזירים דיבור, ונועדו לפתור בעיות מתמטיקה שמוקראות להם בקול. הנתון המרכזי בהודעה: בגרסה המדוברת של מבחן GSM8K, הדיוק עלה מ-27.3% ל-77.1%. לפי הדיווח אין בתהליך שלב תמלול, ואף מודל שפה טקסטואלי (LLM) לא משתתף בו.

איך זה עובד בדרך כלל, ומה שונה כאן

עוזרים קוליים רבים בנויים היום כשרשרת של שלבים. קודם הדיבור עובר תמלול לטקסט, אחר כך מודל שפה טקסטואלי מעבד אותו ומנסח תשובה, ובסוף מנוע הקראה הופך את התשובה חזרה לקול. השיטה עובדת, אבל כל שלב מוסיף זמן המתנה ומקום לטעויות. בנוסף, מידע שנמצא בקול עצמו, כמו טון, הדגשות והיסוסים, הולך לאיבוד בתמלול.

לפי ההודעה, Voice of Reason מוותר על השרשרת הזאת. המודלים "חושבים" ומשיבים ישירות במרחב הדיבור. ההישג המדווח הוא שמודל כזה מצליח להתמודד עם משימה שדורשת חשיבה בכמה צעדים, בלי להישען על מודל טקסט.

המספרים

שני המודלים בנויים על GLM-4-Voice-9B, מודל דיבור קיים בגודל של כתשעה מיליארד פרמטרים. קיוטאי אימנה אותו בשני שלבים. הראשון הוא supervised fine-tuning, כלומר כוונון על דוגמאות שבהן התשובה הנכונה ידועה מראש. השני הוא reinforcement learning (למידת חיזוק), שבה המודל מקבל משוב על התוצאות שלו ומשתפר בהתאם.

המבחן שנבחר הוא GSM8K, מאגר מוכר של בעיות מילוליות במתמטיקה ברמת בית ספר יסודי, שבו משתמשים הרבה כדי לבדוק יכולת חשיבה של מודלי שפה. כאן נבדקה גרסה מדוברת שלו. הקפיצה מ-27.3% ל-77.1% פירושה שהמודל עבר מפתרון נכון של כרבע מהבעיות לפתרון נכון של יותר משלושה רבעים מהן.

פתוח וזמין

שני המודלים שוחררו כ-open-weight, כלומר המשקלות שלהם זמינים להורדה חופשית, והם מתפרסמים ב-Hugging Face. לפי הדיווח אפשר להריץ אותם על מעבד גרפי יחיד מסוג H100. זו חומרה של מרכזי נתונים ולא של מחשב ביתי, אבל היא בהישג יד של מעבדות מחקר אקדמיות וחברות קטנות.

למה זה חשוב

החולשה הידועה של מודלי דיבור "טהורים" היא שבמשימות חשיבה הם מפגרים הרבה אחרי מודלים טקסטואליים. זו גם הסיבה שרוב המערכות המסחריות ממשיכות לעבור דרך טקסט. התוצאה של קיוטאי מרמזת, ככל הנראה, שחלק ניכר מהפער הזה אפשר לסגור בעזרת שיטות אימון שכבר הוכיחו את עצמן בעולם הטקסט, ובראשן reinforcement learning, ולא רק בעזרת ארכיטקטורה חדשה.

אם הכיוון הזה יתבסס, המשמעות עשויה להיות עוזרים קוליים מהירים יותר, שמבינים את הדובר בצורה עשירה יותר ואינם תלויים באיכות התמלול. עם זאת, כדאי לזכור שמדובר בתוצאה על מבחן אחד ובתחום מוגדר, מתמטיקה בסיסית. עדיין לא ברור עד כמה היא תחזיק במשימות אחרות.

גם לשחרור הפתוח יש משקל. כשהמשקלות זמינים לכולם, חוקרים אחרים יכולים לבדוק את התוצאות בעצמם, לשפר אותן ולבנות עליהן. לכן סביר שבחודשים הקרובים נראה ניסיונות לשחזר ולהרחיב את הגישה.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות