גוגל משיקה את Gemini 3.8 Flash TTS: יוצרים קול חדש מתיאור טקסטואלי, ביותר מ-100 שפות
גוגל השיקה שני מודלים חדשים להמרת טקסט לדיבור, Gemini 3.8 Flash TTS ו-Flash-Lite TTS. שניהם תומכים ביותר מ-100 שפות, מאפשרים לכתוב הוראות משחק לכל שורה ולייצר דיאלוג בין שני קולות. בגרסת Flash אפשר גם לעצב קול חדש לגמרי מתיאור טקסטואלי, או לשכפל קול מדגימה של 30 שניות בהסכמת בעליו.
גוגל הכריזה היום על שני מודלים חדשים להמרת טקסט לדיבור (TTS, text-to-speech): Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS. בגרסת Flash אפשר ליצור קול חדש מאפס רק מתיאור במילים, למשל תפקיד הדמות, המבטא ומאפייני הקול. שני המודלים תומכים ביותר מ-100 שפות וניבים, ומאפשרים לכתוב הוראות ביצוע נפרדות לכל שורה בתסריט.
שני מודלים, שני קהלים
לפי גוגל, Flash TTS מיועד לעבודה יצירתית: דמויות במשחקים, ספרי שמע, פודקאסטים ומדיה אינטראקטיבית. Flash-Lite TTS מיועד לייצור דיבור בהיקפים גדולים ובעלות נמוכה, למשל לדיבוב, לתוכן שמע ולסוכנים קוליים (voice agents), כלומר מערכות שמנהלות שיחה קולית עם משתמשים.
עד עכשיו עמדו לרשות המפתחים 30 קולות מוכנים בלבד. עכשיו גוגל מציעה ספרייה של יותר מ-2,000 קולות, כולל וריאנטים אזוריים כמו ספרדית מקסיקנית, צרפתית של קוויבק ואנגלית סקוטית. מי שמעדיף לא להתחיל מאפס יכול לבחור קול מהספרייה. מי שרוצה משהו מקורי יכול לתאר אותו במילים. בדוגמאות שגוגל פרסמה מופיעים די־ג'יי אנרגטי ממלבורן, רובוט מונוטוני ודרקון יפני.
שכפול קול, והגנות
היכולת הרגישה יותר היא שכפול קול (voice cloning). לפי הדיווח ב-The Decoder, המודל בונה פרופיל קולי מדגימת שמע של 30 שניות. כדי להשתמש ביכולת הזו, מי שהקול שלו משוכפל צריך להקליט הצהרת הסכמה בקולו, והקול בהקלטה חייב להתאים לדגימה. לפי גוגל, בכל קטע שמע שהמודלים מייצרים מוטמע סימן מים בלתי נשמע מסוג SynthID, ויכולת השכפול מגובה גם באישורי מקור בתקן C2PA. המטרה היא לאפשר לזהות דיבור שנוצר בבינה מלאכותית.
גוגל הכריזה גם על Voice Remixing, יכולת שתאפשר לשנות גוון, גובה, קצב ומבטא של קולות מהספרייה באמצעות הנחיות כמו "הוסף מבטא דרומי עדין". היכולת עדיין לא זמינה.
לביים כל שורה
בשני המודלים המשתמש יכול לכתוב הוראות במה לכל שורה, או לתת למודל לפרש לבד את הרמזים שבתסריט. מצב של שני דוברים מייצר דיאלוג מתסריט אחד ושומר על קול נפרד לכל דמות. אפשר גם לשלב בתסריט צחוק, אנחות וקולות תגובה כמו "מממ" בדיוק במקום הרצוי. לדברי גוגל, המודלים מסוגלים לייצר שעות של שמע עם "סחיפת דובר" (speaker drift) מינימלית, כלומר הקול כמעט לא משתנה לאורך ההקלטה.
גוגל טוענת שהמודלים מובילים ברוב הקטגוריות במדד ה-TTS של Hume AI. בדיקה עצמאית קצרה של The Decoder מציגה תמונה חלקית יותר. בשני ניסויים שבהם התבקש המודל לחקות ברלינאי עצבני שמדבר אנגלית במבטא גרמני כבד, המבטא והאינטונציה יצאו משכנעים. עם זאת, בשני הניסויים נשמע בחלק מהזמן יבבה גבוהה ברקע, ובאחד מהם הקול השתנה לקראת סוף הקטע.
זמינות
שני המודלים מתחילים להיות זמינים דרך Gemini API ו-Google AI Studio. Flash TTS זמין גם ב-Gemini Notebook, ו-Flash-Lite TTS זמין ב-Google Vids. לפי גוגל, גישה דרך Gemini Enterprise API תגיע בקרוב. פלטפורמות פיתוח כמו Agora, LiveKit, Pipecat ו-Vercel כבר תומכות בשילוב דרך ה-API.
המשמעות
ההשקה מצטרפת לשורת מודלי שמע שגוגל הוציאה במשפחת Gemini, ובהם 3.5 Live Translate, 3.5 Transcribe ו-3.8 Live. ככל הנראה גוגל מנסה לבנות מערך שלם של כלי קול: תמלול, תרגום, שיחה בזמן אמת ועכשיו גם עיצוב קולות. הפיצול לשני מודלים מבחין בין יוצרים שצריכים שליטה מדויקת בביצוע לבין חברות שצריכות היקף ומחיר נמוך. יחד עם זאת, שכפול קול מדגימה קצרה מעורר שאלות מוכרות של התחזות והונאה. הסכמה מוקלטת וסימני מים הם מענה חלקי, והשאלה היא עד כמה יעמדו בשימוש בפועל.