גוגל משיקה שני מודלי TTS חדשים: קול חדש מתיאור בטקסט, ומקום ראשון בבנצ'מרק לעיצוב קול
גוגל השיקה את Gemini 3.8 Flash TTS ואת Flash-Lite TTS, שני מודלים חדשים להמרת טקסט לדיבור. Flash TTS מעצב קולות חדשים לפי תיאור בשפה טבעית ביותר מ-100 שפות, ומדורג במקום הראשון בבנצ'מרק לעיצוב קול של Hume AI. Flash-Lite TTS זול יותר ומיועד לדיבוב בהיקפים גדולים ולסוכנים קוליים.
גוגל השיקה שני מודלים חדשים להמרת טקסט לדיבור (TTS, text-to-speech): Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS. שניהם זמינים כבר עכשיו דרך ה-Gemini API וב-Google AI Studio. החידוש המרכזי ב-Flash TTS הוא עיצוב קול לפי תיאור (prompt): במקום לבחור קול מרשימה קבועה, כותבים בשפה טבעית איזה קול רוצים, והמודל יוצר אותו. היכולת נתמכת ביותר מ-100 שפות.
מקום ראשון בבנצ'מרק
לפי MarkTechPost, Flash TTS מדורג במקום הראשון ב-Voice Design Benchmark של Hume AI, עם ציון 71.4. זה בנצ'מרק שמודד בדיוק את היכולת הזו: ליצור קול חדש מתוך תיאור טקסטואלי. כדאי לזכור שבנצ'מרק יחיד לא מספר את כל הסיפור, ועוד לא ברור איך המודל יתפקד בשימוש יומיומי. ובכל זאת, הדירוג מלמד שגוגל מתחרה ברצינות בתחום שבו פועלות חברות קול ייעודיות.
המודל השני, Flash-Lite TTS, מיועד לשימושים שבהם העלות קובעת: דיבוב בהיקפים גדולים וסוכנים קוליים (voice agents), כלומר מערכות AI שמנהלות שיחה קולית עם משתמשים. זה אותו דפוס שגוגל נוקטת גם במודלי השפה שלה: גרסת Flash לאיכות, וגרסת Lite זולה יותר לעבודה בכמויות.
אלפיים קולות, שיבוט קול ושיחות מרובות דוברים
המפתח סיימון ויליסון, שמסקר מקרוב את תחום ה-LLM, פרסם כלי ניסוי למודלים החדשים ותיאר עוד כמה פרטים. לדבריו, המודלים מגיעים עם ספרייה של יותר מ-2,000 קולות. אפשר גם ליצור קול מותאם אישית מ"דגימת שמע של 30 שניות בלבד מהקול שלך, או מקול שיש לך זכות להשתמש בו". הניסוח הזה מרמז שגוגל מודעת לחשש משיבוט קולות של אנשים בלי הסכמתם. עם זאת, המקורות לא מפרטים אילו מנגנוני אכיפה, אם בכלל, עומדים מאחורי התנאי.
לפי ויליסון, אחת התכונות הבולטות של ה-API היא הקלות שבה מגדירים שיחה שלמה בין כמה דמויות, וכל אחת מקבלת קול משלה והנחיות סגנון משלה. להדגמה הוא הפיק דיאלוג קצר בין שני שקנאים שמתלבטים אם לעבור למזח פסיפיקה. את התסריט כתב Claude.
כמה זה עולה
ויליסון מספר שהפקת דקה ו-18 שניות של שמע ב-Flash TTS, הגרסה היקרה מבין השתיים, נמשכה כ-20 שניות ועלתה 2.74 סנט. הכלי שבנה עובד עם מפתח ה-API של המשתמש, ומאפשר ליצור קריינות בקול יחיד או שיחה בין כמה דוברים, להאזין לתוצאה ולשמור את ההגדרות בקישור שאפשר לשתף.
למה זה חשוב
המהלך מציב את גוגל בתחרות ישירה מול חברות קול ייעודיות. עבור יוצרי תוכן, מפיקי פודקאסטים ומפתחי אפליקציות, המשמעות ככל הנראה היא שהפקת קריינות ודיבוב בשפות רבות הופכת לזולה ולפשוטה יותר, בלי אולפן ובלי שחקני קול לכל שפה. אם המחיר שוויליסון מדווח עליו ישקף גם שימוש רחב, ייתכן שההפקה הקולית תהפוך לרכיב סטנדרטי באפליקציות רבות, ולא למותרות.
מנגד, הקלות שבה אפשר ליצור ולשבט קולות מחדדת שאלות על זכויות בקול, על הסכמה ועל התחזות. המקורות הזמינים עדיין לא מתייחסים לשאלות האלה לעומק.