גוגל הציגה את Gemini 3.5 Transcribe, מודל תמלול קול חדש שמסיר אוטומטית מילות מילוי ותיקוני דיבור, מזהה ז'רגון מותאם אישית ותומך ביותר מ-85 שפות. המודל זמין כבר למשתמשי קצה באפליקציית Gemini ב-macOS ובתכונת ההכתבה Rambler באנדרואיד, ולמפתחים דרך ה-API.
גוגל הכריזה על Gemini 3.5 Transcribe, מודל תמלול קול חדש שמתיימר להתמודד טוב יותר עם רעש רקע, ז'רגון מקצועי וגמגומי דיבור טבעיים. לפי הודעת החברה, המודל ממיר קול גולמי ישירות לטקסט מדויק ומעוצב, ומיועד לשמש בסיס לאינטראקציות קוליות חכמות יותר.
המודל זמין למפתחים בשתי צורות: תמלול בזמן אמת עם השהיה של פחות משנייה, דרך ה-Live API ומודל בשם gemini-3.5-transcribe-live, המיועד לאפליקציות קוליות אינטראקטיביות; ותמלול של הקלטות קיימות — כמו פגישות ושיחות טלפון — עם זיהוי דוברים ותיוג זמנים ברמת המילה, דרך ה-Interactions API ומודל gemini-3.5-transcribe.
בין היכולות שגוגל מציגה: המודל מזהה תיקוני דיבור עצמאיים (למשל כשמישהו אומר "נתראה ביום שלישי — לא, ברביעי") ומתקן אותם בטקסט הסופי, מסיר מילות מילוי כמו "אה" ו"אמם", ומעצב את הטקסט אוטומטית. הוא גם תומך ב"אוצר מילים מותאם אישית" שמאפשר להזין מראש מונחי ז'רגון או איות ייחודי כדי שהמודל לא יטעה בהם. יכולת נוספת, זמינה כרגע רק באפליקציית Gemini למק, מאפשרת למודל להעביר משימות מורכבות — כמו יצירת תמונה או ניתוח קובץ — למודלים אחרים של Gemini באמצעות קריאת פונקציות.
מבחינת ביצועים, גוגל מדווחת כי לפי מדידה של Artificial Analysis, שיעור השגיאות במילים (WER) עומד על 4.0% בתמלול זורם ו-2.6% בתמלול של הקלטות מוכנות. בבנצ'מרק הרב-לשוני FLEURS השיעורים עומדים על 5.50% ו-5.04% בהתאמה. גוגל מציגה זאת כשיפור משמעותי לעומת המודל הקודם שלה, Chirp 3, עם קיצור של כ-70% בזמן עד לקבלת התמלול הסופי, לפי דיווח ב-The Verge. המודל תומך גם בזיהוי אוטומטי של יותר מ-85 שפות ולהגים אזוריים שונים, ומסוגל לייחס דיבור לעד שלושה דוברים בהקלטה מוקלטת מראש (תמיכה ביותר משלושה דוברים מסומנת עדיין כניסיונית).
המודל עולה לאוויר לצד שני מודלים נוספים, Gemini 3.5 Live ו-Gemini 3.5 Live Experimental, המשדרגים את מצב הצ'אט הקולי של Gemini בהתמודדות עם קטיעות דיבור באמצע משפט. לפי The Verge, ההשקה מגיעה בזמן שגוגל עדיין לא פרסמה את מודל הדגל Gemini 3.5 Pro, שהובטח ליוני ועדיין לא יצא נכון לכתיבת שורות אלו.
ההשקה מתחילה היום באנגלית, עבור משתמשי אפליקציית Gemini ב-macOS ותכונת ההכתבה Rambler באנדרואיד במדינות ושפות נבחרות. מפתחים יכולים לגשת למודל כבר עכשיו בגרסת פריוויו ציבורית דרך Gemini API ב-Google AI Studio, בפלטפורמת Gemini Enterprise Agent ובכלי Antigravity. גוגל מציינת כי תמיכה בדפדפן כרום צפויה להגיע בקרוב.
המשמעות המעשית, ככל הנראה, היא שגוגל מנסה לבסס את עצמה כספק תשתית לתמלול עבור מפתחי אפליקציות קוליות וכלי הכתבה — תחום שבו היא מתחרה במודלים כמו Whisper של OpenAI. השיפור בדיוק ובזמן התגובה עשוי להקל במיוחד על מוצרים הדורשים תמלול בזמן אמת, כמו כתוביות חיות וכלי ניתוח שיחות.