יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

ElevenLabs משיקה את v4: קול AI שמבין הקשר, 90 שפות וגרסת Turbo לסוכנים קוליים

ElevenLabs השיקה את Eleven v4, מודל ההקראה החדש שלה. לפי החברה, הוא מציית בצורה מדויקת יותר להוראות רגש והבעה ושומר על קול עקבי גם בהפקות ארוכות. לצדו יוצאת גרסת Turbo לסוכנים קוליים שמתחילה לדבר תוך כ-150 מילישניות. המודל תומך ביותר מ-90 שפות, וביניהן עברית, והוא זמין גם באפליקציית ההקראה ElevenReader.

חברת ה-AI הקולי ElevenLabs השיקה את Eleven v4, דור חדש של מודל ההמרה מטקסט לדיבור (TTS) שלה. לדברי החברה, המודל נשען על ארכיטקטורה חדשה, ממלא בדיוק רב יותר הוראות של רגש והבעה, ושומר על קול עקבי לאורך הפקות ארוכות. לצדו יוצאת גרסת v4 Turbo, שמיועדת לסוכנים קוליים בזמן אמת. שני המודלים זמינים כבר עכשיו בפלטפורמות ElevenAgents ו-ElevenCreative ודרך ה-API, ולפי גיקטיים הם מוטמעים גם באפליקציית ההקראה ElevenReader ל-iOS ולאנדרואיד.

קריינות שקוראת את ההקשר

לפי ElevenLabs, המודל מנתח את הטון, הקצב וההקשר של הטקסט כולו, ולא רק מקריא אותו מילה אחרי מילה. בפועל, האינטונציה, מהירות הדיבור וההפסקות לנשימה משתנות בהתאם לתוכן. בדיאלוגים, הדמויות מגיבות להקשר של הסצנה כולה ולא מקריאות כל שורה בנפרד.

אפשר לכוון את הקריינות גם ידנית, באמצעות תגיות שמשלבים בתוך הטקסט: למשל ‎[whisper]‎ ללחישה, ‎[laugh]‎ לצחוק, ‎[sigh]‎ לאנחה או ‎[sad]‎ לטון עצוב. אפשר גם לנסח את ההוראות במשפטים רגילים. המודל הקודם, v3, שיצא לפני קצת יותר משנה, כבר תמך בתגיות כאלה, אבל לפי The Decoder הוא ציית להן פחות. החברה מוסיפה שהשליטה בהגייה של שמות ומונחים טכניים, באמצעות כתיב פונטי, עובדת עכשיו בצורה אמינה יותר.

v4 מעבד עד 10,000 תווים בכל בקשה, כעשר דקות של אודיו. יצירות ארוכות יותר, כמו ספרי שמע, מחולקות למקטעים, והקצב וסגנון ההגשה אמורים להישאר אחידים גם במעברים ביניהם. במבחן ההגייה קיבל v4 ציון של 91.7%, לעומת 85.6% של v3.

90 שפות ושכפול קול

מספר השפות הנתמכות עלה מכ-70 ב-v3 ליותר מ-90. עברית נמצאת ביניהן: לפי גיקטיים, היא נוספה לאפליקציית ההקראה לפני כשנה. לפי החברה, קולות משוכפלים אמורים לדבר בשפות אחרות במבטא מקומי, בלי לחזור עם הזמן למבטא המקורי. גם שכפול הקול עבר שדרוג: Instant Voice Clone צריך עכשיו רק עשר שניות של הקלטה, ו-Professional Voice Clones, שלא נתמכו ב-v3, חזרו לפעול.

Turbo: מהירות לסוכנים קוליים

גרסת Turbo מיועדת לשימושים כמו שיחות שירות לקוחות ודמויות במשחקים. לפי מבחנים של ElevenLabs, היא מתחילה להפיק דיבור שנשמע לאוזן אחרי 150 מילישניות, לעומת 262 מילישניות ב-Sonic 3.6 של Cartesia ו-814 מילישניות ב-GPT-4o mini TTS של OpenAI. חשוב לזכור שאלה מדידות של החברה עצמה.

בטבלת Provider Voice Arena של Artificial Analysis, דירוג שנבנה מהעדפות מאזינים, v4 מדורג מעל Sonic 3.6 ומעל Gemini 3.8 Flash TTS של גוגל.

מחיר

המחיר הרגיל ב-API הוא 80 דולר למיליון תווים ב-v4 ו-40 דולר ב-Turbo. עד 12 באוקטובר המחירים יורדים ל-22 ו-11 דולר בהתאמה. לשם השוואה, Artificial Analysis מציינת מחיר של 49 דולר ל-Sonic 3.6 ו-16.49 דולר ל-Gemini 3.8 Flash TTS. מנויים לתוכנית Creator (22 דולר בחודש) ומעלה יכולים להשתמש ב-v4 ב-ElevenCreative בלי תוספת תשלום במשך שבועיים, עד פעמיים מכסת הקרדיטים החודשית שלהם.

למה זה חשוב

בשוק ה-TTS מתחרות היום כמה חברות, והפער בין קול סינתטי לקול אנושי הולך ומצטמצם. השילוב של שליטה ברגש, עקביות בטקסטים ארוכים ותגובה מהירה מכוון ככל הנראה לשני שווקים מרכזיים: הפקת תוכן, כמו ספרי שמע ודיבוב, ובוטים קוליים לשיחות. למשתמשים בישראל המשמעות מעשית יותר: הקראה טבעית יותר בעברית של כתבות ומסמכים ארוכים באפליקציה. כדאי לזכור שרוב נתוני הביצועים שפורסמו מגיעים מהחברה עצמה, ומבחנים בלתי תלויים יראו עד כמה השיפור מורגש בפועל.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות