יום ראשון, 11 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

תמלול

מודלים וכלים

מיקרוסופט משיקה את MAI-Transcribe-2-Streaming: מודל תמלול בזמן אמת שדורג ראשון בבנצ'מארק

Microsoft AI, חטיבת ה-AI של מיקרוסופט, השיקה את MAI-Transcribe-2-Streaming, מודל התמלול הראשון שלה שעובד בזמן אמת. המודל דורג במקום הראשון מתוך 38 מודלים בדירוג התמלול בזמן אמת של Artificial Analysis. הוא תומך ב-60 שפות, עולה 0.54 דולר לשעת אודיו בתקופת ההשקה וזמין כעת בתצוגה ציבורית ב-Microsoft Foundry.

מודלים וכלים

מיקרוסופט משחררת מודלי תמלול ודיבור חדשים לסוכני קול

Microsoft AI השיקה את MAI-Transcribe-2-Streaming, מודל לתמלול בזמן אמת ב-60 שפות, ולצדו שני מודלים חדשים להמרת טקסט לדיבור. המודלים מיועדים לסוכני קול, כלומר מערכות AI שמנהלות שיחה מדוברת, וההשקה מחזקת ככל הנראה את מעמדה של מיקרוסופט בתחרות על שכבת הקול של ה-AI.

מודלים וכלים

Sarvam AI משיקה את Saaras V4: מודל תמלול לכל 22 השפות הרשמיות של הודו ולאנגלית

הסטארטאפ ההודי Sarvam AI השיק את Saaras V4, מודל speech-to-text שמכסה את כל 22 השפות הרשמיות של הודו וגם אנגלית. המודל כבר זמין דרך ה-API של החברה במחיר של 30 רופי לשעת שמע, ותומך בתמלול בזמן אמת עם זמן תגובה של פחות מ-150 מילישניות.

סין

עליבאבא משיקה את Qwen Audio 3.1: חמישה מודלים קוליים, כולל זיהוי דוברים ורגשות, והוזלות של עד 95%

צוות Qwen של עליבאבא השיק את Qwen-Audio-3.1, סדרה של חמישה מודלים לזיהוי דיבור, להקראת טקסט ולשיחה בזמן אמת. גרסת ASR-Next מזהה כמה דוברים, רגשות וצלילי רקע. במקביל החברה מורידה את המחירים: עד 95% פחות על זיהוי דיבור, כ-85% פחות על המודל בזמן אמת וכ-70% פחות על הקראת טקסט.

מודלים וכלים

Meta משיקה מודל תמלול בזמן אמת בעלות נמוכה — expected לשמש בסיס לעוזרים דיגיטליים "מאזינים תמיד"

Meta הציגה את Muse Voice Transcribe, מודל שמתמלל דיבור בזמן אמת, מזהה גבולות משפטים ומבחין בין יותר מ-20 דוברים — הכול במודל אחד. לפי בדיקה עצמאית של Artificial Analysis המודל מדויק יותר מהמתחרים המובילים, ובמחיר של 0.18 דולר לשעה הוא גם זול משמעותית מהם.

מודלים וכלים

Google עם שני שדרוגי AI באותו שבוע: תמלול מדויק יותר ב-Gemini 3.5 ועריכת וידאו חכמה יותר ב-Omni 1.1

גוגל פרסמה בתוך כשבוע שני עדכונים נפרדים למשפחת Gemini: מודל תמלול חדש בשם Gemini 3.5 Transcribe עם שיעור שגיאות של 2.6% ביותר מ-85 שפות, ועדכון למודל יצירת ועריכת הווידאו Gemini Omni 1.1 Flash הכולל שליטה מדויקת יותר בהרחבת סצנות ובעקביות דמויות.

עסקים ותעשייה

Plaud משיקה אוזניות AI שמתמללות ומסכמות שיחות

חברת Plaud, המוכרת בעיקר בזכות מכשיר ההקלטה שלה בצורת פין, השיקה אוזניות AI חדשות בשם Plaud One שמתעדות, מתמללות ומסכמות שיחות. המכשיר, שעולה 249.99 דולר, זמין כעת לרכישה מוקדמת ומיועד לצאת לשיווק בסוף ספטמבר.