יום שבת, 10 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

זיהוי דיבור

חומרה ורובוטיקה

Oído: זיהוי דיבור שרץ על שבב של 5 דולר ומשיג תוצאות טובות מ-Whisper tiny

צוות Lokutor פרסם בקוד פתוח את Oído, מנוע תמלול דיבור באנגלית שרץ כולו על מיקרו-בקר ESP32-S3, בלי ענן ובלי מאיץ נוירוני. במבחני LibriSpeech הוא מציג שיעור שגיאות נמוך מזה של Whisper tiny.en, שנבדק על מחשב נייד. לפי המפתחים, המדידות נעשו באמולטור, ובדיקות על לוחות פיזיים יפורסמו בימים הקרובים.

סין

עליבאבא משיקה את Qwen Audio 3.1: חמישה מודלים קוליים, כולל זיהוי דוברים ורגשות, והוזלות של עד 95%

צוות Qwen של עליבאבא השיק את Qwen-Audio-3.1, סדרה של חמישה מודלים לזיהוי דיבור, להקראת טקסט ולשיחה בזמן אמת. גרסת ASR-Next מזהה כמה דוברים, רגשות וצלילי רקע. במקביל החברה מורידה את המחירים: עד 95% פחות על זיהוי דיבור, כ-85% פחות על המודל בזמן אמת וכ-70% פחות על הקראת טקסט.

מודלים וכלים

Hugging Face מוסיפה את השפה הראשונה מהדרום הגלובלי ללוח המדידה לזיהוי דיבור

Hugging Face, בשיתוף עם חברת Voice Arena, הרחיבה את ה-Open ASR Leaderboard - לוח המדידה המוביל לזיהוי דיבור אוטומטי (ASR) - והוסיפה לו שתי שפות מהודו: הינדי (הראשונה Indic language בלוח) ואנגלית הודית. המהלך נועד לחשוף פערי דיוק בין קבוצות דוברים שהמדד המקובל, שיעור שגיאות מילים (WER), מסתיר.

מודלים וכלים

IBM משיקה Granite Speech 5.0 Turbo: מודל שמע חדש לתמלול מהיר ומדויק

IBM הציגה את Granite Speech 5.0 Turbo, גרסה חדשה במשפחת מודלי הקול שלה המבוססת על ארכיטקטורת CTC, שמיועדת לתמלול דיבור מהיר ומדויק. המודל עורר עניין בקהילת הבינה המלאכותית הפתוחה, וריפורט עליו פורסם בפורום LocalLLaMA ב-Reddit.