Hugging Face, בשיתוף עם חברת Voice Arena, הרחיבה את ה-Open ASR Leaderboard - לוח המדידה המוביל לזיהוי דיבור אוטומטי (ASR) - והוסיפה לו שתי שפות מהודו: הינדי (הראשונה Indic language בלוח) ואנגלית הודית. המהלך נועד לחשוף פערי דיוק בין קבוצות דוברים שהמדד המקובל, שיעור שגיאות מילים (WER), מסתיר.
פלטפורמת ה-Open ASR Leaderboard של Hugging Face, שמדרגת מודלים לזיהוי דיבור אוטומטי (ASR - Automatic Speech Recognition) לפי דיוק התמלול שלהם, קיבלה השבוע תוספת: שני מערכי הערכה חדשים בשם Monsoon, עבור הינדי (hi-IN) ואנגלית הודית (en-IN). התוספת פותחה בשיתוף עם חברת Voice Arena. הינדי, כפי שצוין בפוסט הרשמי של Hugging Face, היא הראשונה Indic language שנכנסת ללוח המדידה, שעד כה כלל רק שפות אירופיות. הינדי, כך צוין, מדוברת בפי יותר מחצי מיליארד בני אדם.
לוחות מדידה כמו זה של Hugging Face משפיעים ישירות על כיוון הפיתוח בתעשייה: מודל שמשיג ציון טוב בלוח נוטה לזכות באימוץ ובהמשך פיתוח, בעוד יכולות שאינן נמדדות בו נשארות מוזנחות. הבעיה, לפי הפוסט, היא שהמדד המרכזי המקובל - WER, שיעור השגיאות במילים - הוא מספר אחד ממוצע שמסתיר פערים בין קבוצות דוברים שונות. הכותבים מפנים למחקר Racial disparities in automated speech recognition שמצא כי מערכות מסחריות שגו כמעט פי שניים יותר אצל דוברים שחורים בהשוואה לדוברים לבנים, ולמחקר נוסף שמצא פערים גם לפי מגדר, גיל ומבטא. סטים לבדיקה שמתעדים רק את מה שנאמר, ולא מי אמר זאת, אינם יכולים לחשוף פערים כאלה.
כדי להתמודד עם כך, מערכי Monsoon תוכננו להשתנות לאורך תשעה צירים: גאוגרפיה, גיל, מגדר, אוצר מילים, סוגי מכשירים, סביבה אקוסטית, סוג הדיבור, קצב הדיבור, וקיומם של תמלולים תקינים מרובים לאותה הקלטה. בפועל, האיסוף נעשה באמצעות גיוס תורמים ממאות מחוזות בהודו, שהקליטו את עצמם במכשירים ובחיבורים האישיים שלהם, בפנים ובחוץ, תוך מענה על שאלות שדוחפות לדיבור ספונטני - דעות, ויכוח, סיפור אישי - ולא לקריאה מוכנה מראש.
מבחינת היקף: לכל שפה יש פיצול ציבורי (זמין לבדיקה עצמית) ופיצול פרטי שנשמר חסוי כדי לצמצם אופטימיזציה ממוקדת-מבחן. בסך הכול נאספו 4,888 דוברים שאינם חוזרים בין הפיצולים, עם 12 מאפייני דובר לכל אחד. מערך האנגלית ההודית הציבורי כולל 5.62 שעות הקלטה מ-1,444 דוברים ב-428 מחוזות ו-24 מדינות/יחידות טריטוריאליות, שהוקלטו על גבי 556 מכשירים שונים; המערך הפרטי המקביל כולל 5.58 שעות מ-1,405 דוברים. נתוני מערך ההינדי המלאים לא פורסמו במלואם בפוסט המקורי.
המשמעות המעשית: ככל הנראה, מפתחי מודלים שרוצים להראות ביצועים טובים גם על אוכלוסיות שלא נכללו עד כה בבדיקות התקן, ייאלצו להתמודד עם מגוון המבטאים, המכשירים והרעשים שמאפיינים שימוש אמיתי בהודו - ולא רק עם הקלטות סטודיו נקיות. זהו צעד נקודתי בשפה אחת, אך הוא עשוי לשמש תבנית להרחבת המדידה לשפות נוספות מאזורים שתעשיית ה-AI נוטה להזניח.