אנבידיה משחררת את Nemotron 3 Diarization: מודל פתוח שמזהה עד 8 דוברים, גם בזמן אמת
אנבידיה פרסמה ב-Hugging Face את Nemotron 3 Diarization, מודל open-weight קטן יחסית, בגודל 100 מיליון פרמטרים, שקובע מי דיבר מתי בשיחה. המודל עוקב אחרי עד שמונה דוברים, גם כשהם מדברים בו-זמנית. אותו checkpoint עובד גם על הקלטות וגם על שידור חי.
אנבידיה שחררה את Nemotron 3 Diarization, מודל open-weight (מודל שהמשקלים שלו פתוחים להורדה) ל-speaker diarization. המודל זמין ב-Hugging Face, ויש לו תפקיד אחד: לקבוע מי דיבר מתי בשיחה. הוא עוקב אחרי עד שמונה דוברים, גם כשקולותיהם חופפים. אותו checkpoint, כלומר אותה גרסה שמורה של המודל, מטפל גם בהקלטות קיימות וגם בשידור חי.
מה זה diarization, ולמה צריך אותו
כשמכניסים הקלטה של ישיבה, ראיון או שיחת שירות למערכת תמלול, מתקבל בדרך כלל רצף טקסט אחד וארוך. תמלול עונה על השאלה "מה נאמר". Diarization עונה על שאלה אחרת: "מי אמר את זה, ומתי". הוא מחלק את ההקלטה לקטעים ומצמיד לכל קטע תווית של דובר, למשל "דובר 1" ו"דובר 2". כשמשלבים אותו עם תמלול, מקבלים פרוטוקול שבו כל משפט משויך למי שאמר אותו.
המשימה קשה במיוחד כשאנשים מדברים זה על גב זה, וזה קורה כל הזמן בשיחות אמיתיות. לפי הדיווח ב-MarkTechPost, המודל של אנבידיה תוכנן לזהות דוברים גם בקטעים חופפים כאלה.
קטן, ועובד בשני המצבים
המודל כולל 100 מיליון פרמטרים. זה גודל צנוע בהשוואה למודלי שפה מודרניים, שנמדדים בדרך כלל במיליארדים. ככל הנראה המשמעות היא שאפשר להריץ אותו על חומרה צנועה יחסית ולהטמיע אותו במערכות שעובדות בזמן אמת, שבהן כל אלפית שנייה של השהיה חשובה.
גם העובדה שאותו checkpoint משמש לעיבוד offline של הקלטות וגם לעיבוד streaming בזמן אמת היא פרט מעשי. מפתחים לא צריכים לתחזק שני מודלים נפרדים לשני תרחישים. במקרים רבים זה מפשט את הפריסה ואת התחזוקה.
בעמוד המודל ב-Hugging Face מופיעים קישורים לכמה מאמרים מחקריים, והאחרון בהם פורסם במאי השנה. אנבידיה פרסמה שם גם פוסט בשם "Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization", שמכוון לבניית אפליקציות קוליות מרובות משתתפים בזמן אמת.
המשמעות
Diarization הוא רכיב בסיסי בהרבה מוצרים: סיכומי פגישות, ניתוח שיחות במוקדי שירות, תמלול פודקאסטים וראיונות, ועוזרים קוליים שצריכים להבין שיש יותר מאדם אחד בחדר. חלק גדול מהפתרונות בתחום זמין כשירות ענן בתשלום. מודל פתוח וקל משקל מאפשר לארגונים ולמפתחים להריץ את הרכיב הזה על התשתית שלהם. זה עשוי להיות חשוב במיוחד כשמדובר בהקלטות רגישות שלא רוצים לשלוח לשרת חיצוני.
בקהילת המפתחים שמריצים מודלים מקומית, המודל כבר מעורר עניין, ומשתמש שהתנסה בו תיאר אותו כמענה לפער בכלים קוליים מקומיים. זו התרשמות ראשונית ולא בדיקה מסודרת.
אפשר להעריך שהמהלך משתלב באסטרטגיה הרחבה של אנבידיה, שמשחררת מודלים פתוחים במשפחת Nemotron כדי לעודד פיתוח על גבי החומרה והתוכנה שלה. עדיין לא ברור איך המודל מתמודד עם שפות שונות, ובהן עברית, ועם תנאי הקלטה רועשים. התשובה תגיע ככל הנראה מבדיקות עצמאיות בשבועות הקרובים.