יום ראשון, 4 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

Bilibili משחררת את Index-Translate: משפחת מודלי תרגום פתוחים ל-150 שפות, מבוססת Qwen

פלטפורמת הווידאו הסינית Bilibili שחררה את Index-Translate, משפחת מודלי תרגום שנבנתה על Qwen3.5. מודלי הטקסט מכסים 150 שפות. המשפחה כוללת גם מודלים לתרגום דיבור, לתרגום באורך הברות מוגדר ולתרגום מסמכים ארוכים. המשקלות זמינים להורדה, ולצדם API ציבורי בחינם.

חברת Bilibili, מפעילת אחת מפלטפורמות הווידאו הגדולות בסין, שחררה את Index-Translate: משפחה של מודלי תרגום רב-לשוניים שנבנו על בסיס Qwen3.5, סדרת המודלים של עליבאבא. לפי מאגר הפרויקט ב-GitHub, מודלי הטקסט מכסים 150 שפות. הם יודעים גם למלא הוראות תרגום, למשל לשמור על מינוח מסוים, על עיצוב הטקסט או על חלקים מהתוכן שאסור לשנות.

מה יש בחבילה

המשקלות של מודלי הטקסט שוחררו ב-30 בספטמבר 2026 בשלושה גדלים: 2B,‏ 9B ו-35B-A3B. הגרסה הגדולה עדיין מוגדרת "preview" (גרסה מקדימה). הם זמינים ב-Hugging Face וב-ModelScope, לצד דוח טכני והדגמה מקוונת. השם 35B-A3B מעיד ככל הנראה על ארכיטקטורת Mixture-of-Experts: למודל 35 מיליארד פרמטרים בסך הכול, אבל בכל שלב מופעלים רק כ-3 מיליארד מהם. כך הוא חסכוני יותר בהרצה.

סביב מודל הטקסט בנתה החברה כמה מודלים ייעודיים:

  • Index-Echo מתרגם דיבור לכתוביות או לדיבור מתורגם, בהתאם לקולו של הדובר המקורי. כאן התמיכה מצומצמת בהרבה: כתוביות מסינית לאנגלית, יפנית וספרדית, ודיבור לדיבור מסינית לאנגלית, ספרדית ויפנית, ומאנגלית לסינית, ספרדית ויפנית.
  • Index-Homura מכוונן את התרגום למספר הברות שנקבע מראש. זה שימושי ככל הנראה לדיבוב, שבו הטקסט המתורגם צריך להתאים לאורך המשפט המקורי.
  • Index-NativeLong מתרגם מסמכים שלמים תוך שמירה על ההקשר בין הקטעים. התבניות הקבועות שלו תומכות כרגע בסינית-אנגלית ובסינית-יפנית, לשני הכיוונים.

API בחינם וגרסאות להרצה מקומית

ב-3 באוקטובר פרסמה החברה גרסאות מכווצות (quantized) רשמיות לכל המודלים: GGUF להרצה מקומית ב-llama.cpp, ו-FP8 ו-NVFP4 להגשה עם vLLM. הגרסה האחרונה מותאמת למעבדי Blackwell של אנבידיה. כיווץ כזה מקטין את דרישות הזיכרון, ולכן אפשר להריץ את המודלים על חומרה צנועה יותר.

ב-4 באוקטובר נפתחו נקודות קצה ציבוריות של API בחינם למודל 35B-A3B. הן תואמות לחלוטין לממשק של OpenAI, כך שמפתחים יכולים לנסות את המודל בלי GPU משלהם. באותו יום שוחררו גם ארבעה מבחני ביצועים (benchmarks) שפיתחה החברה, עם הנתונים ב-Hugging Face וסקריפטי ההערכה ב-GitHub.

ההשוואה שהחברה מציגה כוללת שבעה צירים: מבחני WMT ו-FLORES המקובלים, מילוי הוראות, שפות דלות משאבים, כתוביות, ממים, וספרים וספרות. החברה עצמה מסייגת שהסקאלה המנורמלת בגרף אינה אחוז דיוק. ראוי לזכור גם שמדובר בהשוואה שפרסם המפתח עצמו, ולא בבדיקה עצמאית.

ומה עם עברית?

החומרים שבדקנו מציינים כיסוי של 150 שפות אבל לא מפרטים את הרשימה. היקף כזה כולל בדרך כלל עברית, אבל מי שמתכוון להשתמש במודל לעברית צריך לבדוק את הרשימה הרשמית ואת איכות התרגום בפועל. מודלי הדיבור והמסמכים הארוכים, בכל מקרה, לא תומכים כרגע בעברית.

למה זה חשוב

Bilibili היא לא מעבדת AI קלאסית אלא פלטפורמת תוכן, והבחירה בכתוביות, בדיבוב ובממים משקפת ככל הנראה את הצרכים של אתר וידאו קהילתי. המשמעות לשוק הרחב היא עוד שחקן סיני שמשחרר משקלות פתוחים ומבסס את עבודתו על Qwen. לפי רשימת המשימות במאגר, החברה מתכננת לשחרר את הגרסה הרשמית של מודל 35B-A3B, להרחיב את תמיכת השפות של Index-Echo ולשחרר מודלים גדולים יותר.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות