Falcon-Emirati: מודל שפה שמנסה להבין לא רק את המילים של הדיאלקט האמירתי, אלא גם את התרבות שמאחוריהן
צוות Falcon מאבו דאבי פרסם את Falcon-Emirati-7B, מודל שפה שהותאם במיוחד לערבית האמירתית המדוברת ולהקשר התרבותי שלה. המודל נבנה על בסיס משפחת Falcon-H1-Arabic, והוא ממחיש את המגמה של מדינות ואזורים לפתח AI שמותאם לשפתם ולתרבותם.
צוות Falcon, שמאחוריו עומדים חוקרים מאבו דאבי, הציג את Falcon-Emirati-7B: מודל שפה (LLM) שהותאם במיוחד לערבית האמירתית, הדיאלקט המדובר באיחוד האמירויות. לפי הפוסט שפרסם הצוות ב-Hugging Face, המטרה היא מודל שמבין ומייצר טקסט בדיאלקט כמו דובר ילידי: באוצר המילים, בטון ובהקשר התרבותי.
הפער בין ערבית ספרותית לשפת היומיום
מפתחי המודל מתארים את הערבית כ"משפחה של שפות שחיות תחת שם אחד". הערבית הספרותית המודרנית (MSA) היא השפה של החדשות ושל ספרי הלימוד, אבל אנשים כמעט לא מדברים בה זה עם זה. באמירויות, שיחות היומיום, ההומור, המשא ומתן וסיפור הסיפורים מתנהלים בערבית אמירתית. זהו דיאלקט מפרץ עם אוצר מילים ומקצב משלו.
לדברי הצוות, שירה אמירתית, ובמיוחד שירת הנַבַּטִי, וכן פתגמים ואנקדוטות קצרות, נושאות משמעות שלא שורדת קריאה מילולית. מכאן הטענה המרכזית בפוסט: מודל שמכיר רק MSA יכול לתרגם כל מילה במשפט אמירתי ועדיין להחמיץ את מה שנאמר בו בפועל.
על אילו יסודות נבנה המודל
Falcon-Emirati-7B לא נבנה מאפס. הוא מבוסס על Falcon-H1-Arabic, משפחת מודלים לערבית שלפי הצוות קבעה מוקדם יותר השנה רף חדש במבחני ביצועים לשפה. המשפחה נשענת על ארכיטקטורה היברידית: בכל שכבה פועלים במקביל מודלי State Space מסוג Mamba ומנגנון ה-attention של Transformer. השילוב נועד להעניק יעילות בעיבוד רצפים ארוכים לצד דיוק בקשרים בין חלקים מרוחקים בטקסט. לפי המפתחים, זה חשוב במיוחד בשפה עשירה מבחינה מורפולוגית כמו ערבית.
המשפחה זמינה בשלושה גדלים: 3B, 7B ו-34B פרמטרים, עם חלונות הקשר של עד 128K ו-256K טוקנים. היא אומנה על ערבית ספרותית ועל דיאלקטים מהמפרץ, מהלבנט, ממצרים ומהמגרב, לצד אנגלית ונתונים רב-לשוניים. הצוות בחר בגרסת ה-7B ונימק זאת בכך שהיא מספיק גדולה כדי לקלוט את הניואנסים שהתאמה לדיאלקט דורשת, ומספיק קטנה כדי שהאימון וההרצה יישארו מעשיים. לדבריהם, מודל ה-34B כנראה היה משפר מעט את האיכות, אבל בעלות שאינה מוצדקת למודל צ'אט ייעודי. מודל ה-3B, לעומת זאת, לא היה משאיר מספיק מרווח לעומק התרבותי והלשוני שרצו להשיג.
למה זה קשה
הצוות מונה שלושה קשיים מרכזיים. הראשון: אמירתית היא בעיקר שפה מדוברת, ולכן היא מופיעה ברשת בכתב הרבה פחות מ-MSA ואפילו פחות מדיאלקטים אחרים של המפרץ והלבנט. השני: המשמעות לרוב אינה מילולית, וניבים ופתגמים נשענים על הקשר תרבותי משותף. השלישי: אין "מתכון" מתועד שקובע כמה נתוני דיאלקט מספיקים, איך לשלב אותם עם ערבית כללית, ואיזה שלב אימון הוא החשוב ביותר: המשך אימון מקדים, SFT (כוונון מפוקח) או אופטימיזציה לפי העדפות. לדברי המפתחים, חלק גדול מהעבודה היה ניסוי וטעייה, בשילוב שיפוט אנושי ותוצאות במבחני ביצועים.
כדי לבנות את מערך הנתונים, הצוות אסף וסינן תוכן מאתרים ומפורומים אמירתיים שנכתבו במקור בדיאלקט, ולא תורגמו מערבית ספרותית. לצד זה הוא הוסיף חומרים בערבית ספרותית שעוסקים בתרבות, במורשת ובזהות האמירתית.
המשמעות: ריבונות AI ברמת הדיאלקט
הפרויקט משתלב ככל הנראה במגמה רחבה יותר, שבה מדינות מבקשות לפתח מודלי AI משלהן במקום להסתמך רק על מודלים כלליים מארה"ב ומסין. ל-Falcon-Emirati יש זווית מעניינת במיוחד: הוא מתמקד בדיאלקט מקומי של מדינה אחת, ולא רק בשפה הערבית בכללותה. המשמעות היא שההגדרה של "AI מקומי" מתחדדת. אפשר להעריך שהשאלה כבר אינה רק אם מודל יודע ערבית, אלא אם הוא מבין את הפתגם, את השיר ואת ההומור של קהילה מסוימת.
לקוראים בישראל המקרה מוכר: גם עברית היא שפה שזוכה לייצוג מוגבל יחסית בנתוני האימון של המודלים הגדולים. הניסיון האמירתי מראה ככל הנראה שגם מודל בסיס חזק בשפה מסוימת אינו מספיק, ושהבנה תרבותית אמיתית דורשת השקעה ייעודית בנתונים ובאימון.