Liquid AI משחררת את d1: מודלים פתוחים שמקבלים החלטות במכה אחת, ישירות על המכשיר
Liquid AI שחררה שני מודלים פתוחים במשפחת d1: מודל d1-3B, שמקבל טקסט ותמונות, ומודל ניסיוני בשם d1-omni-600M, שמקבל גם אודיו. המודלים לא מייצרים טקסט, אלא מחזירים החלטה מובנית במעבר אחד. לפי החברה, d1-3B עושה זאת בתוך עשרות אלפיות שנייה, גם על מחשבים קטנים בקצה הרשת. עוד לפי החברה, d1-3B הוא מודל ההחלטות הטוב ביותר מתחת ל-10 מיליארד פרמטרים במדד Decision Index.
חברת Liquid AI הודיעה היום (7 באוקטובר) על שני מודלים פתוחים חדשים במשפחת d1: מודל d1-3B ומודל d1-omni-600M, שהחברה מגדירה כניסיוני. החברה מכנה אותם "מודלים של החלטות" (decision models). הם לא כותבים תשובות מילה אחר מילה כמו צ'טבוט, אלא מחזירים החלטה מובנית במעבר יחיד דרך הרשת (single forward pass). המודלים מיועדים לעבודה בקצה הרשת (edge), כלומר על המכשיר עצמו ולא בשרת מרוחק.
מה זה "מודל החלטות"?
מודל שפה רגיל (LLM) מייצר טקסט בהדרגה, token אחרי token. המודלים של d1 עובדים אחרת: המפתח שולח להם קלט ("מצב") ורשימת שאלות מוגדרות מראש, ומקבל בחזרה תשובות מובנות. בדוגמה שהחברה פרסמה המודל מקבל הודעה של לקוח שחויב פעמיים, ועונה במעבר אחד על שלוש שאלות: האם הלקוח מבקש החזר, לאיזה צוות להעביר את הפנייה (חיובים, תמיכה טכנית או הונאות), ועד כמה הפנייה דחופה.
ההבדל בין שני המודלים מתחיל בבסיס שעליו אומנו:
- d1-3B מבוסס על LFM2.5-VL-3B, מודל הראייה והשפה העדכני של החברה (מסוג decoder-only). הוא מקבל טקסט ותמונות.
- d1-omni-600M מבוסס על LFM2.5-Encoder-350M, מקודד דו-כיווני (bidirectional encoder), שהחברה הוסיפה לו מקודדים לתמונה ולאודיו. הוא מקבל טקסט עם תמונה, או טקסט עם אודיו. לפי החברה זו גרסת מחקר מוקדמת, והפיתוח שלה עדיין נמשך.
המספרים
במדד Decision Index 0.2.1 קיבל d1-3B ציון של 48.57. לפי החברה הוא עוקף בכך כל מודל בגודל 4B ו-9B, וגם את Decider 35B-A3B, שקיבל 47.11. בשבעה מבחנים ציבוריים (הבנת הנקרא, זיהוי תוכן רעיל, סיווג כוונות, שאלות רפואיות והבנה בין שפות) הגיע d1-3B לממוצע של 82.9, לעומת 81.1 של Decider 4B. המודל הקטן, d1-omni-600M, קיבל 78.4 ועקף את Decider 2B (שקיבל 77.1), אף שיש לו רק כרבע ממספר הפרמטרים.
החברה לא פרסמה תוצאות במבחני ראייה ושמע. לדבריה, הגרסה העדכנית של המדד כוללת רק חלק פרטי למבחני ראייה, ואין עדיין שיטה מקובלת למדידת החלטות על בסיס אודיו.
גם המהירות נמדדה, בין היתר בשיתוף עם אנבידיה על החומרה שלה. מודל d1-3B עונה על שאלה בודדת ב-16 אלפיות שנייה על Jetson AGX Thor, ב-26 אלפיות שנייה על Jetson AGX Orin וב-50 אלפיות שנייה על Jetson Orin Nano, הלוח הקטן שבסדרה. על Apple M5 Pro נמדדו 30 אלפיות שנייה. על כרטיס גרפי מלא (GPU) זמן התשובה יורד ל-8 אלפיות שנייה ב-RTX 4090 ול-9 אלפיות שנייה ב-AMD MI325X. במכשירי הקצה מספר השאלות כמעט לא משפיע: שלוש שאלות לוקחות בערך פי 1.3 מהזמן של שאלה אחת. עבור d1-omni-600M לא פורסמו נתוני מהירות, כי הוא עדיין גרסת מחקר.
כדי להריץ את המודלים צריך את ספריית transformers בגרסה 5.14 ומעלה, ולטעון אותם עם ההגדרה trust_remote_code=True, כי הם מגיעים עם קוד משלהם.
למה זה חשוב
הרבה מערכות לא צריכות טקסט חופשי. הן צריכות תשובה קצרה וקבועה: כן או לא, קטגוריה, או ציון דחיפות. זה נכון לניתוב פניות שירות, לסינון תוכן ולמערכות שמגיבות למה שהמצלמה רואה. ככל הנראה, מודל שמחזיר החלטה כזו בעשרות אלפיות שנייה על לוח מחשב קטן יכול להחליף בחלק מהמקרים קריאה ל-API של מודל סגור בענן. כך הנתונים נשארים על המכשיר, והמערכת לא תלויה בחיבור לרשת.
כדאי לסייג: את כל התוצאות פרסמה החברה עצמה, וההשוואה היא למודלים שהיא בחרה. היכולות החזותיות והקוליות עדיין לא נמדדו בפומבי. ההערכה האמיתית תגיע כנראה מהמפתחים שינסו את המודלים בעצמם.