שמה של גרסה חדשה בשם DeepSeek-V4-Flash-Vision-Exp עלה לכותרות בקהילת המפתחים לאחר שפורסם בפורום r/LocalLLaMA ב-Reddit. הפרסום, שכלל צילום מסך, מרמז על גרסה ניסיונית של משפחת V4-Flash עם תמיכה בעיבוד תמונות, אך פרטים טכניים מלאים טרם פורסמו רשמית על ידי החברה.
שמה של גרסה חדשה מבית חברת הבינה המלאכותית הסינית DeepSeek עלה לכותרות בקהילת מפתחי מודלי השפה הפתוחים, לאחר שפרטים אודותיה פורסמו בפורום r/LocalLLaMA שברשת Reddit — אחת הזירות המרכזיות שבהן מפתחים ואנשי קהילת הקוד הפתוח משתפים ודנים בעדכוני מודלים. את הפרסום העלה משתמש בשם Xhehab_, וצירף אליו צילום מסך המתייחס למודל בשם "DeepSeek-V4-Flash-Vision-Exp".
השם עצמו מרמז על שני מאפיינים מרכזיים: הסיומת "Vision" מצביעה על יכולת עיבוד תמונות לצד טקסט, כלומר מודל מולטי-מודלי (multimodal) שמסוגל לקבל קלט חזותי ולא רק טקסטואלי. הסיומת "Exp", קיצור של Experimental, מציינת שמדובר ככל הנראה בגרסת ניסוי ולא בהכרח בגרסה סופית וזמינה לציבור הרחב. הפרסום עצמו אינו כולל מפרט טכני, נתוני ביצועים או הסבר רשמי מטעם DeepSeek, כך שבשלב זה אין אפשרות לאשר פרטים נוספים על יכולות המודל, גודלו או אופן הפצתו.
הקשר: DeepSeek ומירוץ המודלים הפתוחים
DeepSeek הפכה בשנה האחרונה לאחד השחקנים הבולטים בזירת מודלי השפה הפתוחים (open source), עם משפחת מודלים שמתחרה במודלים סגורים של חברות אמריקאיות תוך פרסום משקלי המודל (model weights) באופן פתוח יחסית. פרסומים על גרסאות חדשות של החברה, ובכללן גרסאות "Flash" המיועדות בדרך כלל למהירות תגובה גבוהה ועלות הרצה נמוכה יותר, נוטים למשוך תשומת לב נרחבת בקרב מפתחים ברשתות כמו Reddit ו-Hugging Face עוד לפני הודעה רשמית.
הוספת יכולות ראייה למודלי שפה היא מגמה רחבה יותר בענף, שבה חברות משלבות בין הבנת טקסט להבנת תמונות במודל אחד — לצרכים כמו ניתוח מסמכים סרוקים, תיאור תמונות או מענה על שאלות המתייחסות לתוכן חזותי.
למה זה חשוב
אם אכן מדובר בגרסה חדשה שתופץ בקרוב, המשמעות עבור מפתחים ומשתמשי קוד פתוח היא הרחבה נוספת של הכלים הזמינים להם ללא תלות בספקים סגורים. עם זאת, מכיוון שהמידע הקיים כרגע מבוסס על פרסום קהילתי בודד ולא על הודעה רשמית של החברה, יש להתייחס לפרטים בזהירות עד לאישור נוסף או פרסום רשמי מצד DeepSeek עצמה.