ארגון המחקר LAION פרסם את Big Video Dataset (BVD) - מאגר של 80 מיליון סרטונים ו-10 מיליון שעות צילום שנאספו מ-CommonCrawl, לצד 55 מיליון קליפים מתויגים ו-300 מיליון תמונות. לפי הארגון, מודלים שאומנו על המאגר עולים בביצועיהם על מודלים מקבילים שאומנו על מאגר מתחרה.
ארגון המחקר הגרמני LAION פרסם את Big Video Dataset (BVD), אחד ממאגרי הווידאו הפתוחים הגדולים ביותר שיועדו למחקר בינה מלאכותית. המאגר כולל 80 מיליון סרטונים בהיקף כולל של כ-10 מיליון שעות צילום, שנאספו מתוך 1.3 מיליארד כתובות URL של סרטונים שאותרו במאגר הסריקה CommonCrawl, כך דיווח The Decoder.
מה יש במאגר
מתוך הסרטונים שהורדו, חילץ הצוות 55 מיליון קליפים, שלכל אחד מהם צורפו תיאורים אוטומטיים של הווידאו והשמע, וכן 300 מיליון תמונות סטילס נוספות. רוב הסרטונים במאגר מקורם ביוטיוב, ורובם דוברי אנגלית.
לפי המאמר המדעי שפרסם הצוות, מודלים שאומנו על BVD השיגו ביצועים טובים יותר בעד 2.1 נקודות אחוז במבחני "וידאו לטקסט" מקובלים, בהשוואה למודלים דומים שאומנו על מאגר המתחרה InternVid. תהליך האימון על המאגר מקשר בין וידאו, שמע וטקסט - כלומר המודל לומד לזהות אילו תכנים חזותיים תואמים לאילו תיאורים או צלילים.
היבט משפטי
LAION מפרסם את המאגר לצורכי מחקר בלבד. מבחינה משפטית, הארגון יכול ככל הנראה להיסמך על פסיקה של בית המשפט האזורי בהמבורג מ-2024, שקבעה כי מותר לו לאסוף תוכן המוגן בזכויות יוצרים למטרות מחקר לא-מסחריות. הארגון מבקש ממשתמשי המאגר לכבד את זכויות היוצרים המקוריים של התכנים. גם המאגר וגם קוד האימון הנלווה אליו זמינים להורדה חינם.
למה זה חשוב
פרסום מאגר בהיקף כזה תחת גישה פתוחה עשוי לחזק את יכולתם של חוקרים וגופים ללא תקציבי איסוף נתונים ענקיים לפתח ולאמן מודלים לעיבוד וידאו - תחום שעד כה נשען במידה רבה על מאגרים סגורים שבבעלות חברות טכנולוגיה גדולות. המאגר, יחד עם קוד האימון הנלווה, מאפשר לחוקרים חיצוניים לשחזר ולשפר תוצאות מבלי להידרש לתשתית הסריקה, ההורדה והעיבוד היקרה הכרוכה בבניית מאגר כזה מאפס. ככל שהמגמה הזו תימשך, ייתכן שהפער בין מעבדות מחקר גדולות לקהילת הקוד הפתוח בפיתוח מודלים המבינים תוכן וידאו - הבנת שילוב של תמונה, קול וטקסט יחד - יצטמצם בהדרגה.