יום שני, 24 באוגוסט 2026 מתעדכן אוטומטית כל שעה

כל מה שחם בעולם הבינה המלאכותית · בעברית

📚 בית הספר ל-AI ✈️ הצטרפו לערוץ הטלגרם

תומסון רויטרס משקיעה 40 מיליון דולר בבניית בינה מלאכותית משפטית משלה, במקום לשכור מ-OpenAI או Anthropic

חברת המידע תומסון רויטרס חשפה את "Thomson", מודל שפה משפטי שבנתה בעצמה על בסיס Qwen הסינית של עלי-באבא, בהשקעה של כ-40 מיליון דולר על פני יותר משנתיים. לפי נתוני החברה עצמה, המודל עוקף מתחרים כמו GPT-5.4 רק כשיש לו גישה לתוכן הקנייני של החברה — בגישה חופשית לאינטרנט בלבד הוא עדיין מפגר אחריהם.

חברת המידע העסקי תומסון רויטרס, הבעלים של Westlaw, Practical Law, Checkpoint וסוכנות הידיעות רויטרס, הציגה מודל שפה משפטי משלה בשם "Thomson". בניגוד למגמה הרווחת של חברות שמתאימות מודלים קיימים של OpenAI או Anthropic לצרכיהן, תומסון רויטרס בחרה לבנות מודל עצמאי — צעד שלפי החברה נועד לחסוך בעלויות ולהימנע מתלות בספק חיצוני, כך על פי הדיווח באתר The Decoder.

איך נבנה המודל

הבסיס למודל הוא Qwen3.5-397B, מודל בקוד פתוח שפיתחה חברת עלי-באבא הסינית. לפי תומסון רויטרס, הפרויקט עלה כ-40 מיליון דולר בגין כוח אדם ותשתיות מחשוב על פני יותר משנתיים — נתון רחב בהרבה מהמספר של 450 אלף דולר שהוצג בעבר, שמתייחס רק לריצת האימון הסופית של הגרסה הנוכחית. מעבר לכך, החברה משקיעה בפרויקט עשרות שנים של תוכן שנצבר ב-Westlaw, Practical Law, Checkpoint ורויטרס, לצד שעות עבודה של מאות מומחי תוכן בתחום המשפטים.

תהליך הפיתוח כלל כמה שלבים: תחילה אימון מחדש של המודל הסיני, בשיתוף עם אימפריאל קולג' בלונדון, להתאמתו לסטנדרטים של בטיחות, אתיקה וניטרליות פוליטית — גרסת ביניים שכונתה "Snowdon", על שם ההר בוויילס. לאחר מכן בוצע אימון מוקדם על תוכן החברה, שלב אימון נוסף בליווי מומחי תחום, ולבסוף למידת חיזוק בסביבות הכלים הפנימיים של החברה. לדברי החברה, פחות מ-10 אחוזים מהתוכן הזמין שולבו בתהליך האימון עד כה. מנהל הטכנולוגיה ג'ואל הרון ציין כי הצוות "שינה את נקודת הפתיחה בקוד הפתוח כמעט חצי תריסר פעמים", ולדברי ראש מחלקת המחקר ג'ונתן שוורץ, התובנה המרכזית של הפרויקט היא לא המודל הבודד אלא "מפעל המודלים" שנבנה סביבו.

מה אומרים המבחנים

נתוני הביצועים שפרסמה החברה עצמה מציגים תמונה מעורבת. במבחן Stanford LegalBench, Thomson (0.823) פיגר אחרי Gemini 3.1 Pro ו-GPT-5.5. במבחן Harvey Legal Agent הוא נותר מעט מתחת ל-Opus 4.8, ובמקביל הוביל במבחני ציות להוראות ובמבחן PrBench Legal המורכב. בתחומי היגיון וכתיבת קוד חלה ירידה חדה יותר ביכולותיו. יש לציין שההשוואה אינה שוויונית לחלוטין: Thomson נבחן עם טכניקת "הרחבת זמן היסק" (test-time scaling), בעוד ש-GPT-5.5 נבדק ללא מצב היגיון.

הפער המעניין ביותר עלה במבחן פנימי של החברה בשם Deep Research: כשהמודלים נעזרים רק בגישה חופשית לאינטרנט, Thomson קיבל ציון דיוק עובדתי של 0.53, לעומת 0.65 של GPT-5.4. רק כשניתנה למודל גישה לתוכן הקנייני של תומסון רויטרס, הוא עקף במעט את GPT-5.4 — 0.83 מול 0.82. ראש צוות ההערכה אנדרו בין הודה כי בגישה לאינטרנט בלבד Thomson "נמצא בטווח של המודלים האחרים, אך בהחלט לא המוביל עדיין", והוסיף כי חלק ניכר מהשיפור מגיע מהיכולת להתאמן ולתרגל על הכלים הפנימיים של החברה — יכולת שלא זמינה לספקים חיצוניים. יצוין כי גם GPT-5.4 השתפר בצורה דומה כשקיבל גישה לאותו תוכן, כך שחלק ניכר מהיתרון נובע מהגישה לנתונים ולא רק מהאימון הייעודי. החברה לא בדקה מודלים חדשים יותר שיצאו לאחרונה.

למה לבנות מודל במקום לשכור אחד

לדברי תומסון רויטרס, ישנן שלוש סיבות מרכזיות להעדפת מודל עצמאי על פני התאמה של מודל קיים מ-OpenAI או Anthropic. הראשונה כלכלית: לפי שוורץ, שיטות התאמה סטנדרטיות (fine-tuning) "נוטות לפגוע ביכולת הכללית" של המודל, ובנוסף משאירות את החברה תלויה בספק החיצוני הן לעלויות ההרצה והן למפת הדרכים העתידית של המוצר.

Thomson צפוי לשמש בשלב הראשון לסקירת מסמכים משפטיים, ובמקביל תפרסם תומסון רויטרס גרסה מוקטנת שלו ברישיון לשימוש שאינו מסחרי.

פרסומת

→ לכל הכתבות