יום ראשון, 11 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מערכת ביקורת עמיתים מבוססת Claude של Sakana AI מזהה 73% מהשגיאות בטענות הליבה של מאמרים מדעיים

חברת Sakana AI הציגה את Multi-Layered Review: מערכת לביקורת עמיתים שבה שלושה סוכנים מבוססי Claude בודקים מאמרים מדעיים. לפי מאמר שפרסמה החברה ב-TMLR, המערכת זיהתה 73.43% מהשגיאות בטענות הליבה של המאמרים. המערכת הקודמת הטובה ביותר זיהתה רק 14.81%. יחד עם המערכת פרסמה החברה גם מדד בדיקה חדש שכולל 1,164 שגיאות.

חברת הבינה המלאכותית Sakana AI פרסמה מאמר בכתב העת TMLR (Transactions on Machine Learning Research). במאמר היא מציגה מערכת לביקורת עמיתים אוטומטית בשם Multi-Layered Review, או בקיצור MLR, שמזהה שגיאות בטענות המרכזיות של מאמרים מדעיים. לפי הדיווח ב-MarkTechPost, המערכת זיהתה 73.43% מהשגיאות בטענות הליבה. המערכת הקודמת הטובה ביותר זיהתה 14.81% בלבד.

איך זה עובד

MLR בנויה משלושה סוכנים (agents), כלומר רכיבי תוכנה שכל אחד מהם מבוסס על מודל שפה גדול (LLM) ומבצע חלק מהמשימה. במקרה הזה כל הסוכנים מבוססים על Claude, משפחת המודלים של אנתרופיק. השם "ביקורת רב-שכבתית" מרמז שהמאמר נבדק בכמה שלבים או מכמה זוויות, ולא בקריאה אחת. חומרי המקור אינם מפרטים איך בדיוק עובדים הסוכנים זה עם זה.

כדי למדוד את המערכת, החוקרים בנו גם מדד בדיקה (benchmark) חדש בשם Contradiction Benchmark, שכולל 1,164 שגיאות. השם מרמז שהמדד בודק אם מערכת מזהה סתירות פנימיות בתוך מאמר, למשל טענה שלא מתיישבת עם הנתונים שמוצגים בו. ככל הנראה זה סוג השגיאה שקל לפספס כשקוראים מאמר ארוך ברפרוף.

למה המספרים חשובים

הפער בין 14.81% ל-73.43% גדול: לפי הנתונים, MLR מזהה בערך פי חמישה יותר שגיאות מהמערכת הקודמת הטובה ביותר. חשוב לזכור שמדובר במדד שהחוקרים בנו בעצמם. לכן אין להסיק מכאן בהכרח שהמערכת תגיע לאותם ביצועים על מאמרים אמיתיים, שבהם השגיאות מגוונות יותר ולא תמיד מוגדרות היטב. בנוסף, חומרי המקור אינם מציינים כמה התראות שווא המערכת מייצרת. זה נתון חשוב לכל מי שישקול להשתמש בה בפועל.

ההקשר: ביקורת עמיתים בעומס

ביקורת עמיתים היא הבסיס של הפרסום המדעי. לפני שמאמר מתפרסם, חוקרים אחרים בתחום קוראים אותו ובודקים את הטענות שלו. בשנים האחרונות המערכת הזאת נמצאת בעומס גדול, בעיקר בתחום הבינה המלאכותית עצמו: מספר המאמרים שמוגשים לכנסים ולכתבי עת גדל מהר, ומספר הסוקרים המנוסים לא גדל באותו קצב. על הרקע הזה גובר העניין בכלים שיכולים לעזור לסוקרים, וגם הוויכוח סביבם. החשש המרכזי הוא שסוקרים יסתמכו על מודלים במקום לקרוא את המאמרים בעצמם.

Sakana AI, שמחקריה מתמקדים בין השאר בשימוש בבינה מלאכותית לאוטומציה של מחקר מדעי, מציגה כאן גישה צרה יותר: כפי שהיא מתוארת במקורות, המערכת מתמקדת באיתור שגיאות בטענות הליבה של המאמר, ולא בהחלטה אם לקבל אותו או לדחות אותו. ככל הנראה כלי כזה מתאים יותר לתפקיד של עוזר לסוקר האנושי ולא של תחליף לו. הוא יכול לסמן לסוקר מקומות שכדאי לבדוק לעומק.

המשמעות

הבשורה הזאת רלוונטית בעיקר לקהילה האקדמית, לעורכי כתבי עת ולמו"לים מדעיים, שמחפשים דרכים להתמודד עם מספר ההגשות הגדל. אם התוצאות יחזיקו גם מחוץ למדד הבדיקה, ייתכן שכלים כאלה ישמשו שלב סינון ראשוני לפני הקריאה האנושית. בינתיים מדובר בתוצאת מחקר עם מדדים ברורים, ולא במוצר מוכן. השאלות הפתוחות הן כמה התראות שווא המערכת מייצרת, מה עולה להריץ אותה, ואיך היא מתמודדת עם תחומי מחקר שונים.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות