יום שלישי, 6 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מחקר חדש: יכולת התכנון הניסויי של מודלי AI מוכפלת כל שלושה חודשים, והמודל המוביל כבר עוקף קבוצת מומחים

מדד חדש בשם TasteVal מודד עד כמה מודלי AI יודעים לתכנן ניסויים ולהסיק מהם מסקנות במשימות מחקר AI. לפי החוקרים, היכולת הזו הוכפלה כל שלושה חודשים בממוצע מאז דצמבר 2025. המודל המוביל, Opus 5.5, עבר את רף הבסיס האנושי, אף שהחוקרים מציינים בעצמם מגבלות משמעותיות בהשוואה.

מדד חדש שפרסמו החוקרים אולי ג'אפה ודיין שרבורן מצא שהיכולת של מודלי בינה מלאכותית מתקדמים לנהל ניסויים במחקר AI משתפרת בקצב מהיר מאוד: לפי המדד, TasteVal, היא הוכפלה בממוצע כל 3.0 חודשים מאז דצמבר 2025. המודל המוביל במדידה, Opus 5.5, כבר עבר את רף הבסיס שנקבע על פי מומחים אנושיים.

מה זה "טעם מחקרי"

החוקרים מגדירים "טעם מחקרי" (research taste) כיכולת לבחור בעיות מעניינות, לתכנן ניסויים ולפרש את התוצאות שלהם. TasteVal מודד רק את החלק הניסויי: כשהבעיה המחקרית כבר נתונה, עד כמה טוב המודל מתכנן ניסויים בזה אחר זה ומסיק מסקנות מהתוצאות.

כדי להפוך את המושג למשהו מדיד, הם מתרגמים אותו ליעילות מבחינת כוח חישוב (compute): כמה כוח חישוב ניסויי המודל צריך כדי להגיע לציון מסוים, בהשוואה למומחים אנושיים. מודל שמגיע לציון של המומחים בחצי מכוח החישוב נחשב בעל "טעם מחקרי" כפול. לפי ההגדרה הזו, הכפלת הטעם המחקרי משפיעה בדיוק כמו הכפלת כוח החישוב שזמין להרצת הניסויים.

איך נבנה המבחן

המדד כולל 8 משימות חדשות, שהחוקרים מתארים כמייצגות את חזית המחקר והפיתוח ב-AI: אצירה של נתוני אימון מקדים (pretraining), אימון מקדים ו-fine-tuning (כוונון עדין) של מודלי שפה, מידול העדפות, ועמידות בפני פרומפטים עוינים.

כדי להפריד בין טעם מחקרי לבין יכולת כתיבת קוד, המודל הנבחן רק מתכנן את הניסויים ומפרש את תוצאותיהם. סוכן קוד קבוע הוא שמממש אותם ומריץ אותם על מעבד H100 יחיד. כל ריצה מסתיימת אחרי 40 שעות GPU או 120 שעות של זמן אמת.

רף הבסיס האנושי הוא הניסיון הטוב ביותר של מומחה בכל משימה. הוא נלקח מתוך 24 מומחים, לפחות שניים לכל משימה, שעבדו לאחרונה בארגונים כמו OpenAI,‏ גוגל דיפמיינד, אנבידיה ומחלקת המחקר של מיקרוסופט.

התוצאות

לפי המאמר, Opus 5.5 השיג "מכפיל חישוב" של 2.30. במילים אחרות, הוא הגיע לתוצאות של המומחים ביותר מפי שניים פחות כוח חישוב ניסויי. מרווח הסמך של 95% רחב: בין 1.15 ל-4.37. המודל עשה זאת בעלות של כ-1/30 מהעלות הממוצעת לניסיון של המומחים. גם קצב ההכפלה של שלושה חודשים מגיע עם אי-ודאות ניכרת: מרווח הסמך שלו נע בין 1.7 ל-5.0 חודשים.

למה זה חשוב

הרקע הוא מודל התחזית AI Futures Model של AI Futures Project. במודל הזה, ברגע שכתיבת הקוד הופכת לאוטומטית, כוח החישוב לניסויים הופך לצוואר הבקבוק העיקרי. לכן הזמן עד לבינת־על (superintelligence) תלוי בעיקר בקצב שבו הטעם המחקרי משתפר.

החוקרים מדגישים שמדובר בהחצנה נאיבית ולא בתחזית. אם הטעם המחקרי ימשיך להשתפר בקצב שנמדד, ביחס לשיפור ביכולות הכלליות, מודל AI Futures מראה את השינויים הבאים:

  • ההסתברות ל"סינגולריות של טעם בלבד" עולה מ-51% ל-88%.
  • מועד ההגעה החציוני לבינת־על מלאכותית מוקדם מאמצע 2030 לסוף 2028.
  • ההסתברות לבינת־על לפני 2030 עולה מ-46% ל-69%.

ההסתייגויות

החוקרים עצמם מציינים שהתוצאות עלולות להגזים בקצב השיפור, משתי סיבות. ראשית, המשימות מהירות וזולות לבדיקה, ולפי החוקרים מעבדות המחקר המובילות מצליחות לשפר ביצועים בדיוק במשימות מהסוג הזה. שנית, רף הבסיס לא כולל חוקרים מהשורה הראשונה, ולכן ייתכן שהוא נמוך בהרבה מרמתם של החוקרים הטובים בעולם. בנוסף, המדד לא בודק את היכולת לבחור על אילו בעיות כדאי לעבוד מלכתחילה.

מנגד, ייתכן שהתוצאות דווקא מקטינות את קצב השיפור: החוקרים השקיעו מאמץ מוגבל בהוצאת הביצועים המיטביים מכל מודל.

המשמעות ככל הנראה היא שהכותרת "AI עוקף מומחים" נכונה רק בגבולות הניסוי: משימות מוגדרות מראש, מול קבוצת מומחים מסוימת. עם זאת, אם קצב ההכפלה יימשך, המדד מצביע על תחום שבו המרחק בין מודלים לבני אדם מצטמצם מהר, ושלפי מודלי התחזית בתחום עשוי להשפיע על לוח הזמנים של התפתחות ה-AI כולו.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות