יום שבת, 29 באוגוסט 2026 מתעדכן אוטומטית כל שעה
🗞️ חזרה למהדורה

אנתרופיק: מערכות AI אוטומטיות שיפרו יישור מודלים טוב יותר וזול יותר מחוקרים אנושיים

מחקר חדש של אנתרופיק מראה כי מערכות AI אוטומטיות שתפקידן לשפר את ה-alignment של מודלי שפה — כלומר את התאמת התנהגותם לכוונות המפתחים — עלו על חוקרים אנושיים בעשרה מבחני ייחוס, מבלי לפגוע בביצועים הכלליים של המודל. לפי המחקר, המערכת האוטומטית זולה פי כמעט 40 מחוקר אנושי ומגיעה לתוצאות טובות יותר תוך שש שעות.

חברת Anthropic פרסמה ביום שישי מאמר מחקר בשם "Automated Researchers Can Reliably Mitigate Alignment Failures", שמתאר מערכת אוטומטית המסוגלת לשפר את ה-alignment של מודלי שפה — כלומר את מידת ההתאמה בין התנהגות המודל לכוונות מפתחיו — טוב יותר מחוקרים אנושיים בתחום. המחקר נערך בהובלת חוקר בתוכנית ה-fellows של אנתרופיק, Chen Yueh-Han.

לפי הדיווח של TechCrunch, הצוות בדק את המערכת, המכונה Automated Alignment Researcher (AAR), על עשרה מבחני ייחוס (benchmarks) שכל אחד מהם בוחן התנהגות בעייתית ספציפית של מודל. המערכת האוטומטית הצליחה לשפר ביצועים בכל אחד מעשרת המבחנים, ולפי המחקר — מבלי לפגוע בביצועים הכלליים של המודל בשאר המשימות.

אופן הפעולה של AAR מחקה תהליך מחקר אנושי טיפוסי: המערכת סורקת ספרות מחקרית קיימת, מציעה שיטת שיפור, ומאמנת את המודל לפי אותה שיטה במשך כ-30 דקות בכל סבב. שיטות שמוכיחות את עצמן נשמרות להמשך, בעוד שיטות לא יעילות נזרקות — כך שהמערכת יכולה לפעול במהירות ובקנה מידה גדול משמעותית מזה שחוקר אנושי מסוגל להשיג.

המאמר כולל השוואה ישירה מול חוקרי alignment אנושיים: "שיטת ה-AAR הטובה ביותר עולה בממוצע, תוך שש שעות, על מה שחוקרים מנוסים מציעים", נכתב במחקר, שמוסיף כי כיוונים מחקריים בהנחיית בני אדם לא הובילו לביצועים חזקים יותר. גם מבחינת עלות הפער בולט: לפי אנתרופיק, הפעלת AAR עולה כ-4 דולר לשעה בעלות חישוב מול API, לעומת כ-150 דולר לשעה שהחברה משלמת לחוקר אנושי.

עם זאת, החוקרים מציינים כמה הסתייגויות. יעילות השיטה תלויה במידה שבה מבחני הייחוס אכן משקפים את יעדי ה-alignment הרצויים בפועל — ובניית מבחנים כאלה ותחזוקתם הן עדיין עבודה מחקרית משמעותית בפני עצמה. גם הספרות שממנה שואבת המערכת האוטומטית את ההצעות שלה דורשת הרחבה ותחזוקה מתמשכת.

המשמעות המיידית של הממצאים היא שאוטומציה של חלק מעבודת ה-alignment עשויה להפוך לישימה בטווח הקרוב, כפי שנכתב במאמר עצמו. מעבר לכך, המחקר נוגע בשאלה רחבה יותר שמעסיקה כיום חלק ניכר מתעשיית ה-AI: האם מודלים יכולים לשפר את תהליכי האימון של עצמם — צעד שמכונה לעיתים "שיפור עצמי רקורסיבי" (recursive self-improvement). אם מודלים אכן מסוגלים לשפר את ה-alignment של עצמם ביעילות, ייתכן שבעתיד יוכלו לשפר גם היבטים רחבים יותר של תהליך האימון — התפתחות שעשויה, ככל הנראה, לצמצם בהדרגה את מעורבותם של חוקרים אנושיים בחלק מעבודת המחקר הזו.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות