אנתרופיק: מערכות AI אוטומטיות שיפרו יישור מודלים טוב יותר וזול יותר מחוקרים אנושיים
מחקר חדש של אנתרופיק מראה כי מערכות AI אוטומטיות שתפקידן לשפר את ה-alignment של מודלי שפה — כלומר את התאמת התנהגותם לכוונות המפתחים — עלו על חוקרים אנושיים בעשרה מבחני ייחוס, מבלי לפגוע בביצועים הכלליים של המודל. לפי המחקר, המערכת האוטומטית זולה פי כמעט 40 מחוקר אנושי ומגיעה לתוצאות טובות יותר תוך שש שעות.