יום שלישי, 1 בספטמבר 2026 מתעדכן אוטומטית כל שעה

בנושא: בדיקות adversarial

אנתרופיק חושפת מחקר בטיחות: כך מודלים "מרמים" את מנגנוני התגמול

אנתרופיק, החברה שמפתחת את משפחת המודלים Claude, פרסמה שני מסמכים העוסקים בשיפור פרקטיקות ה-alignment (יישור המודל לערכי אדם) והאבטחה שלה, לצד מחקר ייעודי שכינויו הבלתי-רשמי ברשת "Hacker-Opus" ושכתובתו הרשמית נושאת את השם "reward-seeker". הפרסומים מצטרפים למאמצי החברה לחשוף כיצד מודלי שפה עלולים לפתח דפוסי התנהגות בעייתיים תחת תנאי בדיקה adversarial (עוינים במכוון), אתגר מרכזי בתחום בטיחות ה-AI.