יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

Perplexity מלמדת את הסוכן שלה מטעויות אמיתיות של משתמשים: 21% פחות כשלים בקריאות לכלים

צוות המחקר של Perplexity פרסם מחקר על שיטת אימון שמלמדת מודל שפועל בתוך Perplexity Computer משיחות אמיתיות של משתמשים, כולל שיחות שנכשלו. בניסוי A/B חי ירד שיעור הכשלים בקריאות לכלים מ-2.24% ל-1.77%. לפי החברה מדובר בירידה של 21.2%, והיא מובהקת סטטיסטית.

צוות המחקר של Perplexity פרסם מחקר חדש בתחום ה-post-training, שלב האימון שמגיע אחרי האימון הבסיסי של המודל. במחקר מאמנים מודל שפועל בתוך Perplexity Computer, הסוכן הממוחשב של החברה, על שיחות אמיתיות של משתמשים, כולל שיחות שנכשלו. לפי הדיווח ב-MarkTechPost, בניסוי A/B חי ירד שיעור הכשלים בקריאות לכלים מ-2.24% ל-1.77%. צוות Perplexity מציג את זה כירידה של 21.2%, מובהקת סטטיסטית.

מה בדיוק נמדד

סוכן AI לא רק עונה על שאלות. הוא גם מבצע פעולות: מריץ חיפוש, פותח קבצים, מפעיל תוכנות או שולח בקשות לשירותים חיצוניים. כל פעולה כזו היא "קריאה לכלי" (tool call). כשקריאה נכשלת, למשל בגלל פרמטר שגוי או פורמט לא תקין, המשימה של המשתמש עלולה להיתקע או לסטות מהמסלול.

חשוב לקרוא את המספרים בזהירות. ה-21.2% הם ירידה יחסית. בערכים מוחלטים שיעור הכשלים ירד בכחצי נקודת אחוז, מ-2.24% ל-1.77%. בנוסף, לפי הדיווח, ההשוואה נעשתה בין שתי גרסאות מאומנות של המודל (checkpoints), והחומר שעומד לרשותנו לא מפרט מה בדיוק ההבדל ביניהן. אבל במערכת שמטפלת בכמות גדולה של משימות, גם שינוי של חצי נקודת אחוז יכול ככל הנראה להצטבר למספר משמעותי של משימות שלא נתקעות.

איך השיטה עובדת

לפי הדיווח, השיטה משלבת שתי טכניקות:

  • Rejection sampling fine-tuning: המודל מייצר כמה תשובות אפשריות, רק הטובות שבהן נשמרות, והמודל מאומן עליהן. בפועל הוא לומד מהגרסאות המוצלחות של עצמו.
  • Hint-guided self-distillation: זיקוק עצמי בעזרת רמזים. בטכניקה הזו המודל לומד מגרסה של עצמו, ומהשם אפשר להבין שהגרסה הזו מקבלת רמזים שמכוונים אותה לתשובה נכונה. אפשר להעריך שהרמזים עוזרים להפוך שיחה שנכשלה לדוגמה שאפשר ללמוד ממנה, במקום שהיא תיזרק. הפרטים המלאים של המנגנון לא מופיעים בחומר שעומד לרשותנו.

למה זה חשוב

הרבה מהאימון של מודלי שפה נעשה על נתונים שהוכנו מראש או על משימות שנבנו במיוחד. Perplexity בחרה לאמן על שיחות אמיתיות, כולל הכישלונות שבהן. המשמעות היא שהמודל לומד מהטעויות שהוא עושה בשימוש יומיומי, ולא רק ממה שהמפתחים ציפו שיקרה.

התוצאה נמדדה בניסוי A/B על משתמשים אמיתיים ולא רק במבחני ביצועים (benchmarks) סטנדרטיים. לכן היא מלמדת ככל הנראה יותר על ההשפעה בשימוש בפועל, שבו משתמשים מנסחים בקשות בדרכים שקשה לצפות מראש.

הרקע הרחב הוא התחרות בין חברות ה-AI על סוכנים, כלומר מערכות שמבצעות משימות מרובות שלבים בשביל המשתמש. בסוכן כזה, כשל אחד באמצע התהליך יכול להפיל את כל המשימה, ולכן אמינות הקריאות לכלים חשובה לא פחות מאיכות הניסוח. הגישה של Perplexity מרמזת כנראה על כיוון שבו השימוש במוצר עצמו הופך למקור נתונים לשיפור שלו.

כדאי לזכור שהמחקר פורסם על ידי Perplexity עצמה, והנתונים הם של החברה ולא של גוף חיצוני.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות