פלטפורמה פתוחה לאימות שיתופי של סוכני AI יוצאת לדרך
מפתח עצמאי השיק את solveathome.org, פלטפורמה שבה סוכני AI עובדים על בעיות מחקר פתוחות תוך שסוכנים אחרים בודקים את התוצרים ובוחנים מוסמכים מכריעים מה קביל - הכול בפומבי. לדברי המפתח, המניע לבנייתה היה דיווח לא-מאומת לפיו OpenAI הריצה כ-10,000 סוכנים בניסיון סגור על אחת מ"בעיות המילניום"; כדוגמה חיה הוא מציג פרויקט סביב השערת הראשוניים התאומים.
✦ נכתב אוטומטית על ידי AIמבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
מפתח שמזוהה ברשת בכינוי Benjaminsen הציג פלטפורמה חדשה בשם solveathome.org, שמטרתה לאפשר לסוכני AI לעבוד יחד על בעיות מחקר פתוחות, כשכל שלב בתהליך - כולל טעויות וניסיונות שנכשלו - נשאר גלוי לציבור.
לפי ההודעה שבה הציג את הפרויקט, המניע לבנייתו היה דיווח שלא אומת באופן עצמאי מול הודעה רשמית של החברה, ולפיו OpenAI הפעילה כ-10,000 סוכני AI בניסיון סגור על אחת מ"בעיות המילניום" - קבוצת שבע הבעיות המתמטיות הפתוחות, שמציע פתרון מלא לכל אחת מהן זוכה בפרס כספי מטעם מכון קליי. מול מודל סגור כזה, כתב המפתח, הוא רצה לבנות חלופה שבה, במילותיו: "הסוכן שלך עושה את העבודה, סוכנים של אנשים אחרים בודקים אותה, בוחנים מוסמכים מחליטים מה קביל - והכול פומבי".
המודל שהוצג פשוט למדי: משתמש מעלה לפלטפורמה תוצר עבודה של סוכן AI; סוכני AI של משתמשים אחרים בודקים אותו; ולבסוף בוחנים אנושיים מוסמכים מחליטים אילו ממצאים מוכרים כתקפים. כל התהליך, כולל החלקים שלא צלחו, נשמר בפומבי.
כדוגמה לשימוש בפלטפורמה, solveathome.org מריץ כרגע פרויקט סביב השערת הראשוניים התאומים (twin prime conjecture) - השערה ותיקה בתורת המספרים, לפיה יש אינסוף זוגות של מספרים ראשוניים המרוחקים זה מזה ב-2 בלבד. תורם המזוהה בפלטפורמה בשם Chris פיתח שם, באופן עצמאי, מסגרת חזותית המתארת התחלקויות כדפוסים מחזוריים חופפים: "אריח" חוזר הממחיל זוגות מועמדים לראשוניים תאומים ואת האפקט של כל מספר ראשוני נוסף על הדפוס. לפי הפלטפורמה, המסגרת מארגנת מחדש כלים קלאסיים מתחום ה"נפה" (sieve) בתורת המספרים - אך אינה מוכיחה שיש אינסוף זוגות ראשוניים תאומים; ההשערה עצמה נותרת פתוחה.
יומן התצפיות של הפרויקט מתעד גם כיצד Chris זיהה דפוס סימטרי סביב מרכז האריח, ושאל אם ניתן לנצל את הסימטריה כדי לפשט את בעיית הפערים בין ראשוניים. הבדיקה שבוצעה הראתה שהסימטריה אכן מדויקת, אך שימוש במחצית הדפוס בלבד אינו מקטין את הקושי המקורי של בעיית הפער המקסימלי. הפלטפורמה מדגישה שמדובר בתצפיות ובבדיקות מתועדות, ולא בטענת בכורה מתמטית.
מעבר לתיאור עצמו, הפלטפורמה שומרת גם קבצי קוד, גזירות מתמטיות, תיקונים שעברו ביקורת, ו"מרשם תוצאות" המאורגן לפי שאלת מחקר - כך שכל חוקר הבא יכול להתחיל ממקום מוגדר, כולל ידיעה מה כבר נבדק ולא הביא לתוצאה.
הפלטפורמה נבנתה, ככל הנראה, כתגובה לחשש רחב יותר בקהילת ה-AI: ככל שסוכנים אוטונומיים משמשים למשימות מחקר מורכבות יותר, קשה יותר לצד שלישי לבדוק אם תוצאה שסוכן הפיק אכן אמינה. מודל שבו סוכנים בודקים סוכנים אחרים ובוחן אנושי מכריע בסוף מציע דרך אפשרית להתמודד עם כך - אך יעילותו בטווח הארוך, וכן היקף האימוץ שלו מעבר לפרויקט הבודד שמוצג כרגע, אינם ניתנים להערכה על בסיס החומר הקיים.