BootLoops: פיזיקאי מהרווארד חיבר את Claude למחקר ב-18 תחומים, ומזהיר שבלי בדיקה אנושית זה לא מספיק
פרופ' מתיו שוורץ, פיזיקאי מאוניברסיטת הרווארד, פיתח את BootLoops, כלי קוד פתוח שמאפשר למודל Claude לבצע חישובים מדעיים מדויקים. במשך שלושה חודשים הוא ו-19 שותפים כתבו בעזרתו 36 כתבי יד ב-18 תחומים. שוורץ מזהיר שהמודל נוטה להכריז על הצלחה לפני הזמן, ולכן כל תוצאה צריכה לעבור אימות של אדם.
פרופ' מתיו שוורץ, פיזיקאי מאוניברסיטת הרווארד, פרסם את BootLoops, כלי קוד פתוח שעוזר למודלי שפה לבצע חישובים מדעיים מדויקים. לפי The Decoder, בתוך שלושה חודשים הוא ו-19 שותפים כתבו בעזרת הכלי 36 כתבי יד מדעיים ב-18 תחומים שונים. לצד התוצאות, שוורץ מדגיש שבלי פיקוח אנושי צמוד הכלי לא מספיק.
שוורץ כתב על הפרויקט ברשומה אורחת שפורסמה אצל אנתרופיק, שבה הוא משמש כיום גם חוקר אורח. BootLoops הוא מה שמכונה בעולם ה-AI בשם harness: שכבת תוכנה שעוטפת את המודל ומנהלת את העבודה שלו מול משימה מסוימת. קוד המקור זמין ב-GitHub.
לחפש בעיות "בצורת Claude"
לדברי שוורץ, נקודת המפנה הגיעה כשהפסיק לנסות להפעיל את Claude כמו חוקר אנושי והתחיל לחפש "בעיות בצורת Claude". הכוונה למשימות שנמצאות במקום שבו מה שמדענים רוצים לחקור חופף למה שהמודלים של היום באמת יודעים לעשות.
כדי להסביר את הגישה הוא משתמש במושג "המעטפת הקמורה" (convex hull). לפי התיאור שלו, הידע האנושי מפוצל: כל תחום מתקדם לכיוון משלו, והשטחים שבין התחומים נשארים לא ממופים. מעבדה יכולה להשקיע 20 שנה בחקר קבוצת גנים אחת בשיטה אחת, בלי לגעת בגנים הסמוכים או בגישות אחרות. כלי כמו BootLoops אמור למלא את הפערים האלה ולמצוא קשרים בין תחומים.
מפיזיקת חלקיקים ועד בלשנות
שוורץ התחיל מפיזיקת חלקיקים, ובמיוחד מאמפליטודות פיזור ואינטגרלים אליפטיים. תוך שבועות Claude חישב בעזרת הכלי 30 אינטגרלים. 15 מהם שחזרו תוצאות ידועות, ו-15 חושבו לראשונה.
אחר כך הפרויקט התרחב לתחומים נוספים:
- אקולוגיה: Claude פתר משוואה בת 20 שנה מתורת המגוון הביולוגי הנייטרלית, שעד אז לא ניתן היה לחשב בקנה מידה גדול. כשהתוצאות הופעלו על נתונים אמיתיים, הן הראו שהרכב מיני העצים באי בארו קולורדו שבתעלת פנמה משתנה פי 4.5 מהר יותר ממה שהתיאוריה מאפשרת. האקולוג ג'יימס או'דוויר עזר להפוך את הממצא למודל חיזוי טוב יותר.
- גנטיקה של אוכלוסיות: הצוות ניתח 5.7 מיליארד זוגות מוטציות מפרויקט 1000 Genomes ומצא עדות למנגנון שנקרא gene conversion (המרת גנים).
- כלכלה: נבנה "עורך נתונים" מבוסס AI לכתבי עת בכלכלה, שבדק אוטומטית 4,452 חבילות שחזור (replication packages). העבודה פורסמה כ-NBER Working Paper.
- בלשנות: יחד עם שלושה בלשנים נבנה מאגר של דפוסי הטעמה במילים, שמכסה 6,072 שפות.
לפי שוורץ, רבות מהתוצאות הפכו לבעלות ערך מדעי רק אחרי שמומחי תחום נכנסו לתמונה וקבעו את הכיוון.
"גמרתי, עם כוכבית אחת"
החלק המהותי ביותר ברשומה של שוורץ הוא האזהרות. Claude נוטה להכריז על הצלחה מוקדם מדי, ולדבריו ניסוחים כמו "גמרתי, עם כוכבית אחת" אומרים לעיתים קרובות "לא גמרתי בכלל". המודל טועה בהערכת משך המשימות ונוטה לפתור חישובים בכוח (brute force) במקום למצוא פתרון אלגנטי יותר. גם בדיקות אוטומטיות אינן אמינות, והמסקנות של המודל עלולות להיות שגויות גם כשהחישובים עצמם נכונים.
מעבר לשאלת האמינות, המודל נמשך לוויכוחים ותיקים ומצוטטים הרבה במקום לשאלות חדשות באמת. בנוסף, לדברי שוורץ, הפרויקטים צרכו הרבה כוח מחשוב ו-tokens (יחידות הטקסט שלפיהן מתומחר השימוש במודל).
מה זה אומר על הכשרת מדענים
שוורץ מתאר קצב שינוי שהופך תכנון לטווח ארוך לכמעט בלתי אפשרי, ושואל: למה להגיש בקשה למענק תלת-שנתי עבור חישוב שמודל AI אולי יפתור בלילה אחד? לדבריו, גם הכשרת דוקטורנטים הפכה לשאלה פתוחה. לפני שנתיים היה מגדיר קורס "Python למהנדסים" כחיוני, והיום הוא רואה בו מיותר כי Claude מסוגל לבצע את המשימות האלה.
ככל הנראה, המסקנה המעשית מהניסוי היא שהמודל מאיץ את ביצוע העבודה, אבל לא מחליף שיקול דעת מדעי. העבודה עוברת מביצוע החישוב לבחירת הבעיה הנכונה ולבדיקת התוצאה, והשלבים האלה עדיין דורשים אדם.