מהנדס תוכנה הפנה AI ל-400 שנות ארכיונים ומצא דיווח על מטאוריט שנשכח וקרנפים שאבדו
מהנדס תוכנה הפעיל ממעבדה ביתית מערך של כמה מודלי AI שסרק מיליוני מסמכים היסטוריים, ובהם ארכיון חברת הודו המזרחית ההולנדית ועיתונים ישנים. לדבריו, הוא מצא דיווח על נפילת מטאוריט שנשכח, שלושה קרנפים שאבדו והתפרצויות געשיות שלא תועדו. השיטה שלו נשענת על מודל סינון זול, וכל ממצא חייב להוביל בסוף לסריקה של מסמך מקורי.
מהנדס תוכנה שאינו היסטוריון הפנה מערך של מודלי AI למיליוני מסמכים היסטוריים. לדבריו הוא מצא שם דיווח על נפילת מטאוריט שנשכח, שלושה קרנפים שאבדו והתפרצויות געשיות שלא תועדו. בפוסט בבלוג האישי שלו הוא מתאר את הכלים ששימשו אותו ואת דרך העבודה, והתוצאה היא דוגמה מעשית לשימוש ב-AI במחקר היסטורי.
ההשראה: עדות חדשה על הדודו
בתחילת הדרך עמד פוסט שפרסם ההיסטוריון בנג'מין ברין ב-1 באוקטובר 2026, בשם "Using Opus 5.5 to discover a new eyewitness account of the dodo". ברין השתמש ב-AI כדי לחפש ברשומות הדיגיטליות של חברת הודו המזרחית ההולנדית. החברה שלטה בסחר התבלינים והפעילה שרשרת נמלים ברחבי אסיה משנת 1602 ועד שפורקה ב-1799, אחרי שקרסה תחת חובותיה. פרויקט בשם GLOBALISE הפך מיליוני עמודים בכתב יד של החברה לטקסט שאפשר לחפש בו. בתוכם מצא ברין יומן אונייה משנת 1615, שבו מספרים מלחים במאוריציוס שהם "תפסו צבים רבים, דודואים". זו עדות ראייה חדשה על הציפור שנכחדה, שחיכתה בארכיון ארבע מאות שנה.
הכותב מספר שמיד כשקרא את הפוסט חשב שגם הוא יכול לעשות את זה, כי הוא מיומן בהפעלת סוכני AI ובבניית תהליכי עבודה אוטומטיים (agentic workflows). את התוכנית לעבודה הוא גיבש בעזרת עוזר "Deep Research", שהציע שלוש עשרה שאלות היסטוריות פתוחות שאפשר אולי לפתור בעזרת נתונים שכבר זמינים ברשת. ביניהן: בעלי חיים בארכיון חברת הודו המזרחית, התפרצות געשית ענקית משנת 1808 שמיקומה לא זוהה מעולם, רעידות אדמה שדווחו בעיתונים הולנדיים ישנים, נפילות מטאוריטים שלא נרשמו וספינות שנעלמו.
הכלל שהציב לעצמו הוא שכל טענה צריכה להסתיים במסמך אמיתי: סריקה של המכתב בכתב היד או של העיתון המודפס, עם מספר תיק בארכיון שכל אחד יכול לבדוק. לדבריו, מודלי AI עלולים לטעות בביטחון מלא, ולכן אסור להסתפק בתשובה שלהם בלי לבדוק אותה במקור.
איך קוראים 70 שנות עבודה בלילה אחד
יחד עם Claude Code, הכלי של אנתרופיק, הוא בנה תהליך מחקר שעבר על תמלילי GLOBALISE (4.35 מיליון עמודים מהמאה ה-17 עד שנות ה-90 של המאה ה-18), על העיתונים הדיגיטליים של הספרייה הלאומית ההולנדית, על מאתיים שנה של עיתונים אמריקאיים ועל כמה יומני אוניות. לפי החישוב שלו, קריאה ידנית של עמודי החברה ההולנדית בלבד הייתה נמשכת כ-70 שנה. מעבדת ה-AI הביתית שלו סיימה אותם בריצה לילית אחת של שתים עשרה שעות.
הקושי המרכזי הוא הכתיב. זיהוי טקסט אוטומטי של כתב יד ודפוס ישן משאיר הרבה שגיאות, ובהולנדית של המאה ה-17 כותבים "קרנף" בכחמש עשרה דרכים שונות, כך שחיפוש לפי מילות מפתח מחמיץ את רוב הממצאים. לכן כרטיס המסך הפך כל קטע ל"טביעת אצבע" מתמטית של המשמעות שלו (embedding). מארכיון החברה לבדו נוצרו כך 5.7 מיליון קטעים, וכך אפשר היה לחפש לפי הנושא של קטע ולא לפי המילים שבו.
גם אז חיפוש אחד יכול היה להחזיר עשרות אלפי תוצאות. כאן נכנס לתמונה Jev, מודל "System One" קטן ומהיר שעונה רק על שאלות צרות: האם זו חיה אמיתית? האם היא בטבע? איפה היא? לדברי הכותב, הקריאה של Jev עולה סנטים בודדים למיליון מילים, ו-59 אלף אזכורים של פילים עלו לו כשלושה דולרים. הוא מדגיש שהרעיון היה שלו ולא של ה-AI: מודל Fable של Claude לא הכיר את המושג, והוא נאלץ להסביר אותו לפני שבנו את המערכת סביבו. רק הקטעים ש-Jev סימן עברו לשלב הבא, שבו פעל Claude Haiku.
למה זה חשוב
המשמעות ככל הנראה רחבה יותר מהממצאים עצמם. בארכיונים היסטוריים, צוואר הבקבוק הוא בדרך כלל אדם שקורא קטעים אחד אחרי השני. מודל סינון זול שמבצע את המיון הראשוני עשוי להפוך מחקר כזה לזמין גם לחוקרים ולחובבים בלי תקציב גדול. הדרישה שכל ממצא יוביל לסריקה של מסמך מקורי היא כנראה מה שמבדיל בין גילוי היסטורי לבין טענה של מכונה, וזה עיקרון שכדאי לאמץ בכל מחקר שנעזר ב-AI.