GPT-6 Astra של OpenAI פיענחה בתוך כשש שעות מכתב צבאי מוצפן מימי נפוליאון, שלא נקרא 217 שנה
קרטר צ'רץ', מהנדס AI, השתמש ב-GPT-6 Astra של OpenAI כדי לפענח מכתב מוצפן שנשלח לגנרל הצרפתי אוגוסט דה מרמון ולא נקרא 217 שנה. המודל קיבל תמונה אחת של המסמך, תמלל בעצמו 1,300 סימנים בכתב יד ופיצח את הצופן בתוך כשש שעות. חוקר צפנים היסטוריים אימת את הפתרון, והמסמך תוארך מחדש לשנת 1809.
מכתב צבאי מוצפן שנשלח לגנרל הצרפתי אוגוסט דה מרמון, ממפקדיו של נפוליאון, נשאר לא קרוא במשך 217 שנה, עד שפוענח בעזרת GPT-6 Astra, מודל של OpenAI. מאחורי הפיענוח עומד קרטר צ'רץ', מהנדס AI ב-SentinelOne. לפי ForkLog, המודל ביצע את כל התהליך בתוך כשש שעות של זמן חישוב, ונעזר רק בתמונה אחת של המסמך ובהגדרת מטרה אחת.
צ'רץ' עצמו הדגיש שהפיצוח לבדו אינו החלק המעניין. לדבריו, מה שבולט הוא שהמודל ביצע לבד תהליך עבודה רב-שלבי שמשלב ראייה ממוחשבת, קוד וניתוח טקסט.
מסמך שתוארך בטעות
עד עכשיו המכתב היה מוכר רק משחזור שפורסם ב-1969 בכתב העת הצבאי הצרפתי Revue historique des Armées, ושם תוארך בטעות לשנת 1807. לפי dev.ua, זהו העותק היחיד ששרד: שחזור בשחור-לבן שהפרויקט Persée סרק מאוחר יותר. במסמך יש שורה אחת בצרפתית רגילה, ואחריה 24 שורות של מספרים דו-ספרתיים, אותיות וסימנים שצוירו ביד. המפתח לצופן לא נשמר.
צ'רץ' מצא שהמכתב נכתב בעקבות פקודה של נפוליאון מ-16 במרץ 1809. באותה פקודה הורה הקיסר לבן חורגו, המשנה למלך באיטליה אז'ן דה בוהרנה, להעביר למרמון מידע מוצפן על מיקומם של הצבא הצרפתי וצבאות בעלות הברית. הטקסט המפוענח מונה את אותם שבעה כוחות, באותו סדר ועם אותן הערכות מספריות שמופיעות בפקודה המקורית.
איך זה עבד
הצופן מורכב מ-1,300 רכיבים ומ-155 סימנים שונים. הוא צופן הומופוני, כלומר אותה אות יכולה להיות מיוצגת בכמה סימנים שונים. השיטה הזו נועדה לשבש ניתוח תדירויות, הכלי הקלאסי של שוברי צפנים. לפני צ'רץ' זיהה היסטוריון ההצפנה דניאל טנט את משמעותם של 33 סימנים. כך אפשר היה לקרוא 435 רכיבים, כשליש מההודעה, ו-865 רכיבים נותרו לא מפוענחים.
לא היה תמלול של המסמך, ולכן המודל קיבל רק סריקה בגודל 1202 על 1836 פיקסלים. Astra חילק את הסריקה לשורות, זיהה את הסימנים שבכתב היד וניסה להבין אילו מהם הם בעצם וריאציות של אותו סימן. אחר כך הוא כתב לעצמו תוכנה שמבוססת על simulated annealing, אלגוריתם חיפוש הסתברותי. התוכנה דירגה פענוחים אפשריים לפי הסטטיסטיקה של רצפים של שלוש, ארבע וחמש אותיות בצרפתית. כקורפוס לשוני שימשו כתבים של ויקטור הוגו ואלכסנדר דיומא וגם זיכרונותיו של מרמון. בשלב מסוים המודל הבחין שחלק מהסימנים מייצגים מילים שלמות, כמו de, que, vous ו-général.
כדי לבדוק שהתוצאה לא הושפעה מטקסטים מאותה תקופה, הריץ צ'רץ' את התהליך שוב בלי זיכרונותיו של מרמון ובלי חומרים נפוליאוניים נוספים. הפענוח שהתקבל היה זהה. לפי dev.ua, צ'רץ' מעולם לא עסק קודם בקריפטואנליזה (ניתוח צפנים). הוא פרסם בבלוג שלו את התמלול, את המפתח המשוחזר ואת הקוד, כך שכל אחד יכול לבדוק ולשחזר את התוצאה.
מה גילה המכתב
הטקסט המפוענח הוא תדריך צבאי שנכתב לפני פרוץ המלחמה. המכתב נשלח בסוף מרץ 1809, כשבועיים לפני שאוסטריה פתחה במלחמה נגד צרפת ובעלות בריתה. נאמר בו שאוסטריה "תותקף מיד מכל הכיוונים", ויש בו גם מידע על מיקום הכוחות האוסטריים שלא מופיע בפקודה של נפוליאון. לדברי צ'רץ', המיקומים האלה תואמים את פריסת הכוחות לפני תחילת המלחמה.
הממצא ההיסטורי המעניין ביותר נוגע לפער בהתכתבות של נפוליאון. בנוסח שפורסם של הפקודה מ-16 במרץ, המשפט נקטע אחרי המילים שאוסרות על מרמון להירתע מפני "קומץ של...". במכתב המפוענח הגנרל מתבקש לא להיכנע ללחץ של "כמה יחידות או המון". צ'רץ' מזהיר שהמכתב הוא פרפרזה על פקודות הקיסר, ולכן אי אפשר לקבוע שנפוליאון התבטא בדיוק כך. עם זאת, זו העדות הישירה הראשונה למה שהושמט מהמסמך שפורסם.
סאטושי טומוקיו, חוקר צפנים היסטוריים ומחבר הפרויקט Cryptiana, אימת את הפתרון. בעקבות זאת סווג המכתב באתר כ"מפוענח" ותאריכו תוקן ל-1809. חמישה קטעים נותרו לא חד-משמעיים, כי חלק מהסימנים מופיעים רק פעם אחת בסריקה באיכות נמוכה. לדברי צ'רץ', קריאות חלופיות שלהם לא משנות את המסר הכללי.
למה זה חשוב
זה לא המקרה הראשון. לפי ForkLog, בספטמבר שימש GPT-6 Astra גם לפענוח הודעת רדיו צבאית גרמנית מ-1941 שהוצפנה במכונת Enigma. ההודעה, מתוך הארכיון CryptoCellar, לא פוענחה במשך כ-20 שנה.
ככל הנראה המשמעות רחבה יותר מהיסטוריה צבאית. המקרה מראה שמודל יכול לעבור לבד את כל השלבים: מזיהוי כתב יד, דרך כתיבת כלי ניתוח ועד הצלבה עם מקורות ארכיוניים. בעבר כל שלב כזה דרש מומחה נפרד. ייתכן שהשינוי המהותי הוא שאדם בלי רקע בתחום יכול להגיע לתוצאה שמומחים מאמתים. בכל זאת, גם כאן נדרש חוקר אנושי כדי לאשר את הפתרון.