יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

מערכת AI שאומנה בפחות מ-8,000 דולר ניצחה את גדול שחקני הסטרטגו בכל הזמנים

חוקרים מארבע אוניברסיטאות אמריקאיות פיתחו את Ataraxos, מערכת AI שניצחה את פים נימייר ההולנדי, השחקן המעוטר ביותר בתולדות סטרטגו, ב-15 משחקים מתוך 20. לפי הערכת החוקרים, האימון עלה פחות מ-8,000 דולר, בעוד שמערכת DeepNash של DeepMind עלתה מיליוני דולרים ולא הגיעה לרמת השחקנים הטובים בעולם.

צוות חוקרים מאוניברסיטאות קרנגי מלון, NYU, סטנפורד ו-MIT פיתח מערכת בינה מלאכותית בשם Ataraxos, שניצחה בבירור את פים נימייר (Pim Niemeijer) מהולנד. נימייר נחשב לשחקן הסטרטגו המעוטר ביותר בתולדות המשחק. לפי הדיווח ב-THE DECODER, בסדרה רשמית של 20 משחקים רשמה המערכת 15 ניצחונות, הפסד אחד וארבע תוצאות תיקו. המחקר פורסם בכתב העת Nature, ולפי הערכת המחברים אימון המערכת עלה פחות מ-8,000 דולר.

היריב: "שחקן הסטרטגו הטוב בכל הזמנים"

נימייר זכה בארבע אליפויות עולם, ב-15 אליפויות הולנד ובשתי אליפויות עולם מקוונות, והחזיק במקום הראשון בדירוג העולמי יותר מ-600 שבועות. ג'ורג' פרנקה, השחקן היחיד שהשתתף בכל אליפויות העולם מאז 1997, כינה אותו "שחקן הסטרטגו הטוב בכל הזמנים". לפי המחברים, Ataraxos היא המערכת הראשונה שמגיעה לרמה על-אנושית במשחק, ככל הידוע להם.

למה סטרטגו קשה כל כך למכונות

בשחמט ובגו כל הכלים גלויים על הלוח. בסטרטגו כל שחקן מציב בסתר 40 כלים שפניהם מוסתרות, ודרגתו של כלי מתגלה רק כשהוא נתקל בכלי של היריב. מי שלוכד ראשון את הדגל של היריב מנצח. לפי המאמר יש יותר מ-10 בחזקת 33 מערכי פתיחה אפשריים. הכותב הראשון, סמואל סוקוטה (Samuel Sokota), הסביר שבמשחקים עם מידע חלקי, ערכו של מהלך תלוי לא רק בהמשך המשחק אלא גם במה שקרה לפניו.

שיטות שפותחו למשחקי פוקר מתמודדות עם הבעיה הזו, אבל רק כשהמידע הנסתר מועט. בטקסס הולדם יש רק 1,326 ידיים פותחות אפשריות, ולפי המאמר כוח החישוב שהשיטות האלה צורכות גדל ככל שיש יותר מידע נסתר. לכן סטרטגו נשאר אחד ממשחקי הלוח התחרותיים הגדולים האחרונים שבהם בני אדם עוד גברו על מכונות.

תקציב אוניברסיטאי מול מיליונים של DeepMind

DeepMind של גוגל ניסתה בעבר להגיע לאותו הישג עם מערכת DeepNash ולא הצליחה לעבור את רמת השחקנים המובילים. לפי המאמר, DeepNash אומנה על 1,024 צמתי TPU במשך חודשיים עד שלושה. מחברי Ataraxos מעריכים שבמחירי 2025 העלות הייתה 3 עד 4.5 מיליון דולר. באליפות העולם של 2023 ניצחה DeepNash ב-19 מתוך 28 משחקים, אבל הפסידה לרוב השחקנים המובילים, ובהם נימייר.

Ataraxos, לעומת זאת, אומנה שבוע אחד על 16 מעבדי H100 של אנבידיה, ועוד ארבעה ימים על ארבעה מעבדים עבור "רשת האמונות" שלה. במחירי 2025 מדובר בפחות מ-8,000 דולר. לפי החוקרים, זה בערך 1/500 מעלות החישוב, 1/30 ממשחקי האימון ו-1/100 מדוגמאות האימון. הם מייחסים את החיסכון לסימולטור GPU שכתבו בעצמם וללמידה יעילה הרבה יותר. אין השוואה ישירה בין שתי המערכות: לדברי החוקרים, DeepMind הודיעה להם שהקוד של DeepNash כבר לא עובד.

איך זה עובד

Ataraxos לומדת בלי שום נתונים אנושיים, רק ממשחקים נגד עצמה. לפי המאמר, המפתח הוא regularization, כלומר תנאי נוסף באימון שמאלץ את המערכת לגוון את מערכי הפתיחה והמהלכים שלה במקום להינעל מוקדם על אסטרטגיה קבועה. זה חשוב בסטרטגו כי שחקן צפוי נוטה להיות מנוצל על ידי היריב. במהלך האימון החוקרים מרפים בהדרגה את הלחץ הזה: בהתחלה המערכת מגוונת מאוד ולומדת בקפיצות גדולות, ובהמשך היא משחקת בשיקול רב יותר ומבצעת רק תיקונים קטנים.

בנוסף, "רשת האמונות" מנחשת מהם הכלים הנסתרים של היריב. לפני כל מהלך המערכת משתמשת בה כדי לייצר מצבי משחק אפשריים, בודקת מהלכים מועמדים ומריצה שלב למידה נוסף רק עבור ההחלטה הזו. לדברי המחברים, עבודות קודמות ויתרו על חיפוש כזה כי הוא נחשב קשה מדי כשיש כל כך הרבה מידע נסתר.

המשמעות

ההישג חשוב לא רק בגלל התוצאה על הלוח. הפער בעלויות מרמז שבתחום משחקי המידע החלקי, רעיונות אלגוריתמיים יעילים יכולים ככל הנראה לפצות על חוסר בכוח מחשוב עצום. אם הממצאים יחזיקו, המשמעות היא שגם צוותים אקדמיים עם משאבים מוגבלים יכולים להתחרות בחזית מחקר שנחשבה שמורה למעבדות של חברות הענק. מכיוון שהעולם האמיתי מלא במידע נסתר, למשל במשא ומתן או בקבלת החלטות בתנאי אי-ודאות, ייתכן שהשיטות האלה יתאימו גם לבעיות מחוץ למשחקי לוח. בשלב זה זו הערכה בלבד.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות