יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

להגיע לאותה רמת ביצועים של AI עולה פי 13 פחות בכל שנה, אבל המודלים המובילים לא נעשים זולים יותר

לפי ארגון המחקר Epoch AI, העלות להגיע לציון קבוע במבחני AI יורדת בכ-47% בכל רבעון, כלומר פי 13 בערך בשנה. חוקרים מ-MIT מעריכים שהשיפור האלגוריתמי עצמו קטן בהרבה, בערך פי 3 בשנה. בינתיים, הפעלת מודלי ה-reasoning המתקדמים ביותר עולה לפעמים יותר, ולא פחות.

המחיר של יכולות AI ברמה קבועה יורד מהר מאוד. לפי Epoch AI, ארגון מחקר שעוקב אחרי מגמות בתחום, העלות להגיע לציון קבוע בכמה מבחני ביצועים (benchmarks) יורדת בממוצע בכ-47% בכל רבעון. זה בערך פי 13 בשנה. לפי הארגון, אף טכנולוגיה משנה-עולם אחרת לא הוזלה בקצב כזה.

אבל זו לא כל התמונה. המספר מתאר את מחיר השוק של ציון מסוים במבחן. הוא לא מודד רק התקדמות אלגוריתמית, וגם לא את העלות של עבודה אמיתית עם המודלים.

מ-30 סנט לארבע מאיות הסנט

Epoch מביא את o3 של OpenAI כדוגמה. בתחילת 2025 הגיע o3 לציון של 75% ב-GPQA Diamond, מבחן מדעי ברמת דוקטורט, בעלות משוערת של 30 סנט לשאלה. שמונה-עשר חודשים מאוחר יותר, מודל ממשפחת GPT-5.6 הגיע לאותו ציון בעלות של ארבע מאיות הסנט לשאלה. לפי Epoch, זה 1/725 מהמחיר המקורי. הארגון מציע השוואה: אם מחירי המכוניות היו יורדים בקצב כזה, רכב שעולה 50,000 יורו היה עולה פחות מ-70 יורו.

לפני ימים ספורים השיקה OpenAI את המודלים GPT-6 Sol ו-Luna, שזולים עוד יותר. לכן, לפי The Decoder, הפער ככל הנראה כבר גדל.

גם Epoch מסייג את הממצאים. הניתוח מבוסס על חמישה מבחנים בלבד, במתמטיקה, במדע ובחידות היגיון. הארגון עצמו מגדיר אותם "מדידות סבירות אך גסות, המבוססות על הנתונים הטובים ביותר הזמינים".

MIT: השיפור האלגוריתמי עומד על פי 3 בערך

האנס גונדלאך ועמיתיו ב-MIT בדקו נתונים דומים והגיעו לקצב ירידה של פי 5 עד פי 10 בשנה. הם השתמשו בנתוני מחירים מפלטפורמת ההשוואה Artificial Analysis, מאפריל 2024 עד נובמבר 2025, ובדקו הרבה יותר מודלים לכל מבחן ממחקרים קודמים.

החוקרים פירקו את הירידה במחירים לגורמים. חלק ממנה מגיע מחומרה זולה יותר, וחלק גדול יותר מתחרות בין הספקים. כדי לנטרל את השפעת התחרות הם בדקו בנפרד מודלים פתוחים. אחרי שהוציאו את שני הגורמים האלה, נשאר שיפור ביעילות האלגוריתמית של בערך פי 3 בשנה. המספר של Epoch גבוה יותר כי הוא לא מפריד בין הגורמים.

למה מודלי reasoning עדיין יקרים

מודלי reasoning הם מודלים ש"חושבים" בכמה שלבים לפני שהם עונים. מודלים חדשים מהסוג הזה יכולים להשקיע הרבה יותר כוח חישוב בבעיה קשה (מה שנקרא test-time compute). כתוצאה מכך, העלות לכל תשובה נכונה יכולה לעלות גם כשהמחיר לכל token ממשיך לרדת. tokens הם יחידות הטקסט שהספקים גובים לפיהן.

החוקרים ב-MIT מצאו גם שחלק מהשיפור בציונים הוא פשוט תוצאה של יותר חישוב. מודל חדש שעוקף את קודמו ב-GPQA Diamond נראה כמו התקדמות, אבל לפי הערכתם חלק גדול מהשיפור מגיע מכוח עיבוד נוסף לכל שאלה. כלומר, המודל משיג ציון גבוה יותר ועולה יותר להפעלה. במבחני תכנות ומתמטיקה החוקרים זיהו את אותה תופעה בהיקף קטן יותר.

המסקנה היא שיש שתי שאלות שונות. לשחזר את היכולות של המודל המוביל מלפני שנה? זה נעשה זול בהרבה. להפעיל את המודל הטוב ביותר היום? זה עולה לא פעם יותר לכל שאילתה.

בעיית ה-"benchmaxxing"

חברות AI יכולות גם לכוון את המודלים שלהן במיוחד למבחנים מוכרים. כך הציונים עולים בלי שיפור מקביל בעבודה אמיתית. Epoch ניסה להתמודד עם זה בעזרת מבחן בשם "Mystery Game Puzzles", שמבוסס על משחק שנשמר בסוד. במבחן הזה העלויות ירדו לאט יותר מבכל השאר. זה מתאים להשערה שחלק מההתקדמות נובע מכיוונון למבחנים, אבל ההבדל יכול להיות גם תוצאה של מבנה המשימה או של רעש בנתונים.

מה זה אומר למי שבוחר מודל

למי שבונה מוצר מעל מודל שפה, ממוצע ירידת המחירים לא מספיק כדי לבחור. פלטפורמות כמו Artificial Analysis מדרגות מודלים לפי איכות, מחיר, זמן תגובה (latency), גודל חלון ההקשר ומהירות הפלט. המודל הזול ביותר כמעט אף פעם לא מוביל בכל המדדים. מודל זול עם זמן תגובה ארוך לא יתאים לצ'טבוט בזמן אמת. מודל reasoning חזק עשוי להיות איטי מדי לתהליכים אוטומטיים. ומודל יקר יותר עשוי דווקא לחסוך כסף אם הוא טועה פחות ודורש פחות ניסיונות חוזרים.

המשמעות ככל הנראה היא שהמרחק בין מודלי החזית (frontier) לבין מה שזמין בזול מתקצר מהר. את היכולות של אשתקד אפשר לקבל היום בחלק קטן מהמחיר. אבל מי שרוצה את היכולות המתקדמות ביותר ישלם עליהן, לפחות בינתיים, מחיר מלא.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות