מיקרוסופט השיקה גרסת Pro חדשה למודל יצירת התמונות שלה, MAI-Image-2.5-Pro, שטיפסה לעמדה מובילה בזירת השוואה בין מודלי text-to-image. המודל מתומחר לפי טוקנים ולא לפי מספר תמונות קבוע, במחיר שמסתכם בכ-108.5 דולר לאלף תמונות בגודל 1024x1024 פיקסלים — יקר משמעותית מהגרסאות הקודמות של החברה.
מיקרוסופט השיקה גרסה חדשה של מודל יצירת התמונות שלה, MAI-Image-2.5-Pro, ולפי דיווח שפורסם בערוץ הטלגרם ai_newz, המודל טיפס לעמדה מובילה בזירת השוואה בין מודלי text-to-image (יצירת תמונות מטקסט).
תמחור לפי טוקנים
בשונה מהמודלים הקודמים של החברה, MAI-Image-2.5-Pro מתומחר לפי טוקנים ולא לפי מספר תמונות קבוע: 5 דולר לכל מיליון טוקני טקסט בקלט, 8 דולר לכל מיליון טוקני תמונה בקלט, ו-106 דולר לכל מיליון טוקני תמונה בפלט. לפי הדיווח, המחיר בפועל מסתכם בכ-108.5 דולר לאלף תמונות בגודל 1024x1024 פיקסלים.
החישוב הזה מרמז שכל תמונה כזו מיוצגת בפלט המודל בכ-1,024 טוקנים בלבד — נתון שמצביע, ככל הנראה, על שימוש באוטואנקודר (autoencoder) שדוחס את התמונה פי 16 בכל צד. זהו פרט טכני שממחיש איך מיקרוסופט ממירה תמונה לרצף טוקנים שניתן לתמחר בו, בדומה לאופן שבו מתומחרות מילות טקסט במודלי שפה.
למי שמעדיף תמחור נמוך יותר, מיקרוסופט ממשיכה להציע גם את הגרסאות הקודמות: MAI-Image-2.5 (ללא Pro) במחיר של 48 דולר לאלף תמונות, ו-Image-2.5-Flash, הגרסה המהירה והזולה יותר, ב-20 דולר לאלף תמונות. כלומר הגרסה החדשה יקרה פי יותר משניים מקודמתה הישירה, ופי חמישה וחצי בערך מגרסת ה-Flash.
מקומה בזירת ההשוואה
הדיווח מציין שהמודל טיפס לעמדה מובילה בהשוואות בין מודלים ליצירת תמונות מטקסט, אך כותב הפוסט מעיר כי הדוגמאות שנבחרו להצגה (cherry-picks) מטעם הזירה לא הותירו רושם רב בעיניו, וההבדל מול GPT-Image-2 של OpenAI נראה לו מינימלי. זוהי הערכה אישית של הכותב, לא נתון מדיד, אך היא מרמזת שמיקום גבוה בטבלת השוואה לא בהכרח משקף פער איכות ניכר בפועל, ועשוי לנבוע גם מאופן הבחירה של דוגמאות ההדגמה.
למה זה חשוב
הכניסה של מיקרוסופט לתחרות ה-text-to-image, לצד שחקניות כמו OpenAI, גוגל ו-Midjourney, משקפת תחרות הולכת וגוברת סביב יצירת תמונות מבוססת בינה מלאכותית. מודל תמחור מבוסס טוקנים, במקום מחיר קבוע לתמונה, עשוי לרמז על כיוון רחב יותר בתעשייה: התייחסות לתמונות כאל רצף טוקנים לכל דבר, כפי שכבר נהוג בטקסט, מה שמאפשר למפתחים לחזות עלויות בצורה מדויקת יותר גם עבור רזולוציות ואיכויות פלט משתנות. עם זאת, כפי שמעיר הדיווח המקורי, מיקום גבוה בטבלאות השוואה ציבוריות אינו בהכרח ערובה לאיכות עדיפה בפועל — פער המחיר הניכר מול הגרסאות הקודמות מעלה את השאלה אם השיפור באיכות מצדיק אותו.