CoreWeave ואנבידיה מכניסות לשימוש מסחרי את Vera Rubin, עם דגש על סוכני AI
ספקית הענן CoreWeave הודיעה שמערכות Vera Rubin NVL72 של אנבידיה זמינות אצלה, ו-Cognition, החברה שמפתחת את Devin, היא הלקוחה הראשונה שמריצה עליהן עומסי עבודה בייצור. CoreWeave תציע גם את מעבד Vera, שאנבידיה מתארת כ-CPU הראשון שנבנה לסוכני AI, והשיקה את Forge, סביבה לאימון ולשיפור של מודלים וסוכנים. לדברי אנבידיה, מעבדי GPU בני כמעט עשור עדיין מריצים אצל CoreWeave עבודות של לקוחות.
ספקית הענן CoreWeave הודיעה השבוע שמערכות NVIDIA Vera Rubin NVL72, דור התשתית החדש של אנבידיה, זמינות בענן שלה יחד עם רשת Spectrum-X Ethernet במהירות 102.4T. ההכרזה נמסרה בכנס CoreWeave Fully Connected שמתקיים בסן פרנסיסקו. באותו מעמד הודיעה החברה שתציע גם את מעבד Vera, שאנבידיה מגדירה כ-CPU הראשון שנבנה במיוחד לסוכני AI. בנוסף היא השיקה את CoreWeave Forge, סביבה משולבת לאימון, להערכה ולשיפור של מודלים וסוכנים.
הלקוחה הראשונה: המפתחת של Devin
Cognition, מעבדת ה-AI שמפתחת את Devin, "מהנדס תוכנה" מבוסס AI, היא הלקוחה הראשונה שמריצה עומסי עבודה בייצור על Vera Rubin. החברה מבצעת ב-CoreWeave אימון, reinforcement learning (למידת חיזוק) ו-inference, כלומר הפעלה של המודל בזמן אמת. לפי ההודעה, תוך תשעה חודשים היא גדלה שם לאלפי מעבדי GPU.
המדפים הראשונים של Vera Rubin הגיעו ל-CoreWeave מוקדם יותר החודש, ולפי אנבידיה אשכול הייצור עבור Cognition הוקם בתוך ימים. בבדיקות מוקדמות השוותה Cognition את ביצועי ה-inference של המערכת החדשה לדור הקודם, GB200 NVL72, על עומס עבודה של הנדסת תוכנה: היא דגמה משימות מ-FrontierCode והפעילה סוכני AI שיפתרו אותן. לדבריה, Vera Rubin הגיעה לתפוקת tokens כוללת גבוהה פי 4.8 לכל היותר בעומסי inference. חשוב לזכור שמדובר בנתונים שפרסמו הצדדים עצמם ולא במדידה עצמאית.
"קידוד מבוסס סוכנים הוא עומס עבודה מורכב: הקשרים ארוכים, מקביליות גבוהה ונפחי tokens שבהם העלות לכל token קובעת מה אנחנו יכולים להשיק", אמר סילאס אלברטי מצוות המייסדים של Cognition.
מעבד לסוכנים, לא רק למודלים
לפי אנבידיה, סוכני AI מעמיסים על התשתית משני כיוונים. כדי להפעיל אותם צריך כוח חישוב זמין ומהיר, וכדי לשפר אותם צריך להריץ אלפי סביבות מבודדות במקביל. בפריסה של CoreWeave, מדף אחד של Vera מכיל 128 מעבדים ו-11,264 ליבות. זה מספיק ליותר מ-11,000 סביבות במקביל, בהקצאה של ליבה אחת לכל סביבה. לדברי CoreWeave, זמן העלייה של סביבות ה-sandbox לסוכנים התקצר ביותר מפי 3 על מעבדי Vera, ובמבחן Terminal-Bench היא מדדה שיפור ביצועים של פי 1.7.
הזווית הכלכלית: חומרה שממשיכה להרוויח
המסר המרכזי שאנבידיה בחרה להדגיש נוגע פחות לביצועים ויותר לאורך החיים של החומרה. "מעבדי ה-NVIDIA V100 של CoreWeave עדיין מריצים עומסי עבודה של לקוחות כמעט עשור אחרי השקת Volta, גם כש-CoreWeave מכניסה לייצור את Vera Rubin NVL72", אמר איאן באק, סגן נשיא בתחום hyperscale ומחשוב-על באנבידיה. לדבריו, זו "תשתית שממשיכה להרוויח במשך שנים".
ככל הנראה, המסר הזה מופנה בעיקר למשקיעים ולספקי ענן שחוששים שכל דור חדש של שבבים יהפוך את ההשקעה בדור הקודם ללא רלוונטית. אם מעבדים ישנים אכן ממשיכים לייצר הכנסות, התמונה הכלכלית של הקמת מרכזי נתונים ל-AI נראית סבירה יותר.
גם Forge משתלבת בכיוון הזה. לפי ההודעה, היא נועדה לסגור את המעגל שבו התנהגות המודל בייצור משפיעה על סבב האימון הבא, תהליך שעד היום היה מפוזר בין כלים של ספקים שונים. בין היתר היא מאחדת את Weights & Biases. המשמעות האפשרית היא שספקית הענן מנסה להפוך מספקית של כוח חישוב לפלטפורמה שמלווה את כל מחזור החיים של הסוכן, מהאימון ועד ההפעלה.