OrcaRouter משיקה את OrcaCyber Zero 1.5: מודל ייעודי לאבטחת סייבר עם חלון הקשר של מיליון טוקנים
OrcaRouter הכריזה על OrcaCyber Zero 1.5, מודל שפה ייעודי לאבטחת סייבר עם חלון הקשר של מיליון טוקנים. הגישה למודל מוגבלת לגורמים מאושרים. לפי החברה, המודל השיג 100% במבחן Cybench ו-95.8% בתת-קבוצה של CVE-Bench, והוא מתומחר ב-3 דולר ו-7.50 דולר למיליון טוקנים.
חברת OrcaRouter השיקה את OrcaCyber Zero 1.5, מודל שפה שפותח במיוחד לעבודה בתחום אבטחת הסייבר. לפי הדיווח ב-MarkTechPost, יש למודל חלון הקשר (context window) של מיליון טוקנים. זו כמות הטקסט שהמודל יכול לקרוא ולעבד בבקשה אחת. החברה מדווחת על ציון של 100% במבחן Cybench ועל 95.8% בתת-קבוצה של מבחן CVE-Bench.
מודל בגישה מוגבלת
לפי הדיווח, זהו מודל gated, כלומר הגישה אליו מוגבלת ואינה פתוחה לכל מי שנרשם. בתחום הסייבר זו בחירה מובנת. היכולות שעוזרות לצוות הגנה לאתר חולשה בקוד יכולות לעזור גם לתוקף לנצל אותה. לכן מפתחים של מודלים כאלה נוטים להגביל את הגישה ולבדוק מי המשתמשים.
התמחור, לעומת זאת, פורסם בגלוי: 3.00 דולר ו-7.50 דולר לכל מיליון טוקנים. המקור לא מפרט את החלוקה, אבל לפי המקובל בענף, ככל הנראה המחיר הנמוך הוא לטוקני קלט (הטקסט שנשלח למודל) והגבוה לטוקני פלט (הטקסט שהמודל מחזיר).
מה המבחנים בודקים
Cybench הוא מבחן ביצועים (benchmark) שבנוי ממשימות בסגנון CTF (Capture the Flag). אלה תרגילי פריצה שמקובלים בתחרויות אבטחה, והמודל צריך לפתור אותם צעד אחר צעד. CVE-Bench בודק אם מערכות AI מסוגלות לנצל חולשות אמיתיות שתועדו במאגר ה-CVE, הרשימה הציבורית של פרצות אבטחה ידועות.
כדאי לשים לב לניסוח של החברה עצמה: הציון ב-CVE-Bench חושב על "תת-קבוצה שניתן להעריך" (evaluable subset) ולא על המבחן כולו. המקור לא מפרט אילו משימות הוצאו מהחישוב ומדוע, ולכן קשה להשוות את המספר הזה ישירות לתוצאות של מודלים אחרים. כמו כן, אלה תוצאות שהחברה דיווחה עליהן בעצמה, והמקור אינו מציין אם הן אומתו באופן בלתי תלוי.
למה חלון הקשר חשוב כאן
לצוותי אבטחה, חלון הקשר של מיליון טוקנים הוא ככל הנראה הנתון המעשי ביותר בהודעה. ביקורת קוד (code review) לצורכי אבטחה מחייבת לעיתים קרובות להבין איך רכיבים שונים במערכת מדברים זה עם זה. חולשה יכולה להסתתר בדרך שבה פונקציה בקובץ אחד מטפלת בקלט שמגיע מקובץ אחר. כשהמודל יכול לקרוא בבת אחת חלקים גדולים ממאגר קוד, יחד עם תיעוד, לוגים או דוחות סריקה, אולי יהיה פחות צורך לפרק את החומר לחתיכות קטנות. פירוק כזה עלול להסתיר את הקשרים בין החלקים.
המשמעות
ההשקה מצטרפת למגמה רחבה של מודלים ייעודיים לתחום אחד, במקום מודל כללי שעושה הכול. אם הציונים המדווחים יחזיקו גם בבדיקות חיצוניות, צוותי SOC, חוקרי חולשות וצוותי red team יקבלו כלי נוסף לבחון. השילוב בין הקשר ארוך למחיר שפורסם מראש מקל על הערכת העלות לפני שמתחילים להשתמש בו. ובכל זאת, הגישה המוגבלת והציון החלקי ב-CVE-Bench הם סיבה לבחון את המודל בזהירות ובסביבת הבדיקות של הארגון, לפני שסומכים על המספרים שבהודעה.