יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה

בנושא

מודלי שפה

גוגל משיקה את Gemini 4 עם תוצאות מרשימות במבחני ביצועים, אבל בתוך החברה יש ספקנות לגבי יכולות התכנות שלו

גוגל החלה להפיץ את Gemini 4 Argon, מודל הדגל החדש שלה, ומציגה תוצאות מובילות בכמה מבחני ביצועים. לפי Bloomberg, בתוך החברה יש ספקנות לגבי הביצועים של המודל בתחומים מרכזיים, ובראשם תכנות.

OpenAI השיקה את GPT-6.1 Sol: ביצועים קרובים ל-Astra בחמישית ממחיר הטוקנים

OpenAI השיקה ב-29 בספטמבר את GPT-6.1 Sol, גרסה משודרגת של GPT-6 Sol. לפי הדיווח, הביצועים שלו בכתיבת קוד אוטונומית, בהפעלת מחשב ובעבודה מקצועית מתקרבים לאלה של Astra, ומחיר הטוקנים שלו הוא חמישית ממחירי Astra. המודל זמין כבר עכשיו דרך ה-API של החברה, ב-ChatGPT Work וב-Codex.

גוגל הכריזה על Gemini 4 Argon, מודל הדגל החדש שלה, אבל בינתיים הוא לא פתוח לציבור

גוגל הכריזה על Gemini 4 Argon, מודל הדגל החדש שלה. לפי החברה הוא מוביל במשימות תוכנה ארוכות, בעבודה משפטית ופיננסית ובהגנת סייבר. בשלב הראשון המודל נפתח רק לקבוצת מגיני סייבר נבחרים, ומחירו לכשיושק יעמוד על 2 דולר למיליון טוקנים בקלט ו-10 דולר למיליון טוקנים בפלט.

OpenAI: שיבשנו קמפיין מתואם לחילוץ החשיבה המוגנת של המודלים שלנו

OpenAI מודיעה ששיבשה קמפיין מתואם שניסה לחלץ מהמודלים שלה את תהליך החשיבה המוגן שלהם, בשיטה שנקראת distillation. החברה מוסיפה שהיא מחזקת את ההגנות מפני ניסיונות כאלה. זו תזכורת לכך שתפוקות של מודל הן נכס שמתחרים עשויים לנסות לנצל.

Claude Sonnet 5.5 הושק: קרוב ל-Opus בביצועים ובעלות נמוכה יותר, וטענה לא מאומתת על הוכחה מתמטית שכתבו סוכנים

אנתרופיק השיקה את Claude Sonnet 5.5. לפי הנתונים שפורסמו, הוא מהיר ביותר מ-30% מ-Sonnet 5, מוזיל את העלות למשימה בעד 30% ומתקרב ל-Opus 5.5 במבחני עבודת ידע. במקביל מתפרסמת ברשת טענה, שעדיין לא אומתה, שעשרה סוכנים מבוססי המודל עבדו 15 שעות ברציפות והפיקו הוכחה מתמטית של 17,895 שורות.

OpenAI משיקה את GPT-6.1 Sol: לדבריה, כמעט ביצועי Astra בחמישית מהמחיר

בכנס DevDay הציגה OpenAI את GPT-6.1 Sol. לדברי החברה, המודל כמעט משתווה ל-GPT-6 Astra במשימות קוד, שימוש במחשב ועבודה מקצועית, ומחירו חמישית ממחיר הטוקנים הרגיל. את GPT-6.1 Astra, שהשקתו הייתה צפויה, החברה לא השיקה. לפי ה-Wall Street Journal, ההשקה בוטלה בגלל חששות בטיחות שעלו בבדיקות פנימיות.

מפתח אחד, שבוע ומודל מקומי: משחק מלחמה מ-1989 הוסב לדפדפן, ומה זה אומר על כלכלת המשחקים

מפתח שמעביר משחקי רטרו לדפדפן מתאר איך מודל שפה שרץ על תחנת עבודה אישית ביצע הנדסה הפוכה למשחק War of the Lance מ-1989 בתוך כשבוע, עם פחות מארבע שעות של תשומת לב אנושית. לדבריו, העלות והזמן של פיתוח משחקים ושל יצירת נכסי תלת-ממד יורדים מהר, וכך כמעט כל משחק ישן הופך לפתוח ל-modding.

Sonnet 5.5 אמור להוזיל משימות, אבל מדידה עצמאית מצאה שבמאמץ מקסימלי הוא יקר יותר

אנתרופיק השיקה את Claude Sonnet 5.5 באותו מחיר לטוקן כמו קודמו, וטוענת שהמודל החדש מבצע משימות בעלות נמוכה בעד 30%. לפי מדידה עצמאית של Artificial Analysis, ברמת המאמץ המקסימלית משימה עולה יותר מאשר ב-Sonnet 5 ואפילו יותר מאשר ב-Opus 5.5. משתמשים כבר בודקים אם מודלים מתחרים, כולל מודלים פתוחים, נותנים יותר תמורה לדולר.

אנתרופיק משיקה את Claude Sonnet 5.5: מתקרב ל-Opus בחלק מהמבחנים, מהיר ביותר מ-30% וזול יותר לכל משימה

אנתרופיק השיקה את Claude Sonnet 5.5, מודל הביניים החדש שלה. לפי החברה הוא מייצר פלט מהר יותר ביותר מ-30% לעומת Sonnet 5, עולה עד 30% פחות לכל משימה, ובחלק מהמבחנים מגיע כמעט לתוצאות של Opus 5.5, המודל החזק ביותר במשפחת Claude 5.5. מחיר הטוקנים לא השתנה, אבל המודל צורך פחות טוקנים כדי להשלים את אותה עבודה.

סטיבן פינקר נגד תרחישי יום הדין: "הנדסת בטיחות מפוכחת, לא רטוריקה של סוף העולם"

הפסיכולוג מהרווארד סטיבן פינקר טוען במכתב פתוח שהחשש שבינה מלאכותית תשמיד את האנושות מוגזם. במקום זאת הוא מציע להתמקד בסכנות מוחשיות כמו טרור ביולוגי, מתקפות סייבר וסוכני AI שפועלים בלי פיקוח, ולטפל בהן בעזרת הנדסת בטיחות, פיקוח עצמאי, אחריות משפטית ושליטה אנושית. פינקר גם מודה שהעריך בחסר את היכולות של מודלי השפה.

Z.ai ו-Concordia AI מציעות מסגרת בת שישה שלבים לניהול סיכונים במודלי open-weight

חברת ה-AI הסינית Z.ai וחברת הייעוץ לבטיחות Concordia AI מבייג'ינג פרסמו דוח על ניהול סיכונים במודלי open-weight, ובו תהליך בן שישה שלבים. לדבריהן, זהו הבסיס המקיף והמבוסס-ראיות הראשון לאיזון בין הסיכונים והתועלות של מודלים שכל אחד יכול להוריד ולשנות. הדוח מתפרסם כשחברות סיניות מובילות את תחום המודלים הפתוחים, ולכן הן גם אלה שצריכות להתמודד ראשונות עם שאלת הבטיחות.

NaiveAI משחררת את Naive-N0.5-Flash: מודל קוד פתוח עם 309 מיליארד פרמטרים והקשר של מיליון טוקנים

חברת NaiveAI פרסמה את Naive-N0.5-Flash, מודל MoE עם 309 מיליארד פרמטרים, מתוכם 15.5 מיליארד פעילים. המודל נבנה לפיתוח קוד ולמחקר AI, תומך בהקשר של מיליון טוקנים בלי שכבות full attention, והמשקולות שלו משוחררות ברישיון MIT. לדברי החברה, מודלי AI שלה היו שותפים לתכנון הארכיטקטורה של המודל עצמו.

OpenAI: בין 80% ל-90% מהמחקר שלנו מכוונים כבר ל-GPT-7 ולדורות שאחריו

בוריס פאואר, ראש המחקר היישומי של OpenAI, אומר ש-80 עד 90 אחוז מהמחקר בחברה מכוונים ל-GPT-7, ל-GPT-8 ולדורות שאחריהם, כי לדבריו שם נמצא "רוב הערך". לדבריו, הבעיה המרכזית של עוזרי ה-AI כיום היא לא איכות המודלים, אלא העובדה שרוב המשתמשים לא יודעים מה אפשר לעשות איתם.

Claude Fable 5.1 יצא לדרך: טענות על חישוב בפיזיקה שחוקרים עבדו עליו שנים, ומה אומרים המקורות בפועל

אנתרופיק השיקה ב-1 בספטמבר את Claude Fable 5.1, שלדבריה איתר אצל קרן ההשקעות Millennium את הגורם לקריסה נדירה שמהנדסים לא הצליחו להסביר במשך כמה שנים. ברשת מופצת גם טענה שהמודל השלים חישוב של תשע לולאות (nine-loop) בפיזיקת חלקיקים, שמומחים עבדו לקראתו שנים. הטענה הזו עדיין לא אומתה במקור מקושר.

Gemini 4 בשלבי האימון האחרונים: גוגל מבטיחה השקה "הרבה לפני" סוף השנה

קוראי קבוקצ'ולו, שמונה לאחרונה לראש Google DeepMind, אומר ש-Gemini 4 נמצא בשלבי האימון האחרונים ושגוגל מתכוונת להשיק אותו "הרבה לפני" סוף השנה. נראה שהחברה ויתרה על Gemini 3.5 Pro, שהוכרז במאי ועדיין לא הושק. תאריך השקה מדויק לא נמסר.

יאנדקס פרסמה את המשקלים של Alice AI Foundation: מודל MoE של 80 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל צעד

ענקית הטכנולוגיה הרוסית יאנדקס פרסמה ב-Hugging Face, תחת רישיון Apache 2.0, את המשקלים של מודל בסיס ניסיוני בגודל 80 מיליארד פרמטרים. המודל אומן מאפס על כ-18 טריליון טוקנים. זה עדיין לא צ'טבוט מוכן: יאנדקס מגדירה אותו כשדה ניסוי לדור הבא של העוזרת Alice AI ולסוכני AI עתידיים.

דיווחים: גוגל מתקרבת לגרסת תצוגה מקדימה של Gemini 4 Pro, והשקה ציבורית צפויה באוקטובר

לפי הדלפות, גוגל הפיקה checkpoint פנימי ראשון של Gemini 4 Pro, המודל הבא בסדרת הדגל שלה. ההערכות מדברות על השקה ציבורית באוקטובר, ועל מודלים קלים יותר שיגיעו עוד קודם. גוגל עצמה עדיין לא אישרה דבר.

אנתרופיק ו-OpenAI כבר לא מתחרות רק על ביצועים: מירוץ המחירים בשוק מודלי הדגל

אנתרופיק השיקה את Opus 5.5 ו-OpenAI השיקה את GPT-6 Sol ו-Luna, ובשני המקרים ההבטחה המרכזית היא מחיר נמוך יותר, לא קפיצה ביכולות. ככל הנראה המשמעות היא שהלקוחות העסקיים מתחילים לבחור מודל לפי הערך הכלכלי שהוא נותן, ולא רק לפי הביצועים שלו.

GPT-6 Sol ו-Luna של OpenAI זמינים כעת ב-Amazon Bedrock

שני מודלים חדשים ממשפחת GPT-6 של OpenAI, בשם Sol ו-Luna, זמינים כעת באופן כללי בפלטפורמת Amazon Bedrock. Sol מיועד למשימות קידוד ותכנון מורכבות ותדירות, ו-Luna למשימות ממוקדות בהיקף גבוה כמו סיווג וחילוץ מידע ממסמכים — שני המודלים מתומחרים נמוך משמעותית מהדור הקודם.

אנתרופיק משיקה את Opus 5.5: מודל הדגל החדש עושה יותר בפחות טוקנים ובעלות נמוכה יותר

אנתרופיק השיקה את Claude Opus 5.5, הראשון במשפחת המודלים 5.5, וזמין כעת ב-Amazon Bedrock. לפי החברה, המודל מבצע משימות עם פחות טוקנים ובמחיר טוקן נמוך יותר, כך שהעלות הממוצעת למשימה קטנה בהשוואה ל-Opus 5 הקודם. השינוי הבולט הנוסף: סיווגי בטיחות מחמירים יותר, בדומה לאלה שהוטמעו ב-Fable 5.1.

Alibaba: דיווחים על השקת מודל הדגל Qwen 4 בכנס Apsara, על רקע איחוד אסטרטגיית ה-AI הצרכנית

דיווחים שהופצו ברשתות החברתיות מצביעים על כך שאליבאבא הכריזה על Qwen 4, הדור הבא במשפחת מודלי השפה שלה, בכנס Apsara השנתי. ההכרזה הנטענת מגיעה בסמוך להשקה הרשמית של גרסה מחודשת לאפליקציית Qwen, כחלק ממהלך רחב יותר של החברה לאחד את מוצרי ה-AI הצרכניים שלה תחת מותג אחד ולהתחרות ב-ChatGPT, על רקע מרוץ טכנולוגי מואץ בין חברות סיניות ואמריקאיות.

סוכן קוד פתוח מנסה לשפר שיא בבעיה מתמטית פתוחה — בשידור כמעט חי

פרויקט קוד פתוח בשם Artificium מריץ סוכן AI אוטונומי, מבוסס על מודל Qwen בן 27 מיליארד פרמטרים, בניסיון לשפר שיא קיים בבעיית כיסוי קומבינטורית פתוחה הידועה כ-C(25,15,5). כל התהליך - הזיכרונות, הקוד והפעולות של הסוכן - מתפרסם בציבור, כך שניתן לעקוב ולבדוק את התוצאות באופן עצמאי; נכון לרגע זה טרם פורסם פתרון משופר.

TypeSafe AI משיקה את Jev: מודל שמחזיר מספרים במקום מילים

חברת TypeSafe AI הציגה את Jev, מודל שפה שבמקום טקסט מחזיר ערכים מספריים וציוני ביטחון לשאלות סגורות - החברה מכנה זאת קטגוריה חדשה של "מודלי החלטות". הבלוגר סיימון וילסון, שפרסם ניתוח מפורט על המודל, מציין את המחיר הנמוך והמהירות שלו, לצד חשש ממשי מ"קופסה שחורה" שמקשה להבין למה התקבלה החלטה מסוימת.

Grok 4.6 של xAI זמין כעת ב-Amazon Bedrock עם חלון קונטקסט של 500 אלף טוקנים

מודל Grok 4.6 של xAI זמין כעת בפלטפורמת Amazon Bedrock עם חלון קונטקסט של 500 אלף טוקנים וארבע רמות מאמץ חישובי. זהו המודל השני של xAI ב-Bedrock, וההשקה מרחיבה את נקודות הגישה למודל ואת הפרוטוקולים הנתמכים.

Grok 4.7 של xAI: מחיר נמוך, ביצועים בינוניים מול Claude ו-GPT

xAI השיקה את Grok 4.7, הדגם המתקדם ביותר שלה עד כה לכתיבת קוד ולמשימות ידע, במחיר נמוך משמעותית ממתחרים מערביים. אלא שמבחני ביצועים עצמאיים מציבים אותו הרחק מאחורי Claude Fable 5.1 ו-GPT-6, בעיקר במשימות קוד אוטונומיות.

StepFun משיקה את Step 5: מודל MoE ענק עם חלון הקשר של מיליון טוקנים

חברת StepFun השיקה את Step 5 Preview, מודל שפה בארכיטקטורת MoE עם 600 מיליארד פרמטרים בסך הכול ו-27 מיליארד פעילים בכל טוקן, לצד חלון הקשר של מיליון טוקנים ותמיכה בקלט טקסט, תמונה ווידאו. המודל ממוקד במשימות אגנטיות ארוכות טווח בפיתוח תוכנה, עבודת ידע מקצועית ופיננסים, זמין כעת דרך API, ובאוקטובר צפוי לצאת גם כמשקלים פתוחים.

טנסנט חושפת Gander: מודל AI שממשיך לדבר גם כשהוא עסוק במשימה ברקע

חטיבת Hunyuan Speech של טנסנט הציגה את Gander, מודל מחקרי שמנהל שיחה קולית בזמן אמת במקביל לביצוע משימות מורכבות ברקע, באמצעות פיצול בין רכיב "צרבלום" לניהול השיחה לרכיב "מוח" להסקה. בבדיקות מול מתחרים מסחריים המודל הצטיין בתזמון השיחה אך פיגר בדיוק ביצוע המשימות.

מחקר של מיקרוסופט: סימולציית סטודנטים משפרת מדריכי AI

חוקרים ממיקרוסופט ומאוניברסיטת אילינוי פיתחו מערכת בשם StudentSim, שבונה שכפולים דיגיטליים של סטודנטים בודדים כדי לספק למודלי הוראה מבוססי AI משוב מהיר וזול במקום להסתמך על תלמידים אמיתיים. במבחנים על 60 תלמידים בשלושה תחומים, המערכת עלתה על ביצועי מודל השפה הגדול GPT-5.4 בחיזוי טעויות אופייניות ותגובה להנחיה.

מודל חדש מסין: Stepfun הציגה את Step 5 Preview עם ביצועים ותמחור תחרותיים

חברת הבינה המלאכותית הסינית Stepfun הציגה את Step 5 Preview, מודל שפה חדש שדורג בספטמבר 2026 באתר ההשוואות Artificial Analysis. המודל מדורג מעל החציון במדד האינטליגנציה של האתר ומתומחר נמוך משמעותית מהחציון בקטגוריית מחיר הפלט, מה שממקם אותו כאלטרנטיבה משתלמת בתחרות הגוברת מול מעבדות אמריקאיות ומודלים סיניים אחרים.

אנתרופיק מכניסה את אקסנצ'ור לתפקיד מבקר חיצוני של המודלים שלה

אנתרופיק הודיעה כי צוותים מחברת הייעוץ אקסנצ'ור יתחילו לעבוד בתוך החברה כדי לבחון את המודלים והצוותים שלה, במסגרת מיזם משותף שבו שתי החברות מתכננות להשקיע יחד לפחות מיליארד דולר בחמש השנים הקרובות. הבחירה באקסנצ'ור הפתיעה משקיפים בתעשייה ואף הזניקה את מניית החברה ב-8% במסחר המאוחר.