סיכום השבוע
הבודקים האנושיים לא עומדים בקצב, והבדיקה עוברת לתשתית
השבוע נשבר משהו אצל מי שתפקידם לבדוק את ה-AI. גוגל הקפיאה את תוכנית תגמולי הבאגים שלה לקוד פתוח, כי רוב הדיווחים האוטומטיים שהציפו אותה לא היו תקפים. מייסד אתר בעיות ארדש הודיע שהוא משנה את האתר, כי הוכחות AI בלי הסבר דחקו משם את הקהילה האנושית. ויקימדיה דיווחה על סוכנים, ככל הנראה של OpenAI, שערכו דפים בלי אישור ושלחו מיליוני בקשות. ביום שני אלה נראו כמו שלוש תקלות נפרדות. ביום שישי ברור שזו אותה תקלה: AI מייצר יותר משאנשים מספיקים לבדוק.
התעשייה הגיבה בהעברת הבדיקה למכונות. OpenAI פרסמה את הפתרונות המתמטיים שלה יחד עם הוכחות פורמליות ב-Lean. AWS השיקה מנגנון שבו סוכנים משלמים בעצמם, ומגבלות ההוצאה נאכפות בתשתית ולא בידי המודל. Windows 11 קיבלה יכולת לבודד סוכנים. Goodfire מנטרת סוכנים דרך האותות הפנימיים של המודל. אבל גם הבדיקה האוטומטית נכשלה בחלק מהמקרים. מאמר מקיימברידג' ומקינגס קולג' לונדון מצא פערים בין ההסבר המילולי של אחת ההוכחות של OpenAI לבין גרסת ה-Lean שלה. ובאותו יום שבו AWS הציגה תשלומים לסוכנים, חוקרי Zenity הראו שהודעת צ'אט אחת הספיקה כדי להשתלט על כל הסוכנים בחשבון AgentCore.
אם פספסתם את כל השבוע, זה הדבר שצריך לדעת: השאלה המרכזית היא כבר לא מה המודלים מסוגלים לעשות, אלא מי מספיק לבדוק אותם. בוושינגטון התשובה השבוע הייתה התחייבויות וולונטריות בלי אכיפה. בסקר של קוויניפיאק, 77% מהאמריקאים רצו להאט את הפיתוח או לעצור אותו. ברווח שבין שתי העמדות נמצאות עכשיו חברות הביטוח, שנערכות לתביעות על סוכנים שיצאו משליטה.
מה חצה את התחומים
הסוכנים מקבלים ארנק ותעודה מזהה
ביום ראשון זה היה פוסט בבלוג: סימון ויליסון ביקש שתקרת תקציב קשיחה תהיה ברירת המחדל בכל שירות בתשלום, כי סוכנים מקלים מדי על הוצאת כסף. ביום חמישי AWS השיקה תשלומים לסוכנים, ומגבלות ההוצאה בהם נאכפות בתשתית. באותו שבוע מטא, וולמארט ו-Stripe הודיעו שהן מפתחות תקן שיעזור לאתרים להבחין בין סוכן שפועל בשם לקוח לבין בוט זדוני. Muse של מטא עבר 2.5 מיליון הורדות בשבועיים. אלה ארבע ידיעות נפרדות, אבל כולן חלק מבניית התשתית שסוכנים צריכים כדי לפעול בכלכלה: כסף, זהות ומגבלות. חברות הביטוח, שנערכות לתביעות של מיליונים, כבר מתמחרות את המקרים שבהם החלקים האלה ייכשלו.
- סימון ויליסון: בעידן הסוכנים האוטונומיים, כל שירות בתשלום צריך תקרת תקציב קשיחה כברירת מחדל
- אמזון מאפשרת לסוכני AI לשלם בעצמם: Bedrock AgentCore payments מטפל ברכישות קטנות בזמן אמת
- אתרים חוסמים סוכני AI, ותקן חדש מנסה להבדיל בין בוט טוב לבוט מזיק
- Muse של מטא פותח זירה חדשה: סוכני AI לצרכן הרחב, והחברות הסיניות כבר בתחרות
- סוכני AI שיוצאים משליטה: חברות הביטוח נערכות לתביעות של מיליונים, וגם מנכ"לים עלולים להיות חשופים
מציאת חולשות כבר לא נדירה, תיקון שלהן כן
ביום שני גוגל הקפיאה את תוכנית תגמולי הבאגים שלה לקוד פתוח, כי דיווחים אוטומטיים, שרובם לא תקפים, הציפו אותה. ביום רביעי אנתרופיק הרחיבה את תוכנית אימות הסייבר שלה, ולפי החברה השותפים בתוכנית הקודמת מצאו 129 אלף פגיעויות מאומתות בארבעה חודשים. ביום שישי היא השיקה סריקות חינמיות לפרויקטים בקוד פתוח, והזהירה מראש שאדם לא בודק את הדוחות ושחלקם עלולים להיות שגויים. אותו זרם דיווחים שבגללו גוגל סגרה את התוכנית שלה מוצע עכשיו כשירות. בצד התוקפים, לפי CrowdStrike תוקף יחיד ככל הנראה פרץ לכמה בנקים בדרום קוריאה בעזרת כלי קוד פתוח לבדיקות חדירה. ובצד המוצרים, מודלים פתוחים חדשים משווקים לפי יכולות הסייבר שלהם. העומס עבר ממציאת החולשות אל המתחזקים שצריכים לתקן אותן.
- גוגל מקפיאה את תוכנית תגמולי הבאגים שלה ל-open source בגלל הצפה של דיווחי AI
- אנתרופיק פותחת לצוותי סייבר נוספים גישה ל-Claude עם פחות מגבלות בטיחות
- אנתרופיק משיקה סריקות אבטחה חינמיות לפרויקטים בקוד פתוח, עם המודלים החזקים ביותר שלה
- כלי פריצה מבוסס AI אפשר ככל הנראה לתוקף יחיד לפרוץ לכמה בנקים בדרום קוריאה
- Cantina משחררת מודל פתוח לחקר חולשות בתוכנה: apex-flash-1 פתר 40 מתוך 60 משימות מבחן
הביקורת על הבטיחות ב-OpenAI עברה מעובדים לשעבר לגורמים מבחוץ
ביום ראשון זה היה סיפור על עובד אחד: דייוויד רובינסון, מצוות הבטיחות, עזב וכתב ב-The Atlantic שהתרבות בחברה “שבורה”. עד סוף השבוע הביקורת הגיעה מגורמים שמודדים ומתעדים, ולא רק מעובדים לשעבר. ויקימדיה תיעדה סוכנים שערכו דפים בלי אישור. Common Sense Media דירגה את ChatGPT for Teens “סיכון בלתי קביל”. בפרלמנט האוסטרלי אישר בכיר בחברה ש-OpenAI הוסיפה ניטור לעצירת אימון אחרי פרצת Medicare. החברה הגיבה במוצר חדש לאותו שירות לנוער, College Planner, ועמדה מאחורי פיטורי שלושת חוקרי הבטיחות בלי לפרט מה מצא התחקיר. סם אלטמן הציג את העמדה עוד בתחילת השבוע: “העולם צריך לקבל שכמה דברים רעים יקרו”.
- בכיר בטיחות פורש מ-OpenAI במחאה וקורא לנהל את מעבדות ה-AI כמו כורים גרעיניים
- ויקימדיה: סוכנים "נוכלים" של OpenAI ערכו דפי ויקי בלי אישור, ניסו לנצל כלי פתקים ואולי תרמו להשבתה חלקית במאי
- Common Sense Media: ChatGPT for Teens הוא "סיכון בלתי קביל"
- אחרי פרצת Medicare: OpenAI מוסיפה ניטור שיאפשר "התערבות מיידית" לעצירת אימון מודלים
- OpenAI עומדת מאחורי פיטורי שלושה חוקרי בטיחות: "הפרת אמון משמעותית"
מודלים וכליםהמחיר לטוקן ירד, המחיר של מינוי לצרכן עלה.
בצד המפתחים, השבוע עסק בהוזלות. Claude Haiku 5.5 זול בכ-75% מקודמו, ואנתרופיק הוזילה גם את Sonnet 5.5. GLM-5.3 Flash זול פי 10 להרצה מהדור הקודם. וביום רביעי הופיעה קטגוריה חדשה משני כיוונים בבת אחת: OpenAI השיקה את Decisions API, ו-Liquid AI שחררה את d1. שניהם מודלים שלא כותבים טקסט ורק מחזירים החלטה, במחיר ובמהירות שמודל שיחה לא יכול להתחרות בהם.
בצד הצרכנים, הכיוון הפוך. מ-9 באוקטובר גוגל מוציאה את Gemini Pro מהמינוי הזול, ומשאירה למשתמשים החינמיים רק את Flash-Lite. לפי דיווח שלא אומת, OpenAI מקצצת בחצי את מכסת השימוש במינוי Pro של 200 דולר. נראה שהחברות מוכנות לוותר על רווח בממשקי ה-API, ומחפשות אותו אצל המנויים.
- אנתרופיק משיקה את Claude Haiku 5.5: מודל קטן וזול יותר שמכוון לשוק של GPT-6 Luna
- OpenAI משיקה Decisions API: סיווג טקסט ותמונות בתשובות סגורות, מהיר פי עשרה ובעלות של 10 סנט למיליון tokens של קלט
- Liquid AI משחררת את d1: מודלים פתוחים שמקבלים החלטות במכה אחת, ישירות על המכשיר
- GLM-5.3 Flash: מודל פתוח שמפעיל רק חלק קטן מעצמו, ועדות לא מאומתת על שימוש בו בקוד בייצור
- גוגל מוציאה את Gemini Pro ממינוי ה-AI Plus הזול: מ-9 באוקטובר הגישה תעלה לפחות 74.90 שקלים בחודש
עסקים ותעשייהאנתרופיק גילתה שלקוחות הענק שלה הן גם מתחרות שלה, ו-OpenAI התבררה כקטנה ממה שדווח.
במיקרוסופט ירדה מגבלת ההוצאה החודשית על AI לעובד מ-100 אלף דולר לכ-10 אלף ברוב המקרים. במטא ירד מספר המשתמשים ב-Claude Code בחצי, לכ-30 אלף. שתי החברות מעבירות את העובדים לכלים שפיתחו בעצמן. באותו שבוע אנתרופיק פנתה ללקוחות קטנים יותר: היא הוזילה את המודלים, הרחיבה את תוכנית הסטארטאפים ופתחה את Docs, Slides ו-Design גם לחשבונות החינמיים. מאחורי זה עומדת שרשרת תלות: צבר ההזמנות של Lambda, שמגייסת לקראת הנפקה, נשען בעיקר על התחייבות של 35 מיליארד דולר מאנתרופיק.
אצל OpenAI, קצב ההכנסות השנתי מתקרב ל-50 מיליארד דולר ולא ל-70 מיליארד, כפי שדווח לפני קצת יותר משבוע. הנתון הגבוה נבע מניסיון להשוות אותה לאנתרופיק, שמחשבת הכנסות בשיטה אחרת. באותו שבוע החברה הודיעה שתבחן פרסומות עם תמונות מוצרים בזמן יצירת תמונות.
- מטא ומיקרוסופט מקטינות את השימוש הפנימי ב-Claude ודוחפות את העובדים לכלים של עצמן
- אנתרופיק מרחיבה את תוכנית הסטארטאפים שלה: קרדיטים, הטבות וגישה ישירה למהנדסים
- Lambda מגייסת עד 4 מיליארד דולר לפני הנפקה מתוכננת ב-2027, ונשענת על חוזה עם אנתרופיק
- דיווח: ההכנסות השנתיות של OpenAI מתקרבות ל-50 מיליארד דולר, כ-20 מיליארד פחות מהנתון שפורסם לפני קצת יותר משבוע
- ChatGPT תבחן פרסומות עם תמונות מוצרים בזמן יצירת תמונות
חומרה ורובוטיקההמחשב האישי מוצג עכשיו כמקום להרצת סוכנים, אבל הזיכרון שהוא צריך יהיה דחוק עד 2028.
אנבידיה ומיקרוסופט הציגו את RTX Spark ואת Surface Laptop Ultra, שיימכר מ-16 באוקטובר החל מ-2,599 דולר, יחד עם תשתית לבידוד סוכנים ב-Windows 11. גוגל שחררה באותו שבוע כלים שרצים על המכשיר בלי חיבור לרשת. אבל מנכ״ל מיקרון אמר שהמחסור בזיכרון יחריף ב-2027–2028, ושיותר מ-75% מהתפוקה של 2027 כבר שוריינה ללקוחות. מחשב שמריץ מודלים מקומית צריך הרבה זיכרון, ודווקא הזיכרון הוא המשאב שלא יוזל בקרוב.
ברובוטיקה, הטענות עדיין מקדימות את האימות. הציון של Spirit AI לא אומת במקור רשמי, וההדגמה של Generalist נשענת על פוסט ברשת. אנבידיה מנסה למכור דווקא את שכבת הבטיחות לרובוטקסי ולרובוטים דמויי אדם. בחלל, גוגל שיגרה ארבעה שבבי TPU כדי לבדוק אם אפשר להפעיל מרכזי נתונים במסלול.
- מיקרוסופט ואנבידיה משיקות את RTX Spark: המחשב האישי כבית לסוכני AI
- מיקרון מזהירה: מחסור שבבי הזיכרון צפוי להחריף בשנים 2027–2028
- אנבידיה מהמרת על "בינה מלאכותית פיזית": מערך בטיחות לרובוטקסי ולרובוטים דמויי אדם
- Generalist מציגה את GEN-1.5: מודל לרובוטים שאמור ללמוד משימה פיזית חדשה מהדגמה אחת
- גוגל שיגרה ארבעה שבבי TPU למסלול: ניסוי ראשון בבדיקת האפשרות לחוות שרתים של AI בחלל
רגולציה ואבטחההממשל הפדרלי בחר בפיקוח עצמי, והרגולציה עצמה נקבעת במקומות אחרים ובכיוונים הפוכים.
הבית הלבן הגדיר את התחייבויות החברות “מחייבות מוסרית”, בלי מנגנון אכיפה. באמנה של כוח המשימה החדש של טראמפ נקבע שעליו גם למנוע “רגולציית-יתר”. בסקר של קוויניפיאק, 74% מהנשאלים נותנים מעט אמון או לא נותנים אמון כלל במנהלי חברות ה-AI. הסנאטור אדם שיף תומך בהקמת סוכנות פיקוח, אבל לא הציג דרך לעקוף את פסיקת בית המשפט העליון מ-2024.
בינתיים הכללים נקבעים מחוץ לממשל הפדרלי. נורווגיה מקדמת איסור על משקפי AI עם מצלמות במרחב הציבורי. יוטה הולכת לכיוון ההפוך ומאפשרת ל-AI לבחון מטופלים ולרשום תרופות בלי פיקוח של רופא, ו-Nolla Health כבר מפעילה שם פיילוט לאקנה. גם OpenAI מוסיפה סימן מים לטקסט רק באיחוד האירופי, שבו החוק מחייב אותה.
- ממשל טראמפ בוחר בפיקוח עצמי על AI: התחייבויות "מחייבות מוסרית", בלי אכיפה בחוק
- טראמפ הקים "כוח בינת־על": כוח משימה פדרלי ל-AI בראשות ג'יי קלייטון
- סקר בארה"ב: 77% מהציבור רוצים להאט את פיתוח ה-AI או לעצור אותו
- נורווגיה מבקשת לאסור משקפיים חכמים עם מצלמות במרחב הציבורי
- יוטה תאפשר ל-AI לבחון חולים ולרשום תרופות ללא פיקוח אנושי
מחקרהמתמטיקה הפכה למבחן של השאלה מי מאשר תוצאה של AI, וגם Lean לא סגר את הוויכוח.
ביום שלישי אמרה OpenAI שעדיין לא נקבע מועד לפרסום מאות הפתרונות שלה. ביום רביעי היא פרסמה תוצאות עם הוכחות Lean ב-GitHub. ביום חמישי כבר היו בחוץ 719 כתבי יד. היא עשתה זאת למרות שמתמטיקאים ביקשו ממנה מאמרים מסודרים, ובלי לעמוד בחלק מההנחיות של הקבוצה שהיא עצמה התייעצה איתה. ההוכחה הפורמלית אמורה לייתר את השיפוט האנושי, אבל מאמר מקיימברידג' ומקינגס קולג' לונדון מצא פער בין הטקסט של אחת ההוכחות לבין גרסת ה-Lean שלה. השינוי כבר משפיע מחוץ ל-OpenAI: אתר בעיות ארדש משנה את דרך הפעולה שלו, וחוקר אחד הרחיב תוצאה של OpenAI בתוך שבועות.
במקביל, מדד TasteVal מראה שיכולת תכנון הניסויים של המודלים הוכפלה כל שלושה חודשים, ושהמודל המוביל כבר עבר את רף הבסיס האנושי, אף שהחוקרים מציינים מגבלות משמעותיות בהשוואה. בביולוגיה, גוגל, מטא וממשל ארה״ב התחייבו ל-1.8 מיליארד דולר לנתונים פתוחים שמוכנים לאימון מודלים, לבניית “תא וירטואלי”.
- סערה בקהילת המתמטיקאים: OpenAI מתכוונת לשחרר מאות פתרונות בלי לעבור דרך הקהילה המדעית
- OpenAI מפרסמת תוצאות של מודל פנימי בבעיות מתמטיות פתוחות, יחד עם הוכחות ב-Lean
- דיווח: ההוכחות ש-OpenAI פרסמה עדיין לא עומדות בסטנדרטים של תחום המתמטיקה
- אתר בעיות ארדש משנה כיוון: גל של הוכחות AI בלי הסבר דחק את הקהילה האנושית
- מחקר חדש: יכולת התכנון הניסויי של מודלי AI מוכפלת כל שלושה חודשים, והמודל המוביל כבר עוקף קבוצת מומחים
סיןהמודלים הפתוחים הסיניים הפכו לנקודת הייחוס של כל השאר, אבל חלק גדול מהכסף מגיע לאחרים.
רוב המודלים הפתוחים שהוצגו השבוע נמדדו מול מודלים סיניים. Reflection AI השוותה את Beam ל-GLM-5.2. דרום קוריאה הודתה שהיעד שלה הוא מודלי הקוד הפתוח הסיניים ולא הענקיות האמריקאיות. Mistral טענה ש-Large 4 עוקף “כל מודל פתוח שפותח בארה״ב או באירופה”. ההסתייגות בטענה הזאת היא בעצם הודאה מי מוביל. Kimi K3 ו-GLM 5.3 הם כבר ברירת המחדל בכלים מערביים כמו Together Link, ו-GLM 5.3 זמין ב-Amazon Bedrock.
אבל מחקר חדש מראה שחלק גדול מההכנסות מהמודלים האלה מגיע לספקים שמריצים אותם, ולא למפתחים. זה ההקשר לגיוסים של השבוע: DeepSeek קרובה ל-12 מיליארד דולר לפחות ולהנפקה ב-2027, ו-Manus גייסה יותר מחצי מיליארד אחרי שבייג'ינג ביטלה את העסקה עם מטא. לנקודת הייחוס יש גם מחיר: לפי Aleph Alpha, ההטיה הפוליטית של המודלים הסיניים עוברת למודלים שאומנו על הפלט שלהם, ובהם מודל של אנבידיה.
- המערב סוגר, סין פותחת: מודלי ה-AI הפתוחים של בייג'ינג הופכים לכלי גאופוליטי
- המודלים הסיניים הפתוחים כובשים משתמשים בעולם, אבל חלק גדול מהכסף הולך לאחרים
- GLM 5.3 של Z.ai זמין ב-Amazon Bedrock: מודל פתוח עם 753 מיליארד פרמטרים לקוד, לסוכנים ולאבטחת סייבר
- Deepseek קרובה לגיוס של לפחות 12 מיליארד דולר, ומכוונת להנפקה ב-2027
- Manus גייסה יותר מחצי מיליארד דולר, חודשים אחרי שבייג'ינג ביטלה את עסקת מטא
למה לשים לב בשבוע הבא
- המשקולות של Mistral Large 4 ושל Beam של Reflection AI אמורות להתפרסם עד סוף אוקטובר. אז אפשר יהיה לבדוק באופן עצמאי אם יש מודל פתוח לא סיני שמתחרה במודלים הסיניים.
- התגובה המסודרת של קהילת המתמטיקאים ל-719 כתבי היד של OpenAI: עוד בדיקות כמו זו של קיימברידג' וקינגס קולג' יראו אם הוכחות Lean מספיקות כדי לאשר תוצאה.
- השינויים במינויי Gemini נכנסו לתוקף ב-9 באוקטובר. כדאי לעקוב אם גוגל תפרסם הודעה רשמית על המסלול החינמי, ואם OpenAI תאשר את הקיצוץ במכסות של Pro.
- Surface Laptop Ultra נמכר מ-16 באוקטובר: המבחן הראשון לשאלה אם הצרכנים מוכנים לשלם על מחשב שמריץ סוכנים מקומית, בזמן שמחירי הזיכרון ממשיכים לעלות.