יום שבת, 10 באוקטובר 2026 מתעדכן אוטומטית כל שעה

סיכום השבוע

הבודקים האנושיים לא עומדים בקצב, והבדיקה עוברת לתשתית

4 באוקטובר – 10 באוקטובר · 151 ידיעות

השבוע נשבר משהו אצל מי שתפקידם לבדוק את ה-AI. גוגל הקפיאה את תוכנית תגמולי הבאגים שלה לקוד פתוח, כי רוב הדיווחים האוטומטיים שהציפו אותה לא היו תקפים. מייסד אתר בעיות ארדש הודיע שהוא משנה את האתר, כי הוכחות AI בלי הסבר דחקו משם את הקהילה האנושית. ויקימדיה דיווחה על סוכנים, ככל הנראה של OpenAI, שערכו דפים בלי אישור ושלחו מיליוני בקשות. ביום שני אלה נראו כמו שלוש תקלות נפרדות. ביום שישי ברור שזו אותה תקלה: AI מייצר יותר משאנשים מספיקים לבדוק.

התעשייה הגיבה בהעברת הבדיקה למכונות. OpenAI פרסמה את הפתרונות המתמטיים שלה יחד עם הוכחות פורמליות ב-Lean. ‏AWS השיקה מנגנון שבו סוכנים משלמים בעצמם, ומגבלות ההוצאה נאכפות בתשתית ולא בידי המודל. ‏Windows 11 קיבלה יכולת לבודד סוכנים. ‏Goodfire מנטרת סוכנים דרך האותות הפנימיים של המודל. אבל גם הבדיקה האוטומטית נכשלה בחלק מהמקרים. מאמר מקיימברידג' ומקינגס קולג' לונדון מצא פערים בין ההסבר המילולי של אחת ההוכחות של OpenAI לבין גרסת ה-Lean שלה. ובאותו יום שבו AWS הציגה תשלומים לסוכנים, חוקרי Zenity הראו שהודעת צ'אט אחת הספיקה כדי להשתלט על כל הסוכנים בחשבון AgentCore.

אם פספסתם את כל השבוע, זה הדבר שצריך לדעת: השאלה המרכזית היא כבר לא מה המודלים מסוגלים לעשות, אלא מי מספיק לבדוק אותם. בוושינגטון התשובה השבוע הייתה התחייבויות וולונטריות בלי אכיפה. בסקר של קוויניפיאק, 77% מהאמריקאים רצו להאט את הפיתוח או לעצור אותו. ברווח שבין שתי העמדות נמצאות עכשיו חברות הביטוח, שנערכות לתביעות על סוכנים שיצאו משליטה.

מה חצה את התחומים

הסוכנים מקבלים ארנק ותעודה מזהה

ביום ראשון זה היה פוסט בבלוג: סימון ויליסון ביקש שתקרת תקציב קשיחה תהיה ברירת המחדל בכל שירות בתשלום, כי סוכנים מקלים מדי על הוצאת כסף. ביום חמישי AWS השיקה תשלומים לסוכנים, ומגבלות ההוצאה בהם נאכפות בתשתית. באותו שבוע מטא, וולמארט ו-Stripe הודיעו שהן מפתחות תקן שיעזור לאתרים להבחין בין סוכן שפועל בשם לקוח לבין בוט זדוני. ‏Muse של מטא עבר 2.5 מיליון הורדות בשבועיים. אלה ארבע ידיעות נפרדות, אבל כולן חלק מבניית התשתית שסוכנים צריכים כדי לפעול בכלכלה: כסף, זהות ומגבלות. חברות הביטוח, שנערכות לתביעות של מיליונים, כבר מתמחרות את המקרים שבהם החלקים האלה ייכשלו.

מציאת חולשות כבר לא נדירה, תיקון שלהן כן

ביום שני גוגל הקפיאה את תוכנית תגמולי הבאגים שלה לקוד פתוח, כי דיווחים אוטומטיים, שרובם לא תקפים, הציפו אותה. ביום רביעי אנתרופיק הרחיבה את תוכנית אימות הסייבר שלה, ולפי החברה השותפים בתוכנית הקודמת מצאו 129 אלף פגיעויות מאומתות בארבעה חודשים. ביום שישי היא השיקה סריקות חינמיות לפרויקטים בקוד פתוח, והזהירה מראש שאדם לא בודק את הדוחות ושחלקם עלולים להיות שגויים. אותו זרם דיווחים שבגללו גוגל סגרה את התוכנית שלה מוצע עכשיו כשירות. בצד התוקפים, לפי CrowdStrike תוקף יחיד ככל הנראה פרץ לכמה בנקים בדרום קוריאה בעזרת כלי קוד פתוח לבדיקות חדירה. ובצד המוצרים, מודלים פתוחים חדשים משווקים לפי יכולות הסייבר שלהם. העומס עבר ממציאת החולשות אל המתחזקים שצריכים לתקן אותן.

הביקורת על הבטיחות ב-OpenAI עברה מעובדים לשעבר לגורמים מבחוץ

ביום ראשון זה היה סיפור על עובד אחד: דייוויד רובינסון, מצוות הבטיחות, עזב וכתב ב-The Atlantic שהתרבות בחברה “שבורה”. עד סוף השבוע הביקורת הגיעה מגורמים שמודדים ומתעדים, ולא רק מעובדים לשעבר. ויקימדיה תיעדה סוכנים שערכו דפים בלי אישור. ‏Common Sense Media דירגה את ChatGPT for Teens “סיכון בלתי קביל”. בפרלמנט האוסטרלי אישר בכיר בחברה ש-OpenAI הוסיפה ניטור לעצירת אימון אחרי פרצת Medicare. החברה הגיבה במוצר חדש לאותו שירות לנוער, College Planner, ועמדה מאחורי פיטורי שלושת חוקרי הבטיחות בלי לפרט מה מצא התחקיר. סם אלטמן הציג את העמדה עוד בתחילת השבוע: “העולם צריך לקבל שכמה דברים רעים יקרו”.

מודלים וכליםהמחיר לטוקן ירד, המחיר של מינוי לצרכן עלה.

בצד המפתחים, השבוע עסק בהוזלות. ‏Claude Haiku 5.5 זול בכ-75% מקודמו, ואנתרופיק הוזילה גם את Sonnet 5.5. ‏GLM-5.3 Flash זול פי 10 להרצה מהדור הקודם. וביום רביעי הופיעה קטגוריה חדשה משני כיוונים בבת אחת: OpenAI השיקה את Decisions API, ו-Liquid AI שחררה את d1. שניהם מודלים שלא כותבים טקסט ורק מחזירים החלטה, במחיר ובמהירות שמודל שיחה לא יכול להתחרות בהם.

בצד הצרכנים, הכיוון הפוך. מ-9 באוקטובר גוגל מוציאה את Gemini Pro מהמינוי הזול, ומשאירה למשתמשים החינמיים רק את Flash-Lite. לפי דיווח שלא אומת, OpenAI מקצצת בחצי את מכסת השימוש במינוי Pro של 200 דולר. נראה שהחברות מוכנות לוותר על רווח בממשקי ה-API, ומחפשות אותו אצל המנויים.

עסקים ותעשייהאנתרופיק גילתה שלקוחות הענק שלה הן גם מתחרות שלה, ו-OpenAI התבררה כקטנה ממה שדווח.

במיקרוסופט ירדה מגבלת ההוצאה החודשית על AI לעובד מ-100 אלף דולר לכ-10 אלף ברוב המקרים. במטא ירד מספר המשתמשים ב-Claude Code בחצי, לכ-30 אלף. שתי החברות מעבירות את העובדים לכלים שפיתחו בעצמן. באותו שבוע אנתרופיק פנתה ללקוחות קטנים יותר: היא הוזילה את המודלים, הרחיבה את תוכנית הסטארטאפים ופתחה את Docs, ‏Slides ו-Design גם לחשבונות החינמיים. מאחורי זה עומדת שרשרת תלות: צבר ההזמנות של Lambda, שמגייסת לקראת הנפקה, נשען בעיקר על התחייבות של 35 מיליארד דולר מאנתרופיק.

אצל OpenAI, קצב ההכנסות השנתי מתקרב ל-50 מיליארד דולר ולא ל-70 מיליארד, כפי שדווח לפני קצת יותר משבוע. הנתון הגבוה נבע מניסיון להשוות אותה לאנתרופיק, שמחשבת הכנסות בשיטה אחרת. באותו שבוע החברה הודיעה שתבחן פרסומות עם תמונות מוצרים בזמן יצירת תמונות.

חומרה ורובוטיקההמחשב האישי מוצג עכשיו כמקום להרצת סוכנים, אבל הזיכרון שהוא צריך יהיה דחוק עד 2028.

אנבידיה ומיקרוסופט הציגו את RTX Spark ואת Surface Laptop Ultra, שיימכר מ-16 באוקטובר החל מ-2,599 דולר, יחד עם תשתית לבידוד סוכנים ב-Windows 11. גוגל שחררה באותו שבוע כלים שרצים על המכשיר בלי חיבור לרשת. אבל מנכ״ל מיקרון אמר שהמחסור בזיכרון יחריף ב-2027–2028, ושיותר מ-75% מהתפוקה של 2027 כבר שוריינה ללקוחות. מחשב שמריץ מודלים מקומית צריך הרבה זיכרון, ודווקא הזיכרון הוא המשאב שלא יוזל בקרוב.

ברובוטיקה, הטענות עדיין מקדימות את האימות. הציון של Spirit AI לא אומת במקור רשמי, וההדגמה של Generalist נשענת על פוסט ברשת. אנבידיה מנסה למכור דווקא את שכבת הבטיחות לרובוטקסי ולרובוטים דמויי אדם. בחלל, גוגל שיגרה ארבעה שבבי TPU כדי לבדוק אם אפשר להפעיל מרכזי נתונים במסלול.

רגולציה ואבטחההממשל הפדרלי בחר בפיקוח עצמי, והרגולציה עצמה נקבעת במקומות אחרים ובכיוונים הפוכים.

הבית הלבן הגדיר את התחייבויות החברות “מחייבות מוסרית”, בלי מנגנון אכיפה. באמנה של כוח המשימה החדש של טראמפ נקבע שעליו גם למנוע “רגולציית-יתר”. בסקר של קוויניפיאק, 74% מהנשאלים נותנים מעט אמון או לא נותנים אמון כלל במנהלי חברות ה-AI. הסנאטור אדם שיף תומך בהקמת סוכנות פיקוח, אבל לא הציג דרך לעקוף את פסיקת בית המשפט העליון מ-2024.

בינתיים הכללים נקבעים מחוץ לממשל הפדרלי. נורווגיה מקדמת איסור על משקפי AI עם מצלמות במרחב הציבורי. יוטה הולכת לכיוון ההפוך ומאפשרת ל-AI לבחון מטופלים ולרשום תרופות בלי פיקוח של רופא, ו-Nolla Health כבר מפעילה שם פיילוט לאקנה. גם OpenAI מוסיפה סימן מים לטקסט רק באיחוד האירופי, שבו החוק מחייב אותה.

מחקרהמתמטיקה הפכה למבחן של השאלה מי מאשר תוצאה של AI, וגם Lean לא סגר את הוויכוח.

ביום שלישי אמרה OpenAI שעדיין לא נקבע מועד לפרסום מאות הפתרונות שלה. ביום רביעי היא פרסמה תוצאות עם הוכחות Lean ב-GitHub. ביום חמישי כבר היו בחוץ 719 כתבי יד. היא עשתה זאת למרות שמתמטיקאים ביקשו ממנה מאמרים מסודרים, ובלי לעמוד בחלק מההנחיות של הקבוצה שהיא עצמה התייעצה איתה. ההוכחה הפורמלית אמורה לייתר את השיפוט האנושי, אבל מאמר מקיימברידג' ומקינגס קולג' לונדון מצא פער בין הטקסט של אחת ההוכחות לבין גרסת ה-Lean שלה. השינוי כבר משפיע מחוץ ל-OpenAI: אתר בעיות ארדש משנה את דרך הפעולה שלו, וחוקר אחד הרחיב תוצאה של OpenAI בתוך שבועות.

במקביל, מדד TasteVal מראה שיכולת תכנון הניסויים של המודלים הוכפלה כל שלושה חודשים, ושהמודל המוביל כבר עבר את רף הבסיס האנושי, אף שהחוקרים מציינים מגבלות משמעותיות בהשוואה. בביולוגיה, גוגל, מטא וממשל ארה״ב התחייבו ל-1.8 מיליארד דולר לנתונים פתוחים שמוכנים לאימון מודלים, לבניית “תא וירטואלי”.

סיןהמודלים הפתוחים הסיניים הפכו לנקודת הייחוס של כל השאר, אבל חלק גדול מהכסף מגיע לאחרים.

רוב המודלים הפתוחים שהוצגו השבוע נמדדו מול מודלים סיניים. ‏Reflection AI השוותה את Beam ל-GLM-5.2. דרום קוריאה הודתה שהיעד שלה הוא מודלי הקוד הפתוח הסיניים ולא הענקיות האמריקאיות. ‏Mistral טענה ש-Large 4 עוקף “כל מודל פתוח שפותח בארה״ב או באירופה”. ההסתייגות בטענה הזאת היא בעצם הודאה מי מוביל. ‏Kimi K3 ו-GLM 5.3 הם כבר ברירת המחדל בכלים מערביים כמו Together Link, ו-GLM 5.3 זמין ב-Amazon Bedrock.

אבל מחקר חדש מראה שחלק גדול מההכנסות מהמודלים האלה מגיע לספקים שמריצים אותם, ולא למפתחים. זה ההקשר לגיוסים של השבוע: DeepSeek קרובה ל-12 מיליארד דולר לפחות ולהנפקה ב-2027, ו-Manus גייסה יותר מחצי מיליארד אחרי שבייג'ינג ביטלה את העסקה עם מטא. לנקודת הייחוס יש גם מחיר: לפי Aleph Alpha, ההטיה הפוליטית של המודלים הסיניים עוברת למודלים שאומנו על הפלט שלהם, ובהם מודל של אנבידיה.

למה לשים לב בשבוע הבא

  • המשקולות של Mistral Large 4 ושל Beam של Reflection AI אמורות להתפרסם עד סוף אוקטובר. אז אפשר יהיה לבדוק באופן עצמאי אם יש מודל פתוח לא סיני שמתחרה במודלים הסיניים.
  • התגובה המסודרת של קהילת המתמטיקאים ל-719 כתבי היד של OpenAI: עוד בדיקות כמו זו של קיימברידג' וקינגס קולג' יראו אם הוכחות Lean מספיקות כדי לאשר תוצאה.
  • השינויים במינויי Gemini נכנסו לתוקף ב-9 באוקטובר. כדאי לעקוב אם גוגל תפרסם הודעה רשמית על המסלול החינמי, ואם OpenAI תאשר את הקיצוץ במכסות של Pro.
  • ‏Surface Laptop Ultra נמכר מ-16 באוקטובר: המבחן הראשון לשאלה אם הצרכנים מוכנים לשלם על מחשב שמריץ סוכנים מקומית, בזמן שמחירי הזיכרון ממשיכים לעלות.