GLM-5.3 הסיני זוכה במקום השני בבנצ'מרק כתיבה יצירתית עולמי
מודל השפה הסיני GLM-5.3, בגרסת ה-max שלו, תפס את המקום השני ב-Short Story Creative Writing Benchmark — מבחן שבו מודלי בינה מלאכותית שונים כותבים לפי בריפים יצירתיים אחידים ונשפטים על ידי שופטי LLM עצמאיים. הידיעה, שפורסמה בפורום r/singularity, ממקמת מודל סיני בין המובילים בתחום שנחשב מסורתית אתגר קשה לבינה מלאכותית.
✦ נכתב אוטומטית על ידי AI מבוסס על מקורות גלויים · עבר בקרת איכות אוטומטית
מודל השפה הסיני GLM-5.3, בגרסת "max" שלו, תפס את המקום השני ב-Short Story Creative Writing Benchmark — בנצ'מרק ייעודי לבחינת יכולות כתיבה יצירתית של מודלי בינה מלאכותית. הידיעה פורסמה בפוסט בפורום r/singularity, שם מציינים כי הבנצ'מרק פועל בשיטה אחידה: כל המודלים הנבחנים כותבים לפי אותם בריפים יצירתיים מוגבלים (constrained creative briefs), ולאחר מכן שופטי LLM עצמאיים מדרגים את התוצרים בזה מול זה, במטרה לצמצם הטיה בשיפוט.
מה זה אומר בפועל
השיטה של שופטים ללא הטייה נועדה להתמודד עם בעיה מוכרת בהערכת יכולות יצירה של מודלי שפה: כאשר מודל שופט את עצמו, או כאשר קריטריוני השיפוט אינם עקביים בין המודלים הנבדקים, התוצאות עלולות להיות מוטות לטובת סגנון כתיבה מסוים. בבנצ'מרק הזה, לפי הפוסט, כל המודלים כפופים לאותם תנאי פתיחה בדיוק — מה שהופך את ההשוואה למדויקת יותר ביחס לבנצ'מרקים שבהם כל מודל מקבל חופש פעולה שונה.
מדובר בתחום שנחשב מבחן קשה יחסית עבור בינה מלאכותית: בעוד שמודלי שפה הוכיחו את עצמם היטב במשימות טכניות כמו כתיבת קוד או פתרון בעיות לוגיות, כתיבה יצירתית דורשת התמודדות עם דקויות של קצב, טון, מקוריות ועקביות עלילתית — פרמטרים שקשה יותר לכמת ולבחון באופן אוטומטי.
הקשר רחב יותר
GLM היא משפחת מודלי שפה שמפתחת החברה הסינית Zhipu AI, והיא נחשבת לאחת המתחרות הבולטות למודלים המובילים המערביים בתחום הבינה המלאכותית הגנרטיבית. הכניסה של מודל סיני למקום גבוה בבנצ'מרק כתיבה יצירתית — תחום שבו מודלים אמריקאים כמו אלה של OpenAI ו-Anthropic נתפסו עד כה כמובילים בציבור הרחב — מצטרפת למגמה רחבה יותר של צמצום הפער הטכנולוגי בין מפתחי בינה מלאכותית סינים למקביליהם המערביים, מגמה שבאה לידי ביטוי בחודשים האחרונים גם בבנצ'מרקים טכניים אחרים.
הפוסט המקורי אינו מפרט מי תפס את המקום הראשון בבנצ'מרק, ואילו מודלים נוספים מדורגים לצידו של GLM-5.3 — פרטים אלה לא נמסרו במקור הזמין. ככל הנראה, המשמעות המעשית עבור משתמשים היא שכלי כתיבה מבוססי בינה מלאכותית ממקורות מגוונים יותר עשויים להיות רלוונטיים גם למשימות יצירתיות, ולא רק לשימושים טכניים או עסקיים, אך יש להמתין לנתונים מלאים יותר כדי להעריך את היקף הפער בין המודלים המובילים.
פרסומת
הכתבה הבאה
משתמש בדק את Ox Alpha מול בעיות קוד אמיתיות: 96% הצלחה, מעל Fable 5 — אך גם ספקנות עצמית משתמש ב-Reddit הריץ את המודל Ox Alpha על תת-קבוצה של 50 משימות מתוך בנצ'מרק SWE-bench Verified, וקיבל שיעור פתרון של 96%, העולה על ציון Fable 5 של Anthropic. עם זאת, מפרסם הבדיקה עצמו הביע ספקנות כלפי התוצאה שלו, וזו בדיקה בודדת ולא בהכרח מאומתת באופן עצמאי ומלא. → לכל הכתבות