יום שני, 31 באוגוסט 2026 מתעדכן אוטומטית כל שעה
🗞️ חזרה למהדורה

מחקר חדש: sliding window attention עשוי להחליף attention ריבועי בלי אימון מחדש

מחקר חדש של אלכסיה ז'וליקר-מרטינו ושותפים, שעלה לתשומת לב הקהילה דרך פורום r/LocalLLaMA, טוען שניתן להחליף את מנגנון ה-attention הריבועי הסטנדרטי במודלי שפה ב-sliding window attention בשילוב attention sinks — בלי לאמן את המודל מחדש. אם הטענה תעמוד במבחן, יש לכך פוטנציאל השפעה על הרצת מודלי שפה מקומיים במחשבים עם משאבי זיכרון מוגבלים.

מחקר חדש שערכה אלכסיה ז'וליקר-מרטינו (Alexia Jolicoeur-Martineau), הידועה בזכות עבודתה על ה-Tiny Recursive Model, יחד עם שותפים למחקר, מציע להחליף את מנגנון ה-attention הריבועי הנפוץ במודלי שפה גדולים ב-sliding window attention בשילוב מנגנון שנקרא attention sinks — וזאת, לפי התיאור שפורסם, בלי צורך לאמן את המודל מחדש.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות