Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER H 5 · HF 14 约 1 分钟

滑窗注意力为何仍能赢

直接保留最近一小段上下文,竟比专门压缩记忆的线性注意力更强、更稳。

读长文时,AI 既想记住前文,又不想让“草稿纸”越堆越厚。线性注意力选择把漫长历史压进固定状态;这项研究却发现,更朴素的办法可能更好:只让模型回看最近一小段文字,就像读书时只摊开手边几页。

作者比较了改造并继续训练过的线性注意力模型,与无需额外训练的滑窗注意力。后者把回看窗口设为 64 个 Token——Token 是模型处理文字的基本单位——同时始终保留开头 4 个“注意力汇点”。这些开头位置像固定的缓冲区;论文指出,若把它们一并滑出窗口,模型表现会严重下降。

结果颇有工程意味:在知识与推理任务的 11 组对照中,滑窗方案有 9 组平均表现最佳;在 Needle-in-a-Haystack 和 BABILong 两类长上下文推理测试中,作者报告其成绩达到线性注意力的 2 至 10 倍。它仍会失去直接查看遥远细节的能力,但这组对照提醒团队:在投入额外训练改造模型前,带 4 个汇点的滑窗应先作为低成本基线认真测试。


供稿材料 SOURCES — 1
01
Sliding-window beats linear attention arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-03 · 学术板块