让 AI 在一部长篇小说里找回开头埋下的细节,难点不只是“记得多”,还要控制计算成本。标准注意力会比较上下文中的各个位置,文本越长,计算和显存开销增长越快。一篇新发布的 arXiv 预印本提出:简单的滑动窗口注意力(SWA)或许比复杂方案更划算。
SWA 只让每个 token——模型处理文字时的基本单位——查看附近一段内容,再保留少量 attention sink,即始终可被后文关注的“汇聚点”,帮助窗口滚动时维持稳定。论文作者自述,在 Needle-in-a-Haystack 和 BABILong 两项长上下文推理测试中,这套方案的表现达到线性注意力变体的 2 至 10 倍;后者通过近似或递归状态降低长文本成本。作者还称,SWA 无须额外后训练,同时速度快、内存占用低。
这项工作的提醒很直接:模型团队评估新架构时,不能只和标准全局注意力比较,也该纳入足够强的简单基线。不过,目前材料来自论文摘要的转述,未披露具体模型、窗口大小、汇聚点设置及完整实验数字,结论仍需结合论文细节和后续复现判断。