像多人一起读一份长报告,不必每个人都从头看到尾,只要分工后没有漏页。CoWindow Attention(CoWA)把这个思路用在语言模型上:因果注意力——模型生成当前位置时回看此前内容——通常让每个注意力头,也就是一组独立的“阅读视角”,都读取完整历史。上下文越长,这种重复越昂贵。
CoWA让所有头共同关注最近内容和文本开头,再把其余远距离历史切成互补窗口,分给不同的头。单个头不再看全,但所有头的视野合起来仍覆盖每个可查看的位置。窗口由位置直接决定,不需要额外训练一个“路由器”挑选内容。最能说明问题的是一组8K上下文对照实验:据作者报告,完整集体覆盖的CoWA准确率为89.73%,完整注意力为89.97%;如果各头重复查看相同的远距离窗口,表现则明显更差。这表明关键可能不是每个头都读遍历史,而是团队分工后仍能把历史读全。