把大模型生成长文想成查资料:Key 是目录索引,Value 是索引指向的内容。模型通常把两者都留在显存里,文本越长,这本“随身资料册”就越占空间、越费读取带宽。Grouped Value Attention(GVA)的思路很直接:只长期保存分组后的 Value,需要 Key 时,再通过学到的线性变换重建。
更巧的一步是,推理时这项变换可以提前并入 Query——模型当前用来检索资料的“问题”。因此,预期的逐词生成路径甚至不必真的生成内容 Key。位置信息则由一条很小、各注意力头共享的 RoPE 通道单独保存;RoPE 是让模型知道词语先后关系的位置编码。论文报告,在所测配置中,GVA 比对应的 GQA 缓存标量减少约 45%–47%。
在 3.5 亿参数、300 亿个 FineWeb-Edu token 的实验中,16 维位置版本在五项任务上的平均准确率为 44.35,几乎追平 GQA 的 44.36,并高于 MLA 的 43.88。作者明确表示,延迟和生成吞吐量是否真的改善尚未得到实验确认,定制解码内核仍在评估中。