同一份长资料要让 AI 反复回答不同问题,就像把一本厚书交给许多人轮流查阅。模型虽不用每次重读,却要一直保存 KV 缓存——读完资料留下的“速查笔记”;上下文越长,这份笔记越占显存。KV²瞄准的正是这笔复用成本:在不知道后续问题的情况下,先把缓存压小,同时尽量不丢掉未来可能有用的信息。
它的关键是“先粗选,再精算”。KV²先用便宜的代理评分找出较有信息量的上下文词元,再只让这小部分内容参与更精细的重建评分,据此决定缓存中哪些条目该保留;算力充足时,这一过程还可迭代修正。这样既保留了重建方法的判断力,又不必重新处理整段原文。
作者报告,在 RULER 的 16K 上下文测试中,当缓存预算仅剩原来的 2%时,KV²平均得分比次优基线高出逾40个百分点;在 LongBench 上,它也在2%至10%预算区间取得最高平均成绩,同时压缩阶段的运行时间和峰值内存低于完整上下文重建。结果仍来自论文作者自述,但它指出了一个实用方向:可反复调用的长上下文缓存,不必在“省内存”和“整段重算”之间二选一。