让 AI Agent 连续逛网页、查资料或操作物体,它每走一步都要记住此前看见什么、想过什么。KV Cache(模型保存历史计算结果的“速记”)因此越积越厚。论文举例称,Qwen3-30B 完成一次网页购物任务要经历 25 轮、处理约 3.5 万个 token,仅缓存就占 3.20 GB。ActKV 要解决的,就是删掉部分速记时,别误删真正会影响后续行动的线索。
过去的压缩方法主要看哪些内容会被近期文字生成关注;ActKV 改为衡量一条记录对“下一步做什么”的价值。作者发现,同一任务里,不同行动反复依赖一组相对稳定、但并非每轮都会被关注的历史信息。因此,系统累计它们在多轮行动中的使用频率,并结合模型自身的信心动态调整缓存预算,而不是固定比例一删到底。按作者在三类长流程任务上的实验,ActKV只使用 FullKV 峰值缓存的 25.98%,仍保留其平均 98.53% 的准确率;token 吞吐和整项任务吞吐分别达到 FullKV 的 3.97 倍和 3.58 倍。这些效果目前来自论文自报,但思路值得注意:Agent 的记忆管理开始从“哪些文字重要”,转向“哪些经历会改变行动”。