让 AI 连续思考、调用工具再读取结果,就像让人一边办事一边整理桌面:只按“最近有没有翻过”扔掉旧纸条,很可能把下一步还要用的材料丢了。KV 缓存——模型保存在显存里的中间计算结果——能避免重复计算,但 Agent 的流程远长于普通聊天,这本“临时笔记”也更容易撑满。
AgentKV 的关键改动,是不再只用最近一小段查询判断哪些缓存值得保留。它把上下文分成 think(内部推理)、act(生成工具调用)、tool(工具返回)和 others 四类,各自保存一小组近期查询,再用它们的合集给缓存打分。作者用主角度分析——衡量两组向量主要方向有多相似——发现不同阶段的查询确实落在可区分的方向范围里;只看最近内容,会偏爱当前阶段,并低估较早的工具信息。
实现上,它通过聊天模板中的可见标记确定阶段,不需要额外分类模型或新增特殊词元。论文还把压缩后的缓存跨轮保留并在线整理缓存页。作者称该方法已在两个模型、六类任务和三档缓存预算下测试,但所给原文中的具体提升数字缺失,因此这里不作量化判断。