Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER 约 1 分钟

动态修改上下文,不必重算全部KV

PatchKV只修补受中段编辑影响的缓存,尽量保住长后缀的既有计算。

想象 AI Agent 已经读完一份很长的工作记录,却临时替换了中间一段工具结果。后面的文字虽然没变,模型仍不能放心沿用旧“笔记”:KV 缓存——模型读输入时保存的中间计算状态——会受前文和词语位置影响。全部重读又会拖慢首次输出。PatchKV 瞄准的正是这种反复修改长上下文中段的场景。

它先把新旧上下文拆成完全相同的前缀、被更新的片段和文字一致的后缀。随后用离线分析得到的预测器,圈出编辑附近最可能“变脏”的区域;再根据已保存的注意力统计,补上少量距离较远但可能影响回答的缓存块。系统只重算这部分,其余后缀则从 CPU 恢复,并按预先确定的精度压缩传输;恢复过程还合并了反量化、RoPE 位置修正和缓存页放置。

作者在三个模型和三类长上下文问答任务上测试。与 CacheBlend 相比,PatchKV 在九组设置中的六组达到或超过其 F1,其余差距不超过 1.36 分。论文文本未给出可用的具体加速倍数,因此目前更值得关注的是它的取舍:不把“文字没变”等同于“缓存有效”,而是只修补真正可能影响生成的部分。


供稿材料 SOURCES — 1

← 返回 2026-09-26 · 学术板块