Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.062 — 2026-09-04
PAPER H 1 约 1 分钟

量化KV缓存可能悄悄改答案

RAG预存并压缩“阅读笔记”能省成本,但压到INT4后,答案即使仍正确,也可能不再有据可依。

让 AI 反复查同一批资料,每次都从头读一遍很费算力。RAG(检索增强生成,先找资料再据此作答)因此会预存文档的 KV 缓存——模型读文档时留下的“阅读笔记”。再用量化把数值改成较粗的刻度,还能继续节省存储。但这篇论文提醒:笔记压得太狠,AI 可能悄悄换掉答题依据。

作者在 Qwen2.5-7B-Instruct、RGB 和 HotpotQA 上比较 BF16、INT8 与 INT4 缓存,并固定检索材料、提示词和生成方式。结果显示,INT8 在准确率与忠实度上接近未压缩基线;INT4 则不只让更多答案出错。即使筛出答案对错状态没有变化的样本,超过 90% 的忠实度变化仍朝坏的方向发展。这里的忠实度,是指答案能否由给定材料推出;模型也可能凭原有知识碰巧答对,却没有真正依据检索证据。

这种损伤在无关文档更多、检索片段更多时还会放大,不过检索深度实验只有三个档位,作者将其视为趋势性证据。对工程团队来说,结论很直接:评估离线量化 KV 缓存,不能只看压缩率和最终答案是否正确,还要检查回答是否仍有据可依。


供稿材料 SOURCES — 1

← 返回 2026-09-04 · 学术板块