Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.031 — 2026-08-04
NEWS 约 1 分钟

DeepSeek V4的KV缓存别急着量化

社区测试显示,DeepSeek V4 Flash 的 Q8 KV 缓存省显存,却可能明显改变输出。

给大模型省显存,有点像把草稿纸上的字写得更挤:纸是省了,但模型回看时也更容易读错。KV 缓存就是模型生成文字时保存上下文中间结果的“草稿纸”;Q8 KV 缓存则用较低精度记录这些信息。它不同于压缩模型权重,可能直接改变模型接下来看到的数值。

Reddit 用户 erazortt 测试 DeepSeek V4 Flash 后发现,从 BF16 KV 切换到 Q8 KV,平均困惑度由 5.839660 升至 5.877076——困惑度通常越低越好。更值得留意的是,量化版与原版选择相同最高概率 token 的比例只有 87.189%;衡量输出概率分布差异的 KL divergence 均值为 0.145884。作为对照,同一用户给出的 Qwen 397B 数据中,平均困惑度仅从 3.746773 升至 3.747980,KL divergence 均值为 0.003552。

这意味着,至少在这次社区测试里,DeepSeek V4 Flash 对 KV 缓存量化明显更敏感,省下的显存未必抵得过输出偏移。帖子没有披露完整测试设置,因此这些数字更适合作为“先别默认开启 Q8”的预警,而不是最终定论。


供稿材料 SOURCES — 1

← 返回 2026-08-04 · 开源板块