Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
NEWS 约 1 分钟

KV缓存也能流式换入换出

给 KV 缛存设显存预算,按需搬运,用生成速度换更大模型或更长上下文。

IMAGE — r/LocalLLaMA 日榜

长对话越聊越吃显存,因为 KV 缓存——模型保存已读内容中间结果的“草稿纸”——会随上下文增长。giveen 提交的 PR #326 尝试给这张草稿纸设一个显存预算:用户通过 CLI(命令行界面)的 --kv-stream 参数指定 MiB 上限,只把当前需要的缓存块留在显存,其余放到较慢的主机内存。这样,本地有限显存有机会容纳更大的模型或更长的对话,代价是数据搬运可能拖慢生成。

这项集成的关键,是让固定页的主机内存成为 KV 数据的主要存放处,并为 CUDA 后端补上能力与缓存类型检查。程序只在统一 KV 缓存、单序列、Flash Attention、GPU KV 卸载等条件满足时放行。值得注意的是,PR 记录显示相关开关、校验和内存分配接线仍在分步完成;早期提交明确称“尚未真正流式传输”,现有材料也没有给出速度、容量收益或完整硬件实测,因此目前更像一条正在铺设的运行时通道,而非已经验证完毕的成品功能。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 开源板块