Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
PAPER 约 1 分钟

50M Token记忆层挑战反复重算

把旧对话的“思考草稿”存进硬盘再调用,50M Token测试中比重算更快、更省电。

长时运行的 AI Agent 像一位不断接新任务的助理:旧材料看过了,下次用到却常要重新读一遍。这里重复消耗的是 KV 缓存——模型处理文字时留下的注意力计算中间结果。作者发布的 galahad-kv 把每 1.6 万 Token 的 KV 状态加密写入本地 NVMe 高速固态硬盘,需要时直接恢复,而不是让 GPU 重新计算。

实验在单张 NVIDIA H100 上处理 5000 万 Token,共形成 3125 个存储块。作者称,Gemma 4 12B 和 31B 在不同深度抽查的 100 个块均实现零重算恢复;与重算同一块相比,恢复速度快 2.8 至 4.3 倍,GPU 能耗低 8.8 至 12.3 倍。代价并不小:两种模型的加密存储分别占 1.86 TB 和 6.25 TB。更重要的边界是,它没有扩大模型一次能看的上下文窗口,也不负责自动寻找相关记忆;系统必须先知道要调回哪个块。换句话说,这更像把旧“思考草稿”可靠归档,而非让模型自动拥有完整的超长记忆。上述结果均为作者在其公开复现实验中的报告。


供稿材料 SOURCES — 1

← 返回 2026-10-10 · 学术板块