生成越长,AI 的“草稿纸”通常越厚:为了避免反复计算,模型会把旧文本的中间结果存进 KV 缓存,但这份缓存会随上下文增长。Singh 等人研究的,是能否给块扩散模型一张大小固定的草稿纸。块扩散会把文本分段生成,每段内部并行补全;团队用 Mamba——一种以固定大小循环状态汇总历史的序列模型——保存已经定稿的内容,让缓存不再越写越大。
作者在统一训练与解码设置下比较了三种 30 亿参数模型:注意力、纯 Mamba,以及两者混合的版本。论文报告,生成长度一路增加到 25.6 万 token(可理解为文本的基本单位)时,Mamba 的缓存相关占用维持在 7.5 GB,单步延迟维持在 6.8 毫秒;注意力模型的占用则增至 82 GB。更小且恒定的状态也让 Mamba 能继续增加并行请求,而注意力版本在这一长度只能运行单路。关键不只是“省内存”:这些模型从训练阶段就按同一种分块规则学习,因此缓存是模型原本计算的一部分,并非事后近似。结果仍来自作者对自训模型的测试,但它给出了一个具体边界:扩散式并行生成若想伸向超长文本,固定状态确实比不断增长的缓存更有扩展空间。