让 AI 一段接一段生成长视频,它常会慢慢“忘记”开头:人物变样,场景和运动也开始漂移。Recency Forcing 认为,问题可能不只在模型容量,还在训练方式。训练短片时,模型通常能参考全部历史;真正生成长片时,内存有限,KV Cache——保存历史中间结果的“草稿纸”——却必须不断删掉旧内容。模型平时没练过这种情形,生成越久越容易失稳。
作者没有在训练时直接截断旧画面,因为实验分析显示,这会丢掉仍有用的时间信息,损害运动连贯性。他们先测量不同距离的旧帧在各个“去噪步骤”中有多大影响,再用 Temporal Response Bias(时间响应偏置)逐渐压低远帧的注意力。这样,旧信息不是突然消失,而是在真正被淘汰前先变得不重要。论文还给出一种精确的计算改写 BAR,可沿用标准 FlashAttention——一种节省显存的注意力计算——作者称不会增加推理开销。该方法既能直接用于现有模型,也能配合训练;其长期生成质量结论来自作者在 VBench 和 VBench-Long 上的实验,尚应结合后续复现看待。