让 AI 像接龙一样逐段生成视频,麻烦在于:训练时它常参考干净的真实画面,实际生成时却只能接着自己已有瑕疵的画面往下画。误差会越滚越大,画面也容易过度饱和、细节发糊。Mask Forcing 要修补的正是这种训练与生成的错位,让适合实时运行的自回归视频模型更稳。
它最巧的一步,是在模型用自己生成的内容继续训练时,随机挑出部分空间或时间位置,换成噪声更少、因而更清楚的信号;其余位置仍保留原来的高噪声,形成“双噪声”输入。好比让模型修改一张模糊草稿时,局部给它几块较清晰的参照:这些位置既能帮助其他区域去噪,也会把训练轨迹推向更多可能结果,缓解蒸馏中的“模式坍缩”——学生模型只学会老师少数几种答案。
作者称,这套方法无需加入真实视频数据或额外的后训练阶段,就能用于多种视频扩散蒸馏方案,并改善视觉质量与收敛速度;这些效果目前来自论文自身实验。