你让 AI 解一道应用题。常见模型会像人在纸上逐字写答案:先写第一步,再根据前文写下一步。这样容易保持思路连贯,但后面的字必须等前面的字生成。ELF-REG 想试另一条路:先铺开一整份混乱的草稿,再同时修改各个位置,经过多轮整理后一次性读出完整答案。值得关注的问题是,这种更适合并行生成的路线,能不能处理数学和代码这类环环相扣的任务。
论文把 ELF——一种全连续扩散语言模型——扩展到数学推理与代码生成。所谓“连续”,是指模型在修改草稿时,不急着把每个位置定成具体词,而是在一组可以平滑调整的数字坐标中逐步去噪,最后才把所有位置一起解码成文字或代码。作者报告,ELF-REG 在若干同等规模的扩散模型比较中取得更好的结果,并展示了提前结束去噪的可能性。不过,以下成绩与比较均来自论文作者自己的实验,尚无独立复现。
难点不是一起写,而是一起想
扩散语言模型(Diffusion language model)与常见的自回归语言模型(Autoregressive language model)走法不同。后者从左到右,每次根据已经写出的内容预测下一个词,像沿着句子逐字续写。前者则反复修改整个答案,各个位置可以同时更新。
并行很诱人,但推理不是简单填词。数学解答的后一步往往依赖前一步,代码中一个变量也要与前后多处保持一致。如果每个位置都在同时变化,模型就需要一种办法,让局部修改服从整体思路。
ELF-REG 的关键组合叫 REPA+REG。REPA 可以理解为“对齐内部思路”:训练时,一套冻结的 Qwen3-1.7B-Base 自回归教师模型,为去噪器的中间特征提供参照。教师监督——即用一个已经训练好的模型给新模型提供学习信号——不只检查最终答案,还告诉学生模型,中间表示应该朝什么方向整理。
REG 则补上一份全局提示。教师模型最后一个内容位置的状态被整理成一个全局表示,与回答一起加噪、一起去噪。它像草稿顶部的一行解题提要:正文各处可以与它交换信息,但最终只输出正文。教师模型和用于对齐的投影层只在训练时使用,推理时不再参与。
这也划清了“扩散模型推理能力”的边界:最终生成走的是全连续扩散路线,但它的训练仍借助了自回归教师。论文的消融实验支持这套设计确实有用。在训练第 6 个 epoch 时,基础 ELF-B 的 pass@1 为 21.74%,只加 REPA 后为 24.56%,REPA+REG 则达到 28.92%。pass@1 指只生成一次时答对的比例。即使推理时移除 REG token,成绩仍有 28.66%,说明它带来的训练收益大部分保留下来;单纯加入一个可学习 token,则只有 25.60%,没有复现同样的提升。
成绩进步了,但还不是全面追平
在小学数学应用题基准 GSM8K 上,ELF-REG-L 用 64 次网络函数评估达到 55.96% pass@1,高于 ELF-L 基线的 51.85%。网络函数评估(NFE)可以粗略理解为去噪器被调用的次数,也是这里衡量生成计算量的主要单位。更小的 ELF-REG-B 在 64 NFE 下取得 38.11%,论文称它超过了所比较的若干相近规模扩散模型,其中一些用了更多 NFE。
更难的 MATH-500 上,ELF-REG-L 在 128 NFE 下把 pass@1 从 ELF-L 的 10.55%提高到 13.39%。增幅清楚,但绝对成绩也提醒我们:这条路线仍在攻坚,而不是已经解决复杂数学推理。
代码任务呈现了类似图景。在 HumanEval 上,ELF-REG-L 于 128 NFE 达到 22.56% pass@1,略高于 PlaidQ+CFG 在 257 NFE 下的 22.04%;在 MBPP-378 上,两者分别为 28.92%和 24.58%。论文称 ELF-REG-L 在表中四个代码基准上都超过了所列的相近规模扩散模型,但各方法的提示方式、回答长度和代码后处理并不完全相同,因此这些数字更适合看作同一张实验表中的阶段性比较。
答案还在变,结论可能已经出来了
ELF-REG 的另一处看点是 early-stop,也就是提前停止去噪。通常,模型会走完整条去噪路径再解码。作者改为在途中读取当时预测的“干净答案”,无需为少步生成重新训练模型。
这个做法的直觉很有意思:一份解题草稿可能还在改措辞,但最后的数字已经不会变。GSM8K 实验中,ELF-REG-B 在 64 NFE 时的完整回答只有 8.61%与 512 NFE 的终点逐词一致,但数值答案已有 87.11%一致。继续去噪会让全文更稳定,却只带来很小的总体准确率变化。也就是说,“答案定下来”和“每个词定下来”不是同一时刻。
在相同 NFE 预算下,提前停止也优于直接把较短去噪流程走完:ELF-REG-B 在 16 NFE 时,两种方式的 GSM8K pass@1 分别为 34.42%和 25.27%;到 64 NFE 时则为 38.11%和 34.19%。这说明低预算生成不只是简单少算几轮,在哪里截断、截断时读取什么状态,同样重要。
论文还报告,ELF-REG-L 在 16 NFE 下取得 HumanEval 41.21% pass@10。pass@10 指生成十次、其中至少一次通过的概率,不能与 128 NFE 下的 22.56% pass@1直接比较,更不能据此说减少计算反而提高了同一项性能。
为什么值得现在看
ELF-REG 没有证明扩散模型已经取代逐词生成。它更像一次路线验证:全连续扩散不只可以改写或翻译文本,也开始进入数学与代码;代表整体答案的全局信号,加上对中间表示的教师监督,确实能改善学习;而提前解码说明,并行生成的有效答案可能早于完整文本稳定。
如果这些现象能在更大、更通用的模型上延续,扩散路线才有机会真正挑战自回归模型在速度与能力之间的权衡。眼下更准确的判断是:它已经从“能不能做推理”走到“怎样用有限去噪预算做得更好”,但距离通用竞争仍有一段路。
局限与未知
- 论文为单一信源,尚无机构外复现;“同等规模领先”仅限作者选择的模型和实验设置,不能泛化为全面领先。
- 主要成绩来自分别训练的 GSM8K、MATH、代码等任务专用 checkpoint,不代表一个通用模型的零样本综合推理能力。
- 不同基线在提示、回答预算和代码后处理上存在差异;论文也未给出足以判断实际端到端速度的统一延迟比较。