循环语言模型像让同一位编辑反复审一段文字:不用多请人,却要多轮排队。它让同一组网络层反复处理内部状态,以共享参数换取更深计算;代价是生成每个 token(可理解为词或字的片段)都要顺序运行多次,拖慢回答。WaveFront Decoding(WFD)瞄准的正是这段等待时间,而且无需重新训练模型。
它利用中间轮次的输出先猜后续 token,再用完整轮次验证。关键不只是“推测解码”——先便宜地提出候选、再集中核验——而是把不同位置、不同计算深度的状态排成一条斜向推进的“波前”:较浅的计算继续起草新位置,较早的位置同时走向完整验证。由于循环模型共享权重,这些工作可以塞进同一次批量计算;猜错时,再用完整深度的结果纠正。
作者称,在 Spec-Bench 六类任务上,WFD 相比逐 token 的自回归解码,在 Ouro-2.6B 和 Huginn-3.5B 上分别加速 2.42 倍和 3.54 倍;加入跨循环 KV 共享、减少中间状态搬运后,Huginn-3.5B 达到 4.81 倍。值得关注的是,它为“省参数但多步骤”的循环架构补上了推理加速的一环;这些效果目前仅据作者材料,实际收益仍取决于候选命中率与并行开销。