写文章时,先把草稿交给昂贵的主编逐句检查,未必划算;让便宜的助手先多改几轮,可能更省时间。两项新工作都把这个思路用在投机解码上——小模型先写一串 Token(模型处理文字的基本单位),大模型再统一验证;草稿连续获批得越长,验证成本通常越低。
DLoop 发现,草稿模型变强后,大模型常会整段接纳,但系统仍固定在每轮草拟后验证。它改为看草稿模型是否仍有信心:有信心就继续起草,积累多轮结果后一次验收;训练时还让小模型适应基于“尚未验证内容”继续工作。作者称,该方法用于 EAGLE-3、DFlash 等多种方案时,在保持无损解码的前提下,实际耗时加速提高 5% 至 41%。
D-Loop 针对另一种毛病:块扩散模型一次并行写多个 Token,各位置看不到邻近位置的新提议,容易重复同一个词。它复用原模型跑第二遍,保留选定前缀,再据此前缀并行重写后半段,不增加模型组件。两条路线共同说明,竞争焦点正从“草稿一次写多少”,转向“送审前能否把草稿写得更可靠”。