像赶路前先备好几条岔路,候选越多,走对的机会越大,但逐条检查也要花时间。投机解码就是这样:便宜的草稿模型先猜后续 Token——文字的基本处理单元,再由目标模型统一核验。CAST 的关键,是不再只保留得分最高的一条续写,而把草稿模型一次计算中已经得到的其他候选组成“投机树”,交给目标模型一并检查。
它也不盲目扩树。CAST 会继续加入候选,直到下一根分支带来的预期收益不再高于它增加的验证时间。这个判断结合候选得分和部署环境中的短时延测量,因此能适应不同 GPU、模型和并发负载,无须逐个尝试树宽。作者报告,在八组硬件与模型设置中,CAST 均快于标准单链方案,平均提升 20%—36%,单一领域最高 43%;其预测宽度在六组设置中与遍历得到的最佳宽度一致。换句话说,这项工作的价值不只是“多猜”,而是把草稿与核验成本放进同一本账里,寻找真正能兑现为速度的分支。