让 AI 一次多猜几个 Token(模型处理文字的小单位),听起来理应更快。但猜完还要验证,额外步骤也会占用 GPU。作者在单张 NVIDIA A10G 上对比普通的逐个生成与“两 Token 预测”,用 360 个文本、推理和工具调用请求重新核算这笔账。
结果里最值得注意的是:多 Token 方案每轮验证平均可推进 2.370 至 2.595 个 Token;按每个生成 Token 计算,反复执行的 CUDA Graph——预先录好的 GPU 操作流水线——减少了 56.4% 至 78.1%。与此同时,它的主要矩阵计算并不比普通方案更快,执行路径反而加入了提议、采样、注意力和归约等操作。换句话说,收益来自把额外成本摊到更多 Token 上,并减少重复访存与执行,而不是某个算子突然提速。作者还报告,首次输出等待时间缩短 10.0% 至 14.2%。不过这是一份未经同行评审的技术报告,实验限于单请求、特定模型与 A10G GPU,不能直接外推到所有部署。