Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER 约 1 分钟

多Token预测的加速账该重算了

GPU实测显示,多预测Token的收益来自少跑执行轮次,而非单个算子更快。

让 AI 一次多猜几个 Token(模型处理文字的小单位),听起来理应更快。但猜完还要验证,额外步骤也会占用 GPU。作者在单张 NVIDIA A10G 上对比普通的逐个生成与“两 Token 预测”,用 360 个文本、推理和工具调用请求重新核算这笔账。

结果里最值得注意的是:多 Token 方案每轮验证平均可推进 2.370 至 2.595 个 Token;按每个生成 Token 计算,反复执行的 CUDA Graph——预先录好的 GPU 操作流水线——减少了 56.4% 至 78.1%。与此同时,它的主要矩阵计算并不比普通方案更快,执行路径反而加入了提议、采样、注意力和归约等操作。换句话说,收益来自把额外成本摊到更多 Token 上,并减少重复访存与执行,而不是某个算子突然提速。作者还报告,首次输出等待时间缩短 10.0% 至 14.2%。不过这是一份未经同行评审的技术报告,实验限于单请求、特定模型与 A10G GPU,不能直接外推到所有部署。


供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块