Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
PAPER H 15 约 1 分钟

LLM并行推理的通信账被重新算清

一套分析框架算清多 GPU 推理的通信与等待成本,帮助权衡吞吐、延迟和硬件规模。

把大模型分给更多 GPU,不等于回答一定更快。它像给餐厅增加厨师:每个人少做一点,却要花更多时间交接、等候。这项工作要解决的,正是大语言模型推理——训练完成后生成回答——该怎样拆分,才能在吞吐量(单位时间处理多少请求)与延迟(单个请求要等多久)之间取得合适平衡。

作者建立了一套统一分析框架,把总延迟拆成计算、GPU 间通信和流水线空泡——部分 GPU 因前后工序未衔接而闲置的时间。框架同时覆盖张量并行(多块 GPU 合做同一层)、流水线并行(不同 GPU 分别处理不同层)及两者的混合方案,并纳入模型结构、输入长度、批量大小、GPU 数量和连接方式。

最值得注意的是,论文把输入处理与逐字生成分开算:计算密集的预填充阶段更偏向流水线并行;解码阶段需要逐个生成 token,流水线空泡更突出,张量并行因消除了这类空泡而可获得更低延迟。作者称,多 GPU 实验验证了模型及这组计算—通信取舍,但已提供的原文未披露具体误差或加速数字。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 学术板块