Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
PAPER 约 7 分钟

Ling 2.0:万亿参数开放推理模型

Ling 2.0 用稀疏专家把总容量推至万亿参数,并让每次计算更集中于推理能力。

你可以把大模型想成一家拥有许多专科部门的机构。部门越多,能处理的事情通常越复杂;但如果每次提问都召集全公司,成本也会迅速失控。Ling 2.0 的思路是:把模型扩到万亿参数,同时每次只请少数合适的“专家”工作,并从数据、训练到硬件系统都围绕推理重新编排。

这项工作值得看,不只因为数字大。Ling Team 想回答一个更实际的问题:增加的模型容量,能不能真正转化为更好的多步推理,而不是只增加一笔昂贵的计算账单?不过,本文所有效果数字和结论都来自团队自己的技术报告,尚无独立复现;报告所说的“open”也没有在正文材料中明确对应权重、代码、数据或许可证中的哪一种开放形式。

万亿参数,不等于万亿参数同时开工

参数是模型训练后留下的大量数字,可以粗略理解为长期记忆和处理规则。Ling-1T 拥有 1T,也就是一万亿个总参数,但每次处理一个 token——模型阅读和生成文字时使用的基本单位——只激活其中 51B,即 510 亿个参数。因此,它不是“万亿参数全激活模型”。

这依靠 Mixture-of-Experts(MoE,专家混合)架构。三个 Ling 2.0 模型都设置了 256 个可路由专家;每个 token 只调用 8 个,再加一个始终参与的共享专家,总激活比例约为 3.5%。小型的 Ling-mini-2.0 有 16B 总参数、激活 1.4B;Ling-flash-2.0 有 103B、激活 6.1B;Ling-1T 则是 1T、激活 51B。

团队把这种设计概括为“Every Activation Boosted”:既然一次只能动用少量参数,就尽量让每次激活都服务于推理。报告称,相比达到相同性能的稠密模型——每次让大部分参数共同计算的模型——这套架构可带来最高约 7 倍的主动计算效率。但这个“7 倍”是团队定义的 efficiency leverage,比较的是达到相同验证损失所需的计算成本,并不是所有任务上的固定加速倍数。

先在风洞里试,再造万亿模型

模型大到万亿参数后,直接试错太贵。Ling Team 因此建立了一套 Scaling Laws(扩展规律):通过大量较小实验,估计模型规模、数据量和计算投入变化时,什么配置更合适。

团队称,他们进行了近千次超参数实验,并另外研究了 300 多个、最大 28B 参数的模型。结果用于选择学习率、批量大小、专家激活比例和专家颗粒度。报告把这套小规模验证系统称为“Ling Wind Tunnel”,也就是 Ling 风洞:用五个介于 500M 和 8B 参数的模型测试候选设计,再把结果外推到百倍以上规模。

按报告数据,这套风洞实验的总计算成本约为传统单次消融实验的 35%,验证一种设计所需成本可压到完整训练的 1%以内。它得到的关键选择是:稀疏程度越高,计算效率优势越明显;而每次激活 8至12个专家,在速度与效果之间较合适。最终,三个模型统一采用“256选8加1共享专家”的配置。

推理能力不是最后才补的

Ling 2.0 没有把推理只留给训练末尾。它在预训练阶段就提高数学和代码材料的比例:前后两个各 10T token 的阶段中,推理类数据占比从 32%增至46%。团队称,定制的 Ling Math 与 Ling Code 数据让推理基准平均提高5%至8%。

进入 mid-training(介于通用预训练和最终微调之间的训练阶段)后,团队把上下文窗口从 4K 扩展到 32K,并加入 150B 个长上下文 token;同时引入 Chain-of-Thought(CoT,展示中间推导步骤的数据),提前激活模型的推理行为。Multi-Token Prediction(MTP,多 token 预测)则要求模型训练时不只预测紧接着的一个 token。报告称,它在不同模型规模上持续改善代码和数学任务。

后训练继续沿同一方向推进。DFT(Decoupled Fine-Tuning,解耦微调)通过不同系统提示建立多样化的推理起点;Evo-CoT(Evolutionary Chain-of-Thought,演化式思维链)逐步增加推理深度。团队称,这一组合达到相当或更好表现时可少用25%的训练 token。LPO(Linguistic-unit Policy Optimization,语言单元策略优化)则把完整句子作为强化学习的更新单位,而不是单个 token 或整段回答;报告给出的复杂推理基准增幅约为10%。

训练账本也包括机器怎么跑

如此规模的模型,算法成立还不够,机器必须稳定而高效地执行。Ling 2.0 全程采用 FP8——一种用较少位数表示训练数值的低精度格式——以减少内存和计算负担。团队报告称,训练至 900B token 后,它与 BF16 的精度差距约为0.25%,内存占用降低超过15%。

MoE、MTP 等模块的计算节奏并不一致,容易让部分设备空等。团队采用细粒度异构流水线,把不同任务穿插安排,并只重算部分中间结果;报告称吞吐量因此提高约40%。这些工程安排说明,万亿参数扩展不是单一架构技巧,而是模型、数据、训练方法与基础设施共同配合的结果。

为什么值得关注

Ling 2.0 展示了一条不同于“把所有参数一起做大”的路线:总参数提供容量,稀疏激活控制单次成本,训练数据和后训练方法再把有限的激活机会推向数学、代码与多步推理。团队据此宣称 Ling-1T 在推理准确率与计算效率之间建立了新的 Pareto frontier——也就是在两项目标的权衡中推进了边界。

但标题里的“推理模型”需要谨慎理解。报告明确把 Ling-mini-2.0、Ling-flash-2.0 和 Ling-1T 称为 non-thinking(instruct)模型:它们是偏重推理和指令执行的基础模型,并非会显式展开深度思考过程的 thinking model。后续 Ring 系列才是在同一底座上继续走向深度思考模型。

局限与未知

  • 所有效果均来自 Ling Team 技术报告。所谓“新 Pareto frontier”和“每次激活都增强推理”是作者对结果的总结,尚不能视为独立验证后的结论。
  • “最高7倍效率”依赖团队定义的等性能计算口径,不能直接理解为推理速度提高7倍。不同任务、硬件和部署条件下是否成立,材料没有给出独立结果。
  • 报告使用“open”和“open-source”描述模型,但现有材料没有交代具体开放许可证、训练数据开放范围等边界。更准确的说法是“团队称其为开放基础模型”,而不是直接断言它已完整开源。

供稿材料 SOURCES — 1

← 返回 2026-09-13 · 学术板块