Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
NEWS 约 1 分钟

MoE多激活一点,推理反而少绕路

不重训模型,只让后段多位专家参与,推理 token 据称减少 8.5%

像讨论难题时,临近拍板再多请几位专家,反而可能少兜圈子。这项实验针对稀疏 MoE——一种每处理一个 token(模型处理文字的小单位),只调用少数“专家”模块的模型。作者没有重新训练 Qwen3.6-35B-A3B,而是在运行时调整路由器:早期层保持不变,只在更接近最终决策的后段 Transformer 层扩大专家选择预算,并让额外专家按线性规则逐渐减少。

作者将这种设置称为 Qwen3.6-35B-A4B+。在完整 MMLU-Pro 的 714 道题上,平均推理 token 据称减少 8.5%,延迟下降 10.9%;准确率为 84.5%,原始设置为 84.0%,差异在统计上不显著。这个结果有意思之处在于,它用更多单步计算换来更短的作答路径,而且无需微调权重。不过,推理 token 变少不等于实际耗时必然同比下降,目前材料也只给出单一模型与基准的结果,能否推广仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 开源板块