像把会诊医生从八位减到四位,省下工作量后,却把留下四人的意见统一放大,判断反而容易走样。这正是细粒度混合专家模型(MoE——每次只调用少数“专家”子网络)缩减计算时的问题。路由器会为每个 token(文字的基本小块)挑出得分最高的专家;以往减少专家后,会把幸存者的权重重新缩放到总和为一,无意间改变模型训练时习惯的输出强度。
Chen 与 Yao 的办法很简单:实际只运行前四名专家,却仍参考前八名专家的概率总量来缩放权重。它不增加参数,也无需训练。作者称,在 Qwen3.6-35B-A3B 上,激活专家从 8 个减至 4 个后,标准做法让 MMLU(综合知识问答测试)下降 4.65 分,新方法只降 0.35 分,同时将专家部分的计算量减半;在更大的 Qwen3.5-397B-A17B 上,从 10 个减至 5 个也只降 0.55 分。关键不是简单“少用专家”,而是保住原有的数值尺度;不过这些效果目前来自论文作者的实验,且不同任务适合的缩放设置可能不同。