像公司合并后重新分派工作:一个请求换了负责部门,并不能证明服务变差。Yuanyi Wang 研究的正是这个误区。混合专家模型(MoE)含多个“专家”子网络,路由器像总机,为每个词挑选少数专家;模型合并则把分别训练过的模型参数组合起来。合并前后选中的专家不同,叫“路由漂移”,但它只是变化,不是故障诊断。
论文在 DeepSeekMoE、OLMoE 和 Qwen3-MoE 上做反事实干预——主动替换或固定路由,再比较结果。作者发现,多数专家改派更像是路由器收到的内部表示变了,而非同层路由参数本身改变;而且,路由差异很难预测恢复原模型路线后,下一词预测是否会改善。不同专家组合还可能给出方向相近的混合输出。
因此,更可靠的问题不是“路线还和原来一样吗”,而是固定其他参数后,换一种路由能否挽回任务损失。论文用人为破坏路由验证了这套检验能识别可恢复的损失,但恢复源模型路由并未在所评估的合并模型中显示出可靠收益。结论很克制:漂移值得调查,却不足以证明合并失败,也不能单独成为修复依据。