Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER 约 1 分钟

MoE更怕重复数据

语料循环使用时,MoE比稠密模型更早过拟合,模型越稀疏越明显。

好语料不够用,就把同一批内容反复教给 AI,像让学生一遍遍刷同一本练习册。问题是,学生可能只是背熟答案。Jha 等人发现,Mixture-of-Experts(MoE,专家混合模型)尤其容易中招:它把模型分成多个“专家”,每次只调用少数几个;相比每次启用几乎全部参数的稠密模型,它在重复数据上更快过拟合——训练材料学得更熟,面对新数据的表现却变差。

作者比较了每次实际启用 8000 万至 10 亿参数的模型,最大 MoE 总参数量为 85 亿。在 8000 万参数的实验中,稠密模型重复数据时退化很小,MoE 到第 4 次重复便开始受损;重复 32 次后,MoE 不仅失去使用全新数据时的优势,还明显落后于稠密模型。模型越稀疏,问题越严重,而且敏感程度更取决于总参数量,而非每次启用的参数量。作者认为,这可能与“路由”过早固定有关:同类内容长期交给同一批专家,促使它们记住狭窄样本。强掩码正则化可让 MoE 在重复超过 64 次时仍胜过稠密模型,但没有方法恢复到全新数据训练的水平。


供稿材料 SOURCES — 1

← 返回 2026-09-14 · 学术板块