好语料不够用,就把同一批内容反复教给 AI,像让学生一遍遍刷同一本练习册。问题是,学生可能只是背熟答案。Jha 等人发现,Mixture-of-Experts(MoE,专家混合模型)尤其容易中招:它把模型分成多个“专家”,每次只调用少数几个;相比每次启用几乎全部参数的稠密模型,它在重复数据上更快过拟合——训练材料学得更熟,面对新数据的表现却变差。
作者比较了每次实际启用 8000 万至 10 亿参数的模型,最大 MoE 总参数量为 85 亿。在 8000 万参数的实验中,稠密模型重复数据时退化很小,MoE 到第 4 次重复便开始受损;重复 32 次后,MoE 不仅失去使用全新数据时的优势,还明显落后于稠密模型。模型越稀疏,问题越严重,而且敏感程度更取决于总参数量,而非每次启用的参数量。作者认为,这可能与“路由”过早固定有关:同类内容长期交给同一批专家,促使它们记住狭窄样本。强掩码正则化可让 MoE 在重复超过 64 次时仍胜过稠密模型,但没有方法恢复到全新数据训练的水平。