Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER HF 17 约 1 分钟

循环与稀疏,谁更会扩展模型

让模型多想几轮,也多备几位专家:新扩展律给出算力与容量的搭配方法。

像同一个团队反复讨论问题:多开几轮会有帮助,但越往后,新增收获越少;如果每轮还能换一批专家,讨论则更可能带来新信息。这篇论文研究的正是两种扩展方式如何配合。循环 Transformer 会重复使用同一组网络层,相当于让模型多想几轮;Mixture-of-Experts(MoE,混合专家模型)则准备许多专家子网络,每次只调用少数几个,用较少的实际计算换取更大的总容量。

作者提出 Loop Scaling Laws,把模型大小、训练数据、循环次数和稀疏程度放进同一套经验公式。最关键的发现是:循环带来的有效容量不会无限增长,而会逐渐趋于上限;专家越多,路由器越可能在不同轮次调用不同参数,因此循环收益能维持更久。在留出数据预测中,这种“有上限、且受稀疏度影响”的公式,误差低于线性和幂律方案。

作者还报告,在相同训练算力下,一个每次激活 0.3B、总计 1.3B 参数的循环 MoE,在推理基准上追平了每次激活 0.6B、总计 2.9B 参数的非循环 MoE。代价也很直白:省下参数容量,需要用更多推理计算来换。


供稿材料 SOURCES — 1

← 返回 2026-10-03 · 学术板块