Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER H 5 · HF 220 · 2 信源 约 8 分钟

蒸馏扩展律:小模型能接住多少推理力

两项研究追问同一件事:模型变大后,推理能力还能蒸馏多少,以及怎样避免收益消失。

你请一位数学老师带学生,通常会觉得老师越强越好。但模型蒸馏不是这样:一个分数更高、体量更大的“老师”,未必更会教;同一套教法放到更大的“学生”身上,收益还可能接近消失。两项新研究把这种经验问题拆成可测量的扩展问题:模型尺寸变化后,推理能力能转移多少、转移多快,又会在何处碰到瓶颈。

这里的知识蒸馏,是让学生模型模仿教师模型对各种输出的判断,不只照抄最终答案。两项工作都采用 on-policy 路线:学生先按自己当前的能力解题,教师再沿着学生真正走过的路径提供监督。好比老师不发标准范文,而是直接批改学生刚写出的草稿。两项研究共同指向一个结论:蒸馏收益明显受模型规模影响,不能只看教师得分,也不能把固定配方一路放大。不过,它们研究的设置并不相同,具体数字和机制也都尚未得到另一项研究的直接复现。

先看清能力是怎样转过去的

浙江大学 ZJU ACES Lab 团队的《Scaling Properties of Same-Family On-Policy Distillation》研究同族模型——架构和训练血统相近、尺寸不同的一组模型。实验采用 Qwen2.5 Base 的 0.5B、1.5B、3B、7B 和 14B 版本,共组成25种教师—学生搭配,覆盖弱教师教强学生、同尺寸互教,以及强教师教弱学生。任务是数学推理。

作者没有只比较训练前后的分数,而是观察整个过程。他们用 held-out accuracy,也就是未参与训练的测试集准确率,作为 gold score;再用

d=KL(πθ‖πref)

衡量学生离初始状态走了多远。KL 散度衡量两个输出概率分布的差异;这里取平方根,是因为它能更自然地对应训练初期的能力变化。

结果出现了一个相当整齐的前半程。论文称之为 useful-transfer 阶段:gold score 随 d 近似线性上升。换句话说,训练刚开始时,学生每偏离起点一段距离,通常能换来较稳定的准确率收益。但过了这段窗口,曲线便分成三类:继续缓慢改善、趋于饱和,或开始倒退。此时教师诱导的训练奖励仍可能上升,真实测试成绩却已下降,说明“更像教师设定的目标”不等于“更会解题”。

规模决定了这段转移最终能走多远。以 Vanilla-OPD 为例,7B 学生随教师增大,峰值准确率从72.7%升至81.9%;14B 学生则从77.7%升至87.3%。但小学生并非教师越大越好:0.5B 学生由3B教师指导时峰值为40.8%,换成7B和14B教师后反而降至39.0%和37.7%。

小老师为什么可能更会教

这项研究拟合的幂律显示,增大教师带来的峰值改善,大致持续到教师尺寸接近学生为止。超过这一位置,收益会饱和,部分小学生组合甚至反转。作者还发现,在教师 gold score 相当时,较小的教师转移效果更好。

一个受控比较很能说明问题。教同一个7B学生时,1.5B教师的得分是63.6,学生最终峰值达到77.5;一个尚未训练完的3B教师得分略高,为66.0,学生峰值却只有73.8。也就是说,教师自己会做多少题,并不能完整表示它能教出多少能力。

在论文观察到的所有 weak-to-strong 组合中,学生峰值都超过了教师自身得分。这不是说弱教师普遍可以造出更强模型,只说明已测试的同族组合存在这种现象:较大的学生本来就可能藏有教师不具备的知识和推理策略,教师提供的更像是把这些能力调动出来的训练信号。

不过,逐级接力没有带来额外好处。作者先训练0.5B专家,再让蒸馏后的中间模型继续当老师。所有接力链都低于0.5B专家直接教目标学生:例如14B学生的接力峰值为76.8%,直接蒸馏为77.7%。这再次说明,中间教师分数变高,不代表监督价值同步增加。

训练方式也很关键。让学生先模仿教师现成答案的 off-policy 冷启动,对弱教强尤其有害。0.5B教师指导14B学生时,这一步先把学生拉到教师附近,抹掉学生初始成绩中的32个百分点;后续 OPD 未能补回。与纯 OPD 相比,冷启动令最终峰值少19.4个百分点。

模型变大后,为什么自蒸馏失灵

第二项研究《Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning》讨论的是 OPSD,即 on-policy self-distillation。这里不能把教师—学生关系直接等同于前一项跨尺寸研究。标准 OPSD 会让教师读取额外的参考解法,再去监督学生未经验证的解题轨迹。

作者把两个因素拆开:教师看到的 context 是否正确,以及学生轨迹这个 scaffold 是否正确。scaffold 可以理解成学生搭出的解题脚手架,也就是后续监督依附的推理路径。因素分析显示,脚手架是否正确,对下游准确率的影响强于教师上下文是否正确。问题在于,教师能借助学生拿不到的额外信息,对一条错误路径给出看似合理的逐步指导;学生随后模仿的,未必是自己真正能够执行的推理。

据此,作者提出 OASIS。它保留 OPSD 的训练目标,但主要监督那些已经由最终答案标签验证为正确的 on-policy 轨迹;教师上下文则可使用模型生成、未经验证的尝试。因此,OASIS 只需要最终答案标签,不要求写好的完整参考解法。

在 Qwen3-1.7B、4B、8B,以及 AIME 2024、AIME 2025、HMMT 2025 三个数学竞赛基准上,论文报告 OASIS 相对基础模型平均提高3.2至3.8个准确率百分点。标准 OPSD 的增益却从1.7B时的3.05个百分点降到8B时的0.14个百分点;在8B模型上,OASIS比 OPSD 高3.05个百分点。更克制的解读是:在这组模型和数学测试中,先筛出正确的学生轨迹,缓解了标准自蒸馏随规模增大而收益衰减的问题。

真正值得关注的是“教学适配”

两项工作把后训练社区的一种焦虑说得更具体了:能力迁移不是把教师做大、把训练拉长就会自然改善。教师自身分数、教师尺寸、学生尺寸、学生实际走过的路径,以及这些路径是否正确,会共同决定监督有没有用。

这也让“扩展律”有了不同含义。它不只是预测更大模型会多得几分,还试图在训练前回答两个更实际的问题:哪个教师更适合这个学生,以及训练到哪里应该停。若这些规律能在更多模型与任务上成立,团队或许不必为每个尺寸都重复完整的强化学习,而可以先训练一个较小专家,再选择合适的转移方式。但目前证据还不足以把这件事写成通用配方。

局限与未知

  • S1 只在 Qwen2.5 同族模型和数学推理设置中验证;其幂律虽能较好预测留出的最大尺寸,但参数量同时混入了数据与训练计算等因素,不能直接视为跨模型家族的普遍定律。
  • S2 的证据限于 Qwen3-1.7B、4B、8B和三个数学竞赛基准。“随规模保持有效”因此仍是范围有限的结论,最高只测试到8B。
  • 材料没有给出方差、重复次数、显著性、样本规模或幂律拟合优度的完整信息。除“蒸馏存在规模依赖、简单扩展会遇到限制”这一共同判断外,精确数字与机制解释都应视为单项研究结果。

供稿材料 SOURCES — 2

← 返回 2026-10-03 · 学术板块