Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 23 约 1 分钟

蒸馏到底把什么写进了模型

拆开蒸馏后的模型看,学生没有抄来新知识,更像是重新调高了已有能力的音量。

让学生模型跟着强教师学习,听起来像把老师脑中的知识抄进学生脑中。但这篇论文拆开内部表征后发现,事情更像调音:同策略蒸馏——教师在学生自己生成的推理轨迹上逐步纠正它——没有为学生创造新特征,也没有直接搬来教师独有的特征,而是重新调整双方原本共享特征的使用频率。

研究者用稀疏交叉编码器——把多个模型的内部信号翻译成一套共享、且每次只启用少量项目的“概念词典”——比较蒸馏前后的学生与教师。他们还设计了 swap readout,单独读取不同训练节点怎样调用同一批特征。三个蒸馏设置都呈现上述模式;变化最明显的特征常在“Wait”“Hmm”“So”等推理转向词处激活,也正是师生分歧较大的位置。连常见的 SFT 预热也没有添加特征,而是提前重排既有特征;把这种重排施加到未经预热的学生上,无须改动模型权重,准确率便接近预热后的学生。结论仍限于论文测试的三种设置,但它挑战了“蒸馏就是复制教师知识”的直觉:学生学到的或许主要是怎样更好地使用自己已有的东西。


供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块