让学生模型跟着强教师学习,听起来像把老师脑中的知识抄进学生脑中。但这篇论文拆开内部表征后发现,事情更像调音:同策略蒸馏——教师在学生自己生成的推理轨迹上逐步纠正它——没有为学生创造新特征,也没有直接搬来教师独有的特征,而是重新调整双方原本共享特征的使用频率。
研究者用稀疏交叉编码器——把多个模型的内部信号翻译成一套共享、且每次只启用少量项目的“概念词典”——比较蒸馏前后的学生与教师。他们还设计了 swap readout,单独读取不同训练节点怎样调用同一批特征。三个蒸馏设置都呈现上述模式;变化最明显的特征常在“Wait”“Hmm”“So”等推理转向词处激活,也正是师生分歧较大的位置。连常见的 SFT 预热也没有添加特征,而是提前重排既有特征;把这种重排施加到未经预热的学生上,无须改动模型权重,准确率便接近预热后的学生。结论仍限于论文测试的三种设置,但它挑战了“蒸馏就是复制教师知识”的直觉:学生学到的或许主要是怎样更好地使用自己已有的东西。