Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.080 — 2026-09-22
PAPER HF 7 约 1 分钟

蒸馏先校准师生差距

Cal-OPD先剔除教师自身的摇摆,只把更可信的师生差距交给学生学习。

老师批改作业时,也可能因提示语不同而改变判断。若学生把这种摇摆也当成知识照单全收,未必学得更好。在线策略蒸馏(让学生模型先生成推理过程,再由更强教师逐词指导)就有这个问题:每个词上的师生概率差距,不只反映能力差,也混入了教师自身受上下文影响的偏移;训练时教师若还能看到标准答案等“特权信息”,这种混杂可能更明显。

Cal-OPD的做法,是先用正、负两类特权提示,探测教师对同一个词的判断会在多大范围内摆动,再把落在这个范围内的师生差距视作不够可靠,不用于训练;只有超出范围的部分才成为学习信号。换句话说,特权信息不再直接教学生,而是拿来校准老师。

作者在数学推理基准上的实验显示,Cal-OPD只保留原始学习信号的约52%—65%,表现却在不同模型规模上持续超过标准方法及其变体,并缓解了回答越训越长的现象。不过,这个“教师自偏移区间”只是由有限提示估算,并非对教师所有上下文变化的完整刻画。


供稿材料 SOURCES — 1

← 返回 2026-09-22 · 学术板块