Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.069 — 2026-09-11
PAPER HF 79 约 1 分钟

弱老师也能反向教出强学生

不让强学生照抄弱老师,而是借老师指路,再凭可验证反馈继续超越。

好比让基础更好的学生跟一位普通老师备考:照抄老师的解法,进步很快,却也可能被老师的上限卡住。Sangmin Bae 提出的在线反向蒸馏(OPRD),想解决的正是这个问题:强模型如何从弱监督中受益,又不把老师当成最终标准。这关系到“弱到强泛化”——未来模型若强到人类难以逐项评判,我们仍需要用较弱的监督引导它。

OPRD 的关键不是模仿老师的全部回答,而是观察老师经过训练后,行为相对原始版本朝哪个方向变化;再让学生自己生成回答,并用可程序检查的奖励判断对错。只有当学生本来的改进方向得到这种“验证器”支持时,老师的方向才会被用来放大更新。换句话说,老师负责指路,不负责规定终点。

作者报告,在跨代模型迁移中,OPRD 用少 33%—67% 的学生更新次数达到弱老师水平,早期检查点最高领先 22.7 个百分点,之后还能继续超过老师;整合四个小型领域老师时,它少用 55% 的更新达到老师水平,最终超过全部四位老师。这些结果仍来自论文作者的实验,但它给出了一个值得关注的思路:弱老师的经验可以成为加速器,而不必成为天花板。


供稿材料 SOURCES — 1

← 返回 2026-09-11 · 学术板块