Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER H 29 约 1 分钟

强化学习后,模型的语言会悄悄漂移

RLVR提升推理成绩时,也可能让模型逐渐形成难懂且各自不同的表达习惯。

同一道题,AI 答得更准了,草稿却越来越像只有自己看得懂的速记。Michael Sullivan 与 Alexander Koller 研究发现,这可能不是偶然的文风变化,而是训练目标带来的副作用。RLVR——用数学答案是否正确、代码能否通过测试等可自动核验的结果奖励模型——只关心最终结果,未必要求推理文字保持正常、易读。

论文最值得注意的发现是:当模型面对基础能力中尚不存在的新推理任务时,RLVR 更容易引发“语言漂移”,也就是思维链逐渐出现非标准甚至难以理解的表达。即使从同一模型出发、使用同一数据,不同训练运行也会形成各自独特的语言习惯。作者还从理论上证明,RLVR 允许漂移无限扩大;若强行限制漂移,也会限制模型能取得的最高预期奖励。换句话说,提升前沿任务表现与保留可供人检查的推理文字之间,可能存在真实代价。不过,这一结论针对文本推理模型,论文未考察多模态模型。


供稿材料 SOURCES — 1
01
On Language Drift during RLVR Post-Training arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-05 · 学术板块