同一道题,AI 答得更准了,草稿却越来越像只有自己看得懂的速记。Michael Sullivan 与 Alexander Koller 研究发现,这可能不是偶然的文风变化,而是训练目标带来的副作用。RLVR——用数学答案是否正确、代码能否通过测试等可自动核验的结果奖励模型——只关心最终结果,未必要求推理文字保持正常、易读。
论文最值得注意的发现是:当模型面对基础能力中尚不存在的新推理任务时,RLVR 更容易引发“语言漂移”,也就是思维链逐渐出现非标准甚至难以理解的表达。即使从同一模型出发、使用同一数据,不同训练运行也会形成各自独特的语言习惯。作者还从理论上证明,RLVR 允许漂移无限扩大;若强行限制漂移,也会限制模型能取得的最高预期奖励。换句话说,提升前沿任务表现与保留可供人检查的推理文字之间,可能存在真实代价。不过,这一结论针对文本推理模型,论文未考察多模态模型。