你让 AI 解一道题,它第一次就答对了,看起来训练很成功。但如果让它试 1024 次,训练后的模型反而可能不如训练前:它更常走一条熟悉的路,却更少探索其他偶尔有效的路线。这正是强化学习研究里长期显得矛盾的地方——它究竟教会模型新的推理方法,还是只让模型更偏爱原来就会的方法?
Ziheng Cheng、Yixiao Huang、Hanlin Zhu 和 Somayeh Sojoudi 的这项工作,把跨领域迁移、能力遗忘、推理覆盖率和训练算力放进同一个解释框架。作者在 Qwen 与 Gemma 模型家族上做实验,再用一个简化的理论模型解释结果。核心判断很克制:强化学习(Reinforcement Learning, RL——模型先尝试作答,再根据奖励调整,让高奖励行为以后更常出现)并不会统一地扩大推理边界。它首先改变的是模型对不同推理策略的偏好。
本文数据、结论和理论主张均来自这篇论文,尚无独立信源交叉验证;其中机制解释建立在作者提出的简化模型及其假设上,不能直接视为对真实模型内部过程的因果证明。
一次答得更好,不等于探索得更远
论文先区分两个容易混在一起的指标。Pass@1 是模型只回答一次时答对的概率。Pass@N 则是对同一道题尝试 次,至少答对一次的概率。前者像“第一次就做对”;后者更像“给足尝试机会后,能不能摸到解法”。
作者使用 Qwen3-14B-Base 和 Gemma-3-12B-IT,在 4.8 万道数学题上做 RL。Qwen 另有一个加入 5000 道编程题的 Math-Code RL 版本。RL 训练采用 GRPO——一种根据同组回答的相对奖励更新模型的方法——共训练 200 步;每步抽取 512 个问题,每题生成 16 个回答。研究还设置了监督微调(SFT——让模型模仿现成示范答案)作为比较。
结果没有出现一条整齐的“RL 全面变强”曲线。数学训练稳定改善了数学任务,但数学之外的表现因模型、训练数据和测试任务而异。同样接受数学训练,Qwen 与 Gemma 在不少域外任务上甚至朝相反方向变化。加入编程题能改善部分编程任务,却没有带来普遍迁移。SFT 同样依赖模型:Qwen 的版本在知识与规划任务上有选择地迁移,Gemma 的版本则在所有域外评测中下降。
换句话说,训练领域里的成功,不能可靠预测其他领域会发生什么。跨域迁移——在数学等领域训练后,收益延伸到别的任务——与遗忘——改善一部分能力时损伤原有能力——可以同时存在。
RL像是在重排工具箱
论文最有解释力的一步,是观察模型具体走了哪些“推理路线”。这里的路线不是措辞或算式细节,而是解决问题的关键办法。例如,把问题化简后分析,与穷举搜索,属于两条不同路线。
作者比较 Qwen3-14B-Base 与数学 RL 版本,在六个基准中选取 240 道题,每个模型对每题生成 16 个回答,再用 LLM 从推理轨迹中提取并归类路线。六个基准上,RL 模型每题使用的平均路线数都更少,整体从基座模型的 3.24 条降到 2.66 条,编程任务下降尤其明显。这说明训练后的输出更集中。
但“更集中”不等于“绝无新迹象”。在 3840 个 RL 回答中,有 487 个、即 12.7%,采用了同一道题的 16 个基座回答里没有出现的路线。这个结果只能说明有限样本中出现了不同路线,不能证明 RL 创造了基座模型原本完全不具备的策略。基座模型也许只是没有在那 16 次采样中把它拿出来。
为解释这种现象,作者提出两阶段自回归策略模型。“自回归”指模型按顺序一步步生成内容。第一阶段先选择推理策略,第二阶段再针对具体问题执行策略并生成答案。可以把它理解成先从工具箱选工具,再动手完成工作。RL 不一定添置新工具,也可能只是把几件工具摆到最顺手的位置,把另一些压到箱底。
在这一框架下,作者证明:RL 的“隐式偏置”——训练过程即使没有明文规定,也会自然偏向某些解法——能够重新分配策略概率。训练任务偏爱的策略如果也适合目标任务,就会产生迁移;如果目标任务需要的策略被压低,就会出现遗忘。效果还取决于训练问题与目标问题的特征重合、目标任务需要哪些策略,以及基座模型原先偏爱什么。
作者也据此区分 RL 与 SFT。理论模型中,RL 会强化所有能在训练题上获得奖励的有效策略;SFT 只强化示范答案实际展示的策略。因此 SFT 更容易受教师示范限制。不过论文也明确给出反例:Qwen3-SFT 在域外基准 GPQA-Diamond 上超过了 RL 模型,所以这不是“SFT 必然更差”的定律。
覆盖率为何会一升一降
推理覆盖率关心的是:多次采样后,模型能触及多少有效解法,而不只是最常输出什么。论文观察到的常见模式,是 RL 后 Pass@1 上升,Pass@1024 却低于基座模型,数学任务上尤其明显。模型第一次更可靠了,但大量尝试时的探索面可能变窄。
BoxNet 展示了另一面。这项任务上,基座模型成功极少。Qwen3-Math-RL 把 Pass@1 从 3.8%提高到 9.9%,也把 Pass@1024 从 34.0%提高到 51.0%。Gemma 的数学 RL 版本虽然 Pass@1 下降,Pass@1024 仍然上升。也就是说,RL 如果放大了原本极少出现的有效策略,单次成绩与大预算覆盖率可以一起提高。
相反,如果 RL 压低了某些题目所需的罕见策略,覆盖率就会下降。作者的理论结论是:即使模型可用的策略集合没有扩展,仅仅调整已有策略的概率,也足以让给定采样预算下的覆盖率扩大或缩小。因此,Pass@1024 上升不能单独证明模型学会了新策略;Pass@1 上升也不能推出推理边界变宽。
这一点还能解释为何实验常互相矛盾。论文中,Qwen3-Math-RL 在 BoxNet 上扩大覆盖,却在 AIME 2024 上出现 Pass@1 提高而覆盖收缩。给 Qwen 的训练数据加入编程题后,CodeContests 的覆盖变化方向又被反转。决定结果的不是“有没有用 RL”这一项,而是训练数据、评测题分布与基座模型三者的组合。
算力曲线也只是局部地图
论文最后讨论 RL compute,也就是投入训练的计算量。作者把前 200 步训练的数据分别拟合为 log-sigmoid 与 log-linear 两类缩放规律,再把训练延长到 350 步检验预测。前者会逐渐弯向平台,后者假设成绩随计算量的对数近似直线上升。
在拟合区间内,两条曲线往往几乎分不出来;拉长训练后,差异才出现。Qwen3-Math-RL 更接近 log-linear 预测,而 Qwen3-Math-Code-RL 后期趋于饱和,在 MATH500、AIME、ACPBench 和平均分上更接近 log-sigmoid。log-linear 因为没有上限,在较高算力下越来越容易高估表现。
预测能力也取决于评测领域。数学等训练域内任务较稳定,编程与规划等域外任务更脆弱;单个基准的轨迹又比平均成绩更嘈杂。作者在简化的“策略选择主导”假设下,为两种曲线给出局部近似及误差界。这解释了它们为何能在有限训练区间内有效,却不支持把任何一条曲线当成普适定律。
为什么值得关注
这项工作的价值,不是宣布“RL 创造推理”或“RL 只会重排答案”,而是把问题拆得更准确。模型最常给出的答案、有限次数采样能否碰到正确解法,以及模型是否真正拥有新的策略,是三个不同层面。
它也提供了一种理解实验分歧的方式:RL 像在调节策略的音量。有些任务需要的路线被放大,于是出现迁移;另一些路线被压低,于是发生遗忘。罕见但有效的路线被放大时,覆盖率扩张;被压低时,覆盖率收缩。看似互相冲突的结果,可能只是策略重排在不同任务上的不同投影。
局限与未知
- 路线分析依赖 LLM 从回答中提取并归类策略,且“RL 新路线”只表示它未出现在同题的 16 个基座样本中,不能证明基座模型从未拥有该策略。
- 两阶段模型假设存在共享且有限的策略库,并使用冻结特征、正交性等条件。理论证明刻画的是这个抽象框架,不是对真实大模型内部机制的直接观测。
- 缩放规律只在有限计算区间内得到拟合与外推检验,跨领域预测也更不稳定。论文支持的是局部解释,而不是一条可无限外推的算力定律。