你让一个人替你网上购物。第一次,他总能走最熟悉的路线,却反复卡在同一个地方;另一个人第一次常出错,但多试几次,会换搜索词、换入口,最后反而能完成更多不同的任务。哪一个更“会”?
这正是论文《Sharpening Tax in Post-Training》追问的问题:大模型经过强化学习(RL)后训练,究竟学会了原本不会的能力,还是主要把已有的少数做法练得更稳定?作者把讨论从数学题和代码题带到智能体任务——模型需要连续观察环境、调用工具,再根据反馈调整行动。结论不是“后训练没有学习”,而是一个更克制的判断:在他们测试的模型和任务中,后训练提高了单次成功率,却经常缩小多次尝试所能覆盖的任务范围。
本文数字与结论均来自这一篇论文,尚无外部复现;部分开源模型也没有公开完整训练配方,因此证据主要是观察性的。
一次更准,多试几次却未必更强
先区分两个容易混在一起的指标。
pass@1 是每道任务只做一次时的成功率,衡量日常单次使用是否可靠。pass@K 则允许尝试 次,只要其中一次成功,就算这道任务被解决。它衡量的是“解法覆盖度”:模型是否还保留着一些不常出现、但可能有效的路线。
所谓概率“变尖”(sharpening),就是模型原本会在多种答案或行动之间分配概率,后训练后却把更多概率压到少数选项上。好处是最常输出的做法更稳定;代价是罕见路线更难被采样出来。像一支球队把一套战术练得很熟,常规比赛更稳,但不断重赛时,可尝试的变化反而少了。
作者比较了 Gemma-4、Ministral-3、Qwen2.5 和 Qwen3.5 四个模型家族,共 14 组基础模型与后训练模型,并在 BFCL、WebShop、ACEBench 三个智能体基准上形成 42 个评测案例。模型规模从 3B 到 35B 有效参数不等。
基础模型并没有直接裸跑。研究给它们配了一套轻量推理框架:简单的系统提示,加上更宽松的工具调用和结果解析接口。它不针对某个数据集,也不改模型参数,更像是给一个不熟悉办事格式的人一张流程卡。这个框架在基础模型原本较吃力的任务上提升明显。例如,论文表格中 BFCL 的单次指标从 5.59 提至 15.63,覆盖指标从 15.19 提至 49.13;WebShop 则从 6.32 提至 9.73、从 39.48 提至 49.15。ACEBench 上没有同样收益。作者还发现,这套框架用于后训练模型时反而会损害表现,因此最终比较采用的是:基础模型加轻量框架,后训练模型使用数据集默认设置。
结果出现了清楚的分叉。后训练模型在 pass@1 上领先,但基础模型的 pass@K 随尝试次数增加得更快。预算提高到每题 128 次时,基础模型在多数基准上追平或超过后训练版本。论文给出的一个例子是 WebShop 上的 gemma-4-31B:基础模型覆盖率超过 85%,后训练模型约为 56%。这不代表基础模型在普通的单次运行中更强,只说明预算足够、又能从多次结果中找到成功尝试时,它可能触及更多任务。
后训练把中间地带挤掉了
论文进一步把每道任务按 128 次运行的结果分成三类:次次成功、增加尝试后能够成功、始终失败。
WebShop 上,gemma-4-31B 的基础模型有 87.6% 的任务处在“多试可以成功”的中间地带。后训练后,这一比例降到 30.0%。与此同时,次次成功的任务从 0.0% 增至 26.0%,始终失败的任务也从 12.4% 增至 44.0%。
这解释了表面的矛盾。后训练不仅把一部分任务推向“总能做对”,也把另一部分推向“怎么试都不对”。输出因此更一致,第一次更容易成功;但中间地带缩小后,追加计算预算的回报也下降了。
作者将这种损失概括为 Sharpening Tax,即“变尖税”。它不是简单比较两个终点,而是观察整条 pass@K 曲线:随着尝试次数增加,模型还能从额外计算中找回多少失败任务。后训练模型相对于基础模型少获得的这部分扩展收益,就是它支付的税。
在 42 个模型—基准组合中,预算向 128 次增加时,有 36 个组合的税上升。大模型的税通常更明显;小模型在预算很少时,税有时为负,说明此时把有限概率集中到可靠路线反而划算。说白了,“变尖”不是天然的坏事。只运行一次时,稳定很重要;允许大量尝试、又看重罕见解法时,覆盖面才更值钱。
论文还称,只用一半任务、每题 8 次运行得到的早期估计,就能较好预测另一半任务在更大预算下的税;它也与后训练前后的输出一致性差距相关。不过材料没有给出这些相关系数的具体数值,暂时不宜把“较好预测”推广到论文之外的模型和任务。
能不能既可靠,又别过早收窄
作者提出 posterior-tempered group sampling(PTGS,可理解为“按任务难度调温的分组采样”)。采样温度控制输出的随机程度:温度高,模型更愿意探索;温度低,输出更集中。
固定温度对所有任务一视同仁。PTGS 则在训练过程中累计每个提示的成功与失败记录,估计它当前有多难。模型总做不对的任务会被“加热”,鼓励尝试不同路线;已经掌握的任务会被“降温”,巩固可靠做法。它只改变强化学习收集训练样本的方式,不改 PPO、GRPO 等强化学习算法本身,测试时也不再使用这套调温器。
作者用 Qwen2.5-7B-Instruct 在 Sokoban 和 FrozenLake 两个环境中训练,每组运行 200 步,并报告五次实验的平均结果。在 Sokoban 上,PPO 的单次成功指标为 46.5、覆盖指标为 55.0;加入 PTGS 后分别升至 61.1 和 69.7,Sharpening Tax 从 0.094 降至 0.081。GRPO 加入 PTGS 后,覆盖指标从 55.3 升至 72.5,税从 0.081 降至 0.025。
FrozenLake 上的变化较温和,但方向类似:PPO 加 PTGS 后,单次指标从 63.7 升至 65.0,覆盖指标从 74.1 升至 80.0;GRPO 的两项指标则从 63.4、77.8 升至 67.3、81.2。也就是说,在这两个环境里,覆盖损失至少有一部分并非提高准确率不可避免的代价,而与训练时如何采样有关。
真正值得看的,是评价尺度变了
这项工作的价值,不是给“RL 到底有没有学习”盖棺定论。它提醒我们:只看第一次答对多少,可能会把“更稳定”误当成“能力边界更远”。如果任务允许反复尝试,或者人们期待模型找到少见但有效的路线,那么还要问一句:训练之后,那些低概率的可能性还在不在?
局限与未知
- 14 组模型的预训练与后训练数据、具体配方并未完整公开,研究无法因果地区分哪些变化来自 RL、SFT、DPO 或训练数据。
- 覆盖率比较依赖测试时预算和轻量框架;基础模型在
pass@K上反超,不能外推为单次使用也更强。 - PTGS 只在两个智能体环境中由同一团队验证,尚无独立复现。现有证据支持“准确率与覆盖率存在权衡”,但没有证明后训练只是变尖、完全没有学到新能力。