训练推理模型,有点像只在棋局结束后告诉棋手输赢,却希望它知道中间每一步好不好。RLVR(可验证奖励强化学习)正是如此:数学答案或程序测试给出最终得分,但不逐句评价推理。BPO(Bellman Policy Optimization)想解决的,是怎样利用这份最终反馈更新模型,同时不额外训练critic——一个负责估计“走到这里将来能得多少分”的辅助模型。
它最巧的一步,是把Bellman方程带进文字生成。这个方程原本用于倒推每一步的长期后果;在这里,“局面”就是模型已经写出的文字前缀。作者发现,相邻前缀之间的价值差沿整段回答相加后会彼此抵消,最后只留下终局奖励和提示词起点的价值。后者可用同一问题下多次采样回答的平均奖励估计。于是,BPO把策略镜像下降(PMD,一种限制模型更新幅度的策略优化方法)改写成整条生成轨迹上的目标,避开中间状态的价值估计。论文还证明,两种目标在采样策略可到达的状态上具有同一个唯一最优解;实际损失则用“互补词元概率的平滑比值”修正采样策略与当前模型的偏差。作者在Qwen3-30B-A3B-Base和数学推理任务上报告其有效,但现有材料未保留具体准确率数字。