就像裁判看了同一段比赛录像,只因提问换了说法,便给出相反判决。机器人训练也可能遇到这种问题:视觉语言模型(VLM,能同时理解画面与文字指令的模型)常被当作奖励模型——给机器人的动作过程打分,指导它通过强化学习反复试错。但如果分数跟措辞走,机器人学到的方向也会被带偏。
研究者为此制作了 RoboRMBench:固定同一条真实机器人轨迹,只改写目标指令。基准包含 2,390 条轨迹和 21,673 条经语义等价验证的改写,覆盖换词、调整句式和转换行动目标的叙述视角。论文报告,在视角转换幅度较大的测试中,一些通用 VLM 对超过半数轨迹同时给出过“失败级”和“成功级”评分。模型更大或加入显式推理,也没有稳定消除矛盾。
相较之下,接受过“轨迹—奖励”专门监督的 RR-4B、RR-8B 虽然更小,却明显更稳定。作者还发现,在离线挑选最佳轨迹时,措辞矛盾较少的模型能选出真实进度更高的动作。这说明,机器人奖励模型不只要平均打得准,还得做到同义指令不改判。