机器人抓箱子时,光看见位置还不够:夹松了会掉,夹紧了又可能超过受力上限。这项工作训练了一个约 65 万参数、从随机权重开始学习的世界模型——也就是机器人脑内的小型模拟器——把视觉、触觉、动作、奖励和接触力连起来,预判下一步抓取会怎样发展。
最值得注意的是,预测变准和决策变好并非一回事。加入视觉触觉信息后,模型对“动作会怎样改变受力”的平均绝对误差从简单沿用上一时刻力值的 0.413 N 降至 0.338 N。作者自述,在训练分布内的 MuJoCo 刚性箱体实验中,用模型辅助力反馈后,满足受力预算的成功率从 73.3% 升至 93.3%;但这项差异出现在统一执行的脚本化下降阶段,换到质量、摩擦等物理参数发生偏移的环境,优势不再成立。
另一个提醒更直接:让 Actor-Critic——一套“选动作、评动作”的学习机制——在模型想象出的经历里练习,综合成功率只有 11.9%,低于直接根据真实记录学习的 IQL 的 25.0%。因此,这项工作的价值更像一次严格体检:力预测有用,但还不能自动兑换成可靠的抓取策略,更不构成闭环安全保证;论文也未测试真实机器人迁移。