一段机器人预测视频看起来很逼真,不代表它真能把杯子放进水槽。问题在于,两类模型长期参加的是不同“考试”:世界模型——预测下一步环境会怎样——多做开环评测,只看固定记录上的预测质量;Vision-Language-Action(VLA)模型——把画面和指令直接变成动作——则在闭环环境中行动,看任务是否完成。前者像把路线画得漂亮,后者才真的上路,成绩自然不能直接比较。
这份综述梳理了2017至2026年的160项经网页核验的基准。最值得注意的是,138项与模型类型无关,只有11项(7%)明确比较VLA与世界模型;更只有4项会把预测转成实际动作并执行。换句话说,现有评测大多还不能回答“世界模型是否让机器人更强”:画质或预测误差只是代理指标——用容易测的数字代替真正目标。作者没有断言世界模型有效或无效,而是提出,公平答案需要让两类模型在同一闭环任务中正面对比。