你让机器人收拾桌面,它若只想象“杯子已经放进柜子”的终局,仍可能不知道下一步该先靠近杯子、调整夹爪,还是直接抬手。另一种办法是生成从现在到完成任务的整段视频,但这既慢,也容易让早期的小误差一路累积。ProWAM 选择了中间路线:先想象少量、按顺序排列的关键画面,再让动作围绕这些画面逐步展开。
这项工作把机器人控制从“一次猜终点”推进到“沿途看路”。不过,本文目前是一篇 arXiv 预印本;方法、指标和优势判断均来自作者团队,尚无独立复现。
不拍完整电影,只画几张分镜
ProWAM 是一种渐进式世界动作模型。世界动作模型(World Action Model,WAM)把两件事放进同一个系统:预测接下来会看到什么,以及决定机器人该怎么动。这样,模型的视觉想象可以直接服务于控制。
此前的做法大致落在两个极端。一类生成密集的未来视频,相当于行动前先拍一遍完整预演。它能提供细致的短期提示,却需要让大型视频模型反复运行。另一类不生成未来画面,或者只预测一张终点图,速度更快,但缺少中间过程。
ProWAM 改成生成“视觉子目标”——任务途中应该依次出现的关键画面。比如拿起杯子时,可以依次表示夹爪靠近、夹稳杯身、杯子离开桌面。它们像导航中的途经点,只保留重要节点,不必补齐每一帧。模型同时预测这些子目标和可执行动作,不需要另设一个高层规划器。
关键在于,这些画面不是固定绑定到某个绝对时刻。每个子目标都用归一化进度标记,也就是用“剩余任务走到几成”来定位。轨迹长短不同,仍可共用同一套进度尺度。机器人每次看到新画面并重新规划时,又会以当前状态为起点,重新预测后面的途经点。换句话说,计划会随着执行进度不断重新锚定,而不是开局定好后一路照搬。
这和本刊 9 月 27 日报道的 World Action Agent 有相近方向:都让机器人在行动前进行视觉推演。区别在于,ProWAM 把推演明确组织成一串按进度排列的稀疏子目标。
视觉负责想,动作负责跟
模型内部有两个相互配合的部分。视频专家负责预测近期视觉变化和多个子目标;较轻量的动作专家读取当前观察、任务指令与这些子目标,生成一小段底层动作。
两者之间的信息流是非对称的:动作部分可以读取视觉计划,视觉部分却不读取动作信息。作者希望借此保留视频模型原有的视觉生成能力,避免动作信号反过来改变视觉预测路径。训练也分两步。第一步只用没有机器人动作标注的视频,让模型学习场景如何变化,以及不同进度可能对应什么画面;第二步再用机器人示范联合微调,把视觉计划和实际动作接起来。
这一点很实际。机器人示范需要记录画面与动作之间的对应关系,采集成本高;普通视频没有动作标签,却可以提供大量视觉变化。ProWAM 的设计让后者也能用于训练子目标预测。论文没有在所给正文中量化这种预训练究竟节省了多少机器人示范,因此这里更适合把它看作一种扩展训练数据的路径,而非已经证实的成本结论。
执行时,ProWAM 也没有反复生成完整视频。每次重新规划,它只让视频骨干网络运行一次,计算并缓存子目标特征。缓存可以理解为提前写好的视觉提纲。随后,动作专家反复读取这份提纲,通过 action denoising——从带噪声的动作候选中逐步还原可执行动作——完成控制。收到新观察后,模型再更新子目标和缓存。作者报告,这种做法只需一次视频骨干前向传播,后续主要执行轻量的动作去噪。
数字说明了什么?
作者把重点放在分布外测试,也就是让机器人面对训练时没有见过的场景变化。在 LIBERO-Plus 上,ProWAM 的成功率为 85.8%,高于表中此前最好的 Image-WAM 的 83.1%。在带场景随机化的 RoboTwin 上,它达到 75.7%,比表中最强的既有 WAM——MV-WAM 的 55.7%高 20.0 个百分点。论文汇总称,在仿真基准上的最高相对增益为 35.9%;这是相对增幅,不是提高 35.9 个百分点。
预训练对随机化场景尤其明显。去掉第一阶段的视频预训练后,ProWAM-Base 在随机化 RoboTwin 上从 75.7%降到 67.4%;但在干净场景中,两者分别为 85.8%和 87.6%,差距并未朝同一方向发展。按作者的解释,视频预训练的主要价值更可能体现在应对视觉环境变化,而不是熟悉场景中的基本执行能力。
真机零样本实验也给出了一个醒目的结果。“零样本”指模型没有针对测试环境收集专门示范或重新训练。论文在 Franka 机器人和四类操作任务上报告,ProWAM 平均成功率为 70.0%,DreamZero 为 55.0%,相差 15.0 个百分点,折算为相对提升约 27.3%。一次失败案例也暴露了边界:当模型把两个方块想象得模糊地粘在一起,关键接触位置不清,机器人随后偏心释放并让方块掉落。视觉计划不必像照片一样精细,但与任务有关的几何关系不能错。
为什么值得关注
这项工作的意义不只是多预测几张图。它给长时程控制提供了一种清晰折中:完整视频太贵,单张终点又太粗,于是只预测足以约束执行的关键节点。更重要的是,这些节点会随当前观察更新,使“想象”进入闭环控制——机器人行动、重新观察,再修订后续计划。
如果这条路线经得住进一步验证,世界动作模型的竞争重点可能不再只是“能否生成未来”,还包括“应该生成哪些未来,才能真正帮助行动”。ProWAM 给出的答案是:不必把未来逐帧画完,但要让机器人知道自己正在经过哪几个阶段。
局限与未知
- 所有结果均为作者自报。论文材料未充分交代各项结果的试验次数、方差或置信区间,真机任务的完整配置也需要进一步核查。
- RoboCasa365 的表格把 ProWAM 列为总体第 4,成功率为 48.1%,Composite-Unseen 为 18.2%;但正文另称“总体第 2”。两处表述冲突,因此本文采用可直接核对的表格排名,不把该结果写成领先。
- 不同基准的 85.8%、75.7%、48.1%、18.2%和 70.0%对应不同任务与设置,不能直接横向比较。作者所称的 SOTA 和分布外优势,也仍需第三方复现确认。