让机器人把物体插进狭窄位置,难点不只是“看懂要做什么”,还要避免一伸手就抓偏。World Action Agent(WAA)让机器人先在“脑内”彩排:视觉语言模型(VLM——同时理解图像和文字的模型)不直接执行动作,而是在视觉工作区预览候选动作,结合规划反馈反复修改,确认后才真正动手。
WAA 还会自动生成“接触视图”,也就是把镜头拉近抓取、推压或插接的位置,让模型盯住夹爪、物体与目标之间的几何关系;执行后若仍有偏差,它可在同一视图中继续校正。整个流程由多 Agent Harness 组织,即让不同模型角色分别处理观察、排练和决策。
作者报告,WAA 仅使用从 LIBERO-90 演化出的技能,在 LIBERO-Pro 上取得 75.6% 的平均成功率,高于对比方法 ASPIRE 的 72.0%。更值得注意的是,这项工作主要改造模型“看动作、试动作”的方式,而非重新训练一个专用控制模型;不过上述效果仍来自论文作者的基准实验。