Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER H 48 约 6 分钟

世界运动模型:先学会生成三维轨迹

WMM 不先画视频,而先生成物体的三维运动轨迹,让预测、规划与控制共用一种语言。

你让机器人把桌上的积木推到指定位置,它不仅要“看见”积木,还得判断积木会怎么动、机械臂该怎么走。用视频来想象未来当然可以,但像素同时混着外观、光照和视角变化,真正有用的三维运动反而藏在里面。Jiahui Lei、Qianqian Wang、Trevor Darrell 和 Angjoo Kanazawa 提出的 World Motion Models(WMMs),换了一个更直接的目标:不先生成未来画面,而是生成关键实体的三维姿态轨迹。

这里的姿态用 SE(3) 表示,也就是一个刚体在三维空间中“位于哪里、朝向哪里”。把连续时刻的姿态串起来,就是姿态轨迹。论文把这种稀疏轨迹当作动态世界的共同语言,希望同一套模型既能预测物体运动,也能规划机器人动作。

把世界压缩成几条运动线

真实场景很复杂,但其中许多运动可以近似拆成少量刚性部分。相机或积木可以各用一条轨迹表示;人体虽然会弯曲,也能拆成若干近似刚性的骨骼部分;机器人则可拆成连杆和末端执行器。论文把这种做法称为对动态三维世界的“分段刚体”近似。

它带来的压缩很直观。模型不必追踪人体网格上的成千上万个点,只需记录几十个关节的位置和朝向。每个实体在每个时刻的姿态,都是一个 token——可以理解为模型处理的一张小卡片。卡片上的“哪里”是姿态,“什么”则由语义或局部几何特征补充。整个场景由许多实体、许多时刻的卡片组成。

这不是完整的三维世界重建。它不负责生成每个像素或每处表面,而是抓住与预测和控制关系最密切的运动骨架。论文据此声称,人体、手与物体的交互、相机运动、分段刚性的场景变化,以及机器人的状态和动作,都能进入同一个表示空间。

关键不是往后猜,而是任意补空

普通的时序模型通常沿时间单向工作:给出过去,预测未来。但实际任务不总是这样。机器人可能已知起点和终点,需要补出中间动作;也可能看见目标状态,反推动作;还可能拿到人的运动,让模型生成机器人对应的运动。

WMMs 的关键设计,是给每张姿态卡片单独设置噪声水平。有些卡片保持清晰,代表已知条件;有些被噪声覆盖,代表需要生成的部分。模型采用 flow matching——学习如何把噪声连续推回合理数据——一次处理整片卡片,并恢复未知内容。

这像一张可以任意挖空的运动表格:横向是时间,纵向是实体。遮住未来,模型就做未来预测;保留起点和终点、遮住中间,它就补全动作;保留状态、遮住动作,它就做逆运动学或策略生成。论文将这种能力称为 any-to-any marginal conditioning,即已知与未知可以按不同方式划分。任务切换主要靠更换 mask,也就是标出哪些卡片已知、哪些待生成,而不是另换一套网络结构。

论文还加入 context token,处理不属于连续时间线的信息。例如,一个很远的目标状态,或几组人类动作与机器人动作的配对示例,都可以放在独立的“上下文时间线”上,为当前生成提供提示。

六类实验说明了什么

作者在六类 3D 视觉与机器人应用中测试了这一思路,但每个基准分别训练一个 WMM,并非一个模型横跨全部领域。

在桌面推积木的 Language Table 基准上,WMM 的五类任务平均成功率为 87.2%,高于表中 LCB 的 80.0%和 ActionVLA 的 76.8%。同一个模型还可作为可微分的动态模型:在两个绝对位置指令任务中加入模型预测控制(MPC——先模拟若干动作后果,再选择动作)后,成功率分别从 90%升至 100%、从 76%升至 80%。

在 TraceGen 的三维场景未来预测任务中,模型根据一帧 RGB-D 图像和语言指令预测关键点轨迹。论文报告,WMM 在 Droid 与 EpicKitchen 两个子集的 MSE、MAE 和终点误差各列均优于 TraceGen。以 Droid 的一组设置为例,MSE 从 0.206 降至 0.151,终点误差从 0.285 降至 0.200。

在人类动作转 Unitree G1 人形机器人动作的实验中,同一个检查点处理了完整输入、稀疏关键帧和带噪输入三种情况。WMM 的处理速度为 86.97 FPS,高于实时方法 GMR 的 35.03 FPS和离线优化方法 PHUMA 的 2.27 FPS;三种输入下的序列成功率分别为 0.8690、0.8525 和 0.8530,也都高于表中两个对照方法。不过,不同误差指标并非全部由 WMM 取得最优,不能把结果概括成全面领先。

消融实验进一步显示,逐 token 噪声不是装饰。在 Language Table 的 B2B 任务中,完整模型成功率为 0.860;改成所有 token 共用同步噪声后,成功率降至 0。至少在这一设置里,任意划分已知与未知的训练方式直接关系到模型能否成为可用策略。

为什么值得关注

WMMs 最有意思的地方,不只是又做了一个运动生成器,而是尝试把“看未来”“补动作”“反推动作”和“跨形态转换”改写成同一类问题:给定部分三维轨迹,生成剩余部分。

这也为“世界模型”提供了另一条路线。与其让模型先学会生成看起来逼真的画面,再从画面中寻找运动,不如直接学习物体和身体部件怎样在三维空间里移动。对于机器人和空间智能,这种表示离规划与控制更近,也更容易明确指定哪些状态已知、哪些状态需要推断。

局限与未知

  • 论文目前为每个基准单独训练检查点。跨人体、机器人和场景共同训练的统一模型仍是未来工作,因此“统一”主要指表示和方法统一,而非已经得到一个包办所有任务的模型。
  • 当前框架需要深度、几何信息以及估计出的当前和历史状态,尚不能直接只凭普通 RGB 视频完成推断。
  • 模型不能泛化到训练中没见过的新形态;它采用刚体或分段刚体近似,也暂未覆盖缩放、剪切等更一般的局部形变。

供稿材料 SOURCES — 1

← 返回 2026-10-05 · 学术板块