你教机器人收拾桌面,最费钱的不是拍下杯子和抹布,而是记录它每一刻看见什么、关节怎么转、夹爪何时开合。普通视频很多,这种与动作逐帧对应的机器人轨迹却很贵。ZimaBlue 想换一条路:先让模型大量观看人和机器人的第一人称视频,学习物体如何移动、接触和变化,再用规模较小的动作数据教它真正控制机器人。
值得现在看,是因为它追问了机器人学习里的一个核心问题:从视频中获得的“生活经验”,能否迁移到没有练过的任务和场景。论文作者给出的答案相当积极,但目前证据全部来自作者团队,尚无独立复现或第三方评测。
不只学“下一步怎么动”
常见的 Vision-Language-Action 模型,简称 VLA——把视觉、语言指令直接映射成机器人动作——可以理解“把杯子放进水槽”是什么意思。但知道目标,不等于知道杯子被碰歪后会怎么滑、夹偏了该如何调整。模型若主要依赖带动作标签的示范,这类物理经验也受制于示范数据的规模。
ZimaBlue 采用 World Action Model,简称 WAM,即“世界动作模型”。它把两个问题放在一起学习:接下来画面会怎样变化,机器人又该采取什么动作。这样,抓偏、遮挡或物体滑动不再只是画面里的噪声,而是动作与后果之间需要解释的关系。
这里的关键资源是第一人称视频,也就是从行动者视角拍摄、常能看到手、工具和物体互动的视频。它通常没有机器人可以直接执行的动作指令,却能提供运动、接触和任务过程方面的经验。
三步把视频经验变成控制能力
ZimaBlue 的训练像一座由宽到窄的数据金字塔。
第一步是因果式视频预训练。模型从过去的画面和语言指令预测未来画面,只使用已经发生的信息,适应机器人实际运行时逐步接收观察的方式。训练材料混合了人类第一人称视频、模拟操作轨迹和真实机器人视频,研究规模最高超过 12 万小时。论文还采用统一的三视角画布:缺少某个机位时就补空,并用掩码告诉模型哪些区域无效。
第二步是 video-action mid-training,也就是视频—动作中期训练。此时才加入带动作标签的机器人轨迹,让视觉变化与可执行动作对上号。数据来自多种单臂和双臂机器人。由于不同机器人的控制接口并不相同,作者设计了一个 100 维统一状态—动作空间:机械臂末端、夹爪、关节、躯干、移动底盘和灵巧手分别占据固定位置;某台机器人没有的部分填零,并用有效性掩码排除训练监督。
这一步好比先统一表格栏目,再汇总不同机器人的操作记录。模型不必假装所有机器人身体相同,但可以在共同的语义位置上学习“哪个部件做了什么”。动作还以每段轨迹开头的机器人状态为参照,减少不同坐标系和场景之间的错位。
第三步才面向目标机器人做专门化训练,校准它的控制接口、环境和任务分布。因此,“先看视频再学动作”只是通俗概括:ZimaBlue 并非只看无动作视频就能直接开机器人,中间仍需要带动作标签的多机器人轨迹,最后还需要目标机器人的数据。
慢系统想后果,快系统管动作
WAM 的现实麻烦是速度。预测未来画面通常比直接输出动作更费计算,而机器人遇到抓取失败或碰撞时,不能一直等模型“想完”。
ZimaBlue 因此采用异步 Slow-Fast 双系统。Slow 是参数规模约 5B 的大模型,负责较慢地推演视觉变化,并留下各层的 K/V cache——可理解为模型处理时保存的中间线索。Fast 是约 0.5B 的轻量分支,它读取这些线索,同时接收最新画面和机器人自身状态,快速更新动作。Slow 不必每个控制周期都重新运行;新结果准备好后,再异步交给 Fast。
作者还用蒸馏把两个分支各自所需的 DiT 计算从八次降到两次,并配合编译优化。论文报告,在 NVIDIA RTX 4090 上,Fast 可实现约 33 毫秒一次的控制循环,即 30 Hz 动作预测。这个数字只对应该显卡和论文设置,不能直接理解为任何硬件上的完整机器人系统都能达到 30 Hz。
数据扩展真的带来了什么?
作者把重点放在 zero-shot,也就是测试任务没有出现在训练数据中的评测。只做目标机器人训练时,真实机器人成功率为 36.1%;加入跨机器人视频—动作训练后升至 46.1%;再加入 6 万小时视频预训练,达到 66.9%;扩展到 12 万小时后达到 77.8%。这条递增曲线支持作者的核心判断:广泛的视频经验可能帮助机器人应对没有示范过的任务,而收益不只来自同一台机器人的动作记忆。
在标准基准上,论文称 ZimaBlue 在 LIBERO-Plus 中超过所有参与比较的 WAM 方法,在 RoboTwin 2.0 上具有竞争力;在 RoboCasa365 中,整体成绩仅次于使用 10 万小时真实机器人数据的 VLA 模型 Xiaomi-Robotics-1。作者强调,优势在未见任务上尤其明显。
这项工作的意义不只是多收集了一批视频。它把不同数据分工得更清楚:普通视频负责提供广泛的视觉和物理经验,多机器人轨迹负责把变化与动作对齐,目标机器人数据负责最后的精确控制。如果这条路线经得住独立验证,机器人能力的扩展就不必完全跟着昂贵的动作示范数量走。
局限与未知
- 36.1% 到 77.8% 的真实机器人结果仍缺少足够上下文:材料没有完整交代具体任务集合、样本量、成功判定、误差范围,以及各组是否采用完全相同的训练与评测设置。因此,不能把全部提升简单归因于视频时长。
- “超过 12 万小时”可能混合人类与机器人视频。论文材料没有充分说明各类数据占比、去重方式与质量分布;zero-shot 的严格边界也仍需结合完整评测设置判断。
- “可泛化”“表现强劲”等结论目前来自作者自己的论文与基准比较。它们展示了值得追踪的方向,但还不是已经获得独立验证的定论。