Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.069 — 2026-09-11
PAPER HF 59 约 7 分钟

OpenWAM:世界动作模型走向模块化

OpenWAM把世界理解与机器人控制拆成可替换模块,让不同预训练路线终于能放在同一张实验台上比较。

你让机器人收拾餐桌,它不能只会“看懂”杯子正在移动,还得把判断变成机械臂能够执行的动作。问题是,今天不少系统把看世界、预测变化和控制身体揉成一个黑箱。效果变好了,研究者却很难说清:究竟是视频知识更有用,还是动作模块更强,抑或只是训练数据更多。

OpenWAM想解决的就是这个问题。它不是只推出一个新的机器人模型,而是搭了一套开放、模块化的研究栈——把原本绑在一起的部件拆开,让研究者能够一次替换一个部分,系统比较不同的世界动作模型预训练路线。

这里的世界动作模型(World-Action Model,WAM),指的是一种同时学习两件事的模型:预测环境接下来可能怎样变化,并生成机器人应该采取的动作。它通常希望继承视频生成先验——模型从大量视频中学到的物体、运动和场景变化规律——再通过具身经验,把这些视觉知识接到真实可执行的控制信号上。

下文的设计结论、数据规模和性能描述均来自 OpenWAM 团队于 2026 年 9 月提交的论文及项目材料,目前应视为团队自报结果,尚无独立复现支持。

先把黑箱摆上实验台

OpenWAM由三部分组成。

第一部分是 OpenWAM-Infra。它把生成骨干、视觉表征、模型架构、信息流、推理、训练、部署和评测拆成可组合模块。生成骨干可以理解为负责预测画面与状态变化的主引擎;视觉表征则是模型把图像压缩成内部信息的方式;信息流决定“对世界的判断”怎样传给“动作决策”。

这种拆分的价值不在于组件数量多,而在于控制变量。好比比较两种咖啡豆时,最好使用同一台机器、相同水温和研磨方式。否则味道不同,未必来自咖啡豆本身。过去的 WAM 往往连骨干、数据、训练办法和动作设计一起更换,很难判断改进来自哪里。OpenWAM-Infra试图提供一张共同的实验台。

第二部分是 OpenWAM-Study。团队利用这套底座做受控实验,集中追问三个问题:模型应该从上游视频模型继承什么;世界学习与动作学习应该怎样配合;这种配合在扩大训练规模时会发生什么。

第三部分是 OpenWAM-α。它把研究中总结出的设计原则组合起来,成为一个经过大规模预训练的具体模型。换句话说,Infra是实验台,Study是对照实验,α则是依照实验结论装出的整机。

世界知识不能直接变成动作

OpenWAM-Study首先指出,上游知识能否顺利迁移,取决于两个条件:生成骨干要有足够能力,同时还要使用紧凑但信息丰富的潜在空间。

潜在空间是模型内部对画面和状态的压缩表示。它不保存每个像素,而是尽量留下与物体、运动和场景变化有关的信息。可以把它看成一份高度压缩的现场笔记:太简略会漏掉关键变化,太杂乱又不利于后续动作模块使用。

但仅仅“看懂未来”还不够。团队的受控实验认为,世界学习与动作学习要真正形成协同,还需要三项设计。

首先,动作部分必须拥有独立且足够的容量。动作不是世界预测顺手附带的结果,而是一项需要专门资源的任务。其次,系统需要显式的 world-to-action 信息流,也就是明确建立从世界判断到动作生成的通道。最后,两部分需要进行 synchronized joint denoising,即同步联合去噪。去噪可以理解为模型从混乱、带噪的候选结果中逐步还原合理输出;“同步联合”意味着世界变化与机器人动作不是各自生成后再拼接,而是在同一个过程中彼此协调。

这三点共同表达了一个朴素判断:知道杯子下一秒可能往哪里移动,并不等于知道机械臂该怎样抓。系统既要保留世界知识,也要给动作学习留出自己的能力和清晰的接入路径。

人类视频负责见世面,机器人数据负责落地

OpenWAM-Study还把具身预训练的主要收益指向分布外泛化。具身预训练,是让模型在正式执行具体任务前,先从带有身体与动作关系的数据中学习。分布外泛化则是模型面对训练中不熟悉的场景、物体或任务条件时,仍能工作的能力。

团队认为,这类预训练的主要作用未必只是把熟悉任务做得更好,而是提高模型应对陌生条件的能力。为此,他们采用一阶段联合训练,把第一视角人类数据与机器人数据放在同一阶段学习。

第一视角数据是从行动者视角拍摄的画面,接近人或机器人“眼中看到的世界”。人类数据提供更广的世界覆盖,让模型接触更多活动与场景;机器人数据则提供动作 grounding——把抽象理解落实到机器人真正能够执行的控制信号。前者帮助模型见世面,后者告诉它自己的身体究竟能做什么。

OpenWAM-α使用约 6,400 小时的第一视角人类与机器人数据预训练。项目材料给出的精确口径是 5.185 亿帧、6,369 小时,两种说法属于四舍五入差异。

它为什么值得现在关注?

团队在 8 个仿真基准和真实机器人实验上评测 OpenWAM-α,覆盖单臂、双臂与灵巧手等不同 embodiment。embodiment可译为具身形态,指机器人拥有怎样的身体和动作机构。能在多种形态上评测,至少说明这套研究框架并非只围绕一种机械臂设计。

论文称 OpenWAM-α从仿真到实体机器人都保持了“top-tier”水平。不过,这属于团队自己的概括。当前材料没有提供各项基准的具体分数、对照模型和差距,因此不能把它写成已经得到独立确认的领先结论。

相比这句性能宣称,OpenWAM更值得关注的地方或许是研究方式。世界动作模型正在把视频生成与机器人控制接到一起,但如果每个系统都以整机形式出现,研究者很难积累可以横向比较的知识。OpenWAM试图把问题改写为一组可检验的选择:该继承哪种表示,世界信息怎样流向动作模块,联合训练该如何进行,不同数据各自贡献了什么。

团队还表示已经公开代码仓库,并计划或宣称提供基础设施、评测协议、预训练模型和数据配方。如果这些资产能够完整下载、按统一协议运行,并被外部团队采用,OpenWAM才可能从一个模型项目变成公共实验底座。它的长远价值也将更多取决于可复现性,而不只是 OpenWAM-α 本身的成绩。

局限与未知

  • 当前证据全部来自同一研究团队。所谓“持续达到顶尖水平”尚缺少独立评测与外部复现,也无法据现有材料判断不同基准上的领先幅度。
  • 论文摘要没有披露 8 个仿真基准的逐项指标、基线版本及训练数据是否公平可比,也未给出各项设计原则对应的具体消融数字。
  • 代码仓库虽已可见,但“完整研究栈已经发布”仍需逐项核验:模型权重、数据配方、评测资产能否实际取得,以及许可证是否覆盖全部依赖与数据,目前材料没有说清。

供稿材料 SOURCES — 1

← 返回 2026-09-11 · 学术板块