你问一个 AI:“球落地后会不会反弹?”它答得很准。接着让同一个 AI 把过程生成视频,球却贴在地面上,一动不动。两份答案单看都可能像模像样,放在一起却讲了两个不同的未来。
这正是论文《One Model, Two Physical Stories》要检查的问题。世界模型——根据当前环境推演接下来会发生什么的系统——正开始同时输出文字、视频和物理状态。物理状态是用位置、速度、接触关系等变量概括场景,比完整画面更方便计算。但输出越多,一个更根本的风险就越突出:它们是否真的在描述同一个世界?
论文于 2026 年 9 月 13 日提交至 arXiv。以下实验结果均来自作者报告,尚无独立复核。
别只看每份答案像不像真
过去检查生成视频,常问画面是否自然、运动是否符合常识。这篇论文换了一个角度:把同一初始条件下的几份“证词”并排核对。
作者区分两种失配。内部失配,是同一模型的文字预测与生成视频不一致,例如文字说球会反弹,视频里却没有反弹。外部失配,是生成结果与解析物理环境不一致,也就是视频没有遵循作为参照的物理演化。前者检查模型有没有自洽,后者检查它是否正确。一个模型可以言行一致但一起答错,也可以视频碰巧正确、却与自己的文字推理相反。
这种区别很重要。若世界模型用于机器人规划、反事实评估或合成训练数据,画面逼真并不够。系统必须保留摩擦、碰撞和延迟等条件改变后应有的效果。会背出规律,也不等于生成的未来真的照规律运行。
给不同输出签同一份“合同”
难点在于,文字和视频不能直接相减。作者因此设计了“预测契约”:先把各模态的答案整理成一组可核对的项目,包括事件是否发生、幅度有多大,以及关键时刻和位置。
例如,文字给出“反弹、反弹到若干个球直径”;视频则通过追踪像素中的球,恢复其运动轨迹,再换算成以球直径为单位的高度。这样比较的是反弹对反弹、位移对位移,而不是凭观感判断视频“差不多”。这套流程也会识别物体消失、凭空出现、变形或瞬移等退化情况;只有可测量的视频才获得数值评分,退化在无条件评分中按失败处理。
实验使用 Isaac Sim 6.0.1(基于 PhysX 的可控物理仿真环境)提供外部参照,并审计 Cosmos3-Super。论文称,该模型拥有分别负责理解与生成的 31.2B 参数流,其中共享参数为 1.6B,并通过双向联合注意力连接。它不是两个完全无关的模型,但两条路径执行的大部分参数仍然不同。
作者围绕四种机制和 20 组设置做参数扫描:反弹、斜面摩擦、水平推动和摆动。另有抓取作为补充场景。统一的像素追踪器先在六段无损仿真视频上验证,事件类别识别为 6/6;正式研究共按统一规则评分 448 段视频,其中中性提示实验包含 160 段、每段 81 帧。
文字会算,视频未必照做
最鲜明的结果来自两条输出路径的反差。面对 20 组参数设置和两种摆动问题措辞,文字路径在 22 次测试中全部答对;图像加文字路径严格计分为 19/22,另外三次回答耗尽了 4096-token 预算,未能解析出最终答案。
中性提示只告诉视频生成器场景和参数,不直接说结果应当怎样。论文报告,这些视频经常与正确的文字答案及仿真环境不一致。这里的“经常”没有给出一个可概括全局的比例,因此不能写成视频必然失败;不同机制的表现也不同。
不过,参数扫描揭示了值得警惕的模式。斜面实验的八个随机种子,在六组设置中都保持同一种结果类别。水平推动有七个种子如此,反弹有六个。换句话说,决定结果的物理参数变了,许多视频的结果却没有跟着变。
作者还比较了两类很小的提示改动。只改约 120-token 提示中的一个参数数字,视频常常不响应;直接写“方块滑下斜坡”或“方块保持不动”,却能让相同随机种子的结果翻转。这说明生成路径不是完全听不见提示。它更容易听懂“发生什么”,却未必把决定结果的数字转换成相应运动。
提示能开运动开关,却拧不准刻度
作者设计了两架干预“梯子”。A ladder 逐步向视频路径补充模型自己在文字中给出的事件、幅度和关键帧,用来缩小内部差距;B ladder 则补充经物理环境修正的信息,用来缩小外部差距。两者都从只给场景和参数开始,随后依次增加事件、幅度和关键帧。
实验还故意加入错误指令,以判断变化究竟来自语言,还是模型自行读懂了物理参数。结果显示,语言确实能控制事件是否发生:在斜面场景中,更具体的正确提示可让更多种子开始滑动;在摆动场景中,“保持悬挂、不摆动”的错误指令压制了八个种子中的五个。
但幅度明显更难控制。推动实验里,每一层提示都有部分视频出现滑动,移动距离却大致固定,不随给定条件变化。摆动视频即使动起来,也会出现幅度过大。更丰富的提示没有稳定、单调地提高物理准确度,有时还伴随更多退化。说白了,语言比较像一个“动或不动”的开关,还不像能精确控制运动量的旋钮。
为什么这比单项画质更值得看
这项工作的价值,不在于又列出一批“不符合物理”的视频,而在于把三个问题拆开:模型会不会推理、不同模态是否一致、生成结果是否符合外部物理。文字答对只能证明第一件事,不能替后两件事担保。
这也改变了世界模型的评测重点。若分别给文字和视频打分,我们可能得到两个不错的单项成绩,却漏掉它们互相冲突。跨模态一致性审计——用专门测试寻找系统性失灵条件——要求模型不仅交出几份像真的答案,还要让这些答案共同指向一个可核对的未来。
局限与未知
- 研究只测试一个模型系列、四种主要机制和八个参数扫描随机种子。结论不能外推到所有多模态世界模型。
- Isaac/PhysX 是仿真参照,不是现实硬件。实验说明模型与这一受控环境不一致,不等于覆盖了真实世界的全部物理复杂性。
- A、B 两条梯子的最终配对实验只有 32 段视频,作者也将其定位为诊断,而非足以比较两条改进曲线的统计结论。论文据此提出统一骨干可能难以同时兼顾正确推理、内部一致性和外部物理真实性;这是作者的推论,不是已被证实的普遍能力冲突。