你教一个人下棋,如果他大多数时候都能摆出“像棋局”的盘面,却总在连续走几步后犯规,我们不会说他学会了规则。世界模型也有类似问题:它可以把下一帧预测得很像,但一旦连续推演,细小错误就会累积,最后得到一个外观合理、过程却不成立的世界。
Shaoyang Guo 和 Ziming Liu 用细胞自动机测试了这个缺口。细胞自动机是一个由许多格子组成的离散世界。每个格子只看自己和周围邻居,再按固定规则同步更新。规则完全已知,产生的图案却可以很复杂,因此它很适合追问一件事:模型究竟学到了世界如何变化,还是只学会了变化后的样子?
论文考察了基于 CNN、Transformer 和扩散模型的常规世界模型。CNN 是用局部滤镜处理网格的神经网络;Transformer 会把格子转成一串 token——模型处理信息的基本单位;扩散模型则从带噪状态出发,逐步去噪生成结果。下文数字均来自这篇论文,尚无独立复现。
96.3% 正确,为什么仍然算失败?
实验让模型先看 8 帧,再预测后续 8 帧,这段连续推演叫 rollout。作者使用的是严格的整段指标:只有整个序列都正确,才算成功。
这和逐格准确率不是一回事。逐格指标把所有格子分开统计,少数错误很容易淹没在大量正确格子里;整段成功率要求每一步、每个格子都不出错。论文中的标准 CNN 能预测对 96.3% 的格子,却只完成了 18.9% 的 rollout。联合扩散模型更极端:没有完成任何一段完整 rollout。
这种差距不是挑剔指标制造出来的。动力学规则——世界从当前状态走向下一状态的机制——必须能够反复执行。第一步错一个格子,下一步的邻居关系就会改变,错误随后继续扩散。模型“通常猜对”与“真正掌握规则”,在短期看起来接近,在长期却是两回事。
三条断掉的信息链
作者把失败归纳为三个问题:空间局部性、时间局部性和时间稳定性。它们听起来抽象,其实分别对应三个朴素要求:找对邻居、记住前因后果、算完一步再走下一步。
第一,模型要知道哪些格子彼此相邻。Transformer 通常把二维网格按行摊平成一维序列。这样一来,画面里紧挨着的格子,在序列中未必仍是邻居;环形边界两侧的格子尤其容易被拆开。使用一维旋转位置编码时,同一个 Transformer 在 Conway’s Game of Life 上只完成了 39.1% 的 rollout,而且 95% 的错误集中在 28 个边界格子。作者把位置编码改成分别表示行和列的二维旋转位置,参数量不变,结果达到 100%。
关键不在于 Transformer 完全没有表达邻接关系的能力。论文中的模型有时能从数据里学出这种布局,但不够可靠。把二维结构直接写进信息流,相当于明确告诉模型“地图上的上下左右在哪里”,不必期待它每次都自行发现。
第二,模型要把一种局面和它随后产生的结果绑在一起。当前格子的下一状态取决于前一帧中它和邻居组成的局面。常规模型虽然能看到这些信息,却未必会把“当时发生了什么”与“下一刻变成什么”组成便于检索的一对。
作者为每个 token 附上对应格子在上一帧的邻域,让模型查询当前局面时,可以直接找到历史中相同局面及其结果。这个改动只增加了少量参数:同一个较小 Transformer 在未见过的规则上,从 25.8% 升至 99.9%;较大版本则从 85.6% 升至 99.9%。更结构化的 KV shift——把相邻时间点的信息在 key 和 value 之间配对——仅用 2600 个参数便在前三个难度等级上全部达到精确结果,而标准 Transformer 最大有 660 万参数,仍未做到完全正确。这里真正稀缺的不是模型规模,而是正确的信息连接。
第三,模型要先把一帧算稳定,再让后续帧依赖它。联合扩散会同时去噪未来 8 帧。问题是,后面的帧不断依赖尚未确定、仍在修改的前面帧,像拿一份反复改写的草稿继续计算。
作者采用 causal freezing:按时间顺序生成,每完成一帧便将它固定,作为下一帧的干净上下文。在 Game of Life 实验中,同一组扩散模型权重、同样进行 8 次网络调用,完整 rollout 表现从 42.2% 升至 99.9%。作为对照,在台球运动上,联合生成已经达到 99.2%,按顺序冻结后为 100%。作者据此认为,不同动力学对生成顺序的敏感程度并不相同;需要逐步组合局部更新的系统,更依赖稳定的中间状态。
真正重要的不是“模型太弱”
三项修复都没有更换模型的主体架构,只调整了信息如何进入、配对和向后传递。论文提出的判断因此比“再做一个更大的模型”更具体:一个模型即使理论上能看到所需信息,训练也未必会自动学会正确使用它。
细胞自动机的价值正在这里。现实视频中的真实规律往往未知,预测失败时,很难分清是数据不足、视觉复杂,还是模型根本没有学到动力学。细胞自动机把规则写得清清楚楚,使研究者能够逐项检查:邻居是否被正确表示?历史局面是否和结果绑定?中间状态是否在被使用前稳定下来?
这也解释了为什么高像素分数可能带来误导。生成模型擅长匹配表面统计,画出“大体像”的未来;世界模型承担的要求更严,它必须让未来严格来自过去。若连规则明确的离散网格都可能推演失败,那么面对视频或物理过程时,“看起来合理”更不能直接等同于“理解了世界”。
局限与未知
- 主要证据来自确定性的二值细胞自动机及论文设定中的特定模型、训练预算和评测协议,不能外推为所有世界模型都学不会细胞自动机。
- 三类失败模式及对应修复是作者的机制归因。虽然论文尽量固定模型主体进行对照,但这些解释是否具有排他性和普适性,仍需独立研究验证。
- 连续动力学实验仍属探索阶段:causal freezing 在模拟 Burgers equation 上有帮助,在另一项线性系统上则没有同样效果。它能否迁移到更复杂的物理世界和渲染视频,尚无成熟结论。