Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.060 — 2026-09-02
PAPER HF 12 约 6 分钟

Matrix-Game 3.5:世界不再逐帧失忆

Matrix-Game 3.5用补丁记忆找回旧场景,尝试让实时生成的世界不再越走越失真。

你操纵角色走出房间,绕过街角,几分钟后再回来。门窗位置变了,桌子凭空消失,角色的衣服也换了样。对普通视频生成,这或许只是一个小瑕疵;对交互式世界模型,却意味着这个世界根本没有持续存在。

Matrix-Game 3.5想解决的正是这种“走远就忘、回头就变”。交互式世界模型不是一次生成一段固定视频,而是根据用户或智能体的动作,持续画出接下来看到的世界,像一台边运行边绘制画面的游戏引擎。它采用自回归生成——把刚生成的内容作为下一步的依据,一步步向前推。这样能持续输出,但小错误也会不断累积。

论文作者团队在Matrix-Game 3.0之上加入三组改进:能按相机几何关系找回旧画面的补丁记忆、把静态环境与动态主体分开保存的世界表示,以及把高质量模型压缩成实时生成器的两阶段蒸馏。团队称,系统可以进行分钟量级的实时交互生成。不过,论文没有给出帧率、分辨率和运行硬件,因此这里的“实时”和“分钟量级”都只能按作者口径理解。

不记整张照片,只记有用的小块

视觉模型通常会把画面切成许多补丁(Patch),再把每个小块编码成模型可以处理的向量。过去的一些记忆方案保存完整画面:镜头回到旧地点时,系统找出一张相关的历史帧,整张交给生成模型。问题是,一张照片绑定了原来的观察位置。新镜头可能只需要其中一扇窗或一段墙,而且需要知道它们在当前视角里应该出现在哪里。

Matrix-Game 3.5把记忆单位缩小到补丁。系统利用历史画面的深度、相机内部参数和相机位置,把补丁中心还原到三维空间;当相机来到新位置,再把这些三维点投影到新画面。说白了,它不是只问“以前见过什么”,还要计算“那件东西现在应该落在屏幕哪里”。

如果多个历史补丁落到同一位置,系统用类似图形渲染中遮挡判断的办法,保留离当前相机最近的表面。看不见、超出画面或几何关系不可靠的补丁会被丢弃;从未观察过的区域则留给生成模型补全。历史画面也不是越多越好。系统逐步挑选能为目标画面增加最多有效覆盖的视角,每个目标帧最多选五个,避免拿回一堆几乎相同的照片。

这套记忆还配合tiled-PRoPE——一种把相机相对位置写进注意力计算的方式。注意力可以理解为模型判断“当前信息该参考哪些旧信息”的机制。tiled-PRoPE让同一个补丁同时带着时间位置和相机位置,使模型知道取回的旧内容与当前视角如何对应。作者明确说明,patch-memory和tiled-PRoPE本身不增加可学习参数;这不等于整个Matrix-Game 3.5没有新增参数。

墙应该记住,角色应该变化

只增加记忆还不够。房间布局应当长期不变,人物和车辆却必须移动。如果系统把奔跑中的角色也写入静态地图,同一个人可能在多个旧位置反复出现,形成重影或错误遮挡。

因此,Matrix-Game 3.5把静态与动态内容分开处理。静态场景进入补丁记忆;动态主体则由轻量的多视角参考token保存身份和外观。token可以理解为模型内部的一小段特征记录。系统用分割和追踪判断人、车辆、动物等对象是否真的在运动:停着的车仍可成为稳定的空间参照,移动后才从静态记忆中排除。判断依据是运动,而不只是对象类别。

在当前的第三人称游戏设定中,动态主体主要指玩家控制的角色。系统从因果上已经可见的初始化画面和历史中提取四张参考图,并在整段生成中固定使用,避免偷看未来画面。四组参考token合计约相当于一张额外上下文帧的长度。这里也能看出论文的边界:它展示的是针对主要可控角色的身份保持方案,并不等于已经解决任意数量动态对象的长期记忆。

从会精修,变成能边走边画

高质量扩散模型通常需要反复修改整段结果,也能同时参考前后信息;实时交互却只能看过去,不能等待未来。这就像把一位可以来回润色的编辑,训练成只能沿着直播字幕向前写、而且几步内就要交稿的人。

作者采用两阶段渐进式蒸馏——把较慢模型的生成能力转移给较快模型。第一阶段使用Perceptual Flow Matching,让学生模型不仅在内部潜表示上接近目标,也在冻结的感知特征空间里保持画面质量,同时适应只能访问过去信息的因果生成。第二阶段使用基于课程安排的Self-Rollout DMD:学生模型不再只看正确历史,而是在自己生成的轨迹上继续学习,逐步加入补丁记忆和上下文条件。这样训练更贴近实际运行时“前面的输出可能已经有偏差”的处境。

最终得到的是三步因果生成器。“三步”指每个生成过程只需少量去噪步骤,而不是只生成三帧。作者称,这套方案支持分钟量级的实时流式交互,并在长程场景召回、相机控制、主体一致性、提示词驱动的世界生成和开放世界交互上表现强劲。

为什么这条路线值得看

这项工作的关键不只是给模型加一块更大的“硬盘”,而是重新规定记忆的组织方式:静态内容按三维位置保存,动态主体按身份保存;旧补丁按新视角重新定位,只在几何证据可靠时使用。记忆、相机控制和动态变化因此进入同一套表示,而不再是几个彼此分离的补丁功能。

这直指长程一致性——模型运行很久后,仍能记住房间布局、物体位置和角色外观。短视频只要几秒内看着合理即可;交互世界一旦允许用户转身、折返和反复探索,就必须接受“旧地点还能不能认出来”的检验。Matrix-Game 3.5给出的答案,是让模型拥有可检索、可重新投影的局部记忆,而不是仅靠有限上下文模糊回想。

训练语料统一覆盖Unreal模拟环境、开放世界游戏和互联网视频。按作者报告,这让同一个系统能够处理多类场景与交互。但目前材料没有披露各类数据的规模和比例,无法判断能力主要来自方法设计、训练数据,还是两者共同作用。

局限与未知

  • 所有效果结论都来自作者团队的技术报告,尚无独立信源交叉验证。论文使用“precise”“stable”“strong performance”等措辞,但现有材料没有提供基准名称、对照模型、定量成绩或统计显著性。
  • “实时”缺少帧率、分辨率、硬件配置和延迟数据;“分钟量级”也没有给出明确上限。因此,它证明到什么程度,仍不能只凭这些标签判断。
  • 系统依赖相机姿态、深度、内参、分割与追踪等自动标注。论文描述了无效投影过滤、遮挡检查和数据筛选,但现有材料不足以说明这些上游估计出错时,长期记忆会如何退化。

供稿材料 SOURCES — 1

← 返回 2026-09-02 · 学术板块