你让一个 AI 操控镜头穿过房间,几分钟后再走回来。门的位置、墙上的画、桌椅布局,本应和刚才一样,模型却可能生成一个似是而非的新房间。Memorizon 要解决的,就是这种“离开视野便慢慢忘记”的问题。它没有强行让模型记住沿途每一帧,而是教模型在返回旧地时,从有限的历史记忆中找回最相关的画面。
这项工作来自 Tingting Liao、Xuezhi Liang、Hao Li 和 Guangyi Liu 的论文《Memorizon: Training World Models Beyond Their Context Window》。下文数字均来自作者论文及项目材料,尚无独立团队交叉验证。
难点不是走得远,而是回来后还认得
流式世界模型可以理解为持续运行的游戏引擎:它一边接收镜头移动或动作,一边生成下一段世界。生成一分钟以上的视频并不等于拥有一分钟以上的记忆。模型一次能直接参考的信息范围叫“上下文窗口”;早先画面滑出窗口后,它便无法像查看当前画面那样直接回看。
直接扩大窗口很贵。模型使用的注意力机制,会让当前信息与过去片段相互比较。若所有片段都彼此比较,计算量会随序列长度近似平方增长。更关键的是,训练模型保持“重访一致性”——隔很久回到旧地仍保持身份、布局和状态——需要一个训练样本同时包含第一次到访和返回。两次访问若相隔数分钟,短训练片段里根本没有可供学习的对应关系。
Memorizon 抓住了一个区别:为了监督长期一致性,训练样本确实要横跨很长时间;但模型不必同时读取这段时间里的每一帧。
不重看整段录像,只翻相关旧照
它把视频切成若干 chunk,也就是连续的小段。一个训练样本可以覆盖任意长的时间跨度,但只对最后 个 chunk 计算损失,也就是只评分最后几段生成得对不对。中间的大段历史不直接送进模型,而是作为可检索的候选池。
每个被评分的 chunk 都会按 camera co-visibility 检索自己的 top-K latents。latent 是画面的压缩表示;camera co-visibility 则是在问:过去哪几个镜头看见过当前镜头即将画出的区域。作者用视锥重叠和相对相机姿态给候选项排序。
这很像回到一栋旧楼时,不把整段行程录像从头播放,而是按拍摄位置翻出几张相关旧照。关键在于,每个 chunk 单独找自己的旧照。走廊、楼梯和房间需要的记忆不同,不能让整段视频共用一组笼统的检索结果。
各 chunk 请求的内容随后合并成一个共享记忆库。由于每个 chunk 最多取 个条目,记忆库上限为 。因此,训练样本即使横跨更久,真正送进模型的序列也不会跟着无限变长。最短跨度下,这套训练又会完全退化为常规训练,不需要另一套流程。
Memorizon 因而不是“无限上下文”。它只是把样本覆盖多久与模型本次读入多少内容拆开了。能找回什么,仍受 top-K 检索、 容量、相机共视关系和已有历史表示限制。
两个环节,解决两个不同问题
作者的消融实验显示,检索和长跨度训练各自承担一件事。
第一,检索让模型能够使用窗口外的旧画面。与 sliding-window baseline——只保留最近一段内容的滑动窗口基线——相比,检索在每个评测 split 上都提高了重访一致性。把整个短片直接塞进更宽的注意力窗口,并不能稳定替代检索。让整段待评分内容共用一次检索也更差,尤其在网页照片测试上,Revisit 和 Gain 约下降三分之一。原因很直观:一组旧画面很难同时适合多个不同视角。
第二,训练跨度必须长到足以同时覆盖返回和首次到访。按作者报告,做到这一点后,重访一致性还能提高 24%–30%;再继续拉长跨度,则不再带来收益。论文因此把跨度视为“覆盖设置”,而不是越大越好的参数。
这种拆分也控制了成本。加入共享记忆库会带来一次性的单步训练开销,但作者称,把样本跨度从 100 秒扩到 400 秒,step time 只增加 12%。这里的 step time 是完成一个训练步骤所需的时间。不过论文材料没有给出这项增幅对应的硬件、batch size 与完整实现配置,不能把 12% 当成普遍规律。
它真的在读记忆吗?
作者还做了一个破坏性测试:保持模型、轨迹和随机种子不变,只替换记忆库内容。若用另一个 episode——另一段独立视频过程——的 latents 填充记忆库,revisit correlation 下降 83%。这说明检索内容确实会影响模型输出,而不只是占着位置的填充物。
但这项结果不能单独证明模型已经正确、因果且可泛化地使用记忆。论文里的 revisit correlation 与其他段落使用的 revisit consistency 也未必是同一指标;83% 究竟是相对降幅还是绝对百分点,现有材料没有明确说明。
在开放世界模型对比中,Memorizon 与 CaR 是唯二表现出清晰记忆效果的系统。八个记忆相关栏目里,Memorizon 领先五项,CaR 领先三项。Memorizon 在“途中某处再次返回”的测试上更有优势:这种返回不能依赖始终保留的第一帧,必须调用沿途形成的记忆。这正好对应它想解决的问题。
为什么值得关注
Memorizon 最有意思的地方,不是宣称模型能记住无限久,而是重新定义了长期训练的单位。过去,样本跨度、注意力长度和训练成本常被绑在一起;它提出,监督关系可以跨越数分钟,实际计算却只围绕最近内容和少量相关记忆展开。
这也点出世界模型的一条重要边界:架构里装上“记忆库”,不代表模型自然会使用长期记忆。训练样本必须真的出现“第一次见到—离开—再次返回”的关系,损失函数才有机会教会模型把两次访问接成同一个世界。
局限与未知
- 实验主要针对只有相机移动的静态场景。若物体移动、房间状态改变,再次见面时“画得不一样”可能反而是正确答案。
- 更长跨度提升记忆指标,却会损害 image quality。作者将其追溯到训练时读取干净真值、推理时读取模型自身生成结果之间的落差,但现有材料尚未说明后续蒸馏能弥合多少。
- 数据集名称、部分指标定义、24%–30% 和 83% 的变化口径,以及若干实验配置仍需结合完整表格与代码进一步核对。