你让 AI 在虚拟房间里走很久,再回到起点,它可能把桌子换了位置,甚至让物体凭空变样。问题不只是“记不住”,还在于历史画面越积越多:全存下来成本高,取错记忆会破坏场景,生成出错的画面若被反复引用,错误还会越滚越大。
Spatial Memory Intelligence(SMI,空间记忆智能)把多模态大语言模型——能同时理解图像和文字的模型——请来当“记忆管理员”。它先按空间位置给历史画面分组,再删掉组内重复内容;生成下一段视频前,它结合最近画面与当前动作,找回真正相关的旧观察;最后还会拦下已经出现视觉漂移的新画面,避免错误进入长期记忆。
最值得注意的不是某一种压缩技巧,而是这套四步分工:它同时回答“怎么整理、留什么、取什么、什么不能存”。作者称,SMI在多种基线、基准和世界模型上改善了记忆稀疏度、长期生成稳定性与空间一致性;这些效果目前仍以论文实验为准。