一个人滑出镜头后,AI再转过头去,还能认出他,并接上原来的运动轨迹吗?这比“生成一段看起来逼真的视频”难得多。4D基础模型——同时表示三维空间与时间变化的模型——若要成为可导航的世界模型,就得知道看不见的物体仍然存在,而不是每次回头都重新编一个世界。
论文提出 PersistBench,巧妙地用360°视频充当“全知视角”:模型只看到裁出的普通视野,评测者却能用完整视频检查画面外真实发生了什么。它不再只比较颜色和纹理是否相像,而是逐个物体检查三件事:离开视野后是否仍存在、运动是否连续、再次出现时外观是否保留。
作者测试多类4D基础模型后发现,所有模型在目标物体离开输入视野后表现都显著变差,只能维持短期一致性。作者将这一缺口归因于训练数据偏差:现有模型主要从目标始终可见的视频中学习。换句话说,它们已经很会“生成得像”,却还没有证明自己真正记住了同一个世界。