同一辆车从不同机位看,画面差别很大,但现实中仍是那辆车在同一条路上运动。传统视频Tokenizer——把大量像素压成较短表示的模型组件——往往只把视频当作连续的二维图片,容易把视角变化和物体运动混在一起。VideoTok4D想压缩的不是“看到了哪些画面”,而是画面背后那个持续变化的世界。
它把4D场景——三维空间加时间——拆成两组Video Token:静态Token保存较稳定的场景结构与外观,动态Token记录物体随时间的变化。最关键的一步,是先补偿相机移动造成的位移,再沿估计出的物体轨迹汇集特征。这样,模型更容易分清“镜头在动”和“物体在动”,并减少换视角生成时的运动模糊与重影。
作者还在这套紧凑表示上训练了Co4DGen,用一次采样得到的场景状态生成多条同步机位视频。据论文自述,VideoTok4D在动态新视角合成中达到当前最佳水平,同时比稠密4D表示最多节省近四个数量级的存储。它的意义不只在压缩:世界模型若能把结构与变化写进Token,预测动态场景时就不必反复记住每一帧像素。