Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER 约 1 分钟

视频Token开始显式理解4D

VideoTok4D把场景结构与运动分开压缩,让视频Token开始描述随时间变化的三维世界。

同一辆车从不同机位看,画面差别很大,但现实中仍是那辆车在同一条路上运动。传统视频Tokenizer——把大量像素压成较短表示的模型组件——往往只把视频当作连续的二维图片,容易把视角变化和物体运动混在一起。VideoTok4D想压缩的不是“看到了哪些画面”,而是画面背后那个持续变化的世界。

它把4D场景——三维空间加时间——拆成两组Video Token:静态Token保存较稳定的场景结构与外观,动态Token记录物体随时间的变化。最关键的一步,是先补偿相机移动造成的位移,再沿估计出的物体轨迹汇集特征。这样,模型更容易分清“镜头在动”和“物体在动”,并减少换视角生成时的运动模糊与重影。

作者还在这套紧凑表示上训练了Co4DGen,用一次采样得到的场景状态生成多条同步机位视频。据论文自述,VideoTok4D在动态新视角合成中达到当前最佳水平,同时比稠密4D表示最多节省近四个数量级的存储。它的意义不只在压缩:世界模型若能把结构与变化写进Token,预测动态场景时就不必反复记住每一帧像素。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块