Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER 约 1 分钟

视频世界模型迎来多物体记忆考场

OPIS只盯输入中真实出现的物体,揭示视频模型“有东西却认错东西”的记忆缺口。

让 AI 看着一间摆满物品的屋子移动镜头,杯子暂时出画后再回来,它可能还会生成一个“像杯子的东西”,却已经不是原来那只。OPIS 是一套面向视频世界模型——根据画面与动作继续生成场景的模型——的长期多物体记忆测试。它把最初输入里的物体列成固定清单,只按这份真实输入核对后续画面,避免模型借自己生成的历史或特定回访镜头“找答案”。

OPIS 收录 500 个案例、12,672 个物体实例,并从物体是否仍在、身份是否一致、结构是否保持三个层次评分。论文作者报告,在八款模型中,物体存在得分为 85.63—93.49,身份得分却只有 28.12—36.88;当场景中的参考物体从不超过 20 个增至 40 个以上,平均身份得分又从 40.22 降到 23.11。说白了,模型不难生成一个看起来合理的世界,难的是记住这个世界里每件具体东西。上述结果来自论文作者的基准实验,尚不能代表所有视频世界模型。


供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块