Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.062 — 2026-09-04
PAPER H 17 约 1 分钟

世界模型能记住镜头外吗

杯子挪开后,AI还记得球在哪吗?新测试揭开逼真视频背后的记忆短板。

球被扣在杯子下,几个杯子来回交换,再让 AI 指出球在哪里。人能靠“看不见也还存在”的直觉一路追踪;视频世界模型却可能把画面拍得很真,揭晓时仍找错杯子。这项工作用动作条件的“猜球游戏”测试对象恒存——物体离开视野后,模型能否继续记住并更新它的状态。

据论文作者报告,多类模型都能学会训练时最多 5 次交换,但面对更长的交换链,准确率会跌向随机猜测,生成的视频却依然合理;增加扩散模型的去噪步骤也没有帮助。问题在于,像素训练只监督看得见的画面,并不直接告诉模型球藏在哪。Transformer 的 KV Cache——保存历史计算结果的临时记忆——又只能不断追加,难以把“球的位置”原地改写。

真正能外推到更长过程的两种设计,都带着一份可持续修改的内部状态:一种让线性注意力允许负特征值,以表达交换所需的翻转;另一种用 TTT(测试时训练)在生成过程中更新一个小型非线性网络。这个结果提醒我们:画面连贯只说明模型会拍,能否记住镜头外的世界,还要单独考试。


供稿材料 SOURCES — 1
01
Can Video World Models Track Unobserved World States? arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-04 · 学术板块