两个人一起搬动一口平底锅,各自眼前的画面不同,但锅最后去了哪里,答案必须一致。以往的第一视角世界模型——预测“我行动后会看到什么”的模型——大多只管一个行动者。ME-World则尝试同时生成多个行动者的第一视角视频,让一方的身体动作、视角变化及其造成的环境改变,也准确出现在另一方眼中。
它最关键的做法,是不把各路视频分开预测,而是放进同一组表示中联合生成,让信息在不同视角间交换;同时用共享环境记忆,把历史画面对齐到目标视角,避免房间、物体或人物身份各自“长成不同版本”。论文实验采用双行动者设置,并结合真实与合成数据。作者称,ME-World在共享世界一致性、动作控制、身份保持和视频质量上优于现有方法;不过现有材料未给出具体提升数字。