想象你在游戏里替守卫送来一张门禁卡。守卫刷卡,城门打开。你离开一阵再回来,门还开着,卡却凭空消失了;或者门已经开了,系统却说刷卡从未发生。单看每一帧,画面或许都很逼真,但这个世界已经“不记得自己经历过什么”。
论文《World Agent: Can Language Models Keep a World Running?》研究的正是这类问题。它不让模型生成世界,也不让模型扮演其中的角色,而是把模型放到幕后,要求它维护世界的显式状态——也就是物体在哪里、人物做过什么、规则是否成立等可记录的信息。作者把这项任务称为 world agent task。考题由“交付时看起来怎么样”,延伸为“交付以后还能不能持续运行”。
这项工作的所有结果均来自作者论文。作者关于既有评测覆盖范围的判断较宽,本文将其视为论文主张,而非已经得到独立验证的行业结论。
世界不是连续画面,而是一串后果
可玩世界模型不同于固定视频:它要根据玩家行动实时续写环境,让互动不断发生。难点也由此出现。画面相邻两秒看着合理,不代表几十个事件以后仍然自洽。
维持世界首先要做好“状态转移”——一次行动之后,世界记录应当怎样改变。门被打开,下一刻就不该无缘无故关上;角色交出了卡,卡也不能继续留在其背包里。
但只记住最终状态仍然不够。假设两个人都到了门口,门也确实打开了,系统仍可能漏掉中间的交卡动作,甚至把“开门”排在“拿到卡”之前。结果对了,过程却没有遵守因果。论文因此把重点放在因果事件流:事件不仅要发生,还要按原因、结果、先后、持续时间和并发关系组织起来。
这也是 World Agent 最关键的换位。通常,固定引擎负责维护世界,模型只需完成任务;这里,模型不写游戏代码,也不扮演玩家,而要通过统一的工具接口读写不同世界,让每个叙事事件落到持久状态中。可以把它理解为一名舞台监督:演员负责行动,它负责保证道具、时间表和前因后果始终对得上。
两张考卷:维护当下,推演未来
作者建立了 WorldAgent-Benchmark,共有 37 个案例,分成互补的两条赛道。
第一条是 maintenance(维护),包含 31 个案例。模型会分轮收到一段连续叙事,并把其中明确写出的事件,以及完成情节所必需的隐含步骤,落实为世界状态变化。案例横跨灾难救援、刑事调查、聚落管理和制造等类型;最大压力案例包含 287 个计分事件和 395 个地图格。
维护赛道分三级。Easy 已经提供类型、实体和能力;Hard 保留类型与实体,但要求模型自行构造能力;Extreme 只留下地图,类型、物品和规则都要由模型建立。换句话说,题目会逐渐撤走脚手架,看模型能否一边搭世界结构,一边让故事继续运行。
这条赛道不是纯程序评分。LLM judge——用另一个语言模型辅助作出的语义判断——负责把叙事要求与执行日志、冻结状态对应起来,并检查部分违规情况;程序随后验证这些对应关系,计算事件是否完成,以及因果、时间和并发关系是否满足。最终状态碰巧正确并不算完成:日志里必须留下符合要求的成功操作。
第二条是 deduction(推演),包含 6 个案例。模型拿到初始状态和不完整的运行规律,要预测世界接下来怎样变化,有时还要操纵一个角色完成目标。题目既包括没有中间状态反馈的连续预测,也包括每次行动后返回真实变化的闭环预测;还会测试远期预测和反事实问题——如果过去换一种行动,世界会怎样。
推演赛道完全由程序评估。引擎独立算出确定的正确演化,再逐字段比较模型预测:不仅字段路径要对,结果值也要对。它因此绕开了语言模型裁判的不稳定性。
真正容易断掉的是因果链
论文评测了 8 个模型。三个模型跑完全部基准,其余五个只测试从前三个模型结果中选出的 9 个、更具区分度的案例。因此,不同模型之间并非所有数字都来自完整而相同的测试范围。
在九案例共同子集上,Qwen-3.8-Max-0902 的维护完成分为 0.813,关系分为 0.738,两项领先;作者报告其显著高于其他模型。这里的“完成”是事件有没有做出来,“关系”则看这些事件是否以正确的因果和时间结构发生。多数模型的完成分已经比较接近,关系分却拉得更开。这说明让门打开相对容易,让它因为正确的前置事件、在正确时刻打开,才更能区分模型。
撤掉预建结构后,所有 8 个模型的表现都下降。进入 Extreme 难度时,因果关系检查成为全部模型最弱的组件。论文还发现,各难度内部的分数也会随叙事轮次下降。模型不只是怕任务复杂,也会在世界运行得更久以后逐渐失去控制。
推演赛道呈现出另一层差距。模型得到每一步真实反馈后,闭环预测明显好于必须提前连续推演的模式,说明它们善于根据新状态修正当前判断,却不擅长在脑中稳定地“把世界向前跑”。所有模型的 48 时间单位前瞻分都低于 0.23。最好的维护模型、远期预测模型和反事实模型也并非同一个。持续运行并不像一项统一能力,更像多块尚未同时补齐的拼图。
为什么这道题值得现在问
世界模型正在从“生成一段像真的画面”走向“生成可以进入、可以操作的环境”。评测标准若仍停在几秒画质或交付时刻,就可能把局部逼真误认为世界可靠。
World Agent 提供了一种更严格的检查方式:冻结评分合同,保存状态和执行日志,再追问每个结果是怎样发生的。维护赛道的单项判断可以回看;判断固定后,分数也能从记录重新计算。它把“这个世界好像还行”改造成一组可以定位的故障:事件漏了、顺序错了、因果断了,还是并发关系冲突了。
更重要的是,这个问题不限于游戏。论文指出,任何需要在持久环境中长期行动的 agent——即能够调用工具、连续采取行动的模型系统——都必须先学会维护状态。否则,它即便每一步都说得通,长期目标仍可能被自己早先遗漏的后果破坏。
局限与未知
- 维护赛道仍依赖 LLM judge 做部分语义匹配。记录虽然可审计,分数也可在固定判断后重算,但这不保证判断本身正确;重新调用裁判模型还可能得到不同结果。
- 只有三个模型完成全部基准,其余模型使用九案例子集,部分结果还只有单次折叠,论文也将这些读数视为初步结果。基准共 37 个案例,能否代表更开放、更长时间的真实世界仍待检验。
- 作者称代码与数据集“将发布”到 GitHub 仓库 HCPLab-SYSU/WorldAgent-Benchmark。这是一项发布承诺,不能据此认定资源已经公开。
这篇论文没有证明机器已经能让生成世界长期存活。它更像是把验收时间往后拨了一大截:不在世界刚亮相时鼓掌,而是等角色走远、规则叠加、旧事件开始约束新事件,再看舞台是否仍然站得住。