让 AI 在脑内沙盘里练游戏,难点不只是“想得像不像”,而是上场后能不能赢。这项工作把世界模型——学习游戏规律、供 AI 模拟对局的模型——放进一款十英雄 MOBA:206 个单位同时影响局势,单局最长 6,000 个时间步。策略在模型中进行长达 1,400 步的自由滚动预测,即后续局面一直建立在模型自己的预测上,误差也会随之累积。
论文作者报告,只在最初的“梦境”里继续训练,策略的真实胜率会从 33.7%跌至接近零,模型内部指标却看不出崩塌。作者于是采用持续 Dyna 循环:一边在沙盘里加练,一边用策略最新的真实对局修补沙盘,并用新种子上的实战成绩约束策略更新。最终,策略在从未参与决策的 600 局 radiant 方测试中赢下 421 局,胜率 70.2%;但在 dire 方一局未赢,也没有真正击败随游戏提供的对手——后者作为 radiant 方时保持全胜。价值正在这里:世界模型终于不只凭画面或想象回报自证,而要接受真实胜负的闭环验收。