Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.092 — 2026-10-04
PAPER H 15 约 1 分钟

实时游戏逼世界模型按帧交卷

把世界模型塞进60 Hz游戏循环,用“想象训练”换来真实操作提升

玩 Geometry Dash,跳早一拍或晚一拍都会撞上障碍,游戏也不会停下来等 AI 思考。DashVMC 要解决的正是这个现实约束:让屏幕捕捉、判断和按键赶在下一帧之前完成,同时检验模型学到的“游戏规律”是否真能帮助操作。

研究者用约 2.33 小时、251,963 帧游戏录像训练动作条件世界模型——它会预测“此刻跳或不跳,接下来会怎样”。控制器先通过行为克隆模仿录像中的操作,再用 PPO(一种根据结果小步改进策略的强化学习方法)在冻结的世界模型里练习,全程不再接触真实游戏。每轮训练生成 512 段最长 45 步的模拟经历,且只利用较早的部分,避免虚构画面越滚越偏。

部署时,系统干脆跳过下一帧图像生成,只复用模型对近期画面的压缩理解。作者称,它在消费级 GPU 上维持了 60 Hz 的“捕捉到动作”循环;三个随机种子的改进策略,在三个官方关卡和一个留出的社区布局中都比各自的模仿学习起点存活更久。意义不在于 AI 会玩一款小游戏,而在于世界模型开始被按真实帧时限验收;论文也承认,其长期预测仍不完美。


供稿材料 SOURCES — 1

← 返回 2026-10-04 · 学术板块