你对视频 AI 说“人物后退,同时镜头缓慢右转”,它也许能拍出大致效果,但动作常常早了、晚了,甚至串到下一条指令里。H3-World要解决的正是这个问题:把330亿参数的 MiniMax-H3 视频生成器改造成可交互的世界模型——一个能预测环境变化、并让视频世界随指令继续演变的内部模拟器。
它最巧的一步,是不另装专用动作模块,而把人物和镜头操作写成模型本来就懂的短句,再用“时间注意力路由”限制每条指令只影响指定的视频时段。比如“人物向左后退,镜头缓慢右转”,不仅说明做什么,也规定何时做,从而减少动作跨时段泄漏。
作者称,只用8000段游戏样本、训练10000步 LoRA——一种只调整少量参数的轻量微调方法——并开放0.199%的参数参与训练,就获得了有效的人物与镜头控制,还能处理训练中未见的动作组合和画面。意义在于:视频模型的语言理解越强,把“会生成”变成“可控制”所需新增的训练与模块,可能就越少;不过这些效果目前仍以论文作者报告为准。