Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
PAPER H 6 · HF 44 约 1 分钟

语言理解如何变成世界控制

H3-World用语言指令控制视频世界,只微调0.199%参数,便能让动作与镜头按时发生。

你对视频 AI 说“人物后退,同时镜头缓慢右转”,它也许能拍出大致效果,但动作常常早了、晚了,甚至串到下一条指令里。H3-World要解决的正是这个问题:把330亿参数的 MiniMax-H3 视频生成器改造成可交互的世界模型——一个能预测环境变化、并让视频世界随指令继续演变的内部模拟器。

它最巧的一步,是不另装专用动作模块,而把人物和镜头操作写成模型本来就懂的短句,再用“时间注意力路由”限制每条指令只影响指定的视频时段。比如“人物向左后退,镜头缓慢右转”,不仅说明做什么,也规定何时做,从而减少动作跨时段泄漏。

作者称,只用8000段游戏样本、训练10000步 LoRA——一种只调整少量参数的轻量微调方法——并开放0.199%的参数参与训练,就获得了有效的人物与镜头控制,还能处理训练中未见的动作组合和画面。意义在于:视频模型的语言理解越强,把“会生成”变成“可控制”所需新增的训练与模块,可能就越少;不过这些效果目前仍以论文作者报告为准。


供稿材料 SOURCES — 1
01
H3-World: Turning Language Understanding into World Control arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-05 · 学术板块