你在游戏里向左转,眼前的街道就要跟着变化;推开一扇门,门后的空间还得合乎逻辑。对 AI 来说,这比生成一段固定视频难得多。它不仅要“画得像”,还要理解环境如何随动作和时间连续变化。
这正是世界模型(World Model)想解决的问题:让 AI 学会预测环境的下一状态,并生成可以持续互动的场景。据 Bloomberg 援引知情人士报道,字节跳动创始人张一鸣正在亲自督导一款实时空间视频生成模型。由于目前只有这一家媒体的知情人士报道,以下项目进展仍需等待字节官方确认。
从生成短片,到生成一个世界
这款模型据称以 Seedance 为基础。Seedance 是字节的视频生成模型产品线,原本更接近“输入要求,产出一段视频”;新项目则试图再往前一步,让画面根据用户动作实时变化,并保持前后连贯的空间关系。
可以把两者的差别理解成电影和游戏。电影播放前已经拍好,观众不能改变剧情;可交互世界则必须在用户转身、移动或操作物体时,立即生成合理的后续画面。Bloomberg 称,字节希望用户借此为直播、短剧和游戏创建可交互的虚拟世界。
报道还称,张一鸣正在协调字节内部不同业务,以及 AI 资源和算力投入。模型最早可能在 2026 年 10 月发布,但计划仍可能调整。现有材料没有披露项目名称、技术结构、训练方式或模型效果,也没有可供比较的实验数字。
创始人重新深入一线,意味着什么
这件事引人注意,不只因为模型本身,也因为张一鸣的角色。
张一鸣在 2021 年卸任 CEO 时,曾在字节官方内部信中说,自己不够社交,更愿意独处、读书、上网和设想可能性。他把日常管理交给联合创始人梁汝波,希望转向长期战略研究。五年后,据 Bloomberg 报道,这位退居幕后的创始人为了世界模型重新深入一线,并横向协调业务、AI 资源和算力。
因此,“押注”更适合作为对资源配置变化的概括,而不是已经得到官方确认的投资结论。现有证据能支持的是:张一鸣参与并督导了这场研发竞赛;至于投入规模、组织架构和优先级,报道都没有给出足够细节。
为什么世界模型值得盯住
世界模型把 AI 竞争从“生成一段内容”推向“模拟一个能行动的环境”。它既可能服务直播、短剧和游戏,也可能成为具身智能的底座。具身智能是指让 AI 通过机器人等实体感知环境并采取行动;世界模型可以先预测某个动作会带来什么后果,再帮助系统规划或训练。
Bloomberg 也把应用方向延伸到机器人和自主系统,并将 Meta 与 Alphabet 列为字节在这一领域的竞争对手。如果报道所述项目落地,字节的内容产品、视频模型与算力资源可能被更紧密地串联起来。真正值得观察的,不是一款视频工具多了互动功能,而是大厂是否开始把“生成内容”升级为“生成并理解环境”。
局限与未知
- 目前核心信息来自 Bloomberg 单一信源,字节尚未在材料中公开确认。
- 发布时间最早为 2026 年 10 月,但报道明确称计划可能变化。
- 模型能力、技术路线、投入规模及机器人应用均缺少公开细节,暂时无法判断它与竞争对手的实际差距。