你让一个视频生成模型沿着街道一直向前走。五秒钟内,它也许能保持房屋、道路和镜头运动都像那么回事。但连续走几分钟后,早先的小误差会不断累积:物体漂移,空间关系改变,场景甚至突然断裂。更麻烦的是,研究者即使看到了不错的演示,也未必拿得到处理后的数据、筛选记录和完整训练配置,很难判断效果究竟来自模型、数据,还是某套没有公开的工程流程。
SolarWM想同时处理这两个问题。它不是单独推出一个视频模型,而是试图开放从数据准备、规模化训练到长时程推演的整套基础设施。视频世界模型——根据当前画面和控制信号预测世界接下来如何变化的模型——因此不再只是一个会续写视频的生成器,而更像一个可以用镜头运动持续探索的视觉模拟环境。
不过,本文数字和效果均来自作者论文,尚无材料中的第三方复现或独立评测支持;项目对数据、代码和权重的开放也以“将发布”表述为主。
先把十批不同的食材装进同一种盒子
SolarWM首先处理的是数据混用问题。不同视频数据集的时长、清晰度、镜头视角、运动强度和文字说明都不一样。这样的“异构数据”直接倒进同一个训练池,会给模型送去互相冲突的信号。
作者称,SolarWM的数据引擎处理了来自10个数据集的1,425,694个规范化片段,总体积约25.85 TB。每个片段都被整理成统一、逐帧对齐的格式,包含视频画面、具有实际尺度的相机几何信息、字幕、质量指标、筛选决定和来源记录。所谓“实际尺度”,是让相机移动不只是一个相对方向,还保留距离尺度;逐帧对齐则保证某一帧画面能对应同一时刻的相机位置和参数。
这套引擎的关键不是单纯把数据做大,而是把昂贵的源数据处理与后续配方拆开。研究者可以修改过滤门槛、数据源权重、抽样比例和视频时长窗口,而不必重新跑一遍相机估计、字幕生成和质量评估。它有点像先把所有食材洗净、称重并标明产地,再按不同菜单组合,而不是每换一道菜就从采购开始重做。
SolarWM也没有悄悄扔掉不符合默认标准的样本。作者称,约87.6万个片段进入high或xhigh质量层级,另有549,101个片段放入rejected分区,并保留指标与机器可读的淘汰原因。这样,默认筛选规则本身也能被检查和改写。对可复现研究而言,这些“为什么没选”的记录,往往和最终选了什么同样重要。
四个模型,共用一条训练路线
在模型端,SolarWM基于Wan2.2、LTX-2.5和MiniMax-H3三个基础模型系列,构建了四个版本:两个Wan2.2模型分别为5B和14B参数,LTX-2.5版本为22B,MiniMax-H3版本为33B。B表示十亿参数,是描述模型规模的常用单位。
它们没有被强行改造成完全相同的内部结构。SolarWM统一数据、相机控制、训练和推演接口,同时保留每个基础模型原本的视频表示方式、注意力结构和优化目标。这样做的目的,是让不同模型能在相近条件下比较,又不因迁就统一框架而破坏原有能力。
训练分三步。第一步是双向适配:模型训练时可以同时参考一个短片段的前后画面,先学会新数据中的外观、运动和相机控制。第二步改成自回归训练——像接龙一样,根据已经出现的内容生成下一段。这里使用teacher forcing,也就是训练时把真实历史画面交给模型,避免它一开始就在自己的错误上越走越偏;AnyFlow目标则让它直接适应少步生成所需的噪声转换。
第三步是distribution matching distillation,中文可理解为“分布匹配蒸馏”:让因果学生模型在自己生成的历史上继续训练,并用固定的双向教师模型提供质量参照。它针对的是训练和使用之间的落差。前一步看到的是干净的真实历史,实际推演时看到的却是模型自己的输出;如果不补这一课,误差很容易逐段积累。
作者的判断是,大部分能力应在第一阶段学好。第二阶段主要负责打开因果生成能力,因此收敛较快;最后的蒸馏所需优化步数更少。论文还称,这条路线不需要额外的Causal ODE或一致性蒸馏初始化阶段。
五秒训练,为什么敢谈数小时?
SolarWM最醒目的论断,是因果模型只用5秒序列训练,就能实时交互,并把生成持续到数分钟乃至数小时。这里需要分清两个概念:训练片段短,不等于输出只能短;模型可以把刚生成的片段继续当作历史,反复向后接续,这就是rollout——把预测不断滚动展开。
真正困难的是,能继续生成不等于能长期保持一致。论文认为,统一的数据监督、保留基础模型能力的适配方式,以及让模型在自身生成轨迹上训练的第三阶段,共同缩小了短训练与长推演之间的距离。作者还宣称模型达到state-of-the-art表现,即在其采用的比较设置中处于当前最佳水平。
这项工作的关注点因此不只是“视频能生成多久”。它提供了一个更难得的研究对象:同一批规范化数据、同一套三阶段训练路线,被应用到四个5B至33B模型上。我们此前报道的Stream4D,重点是借助四维重建信号约束长视频中的物体、空间与运动一致性;SolarWM则把视线再往前推了一层,追问支撑世界模型的数据、训练和推理管线能否一起复现。
为什么这次“开放”格外重要
在这类系统中,只公开模型权重,通常不足以重现实验。数据从哪里来、删掉了什么、不同来源如何配比、每个训练阶段用了什么配置,都会改变结果。SolarWM所说的“全栈开放”,覆盖处理后数据、筛选记录、训练配方、模型权重、推理代码和长时程生成流程。若这些承诺完整落实,研究者不仅能运行成品,还能替换数据配方、比较不同基础模型,并追踪结果变化来自哪一步。
这也是SolarWM真正值得看的赌注:它把世界模型的竞争单位从“一个效果不错的模型”,扩大为“一套可以审计、重组和复现的生产系统”。对一个仍高度依赖数据工程与训练细节的领域来说,这种全栈样本可能比单次排行榜领先更有长期价值。
局限与未知
- 所有主要效果和规模数字目前都来自作者论文。材料没有第三方评测、仓库实测或独立复现实验,所谓最佳表现仍需外部验证。
- “数分钟至数小时”描述的是可持续运行时长,不能直接等同于长期空间一致性或有效模拟能力。论文材料未给出足以判断“实时”的硬件、分辨率、帧率、交互延迟,以及长时程质量指标。
- 作者使用“fully open”等表述,但正文多处写的是“将发布”。数据、代码、权重是否已全部到位,以及许可证允许哪些使用方式,仍应以实际发布物为准。