想象你在虚拟街道里转头:画面已经转向右侧,汽车声却还停在原处,沉浸感立刻破功。HelixWorld要解决的正是这种错位。它是一种交互式世界模型——会根据用户操作持续生成环境变化,而非播放预制视频;同时生成空间立体声,让左右声道呈现声源的方向与距离感。
关键在于,模型会读取六自由度相机轨迹,也就是相机在三维空间中的位置和朝向,让视点移动与声音方位同步演化。团队先训练较强的“教师”模型,再把能力压缩给更快的“学生”模型,以减少连续生成时误差越滚越大的问题。作者称,系统可在单张 NVIDIA H800 GPU 上以每秒 24 帧持续生成同步的声音和画面。
这项工作的另一处实质进展是数据:团队从 4100 小时素材中筛出 3000 小时、约 210 万段同步片段,剔除配乐、旁白和伪立体声,并补上相机位姿。效果结论目前主要来自论文作者自述,但它把世界模型从“会动的无声画面”推进到了可听、可操控的环境模拟。