让 AI 生成“穿针引线”,难点不只是把手和针画得逼真:双手发力时,线该怎样弯曲、拉伸,也得符合常识。智象未来发布 HiDream-O1-Video-1.0(HD-V1),把这类“物理一致性”——运动、碰撞和前后状态是否合理连贯——作为主要卖点,试图让视频从视觉奇观走向可信的连续动作。
据量子位报道,HD-V1 是原生全模态模型,即从架构和训练阶段就联合处理文字、图片、视频与声音,而非生成画面后再拼接音频。它会先把用户意图拆成镜头、角色、动作、台词和音效等安排,再联合生成;还可按事件节奏自行规划 5—20 秒的 1080p 视频,不必机械填满固定时长。
第三方成绩提供了一个参照:HD-V1 在 Artificial Analysis 带音频图生视频榜单列第四,在 Arena.ai 图生视频盲测列第八。不过,现有材料未披露训练数据、完整技术细节或独立物理测试结果;“更懂物理”的判断目前主要来自厂商展示与榜单表现。