让 AI 生成一段人物说话的视频,难点不只是脸画得像,还要让声音、口型和动作对上拍。Kandinsky 6.0 Video把这些环节放进同一套基础模型——在大量、多样数据上训练的通用底座——同时生成5秒视频与44 kHz音频,支持文字或图片输入,也能处理对白口型。
它最值得看的设计是“双流架构”:画面和声音各走一条计算路径,像两位剪辑师分头工作,却不断交换信息、核对时间点。团队先用4000万条音轨从零训练音频分支,再把它接入已有的视频分支,随后用700万段配对声画数据联合训练。Lite版有30亿参数,Pro版有290亿参数;初始画面还可经内置超分辨率模型放大至Full HD,但补出的纹理属于模型推断,并非恢复真实细节。
作者称,Pro版在人类并排评测中明显超过Kandinsky 5.0 Pro,并在语音质量上可与领先声画模型竞争。代码、权重及diffusers集成以MIT许可证开放;论文未在摘要中给出上述比较的具体胜率。