让 AI 念稿不难,难的是既自然地切换多种语言,又能按描述设计声音,或从一小段录音复刻说话风格。OpenBMB 的 VoxCPM2 正面向这些场景:它支持 30 种语言、声音设计和可控声音克隆,连续两日登上热榜,今日新增 216 星。
它最特别的是绕过 Tokenizer——许多语音模型会先把声音切成一串离散编号,再据此生成;VoxCPM2 则直接处理连续的语音表示。其架构把自回归与扩散结合:前者按顺序维持长段语音的连贯,后者从噪声中逐步还原声学细节。项目方称,这个 20 亿参数模型使用超过 200 万小时的多语种语音训练,可从文字描述创造新声线,也可依据短录音克隆音色并调节情绪、语速和表达。
模型还能直接输出 48kHz 音频,代码与权重采用 Apache-2.0 许可证开放。上述能力与性能均来自项目说明,材料未提供独立评测;但把多语种生成、声音设计和克隆集中到一套无 Tokenizer 系统中,已足以解释它为何值得关注。