Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.065 — 2026-09-07
NEWS 约 1 分钟

Meta让配音摆脱逐句对齐

Meta用同一套语音框架做跨语言配音与全双工对话,省去逐字对齐环节。

给视频换一种语言配音,通常得先把每个字词钉在时间轴上:哪句话从第几秒说到第几秒,都要预先标好。Meta于9月3日提交的论文提出Text-Audiobox(Text-AB),让模型直接读取原始文本,自行学习文字与声音的对应关系,省去“强制对齐”和逐段预测时长。这不只简化配音流程,也适用于全双工对话——双方能同时说和听,系统还要处理插话、回应声与自然轮替。

据arXiv论文摘要,Text-AB先用DAC-VAE把48 kHz声音压缩为每秒25个“潜在表示”——可以理解为更短的声音内部编码——再交给Diffusion Transformer逐步合成音频。作者称,这比此前采用的EnCodec表示压缩率提高逾10倍,同时改善重建质量。模型以48万小时单语语音预训练,规模为30亿参数;一次可生成约一分钟语音,也能用multi-diffusion拼接更长内容。

作者报告称,系统在内部真实配音基准上改善了韵律、音色相似度和自然度,短对话接近人类录音。不过这些效果来自论文自述和内部基准,尚缺少独立验证。


供稿材料 SOURCES — 1

← 返回 2026-09-07 · 科技板块