Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.076 — 2026-09-18
NEWS 约 1 分钟

阶跃一次补齐四类语音模型

StepAudio 3以五款模型补齐听、说、实时对话与音频创作,语音竞争转向完整产品栈。

IMAGE — InfoQ 中文

语音 AI 过去常像一条拼装流水线:先把人声转成文字,再思考,最后合成声音。阶跃星辰此次发布 StepAudio 3 系列,用五款模型覆盖四类需求——语音识别、语音生成、实时交互和音乐创作。值得关注的不是又多了一个模型,而是国产厂商开始争夺完整音频能力栈。

其中,StepAudio 3 Realtime 主打全双工语音,也就是双方能像打电话一样同时听和说,AI 可以判断何时回应、何时等待,并处理用户打断。它还把推理、工具调用和长任务执行放进对话流程。StepAudio 3 ASR 则负责把语音转成文字;据 InfoQ 报道,两款模型在 Artificial Analysis 评测中分别取得对话动态综合得分 98.9%、非流式识别词错误率 1.7%。

另外三款分别处理自然语音合成、包含人声与环境声的完整音频,以及歌曲创作与改编。五款模型均已上线阶跃星辰开放平台;上述排名和指标来自报道所引评测,材料未披露更完整的测试条件。


供稿材料 SOURCES — 1

← 返回 2026-09-18 · 科技板块