Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
REPO 27 STARS 约 1 分钟

语音Agent有了开源拼装线

Hugging Face把语音对话拆成可替换组件,让开发者更容易拼出实时语音Agent。

IMAGE — GitHub Trending(Python·日榜)

做一个能自然接话的语音 Agent,过去常像同时组装耳朵、大脑和嘴巴:每一段都要选模型,还得处理它们之间的实时通信。Hugging Face 开源的 speech-to-speech,把这套流程接成一条低延迟流水线,让开发者可以直接搭建,也能逐段更换零件。

它依次用 VAD 判断用户何时说完,STT 把语音转成文字,再交给 LLM(负责组织回答的语言模型),最后由 TTS 把文字合成为声音。整条链路可通过 WebSocket 或 WebRTC——两种持续传输实时数据的连接方式——对外提供服务。LLM 接口兼容 OpenAI 常用的请求格式,因此既能连接托管服务,也能换成本机运行的 vLLM 或 llama.cpp。

这套工具链已经作为数千台 Reachy Mini 机器人的对话后端投入生产。默认组合使用本地 Parakeet TDT 识别语音、Qwen3-TTS 输出声音;Apple Silicon Mac 的全本地配置建议准备至少 16 GB 统一内存,核心模型权重约 7.5 GB。不过这些内存数字只是单次对话的规划估算,实际占用仍取决于上下文、音频长度和后端版本。


供稿材料 SOURCES — 1
01
huggingface/speech-to-speech GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-09-12 · 开源板块