如果想让两台身边的设备直接用语音交谈,不把整条链路都交给云端,难点在于如何分配有限的算力。这次实践给出了一种直观方案:Gemma 4 12B 跑在配有 RTX PRO 4500 Blackwell 的桌面设备上,Gemma 4 E2B 则跑在 Jetson Orin NX 16GB——一种面向机器人和嵌入式 AI 的小型计算平台。两端都配有 reSpeaker 四麦克风阵列和 3W 扬声器,既能彼此对话,也能与人交谈。
它值得关注的不是某个单项跑分,而是设备间的分工:较大的模型使用桌面 GPU,受功耗和内存约束的一侧交给 Jetson。推理——也就是模型接收新输入并生成回答——由作者用 C 语言编写的 CUDA 引擎 Cortexist Little Gemma 完成。作者称,它在 Jetson Orin 上快于 llama.cpp,长语音提示后也没有性能退化;系统还支持口型同步、表情和手势,代码已开源。不过,供稿未披露延迟、功耗及对话质量等量化结果,因此目前更适合把它看作一条可运行的本地语音系统路径,而非完整的性能验证。