和 AI 说话时,最让人不安的往往不是它听错,而是不知道它在听、在想,还是已经替你行动。设计师 Sharang Sharma 将正在出现的语音 AI 拆成八种界面:头像通话、轮流发言、语音增强聊天、语音转文字、AI 电话、脚本化视频加语音、协作式转录,以及环境感知或唤醒词模式。这里的“交互模式”,就是同类问题反复采用的一套界面解法。
这张地图真正有用的地方,是把语音背后的代理角色和控制权摆到台面上。头像通话借助眼神、口型和细微表情制造陪伴感,却也会因延迟或口型不同步破坏沉浸;轮流发言则明确标出谁在说、谁在听,用较僵硬的节奏换取考试、辅导和面试场景所需的秩序。双向实时语音还可用 VAD——检测谁正在讲话的技术——允许用户中途打断。换句话说,语音界面不是删掉按钮,而是要用状态提示、波形和中断机制,把“现在由谁做主”重新设计清楚。本文属于产品模式观察,并非完整的效果评测。