和人聊天时,我们会一边听、一边看对方反应,也知道什么时候该接话、什么时候该停。Realtime-Venus-Omni想把这套节奏装进一个9B全模态模型——也就是能在同一套系统里持续处理视频和音频,并生成文字与语音。它的体量相对可控,因此值得关注:本地实时全模态应用多了一个开放权重的选择。
这个系统最具体的设计,是让看、听、判断和说话共用一条“因果时间线”:各种输入输出都按先后顺序排列,模型可以边说边继续感知,而不必等整段音视频结束。项目页面称,它还能区分附和、真正的打断、纠正和话题转向;其中“语义打断”不只是听见声音就停,而是判断对方是否真要截断当前回复。模型也能在事件值得回应时主动开口,并用无需额外训练的机制保存长视频中的重要片段。不过,目前材料没有提供延迟、显存占用或基准测试数字,实际本地运行门槛和交互效果仍待验证。