语音助手最反直觉的一课:难点不是「听得懂」,而是「会聊天」。你说到一半咳嗽一声,它该继续说还是停下?背景有人放音乐,它该不该插话?9 月中旬,蚂蚁 Venus 团队联合清华开源了答案——Realtime-Venus,主打「主动全双工交互 + 异步委托」,论文挂 arXiv,两个 9B 模型权重已上架 Hugging Face。

两个 9B 前端,一条因果时间轴

系统拆成两个分别训练的 9B 模型:Omni 版管音视频交互,Audio 版管纯语音对话。两者都基于开源 MiniCPM-o 4.5 改造,语言主干 Qwen3-8B,语音走离散 S3 token 加流匹配解码器,上下文 40,960 token。

核心设计是把所有事件压到一条共享因果时间轴:用户输入、模型输出、委托事件,全部按 1 秒一个 chunk 对齐。每个 chunk 先做「听还是说」的决策,说话时感知不中断,没说出口的部分保持可修改。打断处理不是语音活动检测(VAD)二分法,而是语义级分类:应和继续说、抢话停住、纠错重生成、转向挂起当前计划。

Harness 异步委托:前台聊天,后台干活

全双工解决「怎么说」,异步委托解决「怎么干活」。前端在对话流里发出用户听不到的私有委托请求,Realtime-Venus-Harness 把任务路由给后台能力异步执行,结果经新鲜度检查后择机送回对话——等它查资料的同时你还能继续聊天,前台不阻塞。训练侧共用 280 万样本后训练语料,覆盖九大类;Omni 版另带免训练长视频记忆模块,支持小时级视频理解。

跑分:强在「不被带偏」,弱在「反应速度」

Full-Duplex-Bench v1.5 上,Audio 版的续聊率:用户应和 97%、对他人的话 88%、背景语音 86%,三项全部超过 GPT-4o 与 Gemini 3.1 Live;打断响应率 75%——高于基座 MiniCPM-o 4.5 的 60%,但低于 Joy-Duplex 的 88%、GPT-4o 的 78%、Gemini 3.1 Live 的 77%。论文结论很诚实:续聊强不等于打断处理强。

理解侧,Omni 版在 8 个视频基准中 6 个拿到受评在线模型最高分(StreamingBench 70.2%、OVO-Bench 64.7%、Daily-Omni 81.3%);Audio 版在 MMAU 78.0%、MMAU-Pro 63.2% 等音频基准领先。工具调用(FDB-v3):Omni 版选择 F1 86.0%、Pass@1 43.0%,GPT-Realtime 以 87.6% / 60.0% 全面领先。

泼冷水:委托决策还不过关

论文最有价值的段落是自建委托基准:Audio 版外部能力委托召回 92.22%,但例行问题的不必要委托规避只有 39.44%——十个例行问题六个被扔给后台;Omni 版相反,规避 84.44%、召回 68.33%。各瘸一条腿,整体路由准确率 75.93% vs 68.89%。且基准只评「该不该委托」,执行结果如何整合回对话,论文承认需进一步评估。

意义不在 SOTA,而在把「对话归对话、计算归计算」的完整工程答案摆上桌:9B 前端 + 后台异构算力 + 明确调度语义。OpenAI 的 GPT-Live 把对话层和推理层拆开并已 API 化,蚂蚁证明同样的拆分在开源 9B 尺度能落地——只是「该不该把活儿交出去」,目前还是门 75 分的学问。

参考链接

  • 论文 arXiv:2609.13814 | 权重 huggingface.co/inclusionAI/Realtime-Venus | 主页 realtime-venus.github.io