7 月 OpenAI 发布 GPT-Live,把「全双工语音 + 异步推理」做成了闭源产品:对话层管听说,推理层管干活。两个月后,开源侧有了对照物——腾讯混元团队 9 月 9 日开源 Gander,一个端到端全模态交互 Agent,模型与代码全部放出,论文同步挂上 arXiv:2609.08977,进 Hugging Face Daily Papers 日榜第 3,官方仓库 GitHub 发布当天 star 数已过百。

双系统:Cerebellum 管「说」,Brain 管「做」

Gander 的核心是 Cerebellum-Brain 架构。小脑基于 MiniCPM-o 4.5,负责实时视听感知、全双工对话控制与语音合成;大脑走可插拔 provider 接口,默认接 Codex,异步处理长程推理、工具调用与工作流执行;中间由 Agent 编排运行时衔接,绑定可信对话轮、维护任务状态、管理权限。

交互被压成一秒一个因果单元:[视频][音频][任务上下文] → [控制 token][内容]。控制 token 先于内容预测,把「要不要开口」和「说什么」解耦成 listen / speak / interrupt / tool 四种行为。Talker 与 Thinker 分离部署,按每单元 8 个文本 token 对 50 个 S3 语音 token 的对齐比例流式出声,感知不被语音生成阻塞;长会话保留最近 128 个单元。任务侧有 task_start、task_send(main/fork)、task_resolve 一套小词汇表,执行代际隔离防止旧任务结果污染新指令。「边说边干活」由此成为原生能力:你可以随时打断,它也能主动汇报进度、追问需求、请求授权。

官方评测的数字

按技术报告,评测覆盖对话能力、全模态理解、交互、Agent 四个维度,共 2,052 条基准语句。官方口径的成绩单:SpokenQA 两个子集 75.60 / 59.30,VoiceBench 的 AlpacaEval 3.96 分、SD-QA 46.84%,官方称 SpokenQA 居全双工组两个子集第一、VoiceBench 居第二;Full-Duplex-Bench v3 交互时机 100% 恰当,过早打断率 8.0%;委派场景 45/45 条最终回复正确绑定;加上全双工与 Agent 后训练后 Daily-Omni 仍保持 78.53%。摘要另称内部人类评估确认其口语表达自然,在背景噪声、多方对话、backchannel 场景下保持稳健。

该泼的冷水

仓库里数据集徽章写着 coming soon,「模型 + 代码 + 数据」三件套目前只兑现两件;上述评测均为团队自报,第三方复现暂无门路;大脑默认是 Codex,换别家 Agent 要自己接 provider。

真正的增量在于:OpenAI 用闭源产品验证过的「对话层 + 推理层」分工,现在有一条从 MiniCPM-o 4.5 小脑到可插拔大脑的开源实现可以拆开研究——控制 token 协议、运行时的任务生命周期都是白盒。当语音交互从「轮到你说话」变成「随时都能插话」,Agent 的形态也会跟着变:你的工作流,准备好被随时打断了吗?