7 月 8 日,OpenAI 在 ChatGPT 里首发了全双工语音模型 GPT-Live-1;两个月后的 9 月 10 日,它进了 API,第三方开发者第一次可以把这套「能同时听和说」的语音层装进自己的应用。这不是一次简单的接口开放——OpenAI 同时给出了定价、电话场景支持和一整套「语音层与推理层分离」的架构主张。

一个模型干掉三段式管线

传统语音智能体是三段式拼接:语音转文本(STT)、大模型推理、文本转语音(TTS)。每一段交接都在加延迟,也都在制造事故点——用户什么时候打断、停顿、改口,全要开发者手写规则去兜。GPT-Live-1 的做法是把听和说收进同一个模型,由它直接对输入和输出音频联合推理,打断、应答、背景噪音都在模型内部处理。官方公告的说法是,这避免了级联架构的延迟与脆弱交接。模型还原生输出 ASR 转写文本、支持关键词偏置和回合检测——虽然它本身不是回合制模型,但给习惯回合制管道的开发者留了兼容层。落地效果有两个数字:语言学习应用 Speak 在早期评测中发现,思考停顿期的误打断减少了近 80%;一位医疗健康公司的联合创始人兼 CTO Tony Stoyanov 称,换成 GPT-Live-1 后代码库简化了 80%,删掉了 2.3 万行代码。

推理外包:语音层按分钟卖,大脑自选

更有意思的是架构分工。GPT-Live-1 自己只负责「对话」,深层推理和工具调用可以委托给后端文本模型——官方例子是 GPT-6 Astra,也可以是第三方模型。语音层定价每分钟 0.05 美元,后端模型和工具费用另算。对开发者来说,这意味着可以按任务混搭:官方给的场景是,排期、订单更新这类高频任务配轻量模型,复杂客诉配重推理模型。OpenAI 还补齐了电话(telephony)支持——全双工语音智能体可以直接部署到电话场景;长会话的上下文保持、通过系统提示词控制语气语速、覆盖更多口音和语言的新音色,也都列进了发布清单。公告页面上亮出名字的客户是 Yelp、Speak、Fin 和 Cognition,Cognition 的联合创始人 Walden Yan 说,配上 Devin,和 AI 工程师协作开始像和同事对话。

数字与冷思考

跑分方面,OpenAI 称 GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点,回合接管延迟和交互行为提升明显;配上 GPT-6 Astra(中等推理力度)在衡量语音智能体端到端任务能力的 Tau3 榜单排名第一。独立媒体的报道也在转述这组官方数字,但目前都出自 OpenAI 自己的评测口径。值得留意的还有计费结构:按分钟计费加后端另算,做长时电话客服的团队需要把成本模型算清楚。

所以呢?语音交互的护城河正在从「谁的声音自然」转向「谁的架构简单」。当听、说、打断在一个模型里闭环,而推理可以插拔,语音智能体的竞争点就回到了后端智能与工作流集成——那恰恰是 OpenAI 顺便一起卖的东西。原文公告:https://openai.com/index/introducing-gpt-live-1-in-the-api/