9 月 15 日,Google 在博客里把两款新的实时语音模型一次性摆到了台面上——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,定位是「最会说话的 Gemini」,从今天起在 Gemini API、Google AI Studio、Gemini Enterprise 和 Search Live 同步开放。
拿数据说话:两个版本怎么分工
两款模型都围绕「让对话更像和人聊天」这一件事展开。普通版 Gemini 3.8 Live 强调成本与可扩展性,在 Speech Agent Arena 上拿到了用户偏好第二名。Extended Thinking 版本则在复杂任务上发力——它在 Artificial Analysis 的 Speech to Speech Quality Index 上拿到 82.6 分排第一,在 Sierra 的 τ-Voice-banking 智能体基准上做到了 35.1%,在 Big Bench Audio 推理基准上拿到了 97.7%。ServiceNow 的 EVA-Bench 上,两个版本联手把语音智能体的准确率-体验帕累托前沿推到了新位置。
模型能力:听、想、说、读、切换、后台工具,一次到位
模型设计上,Google 这次给出了几个关键细节:实时视觉输入、近乎实时的语音响应,以及会话过程中自动检测并切换 97 种语言的能力。Extended Thinking 版本最值得注意的特性是「边想边说」——模型在后台跑多步推理的同时,用"Let me check that..."这类语言化提示保持对话流不被掐断,等到后台任务完成再继续推进。这意味着开发者在 Gemini Live API 上能直接搭出既能多步规划、又能在用户等待时持续聊天的语音智能体。工具调用也被彻底重写:两个版本都允许模型在后台跑工具调用和 API 请求而不打断语音对话,前端只用一句"我先帮你查一下"自然过渡。SynthID 水印自动嵌入所有音频输出,Google 同时披露了 Agora、LiveKit、Pipecat、Vercel、LangChain、Fishjam、Vision Agents 8 家已经基于 Gemini Live API 推出集成的生态合作伙伴。
定价、行业意义与落地节奏
值得拆开看的细节是定价。Google 在博客里没有公布具体数字,但 Artificial Analysis 的 cost-per-hour-of-input-audio 横轴和 Big Bench Audio 的性价比定位显示 Extended Thinking 处于「前沿但便宜」的象限。从行业角度看,这次发布把实时语音对话从「TTS + ASR + LLM 串联」的拼装时代推进到了端到端统一模型时代——Gemini 3.8 Live 同时处理听、想、说、读视觉、切换语言、后台跑工具,这些过去需要几个独立系统协作的环节现在都收进了一个模型权重里。对做客服、教育、陪伴类语音产品的团队来说,基础设施层面的拼装工作量会被显著压缩,真正的差异化只能往产品逻辑和用户体验上去做。
模型卡同步在 Google DeepMind 的 model-cards 仓库公开,Safety & Responsibility 报告与 SynthID 水印策略一并发布,Gemini Enterprise 的 private preview 也在今天同步开启——对企业 IT 来说,这是首个不需要额外接 NLU/ASR/TTS 三件套就能直接上线生产环境的语音模型。Salesforce、Genspark、Lumeris 这些已经把 3.8 Live 接进产品的合作伙伴,接下来会把这些能力推进到真实场景里去试。