2026 年 9 月 15 日,Google DeepMind 在 model-cards 频道放出两个新模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,挂在同一张 "Gemini 3.8 Audio" 总卡下。这次的看点不是参数,也不是基准跑分 —— 是 Google 把"实时对话 + 边想边说"这两条过去分裂的轨道,合并到同一条音频输出流里。
不是什么新架构,是 Gemini 3 Pro 的音频能力解锁
先把架构讲清楚:这两个模型不是从零训出来的。Model Card 直接写明,「Gemini 3.8 Audio is based on Gemini 3 Pro」,从训练数据、训练处理、硬件到软件实现,整张卡都把读者指向 Gemini 3 Pro 的对应 model card。所谓"Live"和"Live Extended Thinking"本质是 Gemini 3 Pro 在"原生多模态"基础上,把"音频"从支持模态升级成"原生输出模态" —— 模型不再依赖外接 TTS 把文字读出来,而是直接端到端生成语音 token。
输入端,两个模型吃 128K token 上下文,模态包括音频、图像、视频和文本,音频是 16-bit PCM、16 kHz 的原始流;输出端,文本 + 音频一起出,文本 token 上限 64K,音频是 16-bit PCM、24 kHz。架构上模型走 40 层 Transformer,但模型卡明确说"和 Gemini 3 Pro 共用 backbone 细节",所以这里没有新论文级别的结构创新,真正的工程量在"流式多模态 token 调度"和"边生成边说"的延迟优化上。
双档发布:一个省成本,一个能"想一会儿再说"
两个模型虽然同源,但定位明显分层。DeepMind 官方音频页把它们的差异写得很直白:
- Gemini 3.8 Live:面向"高吞吐、成本敏感、近实时语音接口",典型场景是客服机器人、电商导购、虚拟 NPC 实时陪聊这种"对话本身不需要多复杂推理,但必须秒回"的场景。
- Gemini 3.8 Live Extended Thinking:面向"复杂推理 + 多步任务",主打"边思考边把思考过程说出来"。模型在生成语音回答之前,会有一段"thinking"间隔,然后一边想一边用自然语气的语音把推理进度"念"出来 —— 而不是像传统链式推理那样只在文本侧 think,最后用 TTS 念结果。
第二个档位是这次最有意思的产品决策。当下绝大多数"会思考"的 AI 助手(无论是 OpenAI 的 o 系列还是 Anthropic 的 thinking 模式)都有一个明显的体验断点:模型先静默想几十秒,突然开始说话;用户体验上像"等了半天突然开口",中间那段等待是"模型在想"还是"模型卡了"完全没反馈。Extended Thinking 把这段"思考期"做成"可听的思考" —— 用户能听到模型在自言自语,实时观察它在哪个方向上走。这种"过程可见的推理"在 OpenAI 和 Anthropic 的当前主力产品里都还没做到音频侧,Google 这次是把 thinking 模式直接拉到了语音流里。
部署通道:从 Gemini App 到 Gmail 都接上
模型卡列出的分发渠道基本是 Google 全家桶:
- 3.8 Live: Gemini API、Gemini App、Google AI Studio、Google Cloud / Vertex AI、Google Search Live
- 3.8 Live Extended Thinking: 上面四个 + Google Workspace(Gmail、Docs、Keep)
Workspace 这一档额外集成是真正落地层面的信号 —— Extended Thinking 不只是给开发者做 agent 用的,Gmail / Docs / Keep 三个消费级 Workspace 应用会直接拿到这个"边想边说"能力。这意味着 Google 准备把"会思考的语音助手"塞进用户每天打开 20 次的邮件和文档工作流,而不是停留在 AI Studio demo 阶段。
研发侧的接入门槛也被刻意压低。Live API 文档页(ai.google.dev/gemini-api/docs/live-api,最近更新 2026/09/10)把"WebSocket 双向流"列为默认协议,GenAI SDK、WebSocket 直连、Agent Development Kit(ADK)Streaming 三种实现路径都给完整示例代码。第三方集成方面,LiveKit、Pipecat、Fishjam、Voximplant、Agora、Firebase AI Logic 全部在合作伙伴名单里 —— 对实时语音 agent 开发者来说,这个分发密度和 Google 自家搜索、AI Studio 拉通,意味着"接 Gemini 3.8 Live"不是另起炉灶,而是在现有 WebRTC / WebSocket 实时栈上换一行 model id。
评测与安全:Sierra τ³-Bench 进官方方法学
Model card 在评估这块很克制,没有贴一长串基准表,而是引向专门的 Evals & Methodology 子页(deepmind.google/models/evals-methodology/gemini-3-8-live),实际评测由三家独立机构跑:
- ServiceNow EVA-Bench:多轮 bot-to-bot 语音对话框架,用 Gemini Enterprise Agent Platform 跑,跑 thinking-minimal 和 thinking-high 两档。
- Artificial Analysis:第三方独立评测,跑的是 speech-to-speech 维度,看推理质量、对话动力学、生成时延、价格的综合表现。
- Sierra τ³-Bench:测模型在大型非结构化知识库上做多步 tool call、解决真实银行工作流的能力,跑 Gemini API,model-id 分别对应 gemini-3.8-live-preview 和 gemini-3.8-live-extended-thinking,thinking-high / 默认采样。
安全方面,所有音频输出自动挂 SynthID 水印(Google 自家音频溯源技术),前沿安全评估沿用 Gemini 3.7 Flash 的结论,认为 3.8 Live / Extended Thinking "相比 3.7 Flash 没有实质性能力跃升",因此不触发 Tracked / Critical Capability Levels。知识截止 2025 年 1 月。
行业意义:把"语音流里的推理"做成产品力
把这件事放到更大的行业语境里看:2026 年下半年,所有前沿模型厂商的差异化竞争已经从"谁更长"转向"谁更能在多模态流里稳住"。GPT-Realtime 2.1、Gemini 3.1 Flash TTS、Inworld TTS-2、Cartesia Sonic 3.6 这一连串实时音频/语音模型在 5-9 月密集发布,说明实时语音这条赛道已经从"能不能做"过渡到"怎么做才能不让用户等"。
Gemini 3.8 Live Extended Thinking 在这个赛道里走了不同方向 —— 不卷延迟数字,卷"思考过程对用户可见"。这种"出声的 chain-of-thought"短期看会拉高单次响应时间(用户得听模型在自言自语),但长期看是把"模型在做什么"这层可解释性,从开发者的 log 里搬到了终端用户的耳朵里。如果 Extended Thinking 这个范式被验证有用,OpenAI 和 Anthropic 跟进几乎是确定事件 —— 届时"会说话的 thinking 模型"可能会变成下一代语音助手的默认形态。
对国内厂商的参照:目前国产实时语音模型(阿里 CosyVoice、字节 Seed-TTS、腾讯混元 TTS 等)主要卷"声音质量 + 实时率",还没有把 thinking 模式端到端拉到语音流里。如果 2026 年 Q4 之前有国产模型把"边想边说"做出来,产品上能直接吃 Google 这套范式的红利。
所以呢
Gemini 3.8 Audio 的发布,关键不在模型本身 —— 它就是 Gemini 3 Pro 加了原生音频输出。关键在于"原生输出 + thinking 可见 + Workspace 全家桶集成"这三件事合起来,Google 把"实时语音 + 推理可解释性 + 消费级落地通道"第一次打包给到用户。开发者可以直接调 API,普通用户未来几个月会在 Gmail、Docs 里听到"模型在想什么"。这是实时语音 agent 赛道从 demo 走向日常工具的标志性一步。