做语音产品的团队都习惯三件套架构:一个模型转写、一个模型分离说话人、再加一个检测器判断用户何时说完。每次交接都引入延迟和新的出错点。Meta 超级智能实验室 9 月 1 日发布 Muse Voice Transcribe,把这三件事压进一个自回归模型——官方称其为首个实时音频感知模型。

一个模型怎么同时干三件事

技术路线上,Muse Voice Transcribe 出身 Muse Spark 家族,是自回归多模态模型。音频按 80 毫秒(12.5Hz)分块,每块转成一个 soft token;模型在每个音频块上自己决定是继续听(<|next_audio|>),还是吐出文本 token。说话人分离和端点检测也不是外挂模块,而是靠额外特殊 token(<|start_of_turn|><|speaker_A|><|speech_endpoint|> 等)在同一条序列里完成,官方强调三个任务联合训练,无需后处理。

最有意思的设计是「自适应延迟」:等待越久越准、但延迟越高,Meta 用强化学习把词错率奖励和延迟奖励相乘,让模型逐词决定等多久再落笔。

数字层面

按官方图表,流式最终转写词错率 3.1%,同图七个系统在 3.4%–4.0% 之间;说话人分离平均错误率(AMI-IHM、AMI-SDM、VoxConverse)17.5%,其余五个系统 21.1%–28.6%。速度-精度散点图上,该模型约 0.16 秒达到约 3.0% 错误率,低于 Soniox、Cartesia、ElevenLabs 系统构成的前一代 Pareto 前沿。Meta 同时声明该模型在 Artificial Analysis 流式语音转写和公开说话人分离基准上排名第一(截至 2026 年 9 月 1 日)——榜单归属是官方口径,数字可回溯至上文图表。

第三方媒体 MarkTechPost 的独立报道给出更多对照:同榜 Cartesia Ink-2(语义端点)3.4% WER / 0.43 秒,ElevenLabs Scribe v2 Realtime 3.6% / 0.14 秒;定价折合每小时音频 0.18 美元,低于 Cartesia 的 0.24 美元和 ElevenLabs 的 0.39 美元,且目前仅通过 API 提供、未开放权重(此三项为 MarkTechPost 单源转述)。

语言能力与落地

模型用 70+ 种语言训练,其中 25 种经过充分验证,官方推荐首发使用这 25 种;原生支持句内句间任意 code-switching,演示里一段中英混杂的极客闲聊——本地部署 Muse Glimmer、4bit 量化、350 瓦 TDP——转得明明白白。长音频原生支持超过 1 小时、20+ 说话人,官方博客放了一段 1 小时 52 秒、11 人闲聊的完整转录演示。可用渠道是 Meta Model API、Mac 版 Meta AI 和 Muse Code,Mac 端按 Fn 即全局听写。

值得留意的两点

一是只放 API 不放权重,和 Meta 此前开源 Muse Glimmer 30B、Muse Spark 系列的姿态形成反差——「个人超级智能」的叙事先从闭源耳朵开始。二是把 ASR、分离、端点检测统一进 token 空间,和文本模型把工具调用、思考过程 token 化同向:管线越短,实时性越好,失败模式越少。做语音 Agent 的团队值得逐段读一遍官方博客(原文:https://research.meta.ai/blog/introducing-muse-voice-transcribe)。

当转写、分离、断句都变成同一个模型的几个特殊 token,语音交互的下一块短板,可能就不再是「听不听得清」了。