一台 H200 GPU,一秒钟,转写完 3.5 个小时以上的英文语音。这不是推理集群的聚合吞吐,而是单个 470M 参数模型——IBM 刚在 Hugging Face 开源的 Granite Speech 5.0 Turbo CTC——用批量推理跑出来的官方数字。在所有人都在往语音模型里塞 LLM 的 2026 年,IBM 的做法恰好相反:把语言模型整个砍掉。(官方发布博客)
速度与准确率,这次真的都要
官方口径:在 OpenASR Leaderboard 的公共英文短格式测试集上,非商用版(聚合 WER 4.85%)和 Apache 2.0 版(5.00%)两个变体,聚合吞吐都超过 12,600 RTFx。作为对照,官方博客明确写了"比之前的 Granite Speech 模型快 20 倍以上"。远场场景的 FFASR 榜单上,两个变体分别排第 5 和第 9,同时也是该榜上最快的两个模型(截至 8 月 25 日)。
需要说明:这些是 IBM 自己提交的官方结果(official results),不是第三方复测,读数时请保留这一层归因。
砍掉语言模型,是一次反向操作
上一代 Granite Speech 的架构是三段式:声学编码器 + 投影层 + 带 LoRA 适配器的 Granite 语言模型。这一代直接砍成 encoder-only——16 个 Conformer 块堆叠,第 8 块输出做 self-conditioning,注意力用 chunkwise 方式避免随序列长度二次增长,训练目标是经典的 CTC loss。
代价也写得明明白白:LM 版独有的语音翻译、关键词偏置能力没有了。换来的东西很实在:470M 的内存脚印,加上适合边缘设备的部署画像。官方还配了一个在浏览器里跑流式识别的 WebGPU demo(仅支持 Chrome/Edge)。
低 token rate 才是提速的钥匙
架构上最有意思的一处改动在 token 生成率:前代编码器每秒输出 50 个字符,Granite 5.0 降到每秒 12.5 个 token。从 100fps 的 log Mel 频谱前端降到 12.5 token/s,靠的是三级 2 倍下采样:第一级把相邻特征向量 reshape 堆叠,第二、三级内嵌在前两个 Conformer 块里,用 stride=2 的时间卷积完成。输出 tokenizer 也分了家:非商用版用 SentencePiece,Apache 版用 BPE。
序列长度直接决定注意力与解码的开销。token 率砍到四分之一,再叠加 chunkwise 注意力,20 倍的吞吐提升就不是魔法,而是算术。
数据配方:开源语料打底,合成数据补角
训练数据一侧,两个变体共享约 5.8 万小时自然语料:MLS(44,600 小时)、YODAS(8,900 小时)、CommonVoice-17(2,500 小时)、Librispeech(960 小时)、VoxPopuli(500 小时)、AMI(150 小时)、Earnings-22(100 小时)。非商用版额外加了 GigaSpeech(10,000 小时)和 SPGI Speech(4,900 小时)——这也是它 WER 略低的直接原因。
合成数据补了三个角:2,000 小时多说话人拼接语料(来自 MLS/YODAS/CommonVoice/VoxPopuli/AMI)、500 小时会议场景拼接(Earnings-22),以及 240 小时专门针对数字、货币、网址、电话号码、地址这类 ASR 传统弱项的内容——文本用 gpt-oss-120b 或 gpt-oss-20b 生成,再用 StyleTTS2 合成为语音。用开源 LLM 制造 ASR 训练数据,这个闭环本身值得玩味。
所以呢
过去两年语音识别的主流叙事是"越大越好":编码器后面挂越来越大的语言模型,用 LLM 的世界知识兜底。Granite Speech 5.0 Turbo CTC 给出了反方向的证据:如果你的场景就是转写本身,一个 470M、encoder-only、低 token 率的模型,可以在吞吐上拉开数量级差距,还把商用友好的 Apache 2.0 许可留给你。
两个变体的取舍也摆得清楚:要极致准确率就拿非商用版的数据优势(许可为 CC-BY-NC-SA,不能商用),要落地就选 Apache 2.0 版,多付出 0.15 个百分点的 WER。对做边缘设备、实时字幕、批量转档的团队,这是一次可以直接抄的工程示范:先把 token 率降下来,再谈别的。