164MB 下载、平均词错率 5.21%——这是 Fermion Research 新开源的英文语音识别模型 Phonon-2 交出的成绩单。它的底座不是从零训练,而是 NVIDIA 的 Parakeet TDT 0.6B v3,一个 2.5GB 的全精度模型。把 15 倍的体积差压到接近无损,靠的是一套五电平量化方案:编码器每个权重只保留约 2.1 比特的信息。

七个基准集,逐项对数字

按 官方模型卡 公布的 Open ASR Leaderboard 测试结果,七个英文集合上 Phonon-2 平均词错率 5.21%,全精度教师为 4.96%,平均差距 0.25 个百分点。分集合看互有胜负:会议语料 AMI 上 9.37 对 9.42、议会演讲 VoxPopuli 上 2.46 对 3.19,这两集反超教师;其余五集(LS clean、LS other、Earnings-22、GigaSpeech、SPGISpeech)教师仍然领先。模型卡自述在议会语音上达到教师词准确率的 100.8%,会议集上直接胜出——与逐集数字一致。

同一张表里还有同赛道的 Parakeet Redux(moondream 出品,三元量化,178MB):平均 5.21% 对 5.69%,Phonon-2 占优;七个集合中除 AMI(9.37 对 9.16)外逐集领先。两条独立的压缩路线在 200MB 以下这个体积档位正面相遇。

2.1 比特怎么存

「五电平」指每个权重被映射到五个可学习层级之一,平均约 2.1 比特,编解码实现就放在仓库的 quint5_codec.py 里。模型卡称其为「900MB 以下最准的开源英文语音识别模型,所有分数更好的开源模型至少是它 5.8 倍大」——这是官方自报口径,暂无第三方复现。速度侧的官方数字:一小时音频在 M5 MacBook Air 上约 20 秒转写完(174 倍实时),八个 Zen 5 核心 CPU 上 143 倍,单张 H100 按 128 路批量跑出 6680 倍。

不止是权重文件

GitHub 仓库 给出了完整引擎矩阵:Apple Silicon 走 MLX,Linux 与 Windows CPU、NVIDIA CUDA 各有官方 Docker 镜像;命令行支持文件转写和麦克风实时转写,还能起一个 OpenAI 兼容的推理端点。家族产品线上,Phonon-1(415MB)基于 Qwen3-ASR-0.6B,以 Apache-2.0 发布;Phonon-2 权重随上游 Parakeet 采用 CC-BY-4.0,改动清单写在 NOTICE 文件里。它同时是 Mac 听写应用 Detta 的内置引擎——商业闭环和开源权重并不冲突。

端侧 ASR 的军备竞赛

一周之内,Parakeet Redux 和 Phonon-2 先后把 Parakeet 系底座压进 200MB 以内:前者赌三元量化的通用性,后者赌五电平量化的精度上限。Phonon-2 真正的看点不在某个单项分数,而在于 2.1 比特的极限压缩做到了单集反超全精度教师——当量化不再自动等于精度天花板,「音频不出本机」就从隐私妥协变成了工程默认选项。

所以呢:下次给 Mac 应用挑语音转写引擎,先看看 164MB 能买到什么,再决定要不要为云 API 付那笔账单。