语音转写的默认假设一直是要 GPU:模型动辄上 GB,推理吞吐靠显卡堆。Moondream 最近发布了 parakeet-redux,把这个假设拆了——NVIDIA 开源 ASR 模型 parakeet-tdt-0.6b-v3 被压到 178MB,在一台普通 x86 CPU 上跑出 113 倍实时的转写速度,全程不碰显卡。
三元化:最激进的量化
parakeet-redux 的做法是对 parakeet-tdt-0.6b-v3 做 1.58-bit 三元量化:架构不动、tokenizer 不动,但编码器的每个权重只剩 -1、0、+1 三个取值。原始权重 1.2GB,压完后 178MB,不到原来的 15%,小到可以塞进任何边缘设备。配套的 Photon 运行时直接读取打包后的权重:x86 上走 AVX-512 VNNI 指令,ARM 上走 NEON,Apple GPU 上走 Metal。
速度:同硬件上最快的 Parakeet CPU 方案
Moondream 在 AMD EPYC 9575F(Zen 5)的 8 个物理核上做了同机对比:parakeet-redux 配 Photon 跑到 113 倍实时,是实测最快的其他 Parakeet CPU 运行时的 2.5 倍——parakeet.cpp 的 q8_0 版只有 45 倍,sherpa-onnx 42 倍,onnx-asr 28 倍。Apple M2 上同样领先:CPU 38 倍、GPU 43 倍,而 parakeet.cpp 的 Metal 路径 38 倍、跑 fp32 的 parakeet-mlx 只有 37 倍。一个三元权重模型,在 MacBook Air 上反超了专门适配过的原生运行时。
精度:多语种与长音频反超,噪声是短板
英文 Open ASR Leaderboard 七个测试集平均 WER,Redux 6.55 对原版 6.26,差距在 0.3 以内;AMI 会议、Earnings-22 财报电话两集还略有胜出。真正反直觉的是 25 语种 FLEURS:平均 10.56,好于原版的 11.62——爱沙尼亚语 9.15 对 13.23,拉脱维亚语 12.80 对 21.38,斯洛文尼亚语 16.21 对 21.76。10-20 分钟的 TED-LIUM 长音频同样反超,2.51 对 2.71。短板在噪声:MUSAN 九个强噪条件平均 9.04,明显落后原版的 6.72。模型卡自己的解释是三元编码器的声学余量更薄,低信噪比下更容易把词替换成近音词。
所以呢
对做本地语音接口、隐私敏感转写的团队,这是一条明确的成本路线:178MB 的模型加一个运行时,笔记本和边缘盒子上就能跑实时转写,不必把音频送上云。两点提醒:其一,Moondream 采用自定义许可证,商用前要读条款;其二,强噪声场景的退化说明三元化不是免费的,选型时先拿自己的真实音频压测。ASR 生态的去 GPU 化正在成为一条独立赛道——量化到三元、重写运行时、砍掉 Python 依赖,路径各异,方向一致:把推理成本从云端搬到终端。