语音大模型上最贵的部分,未必是那个会说话的大脑,而是那双"耳朵"。小鹏汽车 XPeng Omni 团队最近开源的 X-AuT 框架,给出的答案是:把耳朵剪小一点,大脑保持冻结,识别精度还能不降反升。

剪的是音频塔,不是语言模型

X-AuT 的操作对象是 Qwen3-ASR-0.6B 这类语音大模型里的音频编码器(audio tower)——负责把原始波形变成语言模型能消化的嵌入表示。团队把它从 18 层 Transformer 块渐进式剪到 14 层:先删第 1、18 层得到 16 层版,再删第 5、6 层得到 14 层版,音频塔参数从 1.86 亿降到 1.48 亿,省了 20.7%。整个过程语言模型主干完全冻结,只在注意力投影上加 LoRA 适配器,输出嵌入与 lm_head 绑定共享。

关键数字:两层精度不降反升的窗口

在十个公开中英文基准上,结果是两档实用的工程甜点:16 层版把宏平均错误率从 5.61% 压到 5.27%,相对降 6.1%;14 层版错误率 5.75%,相对只涨 2.5%,换来 20.7% 的参数削减。推理效率方面,14 层编码器在车载 PPU 上延迟降 21.4%,H800 上降 11.4%;端到端延迟分别降 4.7% 和 2.6%——幅度有限,因为未被剪枝的 28 层文本解码器占了大头。

为什么渐进剪枝比一刀切好

直接把 18 层砍到 14 层,错误率会飙到 6.73%;X-AuT 分两步走、配合恢复训练,同样 14 层只要 5.75%,差出近 1 个百分点。恢复手段是四件套:行为探针选层、表征对齐、跨尺度蒸馏、LoRA 微调。其中跨尺度蒸馏值得单说——用一个冻结的 Qwen3-ASR-1.7B 当教师,通过学到的 2048→1024 投影监督 0.6B 学生,蒸馏完教师就丢弃。同样配方下,跨尺度教师把学生错误率带到 5.55%,同尺度自蒸馏只有 8.45%,差距悬殊。

端侧落地的算力账

这套数字背后是车载场景的现实约束:车机芯片上每一毫秒延迟都直接体验相关。训练数据侧,团队用一个超 28 万小时、按转录一致性分九档置信级的源池,报告的运行全部用第一档数据。但也要泼冷水:基准值都是单次运行的最佳 checkpoint,论文自己写明没有重复种子和置信区间;14 层版在 Fleurs-en 上最大退化 0.93 个百分点,十个基准里有八个仍高于基线。开源范围也有限——放出的是 14 层 checkpoint 推理脚本和最小 LoRA 微调示例,行为探针管线、跨尺度蒸馏代码和 28 万小时数据管线都不在发布范围,许可证是 CC BY-NC 4.0,禁商用。

对做端侧语音的团队,这份工作的价值不在"又一个压缩方法",而在它把"剪音频塔、冻语言模型"这条路径的精度-延迟边界画清楚了:两层以内的渐进剪枝,精度损失可以靠恢复训练抹平甚至反超;再往下剪,收益和风险就开始赛跑。当语音交互从手机助手走向车载、耳机等算力受限场景,这种给"耳朵"减负的精细活,会比无脑堆参数更接近落地。