语音处理的工具箱向来很碎:合成用一个模型,降噪用一个模型,人声分离又一个模型,改个音高、换个情绪还得再找工具。9 月 9 日,腾讯混元团队把 AuK 开源——一个 1.5B 参数的语音基础模型,试图用「自然语言指令 + 音频上下文」这一个接口,把语音生成和编辑的全部环节收进同一个模型。

五大任务族,一套指令接口

按照技术报告,AuK 的训练覆盖五个任务族:语音生成、内容编辑、增强与分离、副语言编辑、声学编辑,对应到实际能力是 16 类任务——零样本 TTS、无参考音频的指令 TTS、改写说词的内容编辑、保留旋律改歌词的歌词编辑、按半音调整音高、调速、调音量、换情绪、换音色、去口音、增删呼吸笑声等非语言声、气声与正常语音互转,再加上降噪增强、人声分离、音乐分离和按内容定位的目标说话人提取。

支撑这个能力面的数据规模不小:约 30.3 亿条指令-音频实例、195 万小时有效监督。所有任务共用同一个消息式调用接口,一条指令说清楚要什么,音频按需传入。

三件套架构:MLLM + 联合 VAE + 混合整流流

架构上 AuK 是三件套:一个多模态大语言模型负责语义条件(仓库披露当前实现用 Qwen2.5-Omni-3B 做编码器);一个在语音、通用音频、音乐上联合训练的 VAE 负责声学条件;生成主体是混合整流流 Transformer——先走双流 MMDiT 块,再进统一单流 DiT 块。

训练分三步走:先生成热身,再进生成-编辑联合预训练,后训练阶段按任务分化——开放式编辑用人类反馈偏好优化,语音生成走基于奖励的强化学习。

AuK-Flash:4 步推理,4.5 倍加速

推理成本用蒸馏压:官方用一致性初始化加任务路由的 Decoupled DMD 蒸馏出 AuK-Flash,固定 4 步推理、免分类器自由引导,相同条件下比完整模型快 4.5 倍。官方报告称其在零样本与指令控制的语音生成、通用指令编辑评测中处于领先水平,在信号级修复任务上保持竞争力——这是官方评测口径,独立复现还有待社区验证。

开源交付:MIT 协议 + 全套工具链

交付面相当完整:以 MIT 协议放出代码和权重(AuK 与 AuK-Flash 两个变体),HuggingFace 与 ModelScope 双平台提供权重下载和在线 Demo,自带 ComfyUI 节点、命令行与 Python API,微调管线用 JSONL 数据格式加动态 batching。开源当天 GitHub 仓库已有 73 个 star。

论文与代码:arXiv:2609.08936 · GitHub 仓库

所以呢

AuK 的思路值得注意:它没有在某个单一语音任务上卷指标,而是把 LLM 领域验证过的「指令统一 + 大规模多任务预训练」范式搬到语音模态,跟图像、视频领域近一年的统一模型趋势同构。1.5B 的体量加 4 步推理的蒸馏版,意味着这条路线已经摸到本地部署的门槛。

对做语音应用的开发者,MIT 协议加现成微调管线基本消除了试用阻力;对垂直语音工具厂商,问题则尖锐得多——当生成、编辑、分离被一个 1.5B 模型统一,单点功能的护城河还剩多宽?