当大多数通用音频模型还在 diffusion Transformer 的连续生成范式里迭代时,阶跃星辰 StepFun-Audio Team 交出了一份 71 位作者署名的技术报告。报告里的模型把零样本 TTS、音色设计、人声演唱、音效、音乐,以及多类音频混合的"全要素声场",全部塞进同一个框架——而且反着来,回到离散自回归。
反着来:不做 diffusion,在 RVQ token 上自回归
arXiv 摘要写得很直接:这是一个离散自回归生成器,直接在残差向量量化(RVQ)token 上建模音频,脱离近期通用音频模型流行的 diffusion Transformer 连续生成范式。拆开看是三件事:
- Tokenizer:StepAudio Tokenizer 以 12.5 Hz 表示通用音频,使用 16×2048 的共享残差码空间,语义特征与波形级声学特征联合量化,每层码本都同时保留两类信息;
- 骨干分工:主干沿时间轴自回归预测第一本码书,剩余 15 本码书由一个轻量因果 Transformer 沿码本轴补完——时间轴和码本轴各管各的;
- 共享表示:语音、人声、音效、音乐全部落在同一套离散表示上,这是"一个模型干所有音频活"的前提。
三个设计原则,核心是别把 LLM 教坏
团队总结了三条经验:一是干扰感知的渐进式预训练,在获得音频能力的同时保住大语言模型原有的文本能力;二是 RVQ Adaptor,把多码本声学表示有效接进主干;三是跨音频域共享表示上的离散自回归建模。训练路径是渐进预训练、多任务指令训练加监督微调三段式。第一条尤其值得注意——音频能力吃掉文本能力,是 LLM 改行做音频最常见的翻车点。
官方竞技场:两榜居首,但要看清口径
官方项目页放出了两张竞技场图表。中文拟人度竞技场上,该模型 Elo 1755.3,在图中展示的六个模型里排第一,领先次名 211.1 分;500 场对抗 410 胜 39 平 51 负,总胜率 82.0%——对 Qwen 73%、对上代 StepAudio 2.5 TTS 78%、对 Doubao 79%、对 Inworld 和 MiniMax 均为 90%。音色设计竞技场上 Elo 1668.5,五个模型中居首,领先 97.0 分,196 场 148 胜,总胜率 75.5%。
两点口径必须说清:竞技场与对比名单都来自官方项目页,论文"TTS 与音色设计达到 SOTA"属于团队自报,尚无独立第三方复现;同时报告中没有给出权重或代码获取入口,Hugging Face 论文页关联模型数为 0,项目页只挂着"Voice Studio Coming Soon"。
所以呢
看点不在"又多一个音频模型",而在路线选择:在 diffusion 几乎成为默认答案的时段,这支团队押注离散自回归加共享码空间,并拿竞技场数据自证。全要素生成直接对准影视、广播剧、短视频的生产流——角色对白、环境、音效、音乐在同一条时间线上编排,省掉跨工种后期拼接。下一个值得盯的问题是:这套 12.5 Hz 共享码空间,会不会像文本 tokenizer 一样,成为音频生成的基础设施?
参考:arXiv:2609.12945(https://arxiv.org/abs/2609.12945);项目页 stepaudiollm.github.io/step-audio-3-gen;Hugging Face 论文页 28 upvotes。