Qwen-Audio-3.0-TTS双版本发布:Plus登顶Artificial Analysis,Flash压到300ms首包延时

7月20日,阿里巴巴正式发布语音合成大模型 Qwen-Audio-3.0-TTS,Plus 版登顶 Artificial Analysis 第三方榜单,成为继一个月前 Fun-Realtime-TTS 预览版首登实时榜后,Qwen-Audio 系列在 TTS 赛道的又一次登顶。 这次发布的看点不在参数规模,而在产品线拆分:Flash 版面向实时交互,首包延时压到 300ms 级别,瞄准电话、客服、车载等对话场景;Plus 版死磕音色复杂度与长文本韵律,瞄准有声书、视频配音等听一整段不破音的高质量生成场景。两端齐发意味着 TTS 不再是单一模型,而是按使用形态交付。 技术上四个方向齐头并进:细粒度标签控制、freestyle 指令遵循(用自然语言描述声音,无需预设参数)、多语种与方言覆盖、复杂声学鲁棒性。这正好对应 TTS 当前最热的几个痛点,尤其是 freestyle 指令控制,从 CosyVoice 2 开始头部模型就在卷这一项,现在看谁能更懂人话。 行业层面,Qwen-Audio 近两个月节奏极快:6 月预览版登顶,7 月中 Realtime 蒸馏方案出炉,7 月 20 日 Plus/Flash 旗舰发布,产品线已形成实时 + 长文本 + 多模态三轴并进的格局。对中文开发者来说,Qwen Studio 又多了一个能直接调用的 TTS 选项,且对齐到了 ElevenLabs 所在的国际一线。 TTS 这条赛道从能不能说清楚卷到能不能说到位,Qwen-Audio-3.0-TTS 是一个值得标注的节点。