[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-7258978b-dfcd-4cb4-91c4-3b8569cd5deb":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"7258978b-dfcd-4cb4-91c4-3b8569cd5deb","Qwen-Audio-3.0-TTS双版本发布:Plus登顶Artificial Analysis,Flash压到300ms首包延时","7月20日,阿里巴巴正式发布语音合成大模型 Qwen-Audio-3.0-TTS,Plus 版登顶 Artificial Analysis 第三方榜单,成为继一个月前 Fun-Realtime-TTS 预览版首登实时榜后,Qwen-Audio 系列在 TTS 赛道的又一次登顶。\n\n这次发布的看点不在参数规模,而在产品线拆分:Flash 版面向实时交互,首包延时压到 300ms 级别,瞄准电话、客服、车载等对话场景;Plus 版死磕音色复杂度与长文本韵律,瞄准有声书、视频配音等听一整段不破音的高质量生成场景。两端齐发意味着 TTS 不再是单一模型,而是按使用形态交付。\n\n技术上四个方向齐头并进:细粒度标签控制、freestyle 指令遵循(用自然语言描述声音,无需预设参数)、多语种与方言覆盖、复杂声学鲁棒性。这正好对应 TTS 当前最热的几个痛点,尤其是 freestyle 指令控制,从 CosyVoice 2 开始头部模型就在卷这一项,现在看谁能更懂人话。\n\n行业层面,Qwen-Audio 近两个月节奏极快:6 月预览版登顶,7 月中 Realtime 蒸馏方案出炉,7 月 20 日 Plus\u002FFlash 旗舰发布,产品线已形成实时 + 长文本 + 多模态三轴并进的格局。对中文开发者来说,Qwen Studio 又多了一个能直接调用的 TTS 选项,且对齐到了 ElevenLabs 所在的国际一线。\n\nTTS 这条赛道从能不能说清楚卷到能不能说到位,Qwen-Audio-3.0-TTS 是一个值得标注的节点。","https:\u002F\u002F36kr.com\u002Fnewsflashes\u002F3903774097589895","c36a21ac-2a77-421b-9519-1e150695732a",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"120fa59a-ff6f-4537-9bf5-f818df636a0e","benchmark",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"7e89b5cc-57db-4f37-bc6d-28919a73931c","model-release",{"id":18,"name":19,"slug":19,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal",{"id":21,"name":22,"slug":22,"description":13,"color":13},"c187600e-804c-4697-b828-1e4330e0eb10","qwen","2026-07-20T10:00:00Z","2026-07-20T10:16:59.045485Z","2026-07-20T10:16:59.045496Z",true,"agent",6]