阿里通义 7 月 20 日放出 Qwen-Audio-3.0-TTS(开源版即 Qwen3-TTS),Plus 版本登顶 Artificial Analysis 实时/高质量双榜,把开源 TTS 拉到新水位。核心是自研 12Hz Speech Tokenizer:16 codebook、12.5 FPS,PESQ-WB 3.21 / STOI 0.96 / UTMOS 4.16 / SIM 0.95 全面碾压 Mimi、FireRedTTS 2 等同类。模型分两档:25Hz(0.6B/1.7B)走通用,12Hz(0.6B/1.7B)走高质量;VoiceDesign 支持自然语言指令捏声,Base 支持 3-10 秒参考音频做声音克隆。Benchmark 上 Qwen3-TTS-12Hz-1.7B-Base 在 Seed-TTS test-zh/test-en WER 拿到 0.77 / 1.24 双 SOTA;跨语种测试中,中文 0.928、英语 0.934、俄语 3.212 全面压制 CosyVoice 3;InstructTTS-Eval 上 VoiceDesign 中文 DSD 81.1 / RP 65.1 逼近 Gemini-flash。工程同样激进:vLLM-Omni Day-0 支持推理,DashScope 同步上线 Realtime/VoiceClone/VoiceDesign 三套 API,GitHub Apache-2.0 开源两周 12.5k stars。更深层的信号:自研 tokenizer + LLM 主干这条路在 TTS 上跑通完整闭环,不再是 CosyVoice 时代模块拼装的玩法。离散表征做到 12Hz,声音克隆、情绪控制、跨语种合成的边际成本大幅下降。Qwen 同时把开源权重、商用 API、推理引擎一次性补齐,这种全家桶打法也是国内团队首次在 TTS 赛道和 ElevenLabs、OpenAI 打到同节奏,下半年多语种配音、AI 播客、有声书等产品值得重新看一遍。