[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-88530de3-e880-4355-97d8-ba2266a92acc":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"88530de3-e880-4355-97d8-ba2266a92acc","Qwen3-TTS 开源登顶 Seed-TTS 双榜:12Hz Tokenizer 把 TTS 卷到多语种 SOTA","阿里通义 7 月 20 日放出 Qwen-Audio-3.0-TTS(开源版即 Qwen3-TTS),Plus 版本登顶 Artificial Analysis 实时\u002F高质量双榜,把开源 TTS 拉到新水位。核心是自研 12Hz Speech Tokenizer:16 codebook、12.5 FPS,PESQ-WB 3.21 \u002F STOI 0.96 \u002F UTMOS 4.16 \u002F SIM 0.95 全面碾压 Mimi、FireRedTTS 2 等同类。模型分两档:25Hz(0.6B\u002F1.7B)走通用,12Hz(0.6B\u002F1.7B)走高质量;VoiceDesign 支持自然语言指令捏声,Base 支持 3-10 秒参考音频做声音克隆。Benchmark 上 Qwen3-TTS-12Hz-1.7B-Base 在 Seed-TTS test-zh\u002Ftest-en WER 拿到 0.77 \u002F 1.24 双 SOTA;跨语种测试中,中文 0.928、英语 0.934、俄语 3.212 全面压制 CosyVoice 3;InstructTTS-Eval 上 VoiceDesign 中文 DSD 81.1 \u002F RP 65.1 逼近 Gemini-flash。工程同样激进:vLLM-Omni Day-0 支持推理,DashScope 同步上线 Realtime\u002FVoiceClone\u002FVoiceDesign 三套 API,GitHub Apache-2.0 开源两周 12.5k stars。更深层的信号:自研 tokenizer + LLM 主干这条路在 TTS 上跑通完整闭环,不再是 CosyVoice 时代模块拼装的玩法。离散表征做到 12Hz,声音克隆、情绪控制、跨语种合成的边际成本大幅下降。Qwen 同时把开源权重、商用 API、推理引擎一次性补齐,这种全家桶打法也是国内团队首次在 TTS 赛道和 ElevenLabs、OpenAI 打到同节奏,下半年多语种配音、AI 播客、有声书等产品值得重新看一遍。","https:\u002F\u002Fgithub.com\u002FQwenLM\u002FQwen3-TTS","c36a21ac-2a77-421b-9519-1e150695732a",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"7e89b5cc-57db-4f37-bc6d-28919a73931c","model-release",{"id":18,"name":19,"slug":19,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source",{"id":21,"name":22,"slug":22,"description":13,"color":13},"c187600e-804c-4697-b828-1e4330e0eb10","qwen","2026-07-20T12:00:00Z","2026-07-20T12:04:53.766779Z","2026-07-20T12:04:53.766793Z",true,"agent",7]