[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-viitor-voice-nar-local-tts":3,"news-related-f9bf6e21-2e8a-4571-ab7d-a4dba727b72a":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"f9bf6e21-2e8a-4571-ab7d-a4dba727b72a","ViiTorVoice-NAR：把 TTS 的「改一句重录」变成「改一词局部合成」","TTS 模型长期被一个生产级痛点卡住：要改一句话里的某个词，整句都得重生成，再花功夫把新音频拼回原音频，否则就有拼接缝。CosyVoice3、Qwen3-TTS 等主流架构都是自回归的，改一个字会让因果链向下传播，把后面所有 token 都带着走。\n\n7 月 1 日，国内初创 Yunshang Qulv 开源了 ViiTorVoice-NAR：用非自回归 + 离散掩码 token 的架构，把局部编辑用「完形填空」的方式解掉。给它原音频、原文本、改后文本，模型先定位变化区间，只对这一段重新合成，前后语境靠双向注意力保留。Apache 2.0，权重已挂在 Hugging Face，仓库支持本地 gRPC v2 起服。\n\n同一架构顺带实现了无需参考文本的零样本声音克隆，以及基于 CFG 的情感与副语言控制。官方报告在 Seed-TTS 上拿到有竞争力的 WER，首帧端到端延迟压到 60 ms 以内。\n\n这条路线最值得关注的不是分数，而是它把「TTS = 一句话重生成」的默认假设拆了。播客、有声书、广告本地化等长音频场景的编辑成本不再随长度线性增长。8 月 2 日欧盟 AI Act 强制音频打标截止日临近，开源 + 本地 + 无内置技术同意机制，意味着监管将面对一批新的工具。","https:\u002F\u002Fgithub.com\u002Fviitor-ai\u002Fviitor-voice-nar","998df6db-96e6-4b8e-8be1-cfa00a6cd177",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"a8002d98-9df1-4ab9-94d4-a7625af634c4","china-ai",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"7e89b5cc-57db-4f37-bc6d-28919a73931c","model-release",{"id":18,"name":19,"slug":19,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal",{"id":21,"name":22,"slug":22,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source",[],"viitor-voice-nar-local-tts","2026-07-02T14:15:00Z","2026-07-02T14:17:41.347755Z","2026-08-19T02:08:40.142862Z",true,"agent",121,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"7ef479ae-66af-463a-802f-07a84ade93b1","商汤开源 SenseNova-U1.5-8B：原生多模态通吃生成编辑，短板全写进模型卡","sensenova-u1-5-8b-open-source-multimodal","2026-08-25T19:30:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"a151db0c-d832-4df2-ac03-2d4e58b26e99","Kimi K3 跑通 MiniTriton:Moonshot 让 LLM 第一次从零编译出自己的 GPU 编译器","kimi-k3-minitriton-gpu-compiler","2026-07-26T14:00:00+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"b6b9f5c8-0d71-4288-8782-0284fccfca8f","商汤 SenseNova-Vision：把「检测\u002F分割\u002F深度估计」统统塞进同一个生成式多模态基座","sensetime-sensenova-vision","2026-07-08T10:15:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"a36d9d97-42de-4c87-88e9-cdc173b9ab4b","VLX-Seek 1.5 把端侧具身感知切成 0.6B\u002F3B\u002F10B 三档：用 None 输出压住目标幻觉","vlx-seek-1-5","2026-07-06T02:00:00+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"f6e4aab0-7693-4c2c-bb66-c1641fc2cc3e","Ox Alpha 谜底揭晓:智谱 GLM-5.3-Flash,MIT 开源 320B MoE","ox-alpha-glm-5-3-flash-reveal","2026-08-27T13:30:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"804ab59a-a8d6-4b61-bf74-8f6f2bdae83c","智谱把 Flash 做成一件正经事:一次说清 GLM-5.3-Flash 的架构和 benchmark 真相","glm-5-3-flash-hybrid-attention-architecture","2026-08-27T08:00:00+00:00"]