传统语音转写管线里,“听清说了什么”和“分清是谁在说”历来是两件事:ASR 模型负责前者,说话人分离(diarization)系统负责后者,两段管线拼起来,才得到一份带人名的会议纪要。这种拆分在离线场景没问题——反正音频录完再处理也来得及——但实时语音助手和 voice agent 等不起:等整段音频齐了再跑分离,延迟预算直接爆表。微软研究院 9 月 2 日提交到 arXiv 的技术报告给出了新解法:VibeVoice-ASR-Streaming,一个基于 LLM 的端到端流式说话人转录模型(arXiv:2609.02812)。

边听边输出“谁在说什么”

模型的核心机制,是把固定大小的音频块、少量前瞻(lookahead)音频与已生成的文本交错输入,让它在语音持续到达的同时输出“谁说了什么”,不再需要独立的 diarization 阶段。论文自称这是最早一批基于 LLM 的端到端流式说话人 ASR 方案——“自称”两个字值得保留,这类“first”式声明目前只有论文单一信源,按惯例等社区复现再完全采信。

评测数据同样出自论文自报口径:7B 模型在五组评测集上取得最低的平均 WER/CER;说话人归属在 13 项评测设置中拿下 12 项最佳或并列最佳。除 7B 外还有 1.5B 版本,两档权重连同推理代码全部开源,GitHub 仓库为 microsoft/VibeVoice,Hugging Face 模型卡标注 MIT 许可证。

工程侧还有两个实用设计:一是自定义热词,可以把人名、技术术语表注入模型,提升领域内容的识别准确率;二是十语言支持——中、英、法、德、意、日、韩、葡、俄、西,覆盖主流会议场景绰绰有余。

voice agent 为什么需要它

这件事的真正分量在延迟预算里。实时 agent 的多轮对话中,如果说话人信息要等 diarization 后处理才能补上,上下文就出现断层:agent 分不清刚收到的这句话来自用户还是背景里的第三人。把归属判断做进流式解码本身,多人对话场景下的 agent 才具备“当场知道谁在说话”的能力——这正是语音交互从单人说、单人听走向真实多人环境的关键一步。1.5B 档的放出则给了低资源部署一个明确选项,毕竟不是所有边缘设备都塞得下 7B。

从产品谱系看,VibeVoice 家族此前以长篇多说话人 TTS 闻名,这次是 ASR 侧的补位。微软把语音的“生成”与“理解”两端都押在开源上,姿态相当明确:语音 agent 基础件这块,想用生态打法吃下。

所以呢

对做语音产品的团队,这条新闻的价值不在跑分,而在“流式 + 说话人归属 + 热词”三件事被一个模型全包,还挂 MIT 许可。自托管实时会议转写、多人语音 agent 的对话记忆,现在都有可以直接下手的权重。留个心眼的只有一点:评测与“最早一批”均为官方自报,采购决策前先自己跑一遍评测集。