技术背景

语音识别过去几年最大的瓶颈不是'识别准不准',而是'懂不懂用户在说什么'。传统 ASR 走的是逐字转写 + 后处理纠错的路,遇到同音词、上下文断句、专业术语、噪声音学场景时几乎只能依赖规则匹配——一旦用户说长句、口语、夹杂方言,模型就只能听之任之。

GPT 类大语言模型兴起后,'ASR + LLM 后处理'成为行业共识:把识别结果丢给 LLM 做纠错。但这条路线有天然缺陷——LLM 拿不到音频里的副语言信息(语气、停顿、背景声),纠错只能在文本层面打补丁。

腾讯混元 Hy ASR 3.0 preview 选的是第三条路:ASR Encoder 与 LLM 联合训练,把'听懂'前置到声学表征层面。8 月 4 日正式发布,多家媒体(IT 之家、36 氪、量子位、网易、凤凰科技)同步报道。

核心能力

Hy ASR 3.0 preview 在开源评测集上把多语种 WER(词错误率)都打到 3% 量级:中文普通话 3.34%、英语 2.62%、粤语 3.12%——这一组数字在多家独立来源的报道里完全一致,不是单家宣传口径(交叉来源:量子位官方报道、IT 之家、36 氪新闻快讯、腾讯新闻)。自建评测集在通用识别、方言识别、上下文理解、高噪 / 耳语复杂声学场景下,WER 也保持较低水平,'整体领先竞品'(同源措辞)。

四项重点能力提升:通用识别更准确(减少错字漏字)、更理解用户意图(上下文纠错同音词、消除语义歧义)、专业场景适配(支持热词注入,识别品牌名 / 人名 / 行业术语,降低业务接入和持续维护成本)、复杂环境稳定(高噪、耳语、悄悄话场景下专项优化)。

架构与训练

能力提升不是单模块变化,而是架构、数据、后训练三层叠加的结果。

架构层——模型采用 MoE 架构(兼顾效率与性能),基座模型从上一代 Hy2 升级到最新一代 Hy3,进一步增强语言理解、上下文建模和语义推理能力。语音侧,团队自研无监督语音 Encoder,通过数千万小时级无监督语音数据训练,使其能从复杂音频中提取高质量的声学表征。

数据层——对语音 Encoder 与大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,覆盖多种方言、口音和声学环境,通过高质量数据管线进行精细化标注。在方言维度,SFT 数据体系进一步覆盖 10 大方言片区 + 20 余个二级小片区

后训练层——围绕通用识别、上下文理解和复杂场景鲁棒性,团队构建了高质量 SFT recipe;并通过多阶段强化学习(RL),分别针对通用转写准确性、Any-context 上下文能力、复杂长尾场景做优化,降低模型在复杂声学环境中的误识别与漏识别。

落地与商业

Hy ASR 3.0 preview 已在腾讯云官网对外提供 API 服务( 参数 ),广泛应用于智能客服、内容理解、语音搜索等场景。

产品侧节奏:腾讯元宝(yuanbao)首发上线并以免费形式对外开放,用户打开元宝按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写;WorkBuddy 等产品也在陆续接入中。

评论

腾讯把 ASR 与 LLM 联合训练而不是松耦合串联,是这次工程上最值得关注的决定。Whisper 类传统方案是'ASR 转写 → LLM 后处理'两步走,文本层面纠错终究是事后打补丁;而 Hy ASR 3.0 preview 在声学表征阶段就携带语言知识——这意味着方言、口音、噪声环境下的转写不再是'先错后改',而是直接从表征空间规避错误。

对行业来说,3% 量级的 WER 已经接近人类速记员水平(中文普通话人工速记 WER 通常在 2-4% 之间)。问题不再是模型识别不识别得出来,而是模型能多快进入具体场景——客服、金融、医疗、法律这种术语密集的业务,谁先把'热词注入'做成开箱即用、按需调用的产品,谁就能吃掉 ASR 增量市场。

回到产品节奏——这一年内腾讯混元密集发布 Hy3 大语言基座Hy ASR 3.0AngelSpec 投机解码框架Marvis 端侧 Agent,'底层基座 + 中层 ASR/翻译 + 上层 Agent 应用'的全栈布局已经成形。当大模型竞争从'谁跑分高'切换到'谁先吃掉具体业务'时,全栈协同的厂商反而更容易拿到下一个周期的入场券。

引用源