BreezeBlue 是个从做"虚拟人声"起家的实时语音 AI 团队。

8 月 25 日,BreezeBlue 把第二代旗舰 TTS 模型 Breeze TTS 2 的权重和 PyTorch 推理代码同时开源。模型仅 3B 参数,一份权重覆盖中英等 50 种语言,可以做基于参考音频的声音克隆、纯自然语言描述的声音设计,也可以在保持音色一致的同时用指令切换情绪、节奏和语气。最关键的一项指标是把语音 AI 真正塞进实时对话场景的首音频延迟(Time To First Audio, TTFA)中位数压到 133.6 毫秒,加上 40ms 以下的"加速模式"已经能跟 ElevenLabs Flash v2.5、Fish Audio S2.1 Pro 这类顶级付费服务正面打。

"三冠王"全部出现在 BreezeBlue 自己发布的基准上。

BreezeBlue 这次同时开源了三套 TTS 评测基准——voice design、voice direction、Latency——用真实竞品做了完整对比。在 voice design benchmark 里,Breeze TTS 2 以 Role Fit 78.02、声线多样性 708 排名第一,比第二名 MiMo-v2.5-TTS 的 Role Fit 72.78 高出 5.24 分,声线多样性多 39%。在 voice direction 上,它以 4.25 分领先第二名 13%,同时将说话人相似度(SPK_SIM)维持在 0.67。在 latency 这一项,它的 TTFB p50 119.4ms、TTFA p50 133.6ms、TTFA p95 163.3ms,均低于 ElevenLabs Flash v2.5、Fish Audio S2.1 Pro、Cartesia Sonic 3.5、xAI TTS、Speechify Simba 3.2、Async Flash 1.5 等头部闭源对手。

需要明确说明:这三套基准是 BreezeBlue 团队自己开源的,目前三项冠军的成绩均来自该团队而非交叉独立评测。这一点读者在做横向对比时务必留意。

一个 3B 模型为什么能同时做"用文字写声音"和"实时出声音"。

Breeze TTS 2 把四类输入约定塞进同一份权重:

  • Voice Clone:传一段参考音频和它的逐字稿,模型保留音色、节奏和情绪;
  • Voice Design:不传参考音频,直接用自然语言指令"中年男性、磁性低音、节奏铿锵"写出全新声线;
  • Voice Direction:克隆一个声音后,再用自然语言控制每一句的情绪、强度和节奏;
  • Vocal Events:文本内联"(laugh) / (sigh) / (cough)……"或中文"[笑] / [叹气]"等标记,在合成结果里直接插入对应声音事件。

它的推理栈是 Apache 2.0 协议的 PyTorch 实现,在 NVIDIA H100 上 eager 模式显存 7.7 GiB;启用 --fast-all 全流程 CUDA Graph 编译后,体积升至 14.4 GiB,但能把首包延迟再削掉一段。中文和英文写在同一份权重里,日、西、法、德、韩、葡、印地等 50 种语言同模型生成,主页示例覆盖动画、游戏、电影电视、文学舞台、神话民俗、新闻播报六种语气走向。

权重不是 Apache 2.0,商业落地要先谈授权。

代码 Apache 2.0 没问题,但模型权重、衍生模型和自托管输出走 BreezeBlue 自己的"研究 + 非商用"许可,商业部署需要 RESONIA 公司书面授权。这个安排跟 MiniMax-Music3、IndexTTS-2.5 这类近期国产开源 TTS 类似——研究社群可直接下载、企业集成还得谈授权——但和 ElevenLabs、Cartesia 这种纯闭源商用相比,开源 TTS 正在被压缩到一个"免费研究 + 付费商业"的二元结构,平台侧的预算未来会进一步往前者倾斜。

模型卡也把语音克隆的合规红线直接写进 License:未授权的声纹复制、冒充、欺诈和其他非法用途一律不许碰。这一点对国内做 AI 客服 / 数字人 / 短视频配音的团队尤其重要——国内监管现在对"逼真克隆他人声音"的态度比去年更严,集成之前必须把合规走通,不能只看许可证字面。

实时语音 AI 这条赛道正在被卷回到"低延迟"。

这一波 TTS 发布潮(MiniMax-Music3、IndexTTS-2.5、Qwen-Audio-3.0-TTS、Breeze TTS 2)有一个共同方向——把 TTFA / TTFB 从一秒以上压进 200ms 以内。原因不复杂:实时语音 agent、游戏 NPC、互动故事这些场景,自然对话节奏要求首包延迟 ≤ 300ms,否则用户会感到明显的"顿挫"。各家都在拼三条线:声线多样性(让同一个模型支持"上千种角色")、情绪可控(让声音真的能"演")、流式协议(WebSocket 单会话多轮、PCM 流式回灌)。

Breeze TTS 2 把 TTFA p50 做到 133.6ms 这个数字,客观上把实时语音 AI 的工程门槛又拉高了一档。下一步可以关注两个数字:一是第三方独立基准(LMSYS、Artificial Analysis 之外的)能不能复现它的"三冠";二是它的商用授权价格、是否对硬件 / 语言 / 声纹数做限制——这两个变量会直接决定它在企业 SDK 选型表里的真实排位。

原始发布:https://breezeblue.ai/breeze-tts-2