语音克隆的「工业级」新样本

8 月 10 日,Bilibili IndexTeam 开放了 IndexTTS-2.5 的模型权重。这是一个零样本 TTS 系统:给一条参考音频,它就能克隆出对应音色,覆盖中文、英文、日语、西班牙语、阿拉伯语五种语言,并支持跨语种音色迁移——用一段中文参考音频,让同一个声音说英语。

对比上一代 IndexTTS-2,这一版新增日语、西班牙语、阿拉伯语三个语种,推理速度更快,还加上了语速控制与更细的发音控制。技术报告同步挂在 arXiv(编号 2601.03888)。

架构:三段式流水线

模型卡披露的架构是经典三段式:约 0.8B 参数的 GPT 主干 + flow-matching 语音到梅尔谱的解码器 + BigVGAN 声码器,输出 22.05 kHz 波形。推理需要 NVIDIA GPU、Python 3.10-3.11,显存占用约 6GB——一张消费级显卡就够。首次运行时还会自动拉取 w2v-bert-2.0、MaskGCT、CAMPPlus 等辅助模型。

控制力才是重点

IndexTTS-2.5 真正的卖点是「可控」,三个维度:

  • 情感控制:情感与音色解耦,用 8 维浮点向量直接调控,顺序固定为 [开心、愤怒、悲伤、恐惧、厌恶、忧郁、惊讶、平静]。想要带点哭腔的「快躲起来」,把 sad 设为 0.8 即可。文本描述式情感则需要额外加载 QwenEmotion 模型。
  • 发音控制:中文可用拼音标注多音字(模型卡示例:),英文用 CMU 音标,日文用假名注音。
  • 语速控制:duration_factor 参数,0.5 到 2.0 之间,大于 1 放慢、小于 1 加速。

版权与伦理的明账

几个值得注意的细节。第一,许可证是 bilibili Model Use License Agreement,不是 Apache/MIT 这类标准开源协议,商用前需要细读条款。第二,模型卡在 Limitations 里写得很直白:模型不验证参考音频中的说话人是否同意被克隆,取得授权是使用者的责任——在语音克隆滥用争议不断的当下,这句免责声明本身就是行业现状的注脚。第三,长文本会被分段合成再拼接,韵律无法跨段保持;开启情感随机采样也会降低克隆保真度。

上线一周,Hugging Face 月下载量 4,176,社区已有 3 个微调版本和 1 个量化版在流转。

所以呢

TTS 开源赛道最近格外热闹:Qwen3-TTS、VoxCPM2、ViiTorVoice 轮番登场,IndexTTS-2.5 把「情感向量 + 发音控制」这组工程化旋钮做得最完整。对开发者而言,6GB 显存跑五语种克隆的门槛已经足够低;真正的问题反而是非技术的:你手里那条参考音频,本人同意了吗?

原文:Hugging Face 模型卡