翻译这个被认定"已经被解决"的老任务,最近又热闹了起来。腾讯混元、Cohere 相继开源翻译专用模型之后,哔哩哔哩 Index LLM 团队在 9 月 30 日交出了自己的答卷:Index-Translate 翻译模型家族,2B、9B、35B-A3B(preview)三个规模的文本模型权重在 Hugging Face 与 ModelScope 开放,许可证 Apache-2.0(模型卡)。
35B 总参、3B 激活:翻译专用的 MoE
旗舰 Index-Translate-35B-A3B-preview 基于 Qwen3.5 构建,总参 35B、每 token 激活约 3B——标准稀疏 MoE 配方。覆盖 150 种语言,出厂上下文 262,144 token,官方示例按 32K 档起服务,vLLM 即可自托管。
技术报告披露了三段式流程:先做 167.77B token 的多语种 mid-training(通用/单语/平行语料 constant 阶段 1:1:1,decay 阶段切 1:4:2 的 pivot 组织);再对通用翻译、指令遵循、梗文化翻译三个专家分别 SFT + RL(奖励组合 XCOMET-XXL、语言有效性与 Rubric-as-Reward);最后参数插值合并专家,再用多教师在线蒸馏 MOPD 补弱项(报告)。这套"专家分工再合并"的打法,和通用大模型的 post-training 路线已完全同构。
把"约束"做成硬性规格
真正值得看的是指令遵循。它把翻译约束分两档:硬约束包括术语强制对齐、JSON/CSV/markdown 结构保留、代码块和变量占位符原样保留;软约束负责风格切换(正式、口语、梗味)和领域消歧。对本地化流水线来说,这比"翻得更像人"实用得多:术语锁得住,格式不塌,变量不丢。
数字怎么看
官方自测表格里,35B-A3B 在报告内所有对比系统中拿到最高 FLORES COMET-22(0.8794)和 instTrans IFscore(0.8336),WMT26 Judge 76.76。同规模对比:腾讯 Hy-MT2-30B-A3B 的 WMT26 Judge 是 66.81,TranslateGemma-12B 是 71.19,Qwen3.5-35B-A3B 底模 71.33——翻译专项训练的增益肉眼可见。低资源语向上 off-target 率仅 2.4%,Hy-MT2-30B-A3B 是 14.5%。
所以要泼冷水:闭源 API 旗舰仍更高,GPT-5.6-Sol 的 WMT26 Judge 是 89.10,DeepSeek-V4.1-Flash 是 83.55。开源翻译模型赢的是自托管、零调用成本与约束可控,不是绝对质量。
为什么是 B 站
家族里还有 Index-Echo(语音字幕/语音到语音)、Index-Homura(按目标音节数配音)和 Index-NativeLong(整篇长文档)。组合拳指向很明确:视频字幕、跨语配音、社区内容出海——全是 B 站自己的业务场景。它在梗文化翻译基准 MEME 上拿到 0.7405,明显高于 Hy-MT2-30B-A3B 的 0.5812。UGC 社区的黑话、缩写、玩梗翻译,恰是通用模型最拉胯的角落,而 B 站手里有全世界最密的这类语料。
所以呢:通用模型卷到万亿参数的同时,垂直任务的护城河正变成"谁有场景数据、谁把约束工程做细"。B 站这次开源,与其说是慈善,不如说是把业务壁垒顺手变成行业标准件。