当所有开源大厂都在卷 decoder-only 的时候,Yandex 交了一份反向答卷:把搜索产品 Alice AI 的生产底座 AliceAI-T5-35B-A0.6B 开源到 Hugging Face。这是一个从零训练的 encoder-decoder(T5 风格)模型,总参数 34.35B,每个 token 只激活约 0.6B——上一次大团队认真做 encoder-decoder MoE 还是 2021-2023 年的 NLLB-MoE、Switch Transformer 和 FLAN-MoE。(HF model card)
为什么要用"过时"架构
答案藏在产品形态里。据 Yandex 工程博客披露,这是搜索页"快速回答"的生成模型:上游模型先检索文档,再用 80M 参数的小模型压缩成"信息上下文",最后由它生成答案——高峰期用户等的就是这几秒。每个 MoE 层挂 512 个专家、每 token 只路由 8 个。这种"读长上下文、吐短答案"的 RAG 场景,恰好是 encoder-decoder 的传统主场:encoder 一次性并行处理检索文档,比 decoder-only 的因果注意力更省算力;再叠上稀疏 MoE,容量按 35B 走,单 token 计算量却压到 0.6B 级。模型用 UL2 去噪目标在 15T token 上预训练,训练后段用 YaRN 把上下文从 8K 扩到 128K。(Habr 官方博客)
跑分:不是全能,是偏科优等生
官方 benchmark 表里,它对上的是 Qwen3.5 2B/4B/35B-A3B、Gemma 4 E4B、T5 Gemma 2 等 Base 模型。结论很清晰:事实性与抽取类全面领先——俄文事实基准 CultCat 68.0、WikiWebFacts 81.3,Ruler 32K 拿到 94.7,全部压过激活量 5 倍于己的 Qwen3.5-35B-A3B;但数学代码类(MATH 500 62.9、HumanEval 69.3)和 Ruler 128K(81.4)仍是 Qwen3.5-35B-A3B 更强。盲测 SbS 同样如此:胜过微调版 Qwen3.5-2B 77%、4B 54%、T5 Gemma 2.4B-4B 69%,唯独对 Qwen3.5-35B-A3B 只有 44%——官方也承认对方"推理成本显著更高"。
训练细节里的两个信号
一是训练稳定性:团队先用了 Macro-LBL 式辅助损失做专家均衡,结果在 15T token 规模下 encoder 侧路由直接崩了,最终换用 DeepSeek-V3 的 aux-free 路由(偏置项不走梯度)才稳住——MoE 均衡策略在大规模下的失效又添一例。二是优化器:他们选了 Muon 而非 AdamW/Adan,称实验中表现更好。工程侧还有一条容易被忽略的免责:对外只开放 HF Transformers 推理,生产级优化推理仍在 Yandex 内部。官方数据显示该方案在线 A/B 带来 +0.34% 的会话数增长,SbS 对 Google AI Overview 胜率 56.7%。
对做检索增强或结构化抽取的团队,这是一个稀缺的非 decoder-only 参考点;但对通用基准党,它本来就不是为你准备的——专才架构的胜利,恰恰说明了"模型设计跟着产品形态走"这条老原则在 MoE 时代依然成立。