AMD 把 Instella-MoE 摊在桌面:16B 总量、2.8B 激活的「全开源 MoE」想证明什么

事件

AMD 7 月 24 日通过 ROCm Blogs 发布 Instella-MoE-16B-A3B,一款「完全开源」的 Mixture-of-Experts 语言模型。它有 160 亿总参数,每个 token 仅激活 28 亿参数,采用 27 层 decoder-only 架构、2 个共享 expert 加 64 选 6 的 routed expert 结构。这不是普通的研究 demo:AMD 同时放出了从预训练、Mid-train、长上下文扩展到 SFT、DPO、强化学习的完整 6 阶段 checkpoint,以及对应的训练配方、数据配比和代码。这正是「全开源」和「只开源权重」之间的关键差距。

两条架构创新:Gated MLA 与 FarSkip-Collective

Instella-MoE 没有照搬 DeepSeek-V3 的 MLA,而是在 MLA 上加了一个轻量级 learned output gate——这就是论文里所说的 Gated Multi-head Latent Attention。做法不复杂:每个 Gated MLA 层先做一个独立的线性投影得到一个 input-conditioned gate,然后在 MLA 输出与最终 output projection 之间做逐元素相乘。这个 gate 是数据依赖的非线性,可以让模型有选择地弱化低价值的 attention 响应。AMD 强调「以适度的成本换取了更大的表达力」——也就是说,Gated MLA 不是为 benchmark 数字服务的花活,而是给 MoE 模型本身的稀疏性留出一个对 attention 输出做 soft gating 的口子。

另一条更偏系统的优化是 FarSkip-Collective:它改造了 MoE 中常用的 all-to-all expert parallel,把「过时且不完整的激活」提前传进下一层 attention 和 MoE,从而把通信和计算 overlap。AMD 报告在预训练阶段通信 overlap 带来了 12.7% 的训练提速,在推理侧配合 SGLang 与 expert parallelism 后,TTFT(Time to First Token)最高降低 39.2%。这意味着 Instella-MoE 不只是一个能跑通的模型,还是一个为 AMD 硬件通信栈专门调过的模型。

训练管线:64K 长上下文、1400 步 GRPO、MOPD 蒸馏

长上下文阶段把窗口从 4K 扩到 64K,使用了 YaRN 风格的 RoPE theta 调整,并在 packed document 之间加上了 document mask 以防 attention 泄漏。两阶段 long-context 训练分别针对通用长文档和 math/code/reasoning 长文本,在最终的 Base checkpoint 上,HELMET 平均 41.5、RULER 平均 79.4。

后训练分三步:

  • SFT:在 Dolci-Think-SFT-7B 之上叠 Nemotron-Cascade-2-SFT-Data 与 Nemotron-SFT-Competitive-Programming-v2 强化 STEM 与推理;末期引入 feedback-driven data curation,用 512K 精选样本替换均匀采样。
  • DPO:AMD 在初步实验里发现 DPO 直接作用于 MoE 会引发性能退化,他们的解释是 load-balancing 目标会让 router 的 affinity 快速变化,因此在 DPO 阶段禁用了 router bias 更新和辅助 load-balancing 损失——这是工程上比较有意思的细节。
  • RL:用 IF-RLVR 子集跑 1400 步 GRPO,叠加 zero-gradient signal filtering、active sampling、token-level loss、no KL、clip-higher、no std normalization 与 Rollout Routing Replay (R3);最后用 Multi-Teacher On-Policy Distillation(MOPD)把 IF expert 的指令跟随能力蒸馏回 DPO 模型。

成绩单:在 2.8B 激活预算内追平 4B 量级

  • Base 模型平均分 76.7,在「全开源」阵营里最强,明显高于 SmolLM3-3B-Base(70.5)、OLMo-3-7B(70.1)、OLMoE-1B-7B(61.9);WinoGrande 86.5 排名第一、HumanEval+ 65.7,跨知识/推理/数学/代码分布均衡。
  • Think 模型(SFT → DPO → RL → MOPD 蒸馏)平均 73.22,在 Olmo3-7B-Think(71.97)、Gemma-4-E4B-think(70.47)、Qwen3.5-4B(69.73)之上;IFEval 从 DPO 的 77.08 抬到 83.70,AGIEval 82.50、AIME25 73.40。

换句话说,16B 总量 / 2.8B 激活这个预算,AMD 跑出了在「全开源」和「开源权重」两个圈子里都不输的分数。这背后是 MoE 稀疏激活 + Gated MLA 表达力 + AMD 全栈通信优化的合力。

评论:AMD 想要的不是 benchmark,是「全栈主权」

把这件事拆开看,有几个值得拆的层:

第一,AMD 这次卖的不是模型,是栈。 从 Instinct MI300X/MI325 GPU、ROCm 软件栈、Primus 训练框架、Miles RL 框架、SGLang 推理,到最终模型 weights——AMD 第一次公开展示「在自家长链路里从头到尾训出一个 MoE LLM」的能力。对比 NVIDIA 那一边的 NeMo / Megatron / TensorRT-LLM 体系,这是 AMD 在 LLM 时代的第一次完整亮相。

第二,「全开源」和「只开源权重」的鸿沟,AMD 用 checkpoint 阶梯填上了一半。 Qwen3.8-Max、Llama 4、DeepSeek V4 这些「开源权重」阵营,通常只放最终 SFT 或 Instruct checkpoint,中间过程基本看不到。Instella-MoE 把预训练、Mid-train、长上下文、SFT、DPO、RL 全 6 个阶段的 checkpoint 都开放,意味着研究者可以逐阶段复现——这才是「学术可复现」的真正定义,也解释了为什么 AMD 把它定位为「state-of-the-art fully open」而不是简单的「open-source」。

第三,Gated MLA 和 FarSkip-Collective 是工程级而非架构级的创新。 它们的 paper-grade 不算顶尖,但对 AMD 自己的硬件栈来说,是关键拼图——AMD 的 GPU 互联带宽弱于 NVLink,FarSkip-Collective 这种「用不完整 activation 提前 overlap」的手法,本质是用算法补带宽。这也是为什么 AMD 把 12.7% 训练加速、39.2% TTFT 下降当成重点宣传:这是他们能给客户讲的「跑在我们 GPU 上更快」的硬指标。

第四,这是一个「MoE 工程民主化」的样本。 MoE 不再是只有头部玩家玩得起的奢侈品:16B 总量 + 2.8B 激活 + 64K context + 完整 RLHF 管线,跑在消费级 GPU 集群上,而不是非要 1000 张 H100。AMD 等于在说:只要栈足够透明,中等规模 MoE 也能跑通 RL 蒸馏。

所以呢

如果你是 LLM 从业者,Instella-MoE 的真正价值在「checkpoint 阶梯 + 完整训练配方」——你可以拿它的 Mid-train 自己做下游微调,也可以复现它的 GRPO 改造。如果你是硬件买家,它的 FarSkip-Collective 和 Gated MLA 提供了**「AMD GPU 跑 MoE 也不输」的实证**。如果你是开源生态观察者,这次的「全开源 6 阶段」是一个值得 Meta、DeepSeek、Qwen 跟进的标准。

最后一个小提醒:AMD 给 Instella-MoE 用的是 Research RAIL 许可证——它只供学术研究,不接受商业使用。所以它的「商业影响力」短期内受限,但学术复现价值反而更高。

参考: