为什么 MoE 推理其实一直在「算过剩」

混合专家(MoE)架构是当下几乎所有前沿 LLM 扩展参数规模的默认范式——Qwen3 系列、Mixtral、DeepSeek、GLM-5 系列都靠它把总参数撑到几百 B,同时只激活一小部分参数。但 arXiv 2609.05228 上刚挂出的 ACE 论文指出了一个尴尬事实:固定 top-k 路由,意味着每个 token 都白白激活了同样数量的专家槽位,不管它到底需不需要。这份论文把这件事拆解到了工程层面,提出了一种训练无关、免校准、保留原始 checkpoint 的动态专家跳过框架。

ACE 的两段式判断:全局谱代理 + 路由器条件精修

论文给出的核心思路是「两个独立视角同时看,都说不重要才跳过」。

第一个视角叫 Global Spectral Proxy(GSP)。它把每个 MoE 专家里耦合在一起的 gate、up、down 三个投影矩阵当作一个整体看,估算它在 RMSNorm 缩放下真实的「全局变换能力」——本质上是在问:这个专家真正能把输入向量推多远、推得有多稳?这是一个离线算完的统计量,在线推理阶段只是查表。

第二个视角叫 Router-Conditioned Refinement(RCR)。它把去中心化之后的路由器权重投影成「专家专属方向原型」,然后沿路由偏好的方向去看这个专家在当前 token 上的响应。两个视角结合运行时 router gate,只有当两边都把某个专家槽位标记为低贡献时才跳过,且永远保留 top-1 专家

三款 MoE × 八项基准:压低算力还反向涨点

论文报告了在三款 MoE-based LLM 与八项基准上的实验结果,关键的数字有几条(以下数字均直接来自 arXiv 摘要,以原文为准):

  • 在 Qwen 系 35B-A3B 这一档 MoE 上,50% 跳过率下,论文称 WikiText-2 困惑度相对最强对比方法下降 7.96%,下游平均精度提升 4.15 个百分点
  • 在更激进的跳过率下,ACE 相对静态和动态基线的优势更加明显
  • 所有专家统计都是离线计算,推理时只剩查表和轻量标量运算,不需要额外训练、不需要校准数据、不需要改 checkpoint

换句话说:这是给已经训好的 MoE 模型直接套一层「运行时省钱壳」,不重训、不微调、不改一行原始权重。

「跳 vs 不跳」为什么之前没人做干净

过去做专家稀疏化的几条路线都有明显痛点:靠 router 置信度的容易被路由器的 softmax 偏置骗到;靠校准数据集的需要额外准备有代表性的样本,在分布漂移下不稳;靠额外训练的代表(各种 expert pruning)直接要重训一部分参数。ACE 的解法绕开了这三类陷阱——用专家自身的谱结构和路由器自身的历史偏好做判断,数据完全内生,不需要外部监督信号。

所以呢:MoE 推理优化的下一站可能是「让路由器闭嘴」

这件事真正值得展开的不是 7.96% 这个数字本身,而是它代表的方向:MoE 的训练阶段已经把专家「训会」了,推理阶段却一直在为「学得不好的 token」支付同样的算力成本。ACE 这种免训练运行时框架的存在,意味着——MoE 的效率红利可能还有一大半没兑现。一旦这种思路被 vLLM、SGLang、llama.cpp 这些推理引擎吸收进主线,小显存跑大 MoE 的门槛会再往下沉一截。

论文原文(arXiv:2609.05228): https://arxiv.org/abs/2609.05228