MoE(混合专家)架构让大模型用稀疏激活换来了参数规模的自由,但推理侧一直有个没人挑战的默认假设:专家(expert)是最小的调度单位。路由器选中哪几个专家,整颗专家网络就完整跑一遍,不多不少。EMNLP 2026 主会接收的新论文 PCoMoE(arXiv:2609.01024)把这个假设拆了——作者主张,专家内部还有大量可复用的计算结构,推理时真正该调度的不是"整颗专家",而是专家内部的"路径"。

问题:整颗专家是个"集装箱"

论文对现状的诊断很直接:现代 MoE 推理框架无论做管理、调度还是剪枝,都把专家当作原子执行单元(atomic execution units)处理。这带来两个后果:一是优化边界被过早固定——在"专家级"粒度上做优化,专家内部的计算冗余就永远看不见;二是 MoE 的专家计算天然存在可共享的中间结构,但框架只认"整颗专家",这些复用机会全部浪费。

用物流做类比,现在的 MoE 推理像按"整个集装箱"收费,哪怕两票货可以拼箱,系统也不支持。

方案:把专家拆成可组合的路径

PCoMoE 是一个路径组合式(path-compositional)执行框架,设计分三层:

  • 路径级建模:把专家计算形式化为细粒度的组合路径。按官方仓库说明,专家被分解为可复用的 expansion 侧与 projection 侧组件;
  • 兼容性感知的逐层剪枝:抑制低价值的路径组合,避免组合爆炸;
  • 硬件友好的执行引擎:利用可复用的子专家结构,并把额外开销严格控制在有界范围内。

GitHub 仓库还提到一个关键设计:source-grouped compute reuse,按来源分组做计算复用,让多个被激活的专家共享底层计算。

结果:快了,还准了

论文报告的数字:端到端推理最高提速 1.31 倍,同时模型精度提升 10%。加速与精度通常此消彼长——剪枝换速度、掉点作代价是常规操作,PCoMoE 报告的却是两个方向同时改善,机制上可解释为低价值路径被剪掉后,模型反而少受"坏组合"干扰。当然,这些是作者自报的实验数字,独立复现还要等社区验证。

需要提醒:官方代码仓库(github.com/gzyyy0/PCoMoE)已上线,但目前只有论文信息与致谢,实现代码标注"整理中,即将发布",想直接上手还得再等等。

所以呢

MoE 推理优化的竞争正从框架层打到结构层。既有工作大多在路由策略与专家并行上做文章,PCoMoE 把刀伸进了专家内部,给出一个更细粒度的执行抽象。这个方向的价值在于:MoE 用稀疏激活高效扩容的路子已被验证,模型规模越堆越大,专家内部的冗余浪费也会被成倍放大。对推理引擎团队,这是一条新战线;对研究者,"执行单元的粒度"本身就是一个值得重审的设计变量。论文详情见 arXiv:2609.01024。