MoE 想做推理,最怕的不是模型大,而是专家路由不均——少数专家被挤爆,其他专家干等,整个 batch 被「最慢那个」拖住,这在论文里被叫做 Straggler Effect。UMD 的 Shwai He 等人把这现象形式化,并在 ICLR 2026 上提出 Capacity-Aware Inference:先用 Capacity-Aware Token Drop 给每个专家设一个容量上限,把超载专家的溢出 token 直接丢掉,换来最多 30% 的加速(OLMoE 上只掉 0.9 个点);再升级到 Expanded Drop,在丢之前先把 token 路由到同卡上负载更低的备选专家,在 Mixtral-8x7B-Instruct 上跑出 1.85× 推理加速的同时平均还涨了 0.2 个点。最关键的一点是:这套方法是纯 inference-time 的,不动权重、不重训,直接用 apply_capacity_aware_moe_patch 就能套到现有 MoE checkpoint 上,对 OpenMoE / DeepSeek-V3 / Mixtral 这类已经在生产里跑的稀疏模型,等于零成本薅羊毛。代码已开源(case-lab-umd/Capacity-Aware-MoE,star 20,90 commits),同时打通了 lm-evaluation-harness 和 VLMEvalKit 两条评估链路,从纯文本到多模态 MoE 都能验证。对工程团队的启示是明确的:在做 MoE 推理优化时,「专家路由不均」往往比「专家激活太稀疏」更值得优化——前者是木桶的短板,直接决定 P99 延迟。论文 arXiv:2503.05066v5,ICLR 2026 接收。