2026 年 7 月 27 日,arXiv 上线了一篇来自北航 Xuelong Li 团队的新论文 ——《MMOE: Modernizing Diffusion Transformers with Efficient Expert Design》(arXiv:2607.24665)。它不抢模型发布的聚光灯,却把一个被整个 AIGC 圈子默默回避的问题摆到了台面上:扩散 Transformer 真的需要靠"堆参数"来变强吗?
一句话核心
MMOE 不是"给 DiT 加一个 MoE 层"那么简单。它做的事情是把过去几年 LLM 走向规模化的整套"效率工具箱"——routed experts、shared/lightweight experts、gate-residual routing、attention-residual information reuse——系统性地移植到 SiT 风格扩散 Transformer 上,然后做了 ablation:每多塞进去一块效率组件,收敛曲线怎么变,FID 怎么变,qualitative cost 又怎么变。
实验预算控制得非常克制:单台 8× H100, batch size 256, 跑满 400k 步。这是任何一家中型实验室都能复现的资源,不是只有头部玩家玩得起。
LLM 已经走过的路,DiT 现在才补上
先看背景。LLM 这一波能持续扩展,不是因为大家都在"加参数",而是因为 MoE 路线把"激活参数"和"总参数"解耦了——总参数可以很大,但每个 token 只激活其中一小部分,算力开销被压下来。同时 routed + shared 的混合专家设计、gate 的残差连接、attention 残差的信息复用这些"小开关",共同让 LLM 训练能够稳定地收敛而不爆炸。
但 DiT 这边怎么做的?近两年,无论是图像生成的 DiT、还是视频生成的视频 DiT,一旦塞进 MoE,大家的惯性动作是:先把总参数拉满,再拉 sparsity 比例。参数膨胀得很快,质量也确实在涨,但 single-step 收敛曲线稀疏变体之间互有输赢,质量-成本的折中关系一直说不清楚。简单说,大家都在做"参数战",没人认认真真把 LLM 那套已经被验证过的效率机制,系统平移到 AIGC 领域做一遍 ablation。
MMOE 就是来填这个空白的。
MMOE 到底装了什么
论文明确不把 MoE 当"单一插件"对待。它把"现代化"的专家设计拆成四个组件,在 SiT 主干上对照实验:
- Routed experts:经典做法,让每个 token 通过 gating 选择 top-k 个专家。MMOE 关注的是不同 routing 策略在 DiT 深度上的稳定性。
- Shared + Lightweight experts:在 routed 之外加一条"公共通路",处理那些 routing 不大能稳定分类的特征。Lightweight experts 是更便宜的共享变体,减少参数膨胀带来的负担。
- Gate-residual routing:借鉴 LLM 里的残差 gate 思想,把 gate 输出和主干信号相加,而不是替换。这样 routing 选择不会"覆盖"掉已经被前一层处理好的特征,收敛更稳。
- Attention-residual information reuse:在 attention 残差流里复用更早层的路由信号。这条直接拉到了 Transformer 残差设计层面,意味着不同 block 之间的专家调度可以协同,而非各自为战。
这四块不是简单叠加,而是组合起来跑 ablation,看哪一块贡献最大,哪一块是冗余的。
实验结果:质量-成本比的胜利
论文核心结论非常硬核:
在 matched training + sampling protocol、相同预算下,MMOE 在每个 checkpoint 都达到了比 dense 和 intermediate sparse-expert baseline 更低的 FID。换句话说,它每一步收敛得更快。
更进一步,在"都用 MoE"的稀疏变体内部比较,MMOE 拿到了最佳的质量-成本平衡。这意味着 —— 当大家都在比"我的模型比你的大"时,MMOE 想说的是"我的模型比你的便宜,但质量比一样参数量的对头都好"。
Routing 分析也给出了符合直觉的结论:专家特化在深度方向上稳定存在,lightweight routes 的使用率显著,denoising 的相邻步骤之间路由变化小 —— 说明这套设计不是"为了 MoE 而 MoE",而是真的把专家角色做了分工。
为什么这件事对产业有意义
把视野拉远一点看,这篇论文在三个方向上都有意义。
第一,中小实验室能跑了。8×H100、batch 256、400k 步这个量级,基本就是任何一家有训练预算的中型团队能凑出来的配置。过去 AIGC 论文动辄"训练消耗 1024 张 H100 几周",绝大多数从业者只能"读论文",没法"复现"。MMOE 的预算设定把研究-复现之间的鸿沟压了下来。
第二,把"参数堆叠"的叙事松动了一点。当下 AIGC 圈子有个隐含共识:模型质量 ≈ 总参数。如果 MMOE 路线被持续验证,那么"用更聪明的方法,做出质量-成本比更好的扩散模型"就会变成一个值得押注的方向——相当于 AIGC 版的 LLM-MoE 故事。
第三,对视频 DiT 是一利好。Seedance、Veo、Sora 这类视频扩散 Transformer 的算力消耗是文本扩散的几十倍。如果 MMOE 类设计能搬到视频 DiT,推理成本会有显著下降,意味着 B 端可用性和 C 端实时性都能往前走一步。
个人评论:这篇论文的真正姿态
我不太想给这篇论文贴上"颠覆性"的标签。扩散 Transformer 上 MoE 已经不是什么新鲜事,MMOE 也不是第一个这么做的。但它难得地把 LLM 那套效率工具箱的每一项都做了 ablation,给出了可复现的实验设定和明确的结论。在 AIGC 越来越依赖"砸资源"的环境里,这种"克制感"本身就是一种姿态。
所以呢:如果你是一家做图像生成或视频生成的团队,过去默认"参数 = 竞争力",MMOE 提醒你还有一条路 —— 把 LLM 已经被验证的效率设计,系统地搬到自己的 DiT 上,做出质量-成本比更好的模型。这个方向如果在更大规模(更多 H100、更长训练)下被验证有效,可能会改变接下来 12-18 个月 AIGC 基础模型的投入逻辑。
数据来源:arXiv:2607.24665,《MMOE: Modernizing Diffusion Transformers with Efficient Expert Design》submitted 27 Jul 2026。