背景:DiT 还在堆参数,LLM 已经靠效率赢了

扩散 Transformer(DiT)如今是图像与视频生成的绝对主力。从 SD 3、FLUX.1、到字节 Seedance、Google Veo、OpenAI Sora,DiT 几乎一统天下。但是一个隐性的对比很少被摆到台面上:LLM 已经靠「总参/激活参」解耦、混合 routed+shared experts、gate-residual 这套效率工具箱,把训练与推理成本压在可控范围内;而 DiT 这边,过去两年的主流做法仍然是把 MoE 直接糊上去,然后通过加大总参+抬高 sparsity来刷成绩,质量确实在涨,但质量—成本的帐从来没被算清楚。

2026 年 7 月 27 日放到 arXiv 上的 MMOE:Modernizing Diffusion Transformers with Efficient Expert Design(arXiv:2607.24665,北航 TMLR 组,Xuelong Li 通讯)做的就是这件事:不是再加一层 MoE,而是把 LLM 已经验证过的那套效率设计,整体迁移到 SiT 风格的扩散 Transformer 上,然后做一组系统的消融实验。

MMOE 到底装了什么

论文没有把 MoE 当成一个「单一插件」处理,而是把它拆成 4 个组件,在 SiT 主干上分别做对照实验:

  1. Routed experts:token 通过门控选 top-k 专家,MMOE 重点看不同路由策略在 DiT 不同深度上的稳定性。
  2. Shared + Lightweight experts:在路由之外加一条「公共通路」处理那些路由无法稳定分类的特征;Lightweight experts 是更便宜的共享变体,用来对冲参数膨胀。
  3. Gate-residual routing:借鉴 LLM 的 residual-gate 思路——把门控输出加到主干信号上,而不是替换它,避免路由选择「覆盖」上一层已经 polish 好的特征,让收敛更稳。
  4. Attention-residual information reuse:在注意力残差流里复用前面层的路由信号,把 Transformer 残差结构的设计层级抬上来,让各 block 的专家调度能协同而不是各干各的。

四个组件不是简单堆在一起,而是组合消融,看哪一项贡献最大、哪一项是冗余的。

实验设置与结果:刻意克制的预算

论文把训练预算压缩到 单节点 8×H100,batch 256,400k steps。这个量级是任何一个中等实验室都能凑出来的预算——不是只有前沿巨头才能跑得动的「算力秀」。

核心结论非常明确:在 matched training & sampling protocol 下,同一预算内,MMOE 在每一个 checkpoint 上的 FID 都低于 dense baseline 与中间的稀疏专家 baseline——也就是说每一步训练步都收敛得更快。再叠加「在所有稀疏变体中质量—成本比最佳」,论文的真正主张是:「我比你便宜,质量也跑赢同参数量的对手」

路由分析上,专家专化在不同深度上稳定,lightweight 路由被大量使用,相邻去噪步之间的路由变化温和——意味着这套设计确实在让不同专家干不同的活,不是「为了 MoE 而 MoE」。

对行业意味着什么

第一,中端实验室可以跑得动了。最近的 AIGC 论文动不动就是「1024 张 H100 训了好几周」,绝大多数从业者只能「读论文」、不能「复现论文」。MMOE 把研究复现的鸿沟压缩了。

第二,松动了「参数堆叠」的叙事。现在 AIGC 圈子里有一个隐性共识:模型质量 ≈ 总参数。如果 MMOE 这条线继续被验证,那么「更聪明的方法带来更高质量—成本比」这条路就值得押注——是 LLM-MoE 故事在 AIGC 上的镜像。

第三,对视频 DiT 是一个顺风。Seedance、Veo、Sora 这类视频扩散 Transformer 的算力开销是文本级扩散的几十倍。如果 MMOE 这类设计能平移到视频 DiT 上,推理成本会明显下降,无论 B 端可用性还是 C 端实时生成,都会往前推一大步。

我自己的看法

我不想把这一篇称为「颠覆性」。把 MoE 装到 DiT 上不是新事,MMOE 也不是第一个这么做的。但它做了一件稀缺的事:对 LLM 效率工具箱的每一项做了完备的消融,而且用一组可复现的实验设置给出了清晰结论。在「堆资源」越来越多的 AIGC 圈子里,这种克制本身就是一种姿态

所以呢:如果你在做图像或视频生成团队、并且一直默认「参数=竞争力」,MMOE 是一个提醒——还有另一条路:系统地把 LLM 已经验证的效率设计搬到你自己的 DiT 上,发一个质量—成本比更好的模型。这个方向如果能在更大规模(更多 H100、更长训练)上被验证,AIGC 基础模型未来 12–18 个月的投资逻辑有可能被重新改写。

参考资料:arXiv:2607.24665,MMOE:Modernizing Diffusion Transformers with Efficient Expert Design,2026-07-27