大模型训练正在撞上「数据墙」:人类书写的文本就那么多,把训练数据重复几遍用,已经从权宜之计变成行业标准做法。与此同时,主流大模型几乎清一色转向 MoE(混合专家)架构,用稀疏激活换算力效率。这两个趋势撞在一起会发生什么?此前几乎没人系统研究过。9 月 10 日,斯坦福与华盛顿大学团队在 arXiv:2609.11917 发表论文《Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data》,作者名单包括 Jure Leskovec、Percy Liang 和 Luke Zettlemoyer,结论相当扎心:MoE 比稠密模型更怕重复数据。

4 倍重复就开始退化

团队做了 compute-matched 网格实验:80M、200M、1B 激活参数(总参最高 8.5B),专家数 8 到 128,粒度 1/2 到 1/32,重复率 R 从 1 扫到 1024,数据覆盖 OLMoE 数据混合的四个域——网页(DCLM)、代码(StarCoder)、科学文本(peS2o)和维基百科。

核心数字:80M 稠密模型重复数据 8 倍几乎无损,同规模 MoE 重复 4 倍就开始退化,到 32 倍时被稠密模型反超,全独特数据下的架构优势荡然无存。更关键的是,退化程度跟着总参数走而不是激活参数:稀疏度越高,崩得越狠。这个模式在四个数据域和不同混合配比下高度一致,质量过滤也几乎改变不了什么。

机制:路由早固化,专家过特化

为什么会这样?机制分析给出了两条证据。其一,MoE 的路由器在训练早期就「固化」:第 400 步(约训练进度 10%)路由稳定性已到 60%,训练结束时超过 95%——每个专家在绝大部分训练里反复更新同一小撮 token,数据一重复,它看到的就是同一块数据的更多遍。其二,专家 knockout 实验:重复率从 1 拉到 32,80M 下 128 专家、1/4 粒度配置的专家缺失代价涨 2.3 倍,专家特化与过拟合明显相关。

解药存在,但不完美

正则化实验给出活路:dropout、FFN 输出掩码、专家 dropout、专家输出掩码这类「丢弃参数输出」的方法都有效,配合强掩码正则,MoE 在重复超过 64 倍时仍能跑赢稠密模型。而 weight decay、梯度裁剪、router jitter 几乎没有可测影响。论文也很诚实:没有任何方法能完全追平全独特数据。另一个实用发现:把重复域混进足量未重复数据,未重复部分会起正则作用。

所以呢

这篇论文的真正贡献,是把行业默认的架构选择变成了条件命题:稀疏化的红利,取决于你的 unique token 预算。数据管够时 MoE 是免费午餐,数据见底时它比稠密模型更脆弱。对规划下一代基座模型的团队来说,先数清楚手里还有多少没重复过的数据,再决定上多大的稀疏度,可能比多加几千张卡更值得算清楚。原文