在 2017 年的 Transformer 论文里,dropout 还是标配正则化;到了大模型时代它几乎绝迹——GPT-3、OPT 还保留着它,PaLM 只在微调阶段用,LLaMA 之后的模型干脆不再写进配方。理由听上去充分:单轮扫过数万亿 token 的预训练几乎没有经典意义上的过拟合,还有研究报道 dropout 在这个 regime 里掉点。Cerebras Systems 团队新挂在 arXiv 的论文「Don't Drop Dropout」(ICML 2026 发表后的扩展版,arXiv:2609.05275)给出相反结论:被抛弃的可能不是 dropout 本身,而是没调对的用法。
2400+ 次实验,重新给层 dropout 定位
研究聚焦层 dropout(随机深度):训练时以一定概率整块跳过 transformer 层。与神经元级稀疏不同,跳过整层是结构化稀疏,省下的 FLOPs 几乎与丢弃率线性对应。团队在 Cerebras CS-3 系统上跑了 2400+ 次预训练实验,模型从 271M 到 8.2B 参数、数据最高 160B token,按 20 token/参数的 compute-optimal 预算执行,架构沿用 Celerity 系列(ALiBi 位置编码、squared ReLU、Llama3 词表)。
核心结论是一组组合拳:dropout 率沿层深递增(浅层少丢、深层多丢)、随训练进程递减(开局高噪声探索、后期收敛),再配上按丢弃率重调的优化器超参。这样配下来,同等训练 FLOPs 下 loss 反而更低;固定训练步数时,最多省 25% 训练 FLOPs 而 loss 持平或更好。论文称,在 503M 和 906M 模型上省 5% FLOPs 的配置击败了 dense 基线,并称这是首次有实验证明「更少训练算力也能打过全量基线」。采样粒度上,按序列独立采样优于按 batch 整体采样——这是该团队自称首次系统对比的维度。
推理端的「免费」弹性
层 dropout 训出的模型自带深度弹性:zero-shot 做 early exit(提前若干层出口)或跳过中间层,loss 退化平缓,而 dense 模型几乎一跳就崩。这意味着一个大模型可以按延迟预算动态缩到小模型水平,不用重训。叠加自投机解码等后训练手段,推理最高提速 1.5 倍、精度损失可忽略。层分布上存在明确取舍:交替分布(ALD,隔层丢)对跳层最鲁棒,递增分布(ILD)基线精度和 early exit 表现更好,论文建议规模化后选 ILD。
所以呢
这篇论文把「dropout 在大模型没用」重新定性为「配置问题」:它不再只是防过拟合的正则项,而是训练省算力加推理可弹性的结构化稀疏开关。对算力预算敏感的预训练团队,25% FLOPs 是笔不小的账。但要记住边界:实验上限 8.2B 参数,更大的前沿尺度未验证;结论基于 Celerity 式 decoder-only 架构与 20 token/参数预算,数字为团队在其自有系统上的自报结果,尚待独立复现。下一次看到某家预训练成本突然降一截,配方表里的 dropout 也许就是答案。