训练一个千亿参数的 MoE 大模型,最贵的一步可能不是买 GPU,而是猜学习率。韩国 Kakao 的研究团队 8 月 20 日在 arXiv 发表论文(已被 COLM 2026 接收),提出一套两步超参迁移框架,核心主张是:用一个 10.8B 的小模型跑几组短程代理实验,就能直接算出 155B 参数 MoE 模型预训练 10 万亿 token 该用的学习率,全程不需要在目标规模上做任何扫参(arXiv:2608.20061)。
问题:扫参在万亿 token 尺度上是个无底洞
MoE 架构让模型容量扩展不再伴随计算成本的同比例上涨,DeepSeek-V3、Qwen3-235B-A22B、Kimi-K2.5、GLM-5 等主流开源模型全部采用这一设计。但容量换来的代价是超参空间的膨胀:专家路由、负载均衡引入的新自由度,让 MoE 的调参复杂度和成本都显著高于稠密模型。其中学习率尤其麻烦——它的最优值对模型规模和 token 预算都高度敏感,这意味着每次换规模都要重新扫一遍。论文算了一笔账:如果沿用传统的模型规模 × token 规模二维扫参,仅模型规模那一维(比代理模型宽 1.5 倍、2 倍)就要额外烧掉 240.3 ZFLOPs,而代理实验本身只需要 64.8 ZFLOPs。在 10T token 的目标尺度上,这个成本没有实验室扫得起。
方法:μP 管宽度,scaling law 管 token
框架拆成两步,分别对付两个维度。
第一步对付模型宽度。 团队把 Maximal Update Parameterization(μP)适配到采用多头潜在注意力(MLA)和 Muon 优化器的 MoE 架构上。μP 的价值在于零样本迁移:小模型上找到的最优学习率,可以不加修改地搬到按宽度放大的大模型上。针对 MoE 的参数形状,论文把 router 和专家 FC1 权重划入 matrix-like 参数(受初始化和学习率双重缩放),专家 FC2 权重划入 vector-like(仅初始化缩放);同时固定激活专家数和 MoE 中间维度,只增总专家数和隐藏维度——这是超大规模 MoE 的实际扩展路径。实验验证了关键前提:同一 token 尺度下,代理模型和宽度放大模型的验证损失抛物线曲率与顶点位置高度一致,顶点(即最优学习率)跨宽度可靠迁移。
第二步对付 token 预算。 在 10.8B 总参/3.3B 激活(目标模型的 1/4 宽度)的代理模型上训练约 500B token,每 10B token 间隔估一次最优学习率,再用 log-log 空间的线性回归拟合「最优学习率随 token 预算下降」的趋势。拟合优度 R²=0.95,外推出 10T token 尺度的理想学习率为 3.85×10⁻⁴。传统二维扫参在这里被压缩成沿 token 维的一维搜索,模型规模维被 μP 直接消掉了。
结果:10T token 训练全程无 loss 尖峰
用预测出的学习率,团队从零预训练了一个 155B 总参/17B 激活的 MoE 基础模型,10 万亿 token 的全程训练损失保持高度稳定,没有出现任何 loss 尖峰。论文强调,目标训练的总计算量约为代理实验总量的 98 倍——换句话说,代理实验的花费不足正式训练的 2%。评测覆盖 MMLU、MMLU-Pro、BBH、MATH、GSM8K、MBPP、HumanEval 及 Global-MMLU(韩/日/越/中)四个方向;与 dots.llm1、GLM-4.5-Air、Hunyuan-A13B、DeepSeek-V4-Flash 等同量级开源 MoE 基座相比,该模型位于 Pareto 前沿:在相近或更低的估算训练算力下,MMLU-Pro 准确率高于 dots.llm1 和 GLM-4.5-Air。作者也坦承局限:未做目标规模的全量扫参来验证预测学习率的最优性(算力上不可行),且宽度与稀疏度是联合扩展的,稀疏维度本身的独立影响无法剥离。
所以呢
这篇论文的看点不在模型本身,而在方法学:当训练预算迈过 10T token、参数迈过千亿,「扫参」这个深度学习时代的默认动作正在变得物理上不可能。μP + token 维 scaling law 的组合给出了一条替代路径——把搜索成本从目标规模转移到代理规模,让「一次训对」取代「多次试错」。对于算力紧张、却要啃万亿 token 配方的团队,这套框架值得关注;至于它能否推广到其他 MoE 结构和其他优化器,作者留给了未来工作。