Qwen3.8-Flash-Next 把 125B MoE 跑赢 397B 的前辈,但 1/9 训练算力

阿里通义千问团队本周公开了 Qwen3.8-Flash-Next 的完整架构报告和技术博客,核心结论相当扎眼:一个 125B 总参数、6B 激活参数的稀疏 MoE,只用约 1/9 的训练 FLOPs,在 14 个预训练 benchmark 上 8 项反超自家 397B-A17B 的前辈,其余 6 项差距不超过 2.6 分。这不只是又一份「更大更强」式发布,真正的看点是它一次性把 Qwen 系列未来要走的几条架构路线 —— 注意力、残差、嵌入、优化器 —— 都打包进了同一个开源权重。来源:Qwen 官方博客, 2026-08-26,以及 arXiv:2608.30320, 2026-08-31

四个层面的同时升级

Qwen 团队把这次架构迭代拆成四块讲:

  • 注意力层:沿用并强化「Gated DeltaNet(GDN)+ 全注意力」的层间混合模式,平均每 4 层放 1 层全注意力;继续预训练阶段再把全注意力层替换为新设计的 Qwen Sparse Attention(QSA),用一个轻量索引器在 micro-block 粒度上打分。
  • 残差流:从单条分支扩到 4 条并行分支,用一个 elementwise gate 把它们汇合回主干,这一设计被他们命名为 Gated Residual(GR)。
  • 嵌入层:在骨干之外单独加了一层 n-gram embedding,参数表约 51B,放在 host memory 预取,不占加速器显存 —— 等于「白送」一层容量。
  • 优化器:继续用 Muon,带来更优的学习率与 batch size 区间,论文里说「不再需要 batch-size warmup,在压力测试下稳定性大幅改善」。

怎么用 1/9 算力追平 397B

数字最直观的对照是这一句:125B 总参数 + 6B 激活 + 1/3 训练 token + 约 1/9 训练 FLOPs,在 14 个预训练任务里 8 项领先、6 项小幅落后。论文特别强调这是「loss 与下游准确率不再同步变化」的典型案例 —— 单调扩大 n-gram 词表能持续压低 loss,但下游指标很快就饱和,反而是 GR、QSA、Muon 三件套共同把帕累托前沿往左上推。

另外值得注意的是,模型在更短的训练 token 上达到了接近的水平,这意味着 QSA 替换后的长上下文推理、以及 GDN 在短上下文的高效推理,共同把每 token 的训练成本打到了更低的水位 —— 这一项对开源社区的复现成本影响最大,而不是单纯一个 benchmark 跑分。

为什么这是 Qwen4 的「早期预览」

官方博客里有一句很直白的定位:Qwen3.8-Flash-Next 是「Qwen4 架构的早期预览」,延续了 Qwen3-Next 当年在 Qwen3.5 之前提前放架构的惯例。换句话说,Qwen 团队把这一波架构创新拆成两步:先用权重开源的方式让社区验证,再在完整 Qwen4 上把这些设计堆到更大规模。这是一条和「先放大参数、再扩训练 token」的常规 scaling path 不同的路线 —— 它优先押注「架构效率」而非「参数膨胀」。

这条路线和 2026 年开源 LLM 的几条主旋律是吻合的:GLM-5.3-Flash 用 320B 总参数 / 18B 激活打对标 Opus 的 Flash 价位,Qwen3.8-Max 把 2.4T 的超大模型也走开源路线但改用收入分成许可证,Kimi K3、DeepSeek V4 都在用 MoE 稀疏化去拉平推理成本。当「Scaling Law 边际收益递减 + 推理算力吃紧」成为共识,把每一瓦时、每一张卡用得更聪明,正在取代「再训一个更大的稠密模型」成为新的竞争维度。

所以呢

如果你在做开源 LLM 训练或推理优化,这份报告值得花时间精读,尤其是 QSA 的 micro-block 索引器、GR 的多分支残差、以及 n-gram embedding 的 host-prefetch 设计 —— 三者都是可以独立移植的模块化改动,不需要重训整套 backbone。如果你只是消费者,Qwen3.8-Flash-Next-Base 已经可以直接在 Hugging Face 拉权重,6B 激活意味着单张 H100 就能跑推理,加上 vLLM、FlashQLA 等推理框架已经合并相关算子,本地落地成本比上一代旗舰低一个数量级。当「参数更大」不再是新闻,把 1/9 算力追平前辈这件事,本身就是下半年开源 LLM 真正的看点。原文链接:Qwen3.8-Flash-Next 官方博客,arXiv 技术报告,vLLM Recipes 部署指南