8 月 31 日,Qwen 团队把一篇 36 位作者署名的架构论文挂上 arXiv(编号 2608.30320),第二天出现在 Hugging Face Daily Papers 页面并进入当日热度前排。论文主角是 Qwen3.8-Flash-Next——一份以消融和设计权衡为主角的技术报告,把"下一代替价"的账算得很细。它不是跑分通稿:每个候选改动都附带三轴评估。
先看账本:约 1/9 的训练 FLOPs
模型总参数 125B,每个 token 只激活 6B;另外还有 51B 的 n-gram 嵌入表参数,被放在加速器之外、从主机内存预取。对比对象是前代 397B-A17B 模型:14 项预训练基准上,新架构在 8 项领先,其余最多落后 2.6 分——而激活参数只有前代的 1/3、训练 token 只有 1/3、训练 FLOPs 约为 1/9。对部署侧而言,激活参数从 A17B 档降到 6B 档,是最直接的单 token 成本变量。
架构动了哪些地方
论文列出的核心改动有三处:
- 混合 token 混合层:Gated DeltaNet(GDN)与全局注意力逐层混排,每四层保留一个全注意力层;到继续预训练阶段,这些全注意力层会被替换为 Qwen Sparse Attention(QSA),用压缩的轻量索引器按微块粒度给上下文打分。
- 门控残差(Gated Residual):残差流拓宽到四条分支,经逐元素门控读出。
- 骨干外扩容:容量增量不走主干,而是通过单一 n-gram 嵌入层补充,表从主机内存预取——这也解释了那 51B"不占加速器"的参数放在哪里。
最有意思的发现:loss 会骗人
论文里一个反直觉观察:扩大 n-gram 词表能让 loss 单调下降,但下游精度会饱和。也就是说,盯着训练曲线调参,可能把模型调得更会压缩训练数据,而不是更能干活。另一个工程结论:这套架构配合 Muon 优化器,把最优学习率和 batch size 往上推,批量预热(batch-size warmup)不再必要,压力测试下的训练稳定性也明显改善。作者的收束立场很明确——loss、基准、效率、稳定性是一个联合设计问题,拆开优化必然顾此失彼。
怎么读这篇论文
三点个人判断:
第一,它是"设计文档"而非发布通稿。Qwen 把每个改动沿三根轴(损失与下游基准、训练/预填充/解码成本、超参数与稳定性影响)评估后公开,这种透明度在头部团队的技术报告里仍然少见。
第二,"非加速器参数"值得长期盯。把 51B 参数放进主机内存、用预取掩盖延迟,本质是把参数容量与算力消耗解耦——如果这条路线被后续复现和验证,模型规模的账本就要重算。
第三,代际对标的口径变了。125B/6B 对 397B/A17B 的对比说明,竞争重心正从总参数转向"激活参数 × 训练算力"的联合效率;论文标题里的 Evaluation、Efficiency、Training Stability 三个词,就是这套新口径的三个科目。
对开发者的"所以呢":若该架构后续开放权重,6B 激活档的模型在显存有限的推理环境里空间会进一步打开——但注意,论文只覆盖预训练阶段的架构与消融,最终产品形态、开源与否,仍要等官方后续发布。