8 月 26 日,阿里 Qwen 团队开源了 Qwen3.8-Flash-Next 的权重。这个模型的定位很明确:它不是又一个追跑分的旗舰,而是 Qwen4 架构的早期预览——官方在 GitHub 仓库里直接说明,它扮演的角色和当年 Qwen3-Next 之于 Qwen3.5 完全一样:先把架构改动开源出来,让社区在 Qwen4 全家族落地前有机会审视这些设计。
四项系统性升级:注意力、残差、嵌入、优化器
这次升级不是单点修补,而是沿四个维度同时动手:
- 注意力:GDN + QSA 混合架构。Gated DeltaNet 负责高效压缩历史信息,新增的 Qwen Sparse Attention(QSA)用一个压缩轻量索引器,在微块粒度上挑选重要上下文,大幅降低长序列注意力开销。
- 残差:Gated Residual(GR)把残差流拓宽到 4 条分支,用动态门控管理读写,强化跨层信息流动和训练稳定性。
- 嵌入:N-gram Embedding 用局部上下文查表,以极少的额外计算扩容模型容量;嵌入表可以卸载到主机内存,与模型计算异步预取重叠。
- 优化器:采用 Muon,围绕正交化精度、Muon 与 AdamW 的分工、融合参数切分做了细化,并为新架构重新拟合了 scaling law。
6B 激活跑赢旗舰:数字怎么读
参数配置上,主模型 125B,外加 51B 的 N-gram 嵌入,每 token 只激活 6B。官方称相比 Qwen3.7-Plus,训练成本降到约 1/9,但在编码和办公任务上能力更强。
第三方媒体 OfficeChai 整理的 benchmark 数据更直观:SWE-bench Pro 上 62.5 分,对比 Claude Opus 4.6 Max 的 53.4;CoWorkBench 73.9 对 68.2;IFBench 指令遵循 81.3 对 62.5,差距最大的就是这一项。当然也有输的地方:Humanity's Last Exam 上 Claude 40.0 领先 Qwen 的 35.9,前沿推理仍是闭源强项。上下文方面原生 256K,通过 YaRN 可扩到 1M,官方称 1M token 处 prefill 提速至 7.6 倍、decode 至 4.9 倍。
所以呢
一个每 token 只激活 6B 参数的模型,在阿里自己选定的 benchmark 集合上大面积追平甚至反超旗舰级闭源模型——不管你信不信这些跑分,「用 1/9 训练成本逼近旗舰」这个趋势本身值得每个做推理成本规划的人认真对待。权重已在 Hugging Face 和 ModelScope 上线,SGLang、vLLM、llama.cpp、MLX 均已支持,门槛建议自己跑一遍验证。(GitHub 官方仓库,OfficeChai 分析)