阿里通义千问 8 月 3 日把自家最贵的 Qwen3.8-Max 端了出来,这次不仅照常发 API,还第一次承诺把 Max 级权重开源:2.4T 总参数、95B 激活,模型体量直接跨过"开源最大 LLM"那道坎,权重"下周"上 Hugging Face 与 ModelScope。

不只是又一个大模型:架构换装

相比 Qwen3.5 时期那一版 Gated DeltaNet + 稀疏 MoE 混合架构,Qwen3.8 在底层做了四件事。Flash-Next 是这一代架构的预览版:125B 主干 + 51B N-gram Embedding,每 token 只激活 6B。改动落到四个层面。

  • 注意力:Gated DeltaNet(GDN)继续负责压缩历史,新加的 Qwen Sparse Attention(QSA) 用一个压缩过的轻量索引器在微块粒度上挑重点,把长序列注意力成本压下来。
  • 残差流:Gated Residual(GR) 把残差流拓宽成 4 路,再用动态门控控制读写,跨层信息流更稳、训练也更稳。
  • Embedding:N-gram Embedding 用局部上下文查表扩展容量,embedding 表可卸载到主存、用异步预取与计算重叠。
  • 优化器:全栈换上 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的分工、融合参数的切分做了重新调校,scaling law 也按新架构重测。

官方口径里,这套新架构的"下一代"位置很明确:Qwen3.8-Flash-Next 扮演的角色,和当年 Qwen3-Next 之于 Qwen3.5 一样——先放架构变化让社区检验,再把完整 Qwen4 叠上来。

跑分:对 GPT-5.6 Sol、Fable 5、Opus 4.8 的硬碰硬

官方给出的对照表覆盖了 38 项基准。挑几个硬骨头看:Terminal Bench 2.1 上 Qwen3.8-Max 拿 86.6,接近 GPT-5.6 Sol 的 88.8,压过 Opus 4.8 与 Fable 5 的 84.6;PaperBench 拿到 93.0,跑赢 GPT-5.6 Sol(90.5)、Fable 5(88.8)、Opus 4.8(80.3);AndroidBench 75.1,与 Fable 5 的 84.5 仍有差距,但超过 GPT-5.6 Sol 的 74.0。

视觉侧更亮眼:BabyVision 82.0 / 91.3(无 / 有 Code Interpreter),把 Opus 4.8 的 28.4 / 81.2 远远甩开;HLE-VL(w/ Tools)拿到 52.2,超过 GPT-5.6 Sol 的 51.2;ZeroBench Pass@5 拿到 24.0 / 49.0,也是全场最高。多模态文档与视频理解里,OmniDocBench 1.5、视频 MME(w/ Sub.)、MLVU(M-Avg)、LVBench 等多项都拿了第一。

但官方自己也承认短板:HLE 总分 43.6,落后 Fable 5 的 53.3 与 GPT-5.6 Sol 的 47.2;OSWorld 2.0 二进制得分 19.4,低于 Fable 5 的 66.1;Toolathlon Verified 72.5,也低于 Fable 5 的 77.9。换句话说,它在 coding 与视觉侧追平甚至超越,在通用推理与超长任务规划上仍落后 Claude 与 GPT 的顶级版本

长上下文能力:1M 是默认,工具型 agent 已经上手

1M 上下文窗口是 Qwen3.8 全系的标配,官方在最佳实践里建议把内部推理的输出上限放到 262,144 token、最终回答放到 131,072 token,以便在长链工具调用中保持完整推理轨迹。

Qwen3.8 同步支持 reasoning_effort(xhigh / medium / low)控制思考深度,preserve_thinking 默认开启,让跨轮思考内容可以持续累积——这正是 agent 场景里"不能每轮重置思维链"的关键。MRCR v2 256K(8-needle)拿到 92.9,LongBench v2 拿到 66.3,与 GPT-5.6 Sol 的 93.8 / 67.1 几乎咬平。

API 上同时走 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages 三种协议,Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 都能直接换 base_url 接进来。

三个长程演示:连续 16 天的自动编程

发布博客里最让同行坐不住的,是官方做的三场"长程自主"演示。

  • 10+ 天跑出一个自演化工程框架。Qwen3.8-Max 被要求从零创建 oh-my-cli 项目,16 天连续自主运行,累计 265 次 commit、127 个 PR、151 个 issue,GitHub 仓库全程公开。
  • 复现论文再改进。从一篇 arXiv 论文出发,5 天连续工作、约 125 小时、约 7,600 行代码、33 轮 GPU 训练、1,100+ 次行动,先把原论文 6 个主要结论复现出来,再做 4 轮共 18 个自提改进思路,最终在 AIME24 上比原论文方法再高 2.71 个百分点。
  • 24 小时击败 526 支人类队伍。在天池 WWW2025 多模态对话意图识别赛上,以 45 次提交、最终 0.853 的准确率超过 458 / 526(87%)的人类参赛队。

这三件事都不是 benchmark 上的单项冠军,而是把"模型能不能在一段时间里自己扛住一个目标"的工程性问题摆到台面上。

工作侧:覆盖几百个高价值职业

另一块被官方重点强调的是"work"。模型在几百个职业的真实工作流上做了 stress test:从几百份合同里挑出 1,284 个相关条款(过去法务助理团队一周的工作量);一次产出 8 屏交互原型、零修改迭代(常规 UI/UX 工作流要 3–5 轮);从 100+ 份食材供应简报一次性生成 26 道菜的菜单,食材成本锁定在 33.8%;从单套图纸在浏览器里复刻一栋 30 层写字楼抗震结构模型;把一张 2D 康复评估表升级为 3D 交互演示;把每位球员 ~8,400 次进攻 / 防守回合解析成可直接用的战术画像。

Qwen3.8-Max 还展示了一条端到端的 ETF 轮动量化策略研发流程:从一行任务描述出发,系统自动规划工作流,自主完成因子构建、多轮贪心迭代、动态分析回测结果,并在发现"设计期与验证期指标背离"等过拟合信号时自动触发剪枝。另一个广度方向上,从 6 段短描述(动量、价值、质量、投资、低风险、情绪)派生出 50 个研究方向、330 个子 agent、6,000 次回测,所选因子的超额 Sharpe 落在 0.64–1.48。

短板与下一步

官方自己点名的局限也很坦率:benchmark 只覆盖 10 类 alignment failure,无法覆盖那些尚未被定义、罕见或新涌现的对齐失败;强化学习与生产级 RLHF 后训练可能让这些收益消退;AAR 只拒绝在 MMLU / GSM8K / IFEval 上的能力退化,其它能力维度未必测到。

接下来三个研究方向:罕见风险预测器(用历史模型代际数据预测下一代会出现什么对齐失败)、研究结果预测器(在昂贵的长时间实验跑之前先预测是否有效)、更好的控制脚手架(让自动化对齐研究自身更可监控)。

行业含义

把 Max 级权重开源这一步,直接改写了"开源 vs 闭源"的边界:开源端第一次跨入 2T+ 总参数 / 95B 激活的体量,而 Gated DeltaNet + QSA 的混合架构又把长上下文的算力与显存成本压到了一个新基线。对 Claude / GPT 的闭源阵营来说,真正的压力不是某一项 benchmark 被追平,而是开源模型的"长程自主 + 工作流覆盖"开始有了工程化样本

对开发者,意味着 1M 默认窗口 + 三协议 API + reasoning_effort + preserve_thinking + 多 agent harness(Claude Code / Codex / Qoder / OpenClaw)直接打通——不用再为"agent 用什么底座"纠结。

Qwen 团队在引用块里直接点了一句:"Qwen3.8-Max is our most capable model to date, and the first open-weight model at Max scale"。这句话既是产品口号,也是 2026 年下半年开源大模型的现实坐标。

原文与基准表:Qwen3.8-Max: A New Bar for Coding and Cowork