背景:Qwen 家族的 Max 级别补齐

阿里通义千问(Qwen)团队长期以「开源开放」路线区别于其它顶级实验室:过去两年里,Qwen-Image、Qwen-VL、QwQ 等、Qwen3.6-Plus 等模型几乎全部开源权重。但旗舰定位的 Qwen-Max 系列此前一直仅以 API 形式提供,社区无法本地部署。2026 年 8 月 3 日,Qwen 团队在 qwen.ai/blog?id=qwen3.8 发布 Qwen3.8-Max,这是 Qwen 家族中「首次开放 Max 级权重」的旗舰模型(参考 MarkTechPost 同期报道),配套下放一个 270 亿参数的次级检查点 Qwen3.8-27B。

核心规格:2.4 万亿 MoE + 百万 token 上下文

Qwen3.8-Max 的核心参数由 MarkTechPost 与 QwenCloud 模型页面共同确认:

  • 总参数规模:2.4 万亿,采用混合专家(MoE)架构;激活参数数量官方尚未披露
  • 上下文窗口:1,000,000 token(启用思考时输入上限 983K,关闭时 991K),输出上限 131K,推理预算最高 262K
  • 模态:支持文本、图像、视频作为输入,文本输出
  • API 价格(Qwen Cloud):输入 2.00 美元/百万 token,输出 6.00 美元/百万 token;隐式缓存读取 0.25 美元/百万 token,显式缓存构建 2.50 美元、读取 0.17 美元——缓存输入比新鲜输入便宜约 8 倍
  • 速率限制:2M token/分钟、15K 请求/分钟
  • 能力:函数调用、结构化输出、批处理、前缀续写、微调,Responses API 内置 code_interpreter / web_search / web_extractor / t2i_search / i2i_search 五种工具

基准成绩:多模态领先,代码推理追平一线

阿里官方随版本同步放出完整的 benchmark 表(详见 qwen.ai/blog?qwen3.8)。比较有信号的几项:

  • Terminal-Bench 2.1:86.6 分,高于 Claude Opus 4.8、Fable 5 的 84.6,但仍低于 GPT-5.6 Sol(max)的 88.8
  • SWE-bench Pro:67.7 vs Fable 5 的 80.0
  • FrontierSWE:73.5 vs Fable 5 的 88.8
  • PaperBench:93.0(领先)
  • IFBench:82.8(领先)
  • GPQA Diamond:92.6,仅比 Qwen3.7-Max 的 92.4 微涨
  • 多模态项目明显领先:OSWorld-Verified 86.1、Parametric CAD Bench 91.5、OmniDocBench 1.5 92.1
  • 自我对照涨幅很大:DeepSWE 1.1 从 21.6 跃升到 56.6,FrontierSWE 从 40.7 到 73.5,JobBench 从 31.3 到 53.4

需要标注的两点诚实折扣:多模态表是与 Qwen3.7-Plus(而非 Qwen3.7-Max)对比,这放大了代际差距;官方 RL 缩放曲线在 4000 个训练环境附近达到 0.725 峰值,继续扩到 0.719 和 0.689 时反而回落——意味着 2.4T 并不是「越大越好」的简单外推。

部署现实:Max 跑不动,27B 才是落地形态

MarkTechPost 的判断很清醒:虽然 Qwen3.8-Max 立刻可以通过 API 接入(OpenAI 与 DashScope 兼容,改 base URL 与 model ID 即可),但 2.4T 总参数的检查点本身就是「多节点数据中心级」产物,不是单机 GPU 能塞下的东西。真正的本地可部署形态是 Qwen3.8-27B,它和 Max 共享同一波次的训练迭代,但参数规模压到了普通 GPU 服务器可以承载的区间。Max 权重虽然承诺「下周开放」,但具体协议、可商用范围、激活参数量、推理框架适配情况官方还没给出清单,实际能跑成什么样要等社区拿到权重后才能见分晓。

评论:为什么「开源 Max」这件事重要

把 Max 级别模型开放权重,意义在于让社区第一次有可能在本地评估一个阿里对标 GPT-5.6 Sol、Claude Opus 4.8、Fable 5 的真实旗舰。过去这些顶级模型在 benchmark 表里被写在一起,但只有 API 形式,大家都得听厂商自报;现在 Max 权重一旦放出,社区可以做独立的复现、独立的能力测试、独立的红队,这对 AI 安全与对齐研究也是一次「解封」。

但也要看到:Max 权重 ≠ Max 可用。27B 检查点才是真正的产品形态,这是开源 MoE 旗舰的标准操作——DeepSeek V4-Pro 的 1.6T 部署形态、Kimi K3 的 2.8T 在 Hugging Face 上的可玩版本都走了同样的路。**未来一周真正值得盯的事是:官方能否同步给出激活参数量、推理框架(vLLM / SGLang / TensorRT-LLM)的适配进度、以及清晰的许可证条款。**没有这三项,2.4T 仍只是 PR 数字;有了,头部开源模型的天花板会再被掀一次。


来源(素材):

  1. Qwen 官方博客:Qwen3.8-Max 发布页(qwen.ai/blog?id=qwen3.8,通过 qwen.ai/research 索引确认)
  2. MarkTechPost 报道(2026-08-03):Alibaba Qwen Releases Qwen3.8-Max: A 2.4 Trillion Parameter MoE Model
  3. X / Twitter:Alibaba_Qwen 官方账号 8 月初对 Qwen3.8-27B 开源化的预告