8 月 12 日,阿里把 Qwen3.8-Max 的开放权重放上了 Hugging Face:两个官方仓库 Qwen/Qwen3.8-2.4T-A95B 与对应的 FP8 量化版,2.4 万亿总参数、950 亿激活的细粒度 MoE,训练后(post-trained)检查点,官方文档明确面向 vLLM、SGLang、TokenSpeed 部署路径。NVIDIA 同日发布的部署博客也确认了这次开放。这是 Qwen 家族第一次把 Max 级旗舰的权重真正交出去——但下载下来你会发现,它不是你在 API 里试过的那个模型。

开出来的不是旗舰,是旗舰的文本子集

对照托管版 Qwen3.8-Max,开放权重版砍掉了三样东西:视觉输入(API 版有,开源版纯文本)、最高 1M token 的上下文窗口(开源版原生窗口明显更小)、可选的思考模式(开源版强制所有交互走 thinking)。工具调用和 Qoder 那套智能体能力也不在基座检查点里。

这个落差直接点燃了社区。Hugging Face 仓库的讨论区在权重上线几小时内就出现了长帖,有评论认为砍掉视觉「移除了它一半的核心价值」,还有人把这种「同名不同能力」的发布模式比作游戏行业的 DLC 分段付费,称这一操作耗尽了 Qwen 前几代开源积累的信任。

硬件门槛也把绝大多数人挡在门外。BF16 全量权重约 4.89TB;Unsloth 提供的 GGUF 量化从 1-bit 的约 397GB 到 4-bit 的约 1.31TB——就算压到极限,依然是多卡工作站或重型 NVMe offload 的级别。NVIDIA 的参考部署是 GB300 NVL72(72 块 Blackwell Ultra GPU),FP8 下单卡吞吐超过 4000 token/s。对单卡用户来说,这次开放基本与本地部署无关。

许可证才是真正的信号

比减配更值得注意的,是许可证换了。此前 Qwen 各代普遍采用宽松的 Apache 2.0,这次 HF 仓库挂的是一份自定义的 qwen3.8-max 许可证,围绕发布的报道描述其对大型商业用户有收入分成条款,具体阈值和比例还在敲定中。Hugging Face 8 月 14 日发布的 Summer 2026 开源模型报告也印证了这个方向:报告指出行业最前沿正在转向更明确的商业化路径,Kimi K3 与 Qwen 3.8 Max 近期都加入了非商业限制与收入分成要求。

这解释了「为什么砍」。当开源权重从获客手段变成需要直接变现的资产,旗舰能力就必须留在 API 侧。阿里仍然贡献了 Qwen 家族史上第一次 Max 级开放,但在「开放」的定义上,这次释放更像一场研究基础设施的展示,而不是对社区的完整交接。

27B 补上了,但问题的答案没变

8 月 15 日,承诺中面向单卡的 Qwen3.8-27B 也已上线(上线当日冲上 Hacker News 首页),Apache 2.0,这次没再缩水。这让「缺的那一半」有了着落——单卡用户有了可自托管的选择。

但对整个行业来说,真正的问题没变:当顶级模型的开放从「全量交付」变成「分层交付」,开源社区拿到了权重,却没有拿到与闭源版对等的能力。你在 Qoder 里测的是完整版,下载到本地的是阉割版——以后评估任何「开源旗舰」,都得先问一句:开的是哪一半?参考:explainx.ai 分析