8 月 3 日 Qwen3.8-Max 发布时,阿里承诺约一周内放出配套开源权重。8 月 13-14 日,承诺兑现:Qwen3.8-27B 权重正式登陆 Hugging Face,Apache 2.0 许可,距旗舰发布 11 天。
规格超预期
这是一个 28B 参数的 dense 模型,采用混合注意力架构。规格表里有两个此前没人承诺过的点:原生多模态——自带视觉编码器;262k 原生上下文,通过 YaRN 可扩展到 1M token。前者意味着开源社区拿到的不只是文本模型,而是一个可直接做图文任务的多模态基座。
跑分:小模型的「越级打」
按 AI Release Tracker 整理的发布数据:编码向 SWE-Bench Pro 61.7%(该榜第一 Claude Fable 5 为 80.3%)、DeepSWE 1.1 42.2%、LiveCodeBench 90.3%(第一为 DeepSeek-V4-Pro 93.5%)、Terminal-Bench 2.1 73%;办公向 CoWorkBench 70.7%——阿里报告里 Opus 4.6 Max 是 68.2%;GPQA Diamond 89.2%。在该站追踪的全部模型中,Qwen3.8-27B 在 NL2Repo-Bench、QwenSWEBench、CoWorkBench、IFBench、Agent's Last Exam(score)五个榜上暂列第一。当然,这些是官方发布数字,独立复现还要等。
显存账单
Yotta Labs 的测算:BF16 约 56GB(H100/H200 级),FP8 约 28GB(48GB 卡),4-bit 量化约 14-17GB——Unsloth 给出的本地量化方案即约 17GB,意味着一张 24GB 的 RTX 4090 就能跑。对比同为国产旗舰的 Kimi K3:2.8T 参数、自托管起步 1.56TB 权重内存、集群规模。这就是 27B 存在的意义——不是比谁大,是比谁能落地。
所以呢
Qwen3.8-Max 走 API(每百万 token 2/6 美元),27B 走开源,阿里把同代能力切成了两条分发线。前代 Qwen3.6-27B 本就是社区本地 coding/agent 最受欢迎的模型之一,这代加上多模态和 262k 上下文,单卡自托管的门槛没变、能力上限抬了一截。对自建推理的团队,这是本月最值得跑一遍 eval 的新权重;对观望的人,答案也很简单:下载是 Apache 2.0,跑不跑得动你的活,试一下就知道。