开源大模型生态在 2026 年 8 月悄悄翻过一页:头部阵营第一次同时出现了 Qwen、阿里、Anthropic 之外的第三方厂商,头部模型与第二三名的差距也被拉开了 7 分以上。第三方榜单 BenchLM.ai 在 8 月 27 日校验的 Open-Source LLM Leaderboard 2026 给出了一份冷峻的快照:在前沿开源榜单上,阿里通义千问团队再次屠榜——Qwen3.8 Max 以 79.2 分位列第一,Qwen3.8-27B 以 72.6 分位列第二,MiniMax M3 以 68.6 分位列第三(原始数据:benchlm.ai/best/open-source)。

头部:千问系列霸榜,2.4T Max 第一次开源

Qwen3.8 Max 的 79.2 分比第二名 Qwen3.8-27B 高出 6.6 分,比第三名 MiniMax M3 高出 10.6 分。在 BenchAlign v5 公开打分通道上,这是开源与闭源阵营差距最小的一次——Qwen3.8 Max 在全榜(226 个模型)中排名第 6,在 105 个有源验证证据的子集中同样排名第 6。Qwen 团队在 OpenLM.ai 的官方公告里确认,Qwen3.8 Max 基于 Qwen3.5 架构扩展到 2.4 万亿参数,首次把 Max 级权重以 Apache/MIT 方式开源(来源:openlm.ai/qwen3.8)。

Qwen3.8-27B 走的是"小而精"路线——262K 上下文,72.6 分,适合单机单卡或双卡 H100 部署。它和 Qwen3.8 Max 一起,把开源模型在 BenchAlign v5 通用通道上的前两名都锁定在阿里手里。这也是 BenchLM 给出的第 12 名 MiniCPM5-1B(11.4 分)以来,103 个开源模型里最悬殊的头尾差距。

第三:MiniMax M3 拿到 68.6 分,1M 上下文进入头部

MiniMax M3 是 8 月开源榜上的一匹冷门黑马。68.6 分对应 1M 上下文窗口,显式推理模式支持,在 BenchLM 的子集证据标签里被标注为"Supported"——意味着分数来自可复核的公开源数据,不是估算。M3 的 90% 置信区间为 63.31–73.93,区间下沿跟 Dots Studio 的 dots3-note Preview(68.6)重合,这意味着开源阵营在 68 分附近的密度已经相当高。

值得对比的是,M2.7 同厂版本仅 63.1 分。M3 相对 M2.7 提升约 5.5 分,代价是参数规模和推理硬件需求——官方数据指向 8× H100 起步(来源:benchlm.ai/models/minimax-m3)。

部署视角:有"实战记录"的 12 个模型都是中国系或美国老厂

BenchLM 的 8 月榜单里,只有 12 个开源模型进入了"部署目录"——意思是除了跑分,还有真实部署记录可以审计。许可证方面,MIT/Apache 2.0 阵营有 6 个:GLM-5.1(智谱,67 分)、Gemma 4 31B(Google,60.3)、DeepSeek-R1(51.1)、Qwen3.6-27B(53.7)、Mistral Small 4(46.4)、DeepSeek V3(44.5)。社区/自定义许可证的有 6 个:Kimi K2.6/K2.5/K2.7 Code、Qwen2.5-72B、Llama 4 Scout/Maverick。

这条部署目录透露两个信号。第一,中国厂商占了 8 席(智谱、阿里、Kimi、DeepSeek),美国厂商 4 席(Google、NVIDIA、Mistral、Meta)。第二,真正能在单机单卡跑的开源旗舰只剩下 Gemma 4 31B、Qwen3.6-27B 这种 27B–31B 区间的——再往上 Qwen3.8 Max、GLM-5.1、Kimi K2.6 都需要 8× H100 的 640GB 总显存(原始数据同上,见 BenchLM 部署目录)。

几个被反复引用的"中国实验室超大参数"在这份榜里怎么样

Solidot 在 8 月 17 日转述的 Hugging Face 报告提到:中国发布的 178 个 200 亿以上参数模型里,55% 用 Apache 2.0、22% 用 MIT,但大部分有非商业使用限制。NVIDIA Nemotron 3 Ultra(5610 亿参数)和 Thinking Machines 的 Inkling(9520 亿参数,基于中国模型构建)也在该报告中被点名。在 BenchLM 的开源榜上,Nemotron 3 Ultra 仅排第 66 位(46.4 分),Inkling 排第 9(66.9 分),Inkling-Small 排第 11(63.7 分)。参数规模并没有直接转化为榜单位置——Qwen3.8-27B(27B 密集)用 1/90 的参数量把 9520 亿参数的 Inkling 压在身后。

行业影响:开源模型在通用通道上第一次摸到全榜前 10

BenchAlign v5 通用通道是开源/闭源同台打分的通道。在 8 月榜单里,Qwen3.8 Max 已经是全榜(226 个模型含闭源)的第 6 名——这是开源模型在这条通道上第一次稳定出现在前 10。对比 7 月 14 日的快照,开源榜首 MiniMax M3 的 79.2 分(同分数是 Qwen3.8 Max 在 8 月拿到的)当时对应的是全榜第 4 左右。8 月的开源榜单变化意味着:头部闭源模型在通用通道上的领先幅度正在收敛,而收敛的主力不是 Meta、不是 Mistral,是阿里的 Qwen 系列。

所以这条 8 月榜单讲的不是"哪家最强",而是"开源模型第一次在通用基准上不输闭源头部,而且领跑的不是西方实验室"。下个月榜单如果 Qwen3.9 系列或 GLM-6 出现在前 3,这条趋势就算坐实了。

来源汇总: