Mozilla 在 9 月 15 日发布的《State of Open Source AI v1.1》报告把宏观判断落到了具体模型、具体任务时长和单任务成本上。最核心的结论是:中国头部开放权重模型与美国前沿闭源模型的能力差距已经缩至约 4.4 个月。
闭源与开源:三分之差,七倍成本
报告引用 Artificial Analysis 智能指数(9 月 1 日版)指出,Anthropic 的 Claude Fable 5 以 62 分位居榜首,Moonshot 的 Kimi K3 以 60 分紧随其后,中间只差三分。但价格层面的差距要大得多:Fable 5 的列表价为 10/50 美元每百万 token,Kimi K3 仅为 3/15 美元——按输入/输出同价计算,Kimi K3 跑完相同任务的有效支出大约只有 Fable 5 的 30%。GLM-5.3 的成本曲线还要更激进:0.075 美元/百万 token 的输入价,基本上把同一档能力的边际成本压到了行业最低。
这就是 Mozilla CTO Raffi Krikorian 给出的「闭源溢价」定性——价格差体现在需要 8 到 12 小时才能完成的专业型任务上,而开源模型则能以极低的价格处理日常工作。
任务时长:12 小时仍是分水岭
报告引用 METR Time Horizon 1.1 的方法(任务 50% 可靠成功),把闭源与开源放在了同一个时间轴上:目前最佳闭源模型能可靠完成约 12 小时的任务,最佳开源模型大约能完成 7 小时的任务,任务长度比约为 1.7 倍。Krikorian 的判断是:4 个月后,开源模型就能追上 12 小时,闭源模型则推进到约 20 小时——8 到 12 小时这段中间地带,是当前闭源依然能赚到溢价、开源尚难替代的区间。
这个判断在企业一端已经开始反映在路由选择上。DoorDash 已经把日常任务切到 Kimi,把 Fable 留在更复杂的工作负载里;OpenRouter 8 月按 token 用量统计的前十名里有 8 款是开源权重,其中 7 款为中国团队研发。
八月:开源第一次接管请求榜首
报告里最有冲击力的数据点出现在 OpenRouter 这一节。8 月 3 日,DeepSeek 第一次取代 Google 拿下单周请求量第一——Google 已经连续 51 周占据这个位置。从 2025 年 9 月的 800 亿周请求到 2026 年 8 月的 1.01 万亿,DeepSeek 一年的增长倍数是 12.6 倍,Google 的同期增长只有 3 倍。美国闭源头部厂商的请求份额从 5 月的 54% 下滑到 8 月末的 44%。
DeepSeek V4 Flash 单月在 OpenRouter 上消耗 45.1T tokens,其次是腾讯的 Hy3(34.1T)和小米的 MiMo-V2.5(29.4T)。在前十之外,Kimi K3 在自己公布的 Terminal-Bench 2.1 上跑出了 88.3 分,超过了 GPT-5.6 Sol 的 88.8,仅以微弱差距排在开源模型头名。
OSS vs OSI:十六个「开放」没有真正开源
报告里还有一张容易被忽略的表格:Mozilla 邀请第三方按 OSI 的十条定义重新审视了 16 个所谓「开放权重」模型,结论是没有一个完全满足。Kimi K3 的许可证是定制的「Kimi K3 License」,附 MaaS/UI attribution 限制;Qwen3.8-Max 是阿里定制的「Qwen3.8-Max License」,带 Attribution + MaaS 限制;MiniMax-M3 也只发了社区版许可。换句话说,「开放权重」≠「开放源代码」,真正的训练数据配方,在任何一个主流权重面前都仍然是不公开的。
美国闭源的护城河还剩什么
报告把闭源仍然领先的边界画得很具体:Fable 5 在 GDPval-AA v2 上领先 Kimi K3 92 Elo,是所有共享基准里 Elo 差距最大的一个;1M token 多针检索上,Gemini 3.1 Pro 的 89% 对比 DeepSeek V4-Pro 的 41%,长上下文的可靠性差距还很明显。SOC 2 / HIPAA / ZDR 这些企业合规是闭源「打包默认」的卖点;而当一个事故真的发生时,「有责任方可以追责」是另一条护城河。
所以,Mozilla 给出的最终判断不是「开源赢了」,而是「开源在能力与价格上已经追到差 4.4 个月,但在长上下文、企业合规与责任边界上,闭源仍然是工作负载分流的默认选项」。这意味着未来 12 个月里,绝大多数企业的 AI 路线不会变成「all open」,而是「日常上开源,关键任务上闭源」——而这恰好是 Mozilla 想要看到的分流。