9 月 15 日,Mozilla 发布了《State of Open Source AI》报告 v1.1(首版 7 月 14 日上线,本版数据截至 9 月 1 日)。核心数字:美国闭源前沿模型与中国最好的开放权重模型之间,能力差距只剩约 4.4 个月——这是 Mozilla 用 METR Time Horizon 数据拟合的结果,独立机构 Epoch AI 的估计是 4 个月,两个数字互相咬合。
「代差」已经变成「季度差」
报告引用 Artificial Analysis 智能指数 v4.1.1(9 月 1 日数据):前十名里,前四席是闭源(Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok 4.6),紧接着的四个席位全部是开放权重——Kimi K3 与 GLM-5.3 并列 60.0 分,距第一名 Claude Opus 5 的 63.0 分只差 3 分,距 Claude Fable 5 的 62.1 分只差 2.1 分。
差 2.1 分意味着什么?报告给出价格对照:Kimi K3 API 定价 3/15 美元(输入/输出每百万 token),Claude Fable 5 是 10/50 美元——约 30% 的价格。用三成价钱买 2 分的差距,这笔账任何人都会算。
闭源前沿真正守住的三个阵地
报告没有回避闭源的剩余优势。CTO Raffi Krikorian 点名三类闭源仍值得溢价的任务:专家级专业工作、高强度检索、长上下文。硬数字也支撑这个判断:GDPval-AA v2 专家知识工作基准上,Fable 5 领先 K3 达 92 Elo,是两者共享基准里最大的分差;100 万 token 多针检索,Gemini 3.1 Pro 拿到 89%,DeepSeek V4-Pro 只有 41%;METR 时间线数据下,8 小时以内的任务开源闭源都能胜任,超过 12 小时的谁都不行——分界带就在中间这段。
「开放默认、闭源按需」已经有现实模板:报告引用 DoorDash 的做法——日常工作量跑 Kimi,复杂任务留给 Fable。
冷水:能力追平了,钱包和部署没有
报告里最扎心的对比是收入:2025 年模型层收入 96% 归闭源厂商,开放模型只拿 4%;而同期闭源模型在约 90% 能力对齐下,每次调用贵约 6 倍。投产率同样有差距:调查显示运行开放模型的团队只有 53% 真正投产,闭源团队是 63%。
但天平在动:2026 年 8 月是开放模型第一次在 OpenRouter 按请求数登顶的月份,按 token 量计的前十模型里 8 个是开放权重、其中 7 个来自中国厂商;美国闭源厂商的请求份额从 5 月的 54% 掉到 8 月底的 44%。还有一个值得玩味的信号:8 月 16 日 DeepSeek 完成开放模型第一次官方涨价,输出价格上调 2.3–4.6 倍——当开放模型也握有定价权,「便宜」这个标签还能贴多久,是个真问题。
所以呢
这份报告真正的读者不是模型厂商,而是每季度都要写 AI 预算的技术负责人:你在为「4 个月的领先」支付几倍的溢价,而你的日常工作负载里,有多少真的落在这 4 个月里?报告给多数组织的答案很直接——默认选项换成开放权重,把闭源前沿留给那一小段真正需要它的任务。
参考:Mozilla《State of Open Source AI》v1.1、Tom's Hardware(tomshardware.com)与 Ars Technica 9 月 15 日报道