Hugging Face 8 月 14 日发布《State of Open Models: Summer 2026 Observations》,用 Hub 上 1 月至 8 月的活动数据,讲了一件被很多开源新闻稿忽略的事——开源 LLM 的「关注度」和「使用度」根本不是一回事,Hub 上点赞数与下载数最高的那 25 个仓库,只有一个同时出现在两个榜单里。这条结论并不抽象,它直接决定了一家做开源模型的公司,到底应该把研发资源压在「让人兴奋」上,还是压在「让人部署」上。

先把基础数据摆出来。报告期内的 Hub 公共模型仓库从 243 万个增长到 296 万个,数据集从 71.1 万个增加到 100 万个,Spaces 从 100 万个增加到 144 万个。规模放大的同时,头部集中度也在放大:85.6% 的模型仓库终身下载量低于 200 次,1.5% 的仓库吃掉了 99.2% 的下载。这种长尾分布意味着「开源 AI 繁荣」与「一个具体的模型被广泛使用」,是两件互不相关的事。

关注 ≠ 使用,点赞与下载撕裂成两个经济

报告把窗口期内点赞 Top 25 与下载 Top 25 拿出来比对,结果「完全只有一个仓库」同时出现在两个榜单上。把这一条加上「按模型年龄归一化」之后,差异更刺眼:下载 Top 25 里,没有任何一个是 2026 年发布的,而 25 个里有 13 个诞生于 2022 年。极端例子是 all-MiniLM-L6-v2——七个月被下载 15.5 亿次,只换来 5,156 个赞;Kimi K3 是另一个方向,差不多每拿到 60 次下载,才换到 1 个赞。

「赞」记录的是「这个发布很重要」,通常落在前沿模型首发后的几周里;「下载」记录的是「这个东西被接进了定时运行的流水线」,往往来自小而稳定的模型,以年为单位累积。把任何一项当作另一项的代理,都是这次报告想要纠正的常见误读。

Qwen 成了社区的默认底座

点赞和下载不重合,但衍生数(sub-derivative)给出了第三个独立维度:有多少第三方仓库基于这个模型继续造东西。在这个维度上,Qwen 已经基本坐稳了社区「默认底座」的位置。报告里给出的数字是 151,448 个 Qwen 衍生仓库,是 Meta 全生态的 2.6 倍,是 Llama 系列仓库的 4.7 倍;Google 排名第二,有 82,506 个衍生仓库。Qwen 衍生仓库的增量,2026 年前 7 个月保持在日均 180 到 210 个的水平。

这 15 万个衍生里,Qwen 自己只直接发布了 54 个 GGUF 量化版本,其余几乎全部由社区(包括 Unsloth 这类专注量化与微调的社区账号)完成。这条信息很重要——它意味着「开放权重」并不只是「把权重扔出来」,真正决定它能不能跑、能不能被消费级硬件承担的,是 Hub 上那层看不见的量化与转换工作。

GGUF 增长 464%:万亿 MoE 进了消费机

如果只看模型仓库数量,2026 年前 7 个月增速 21.5%;但仓库周围的运行时分发层跑出了几倍速:声明 gguf 库的仓库增长 464%,lerobot 增长 194%,Apple 的 mlx 增长 148%,相比之下 transformers 与 peft 仓库只增长了 16%,diffusers 增长 21%。HF 报告把这个差异命名为「运行时分发层跑得比模型层还快」。

GGUF 是 llama.cpp 的量化格式,这条数据的实际意义是:以前「在本地跑模型」约等于「在笔记本上跑 8B」,现在的天花板已经被推到 DeepSeek-V4-Flash 的约 284B 参数,与 Kimi-K3 的约 2.8 万亿参数(报告原文如此,Hugging Face 写道「Kimi-K3 at roughly 2.8 trillion」)。月下载量数据上,Qwen 的 GGUF 一个月 3,960 万次,是 Gemma(2,080 万)的近两倍,是 Llama(750 万) 的五倍以上;而 Llama 派生 GGUF 仓库数量还略多于 Qwen——同样的货架,五分之一的客流。

中美参数上限差 20 倍,几乎按月刷新

报告给了一张按月发布最大开源模型的折线图。2026 年里几乎每一个月,中国实验室当月发布的最强开源模型,都大于同期美国实验室发布的最强开源模型。中国一侧的参数上限区间是 754B 到 2.78 万亿参数,美国一侧在 7 个月里有 5 个月没跨过 130B 这个坎;少数例外是英伟达 5 月的 Nemotron 3 Ultra(561B),以及 Thinking Machines 的 Inkling(952B,而报告也直接指出,Inkling 是基于中国模型构建)。

Kimi K3 / Qwen 3.8 2.4T 加了非商用 + 收入分成条款

许可证这条线也在变。HF 报告写到,中国 2026 年发布的 178 个 200 亿以上参数的模型里,59% 是 Apache 2.0,22% 是 MIT,「几乎不存在」非商用限制。但报告同时指出,最近几周这一趋势开始反转:Kimi K3 与 Qwen 3.8 2.4T 这两个超大模型,开始在许可证里加入非商用限制与收入分成要求。这对开源 AI 商业化是一个分水岭,「最宽松许可证」正在向「最贵许可证」漂移,主要集中在最大的那几个模型上。

Agent 7 月首次成 Hub 第一大用户

报告还首次披露了 7 月新增的 agent-usage 数据集记录(基于 agent/ token 抓取 coding agent 对 Hub 的调用)。7 月数据:Claude Code 占 44.4%,但 4 月它还占 67.8%,5 月 64%,份额在 4 个月内被 Codex 从 10.4% 拉到了 20.8%;未被命名的 agent harness 占将近四分之一,5 月这一比例甚至到过 59.8%。这意味着「coding agent 调模型」这个流量来源的格局远未稳定,任何一次默认模型切换或一次 SDK 升级,都能在一个月内把流量分到完全不同的位置。

所以呢

把这几条线拼起来,结论比「Qwen 30 亿下载」这种数字更复杂。开源 LLM 已经不是一个市场,而是三个并行的市场:点赞市场(前沿 + 新发布 + 注意力)、下载市场(稳定 + 小模型 + 流水线)、衍生市场(权重友好的许可证 + 完整家族覆盖 + 社区量化)。三者互相重叠的部分,比大家想象的小得多。Qwen 的「底座」地位,来自第二与第三个市场——它没有在点赞市场长期霸榜,但它有 Apache 2.0 的许可证,有一个 1B 到 2.4T 完整的家族,还有社区把它的每一个变体都做成了 GGUF。

这份报告另一个隐含信号:「开源」不等于「免费」,Kimi K3、Qwen 3.8 2.4T 已经把非商用与收入分成写进许可证,这意味着前沿模型开源的主要回收渠道,正在从「许可证」挪到「API 与云」、「硬件与平台定位」、「生态位置本身」。这一波开源叙事,可能比上一波更短命,因为条款正在变紧。

来源: Hugging Face 博客原文;Solidot 中文转述(印证 Qwen 30 亿下载 + 151,448 衍生);Bloomberg 8 月 15 日报道(印证 Qwen 30 亿下载)。(newsforai 整理)