报告背景
8 月 14 日,Hugging Face 发布半年度生态报告《State of Open Models: Summer 2026 Observations》,基于 2026 年 1–8 月 Hub 数据,在 Spring 2026 报告基础上扩展。报告围绕六个观察展开,给出开源权重模型生态在 2026 年的拐点式变化。下面挑三个最有冲击力的数字。
1. Qwen 成了社区的「默认底座」
报告用 4 个口径证明这一点:
- 下载量:仅 Hugging Face Hub 上,Qwen 模型 2026 年累计下载 20.45 亿次(含未声明参数量的仓库为 20.61 亿次);全平台(含 ModelScope 等)累计超过 30 亿次。Google 系为 4.18 亿次,Meta 系为 2.27 亿次。
- 衍生模型数:基于 Qwen 的下游模型在 Hub 上达到 151,448 个,是 Meta 系总数的 2.6 倍,Llama 仓库数的 4.7 倍。Google 系衍生 82,506 个。
- 生长速度:Qwen 衍生仓库在 2026 年前 7 个月里,每天新增 180–210 个,趋势是匀速而非脉冲。
- 覆盖广度:与 Moonshot、MiniMax、Xiaomi、Z.ai 这种「只发 70B+」的实验室不同,Qwen 覆盖 <1B 到 2.4T 全尺寸;与 Tencent 一起是少数把「全谱系」作为产品策略的中国实验室。
报告把 Qwen 模式归因为三件事:持续迭代而不是一次性旗舰、覆盖全尺寸、Apache 2.0 开放许可(在 178 个 20B+ 中国开源模型里,59% Apache 2.0,22% MIT)。
2. 许可证正在悄悄转向
但报告也点出反向信号:Kimi K3 和 Qwen 3.8 2.4T 这种「最大的模型」最近开始引入非商用限制与营收分成条款。DeepSeek、Z.ai 仍然把 700B–1.65T 模型放在纯 MIT 下,但商业化压力已经开始在中美两端的顶级模型上同步出现。
同一尺寸段,美方开放模型许可却更紧:30% 不声明,41% 自定义条款,仅 29% 是 Apache/MIT。报告原话:「权重送出去,收入从别处来 —— API、硬件、生态位都是变现路径。」
3. GGUF/llama.cpp 一年涨 464%,Agent 是 Hub 第一用户
实操层变化更猛烈:
- GGUF 仓库:增长 464%,lerobot +194%,Apple MLX +148%;同时期 transformers/peft 仅 +16%,diffusers +21%。报告原话:「决定模型在哪里能跑的那一层,增长是建模核心的 3–7 倍。」
- 本地推理:Qwen GGUF 月下载 3960 万,Gemma 2080 万,Llama 750 万。同一货架空间下,Llama 的 GGUF 仓库甚至略多于 Qwen,但下载只有 Qwen 的 1/5。
- Agent 流量:Hub 7 月 agent 调用里,Claude Code 占 44.4%,Codex 20.8%;还有近 1/4 来自「未命名 harness」。报告判断:「agent 不再是 Hub 的读者,它是 Hub 的第一用户。」
个人评论
三个判断:
第一,「中国开源 = 默认底座」是结构性的,不是营销话术。 15 万衍生仓库 + 全谱系 + Apache 2.0 + 30 亿次下载,这套组合让 Qwen 在被嵌入下游流水线这件事上,已经超过 Meta 的 Llama 系。Llama 的「心智首位」还在,但工程首位已经易主。
第二,许可证松动是头部模型的「开源代价」。 Kimi K3 / Qwen 3.8 2.4T 这种 10¹² 量级模型开始加非商用条款,意味着权重免费、算力不免费 —— 这是报告里最容易被忽略、却最影响长期格局的变化:真正能跑起来这些模型的开发者,依然要付给实验室(或云)钱。
第三,「本地推理 = 笔记本跑 8B」的时代结束了。 llama.cpp 现在能扛 DeepSeek V4-Flash(284B)和 Kimi K3(2.8T),GGUF 仓库一年涨 464%。本地推理的「门槛」已经变成「几台消费机」,而不是 GPU 集群。当 frontier-first 战略能成立时,llama.cpp 就是底座 —— 这条路线让中国 frontier-only 实验室(Moonshot / Xiaomi / Z.ai / MiniMax)找到了不用发小模型的发布方式。
所以呢:看「开源生态」不能只看 star 数。Hugging Face 这份报告真正想说的是 —— 生态位,而不是参数,才是 2026 年开源权重的胜负手。