2026 年 8 月 14 日, Hugging Face 发布《State of Open Models: Summer 2026 Observations》。在头部厂商们追逐更大、更新的模型时, 这份报告用 Hub 数据反问了一件很多人忽略的事情: 被点赞最多的, 和真正在被跑的, 几乎不是同一批模型。
数据本身就很反直觉
报告取了 2026 年 Hub 上下载量 Top 25 的模型仓库, 与点赞 Top 25 的仓库对比。两个榜单重合的只有一个。在 2026 年新发布的所有模型里, 没有一个进入下载榜 Top 25; 而下载榜里有 13 个模型来自 2022 年。
最具代表性的数字是 all-MiniLM-L6-v2 —— 一个 2022 年发布的 sentence embedding 模型。它在 7 个月内被下载了约 15.5 亿次, 同时只积累了 5,156 个 likes。同一时期, Kimi-K3 每个 like 对应约 60 次 pull。一个被业界忽略, 一个被业界仰望。
"点赞"和"下载"记录的是两件不同的事
报告点出了这件事的本质: likes 是注意力, downloads 是依赖。一个 like 说的是"这个发布值得关注", 主要流向发售后几周内的前沿模型; 一次 download 说的是"这个模型被接进了某条按计划运行的 pipeline", 主要流向运行稳定的小型模型。把任何一个指标当成另一个指标的代理, 是观察 Hub 时最常见的错误 —— 报告原文就这么写。
数据分布的不对称同样出现在发布者层面:
- 中国 frontier 实验室 的下载几乎都集中在 70B 以上参数。MiniMax 2026 年的下载里 100% 来自 ≥70B 模型; Moonshot 88%; DeepSeek 55%; Z.ai 39%。Moonshot 这样的 frontier-only portfolio 全年累计 37M 下载。
- 美国实验室 这一栏基本是空的。Google、Microsoft、IBM Granite 在 ≥70B 区段几乎没有下载; NVIDIA 14%, Meta 仅 9%。
- 总量上, Qwen 的 full-spectrum 策略覆盖从亚 1B 到万亿参数, 全年达到 2,045M 下载 —— 是 Moonshot 整年下载量的约 55 倍。
报告强调 Qwen 累计拥有 151,448 个衍生模型, 是 Meta 全部衍生模型数量的 2.6 倍、Llama 衍生模型数量的 4.7 倍, 并且仍在以每天 180-210 个新仓库的速度增长。
另一条主线: 模型之外的事长得更快
报告专门用一节讨论 runtime layer, 因为真正决定一个模型能不能被用上的, 往往不是模型本身, 而是它跑在哪。
- 仓库声明
gguf库(供 llama.cpp 使用)同比增长 464% lerobot增长 194%- 苹果 MLX 增长 148%
- 而
transformers、peft这类核心建模库只增长 16% diffusers21%
报告提到的另一件事是 ggml 团队 2026 年 2 月正式加入 Hugging Face。项目保持完全开源、社区治理, 但获得了更稳定的资源支持。本地推理的"上限"由此被抬到了一个新的层级: GGUF 版本现在能装下 2.8 万亿参数的 Kimi-K3 与 284B 的 DeepSeek-V4-Flash。
这也解释了一个看似矛盾的事实: 几乎所有顶尖实验室都不怎么发布官方 GGUF 版本, 但开发者本地跑模型时用的恰恰是 GGUF。Qwen 每月被以 GGUF 形式下载 3,960 万次, 是 Gemma(2,080 万)的近两倍、Llama(750 万)的五倍多。
一个还没被写出来的判断
这件事最值得关注的点, 是它改变了我们判断"开源模型成功"的尺子。在 frontier 模型榜单上拼排名, 看 likes 也许够用; 但谁真正被接进了生产 pipeline, 看 downloads 才有意义。报告里的描述值得记住: "Likes are the right instrument for reading what the field is excited about, downloads for reading what it currently depends on."
过去一年, 评价一个开源模型的方式几乎都是"哪个最 fancy"。当 2026 年有 60% 以上的衍生仓库都指向 Qwen 家族, 当 15.5 亿次下载流向一个 sentence embedding 老模型, 当 GGUF 仓库一年涨 464%, "被用上"和"被注意"是两件事就不再是一个抽象观察, 而是一个可以直接拿来修正报道框架的判断。
做下游产品的人, 把 model card 上的 likes 数当成生产可用性的替代指标, 这个习惯大概需要重新校准一次。