这两天,Hugging Face 的 2026 年夏季报告(基于今年前 7 个月的 Hub 数据)在 AI 圈刷屏了。微博大多数标题都在喊同一件事:中国开源模型碾压,Qwen 拿下半壁江山。
这些话没错,但说实话,跟一个想下载模型跑在自己机器上的人,关系没那么大。真正值得你停下来看的,是报告里两个没什么情绪、但非常反直觉的分布数字:约 85.6% 的模型,终身下载量不足 200 次;而 1.5% 的仓库,贡献了全部下载量的 99.2%。微博也就是说,Hugging Face 上绝大多数模型从发布那天起就没人碰,而几乎所有人下载的都是同一小撮头部仓库。「发布一个模型」和「真正被使用」,早就是两件完全不同的事了。报告观察期内,HF Hub 的公开模型仓库从 243 万涨到 296 万,数据集突破 100 万——模型越来越多,但注意力在向极少数头部集中。知乎
报告里还有几组数据,放在一起看更有意思
参数前沿确实转移到中国实验室了。 2026 年几乎每个月,中国实验室发布的最大开源模型都超过同期美国实验室,月度参数上限在 7540 亿到 2.78 万亿之间;美国实验室有七个月里的五个月没超过 1300 亿。微博刚在 8 月 13 日开源的 Qwen3.8-2.4T-A95B(2.4 万亿参数、激活 95B 的 MoE)就是典型——这是千问第一次开放 Max 级旗舰权重。微博

但下载量真正的主力,是小模型。 报告的数据很直白:1B 以下的模型占了全部历史下载量的 83%,100B 以上只占 1%;只看 2026 年内的下载,70B 以上也只占 3%。知乎原因就一句话:小模型是唯一能在大多数开发者实际拥有的硬件上跑起来的模型。
本地推理生态在爆发。 报告统计了仓库增速:声明使用 GGUF 库的仓库涨了 464%,llama.cpp 生态之外的 lerobot 涨 194%、Apple 的 MLX 涨 148%,而 transformers 这类建模核心库只涨 16%。知乎决定模型能在哪运行的那一层,增速是建模层的三到七倍。GGUF 格式的月下载量,Qwen 达到 3960 万次,差不多是 Gemma(2080 万)的两倍、Llama(750 万)的五倍。微博

下载量头部是谁? 观察窗口内,Qwen 家族下载量 20.45 亿次,衍生模型 151,448 个——是 Meta 全部足迹的 2.6 倍、Llama 仓库本身的 4.7 倍。知乎注意一个细节:2.8 万多个 Qwen 的 GGUF 量化版里,官方自己发布的只有 54 个,其余全是社区做的。这个生态的厚度是开发者一票一票投出来的。

报告里最扎心的一节:点赞和下载是两种完全不同的行为
报告把下载量 Top 25 和点赞数 Top 25 拉出来对比:两份榜单重合的仓库只有 1 个。知乎下载 Top 25 里,没有一个 2026 年发布的新模型,13 个来自 2022 年;而点赞榜恰恰相反,新模型扎堆。
报告举的例子很说明问题:all-MiniLM-L6-v2,一个不起眼的嵌入模型,七个月被下载 15.5 亿次,点赞只有 5,156。知乎报告的原话是:点赞是衡量这个领域对什么感到兴奋的正确工具,下载则是衡量当前依赖什么的工具。把其中一个当成另一个的代理,是关于开源生态最常见的误读。
这对选模型的人意味着什么?「新发布」不等于「值得下」。 你刷到刷屏的新模型时,先想清楚它是让你兴奋,还是能进你的工作流。生产环境的开发者极度保守:旧模型被充分验证过,教程、量化版、踩坑记录齐全,出问题能搜到答案。
本周刚开源的 Qwen3.8,正好演示了报告说的分层
8 月 13 日上线的 Qwen3.8-2.4T-A95B 面向集群,个人设备不用想;8 月 14 日跟上的 Qwen3.8-27B 稠密模型才是给个人开发者的:原生多模态,支持文本、图像、视频输入,已上线 Hugging Face 和 ModelScope。微博同一时间,Meta 也把 30B 的 Muse Glimmer 挂上了 HF,Apache 2.0 协议,4bit 量化后不到 20G,一张 24G 显存的卡就能本地跑,定位是给常驻 Agent 调用。微博多模态通用底模和 Agent 常驻小模型,就是当下开源社区最活跃的两个方向。
这也对应了报告里另一个值得注意的发现:Agent 已经首次成为 HF Hub 上的头号用户。七月 Claude Code 占智能体流量的 44.4%,但这个位置一点都不稳:四月它占 67.8%,五月跌到 6.4%,Codex 则从 10.4% 一路爬到 20.8%。知乎报告说,这是一个没有既得者的市场,一次默认设置的变化就能在一个月内移动一半流量。

给你一份可以直接用的选模型清单
先查生态厚度,再看跑分。 衍生仓库数量、GGUF 量化版是否齐全、社区教程多不多。跑分差 2 分不重要,出问题搜不到解决方案才致命。
看维护节奏。 Qwen 能堆出 15 万衍生仓库,靠的是稳定的发布节奏和全尺寸覆盖,而不是偶尔一次旗舰发布。高频更新的系列意味着 bug 修得快、适配工具跟得上。
商用前扫一眼许可证。 报告显示中国实验室反而更开放:20B 以上的国产模型 81% 是 Apache 2.0 或 MIT,美国同规模模型只有 29% 宽松。微博但趋势在变——Kimi K3 和 Qwen3.8 最近都开始加入非商业限制或收益分成条款,别等产品上线了才发现合规问题。知乎
用工具匹配硬件,别凭感觉。 最近社区里有个叫 llmfit 的命令行工具:扫描你的内存、CPU 和显存,自动对比 Hugging Face 的模型库,按量化精度和上下文长度给出适配清单,支持 Ollama、llama.cpp、MLX。微博
最后说句实在的:这份报告最扎心的结论不是谁家碾压谁家,而是开放模型的数量还在涨,使用却在向极少数头部集中。如果你只是想在自己机器上跑点东西,盯紧那一小撮被反复验证过的仓库,比追每一次发布省事得多。另外提醒一句:报告里的下载量只反映 Hub 站内的情况,不包含 API 调用和私有部署,拿它当生态温度计可以,当市场份额看就过了。知乎接下来值得留意的信号:Qwen3.8 系列衍生仓库的增长速度、GGUF 月下载量的变化,以及非编程类 Agent 调用的增速——这些决定下一波开源模型往哪个方向卷。