素材:Hugging Face《State of Open Models: Summer 2026 Observations》——模型能力信号与 Agent 流量
用途:支撑开场「有用性前提」(能力足够强 + 种类足够丰富 → “有没有用”不再是问题,问题是怎么用)、5.1「消耗主体从人变 Agent」机制。
来源:https://huggingface.co/blog/state-of-open-models-summer-2026(2026-08-14 发布,统计 2026 年 1–8 月 Hub 活动)。
诚实声明:这是一份 HF Hub 的生态与使用量报告,不含 benchmark 分数与定价数据。本文件只提取其中可作为「模型能力变强」间接证据的部分(规模竞赛、开源追平闭源、Agent 流量);其余生态冷知识列于第五章备用。演讲中不要把它说成”评测报告”。
一、规模竞赛:开源模型进入万亿参数时代(能力信号 1)
- 2026 年 1–8 月,中国每月最大开源模型发布规模在 754B–2.78T 参数区间;小米、蚂蚁、美团三家今年相继跨过 1T 参数线。
- 同期美国每月最大发布有 5 个月低于 130B(例外:NVIDIA Nemotron 3 Ultra 561B、Thinking Machines Inkling 952B)——规模竞赛上中国开源生态领先。
- 授权也在放开:中国 >20B 开源发布 178 个中,59% Apache 2.0、22% MIT;DeepSeek 与 Z.ai 以 MIT 发布 700B–1.65T 模型。美国 >20B 发布仅 29% Apache/MIT(41% 自定义条款、30% 未声明)。
- 新限制苗头(反面信号,防一刀切):Kimi K3 与 Qwen 3.8 2.4T 已加入非商用/收入分成条款——开源不等于无条件。
- 口径注:参数规模是能力代理指标,报告无 benchmark 数据;「规模 = 能力」只在定性层面成立。
二、开源追平闭源:一个具体事件(能力信号 2)
- 2026 年 7 月,HF 遭遇首起有记录的自主 Agent 入侵事件;事件分析中,前沿闭源模型因安全护栏拒绝分析被捕获的攻击代码,最终由量化版开源模型 GLM-5.2(跑在 HF 自有基础设施上)完成分析。
- 演讲用法(一句话级):”闭源模型不敢干的活,开源模型已经能干”——能力差异正在从「有没有」变成「让不让」。
三、本地推理上限:万亿参数模型跑进本地(【勿用于演讲】本地推理与 Token 工厂主线无关,仅作报告完整性记录)
- llama.cpp 的 GGUF 构建已支持 DeepSeek-V4-Flash(约 284B)与 Kimi-K3(约 2.8T)——万亿级 MoE 模型可在几台消费级机器上本地运行,本地推理的天花板被抬高到前沿规模。
- 运行时层生态增长:gguf 相关仓库 +464%、mlx +148%,而 transformers/peft 仅 +16%——重心向本地/轻量运行时迁移。
- 防误导:下载量 83% 是 <1B 小模型,2026 年用量中 >70B 仅占 3%——前沿能力「可以本地跑」不等于「主流在本地跑」。
四、Agent 流量:谁在调用模型(支撑 5.1「消耗主体从人变机器」)
- 2026 年 4–7 月 HF Hub agent 流量份额:Claude Code 67.8% → 64.0% → 44.4%;Codex 10.4% → 20.8%;未注册 harness 7 月约 25%(5 月曾达 59.8%)。
- 解读:Claude Code 份额下降不是 Agent 退潮,而是生态分化——4–7 月出现十多个新客户端标识,Agent 工具层群雄并起。
- 与 05 §1.4 互补:05 讲「单个 Agent 调用模型多少次」,本数据讲「Agent 群体内部谁在调用」。
五、生态冷知识(备用,不占主线时间)
- 供给规模(「种类丰富」的量化证据,已用于开场):模型仓库 2.43M → 2.96M(+21.5%)、数据集 711K → 1M、Spaces 1.00M → 1.44M(2026 年 1–8 月)。
- 头部集中:1.5% 仓库贡献 99.2% 下载量;85.6% 模型终身下载 <200。
- 下载 ≠ 口碑:下载 Top25 与点赞 Top25 仅 1 个重叠;2026 年发布的模型无一进入下载 Top25(25 席中 13 席来自 2022 年);all-MiniLM-L6-v2 7 个月 15.5 亿下载、点赞仅 5,156,而 Kimi-K3 约 60 下载/赞。
- Qwen 生态:151,448 个衍生模型(为 Meta 总量 2.6 倍),每天新增 180–210 个;28,531 个 GGUF 转换(其中 Qwen 官方仅 54 个)。
- 中国模型下载结构(>70B 部分占各发布方 2026 年下载量的份额):MiniMax ~100%、Moonshot 88%、DeepSeek 55%、Z.ai 39%;对照 NVIDIA 14%、Meta 9%。
- Moonshot 总量 37M vs Qwen 2,045M(约 55 倍差距)——参数规模 ≠ 生态影响力。
六、来源链接
- https://huggingface.co/blog/state-of-open-models-summer-2026