9 月 8 日,面壁智能联合 OpenBMB 开源社区放出了新一代端侧模型 MiniCPM5-2B。知乎·新智元 刷屏标题基本都是「4B 以下第一」「2B 打穿 9B」「小钢炮」这套话术,配图来自同一组榜单截图。
但如果你是一直在笔记本、迷你主机上跑 7B/8B 量化模型的人,这次真正该盯住的有两件事:一是它开源的东西比「权重」多得多,二是发布后 24 小时内,社区里已经出现了两组对不上的分数。
这次开的不只是模型,是整条产线
过去大部分模型开源,给的是最终权重加一张模型卡。MiniCPM5-2B 这次把中间过程也翻出来了:
分阶段权重:Base、Midtrain、SFT-only、RL+OPD 后的版本全放出来,能对比模型在每个训练阶段发生了什么;
数据:50 万条 Agent SFT 数据、8 万多条覆盖数学/代码/知识/长文本推理的 RL 数据,外加 UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609 三个数据集,以及 UltraX-Preview 数据精炼方案——连那个负责精炼数据、只有 0.6B 参数的小模型都开源了。按官方说法,这套方案在 FineWeb 上用 16B tokens 超过了别人用满 20B tokens 的效果。知乎·Datawhale
训练框架与算法:自研 RL 框架 Meshy(去掉中央控制器和 Ray 依赖,训练/推理/奖励全部对等化,同步、异步、全异步三种模式可切)和 JustRL II(给 GRPO 装上 Critic,把信用分配精确到词元级)。知乎·新智元
训练 Recipe:从数据处理到后训练的完整配方。

官方给出的 RL 增益是看得见的:RL 后训练让数学 AIME 提了 20 分、SWE-bench Verified 提了 17.4 分、BFCL 工具调用提了 11.2 分。知乎·Datawhale
模型本身结构倒是很「老实」:2,516,756,480 参数,标准 LlamaForCausalLM 架构,42 层,GQA(16 个 Q 头 / 2 个 KV 头),128K 上下文,纯文本。GGUF、MLX、GPTQ、LiteRT 版本都备好了。
一句话:以前开源是给你一件成品,这次是把厨房一起搬给了你。对想研究「小模型为什么聪明」的人来说,这批材料比榜单名次值钱。
分数怎么读:先别看「第一」,看断层和口径
官方发布稿引用 AA(Artificial Analysis)榜单:Intelligence Index 23 分,全球 4B 以下开源基座第一,压过 Gemma 4 12B 和 Qwen3.5 9B(都是 22 分,参数量是它的 4.5 倍以上)。知乎·新智元
但同一天,社区里独立整理的帖子记录的是另一组数:AA 的 v4.2 口径下,这款模型只有 15 分。知乎·nano
GDPval-AA v2(以人类表现为 1000 分锚点的工作任务评测)上,发布稿口径是 891 分,社区帖当天记录是 831 分。知乎·新智元知乎·nano
这不是谁在造假——榜单版本和快照时点不同,同一模型的分数就是会漂。看开源模型发布,把「快照日期」当成分数的一部分,是这两年必须养成习惯的事。证据覆盖到这里,结论就只能说到这里:「登顶 4B 以下」成立,但「第一」会随版本变。

真正断层、不随口径漂移的,是下面这组形状:
Agentic Index(Agent 能力专项):20 分。第二名 Granite 4.2 8B 是 9 分,Qwen3.5 9B 是 7 分,参数量十倍于己的 gpt-oss-20b 只有 3 分;而同级 2B-3B 模型(LFM2.5、Granite 4.2 3B、Ministral 3 3B)普遍是 2 分——不是领先,是断层。知乎·Datawhale
每任务平均输出约 2 万 token(其中推理占大头),同表 Qwen3.5 9B 要 34k、Ling 3.0 Tiny 要 56k。知乎·新智元知乎·nano对端侧多步 Agent 来说,token 消耗就是延迟和电费,这个数字是真正影响成本的。
这组数据说的不是「它知识比 9B 多」,而是「它被专门训练过怎么做事」:选工具、填参数、搜资料、写代码。总榜小胜靠效率,Agent 榜大胜靠任务形状。

跑起来是什么体验:24 小时里的真实数据点
部署门槛:Q4_K_M 量化只有 1.56GB,Q8_0 约 2.68GB,FP16 权重约 5GB 出头。知乎·AI小Dllama.cpp、Ollama、LM Studio、vLLM、SGLang 全支持,微调走 LLaMA-Factory、ms-swift。知乎·nano 1.56GB 这个数字的传播力在于:它让人立刻联想到自己的旧笔记本,而不是「看完发布稿就划走」。
社区第一个 CPU 实测:一台 i5-1135G7、32GB 内存、无独显的 Windows 笔记本,llama.cpp 跑 Q8_0,prompt 处理约 43.8 token/s,生成约 7.29 token/s。知乎·AI小D单一样本,不能外推,但至少证明「普通电脑能跑起来」不是宣传语——只是这个速度是「可用」,不是「快」。
芯片生态:智源 FlagOS 发布当天完成 12 款 AI 芯片的 Day0 适配(平头哥、昇腾、海光、昆仑芯、沐曦、摩尔线程、苹果 M5、此芯 P1 等),在 M5 Pro 上用 CPU 模式跑 W4A8,Prefill 比 llama.cpp 同精度快约 19%,端到端吞吐提升约 12%。ARM 端侧口径给出 prefill >1000 token/s、decode 90 token/s。知乎·智源FlagOpen

场景实测:Datawhale 拿三个「数据不该离开设备」的任务测了本地链路:29 个混放文件(合同、简历、聊天记录、发票、菜谱)按内容分类,无一份分错,还主动做了敏感信息脱敏副本;50 份简历提取学校、映射城市、汇总分布;会议纪要总结后对照标注文件指出了两处偏差。三个场景全程数据不出设备。知乎·Datawhale

工具链:发布当天就有人把它接进 DeepSeekHarness 跑 Agent 任务。小模型接进真实工具链,今年第一次显得不勉强。
它不行在哪里:三道门,比跑分重要
分数口径门:官方那张 34 项平均分 53.9 的对比表里,只有标 † 的少数项来自 Artificial Analysis 独立评测,多数是发布方内部复现。而且表内并非全胜:SWE-bench Pro 只有 14.4(同表 Qwen3.5-4B 是 28.2),Terminal-Bench v2.1 只有 8.6(对照 25.8),CritPt 拿过 0 分。知乎·AI小D长时间操作终端、改大型代码库、连续错误纠正,仍然是它的短板。一次工具调用做对,和连续几十步不偏离目标之间,隔着完整的 Agent 系统工程。
模态门:纯文本模型。截图、语音、视频都得外接 OCR / ASR,每一层识别错误都会传导进后续工具动作。
现场数据门:你的设备上端到端速度、峰值内存、功耗、长尾稳定性,公开材料还没有交付。社区比较一致的说法是:任务以文本为主、工具权限受控、失败可以回滚——满足这三个条件,它值得进入实验名单;不够格接管生产主链路。知乎·nano
谁现在动手、谁再等等
在笔记本/迷你主机上跑本地模型、嫌 8B 太重的折腾党:值得换 Q4_K_M 实测一轮。但基准要用你自己的文档和工具 schema 重跑,别拿官方榜单当验收单。多步、离散、不需要长程终端的任务,大概率够用。
HR、法务、医疗这类敏感文本的处理者:这次发布第一次把「数据不出设备还能干完整活」从概念变成了一天能搭起来的 PoC。挑一个场景试,成本是一台已有电脑加一个周末。
想自己训端侧小模型的开发者:重点不是下载 2B 权重,而是那套整厂材料——中间 checkpoints、数据精炼管线、Meshy 框架。先复现数据侧,再决定要不要跟「密度定律」这条路。
所有人继续盯的信号:未来一到两周,第三方对量化版速度的实测、工具调用正确率、连续多步任务完成率的复现结果。这些齐了,它才从一次刷屏的发布,变成端侧 Agent 的可靠底座。
截至今年 8 月,MiniCPM 系列开源下载量突破 5000 万——社区用下载量投的票,往往比跑分诚实。知乎·新智元这次轮到的是「连怎么做都可以抄给你看」的一票。
跑分有水分(口径会漂),材料是实货(现在人人可查)。端侧 Agent 的故事,从这一天起才真正开始进入工程验证期。
你在自己的设备上跑过 2B 级模型吗?速度和翻车场景欢迎评论区报数。