9 月 26 日,量子位又把 GitHub 上那只"小蜂鸟"报道了一遍:Colibrì,一个纯 C 写的推理引擎,32k 星,宣称 25GB 内存就能跑 744B 的 GLM-5.2,甚至 32GB 内存加一块大硬盘,能"持有" 2.8 万亿参数的 Kimi K3。这已经是这波"SSD 当显存"话题三个月里第三轮刷屏——7 月建仓爆火、8 月英伟达方向跟进的消息流转、9 月底二次上热搜。量子位
微博评论区两种声音吵得很凶:一边是"0.05 token/s?散热风扇惨叫一天产出 4500-9000 个 token,行为艺术";另一边是"不是’在 API 后面租智能’,而是’持有’它"。两种说法都没错,但都没把账摆开。我把官方机器表、社区实测、开发者估算阶梯、还有各家中文拆解里散落的 15 个速度数字排到一起,发现一个反常识的结论:在这笔账里,显卡排在最后,你的 NVMe 带宽和内存容量才是分子分母。微博知乎
一、先把 15 个数字摆成一张阶梯
Colibrì 的做法一句话能说清:MoE 每 token 只激活约 40B 参数,其中真正"在动"的只有约 11GB(被路由到的那批专家,每个约 19MB,共 19456 个,int4 后整体约 370GB)。稠密部分(注意力、共享专家、嵌入,约 17B,int4 后 9.9GB)常驻内存,路由专家全部扔在 NVMe 上,算到哪层读哪层——作者叫它"权重的 JIT"。量子位
于是不管是官方 README、官方站点机器表,还是"小众软件"等社区的实测,速度全部落在这个框架里:
25GB RAM + 约 1GB/s 级 NVMe(最早开发机,12 核 CPU):冷缓存 0.05–0.1 token/s
Intel Ultra 7 + 24GB 内存:0.07;加 `–topp 0.7` 也只到 0.11
Mac mini M4 Pro 48GB:Metal 路径 0.30,纯 CPU 0.18
Ryzen 9950X + PCIe5 SSD:0.28
EPYC 7443 + 430GB 内存:1.00
RTX 5070 Ti 笔记本级机器:1.07
M5 Max 优化后:2.06(社区实测最快单项)
128GB 纯 CPU 桌面:1.8
官方估算阶梯:32GB + PCIe4 约 0.5–1;64GB + PCIe5 或双 NVMe RAID 约 2–4;128GB 以上加 24–32 核或 AVX-512 才可能到 5–15
堆到 6×RTX 5090、全部专家常驻高速层:5.8–6.8,TTFT 约 13 秒
对照组:Redis 之父 antirez 用 128GB 的 M5 Max + SSD 跑 DeepSeek V4.1 Flash,约 15 token/s;两台联网能到 25
把这张阶梯横着读,会发现问题:CPU 核数和 GPU 数量都不决定你在哪一档,决定档位的是"能缓存多少热专家(RAM 容量)× 冷专家读得快不快(NVMe 带宽)"。 同为十几 GB 内存的机器全部趴在 0.07–0.3;上了 430GB/128GB 内存的全部站上 1.8–2;到 6 张 5090 才摸到 5.8。中间跨的几乎全是存储层级,不是算力。知乎
二、一笔带宽账:为什么天花板写在硬盘上
用一阶估算就能对上:每个 token 平均要从盘里补多少没命中的专家,决定了速度上限。若每 token 冷缺约 11GB 量级、而 PCIe 4.0 SSD 有效读带宽约 7GB/s,理论上限就是约 0.6 token/s——正好落在官方"32GB + PCIe4:0.5–1"这一档。PCIe 5.0(长江存储企业级 PE501 已连续读 14200MB/s)或双盘并行,上限翻倍,对应"64GB + PCIe5 或双 NVMe RAID:2–4"这一档。剩下的提升全部来自命中率:RAM 越大,LRU 能留住的热专家越多,冷缺字节越小;它那个"路由器前瞻"线程赌相邻层路由有 71.6% 的可预测性,提前一层把专家读出来,把 I/O 藏进计算里。知乎微博量子位
这就是为什么说这笔账反常识:你熟悉的那套 GPU 并行计算直觉——加流、加卡、算子融合——在这里几乎不出力。解码瓶颈不发生在 SM 上,发生在你插 M.2 的那个槽上。Epic 创始人 Tim Sweeney 那句"当前真正瓶颈在 M.2 SSD 带宽",在这张阶梯里是被 15 个数字反复验证的。微博
三、这不只是民间玩法:两个月里三条线在靠同一个方向
7 月 1 日 Colibrì 建仓,8 月中旬"英伟达开源 cuFile API、让 GPU 直接指挥 SSD 绕过 CPU 搬运"的消息在中英文社区传开(B 站 310 赞、微博 342 赞的转发帖都在说这事,具体接口细节建议以官方仓库为准);同周长江存储"AI SSD"亮相,喊出 16GB 内存跑 120B;9 月,美光面向数据中心的 PCIe6.0 SSD 量产,读速 28GB/s。Counterpoint 的数据也在佐证转向:2026 年 Q2 企业级 SSD 已占 NAND 出货位元的 48%,AI 负载从训练走向推理,存储和显存的边界正在被官方和民间同时重画。哔哩哔哩微博微博
民间这边同样在卷工程细节:有玩家用 i5-12600KF + 32GB 内存 + 8GB 显存的 RTX 3060 Ti,靠 Colibrì 的三级存储(6.2GB 稠密基座常驻内存、53.6GB 冷专家流式读盘、热专家可选锁进 5GB 显存)跑起了 150B 级的 DeepSeek-V4 Flash REAP,还向局域网开了 OpenAI 兼容接口——8GB 显存完全不参与,留给日常小模型用。Colibrì 自己的版本节奏也说明这不是玩具:9 月 13 日 v1.11.0 一个版本合入 56 个外部 PR,GPU 显存计费、Metal 路径、内存预算这些真机问题"当天复现、当天修复"。知乎知乎
四、但先别下单:README 自己列着的坑
这项目最硬气也最诚实的一点,是把负结果写进 README 的"未验证假设"表:路由历史可能过拟合、O_DIRECT 依盘而定、MTP 推测解码在特定命中率下反而亏 32%——冷缓存时推测解码要额外加载草稿专家,越投机越慢,社区指南直接建议冷盘期 DRAFT=0。官方站点机器表和 README 正文对同一套硬件还给出过两组数字(6×5090 都是 5.8–6.8,但测量条件随版本浮动),所以别把任何一个数字当承诺。它的项目声明翻译过来就是:对速度不做任何承诺,对语义做硬性保证——内存不够只会变慢,绝不会偷偷砍你的精度或路由。知乎知乎
"现实吗"这个问题,比较公允的答案是:离线批处理、私有化、想"持有"一个前沿模型自己测量和改——现实;指望它替代 API 日常对话——不现实,1.8 token/s 意味着回一段话等好几分钟。而且有个自嘲式的第一门槛容易被忽略:“虽然有 25GB 内存,但是没有 370GB 硬盘”——GLM-5.2 的 int4 容器约 372GB,官方建议预留 500GB。局域网部署还有几个实操暗坑:17 个 4.66GB 分卷并发下载会在第 8 个挂死(原生 curl.exe + Range 断点续传、串行拉取才稳);服务默认防 DNS-Rebinding、拒绝非 Loopback 的 Host 头;C 引擎调试输出会塞满 stderr 管道导致子进程阻塞;强杀控制台后孤儿进程霸占 8008 端口。知乎知乎知乎
五、对号入座:三种人,三种花钱顺序
只跑 27B 级日常对话、嫌解码慢的:你在这套账里根本不入场。你的路线依然是"权重全进显存",升级对象还是显存和框架——llama.cpp 9 月 23 日刚发 0.5.0(一个月三连发版、182 个提交),官方口径 Mac 跑 MoE 快约 7%、5090 开 MTP 再快约 5%;但知乎上也有"使用 DFlash2 不要盲目升级 llama.cpp"的劝退帖,升版本前先确认你的草稿模型兼容。别为 SSD 当显存掏钱,你的答案在别的账本里。哔哩哔哩知乎
想持有前沿 MoE、接受"慢但全在我手里"的:升级顺序倒过来——先内存(128GB 起,这是命中率的全部来源),再硬盘(PCIe5 NVMe,最好两块做并行放置),最后才轮到算力(24 核以上或 AVX-512 机器,GPU 反而是可选件)。这套配置的合理预期是 2–4 token/s,能跑通、不能闲聊。知乎
手头 32GB 内存 + 1TB 盘的观望党:744B 对你目前是 0.05–0.5 的展示速度,先别动手。想试语义保证这条线是否成立,从 OLMoE(7GB 权重、8GB 内存门槛)或 35B-A3B 级别起步最省事,也最能直观感受 LRU 从冷盘烤到热盘的速度爬升。知乎
接下来值得盯的信号:Colibrì 的命中率工程还能挤多少(127 个未关闭 issue、383 个已关闭,迭代速度还在涨);PCIe6.0 消费级盘什么时候从数据中心下放到你那个 M.2 槽;以及英伟达 cuFile 这条线若坐实,会不会反过来把"分级权重"变成官方支持的第一类场景。这波热潮三个月换了三轮主角,但那条 0.05→15 token/s 的阶梯只说明了一件事:在 MoE 时代,“模型装在哪"已经取代"模型跑多快”,成了家用算力的第一问。 你抽屉里的显卡没贬值,只是这次轮不到它先出场。