colibri 爆火这一周:0.05 和 6.8 tok/s 都是真的,看懂速度档位再决定装不装
九月中旬,GitHub 热榜第一被一个纯 C 写的推理引擎拿下:JustVugg/colibri,9 月 14 日冲榜时 29,375 星、24 小时涨 960,Hacker News 上"25GB 内存的笔记本跑起 744B"的帖子冲到 453 个赞,到 9 月 16 日的拆解快照已经是 34,100 星、版本 v1.11.0。哔哩哔哩知乎哔哩哔哩
官方仓库里对它的定位只有一句话:Tiny engine, immense model——在你已有的消费级硬件上跑 744B 到 2.8T 参数的前沿 MoE 模型。GitHub

它戳中的是本地推理玩家攒了两年的一口闷气:开源模型一路 MoE 化,个人硬件越来越装不下。它要解决的也不是"算不动",而是"装不进"。
为什么 744B 能"不整套装进来"
传统 GGUF 路线要求权重整体进内存或显存,744B 稠密加载是 TB 级数字,家用机没有这么大的桌子。但 MoE 模型的账不是这么算的:744B 总参数的 GLM-5.2,每个 token 只激活约 400 亿参数,占总量的 5%。 colibri 做的事,就是把"每 token 只用 5%"变成真正的部署形态:不整套装进来,现取现用。知乎

显存、内存、硬盘,被当成同一张桌子
引擎把显存、内存、NVMe 看成同一套存储层级:注意力层、共享专家、嵌入层这些每个 token 都要用的稠密部分,int4 量化后 9.9GB 常驻内存;一万九千多个路由专家(75 层 MoE、每层 256 个)平均每个 19MB,全部躺在硬盘上,路由器选中谁才读谁。 B站拆解视频把这层结构的卖点说得更直白:跑在你自己家的电脑上,一张显卡都不用。官方 README 现在列出的九个模型家族里,除了 GLM-5.2/5.3、2.8T 的 Kimi K3,还接上了 Qwen3.8-Flash-Next 和 Qwen3.6-35B——正好搭上这波本地部署热潮。知乎GitHub

光靠"用到再读"会慢死在磁盘延迟上,colibri 的赌注是路由可以预测:相邻 MoE 层之间的路由路径有 71.6% 的可预测性,引擎提前一层异步预取,磁盘读取和矩阵计算并行跑,实测 71.6% 能猜中下一步用谁。哔哩哔哩
引擎还会把你每轮实际用到的专家记进 .coli_usage 文件、按热度钉在内存里,再叠一层系统页缓存;内存富裕的机器可以开双 SSD 镜像,两块盘各放一份模型读带宽翻倍,中途拔盘只降级不崩溃。 一句话:同一台机器、同一类任务,用得越久越快。知乎
速度档位表:把刷屏标题里省略的那页找回来
所有"744B 跑进家用电脑"的文章,几乎都省掉了官方 benchmark 里的档位差异:25GB 内存的开发机冷启动只有 0.05–0.1 tok/s,作者自己把这称为整个项目起点的"诚实地板"。GitHub
往上走,128GB 纯 CPU 约 1.8,6 张 5090 全驻留才到 5.8–6.8,首 token 还要等约 13 秒。 那个被反复转引的 1.8,前提是 128GB 内存的桌面机;"能跑"和"能用"之间,目前还隔着大概两个数量级的速度差距。 按这个速度,回答一段话要等好几分钟。GitHub知乎

作者也从不装快。项目的公开声明是对速度不做任何承诺、对语义做硬性保证:内存不够只会变慢,绝不偷偷改精度或路由语义。 从档位表反推,这是一场"带宽换资格"的交易:决定你站在 0.05 还是 6.8 那一档的第一变量,不是显卡,是内存容量。知乎
硬盘没被磨伤,先喊累的是带宽
硬盘进推理之后,社区问得最多的是"伤不伤 SSD"。第一个给出完整家用实测的答案很反直觉:引擎全程只读流式,对盘写入 0 字节,温升只有 ±2 度,唯一真实写入来自内存不够时的系统换页,7 分钟写了 3.8G。小红书
真正被消耗的是读带宽:每生成 1 个 token 要从盘读 58.9MB,跑出 1.37 token/秒就是持续 80MB/s 的满读,这还只是 35B 级别。小红书

同一个实验也给中小模型人群划了线:那台 i5-14600K + 32G 内存 + 5060Ti 16G 的机器上,35B 用 llama.cpp 全量进显卡跑出 88 token/秒,用 Colibri 纯 CPU 只有 0.10-1.55——这个级别根本没必要折腾,显存空着 14G 都没用,卡住的是内存。 长上下文之所以没炸内存,另一半功劳是 MLA 压缩 KV:每个 token 只占 576 个值,约是传统方案的 1/57。小红书知乎
入场券的真正价格:这轮涨价里的内存
把 colibri 当方案的人大多只算了显存,没人算 RAM——而它恰恰撞在存储周期的最贵处:2025 年 9 月以来 DDR5 内存条价格涨超 300%,华强北 16G DDR5 去年只要 450 元、最高被炒到 1800 元。 9 月 16 日的硬件日报口径更狠:CFM 报道 DDR5 次级颗粒现货价格已经涨到历史峰值,从去年 9 月累计涨幅超过 6 倍,德国 3DCenter 统计的存储均价是一年前的 5.44 倍。微博微博知乎
而 colibri 官方硬件表对 GLM-5.2/5.3 写的是:模型容器约 372GB、内存 16GB 起步 24GB 舒适、GPU 一栏 not needed——纯 CPU 就能起。 也就是说,决定体验的主要是 RAM 容量和 NVMe 余量,而这两样正在历史高价区。评测作者给的入门路径也是这个逻辑:程序本体几百 KB,先拿 7GB 的 OLMoE 起步验证整条链路。GitHub知乎
装不装,对号入座
分三类人。手里本来就有 64GB 以上内存加大容量 NVMe、又有离线或批量需求(夜间文献总结、敏感语料清洗、数据不出网):现在就能装,语义硬保证是它最值钱的承诺,慢就让它后台跑。只跑 7B-35B 的中小模型用户:这件事跟你无关,Ollama、LM Studio、llama.cpp 全量进显存仍然是第一选择;小模型到底该看什么,B站那期 11 个模型横评总结得直白——装不装得下、跑多快、工具调不调得通,这三件事流式引擎一件都不占优。 想拿它替代云端 API 日常对话的:等,两个数量级的速度差不是版本迭代能一周抹平的。哔哩哔哩
要继续盯的三个信号:项目 2026 年 7 月 1 日才创建、截至 9 月 15 日还有 113 个 open issues,单人维护的爆火引擎,工程成熟度要先打个问号; 同赛道已经在起量,搬运的海外实测里 177B 的 Qwen3.8-Flash-Next 靠把 N-gram 查找表卸载到 NVMe,在 24GB 显存加 32GB 内存的机器上跑出 22 tokens/s,"硬盘进推理"正在从孤例变成一条路线; 最后是内存行情:颗粒价见顶之后每跌一成,colibri 的适用人群就大一圈。知乎哔哩哔哩
最后说意义。评测作者那句话说得比所有热榜标题都准:不是"在 API 后面租智能",而是"持有"它——colibri 把前沿模型的所有权第一次放上家用硬件,只是这份所有权,按你的内存条数定价。知乎