这两天刷B站和知乎,你大概率会撞见同一只小鸟。
10月10日早上,B站出现了一条标题很唬人的视频:《硬盘就是你的机房》。主角是GitHub项目Colibri(意大利语"蜂鸟"),星标已经刷到37.7k,纯C语言、零依赖,号称让7440亿到2.8万亿参数的前沿大模型"跑在你手头的硬件上"——官方支持列表里,GPU那一栏清一色写着not needed。哔哩哔哩
评论区的画风却是另一派。一条24赞的高评只有六个字:“硬盘它招了吗?“另一个近5000播放的视频底下更热闹,有人嘲讽"速度慢成一坨,高僧预测90s/token”(22赞),有人接龙"输出速度 1m(inute)/t是吧”(20赞)、“单位是 token/day 是吧”(4赞)。哔哩哔哩
同一个项目,一边被叫作"主权推理"的里程碑,一边被当成电费行为艺术。这个7月1日建仓、一周就冲上1.6万星、三个多月涨到37.7k星的小引擎,值得认真对一次账——不是站队"本地部署值不值",而是把速度、硬盘、电费三笔账摊开,看清这只蜂鸟到底该落进谁的电脑。哔哩哔哩知乎
一、这只蜂鸟干了什么:不把模型装进内存,而是"现取现用"
先说出身,相当反常识:Colibri是一个人在自己那台12核CPU、25GB内存的笔记本上写出来的。引擎本体是单文件纯C代码,预编译包只有2MB上下,不用装依赖、不用编译,Windows也有现成的coli.cmd。仓库签名档一句话就能概括:Tiny engine, immense model——引擎极小,模型极大。哔哩哔哩知乎

它针对的问题很具体:今年的前沿开源大模型几乎全上了MoE(混合专家)架构,参数总量狂飙,GLM-5.2是7440亿,Kimi K3干到了2.8万亿。传统玩法(llama.cpp那一套GGUF)要求模型文件整体装进显存或内存,这个体量普通人根本没地方塞。知乎
但MoE有个反直觉的特性:参数总量巨大,每个token却只唤醒一小部分——GLM-5.2每步只点亮约400亿参数。Colibri的做法被作者称为"权重的JIT"(a JIT, but for weights):就像编译器从不编译整个程序,它也只用哪个专家、读哪个专家,其余权重躺在硬盘里按需流式加载。哔哩哔哩

具体是一套三层流水线:显存放"热"专家、内存放"温"的、硬盘放"冷"的,配上学习型热存储和一层预取(官方数据:预取命中率71.6%),同一份权重"绝不读第二遍";KV状态用MLA压缩了57倍。目前支持列表覆盖九个模型家族:小到入门的OLMoE(7GB磁盘、8GB内存就能跑),中间有GLM-5.2/5.3、DeepSeek V4两代Flash、Qwen两代、Inkling 975B,大到Kimi K3 2.8T(1.6TB磁盘、32GB内存)。哔哩哔哩哔哩哔哩
还有一个细节比参数更能说明项目态度。官方文档原话是"no SLA on speed, and a hard guarantee on semantics"——对速度不做任何承诺,对语义做硬保证:内存不够只会变慢,绝不偷偷改模型精度或路由语义,每个token都对着参考实现逐一校验;文档里甚至不避讳"slow but correct"(慢,但对)这四个字,连投机解码的失败实验数据都如实写了进去。在"为了跑分什么都敢砍"的环境里,这种坦白反而稀缺。哔哩哔哩知乎
二、第一笔账:速度——"能跑"和"能用"之间隔着两个数量级
把官方给出的速度谱系摆上桌(GLM-5.2 744B级实测口径,模型越小越快):
档位 | 硬件配置 | 速度 | 输出1000个token要等多久 |
|---|---|---|---|
冷启动 | 25GB内存开发机,无显卡 | 0.05–0.1 tok/s | 2.8–5.6小时 |
入门单卡 | 单张RTX 5070 Ti | 约1.07 tok/s | 约15分钟 |
大内存纯CPU | 128GB内存,暖态 | 1.8 tok/s | 约9分钟 |
全卡常驻 | 6×RTX 5090 | 5.8–6.8 tok/s | 2.5–3分钟 |
知乎上一篇深度拆解文章给出的结论很直接:技术上完全成立,体验上还差得远,"能跑"和"能用"之间,目前还隔着大概两个数量级的速度差距。参照物就是云端旗舰API的出字速度。知乎
所以评论区的嘲讽其实没错:拿冷启动档去日常聊天,你敲完"你好"确实可以先去睡一觉。评论区真有人认真地问过:问个问题睡一觉起来后,能不能拿到答案。哔哩哔哩
答案是:能。而且这恰恰是它正确的打开方式,第三笔账细说。
但速度账有个"可是":这张表不是死刑判决,是地图。同一个引擎,硬件预算决定你站在哪一段——被厂商抛弃的RX 580老卡可以走Vulkan被收留;双NVMe固态实测提速37.5%;还有本地集群模式让几台机器分摊读取。它不承诺快,但把"花多少钱、快到哪一档"的路径明明白白摆出来了。评论区那条"终于轮到硬盘派上用场了,这是个好的开始,大家快来卷硬盘吧",玩笑归玩笑,指的确实是这个趋势。哔哩哔哩哔哩哔哩

三、第二笔账:硬盘与电费——门票在哪,持续成本在哪
硬件账先算门票。Colibri的入场券不是显存,是磁盘和内存:
最省事档:OLMoE,7GB磁盘+8GB内存,今天的办公本基本都能直接跑;
中档:744B级的模型文件要几百GB磁盘(GLM-5.2在UP主手里约372GB),内存25GB起步,其中常驻只要9.9GB。哔哩哔哩
天花板档:Kimi K3 2.8T,官方标注1.6TB磁盘+32GB内存。哔哩哔哩
注意这个门票的结构:它不要你买5090,而是让你把本来就该配的大容量固态和大内存"兼职"跑模型。一块2TB NVMe固态今天的行价,离一张5090还差着一个量级。

顺便回应那条最高赞的"硬盘它招了吗":楼下先有人担心"固态的读写是有次数限制的",马上被纠正——“只读不写不影响”。权重流式加载是纯读操作,不碰SSD的写入寿命,这一笔账可以放下。真正要算的是电费。哔哩哔哩
电费账是评论区吵得最凶的地方。有人算过:"电费不要钱啊?开一天不到 1 万 token。问个你好,就有几百 token。一道数学题就有几千 token 了。 不如买官网 api,还便宜。"这笔账对冷启动档完全成立:0.1 tok/s跑满24小时,也就8600多个token,一台百瓦级主机一天烧掉两三度电,产出不到一万字,确实打不过API按量计费。哔哩哔哩
但同一个评论区还有另一条真实用例:"我用了一天几十亿token可没了,这么用下来,我一个月工资都快没了,自己本地部署一天跑个几亿还是没啥问题的。“对这种拿Agent做批处理的重度用户,账是反过来的:本地方案的边际成本只有电费,token量越大,单价越便宜。知乎上"本地部署还是买token"的高赞回答也是同一个判断标准——偶尔高峰、日常很少,买token更划算,因为"机器闲置才是本地最大的隐形成本”;日常强度高、或者数据不能出本机,本地才值得谈。哔哩哔哩知乎
所以电费账的结论是:Colibri省的不是电费,而是"前沿模型不限量使用的免门票资格"。这张资格对你值不值钱,取决于你的token消耗强度和隐私需求,不取决于情怀。
四、第三笔账:用途——聊天不划算,但这三件事划算
把前两笔账合起来,用途账就清楚了。
不划算的:日常对话、即时问答、代码补全。这些场景下,速度谱系里的每一档都打不过云端API;哪怕纯本地方案,单张24GB卡跑27B级稠密模型(Q4量化约17-19GB,llama.cpp直接能跑)的聊天体验也高一个量级——B站那期"125B对决27B"的结论摆在那:小模型先交卷,大模型还在预热。哔哩哔哩知乎

划算的,三类:
第一,离线批处理,“睡前任务”。几百份文档要摘要、一个老代码库要分析、一批数据要清洗打标——128GB内存的暖态1.8 tok/s,一晚上能磨出五万多个token,睡前把活派给硬盘,早上收结果。前面那个"睡一觉能不能拿到答案"的问题,在批处理场景下的答案是明确的:能,而且不要钱。哔哩哔哩
第二,隐私硬需求,数据不能出本机。客户合同、未发布代码、病历、内网资料——这些场景里云端API根本不在选项里,Colibri的"慢"换来的是数据主权。这也是"主权推理"这个说法真正的分量所在:不是情怀,是没有替代品。知乎
第三,研究与好奇,持有前沿模型本身。知乎那篇拆解说得好:对个人来说,这是前沿模型第一次变成"一个你可以自己持有、自己测量、自己改的东西,而不只是按月付费调用的一个接口"。对一个2MB的引擎做逐token校验、观察专家路由怎么在三层存储之间流动,本身就是研究MoE的教具。知乎
五、到底装不装?按你的机器对号入座
无显卡、内存16GB以下:可以装,从OLMoE的7GB版本起步,成本为零,感受一下"权重JIT"的调度;但别指望生产力,这是博物馆门票,不是通勤车。
32GB+内存、有大容量固态:值得认真试GLM-5.2级的睡前批处理。先用小任务测出你机器的真实tok/s,再决定要不要把它设成常驻工具;加第二块NVMe之前,先确认主板通道不打架。
手里有一张24GB显卡:聊天场景别用它跑744B,老老实实本地27B,体验高一个量级;Colibri留给显卡装不下的那些模型。
重度API用户:先算你上个月的token账单。如果真到了"一个月工资"的量级,本地路线(无论是Colibri还是传统显卡方案)才值得认真对账;反之,按量付费依然是最优解。
最后留几个观察信号给想持续跟进的人:仓库9月中旬还保持着提交节奏,版本已经从v1.11.0走到v1.12.1,open issues过百,社区热度是真的,摊子铺得也快。技术路线上已经出现moe-l2这类走另一条路的替代品,可以对照着看。接下来最值得盯的两个数字,是预取命中率(现在71.6%)和纯CPU暖态速度(现在1.8 tok/s)——哪天这两条曲线再抬一个量级,"硬盘就是你的机房"才算从口号变成日常。哔哩哔哩知乎
几克重的蜂鸟能悬停一整天、访一千朵花。Colibri现在干的就是这件事:用25GB内存和一块硬盘的口粮,喂一个7440亿参数的巨人。它还没准备好替代任何人的ChatGPT,但它确实把"跑前沿大模型"的门槛,从数据中心级预算拉到了一台大内存工作站加一块大硬盘。历史上这类门槛迁移一旦发生一次,后面的故事,就不是谁能预测的了。知乎