「不用显卡,25G 内存跑 744B」——这两个月,本地部署的群里隔三差五就有人甩这句话。甩完通常跟着一句:所以是不是不用买显卡了?
先给结论:门票确实从显卡挪走了,但没消失,它挪到了硬盘和你的时间上。 硬盘眼下正站在价格高位,双11 又在眼前。这三件事叠在一起,是本地部署玩家今年最容易花错钱的一次窗口。
colibri 干了什么
先讲清楚它,别被"纯C""2MB小工具"这些标签唬住。
colibri(蜂鸟)是 JustVugg 开源的一个 MoE 推理引擎,Apache-2.0,纯 C、零依赖,一个月里从三万星涨到三点七万星。小红书
它做的事说穿了一句话:把显存、内存、硬盘当成同一条"内存层级"来调度,而不是非要把整个模型塞进显存。哔哩哔哩
以它演示的 GLM-5.2(744B,int4)为例,权重被拆成两块摆:
注意力加词表那部分约 17B,常驻内存,int4 只占 9.9GB;
剩下 19,456 个专家权重、约 370GB,全躺在硬盘上,用到哪个读哪个;被路由得多的,会被钉到更快的那层。
所以官方演示里那个数字才成立:加载 744B int4,32 秒 ready,常驻内存 9.9GB。 剩下的部分不是不存在,是放在硬盘上等着被读。重点是——744B 这个体量,终于不看显卡脸色了。小红书

门槛表和速度表,得一起看
刷屏的是门槛表,没人贴的是速度表。两张表放一起,这事才说得通。知乎
按官方门槛表:
目标模型 | 需要腾出的盘位 | 内存 | 显卡 |
|---|---|---|---|
744B(如 GLM-5.2) | 372GB | 16GB 起步,24GB 舒服 | 不需要 |
35B MoE | 20GB | 24GB | 不需要 |
OLMoE(7B 那档) | 7GB | 8GB | 不需要 |
再看速度。同一批 int4 权重,25GB 内存的开发机上,冷启动 0.05–0.1 token/s——出一句话等二十秒左右。这不是黑子编的,是官方自己贴在主页上的,还标了一句"这是这个项目的起点,也是诚实的基线"。换 6 张显卡,同一套引擎能到 5.8–6.8 token/s。知乎哔哩哔哩

有人装机时还撞到过更直白的提示:启动时引擎先报"检测到你只有 4 个物理核、8 个逻辑核,SMT 会让出字速度减半"。它关心的是慢在哪,压根不问你显存多大。知乎
评论区基本就围着这两张表打转。高赞那条是"速度慢成一坨,高僧预测 90s/token",跟着的是"单位是 token/day 是吧"。还有人算了笔账:“开一天不到 1 万 token,问个你好就有几百 token,一道数学题几千 token,不如买官网 API,还便宜。”哔哩哔哩
另一条只有零赞的评论,反而更接近本质:“跑起来一回事,能不能用一回事。”
colibri 官方给自己的定位也留了口子:这是研究平台,不承诺速度,但对语义和精度有硬保证——不偷偷降精度、不改路由。它证明的是可行性,不是速度魔法。小红书
你这台机器今天能干什么
直接对号入座,三档。(数字来自社区真机,不是我跑的。)
今天就想干活:4B 到 9B。 有人拿一台 2018 年办公本当主力——i5-8250U、24G 内存、2G 入门独显——跑 Qwen3.5-4B,装进内存占 3.52G,出字 6.25 token/s,中文大概一秒一个字。慢,但能干的活很具体:整理表格、改文案、按固定格式抽字段。这档 8G 内存起步,9B 那档 16G 起。想今天就干活,就停在这一档,别碰更大的,慢会劝退你。知乎
想要能力、也还愿意等:35B-A3B 这类 MoE。 20G 盘、24G 内存就能起,是"大模型体验"和"可忍受速度"之间比较现实的折中。社区里也有人建议嫌 744B 慢的人先换这一档。
想跑个大的:744B 起步,一直到 2.8T。 colibri 现成可用的模型族有九个,从 7B 的 OLMoE 到 2.8T 的 Kimi K3,GLM-5.2/5.3、DeepSeek V4 Flash、Qwen3.8-Flash-Next 都在列,部分还带视觉。权重要自备、每个族单独下。这一档,先看你硬盘还剩多少 G,不是先看显卡。小红书

评论区吵的其实是两种需求
那条"不如买 API"底下,有条回复值得单独拎出来:
我用了一天几十亿 token 可没了,这么用下来我一个月工资都快没了,自己本地部署一天跑个几亿还是没啥问题的。
把两句话放一起看,会发现这不是谁对谁错,是两种完全不同的用法。哔哩哔哩
交互式问答:你坐在屏幕前等回复。0.05 token/s 就是不可用,这时候 API 完胜——买 token 的钱,比你等掉的时间便宜。
高吞吐批处理:跑标注、跑清洗、跑批量抽字段,任务扔那儿过夜,明天早上收结果。这时候慢无所谓,重要的是 token 不要钱。一天几亿 token,API 账单确实能把人看傻。
colibri 这类引擎真正的甜点区在第二种。拿它当日常聊天的替代品,几乎必然失望;拿它当一台不出网、按小时吞吐的离线批处理机,它才对得上号。这也顺带回答了"本地部署图什么"——常常不是省钱,是你需要的那批 token 在云端买不起,或者不敢送出去。
双11 这张清单,按"今天能不能用"排
硬盘价格得放进来一起看。社区里管着一千多台机器的人 9 月中给过一个数:1TB 固态从 400 涨到了 1000。到 10 月初,"三星 4TB 三年涨六倍"还在被讨论。另一头,涨价潮里冒出过"监控盘当电脑盘卖"的老坑——跑模型要的是随机读写和持续负载,不是监控盘那种顺序写入的设计。知乎小红书
而 colibri 门槛表上那个 372GB 盘位,正好卡在这个价位上。所以双11 前这张清单,建议按"今天能不能用"倒着排,不是按"能跑多大模型"正着排:
一、先盘点,别先下单。 报三件事:内存多大、空闲盘位多少 G、CPU 几个物理核。多数人会发现自己连 4B 档都没跑满,根本不用为 744B 花钱。
二、真要留盘位,按你确定会跑的那档买,别按 372G 买。 35B MoE 只要 20G。为了一个你大概率只加载一次、然后被速度劝退的 744B,多掏几百上千的盘钱,是这个窗口里最典型的花错方式。买的时候避开两类坑:杂牌黑片回收颗粒,和监控盘冒充电脑盘。宁可容量小一档,颗粒来路要正。
三、诉求是交互式问答的,这笔预算请留着买 API。 这不是劝退本地部署,是把钱花在你真正会用的地方。

谁现在动手,谁再等等
该动手的:手里有旧机器、诉求是离线批处理或不出网的数据处理、愿意花一晚上看它慢慢出结果的人。OLMoE 7B 那档 8G 内存就能起,零成本就能验证这套东西适不适合你——GitHubDaily 那条视频给的上手建议也是这个:先从 7GB 的小版本试起,不需要显卡。哔哩哔哩
该再等等的:想拿它替代日常 AI 对话的人,和准备为 744B 专门买大容量盘的人。前者会被速度劝退,后者会在硬盘高位上多付一笔"可行性税"。
该看一眼但别上头的:已经在跑 27B/35B 的玩家。colibri 对你的意义不是换个更大的,而是它验证了一件事——权重可以不常驻,I/O 可以是引擎的一部分。这个思路后面大概率会被别的引擎抄走,你的显卡和内存不会白买。
说到底,colibri 改变的不是"旧电脑能不能跑 744B",而是把这道题从"你买得起什么卡"换成了"你等得起多久、有多少东西非放在本地不可"。双11 快到了,先对号入座,再决定要不要掏钱。