25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

源自336位全网作者

09-26 21:56

开头:先交代立场

先交代我是谁、在替谁看这件事:混了几年开源本地部署的折腾党,GLM、DeepSeek、Kimi、Qwen的权重哪个没下过?家里常年留着128G内存条和几块大NVMe。这阵子GitHub上最热的不是哪个新模型,是一个叫 Colibrì 的推理框架——25GB内存的笔记本硬跑744B GLM-5.2,32GB内存挑战2.8T Kimi K3——甚至都不用GPU。GitHub现在最火热的大模型开源小蜂鸟Colibrì,纯C实现、零引擎依赖的分层推理框架,已经狂揽32k Star。知乎

看到这种标题,第一反应当然是"我那台旧笔记本也能跑GLM了?"第二反应才是关键:它跑得动,但它跑得快吗?这两个问题之间隔着一条大多数人不会去核实的缝。我把社区这几天的原始数据、作者基准和云端API摆到一张桌上,缝里的东西其实很清楚。

一、Colibrì干的事:把"装进内存"这个前提砸了

传统本地部署的逻辑是"先把模型塞进显存/内存,再开始算"。744B的GLM-5.2,int4量化后权重约372GB,普通电脑根本装不下——所以Colibrì把逻辑倒过来:需要什么,再加载什么。哔哩哔哩

这能成立,得感谢MoE架构。GLM-5.2总参数744B,但每生成一个token实际只激活大约40B;它有19456个路由专家,Router先挑出这一轮真正要用的一小撮,剩下绝大多数专家当前根本用不上,凭什么一直占着昂贵的高速内存?知乎

于是模型被拆成两半:

  • 每次都要用的Dense部分(Attention、Embedding、共享专家,约17B参数):int4后只占约9.9GB,直接常驻RAM;

  • 19456个路由专家(int4后约370GB):全部扔进NVMe SSD,Router点完名,没在高速层命中的才临时从硬盘捞。

25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

光这样还是每生成一个token跑一趟硬盘,冷缓存时慢到没法看。作者JustVugg后面做的全是"少去SSD捞人"的工程:LRU缓存让刚用过的专家留在RAM;持续统计每个专家的使用次数,常客往更快的层搬;利用相邻层路由的明显相关性提前猜下一层要谁——项目测试给出的可预测率是71.6%,当前层还在算,后台已经在读下一层的专家了;机器里有两块SSD,还能各放一份模型副本分摊读带宽。作者管这叫针对模型权重的JIT,社区的说法更直白:AI内存多层化。

有一条设计原则值得单独拎出来,因为它是这类方案最容易挨骂的地方:专家放在哪一层只决定速度,不改变模型本身。Router的选择、权重精度都不动,不会因为你的机器内存少就偷偷少算几个专家、换一套路由。换句话说,它给大模型做的是"分层调度",不是"缩水特供"。

二、三条速度线:这才是标题党的分水岭

项目最早那台开发机——12核CPU+25GB RAM——跑GLM-5.2冷缓存时的真实速度是0.05~0.1 token/s。跑是能跑。“标题里的能跑"和"你愿不愿意等它跑完”,中间差着后面两条线:

配置

专家放哪

解码速度(作者实测口径)

12核CPU + 25GB RAM(开发机)

主要靠现捞SSD

0.05~0.1 tok/s(冷缓存)

128GB RAM 纯CPU桌面机

更多专家常驻RAM

约1.8 tok/s

6× RTX 5090

全部专家常驻高速层

5.8~6.8 tok/s

1.8 token/s是什么概念:一条两千token的回复,你要盯着屏幕等将近二十分钟。作为对照,云端这边GLM-5.3-FlashX不是新底座模型,而是此前开源的 GLM-5.3-Flash 的「高速推理档」:同一套能力,把生成速度推到峰值约 200tokens/s——按官方"快5倍"的口径反推,普通Flash就落在40 tok/s上下。知乎

25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

所以"SSD当显存"这句话的真实含义是:它把"能不能装上"的门槛砍没了,但没动"生成速度"的物理定律。容量问题解决得极其漂亮,速度问题只缓解、不解决。这不是Colibrì不行,是硬盘和高速内存之间本来就隔着数量级的带宽。

三、按体例分个尺寸:你现在到底能跑哪个

把GLM系开源权重和Colibrì的要求对一遍,不同家底对应不同玩法(量子位报道与魔搭、社区快照交叉核对):

  • GLM-5.2(总参744B):int4权重约372GB,最低16GB、推荐24GB左右RAM就能跑通,GPU非必需;项目已提供预转换好的int4模型,也可以从FP8自己转;

  • GLM-5.3-Flash(总参320B、激活18B、1M上下文):8月底已以MIT协议开源,ModelScope有现成权重,官方支持四个推理框架;这是整个系里体例最小、离日常最近的一个,int4粗算约160GB量级(我自己按参数量折算的估计,官方未给口径)。知乎

  • GLM-5.3满血版:FP8主仓约756GB,属于"跑给你看也要存得起"的档位;

  • 顺带一提,Colibrì现在覆盖9个模型家族,从GLM-5.2/5.3、DeepSeek V4 Flash、Qwen一路到975B的Inkling和2.8T的Kimi K3——后者要1.6TB硬盘,但RAM只要32GB起步。

云端侧的价格底子也早就砍到底了:这一档模型的API定价 $0.15/$0.50,与本地自建之间的落差,就是整篇文章的账本底色。知乎

25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

装它本身的门槛倒是低得反常识:程序几百KB,Linux/macOS/Windows预编译版本解压即用,想从源码来也只是gcc或clang加OpenMP;模型放好,一条`coli chat`直接进对话。大头从来不是软件,是那几百GB的权重放在哪。

四、三种人,三种结论

1. 折腾党/观察者:值得装,但你买的是"围观权"不是产能。几百KB程序+一块大硬盘,换来一台不需要GPU的生产级MoE推理调度器在你桌上真实运转,看Router怎么点名、缓存在你机器上一夜夜变热——这本身就是这两年本地推理圈最有意思的现场。装。

2. 数据敏感的人:这是"本地>云端"唯一那个例外。上个月ZCode那次风波:9月17日晚,一位技术博主在清理MacBook时,发现智谱AI旗下的AI编程工具ZCode在本地悄悄占用了超过700MB空间。随后官方致歉、产品开源,智谱透露已邀请中国信息通信研究院和绿盟科技两家权威第三方机构完成了首轮核查,并上线"数据不留存"机制。知乎上流传很广的反对本地部署高赞回答,浏览量过了十万:除非数据涉密,否则千万别搞什么本地部署,人机电维这四样加起来,比买API贵多了。这答案自己给出了例外条款,而站在那条"除非"里的人,第一次有了一个不靠GPU的入口:本地权重+本地引擎,全链路不出户。但注意,Colibrì只解决"模型本地"这一半,你的Agent工具链、你的插件、你接的每一条上传通路,才是ZCode风波里真正出事的那一半。知乎36氪知乎

25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

3. 想拿它替掉云端coding助手的:现阶段不值得。1.8 tok/s对40/200 tok/s,这不是差一点,是差一个游戏。云端这边还有AtomCode这种终端AI编程工具,装上登录就能免费使用glm5.3-flash,不用买API、不用搭中转、不用配Key;华为云那边给GLM-5.3-Flash每天送1000万Token,付费套餐档位也在下面垫着。同一个模型,白嫖和付费入口都比自建便宜,硬件钱花在这儿属于两头亏。真要说加内存加卡能追到什么——从1.8到5.8 tok/s那一档的代价,够你按API价把云端Flash跑到天荒地老,这笔账社区已经替大家算过一轮了。知乎

25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

五、上手前先把坑念一遍

  • 冷缓存的头一个小时别下结论。0.05 tok/s是缓存没热时的数,这种框架越跑越顺,让它过夜再测;

  • int4是当前默认路径,对质量有洁癖的,先想清楚你连FP8主仓往哪放都没有,再谈精度之争;

  • NVMe是隐形成本。这种流式加载的读放大不低(这是我的判断,官方没给寿命数据),要玩就往大容量、耐用好的盘上准备,能组两块就别省;

  • 版本迭代极快。9月14日社区还写着29k star,9月16日快照已经是v1.11.0、34,100 star,量子位9月26日转稿用的又是"32k"量级——两个口径并存、趋势一致,请以仓库当前状态为准,跟完release再动手;

  • 速度线是作者的机子、作者的任务。不同任务的路由热分布不一样,你的活点不点得中高热专家,决定你实际拿到的是1.8还是0.8。

六、接下来我盯三个信号

一是这类"权重分层调度"会不会被官方推理框架收编——智谱已经支持四个框架,vLLM侧mHC这类架构优化也在沉淀共享kernel,分层加载要是进了官方路线,今天Colibrì的"野路子"就是明天的标配;二是GLM-5.3-Flash这条320B/MIT线,GLM5.3Flash是总参数320B、激活参数18B、上下文窗口1M的多模态MoE模型,权重小一整个量级,本地侧最先"日用化"的大概率是它,不是744B的5.2。三是B站本地flash党晒的方向,本地模型进入flash时代了!笔记本单卡跑Qwen3.8-27B本地模型576tok/s——小模型拼速度、大模型拼分层,本地推理正在劈成两条路线,你的128G内存和2T空盘该押哪边,这两条线谁先交叉谁就改写结论。知乎哔哩哔哩

25G内存跑744B的GLM:SSD当显存用,但先看清这三条速度线再决定要不要加内存

最后把问题留给评论区,这也是我最好奇的部分:如果你有一台128G内存+2TB SSD的机器,你会为了"GLM跑在自己家里"去装Colibrì,还是继续靠免费入口白嫖云端?装上跑过的大佬,把你的冷缓存时间和热缓存时间贴出来,比任何评测都有说服力。

(本文速度数据出自Colibrì项目作者实测与量子位、魔搭、B站社区解读转述,非本人逐机复测;云端速度为官方口径,已在文中标注。截至2026年9月26日。)

内容由AI生成

精选参考来源

1. 笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

2. 每日热评|用纯C在消费级硬件上跑2.8T参数模型:Colibrì的“多级推理层次”到底解决什么?

3. GLM-5.3 系列开源:Flash 已上线|GLM-5.3 倒计时不到 24 小时

4. 智谱推出 GLM-5.3-FlashX:最高 200 tokens/s,轻量模型竞争升维

5. GLM-5.3-FlashX:10万张国产卡,把速度推到 200 tokens/s

6. 开源大模型本地部署和官网的有什么区别?

7. 融了650亿的智谱,栽在偷传代码上

8. 被指偷传代码企业发函追责,智谱:ZCode将开源并接受第三方审计

9. GLM-5.3-Flash、DeepSeek V4 系列模型——每天 1000 万 Token 免费送

10. 7440亿参数塞进家用电脑,最低25G内存就能跑通——colibri开源了

11. 744B大模型只常驻9.9GB?colibri把硬盘也拉进推理了

12. 原子基金会重磅力作,免费畅用glm5.3-flash

13. GLM-5.3-Flash MIT开源、Qwen3.8-Max登顶CodeArena、Kimi K3港股IPO

14. 本地模型进入flash时代了!笔记本单卡跑Qwen3.8-27B本地模型576tok/s!

15. GLM5.3Flash/Gemini3.7Flash/Sonnet5/Luna5.6哪家强?

16. GLM-5.3-Flash架构与算子分析报告

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章