跑前沿大模型不一定要显卡:SSD 当显存这波被量出了 15 个数字,这笔账里 GPU 反而排最后

源自176位全网作者

17:53

9 月 26 日,量子位又把 GitHub 上那只"小蜂鸟"报道了一遍:Colibrì,一个纯 C 写的推理引擎,32k 星,宣称 25GB 内存就能跑 744B 的 GLM-5.2,甚至 32GB 内存加一块大硬盘,能"持有" 2.8 万亿参数的 Kimi K3。这已经是这波"SSD 当显存"话题三个月里第三轮刷屏——7 月建仓爆火、8 月英伟达方向跟进的消息流转、9 月底二次上热搜。量子位

微博评论区两种声音吵得很凶:一边是"0.05 token/s?散热风扇惨叫一天产出 4500-9000 个 token,行为艺术";另一边是"不是’在 API 后面租智能’,而是’持有’它"。两种说法都没错,但都没把账摆开。我把官方机器表、社区实测、开发者估算阶梯、还有各家中文拆解里散落的 15 个速度数字排到一起,发现一个反常识的结论:在这笔账里,显卡排在最后,你的 NVMe 带宽和内存容量才是分子分母。微博知乎

一、先把 15 个数字摆成一张阶梯

Colibrì 的做法一句话能说清:MoE 每 token 只激活约 40B 参数,其中真正"在动"的只有约 11GB(被路由到的那批专家,每个约 19MB,共 19456 个,int4 后整体约 370GB)。稠密部分(注意力、共享专家、嵌入,约 17B,int4 后 9.9GB)常驻内存,路由专家全部扔在 NVMe 上,算到哪层读哪层——作者叫它"权重的 JIT"。量子位

于是不管是官方 README、官方站点机器表,还是"小众软件"等社区的实测,速度全部落在这个框架里:

  • 25GB RAM + 约 1GB/s 级 NVMe(最早开发机,12 核 CPU):冷缓存 0.05–0.1 token/s

  • Intel Ultra 7 + 24GB 内存:0.07;加 `–topp 0.7` 也只到 0.11

  • Mac mini M4 Pro 48GB:Metal 路径 0.30,纯 CPU 0.18

  • Ryzen 9950X + PCIe5 SSD:0.28

  • EPYC 7443 + 430GB 内存:1.00

  • RTX 5070 Ti 笔记本级机器:1.07

  • M5 Max 优化后:2.06(社区实测最快单项)

  • 128GB 纯 CPU 桌面:1.8

  • 官方估算阶梯:32GB + PCIe4 约 0.5–1;64GB + PCIe5 或双 NVMe RAID 约 2–4;128GB 以上加 24–32 核或 AVX-512 才可能到 5–15

  • 堆到 6×RTX 5090、全部专家常驻高速层:5.8–6.8,TTFT 约 13 秒

  • 对照组:Redis 之父 antirez 用 128GB 的 M5 Max + SSD 跑 DeepSeek V4.1 Flash,约 15 token/s;两台联网能到 25

把这张阶梯横着读,会发现问题:CPU 核数和 GPU 数量都不决定你在哪一档,决定档位的是"能缓存多少热专家(RAM 容量)× 冷专家读得快不快(NVMe 带宽)"。 同为十几 GB 内存的机器全部趴在 0.07–0.3;上了 430GB/128GB 内存的全部站上 1.8–2;到 6 张 5090 才摸到 5.8。中间跨的几乎全是存储层级,不是算力。知乎

二、一笔带宽账:为什么天花板写在硬盘上

用一阶估算就能对上:每个 token 平均要从盘里补多少没命中的专家,决定了速度上限。若每 token 冷缺约 11GB 量级、而 PCIe 4.0 SSD 有效读带宽约 7GB/s,理论上限就是约 0.6 token/s——正好落在官方"32GB + PCIe4:0.5–1"这一档。PCIe 5.0(长江存储企业级 PE501 已连续读 14200MB/s)或双盘并行,上限翻倍,对应"64GB + PCIe5 或双 NVMe RAID:2–4"这一档。剩下的提升全部来自命中率:RAM 越大,LRU 能留住的热专家越多,冷缺字节越小;它那个"路由器前瞻"线程赌相邻层路由有 71.6% 的可预测性,提前一层把专家读出来,把 I/O 藏进计算里。知乎微博量子位

这就是为什么说这笔账反常识:你熟悉的那套 GPU 并行计算直觉——加流、加卡、算子融合——在这里几乎不出力。解码瓶颈不发生在 SM 上,发生在你插 M.2 的那个槽上。Epic 创始人 Tim Sweeney 那句"当前真正瓶颈在 M.2 SSD 带宽",在这张阶梯里是被 15 个数字反复验证的。微博

三、这不只是民间玩法:两个月里三条线在靠同一个方向

7 月 1 日 Colibrì 建仓,8 月中旬"英伟达开源 cuFile API、让 GPU 直接指挥 SSD 绕过 CPU 搬运"的消息在中英文社区传开(B 站 310 赞、微博 342 赞的转发帖都在说这事,具体接口细节建议以官方仓库为准);同周长江存储"AI SSD"亮相,喊出 16GB 内存跑 120B;9 月,美光面向数据中心的 PCIe6.0 SSD 量产,读速 28GB/s。Counterpoint 的数据也在佐证转向:2026 年 Q2 企业级 SSD 已占 NAND 出货位元的 48%,AI 负载从训练走向推理,存储和显存的边界正在被官方和民间同时重画。哔哩哔哩微博微博

民间这边同样在卷工程细节:有玩家用 i5-12600KF + 32GB 内存 + 8GB 显存的 RTX 3060 Ti,靠 Colibrì 的三级存储(6.2GB 稠密基座常驻内存、53.6GB 冷专家流式读盘、热专家可选锁进 5GB 显存)跑起了 150B 级的 DeepSeek-V4 Flash REAP,还向局域网开了 OpenAI 兼容接口——8GB 显存完全不参与,留给日常小模型用。Colibrì 自己的版本节奏也说明这不是玩具:9 月 13 日 v1.11.0 一个版本合入 56 个外部 PR,GPU 显存计费、Metal 路径、内存预算这些真机问题"当天复现、当天修复"。知乎知乎

四、但先别下单:README 自己列着的坑

这项目最硬气也最诚实的一点,是把负结果写进 README 的"未验证假设"表:路由历史可能过拟合、O_DIRECT 依盘而定、MTP 推测解码在特定命中率下反而亏 32%——冷缓存时推测解码要额外加载草稿专家,越投机越慢,社区指南直接建议冷盘期 DRAFT=0。官方站点机器表和 README 正文对同一套硬件还给出过两组数字(6×5090 都是 5.8–6.8,但测量条件随版本浮动),所以别把任何一个数字当承诺。它的项目声明翻译过来就是:对速度不做任何承诺,对语义做硬性保证——内存不够只会变慢,绝不会偷偷砍你的精度或路由。知乎知乎

"现实吗"这个问题,比较公允的答案是:离线批处理、私有化、想"持有"一个前沿模型自己测量和改——现实;指望它替代 API 日常对话——不现实,1.8 token/s 意味着回一段话等好几分钟。而且有个自嘲式的第一门槛容易被忽略:“虽然有 25GB 内存,但是没有 370GB 硬盘”——GLM-5.2 的 int4 容器约 372GB,官方建议预留 500GB。局域网部署还有几个实操暗坑:17 个 4.66GB 分卷并发下载会在第 8 个挂死(原生 curl.exe + Range 断点续传、串行拉取才稳);服务默认防 DNS-Rebinding、拒绝非 Loopback 的 Host 头;C 引擎调试输出会塞满 stderr 管道导致子进程阻塞;强杀控制台后孤儿进程霸占 8008 端口。知乎知乎知乎

五、对号入座:三种人,三种花钱顺序

只跑 27B 级日常对话、嫌解码慢的:你在这套账里根本不入场。你的路线依然是"权重全进显存",升级对象还是显存和框架——llama.cpp 9 月 23 日刚发 0.5.0(一个月三连发版、182 个提交),官方口径 Mac 跑 MoE 快约 7%、5090 开 MTP 再快约 5%;但知乎上也有"使用 DFlash2 不要盲目升级 llama.cpp"的劝退帖,升版本前先确认你的草稿模型兼容。别为 SSD 当显存掏钱,你的答案在别的账本里。哔哩哔哩知乎

想持有前沿 MoE、接受"慢但全在我手里"的:升级顺序倒过来——先内存(128GB 起,这是命中率的全部来源),再硬盘(PCIe5 NVMe,最好两块做并行放置),最后才轮到算力(24 核以上或 AVX-512 机器,GPU 反而是可选件)。这套配置的合理预期是 2–4 token/s,能跑通、不能闲聊。知乎

手头 32GB 内存 + 1TB 盘的观望党:744B 对你目前是 0.05–0.5 的展示速度,先别动手。想试语义保证这条线是否成立,从 OLMoE(7GB 权重、8GB 内存门槛)或 35B-A3B 级别起步最省事,也最能直观感受 LRU 从冷盘烤到热盘的速度爬升。知乎

接下来值得盯的信号:Colibrì 的命中率工程还能挤多少(127 个未关闭 issue、383 个已关闭,迭代速度还在涨);PCIe6.0 消费级盘什么时候从数据中心下放到你那个 M.2 槽;以及英伟达 cuFile 这条线若坐实,会不会反过来把"分级权重"变成官方支持的第一类场景。这波热潮三个月换了三轮主角,但那条 0.05→15 token/s 的阶梯只说明了一件事:在 MoE 时代,“模型装在哪"已经取代"模型跑多快”,成了家用算力的第一问。 你抽屉里的显卡没贬值,只是这次轮不到它先出场。

内容由AI生成

精选参考来源

1. 笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

2. colibri 的纯 C 引擎:25GB 内存跑 744B 模型的代价

3. colibri 是什么水平?用纯 C 在消费级硬件上跑万亿参数 MoE,现实吗?

4. 别再加钱上 3090 了!一张 8G 破显卡,我把 1500 亿大模型跑起来了

5. 使用DFlash2不要盲目升级llama.cpp

6. llama.cpp 0.5.0 发布:Mac 跑 MoE 快 7%,5090 开 MTP 再快 5%

7. 黄仁勋开源cuFile API 英伟达把硬盘当显存用

8. 让你能在普通笔记本上跑GLM5.2模型的项目!地址:github.com/JustVugg/colibricolibrì是一个用纯C编写的大模型推理引擎,目标是在约25GB内存的普通电脑上运行GLM-5.2744BMoE模型。它不要求GPU,运行时也不依赖Python、PyTorch或BLAS;主要依靠CPU、内存和NVMeSSD。INT4量化。当...全文

9. Redis数据库的创始人antirez用一台128GB内存的苹果M5Max电脑,配合固态硬盘(SSD),成功把最新的DeepSeekv4.1Flash大模型跑了起来,大约每秒能生成15token。如果用两台电脑联网一起跑,能到25token左右。新玩法核心是SSDStreaming(固态硬盘流式加载)DeepSeek模型用的是MoE架构(Mixtureof...全文

10. 【买得起开源买不起显卡:Kimi-K3本地运行的真实账单】业内估算本地部署Kimi-K3需要10张GB300显卡,硬件成本近百万美元,每月电费上万。Epic创始人TimSweeney指出,当前的真正瓶颈在于M.2SSD的带宽限制,若未来GPU能集成数TB的并行闪存,消费级显卡也能跑顶级大模型。开源不等于人人可用,大模型开源...全文

11. 长江存储AISSD首次亮相!16GB内存也能跑120B大模型

12. 【长江存储发布61.44TBPCIe5.0SSD,AI服务器狂喜】长江存储推出PE50161.44TBPCIe5.0SSD,连续读取速度高达14200MB/s,2U机箱可实现近3PB容量。专为AI服务器设计,国产高端固态又迈出一大步。疾速14200MB/s!长江存储PE50161.44TB图赏

13. 美光炸出大招!AI最强硬盘——PCIe6.0SSD量产,产业链要躺赚!2月14日,全球存储巨头美光官宣:全球首批面向数据中心的PCIe6.0固态硬盘正式量产!读取速度高达28GB/s,写入14GB/s——性能直接翻倍,碾压现有PCIe5.0SSD。这不是技术秀,更是AI军备竞赛的弹药升级!大模型训练动辄PB级数据,传统S...全文

14. 【长江存储出货量份额全球第三闪存二季度同比增长5倍】长江存储市占率稳步突破。8月12日,市场调研机构CounterpointResearch统计数据显示,2026年第二季度,随着AI工作负载逐步从训练向推理转移,企业级SSD(固态硬盘)占NAND(闪存)总位元(单位存储容量)出货量48%,导致消...全文

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章