9月22日到9月29日这一周,本地推理玩家的群里被两件事刷屏。一件是小米在9月22日发布并全面开源了MiMo-V2.6系列大模型。Pro版是1.02T总参数的稀疏MoE架构(激活42B),Flash总参数309B(激活15B),发布前一周团队还直播了RL训练。在ArtificialAnalysis开源权重智能指数上,MiMo-V2.6-Pro以46分登顶全球开源大模型第一、国产模型第一。另一件是9月26日起,开源推理引擎Colibrì在中文技术社区刷屏:不装高端显卡,用25GB内存跑通744B参数的GLM-5.2。项目自我介绍只有一句话:Tiny engine, immense model。引擎极小,模型极大。哔哩哔哩知乎知乎
这两件事的公约数不是"参数又大了",而是账本换了。744B的GLM-5.2按FP16放权重要1.5TB,就算int4量化后也还有372GB,“把权重塞进显存"的传统思路等于把前沿模型锁死在数据中心。但MoE的稀疏激活给了另一条路:744B总参数的模型,每步只激活约40B,常驻内存只要9.9GB,剩下按路由从硬盘流式读。Colibrì干脆把显存、内存、NVMe当成同一套存储层级来调度,稠密部分常驻,专家按需取用,作者把这个机制叫"a JIT, but for weights”:给权重做的即时编译。哔哩哔哩知乎
所以这周刷屏的不是一张新卡,而是一个问题:本地跑前沿模型的门票,是不是正从显存换成内存和硬盘?如果你平时用Ollama、llama.cpp跑跑27B、显卡停在8G到16G,眼下最该做的不是激动也不是剁手,而是把下面四组速度数字核清。

一、引擎只有两三个月大,但它把"内存墙"改写成了I/O调度问题
仓库2026年7月1日才建立,作者是意大利独立开发者Vincenzo Fornaro(GitHub账号JustVugg),主语言C,Apache-2.0开源许可,零依赖。星数曲线比很多产品生命周期还陡:9月14日GitHub API读数31,052星,9月15日已到33,335星、单日+2,233冲上Trending日榜第一,9月29日站上38,248星——两个多月走完的。知乎知乎GitHub
真正值得看懂的是它怎么"骗"过显存:
一次性连续读:每个专家约19MB(int4),被路由到时三组矩阵用一次pread连续读入,不搞碎片化随机IO。知乎
路由器前瞻:相邻层的专家路由有71.6%可以提前一层预测,当前层还在算,后台已经在读下一层要用的专家。
带宽可以攒:放两份模型副本走双SSD,实测解码再提速37.5%,相当于把两条独立带宽拧在一起用。知乎
KV状态压到57倍:MLA注意力把每token的KV状态从32,768个float压到576个,官方口径缩小57倍,而且这份压缩状态直接落盘(.coli_kv),重启后对话"热"恢复,不用重新prefill。

最反常识的一条声明其实是态度:对速度不做任何承诺,对语义做硬性保证,内存不够只会变慢,绝不偷偷降精度或改路由。README里还专门列了一张"未验证假设"表,连MTP推测解码在特定命中率下反而亏32%这种负结果都写了进去,等社区做A/B。在一个为了跑分什么都敢砍的环境里,这份自曝短处是它口碑的另一半来源。知乎
模型覆盖也决定这事跟你的关系:官方支持9个模型家族,覆盖面两个月里从1个扩到9个。其中DeepSeek V4两个Flash版甚至无需转换、直接读官方分片,对已经在用DeepSeek的人是零成本入口;而2.8T的Kimi K3需要约1.6TB硬盘与32GB内存起步,"笔记本跑通"对它并不成立。知乎知乎
二、四组数字:「跑通」和「能用」之间隔着两个数量级
热度刷屏的同时,各家口径的速度数据其实非常乱。我把官方README、官方站点社区机器表、第三方媒体实测、作者本人估算阶梯四套数字拼在一起:
口径 | 环境 | 速度 |
|---|---|---|
官方README | 25GB内存开发机(冷缓存) | 0.05–0.1 tok/s |
官方README | 128GB纯CPU桌面机 | 约1.8 tok/s |
官方README | 单张5070 Ti笔记本级机器 | 1.07 tok/s |
官方README | 6×RTX 5090全驻留 | 5.8–6.8 tok/s,TTFT约13秒 |
第三方媒体7月实测 | Ultra 7+24GB内存 | 0.07 tok/s(–topp 0.7后0.11) |
第三方媒体7月实测 | Mac mini M4 Pro 48GB(Metal) | 0.30 tok/s(纯CPU 0.18) |
第三方媒体7月实测 | Ryzen 9950X+PCIe5 SSD | 0.28 tok/s |
第三方媒体7月实测 | EPYC 7443+430GB内存 | 1.00 tok/s |
第三方媒体7月实测 | M5 Max(优化后) | 2.06 tok/s |
作者估算阶梯 | 32GB+PCIe4 | 0.5–1 tok/s |
作者估算阶梯 | 64GB+PCIe5或双NVMe RAID | 2–4 tok/s |
作者估算阶梯 | 128GB以上+24–32核或AVX-512 | 5–15 tok/s(交互档) |
三个读数方法:
同一台机器出现两组官方数字。官方站点社区机器表和README正文在相同硬件上并不一致,同一硬件出现两组数字说明官方数字随测量条件和版本浮动,不宜当稳定指标——这周的任何截图都不宜直接转发定论。知乎
冷缓存和全驻留差两个数量级。项目作者在25GB内存、约1GB/s磁盘环境的测试中,速度只有约0.05~0.1 token/s,生成一句话可能需要几分钟。"能跑"和"能用"之间,目前还隔着大概两个数量级的速度差距。微博知乎
交互速度的门槛不在显卡,在CPU核数、AVX-512和内存容量。按作者自己的估算阶梯:25GB加1GB/s NVMe只有0.05–0.1,32GB加PCIe 4.0是0.5–1,64GB加PCIe 5.0或双NVMe RAID是2–4,128GB以上加24–32核或AVX-512才可能到5–15 tok/s的交互速度——这个配置的价钱在很多场景下已经追平甚至超过买卡预算。

三、新的入场门票账:内存、NVMe带宽、盘容量,一样都不能少
老的账本里,显存决定你能跑什么。新的账本里是另外三栏:
盘容量:GLM-5.2的int4容器约372GB,官方建议预留500GB可用空间。小众软件作者那句自嘲能代表大多数人的第一反应——“虽然有 25GB 内存,但是没有 370GB 硬盘”。门槛真的从显卡转移到硬盘了。知乎
内存容量:int4量化后最低16GB、推荐24GB内存即可运行,GPU并非必需;但要上交互档得按阶梯奔着128GB去。知乎
NVMe带宽:PCIe代际直接写在速度阶梯里;双盘两份副本+37.5%是少数被反复提到的免费午餐。
按预算分四档,对号入座:
档位 | 配置 | 能干什么 |
|---|---|---|
试水档 | 8GB内存+7GB硬盘 | 跑OLMoE(7B),当晚装当晚跑,验证整条流程 |
批处理档 | 24–32GB内存+普通NVMe | GLM-5.2出字0.1–1 tok/s,适合离线总结、语料蒸馏、让它慢慢干活 |
半可用档 | 64–128GB内存+双PCIe5盘 | 2–4 tok/s,看着它慢慢吐字,别指望对话体验 |
全驻留档 | 128GB+多核/AVX-512,或6×5090 | 5–15 tok/s或5.8–6.8 tok/s(TTFT仍约13秒),才勉强"像聊天" |
对照MiMo-V2.6:Pro总参数1.02T、激活42B,和GLM-5.2基本同一套物理逻辑。按int4口径估算,Pro全量容器约500GB出头——硬盘账比GLM-5.2再厚一层,内存账却不用重建。但注意,它目前还不在Colibrì的9家族支持列表里。
四、评论区替你先踩过的三个坑
坑一:推测解码可能越优化越慢。 慢不丢人,方向错的慢才亏:官方在"未验证假设"表里自己标了MTP推测解码在特定命中率下反而亏32%的问题,冷缓存阶段它要额外加载专家,社区指南建议直接DRAFT=0,或等缓存热起来再开。知乎
坑二:SSD寿命是数据空白。 把盘当显存用,意味着长期高强度顺序读+写放大,而长期跑盘的寿命影响尚无公开数据。"这种方案从来不考虑消费级CPU和SSD在大IO和长时间满载情况下的寿命问题吗"是被顶起来的评论区提问,甚至有人翻出14900 CPU降解的老账。这些是社区担忧而非实测结论,但官方没承诺、没人负责之前,风险得算你自己的。知乎小红书
坑三:场景选错等于白折腾。 本地部署大模型的第一需求是安全,不是省钱——隐私、离线、对权重的完全持有,才是这条路线的正确打开方式。日常聊天,云API依然快得多,评论区"纯CPU硬算 干不了活"的冷水泼得不算冤。这引擎适合的是批处理、离线任务、实验和"持有本身",不是替代ChatGPT。小红书
五、现在做什么,蹲什么
今晚可做:从OLMoE(约7GB权重、8GB内存)起步试跑,把容器下载、路由加载、热恢复整条流程走通,再决定要不要为它开硬盘预算。知乎
值得蹲的信号:MiMo-V2.6进不进支持列表——9月13日v1.11.0一口气把家族补到9个,这个加族速度不会太慢;官方口径何时统一(两组数字的修正);SSD寿命的实测数据;MTP那张"未验证假设"表的A/B结果。
别做的事:别为了它专门升级显卡——全驻留才是速度上限,硬盘流式是"持有"的下限方案;也别认真考虑机械硬盘——任何一张实测表里,HDD的带宽都不够它塞牙缝。

作者Fornaro在README里写过一句话,被这轮刷屏反复引用:不是"在API后面租智能",而是"持有"它。这一周,"持有"前沿模型的门票价第一次从数据中心集群降到了内存加大硬盘——四组数字同时也把话说清了:持有已经成立,可用还在排队,货币是带宽和场景。手里是8G到16G显存、日常跑27B的玩家,前沿模型没有变快,只是第一次变得够得着。值不值得上车,取决于你打算让它干哪种活:批处理和隐私,可以;替掉云聊天,再等。知乎