9月开始,本地部署圈的风向变了一件很具体的事:“16GB内存跑百来B大模型”从标题党变成了一批带原始日志的实测帖。
时间线其实拉得很密:7月21日,面向Apple Silicon的流式推理引擎Vates开源,把41GB的80B MoE压到8GB峰值内存就能跑。8月19日第二版跟进,把线推到10GB内存跑80B MoE过可用线。9月3日,第一篇逐数据可复现的slotstream实测出现:M4 Max机器给进程设16GB内存上限跑Qwen3.8-Flash-Next,每个数字都附原始记录。知乎知乎知乎
9月4日,有人晒出16GB显存Windows台式机日常使用176B模型、18.8 tok/s的完整记录。9月8、9两天,两条翻译视频把风向标立到了海外——4张二手V100靠NVFP4量化加SSD流式给180B模型跑出60 TPS,177B模型塞进12GB显卡的架构解析也出了。知乎哔哩哔哩
背景板是装机党今年最烦的一件事:记者走访华强北赛格市场,16GB DDR5内存从去年的四五百元涨至近1500元,致态1TB固态硬盘从300多元涨至1100元。内存买不起,模型越更越大,两边一挤,挤出来的就是这条新赛道。微博
为什么突然“跑得动”了:模型自己变薄了
这轮和2023年那些“CPU硬扛”的老黄历不是一回事,底气来自模型架构。以Qwen3.8-Flash-Next为例,8月26日开源,总参数约176B(主模型125B加一个51B的n-gram记忆模块),4-bit量化后权重103.8GB——48GB的机器按老规矩根本装不下。但主模型是MoE:48层、每层512个专家,每个token只路由其中10个,真正参与的参数约6B;那张32GB的n-gram表访问同样极稀疏。“权重多大就要占多大内存”这条dense模型时代留下的铁律,从根基上失效了。于是玩法从“怎么把模型塞进内存”变成“内存只留工作集,剩下让SSD当仓库,算到谁读谁”。知乎
四条路线,四张脸:一张表看懂谁在卖什么药
把9月这几份实测和几个开源项目的README并排放,“SSD流式”其实是四种完全不同的东西:
路线 | 代表 | 思路 | 实测速度 | 适用 |
|---|---|---|---|---|
全量流式 | Vates、slotstream、fastllm | 主干常驻,专家全留SSD按需读 | slotstream在M4 Max限16GB:5.1 tok/s;README:48GB机器热解码约12,16GB档估计约4,丐版实机仅1.41;fastllm用8G显存+8G内存+读速7GB/s的盘跑229B“意外流畅” | 多任务机器共存、低内存新机 |
显存专家池+CPU兜底 | llama.cpp改法/KTransformers思路(9月4日贴主实测) | 未命中专家走CPU,命中的进显存池 | 4080S 16GB+96GB内存:18.8 tok/s日常、262K上下文5.8 | 有96GB内存的16GB卡党 |
裁剪折中 | REAP+oMLX | 专家512裁到288、39GB常驻,仅n-gram表下SSD | 26-29 tok/s | 内存够一半、要聊天体验的 |
层级流式 | AirLLM(2.8万Star) | 不量化,一层一层从硬盘换进显存 | 单批推理449秒;社区极端案例300秒一个字 | 挂一晚出结果的批量任务 |
最极端的层级流式AirLLM,不量化不剪枝跑原始权重,同一段推理不压缩449秒,开4bit能砍到157秒。同样是“跑得动”,1.41 tok/s和18.8 tok/s差了13倍。所以这个秋天看本地部署帖,先问一句“你说的跑是哪个跑”,比问“能不能跑”重要得多。知乎
三个反常识:数字拆开看,骂错人没有用
第一,卡你的经常不是硬盘。9月3日那篇slotstream实测里有个很硬核的细节:生成长文时物理磁盘读取接近0(专家命中缓存和系统页缓存),而实测每个token约200ms,远高于约5ms的理论带宽下限——瓶颈在计算侧,不是内存带宽也不是SSD。作者明说:换更高内存带宽的机器不会明显变快。而另一头,README里那台丐版Mac mini M2实机量测只有1.41 tok/s——同一套引擎,两种病,开两种药:旗舰机器等内核优化,入门机器才有资格怪盘。想靠一块“AI SSD”宣传盘救本地部署的,可以先把这一页读完再下单。知乎哔哩哔哩
第二,命中率提高,反而更慢。9月4日的Windows实测作者做过动态调度实验:预判下一批要用的专家、提前搬进显存,命中率从31%提到了62%,听起来很美——吞吐却掉到了11-12.8 tok/s,因为每个token多出一条“读路由、做决策、搬权重、更新映射”的控制链,把CUDA Graph全破坏了。他还补了一刀:同一份8GiB池配置,CUDA Graph开和关是18.753对13.567。缓存优化看端到端,单看命中率是新手陷阱。知乎
第三,上下文越长,SSD流式越帮不上忙。专家池的增益在16K上下文时高23.9%,拉到262K只剩约4.6%——长文本的账主要记在KV cache头上,和专家没关系。顺带是Windows党最阴的坑:q8-q4 KV配6GiB池“理论上放得下”,短跑5.5 tok/s一切正常,换一次250 token的长跑直接崩到0.71 tok/s、p95延迟7.5秒——越过物理显存后WDDM开始共享内存分页,性能够你亲眼看着蒸发。作者的硬规则值得抄:分配器余量至少1GiB,池子按上下文阶梯下调,128K用8GiB、192K用6GiB、262K用4GiB。知乎
省下的内存钱,要分三期还
这笔账得算给“要不要为本地部署升级96G/192G内存”的犹豫党:
第一期还速度。常驻39GB换26-29 tok/s,限16GB换5.1 tok/s,丐版换1.4 tok/s——速度每掉一档,省下的内存钱就折一部分。知乎
第二期还硬盘。流式方案要求约110GB磁盘,AirLLM第一次跑要先下载130GB再拆一层占一份;而SSD本身也是这轮涨价的受益者,1TB从300多涨到1100。“免费”仓库的租金同样在涨。
第三期还折腾。llama.cpp路线要自己打补丁、维护基准脚本,slotstream原版甚至不支持OpenAI工具调用字段,得改源码。这轮帖子作者们开源了每个数字的原始日志(包括标“实测/原型/外推”分类的仓库),这是比README更该看的部分——小红书那条“128G Mac硬跑104G大模型、oMLX提升有限”的争议帖底下23条评论吵的,恰恰就是宣传数字和到手数字的差。小红书
谁该动手,谁再等等
现在就值得玩:手里已经躺着96GB内存+16GB级显卡的,显存专家池路线是唯一“日常聊天级”速度的(18.8 tok/s);批量离线任务(文档总结、数据打标)挂AirLLM跑一晚,原始权重不量化,看到的就是模型真实水平;数据不能出网的刚需场景,流式方案给了以前不可能的选项。
再等等:16GB内存的入门Mac用户——README对16GB档只敢标“估计值”,现在入场就是替内核优化做慈善;把这事当聊天助手需求的,27B常驻或者老实调API,5 tok/s以下的手感骗不了人;以及准备为“AI SSD”概念盘单独掏腰包的,先分清自己机器到底是算力病还是存储病。
继续盯的信号:grouped-GEMM内核进度(slotstream作者和9月4日贴主都把宝押在这)、那位Windows作者的prefill冲1000 tok/s计划(16K prompt、物理ubatch 6144下已实测720.8 tok/s,比同条件对照高27.3%,数值一致性cosine 0.9999928)、以及下一个带巨型记忆表的开源模型会不会干脆把官方卸载路径打开——V4.1那类带Engram记忆表的模型,参考实现还不支持卸载,社区的SSD方案会不会逼出官方支持,是下个月最值得关注的一条线。知乎
一句话收个尾:这轮变化的本质不是“硬盘变快了”,而是模型自己变薄了——权重总量在膨胀、单token激活量在缩水,旧的“多大内存跑多大模型”换算表正在过期。下次装机的钱,未必再是内存先拿大头:看你的盘、你的引擎、你的内核接不接得住流式。你手上那台机器属于哪个阵营,评论区报个数:内存上限、tok/s、翻没翻WDDM的车。