内存涨了四倍,"SSD当内存"的买卖来了:65倍、456毫秒、1.41 tok/s都是真的,掏钱前先算这三本账

源自670位全网作者

02:55

上周你的时间线大概率被两类帖子夹击过。一类叫slotstream的开源项目:“16GB内存的Mac跑125B大模型”,把Qwen3.8-Flash-Next的专家权重从固态硬盘流进内存,3.8GB主干常驻,给多少内存用多少。 另一类来自硬件厂商:“128GB内存也跑不动的Qwen3-235B,加一块AI SSD就能跑”——群联aiDAPTIV方案,实测作者把这套思路说成"以存代算"。哔哩哔哩知乎

夹在中间的,是你想躲都躲不开的价格:32GB DDR5内存条,去年800块、今年三千多,翻了四倍。 有话题记录DDR5一年涨近五倍,还有渠道出现"一天两变、提货被拒、商家劝退用户"的怪象。知乎知乎知乎

三年前无人问津的老固态硬盘,同样被炒到五倍价。 而开源模型的个头还在膨胀:552B的DeepSeek V4.1-Flash开源登顶热榜,125B的Qwen3.8-Flash-Next 4-bit量化后仍要105GB——模型涨得比你的内存快。知乎哔哩哔哩哔哩哔哩

于是"给大模型加一层硬盘"突然从极客邪道变成了显学。但这一堆帖子吵的根本不是同一件事。把营销话术、开源README和评论区骂战摆在一起看,里面其实是三本独立的账——谁混着卖,谁就想让你为不存在的收益掏钱。

内存涨了四倍,

第一本账:容量账——这是唯一真金白银省下来的一本

先说结论:让SSD参与推理,真正解决的只有"装不装得下"。

Genima的实测里,Qwen3-235B-A22B的Q4_K_M量化权重142GB,一台128GB内存的AMD 395装不下,普通SSD直接启动失败,没有AI SSD就得两台机器接力;Intel 358H迷你主机党同理,122B-A10B权重77.6GB、64GB内存也带不动。 换上AI SSD、用唯一支持的Herdsman(牧马人)引擎打开aiDAPTIV加速,同一台机器就能启动了。官方产品线口径一致:Qwen-122B在普通SSD环境启动失败、AI SSD环境成功启动;极摩客T2S则把"首字响应从18.2秒缩短至456ms"写进了宣传。知乎哔哩哔哩哔哩哔哩

内存涨了四倍,

这就是为什么"内存贵上天"突然成了这门生意的东风:群联、江波龙联手英特尔、AMD、英伟达,热数据留内存、冷专家进硬盘。 以前你的瓶颈是"要不要加内存条、加第二台机器",现在多了一个选项——用便宜一个数量级的SSD容量顶上去。注意,容量账是真的,但它只回答"能不能开机",不回答"快不快"。哔哩哔哩

内存涨了四倍,

第二本账:加载账——营销数字几乎全住在这本账里

“完成同一任务的耗时出现65倍差异”,是Genima实测里最抓眼球的数字。 但群联官方视频的评论区有人翻完了benchmark页:"2秒"是预缓存KV缓存后的热TTFT(64K输入下981毫秒),"70秒"是普通SSD侧完全不复用的冷重算。 另有一条高赞评论只有八个字的杀伤力:不就是命中了缓存吗?知乎哔哩哔哩

翻译成人话:加载账、冷启动账、切换模型等待账,全在这本账里。它对你有意义吗?有——如果你天天在多个模型间切换,加载从两分钟变两秒是实打实的爽。但它是"开机快",不是"干活快"。厂商把这本账的数字放进标题,让你以为decode也快了65倍,这就是混账的卖法。顺带一提,Flowy客服在评论区承认:目前小范围对外销售,所以还没上链接。哔哩哔哩

第三本账:decode账——没人敢报价的一本

这才是跑大模型的人真正每天在用的速度。有评论直接把官方口径戳破:prefill 96 tps、decode 16 tps,“这能干啥?玩吗”。 还有人补了一句:AI不需要太大的容量,需要巨大的带宽。物理上,"显存>内存>SSD"的带宽梯度骗不了人——每秒多生成一个token,就要多付一笔从盘里读数据的钱,热缓存罩得住的token越快,罩不住的越接近流式播放幻灯片。哔哩哔哩

最诚实的是被当成"救星"安利的slotstream自己的README:8GB内存的Mac连"能不能装下"都不成立,16GB档给的是1–6 tok/s的估计区间,基础款Mac mini M2(16GB、内存目标10.2GB)的实机记录只有1.41 tok/s;它同时写着:安装的内存大小不单独决定性能档位。GitHub

官方最近一次提速公告同样克制:0.2.16版加入SSD预读,开发机从11.79提到13.47 tok/s;而按它的估算口径,接近32K token的提示词在M5 Pro上光预填充就要约三分钟——"能开机"和"能干活"之间,还隔着一整本账。GitHub

折腾党这边也有反向证明:Redis作者antirez七月就开源了从零用C写的DwarfStar推理引擎,让DeepSeek V4这类模型跑在普通MacBook上,把SSD当作模型的"家"。 B站搬运的另一个实验更离谱:四张Tesla V100配SGLang引擎、NVFP4量化加SSD n-gram流式传输,声称在原生260k上下文下跑出60+ tokens/秒——视频原名直译就叫"我的GPU犯罪现场",折腾属性写在标题里,别当量产方案看。哔哩哔哩哔哩哔哩

为什么只有MoE吃得到这波红利

把三本账拆开之后还差一个前提:这套分层只对MoE成立。235B-A22B每个token只激活22B参数(约9%),35B-A3B只激活3B(约8.6%),硬盘只需要偶尔补货冷专家;稠密模型每个token都要过全部权重,层式流加载只能让它"能开机"——小红书那篇讲AirLLM的帖子标题问得直接:4GB显卡真能跑70B?小红书

内存涨了四倍,

存储之家那条"AISSD为何突然爆火"的视频(7月发布,259条评论)下面,圈内早就把底裤扒了:不在显存那速度真的慢,MoE天生不如同规模的稠密模型,写代码还得用稠密模型,虽然上下文可以拉到128、256,但速度呢,是一点不提啊。 这条和官方话术的差距,就是认知差本身。哔哩哔哩

寿命问题同样被问爆。评论区有人晒出实机数据:因为经常跑AI又做虚拟内存,一块2T硬盘通电2424小时、读取152TB之后,寿命良好还有百分之95。 原理上其实不冤:权重是只读的,读不损耗闪存颗粒,真正吃寿命的是把KV缓存往盘上写的场景——所以"普通SSD行不行"的答案很微妙:评论区老哥实测普通盘加虚拟内存部署MoE、上下文别拉太高也能凑合,代价是"太耗硬盘"。 顺带一提,那层传说中的"第三梯队"其实存在过:评论区一半人在替死掉的傲腾哭坟,说英特尔的技术已经打包卖给了海力士——中间的存储层级出现过、又死了,这次能不能活,取决于内存价格还要贵多久。哔哩哔哩哔哩哔哩

四种人四种走法

把这四段合成决策,按你手里的机器对号入座:

内存涨了四倍,

16-48GB内存的Apple Silicon党:这是slotstream的精确受众。免费,今晚就能试,但门槛白纸黑字:需要Apple Silicon、macOS 14以上,外加约110GB空闲硬盘。 而且目前只支持Qwen3.8-Flash-Next这一个模型,老款PCIe 3.0的Mac mini大概率在1 tok/s附近陪你过冬。适合当"花小钱体验105GB文件流式加载"的玩具,不适合当主力。GitHub

395/358H迷你主机、想跑100B+ MoE的装机党:容量账是真省——省的是第二台机器或者翻倍内存条(按现在价,32G一条三千多)。但AI SSD本体"小范围对外销售、还没上链接",唯一支持的引擎只有Herdsman一个。别急着加价从黄牛手里盘,等量产链接和第三方复测。手头紧的可以先用免费路线(虚拟内存+MoE+压低上下文)验证需求真伪,反正等等党的立场早已写在评论区:“慢点又不是不能用。”

16GB显存N卡党:这场架基本没你事。你缺的容量,35B-A3B这一档的MoE量化版直接就能塞下,不必为"125B"三个字动心——为营销焦虑升级硬盘,是这门生意最想要的转化。

V100/矿卡捡垃圾党:4张V100那个60 t/s是"声称",NVFP4+SGLang+n-gram流式这一套的组合成本、噪音、电费和翻车率都远超跑分帖给人的想象。当折腾项目满分,当生产力工具谨慎。

别下单之前,盯这五个信号

  1. slotstream支持的模型是否从1个变多个、GitHub star数是否突破千级(截至发稿293颗星)——项目活跃度的最低指标;

  2. AI SSD是否上架主流电商零售链接(现在"没链接"本身就是答案);

  3. 有没有第三方把"热TTFT vs 冷重算"的口径分开复测——65倍缩水成几倍,等一个敢报decode数字的独立评测;

  4. 模型社区的本地量化适配更新节奏(9月12日的AI晚报已经把"DeepSeek社区量化适配"排进日报)——模型端每卷出一版更小激活的MoE,硬盘党的性价比就前进一步。哔哩哔哩

  5. 国产颗粒扩产落地——从宣布建线到产能释放中间隔着一年半到两年,这是"内存等等党"的终点线,也是"SSD替代"这门生意的终点线:内存价格一旦掉头,这条中间层的需求会肉眼可见地萎缩。知乎

最后把"以存代算"四个字的正确打开方式钉死:SSD省的是你买内存的钱,省不了你等token的时间;加载账和decode账永远分开设预算。真正该焦虑的不是1.41还是60 tok/s,而是这个赛道三个月前还不存在、今天一半帖子来自卖盘的和卖整机的——在一个"还没上链接"的阶段,免费路线跑通需求,永远比付费路线跑通钱包明智。

内容由AI生成

精选参考来源

1. 16GB内存的Mac跑125B大模型?slotstream把模型从固态硬盘流式读进内存

2. 128GB内存也跑不动的Qwen3-235B,加一块SSD就能跑了?我做了一次实测

3. 雷军称未来2年内存价格会持续上涨,那么,内存价格真的会上涨吗?

4. DDR5内存价格一年涨近五倍,背后的原因是什么?这会如何影响PC市场与消费者选购?

5. 如何看待26年7月DDR5内存价格再次暴涨,出现「一天两变、提货被拒、商家劝退用户」的怪象?

6. 从前我们吃得太好了!有网友惊恐发现:三年前买的老固态硬盘价格暴涨了五倍

7. HF热榜:DeepSeek-V4.1-Flash登顶,MiniCPM5杀进端侧,Qwen3.8GGUF本地部署|硬核AI实战派EP45

8. AI SSD到底有什么用?Qwen-122B成功启动,35B模型推理70秒→2秒

9. 极摩客T2S|AISSD到底强在哪?实测差距太夸张

10. AISSD为何突然爆火

11. slotstream README(carloslfu/slotstream)

12. Redis创始人亲手写了个AI引擎:用MacBook跑近前沿模型,还能把SSD当内存用

13. [中配]4张V100运行Qwen3.8180B模型:NVFP4量化与SSD流式传输实现60TPS推理

14. 4GB显卡真能跑70B?AirLLM原理讲透

15. 25位菲尔兹奖得主联署声明;DeepSeek本地适配更新【AI晚报2026-09-12】

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章