过去一周,DIY圈最火的不是哪张新卡,而是一个叫Strata的开源推理引擎。
它干的事情一句话能说完:让Qwen3.8-Flash-Next——一个1250亿参数的MoE大模型——跑在12G显存的消费级显卡上,短文本输出能冲到90多个token/s。B站上,10月2日一条12万播放的安利视频之后,跟进的实测、部署教程、踩坑分享一天冒出十几条。知乎那篇《12G显存就能跑千亿参数大模型,显卡价格要崩?》底下,评论区变成了大型报配置现场:3090Ti的、双3080 20G的、2080Ti 22G的,连AMD的R9700都有人跑通了。知乎哔哩哔哩
但先别急着下单。把这一周的社区实测、华强北最新报价和成本账摊开核一遍,你会发现这件事对装机党的真实含义,和"显卡要崩"的标题党完全是两回事——Strata砍掉的是显存门槛,抬高的却是内存门槛。而内存,恰恰是今年涨得最凶的那个配件。
一、先讲清楚:12G显存凭什么跑得动125B
原理不玄乎。Qwen3.8-Flash-Next是MoE架构,总共24576个专家,每个token只激活10个。也就是说,任何一个瞬间,真正需要算的只是模型的一小块。哔哩哔哩
Strata做的就是分层调度:把热专家放进显存,温专家放进内存,冷专家留在SSD上的模型文件里按需读取(mmap),再叠加MTP推测解码,把输出速度拉高约1.6倍。它基于llama.cpp,专门针对这个模型在"小显存+大内存"配置上做了深度优化。GitHub知乎

知乎评论区有人总结得准确:这条路不是Strata首创,llama.cpp生态早就有类似玩法,但Strata是第一个把它做到"12G显卡、开箱即用、速度能用"的——之前类似方案要么需要128G内存的Mac,要么得自己折腾参数。门槛从"极客玩具"降到了"游戏电脑",这才是它一周爆火的原因。
二、社区实测汇总:显存决定能不能跑,内存决定跑多快
这是本文最值钱的部分。我们把B站视频、知乎评论里能核实的实测数据拼在一起,样本覆盖从2080Ti到5090、从32G到128G内存:
配置 | 量化/设置 | 实测结果 | 来源 |
|---|---|---|---|
i7-14700KF + 32G内存 + 4070Ti Super 16G | 默认 | 六次实测11.7~65.8 tok/s,波动4.8倍;内存占用88% | B站实测视频(10月7日) |
5090 + 64G内存(社区基准) | 默认 | 三次运行波动仅9~15% | 同上视频引用 |
5070Ti 16G + 48G内存 | GSQ IQ2XS、128K上下文 | 解码70~85 tok/s,预填充1500~2000;实占43G内存+15G显存 | B站评论区(194赞) |
2080Ti 22G + 64G DDR4 | IQ3-XXS、256K上下文 | 60+ tok/s | B站评论区 |
5950X + 128G DDR4 3600 + 4080S 32G | IQ3S、256K | 预填充最高1900、解码125 tok/s | B站评论区 |
单张3090 | Strata优化版 | 最高188 tok/s(投机解码) | B站实测视频 |
AMD R9700 + 32G内存 | Swift IQ3-XXS | 编程峰值120 tok/s、平均80+,内存占用不到27G | B站实测视频 |
双3080 20G(魔改) | IQ3_S | 全面优于vLLM跑Qwen3.8-27B | 知乎评论区 |
数据背后有一条清晰的分界线:64G内存。
那台32G内存的4070Ti Super为什么波动4.8倍?因为模型装不进内存,引擎退到低内存模式——显卡只缓存得起21.3%的专家,其余每个token都要走CPU现读文件,首个字最长要等近10秒。而64G内存能把35.5G的专家全部常驻,速度立刻又稳又快。B站评论区一句话点破:这个项目友好64G内存,至少也得48G,32G又尴尬了。哔哩哔哩哔哩哔哩

还有一条容易被忽略的:Strata吃CPU和内存带宽。高性能CPU、DDR5高频内存、PCIe 5.0、高速SSD都会直接反映在输出速度上;评论区已经有人在问"这玩意要求AVX512吗,我是老E5"——老平台能跑,但别指望跑满。知乎
量化版本的坑也要提前说:社区共识是IQ3/Q3是底线,Q4以下质量塌陷、循环断流常见,Q2实测"掉智严重、思考容易死循环"。有人拿Strata版和阿里官方API对比,数学推理略落后,编程长任务有死循环问题——它是"最接近生产力的本地模型",不是"替代闭源API的本地模型",预期要摆正。哔哩哔哩

三、成本账:显存自由了,内存自由没有
现在把价格贴上来。10月7日,也就是今天,第一现场记者走访华强北的报价:内存条一年涨了300%以上,DDR4 16G从去年的100多元涨到最低600多元,DDR5 16G从200多元涨到1400元以上。微博
按这个行情算两笔账。
新机账:知乎那篇10万阅读的文章替小白算过——5070 12G显卡8000多,64G DDR5内存又要8000多,光这两件就1万6,整机落地至少2万档。而2万块,够订阅十多年的GPT Plus。Strata降低的是显卡档次要求,但64G内存这个大头,在涨价周期里一分没少要你。知乎
老机账:这才是Strata真正改写的部分。2080Ti 22G魔改卡,社区行情从2500被视频带火后涨回3000左右;DDR4平台(主板+CPU+64G DDR4内存)二手全套两三千能拿下。一套"2080Ti 22G + 64G DDR4老平台"总价五六千,就能跑到60+ tok/s——B站评论区那条2080Ti 22G的实测,用的正是DDR4内存。哔哩哔哩哔哩哔哩
换句话说,Strata把"能跑125B"的入场券从万元级新卡,发给了千元级老卡+大内存。它没有让装机变便宜,但让已有的旧硬件重新值钱了——128G内存的老哥在评论区说"当初脑袋抽筋插满128G真是正确的选择",也有人说"把192G的内存拆了96卖是我最后悔的决定"。
四、路线账:三条路,各自适合谁
路线A:老平台续命党(预算5000以内,或手里已有旧机)
先别卖旧电脑。手里有DDR4平台+大内存的,花2500-3000收一张2080Ti 22G或3080 20G魔改卡,就能入场。风险提示三条:魔改卡百分百是矿卡底子,无原厂质保,坏了就是沉没成本;2080Ti不支持FP8(40系以上才有),只能走折中方案;这个价位段视频一带火就涨价,别追高,盯着3000这条线,超过就等等。
路线B:新装机党(预算1.5万-2万)
Strata时代的新机配置逻辑变了:显卡可以降档,内存不能省。12-16G显存的5060Ti/5070级别就够入场,把省下的预算全部砸给64G以上DDR5和高频CPU。但要注意,64G DDR5在当前行情下要8000多,等于整机预算的三分之一给了内存——这笔钱在涨价周期里花得冤不冤,取决于你跑本地模型的频率。每天跑,值;每周跑两次,不如走路线C。

路线C:云订阅党(轻度使用)
必须把反方证据摆出来:B站评论区有人算过,正因为Flash-Next这类模型效率高,官方API便宜得离谱——essential套餐50元/月就含至少15亿token的Qwen3.8-Flash额度。知乎评论区也有一位3090Ti用户说,上月买token花了3500,这个月用了Strata可能不过千。注意,他的对比基准是重度API消耗,普通用户根本用不到这个量级。如果你不是每天高强度用Agent写代码,云订阅+按需本地,才是成本最优解。哔哩哔哩知乎
五、避坑四条红线
Q2量化别碰:掉智、死循环、淌口水是社区实测共识,最低IQ3/Q3起步,显存内存够就上Q4以上。
32G内存别硬上125B:低内存模式下速度波动4.8倍、首字等10秒,体验不是"慢"而是"不可用";32G内存老老实实跑27B,或者加内存再上。
魔改卡按"耗材"定价:2080Ti 22G/3080 20G无原厂保修、矿卡底子,心理价位超过3000就是在为别人的视频流量买单。
别为"本地部署"而本地部署:先算你每月真实的token消耗,低于千元的,云订阅永远比两万的硬件划算。
六、盯盘五个信号
Strata项目迭代:GitHub仓库更新节奏,以及是否覆盖更多显卡(AMD支持还不完整)和更多模型——评论区已经在催DeepSeek V4.1 Flash的适配。
内存现货价拐点:DDR4 16Gb颗粒现货已从9月高点93.5美元回落到83.66美元,三周跌掉10.5%,如果继续回落,64G内存的成本账会明显改善;反之,"老平台残值"还会被继续推高。知乎
魔改卡行情:2080Ti 22G是否站稳3000元以上——站稳说明需求是真的,回落说明是视频带节奏。
Qwen官方API定价:官方套餐越便宜,本地部署的经济账越难算;一旦API涨价或额度缩水,路线C的天平就会倾斜。
二手显卡大盘:10月二手显卡已来到近两年高位。5090的回收价已经报到4万。如果双11前后高位松动,路线B的入场时机才算真正到了。哔哩哔哩哔哩哔哩
一句话收尾:Strata没有让显卡崩盘,它让"显存焦虑"变成了"内存焦虑",顺手给你家吃灰的老平台发了一张翻红的入场券。想清楚自己是哪条路线的人,再动手。