装机群里这两天刷屏的不是双11配置单,是一个叫Strata的开源项目。B站10月2日那条"12G显卡跑Qwen3.8 Flash Next,速度93t/s"的视频两天冲上14万播放、1.4万收藏,评论区挤进来1900多条实测汇报。知乎这边从10月4日到10月10日也连发了十来篇部署文。标题党看着眼热,折腾党心里痒的都是那个老问题:抽屉里的旧显卡,是不是又能再就业了?哔哩哔哩
先给结论:能跑是真的,"人人跑得爽"是营销话术。这个周末值不值得折腾,取决于你抽屉里那张卡的显存、机箱里的内存,以及你愿不愿意在内存涨到一年翻三倍的节骨眼上继续接盘。下面用README原始数据加评论区20来条真实配置实测,把这三件事一次算清。
一、先搞清楚它到底干了什么:不是魔法,是把你的电脑拆成了四层仓库
Strata是个MIT协议的本地推理引擎,专门对付Qwen3.8-Flash-Next这个125B参数的MoE模型。MoE的特点是125B里每个token实际只激活约6B参数——512个专家、48层、每层路由10+1个。既然大头用不上,Strata就把这台机器拆成四层:显存里缓存最常用的专家、系统内存里放全部权重、CPU扛下剩下的计算、SSD上放一张查找表。再配上投机解码,才换来"消费级显卡跑千亿模型"的效果。知乎

知乎那篇拆四层存储的文章里有句话值得划重点:你跑的不是完整的125B,是一个被量化、被裁剪、被缓存策略塑形过的近似版本。这句话决定了后面所有判断。知乎
二、真实速度表:README一张表,评论区一张表,拼起来才不作弊
README给的那台RTX 5070(12GB显存+64GB内存)的档位数据很诚实:Q2_0档生成94 token/s、IQ2_XS档79、IQ3_XXS档62、IQ3_S档53。同一套算法换到AMD的RX 9070 XT(16GB)同档只有60,RTX 3090预估在100到140。注意规律:速度基本是拿量化档位换的,档位每降一级,快的那20-40个t/s都是从模型"智商"里扣的。知乎
但博主们的实测比标题诚实多了。我把那条爆款视频的评论区近2000条里的真实配置捞了一遍:
你的配置 | 量化档 | 实测速度 | 备注 |
|---|---|---|---|
RTX 5070Ti 16G | IQ3_S,512k上下文 | 93.1 t/s | 内存占用70G |
RTX 5090 + 64G内存 | Q3s | 100 t/s上下 | Agent优化后可到160 |
RTX 4080笔记本 12G+64G | IQ3_XXS,256k | 40 t/s | 评论区原话"震惊瘫坐,版本答案" |
RTX 2080Ti 11G(双路至强4210服务器) | IQ2档 | 35-40 t/s | IQ3_XXS档30-35 |
E5 2698bv2 + 64G + 2080Ti 22G | swift Q3,128k | 40 t/s,预填充仅700 | CPU拖后腿 |
RTX 5070 12G + 48G内存 | IQ3_XXS | 20 t/s | 一次长任务跑了45分钟 |
AMD 7900XTX,Windows | — | 15 t/s | 疑似被PCIe 3.0拖累 |
32G内存的任何机器 | — | 只能跑Coder变体 | 评论区"遗憾,毫无意义" |

看懂了吗?决定体验的第一变量不是显卡,是内存。官方给的档位门槛就是按内存划的:48G够到Q2_0和IQ2_XS,64G才轮到IQ3_XXS和IQ3_S,要跑更接近原版的UD-IQ4_XS得96G起、光模型就下载94GB;32G内存只能跑砍了一半专家的Coder变体,SWE-bench能拿完整模型91%的分,代码之外的任务明显更弱。知乎
三、三笔成本账:这是2026年10月,不是内存白菜价的2024
第一笔:补内存的账。评论区高赞的担忧是"内存又要推高了,这个项目友好64G内存,至少也得48G,32G又尴尬了"。不是空穴来风——10月7日深圳广电报道,华强北内存条价格一年涨了300%以上,DDR4 16G从100多涨到600多,DDR5 16G从200多涨到1400以上。七彩虹影二代DDR5-6000c30内存上市,一对卖到3999元。也就是说,给一台32G老机凑到64G的显性成本现在是一千上下,半年前是三百。为了周末试个新项目在这个位置接盘,等于给"能跑"两个字付三倍溢价。已经在64G以上的人另说,你们的车票早就买好了,评论区"当初脑袋抽筋插满128g真是正确的选择"和"把192的内存拆了96卖是我最后悔的决定"就是两组现成的对照组。哔哩哔哩知乎知乎

第二笔:不折腾的账。评论区有个泼冷水但很难反驳的声音:本地能玩的核心是Qwen3.8-Flash本身效率太高,高到官方API便宜——lite半价升级的活动50/月的essential套餐就有至少15亿的token。你跑IQ2档省下的那点token费,大概率还不够买内存条,更不够付那台24小时挂机推理机的电费。本地方案真正赢API的地方只有三个:离线与隐私(资料不想出机器)、不限流不看脸色的用量、以及把127.0.0.1:8080直接接到你现有Agent工具链里那种"改一行地址就换大脑"的控制感。如果你要的是这三个,成本账另算;如果只是听说"token自由"眼热,先等等。哔哩哔哩知乎
第三笔:隐性损耗的账。这条最容易被教程略过:有用户实测把权重卸载到固态,两个个小时写了3.2t数据——消费级SSD的TBW就是这么烧的。此外模型下载约70GB,启动时要把35到55GB读进内存,这个过程会让整台机器卡住一到三分钟。上下文越长驻留显存的专家越多,262k原生往1M扩的代价就是显存吃紧。Linux开mmap环境变量能省23GB内存占用,7×24挂机党建议直接避开Windows。哔哩哔哩知乎
四、两类人动手,三类人快走
值得动手:①手里有12G以上N卡、内存已有64G的折腾党,周末下载完就能到40-90t/s的可用区间,IQ3_XXS是目前社区共识的甜点档——Q2掉智有点严重,能上Q3就上Q3,思考死循环的抱怨在评论区反复出现。②对隐私、离线有硬需求的用户,这笔投入是买能力不是追热点。哔哩哔哩
建议快走:①只有32G内存的机器——别为一个项目现在追高内存;②AMD Windows单卡用户,README的RX数据和评论区15t/s的体感都在告诉你支持还没成熟(Strix Halo的APU适配作者刚在GitHub issue里说在真机上bring-up,等等不亏);③被"无限制破甲"话术吸引的人——README里那个experimental-speed-projection选项会剥掉模型的拒绝方向、让拒答大幅减少,作者原话是去除拒绝行为也意味着去除某种安全机制,你需对模型由此生成的内容自行负责。把它当卖点卖你云上实例的教程,本身就该拉响警报。哔哩哔哩
最后提醒一句风向:10月8日已经有UP主喊"所有人停止买显卡、一夜行情暴跌30%",那条视频1.6万播放只有44个赞——市场情绪在松动,但证据撑不起"崩盘"二字。双11的硬件促销窗口就在下个月,手里旧卡还能亮、内存已经够大的,现在上车试水是免费的;差内存的,最划算的路线大概率是再蹲四周。这个项目的更新版本号跟坐火箭一样,多卡支持和配置门槛还在往下打——值得收藏一条观察线索:接下来看它的Windows PR进没进主线、UD-IQ4_XS的96G门槛有没有被优化,这两件事决定第二波"老机再就业"是不是真到普通人门口。哔哩哔哩哔哩哔哩