这周玩本地大模型的,很难绕开一个名字:Strata。
一个MIT协议的开源推理引擎,被顶上了Hacker News首页前排。B站一条《强推神项目Strata!12G显卡跑Qwen3.8 Flash Next!速度93t/s!》四天拿下9.3万播放、1400多条评论。卖点简单粗暴:让总参数约125B、内置24576个"专家"、每个token只调用其中约10个的MoE模型Qwen3.8-Flash-Next,在12-16GB显存的消费级显卡+大内存机器上跑出40-90 token/s。知乎哔哩哔哩GitHub

但点进评论区,会看到一个罕见的场面:口碑劈成了两半。
一边说:“Strata已经杀死了Moe本地部署的比赛”“27B是淘汰了,正准备把27B的全删除抛弃呢”。哔哩哔哩
另一边说:“实在很差的,完全不能用,毫无用处!!!已经折腾三天了。彻底放弃”。IQ2的智商更是捉急:双2080Ti接DeepSeek Harness写一个俄罗斯方块用了一个多小时,DeepSeek网页版几分钟搞定。哔哩哔哩哔哩哔哩
同一个引擎、同一个模型、同一周,评价怎么能差成这样?我把5个高播放视频的评论区、知乎多篇实测文和微博翻完,凑出两百多条带配置的真实汇报。结论是:两边都没说谎,他们跑的根本不是同一个东西。信任何一条评价之前,先对齐四个变量。
变量一:量化档位——"淌口水党"基本都在IQ2及以下
Strata的速度来自一套四层存储设计:显存只缓存最热的专家,全部权重放内存,CPU分担计算,SSD上放查找表。档位越低跑得越快,但质量是从同一头扣的。README里那张RTX 5070(12GB显存)+64GB内存的官方实测表:Q2_0生成94 t/s、IQ2_XS 79、IQ3_XXS 62、IQ3_S 53。而质量这一面,社区已经替它测完了:GitHub

IQ1_M:几乎全员劝退,有人实测从512剪枝到256之后"中文语言能力被完全剪枝了,守不住中文对话,会迅速回退到全英文"。哔哩哔哩
IQ2/Q2_0:差评重灾区,“这个模型根本用不了。Q2版。已经被压缩的连文字功能都没了”,让它写个小说,到第二轮对话就开始只抄自己上一段写的,第三四轮直接不吐字。哔哩哔哩
IQ2的代码能力也被单独拉出来打过:速度不慢,但生成的代码质量还不如27B的Q4,写个小游戏能耗一个多小时。
IQ3_XXS(GSQ-RCO版):口碑转折点,有人评价它"等效对标Q5-Q6之间",多条实测说Q3就很强、比27B的知识库高一个水平。哔哩哔哩
IQ3_S及以上:“IQ3XXS搞得我差点放弃,最后决定上IQ3S再试试,PPT质量上升一大截和我跑27b的AWQ W4A16版本比有略微提升”。但思考token暴涨,同样的任务IQ3_S输出的token是Q4的两三倍,完成质量还略有不如,最后算总账Q4反而快一倍。哔哩哔哩
所以"新王登基"党几乎都在IQ3_XXS/IQ3_S,"淌口水垃圾"党大多卡在IQ2及以下。档位,是口碑分裂的第一条断层线。
变量二:模型变体——同样叫IQ3,GSQ、Swift、Coder是三个东西
社区流传的GGUF不是一家出的,同一个档位、不同变体,命运完全不同:
GSQ-RCO原版(ISTA-DASLab量化):评论区口碑最好,有懂行的补充背景:“搞gsq-rco量化的是之前弄GPTQ量化的团队,老牌量化团队了,质量很高的”。哔哩哔哩
Swift / Swift-1.5(ukisai版):官方口径是思考更短、答案更快、质量差不多。但社区有人专门跑了基准对比,数学推理略微落后,编程能力更是因为长任务死循环导致分数塌陷严重。GitHub哔哩哔哩
Coder剪枝版:最大的坑。它砍掉一半专家,官方口径是SWE-bench Verified能保住完整模型91%的分数,但README同时承认它在代码之外的任务上更弱,中文等CJK文本首当其冲(issue #438)。
社区的实测口径更直接,知乎一篇7900XTX评测写得明明白白:“它有两个版本,Coder 编程版的中文十题零对,原版 Q2_0 全部答对且更快”。B站评论区还有人发现GitHub上#606、#728、#879多个issue都指向输出退化,最惨的汇报是问模型它是谁,它回答"通通通通"。知乎哔哩哔哩
也就是说,32G内存用户面对的现实最扎心:官方README给32G档推荐的恰恰是Coder,而它是社区踩得最狠的变体。

变量三:真正的门槛是内存,不是显存
Strata评论区有条高赞自嘲:“原以为我的16G显存是搞本地AI的瓶颈,谁知是我32G的内存”。README的官方推荐表同样按内存划线:32G上Coder、48G上IQ2_XS或Q2_0、64G所有档位都装得下(官方推荐IQ2_XS,社区共识却是宁可慢点上IQ3_XXS)、96G以上才轮得到UD-IQ4_XS这种94GB下载的大档。社区实测汇报的分档线更清楚:哔哩哔哩GitHub
32G:勉强能用,副作用是"雷霆思考"——“很多情况 上下文耗完了都结束了,还没思考结束”。哔哩哔哩
48G:入门档,5070Ti 16G+48G内存跑GSQ原版IQ2_XS、128k上下文,汇报是"预填充速度1500~2000t,解码速度70~85t"。哔哩哔哩
64G:甜点档,好评主力——2080Ti 22G+64G DDR4内存跑GSQ-RCO IQ3_XXS、开视觉、256k上下文,速度能到60多tps!知乎也有印证:“本地部署125b IQ3_S版本的qwen3.8-flash-next,只需要60多G内存+2张2080ti 就能达到60 tokens/s”。知乎
老机器也有份:X99双E5-2680v4+128G DDR4 2133的"洋垃圾"能跑出平均36、最高55 token/s,发帖人原话"洋垃圾也能玩出新花样了,哈哈哈,爽"。哔哩哔哩
96G往上:从容档,IQ3_S、UD-IQ4_XS都能上。有人实测日常内存占用62G,于是有了这句预言:“感觉内存96g要涨”。

显存这边反而宽容:3060Ti 8G能跑IQ3_XXS 30+ t/s;4060移动版8G+64G内存跑256k上下文20 t/s,但这位用户的评价是"模型智商还行但复杂逻辑就拉垮了",判定无法成为生产力。能不能稳,看的更多是内存容量、CPU和硬盘,而不是显卡型号。哔哩哔哩
变量四:版本日期——差评的保质期可能只有48小时
这是最容易被忽略的变量。Strata作者的更新频率夸张:“而且这两天天在更新,最新版的比前几天的还能快一些”。有用户10月1日抱怨E5+2080Ti 22G吐字速度有个40、预填充却只有700。到10月5日,评论区同配置的汇报已经变成"能力比27b强很多,昨天又更新了2版,现在预填充速度很快,等待时间减少了"。哔哩哔哩哔哩哔哩哔哩哔哩
优化还在加码:10月4日的v0.1.39加了IQ4_XS,10月5日就有人实测NVFP4新格式,把5090笔记本的Decode从41.7拉到71.2 t/s。知乎

在这个项目里,任何性能差评的保质期大约48小时——这是好消息(坑填得快),也是坏消息(你看到的经验帖随时过时)。
对齐完四个变量,该怎么做
64G内存+12-16G显存(评论区验证最充分的配置):可以上,选GSQ-RCO IQ3_XXS,开MTP、KV缓存Q8,上下文128-256k起步。这是"比27B强"结论实测样本最多的组合。
48G内存:IQ3_XXS压上下文,或IQ2_XS只做速度敏感的轻任务。
32G内存:别硬上。Coder变体的中文和输出退化问题还没修完,Q1/IQ2撑不起生产力,不如继续27B Q4,或等内存降价。
96G+:上IQ3_S/Q4,用速度换质量。双DGX Spark的汇报是单流60+、8并发合计300 t/s。
A卡用户:7900XTX在Win11下有IQ3_XSS 60-80 t/s的实测,6800XT也有跑通汇报,但视觉能力官方明说Linux走处理器、Windows还不支持,折腾成本高于N卡。GitHub
多卡用户:目前"作者没有适配张量并行,只有流水线多卡串行",卡多不等于线性提速。哔哩哔哩
另有三个评论区确认过的坑:
死循环不全是模型的锅:一部分是jinja聊天模板问题,“死循环有可能是jinja模板的问题…我有一次遇到了. 换成froggeric/Qwen-Fixed-Chat-Templates这个jinja模板好了”;降MTP档位也能明显降低循环概率。哔哩哔哩
别信monitor面板:多人反馈预填充只有250,实际"他的monitor里面的数据不准,要看后台的log自己算一下reading prompts的速度,500以上就是正常的"。哔哩哔哩
部署前留好磁盘:模型下载约70GB,启动时35-55GB读进内存,官方文档明说这个过程会让整台机器卡住一到三分钟。装在机械盘的还有人跑出过6 token一秒的惨案。知乎哔哩哔哩
最后,两种冷声音也值得听
一种是等等党:“不玩这些,等qwen4,只用官3.8 27B”。社区传言Qwen4临近,如果更大杯同样能跑,今天的档位选择可能要重来一遍。哔哩哔哩
另一种是性价比党:“我各种版本实测最终确定,在这个硬件价格高起的时间段,订阅API或者中转站才是生产力最有性价比的出路”。这话不无道理——内存价格还在涨,"64G起步"的门槛成本水涨船高。哔哩哔哩
我的结论是:Strata的口碑分裂不是项目质量问题,是信息问题——差评大多对着"IQ2档+旧版本+Coder变体",好评大多对着"IQ3档+新版本+GSQ原版"。配置对得上的人,现在值得上;只能跑IQ2的人,评论区那些差评对你更有参考价值。接下来值得盯的信号:Coder变体输出退化的issue修复进度、Strata对AMD视觉的支持、Qwen4的发布时间,以及内存价格走势。