这周本地AI的现场,不是显卡也不是新盒子,是一个之前没人听过名字的框架。9月24日,GitHub账号Niko1221开源了Strata,仓库简介就一句话:Qwen3.8-Flash-Next这颗125B MoE,8GB显存起步的N卡就能跑。 5天过去,1078星、118个fork、34个未关闭的issue/PR,连tombkeeper都在微博专门发长文推荐这款新出的推理引擎。 热度是真,争议也是真。GitHub微博
B站这边,UP主qwased管它叫"专武框架",标题写的是16G显卡也能跑到65tps输出。 另一位UP主"其它世界"的标题更猛:12G显卡就能跑128B的qwen3.8flash——注意,官方口径是125B,别被标题带偏。 水分和悬念都指向同一个问题。哔哩哔哩哔哩哔哩
同一时间,小红书上有4060Ti 16G用户晒出的实测只有30t/s——帖里写:之前用cli跑出15-16t/s左右,现在翻倍。 他同步发在B站的那条视频,标题写得清楚:跑125B还能跑出30tok/s的,是IQ3_XXS这一档。 90、65、30——同一个引擎、同一颗模型,数字全真,量的不是同一件事。我把GitHub的README、DETAILS技术文档、那条微博和几条实测帖对齐了,这篇把账一次算完。小红书哔哩哔哩
先拆引擎:它动了哪块奶酪
Strata是C++写的,MIT协议,Windows/Linux一键装,装完在本机开一个接口,聊天工具和agent都按OpenAI兼容方式接进去,浏览器里再带一个把模型状态和GPU/CPU/RAM摆在一起的监控页。GitHub

权重不是淘天原版,官方README写明模型整包约70GB,第一次下载要留时间。 模型的账本也值得摊开:125B总参数,每个token实际只激活约6B,另挂一张51B的PLE n-gram表和4B的MTP——所谓"29GB查找表"就是它。 tombkeeper把结构拆得很清楚:显存放常驻计算部分和热点experts,内存放路由experts,SSD放n-gram表,命中的GPU算、未命中的CPU和GPU分担,甚至专门针对Q2_0量化写了AVX-512 VNNI内核。 它没有让显卡变强,只是把内存和硬盘安排明白了。GitHub小红书微博
所以入场券不是显卡,是内存和硬盘:README的硬要求是RTX 30/40/50系、12GB显存起、约80GB可用磁盘、最好一块SSD。 "8GB能跑"只写在仓库简介里,没写进说明书——8G党先别下单。GitHub
官方档位表写得明明白白:32G内存只有一张票——Coder版,砍掉一半只留编码、工具和图像相关的专家,作者口径是SWE-bench Verified保留91%、LiveCodeBench保留99%,但编码之外的活会明显变弱。 48G放行Q2_0和IQ2_XS;64G全档,IQ3_S要"基本不开别的程序"。GitHub
显存不参与及格线,只影响速度:每1GB显存约多驻留700个专家,3090 24G按官方估算能到100-140t/s。GitHub
速度悬案:90、65、30分别是谁的数字
官方机子是RTX 5070 12G加Ryzen 5 7600加64G DDR5-5200:短聊天Q2_0 90t/s、IQ2_XS 74、IQ3_XXS 62、IQ3_S 52,同一个Q2_0拉到128K上下文掉到67。 UP主的65tps落在16G卡的估算区间里,不算吹;4060Ti党的30是高两档的量化,再叠上长上下文和CPU差距,跑出表格一半不意外——官方文档自己就标注了输出速度取决于文本。GitHub
真正值钱的对照是那条微博:同一台3090、同是IQ3_S,Strata短问答能到67t/s,llama.cpp只有20t/s;作者自己用12G的5070跑IQ3_XXS也有65.6t/s——差距不来自显卡,来自那颗CPU和内存带宽有没有被安排明白。微博

被带节奏的还有"首字时间":32K提示词读约25秒,128K接近两分钟,262K要4.5分钟。 单轮会话内保留上下文、续聊秒回;换窗口开新会话,长历史整段重读。GitHub
评论区那句"最大问题是没有kvcache"骂的就是这个——严格说是有:64K以上KV会流式放进内存,128K约占1.7GB,只是第一次喂长文的等待不会因为换了说法就消失。 这也是"多轮废不废"的真正分界:文档喂一次算一次,聊十轮只读增量。GitHub
质量之争:27B党和125B党谁在交智商税
"27B够了"党里有真当排头兵的:IQ2_XS跑agent任务死循环,“27B gsq两下就搞定的事,它能绕一小时还卡死了”。 也有人算总账:GPT6都白菜价了,花几万块硬件就为了跑个q2量化模型不值。 共同点很清楚:都拿自己机器上的27B当尺子。哔哩哔哩哔哩哔哩
"125B值得"党的反驳很干脆:iq2智力堪忧,不如27b,不过知识量确实大一下。 这家的看家证据就是生成能力——有用户让同门的Flash基于自己的游戏做一个魔法塔防demo,画面撑得住场面。 官方档位表里IQ3_S也敢写公开测试追平原版(限原版模型):想不掉智力又不付智商税,代价是52t/s加64G内存。小红书小红书GitHub

四个坑,全是issue和评论区捡回来的
一、第一次启动电脑会僵1-3分钟:35-55GB灌进内存、还锁一部分给显卡,评论区那句"卧槽"是等待不是夸。 二、视觉是另一套配置:qwased的经验是让agent分别写"纯文字/视觉给显卡/视觉给CPU"三个启动脚本,别指望一套通吃。 三、有个默认关闭的"实验性速度投影",README特意提醒它会改变模型的回答方式。四、4-bit KV缓存省内存,128K快约4%,但长文档困惑度实测+8-12%,别拿它把128K当8K用。GitHub哔哩哔哩GitHub
三种人的三笔账
16G卡加64G内存已经在手的:直接上,推荐IQ2_XS,短聊天接近评论区说的"这速度跟deepseek体验差不多了"的那个手感;主要写代码就装Coder,50t/s上下但专家少三分之一个头。 前提只有一个:那64G内存本来就在你手里。哔哩哔哩
只有32G、想加根内存条的:这一笔最需要冷静。16G DDR5单条去年9月还在450元左右、现在卖到1800元,32G套条从900涨到3800;美光上个月全产品线暂停报价,现货颗粒报价同比+480%。 qwased视频评论区都在喊"内存双十一会降价不",观望情绪是真实的——不是加不起,是加完这一千八,手里27B Q4已经能干掉的活,未必非要125B Q2来干。小红书哔哩哔哩

8G老卡、A卡党、Mac党:这轮先站岸上看。README只认12G以上的RTX 30/40/50,连装机商帖里"升级5060Ti拆下来的4060"都不在门票里。 双7900XTX的用户在拿别的引擎把Flash-Next Q4跑到160W,256G的M3 Ultra党在用TensorFold晒实测。 路不止一条,但别为Strata改嫁。小红书哔哩哔哩哔哩哔哩

最后说一句迭代速度
引擎还在飞速跑:0.1.13一个版本就把32K提示词的读题速度从572提到1290t/s。 引擎快跑的状态本身就是信号:表格在变,坑在被填。GitHub
0.1.14起,驻留排序覆盖全部24576个专家,不再停在8000。 34个未关闭issue里,评论区很多坑下个版本可能就没了。Strata这周真正凿开的不是显存的墙,是内存和SSD的入场券——追新的正确姿势是:先在内存在哪一档的表里对号,再决定掏不掏那70GB的下载。GitHub