引爆点:一条视频8天14.4万播放,它跑动的不是新模型,是把账重算了一遍
10月2日,B站一条《强推神项目Strata!12G显卡跑Qwen3.8FlashNext!速度93t/s!》的视频,8天干到14.4万播放、近1900条评论。项目本体是开发者Niko1221开源的推理引擎Strata:上线第四天618颗星,10月6日14.5k,版本号已经滚到0.1.40。知乎上被顶起来的回答形容它:速度增长非常飞快,两周内约17K星。哔哩哔哩哔哩哔哩知乎
先把定位说清:Strata不是模型,是“怎么跑模型”的引擎,它跑的是通义千问团队的Qwen3.8-Flash-Next——2026年8月发布的多模态MoE,主模型约1250亿参数,每个token只激活约60亿。“大且稀疏”正是它能落进游戏PC的原因:Strata把模型拆开,让显卡、内存、固态硬盘同时干活——常用的热专家驻显存,温的放内存,冷的躺在SSD上按需叫醒,再配合IQ2/IQ3/GSQ-3.5bit这些量化档位。对A饭来说真正的新东西在这里:“本地跑千亿模型”第一次跟CUDA解绑了,官方支持口径写明覆盖NVIDIA与AMD两条线。前阵子ROCm 10.1把6000系踢出名单的憋屈,在这条路线上换成了“引擎说了算”。但能不能跑、跑多快、要花多少钱,是三本分开要算的账。知乎哔哩哔哩小红书
兼容账:A卡实测记录是真的,但“随便一张卡都行”一个字都没写
RX 7900XTX 24GB,Win11,引擎v0.1.38,IQ3_XSS量化,decode实测60-80t/s,UP主手里还插着4080S做对照。哔哩哔哩
A卡手把手部署实录:分支怎么选、网络502怎么绕都写明了,一张调优表让prefill从405冲到775,升级后再翻两倍多,192K拉到256K上下文零代价——但注意细节,AMD的识图(视觉编码器)走的是CPU路线,不是N卡那种原生加速。哔哩哔哩
老平台的覆盖面:双路V100 16G配E5和64G DDR3内存能跑出60-100t/s。 双路至强加两张RTX 3060也到了45t/s。 连32G内存的M1 Max Mac都能跑,生成速度还有28t/s。 谁也没想到“再利用”的老机器,又回到牌桌上。哔哩哔哩知乎知乎
再筛掉必须筛的噪音:
“8G显存跑125B”是被误读最狠的标题。真有人拿8G卡跑起来了,但起点是SSD流式读拖着、从7.8t/s爬回能用。 博主自己核对安装说明后的结论是:硬件门槛比标题写得高一档。小红书小红书
标题里的“1700 tok/s”“2881 tok/s”基本是prefill(读入速度),不是decode(出字速度),你排队等的是后者:一台5090笔记本NVFP4方案Prefill达2881tok/s,Decode只有71tok/s。知乎
速度账:把两周的实测样本排开,区间其实很窄,而A卡不在瓶颈位
公开可查的decode样本里:魔改4090平均解码140-150t/s、峰值180t/s。 单张RTX 5070跑出94词元每秒。 3090配32G内存跑Coder版、32K上下文约90t/s。 往下就是7900XTX的60-80、双V100的60-100、双3060的45、4060Ti+32G内存的30.1、M1 Max的28。知乎小红书小红书
两个结论:其一,显存12GB以上、内存32GB以上,你大概率落在30-90t/s这个“能用”区间;其二,在这张表里,24GB的A卡不垫底、不封顶,卡在5070档和3090档之间——这一轮,A卡本身根本不是瓶颈。瓶颈在内存档位上,见下一本账。
成本账:门票不是显卡,是64G内存——恰好撞在今年最贵的行情上
社区口径高度一致的量化分档:32G内存请下IQ2版本,64G及以上才无脑上IQ3,也就是说“跑得舒服”约等于“手里有64G内存”,一张笔记的标题把这层窗户纸捅得很直白:代价是64G内存。小红书
而现在,内存正处在一年里的最高点:南亚科DRAM再涨20%,9月营收同比暴增576.62%、连续11个月创单月新高。一年前32GB的DDR5套装不到100美元,如今涨到350-450美元;服务器端64GB RDIMM从8月合约价1590美元喊到四季度现货3200-3700美元。厂家预测这轮涨价周期可能持续到2029年至2030年。知乎知乎知乎
AMD家的卡自己刚执行完一轮指导价上调,涨得最狠的RX 9070加700元落到6299。双11的预期也得管住:站内讨论的共识是就算降价也不会有太大降幅,把32G缩到16G的多了去了。知乎知乎
所以A饭要不要上这班车,问题不是卡,是三个动作的顺序:
先零成本验机。32G内存装v0.1.x跑IQ2,免费开源,先跑一周,判断自己是“尝鲜两天”还是“真的日用”。唯一的成本是折腾环境:分支怎么选、网络502怎么绕,部署实录里全是明写的坑。
确认日用,加条优先于换卡。两根32G的钱仍然远低于一张高端N卡,更不用提192GB的495那个5万块锚点——但买入时点要对双11行情:涨价已定,能选的是相对低点,不是幻想降价。
想一步到位的第三路:395迷你主机+128G统一内存。Strata在Windows上实测395跑Flash-Next,Prefill 1632、生成46t/s。 另有AMD阵营社区主推的gufo引擎,长上下文拉到131K还能维持1030 token/s,同场景llama.cpp只剩180。这是一次性整机投入,属于另一笔预算,别跟“加条”混着算。知乎哔哩哔哩
窗口账:引擎还在0.1.x,A卡的戏没唱完,别急着定“唯一答案”
两周从v0.1.15滚到v0.1.39,有人跨24个版本升级换来prefill翻两倍——红利是真的,不稳定也是真的。同一批硬件上,Strata与Ninfer的“本地推理真神”之争已经有人拿3090单卡对决。 而A卡物料明显偏少:教程默认N卡、识图走CPU,社区自嘲帖直接以“我们AMD用户的回答”命名gufo方案。知乎哔哩哔哩哔哩哔哩
值得继续盯的信号就四个:Strata对RDNA的优化会不会从“能跑”进到“调优表化”(7900XTX的prefill翻倍已经露头);8G级小显存量化生态成不成熟;双11前后内存现货曲线;以及495这类192GB新硬件的真实成交价——如果它把“64G内存方案”衬得毫无性价比,今天的加条决策就要重算。
一句话收尾:A卡跑得动,验机不要钱;真正要对完的账,是在内存最贵的月份,值不值得花“两条32G”给自己发一张125B的门票。先用32G内存跑一周,再谈加条。