这个国庆假期,DeepSeek×昇腾刷屏的时候,本地部署圈子里换了另一个主角:一个叫 Strata 的开源推理引擎。B站UP主"AI观模者"的标题直接写"强推神项目!12G显卡跑Qwen3.8FlashNext,速度93t/s",这条视频207个赞、371个收藏、281条评论。"qwased"的"16G显卡也能跑到65tps"拿了177赞、349条评论,小红书"零度解说"的"8G显存竟能跑125B"也攒了182个收藏。口号一个比一个响:“本地部署的新王”“无需再考虑天价显卡”。哔哩哔哩小红书
但同一周,小红书UP主"9527|AI工具实测"翻完项目README后泼了盆冷水:按他核验的版本,门槛写的是 NVIDIA RTX 30/40/50系、至少12GB显存、64GB内存、约80GB可用磁盘、模型文件约70GB——"8G就能跑"是标题党,"A卡也能用"README里根本没写。这份"冷水"本身也要被复核:这个项目的README本周就在滚动更新,下面细说。小红书
于是我把这周能找到的9组跨平台实测摆到一起。同一个引擎、同一个模型家族,decode速度从19 t/s到110 t/s,差了近6倍。差距不在显卡型号上——这是这篇内容最反直觉的地方。
先给不补课的读者三句话:Strata是什么
Strata是GitHub上的开源本地推理引擎(仓库Niko1221/Strata),Windows和Linux一键安装,装完在本机8080端口直接提供OpenAI/Anthropic兼容API。它专门跑Qwen3.8-Flash-Next的GSQ-RCO量化版(社区还有ukisai的Swift-1.5微调版),思路是给MoE模型做"分层住房":官方架构图的说明写得很直白——模型的两万四千多个专家,最忙的放显卡上,全部专家放内存,连查找表都放到了SSD上。实测者青风的复述更顺口:把模型专家放 RAM,只把热专家放 VRAM,用 CPU 算冷专家。B站"量子菠萝_“把它叫"四室调度”,架构拆解是这个项目最像"并行计算课作业"的部分——你以前在数据中心的专家并行玩法,被塞进了一台游戏电脑。GitHub知乎哔哩哔哩
9组实测摆开:你的配置在哪个档位
配置(显卡+内存+链路) | decode速度 | prefill | 场景口径 | 来源 |
|---|---|---|---|---|
RTX 5070 12G + 64G直插(锐龙5 7600) | 93 t/s(官方口径53-93) | 3.2万token约15秒≈2170 t/s | 官方参考机,短对话 | Scorpio-117引述 / RobinDevNotes |
12G + 64G直插 | 峰值48 / 平均40 t/s | 700 t/s | 168K长上下文日常 | 小红书root |
4060Ti 16G + 64G | 30 t/s | — | IQ3_XXS量化,llama.cpp同机只有15-16 | B站逻辑仓管 |
16G直插+调优 | 65→最高110 t/s | — | 按历史任务轨迹重调专家加载策略后70→110 | B站qwased |
4070TiS 16G + 64G走OCuLink坞 | 19-27 t/s | 冷980 / 热缓存10644 | PCIe x4仅7GB/s,约为直插28% | 知乎青风 |
2080Ti 22G(魔改) + 32G内存+SATA盘 | 峰值63 t/s | — | llama.cpp同机只有7 t/s,约9倍 | 小红书tiger-cat |
5060Ti 16G + 96G DDR5超7200 + AMD双CCD | 峰值100 t/s(帖内口径) | — | 256K上下文测试 | 小红书hhhxxxyyy3 |
16G + Coder量化版 | 35+ t/s | — | 128K上下文,编程特化 | B站逻辑仓管 |
RX 9070 XT 16G + 锐龙9 3900X + 47G内存 | Q2_0 60 / IQ2_XS 52 / Coder 44 t/s | Q2_0读32K约1160 t/s | 官方README的A卡参考机 | 官方README |
B站Scorpio-117引述的官方参考机:单张12G显存的RTX5070+64G内存,短对话实测93 t/s,32K读取2170 t/s。这套数字和知乎RobinDevNotes核实的官方口径对得上:读 3.2 万 token 的提示词,用 Q2_0 大约 15 秒——折回来正是2170 t/s,两个渠道咬合,这组可以当基准。同一台参考机换成长上下文档,小红书root的168K实测是峰值48、平均40、填充700——短对话和日常差距多大,这两组数字一比就出来。哔哩哔哩知乎小红书

三句话读这张表:对llama.cpp的翻倍式提升是真的——逻辑仓管在4060Ti同机的原话是"同一个模型,之前用cli跑出15-16t/s左右,现在翻倍"。tiger-cat的2080Ti更是从寒碜的7 t/s拉到峰值63 t/s,约9倍。 93 t/s也是真的,但那是短对话——上下文拉到168K档,同配置掉到30-48;跑同样的卡,速度差4倍的机器,差的其实是内存、CPU和链路。哔哩哔哩小红书
这波刷屏里,哪些该当真、哪些是口径
“8G显存能跑125B”——先当真不起。 当前README把显存门槛写得明明白白:12GB起。B站九物的标题却写"8G显存跑125B大模型!最低32G内存"——在官方口径之外。证据只有个例、没有可复现条件,8G卡用户先按"不支持"处理,省得下载70GB模型才发现跑不动。GitHub哔哩哔哩
“N卡A卡都能用”——README这周自己改口了。 9527在9月28日核验时,README只写N卡;我10月2日抓下来的当前版,显卡一栏已经是NVIDIA 20/30/40/50系外加AMD白名单:RX 7900 XT/XTX、7800/7700 XT、9060 XT、9070/9070 XT、AI PRO R9700和RX 6800/6900系,参考机就是RX 9070 XT加47GB内存。零度解说的"A卡能用"拿到了官方签名——但注意两点:白名单以外的A卡别对号入座,12GB显存底线对两边都一样;N卡这边20系也在列,tiger-cat那台22GB显存的老2080Ti从"列表外"变成"型号内"——虽然2080Ti原版只有11G,他那块22G本来就是魔改卡。以及从"只写N卡"到"AMD列表"只隔了几天,这本身就是下面"继续观察"那条的证据。GitHub小红书

峰值≠日常。 “100 token/s”"63 t/s"都是峰值口径。真实日常是:长上下文decode掉到30-48,每轮30-60秒的prefill等待是固定成本——青风的适用条件清单里明写了要能接受这一点。他实测64K档每轮还有6-7秒的开销,而且这6-7秒不是重算,是把 KV cache 从 RAM 搬回 VRAM。知乎

一个不报错的坑:滑动窗口。 上下文打满后Strata不报错,是悄悄丢弃最早的内容。青风实测上下文到 99.5% 时,输出空间只剩 431 token。长会话用户会遭遇"它把我上个月说的忘了,但它不说"。知乎
连参数口径都没对齐。 同一个模型,帖子里分别叫它125B、176B、180B、“1250亿”——官方README的标题口径就是那个1250亿,引用数字时别追单一口径,按量化文件体积(63.5-70GB)说话更稳。GitHub
最值钱的一笔账:瓶颈从显存搬走了,但没消失
这台引擎的官方参考机只需要一张12G的5070——听起来像"显卡不重要了"。但把9组实测的短板排一遍,瓶颈搬到了三个更隐蔽的地方:
内存容量和带宽。 README当前的口径是32GB起步、64GB才能跑下所有size。hhhxxxyyy3直接上96G DDR5超到7200,并点名内存控制器体质是瓶颈。而这一轮周期里,恰恰是内存最贵——Wallace的显卡日报10月1日标题就是"内存已超过10倍暴利|显卡日报10月1日"。同一周消费级显存颗粒还在停产。"不用买天价显卡"省下的钱,换成了天价内存条。GitHub小红书知乎
CPU架构(这条先记社区口径)。 hhhxxxyyy3的总结是:strata专门写了AVX512的算子,目前CPU只有AMD有AVX512,所以推荐双CCD型号(7900X/7950X/9900X/9950X)跑满内存读取带宽。青风那边更直观:GPU 功耗只有 89W / 285W 上限,负载 66%——GPU 在等 CPU 算冷专家。workers也不是越多越好,13个反而比9个慢,超线程在互相抢。知乎
链路带宽。 官方README给出的IQ3_XXS档位参考是62 t/s。青风在OCuLink外接坞上跑出的19-27大约是官方值的40%,和他测到的链路带宽比例7/25基本吻合——想拿显卡坞复现小红书数字的,先看这一条。
所以"无需再去考虑天价显卡"这句话只对了一半:它免掉了显存的钱,加上了CPU、内存和链路三个新的账本——hhhxxxyyy3的峰值100 t/s,靠的正是16G小卡配96G超频内存;官方对24GB显存的3090的预估也就是100-140 t/s,说明内存和CPU这一侧的加成可以抹平一部分显存差距。GitHub

分人群结论:谁现在就切,谁再等等
现在就切:手里是12-16G的N卡+64G内存(或愿意补内存),场景是单次长文档/分镜/代码分析,隐私敏感、受得了每轮几十秒prefill的。这周起号的多位实测者正是这类,收益是llama.cpp时代的2-9倍。
先别切:只有8G显存的;白名单之外A卡的;要跑多并发、秒级响应、几十万字超长会话的——滑动窗口和每轮搬运会把体验磨没。手上是32-48GB内存但想上车的,官方口径里只有一条路有背书:Coder版,它砍掉一半专家、第一分片只有 29.6GB,32GB 内存就能跑。知乎
切之前的检查单:留足80GB磁盘;把huggingface.co换成hf-mirror再装;跑一遍–calibrate(青风的实测结论是pcie-frac别拉高,0.2附近最优,带宽打满反而排队);KV用int8/8bit省一半内存;想走Docker的注意要NVIDIA Container Toolkit加580以上驱动;手里有多张卡的可以让它分摊,官方文档写明两三张卡可以共享模型。最后:打开Monitor盯REUSED和PCIe流量列;知道64K/128K满了会静默遗忘;商用和再分发前核对模型卡许可。GitHub
继续观察三件事:README的改口速度——AMD白名单、N卡20系、内存32GB起步口径都是这几天新加的,装之前重新抓一遍,别拿半个月前的教程截图当门槛依据;项目日更期过后参数(–spec、–expert-profile、–kv-resident)是否稳定,这几周参数口径明显在动;GSQ-RCO量化版和Swift-1.5社区版的智力/速度差有没有人做同机横评。
一句话收个尾:Strata这周的热闹,本质是MoE把"数据中心级的专家分层"下放到了单机——它确实重新定价了12G显卡的用途,但"并行计算"这道题没有消失,只是从"要不要买更大的卡"变成了"你的内存带宽、CPU指令集和PCIe链路,配不配得上这12G显存"。