先说B站Strata部署视频区那条点赞最高的留言。那支《强推神项目Strata》周末播放冲到十万加、评论区堆了一千五百多条,被顶在最前面的是这句52赞的留言:“原以为我的16G显存是搞本地AI的瓶颈,谁知是我32G的内存”。 下面紧跟的回复更实在:有人拿1000块预算换了张四槽主板加内存,凑到64G;有人说别追DDR4,刚组的DDR3四通道和双通道DDR4没差别,能省30%—40%。哔哩哔哩
如果你已经知道Strata是什么、也看过它跑分,这篇不跟你聊快不快——聊聊你自己的机器到底缺哪一块,钱该先给谁。
一、官方门槛表:显卡是门票,内存才是档位
Strata这个开源推理引擎,开源两周冲到14.5k星,版本号已经滚到0.1.40。 它的官方定位只有一句话:在一台普通游戏PC上跑1250亿参数的大模型。一周之内,B站"Strata本地部署"相关新视频就有二十多支。哔哩哔哩
它GitHub仓库README里的配置门槛表(10月6日摘录),很多人其实没仔细看过:
项目 | 官方要求 |
|---|---|
显卡 | 12GB显存起步(RTX 20/30/40/50系,A卡另有支持列表) |
内存 | 32GB是底线,64GB才能装下所有档位 |
磁盘 | 约80GB空闲 |
系统 | Win10/11或Linux,除显卡驱动外全自动装齐 |
按内存选量化档位:32GB只能碰Coder档;48GB走IQ2_XS或最快的Q2_0;64GB才把IQ2_XS、IQ3_XXS、IQ3_S全部装下;96GB以上可以上IQ3_S或4-bit。小红书
README里那句原话,值得想掏钱的人抄在纸上:显卡更大只会更快,不会降低内存需求。哔哩哔哩
二、为什么瓶颈是内存:这是个仓库问题
125B的MoE塞进12G显存,靠的不是压缩魔法。Strata把模型的24576个专家拆开存放:每个token实际只路由其中10个专家,所以显卡显存放常驻计算部分和热点专家,内存装下全部路由专家,SSD放n-gram查找表,靠系统页缓存提前预读,命中的交给GPU、未命中的CPU和GPU分担,搬运和计算同时进行。 微博大V tombkeeper在491赞的长帖里把这篇论文读得很干净,顺手给了一组同硬件对照:RTX 3090跑IQ3_S,llama.cpp 20 t/s,Strata 67 t/s;作者本人用12G的RTX 5070跑IQ3_XXS也有65.6 t/s。哔哩哔哩微博
这个架构决定了速度不是一个数,而是两个数:decode看命中率,受内存容量和量化档位约束;prefill看搬运,受内存带宽、SSD速度和CPU约束。 官方那台5070+64G内存的机器短对话跑出93 t/s,是前者的成绩单;后者才是折腾的人真正撞的墙。哔哩哔哩
三、一周二十多个汇报,分布长这样
评论区比视频诚实。把一周内的社区自报数据(证据等级均为单机组报告)排成一列,规律就出来了:
配置(全部为用户自报) | 档位/上下文 | 结果 |
|---|---|---|
3060 12G + 64G DDR4 3600 | IQ3系 | 平均42,峰值70 t/s |
3060 12G + 128G DDR4 2133(X99双E5) | IQ3_XXS,128K开图 | 平均36,峰值55 |
X99 96G + 双3080 | 265K上下文 | prefill冲到2000,decode 60-70 |
5060Ti 16G + 64G DDR4 3200 | IQ3_XXS,MTP+视觉全开512K | 稳定运行,“最大1M正好吃满内存” |
32G显存 + 96G DDR5 6000 + PCIe4.0盘6500MB/s | IQ3_S | 约100 t/s,内存实际占用70G |
Pro5000 72G + 128G | IQ3_S | 100-120 t/s |
7900XTX + 256G(E5服务器改) | IQ3_XXS | 60-80 t/s,A卡路线通 |
笔记本4080 12G + 64G | IQ3系 | decode 40-60正常,prefill只有250 |
5070 8G + 64G | IQ3系 | 3 t/s——UP主回:容量够,是你没清空后台 |
三句话读完整张表:同档位速度能差2-3倍,变量全是内存频率、通道数、SSD和进程卫生,显卡几乎不参与这场内卷。 prefill的差距更夸张,250和2000之间隔了十倍,那是搬运工道的宽窄。内存占用是动态账本,不是文件大小。 知乎上那个"本地跑Agent为什么内存占用比模型文件大十倍"的问题,10月5日刚被讨论透:运行时除了权重,还要装KV缓存、激活、注意力工作区、框架开销和Agent历史;上下文上限的算法是(可用内存−权重−固定开销)÷每token缓存,再留任务余量。 "模型装得下"和"Agent跑得起"之间隔着一整本账。官方档位表和社区实测互相印证:48G是"勉强跑点生产力",64G是"能当执行模型"的分水岭,96G以上才是IQ3_S的舒服区。 至于32G的Coder档——官方给了它,但视频区里关于coder版本"问他他是谁,他说他是通通通"的段子,点赞过的人不少。底线档位拿来进门,别拿来干活。知乎哔哩哔哩
四、钱该放哪:三笔账,显卡排最后
把上面的分布换算成升级动作,优先级是这样的:
第一笔:容量账。 32G内存的机器,档位天花板就是Coder/Q2。想摸IQ3和256K上下文,64G是官方划的线。还有个容易踩的坑:4bit档64G内存也能启动,但权重要从硬盘读,速度会掉到个位数,真上4-bit请按96G准备。 老机器最省钱的凑法被评论区验证过:千元左右换四槽主板+内存上64G;服务器党DDR3四通道顶得上DDR4双通道,省30%—40%。小红书
第二笔:带宽账。 主战场是长文档、RAG、大上下文的,光有容量不够:内存频率和通道决定prefill,SSD(PCIe 4.0、6500MB/s这级)决定专家表预读,顺手给系统盘留足80GB空闲。笔记本4080 prefill 250就是活教材——显存再大,也补不了窄的搬运通道。
第三笔才是显卡,而且排最后。 官方原话已经替你把这笔钱省了:"显卡更大只会更快,不会降低内存需求。"只有一种情况值得先动卡:你在坑区——20系老卡和12代以前的CPU,对这套搬运架构的支持明显差,那支"2080ti部署Strata:很牛!很强!很大坑!"的视频一万一千播放,大半评论在互救。 或者本来就只有8G显存。顺带两笔容易被跳过的账:整机拉满约400W,一天跑10小时就是3度电,商电一个月150元上下,夜班常开奔着500元去。 以及同样的预算,从64G加到96G内存,大约是五万元级192GB新主机价格的零头——想跑这一代MoE,真不用先买那种主机。哔哩哔哩哔哩哔哩
五、动手前,先过四问、盯三个信号
四问自检:
你的问题是"装不下"(OOM、被杀进程)还是"跑不动"(慢、prefill卡)?前者补容量,后者补带宽。
你主要派什么活?纯问答和代码补全,27B加32G内存就够;长文档、RAG、Agent夜班,才需要把上面这张档位表当真。
你在坑区平台吗(20系/12代前CPU/A卡支持列表外)?不在就别换卡。
系统盘有80GB空闲、内存到64G了吗?没有的话,先别下模型。
继续盯的信号: 项目还在日更(0.1.31→0.1.38→0.1.40只用了两周),每次版本跳都会改推荐档位,动手前先读当天的README;Qwen4 Flash-Next是否开源、会不会把可用档位门槛再往下压,评论区"等Qwen4"的赞数一直没掉;内存价格还在往上走,属于"要买就趁早"的那类窗口。
linuxdo那支视频的标题问得好:等显存真的不值钱了,27B还有意义吗?它自己的答案是——真正的问题会变成"同样的机器能同时跑几个Agent"。 Strata这一周改变的并不是125B能不能跑,它把本地AI的入场问题从"我的显卡装不装得下模型",换成了"我的仓库有多深、搬运过道有多宽"。哔哩哔哩
想上车的,先把官方那张门槛表对着自己的配置单过一遍。钱,优先给能装下全部专家的那一层。