国庆这周的B站科技区,标题里反复出现同一个词:Strata。一个10月2日发的实测视频拿下8.2万播放、9378次收藏——收藏比点赞多出一倍还多,这在装机内容里是"先码后看、码完就装"的典型信号。32万粉的零度解说在9月29日跟进"8G显存硬扛125B、N卡A卡都能用"的实测。 今天知乎还在被问的老问题"为了实现大模型的本地部署,应该怎么配置电脑硬件"下面,最新回答已经把方案拆到了3000元、8000元、15000元三档。哔哩哔哩知乎
背景画面却是另一回事:这三个月装机党看到的就是一个字——涨。显卡、内存、固态全线新高,“电脑DIY死透了"这种标题都能上热门。 就在这个当口,Strata把本地AI的门槛问题掀了个面:以前问"你显卡多少钱”,现在问"你内存插了几条"。哔哩哔哩

180B是怎么塞进12G显存的:显卡放热的,内存兜底的
这套东西由两半组成,模型和引擎各干一半的活。
模型是Qwen3.8-Flash-Next的GSQ-RCO量化版(ISTA-DASLab发布)。它是180B级的MoE(混合专家)模型:125B主体参数+51B的n-gram辅助表+4B的MTP投机解码模块,48层、每层512个专家,但每个token只激活其中10个。 翻译成人话:模型账面180B,实际每次运算只叫醒不到零头的"打工人"。IQ3_S量化后整个文件83.6GB——远超任何消费级显卡的显存——但热专家驻显存、冷专家和n-gram表躺在系统内存里按需调取,这是Strata引擎(目前版本v0.1.31)干的活。N卡能跑,A卡同样实测跑得动——有用户晒出7900XTX的60–80 t/s实测。 连魔改22G的2080Ti都有人在评论区晒了成绩单。哔哩哔哩哔哩哔哩
质量上,发布方自己的评测表里IQ3_S拿到GPQA-Diamond 92.93、LiveCodeBench v6 86.86,三项均分93.26,对比BF16基线的93.12——结论"同等水平,体积不到四分之一"。 先说清楚:这是原厂口径,不是第三方复测,后面会看到这轮实测社区里对量化档位并没有一边倒。哔哩哔哩

一周内的真实实测拼成一张表:速度几乎和显卡价格无关
单条UGC只能告诉你"我的机器能跑"。把Strata官方README、三个B站视频简介和评论区里带完整配置的回复拼起来,能看出更值钱的东西——不同机位的实际速度分布:
机器配置 | 量化/上下文 | 实测速度 | 来源 |
|---|---|---|---|
RTX 5070 12G + R5 7600 + 64G | IQ3_S | 短对话93 t/s;32K输入prefill 2170 t/s | Strata官方README |
4080S 32G+5070Ti 16G双卡 + 128G DDR4四通道 | IQ3_S | 105.8 t/s(官方对24G级估计100–140) | B站实测视频 |
5070Ti 16G + 48G内存 | IQ2_XS、128K、开视觉+MTP | prefill 1500–2000;decode 70–85,模型占内存64G | 视频评论区(160赞) |
4080笔记本 12G + 64G | IQ3_XXS、256K | 40 t/s | 视频评论区(85赞) |
4080S 32G + 32G内存 | IQ2_XS、256K | 显存吃满+26G内存,decode 70–100、随轮数回落 | 视频评论区 |
双路至强4210 + 128G + 2080Ti 11G | IQ2 | 35–40 t/s | 视频评论区 |
E5-2698 v2 + 64G + 2080Ti 22G魔改 | Q3、128K | decode 40,但prefill只有700 | 视频评论区 |
三个规律直接改变配机思路:
decode速度和卡的新旧关系不大。12G的5070和48G双卡平台同处一个数量级,跑180B这件事不再需要5090。哔哩哔哩
真正的地板是内存容量。社区给出的可用门槛是"至少48G、正常64G、32G尴尬"。 256K上下文的大户往96G、128G走。下限也有:有人拿8G的5060+32G DDR4用最低量化档跑出了20 t/s——但那个档位恰恰是下一节要提醒的塌陷区。哔哩哔哩
老平台的天花板在CPU和内存带宽。双路至强跑得动,但E5平台的prefill只有700t/s——读一份十万字的文档,等的分钟数全在CPU这一头。

账单从显卡挪到内存,而内存正在历史最高价上
省下的显存钱,转头要用内存还——偏偏内存是这轮涨价最狠的一档。现货板数据(memoryindex.io汇总DRAMeXchange/TrendForce,9月23日口径):DDR4 16Gb颗粒同比涨约690%,DDR5约480%,老一代反涨过新一代。知乎
消费端的具体体感:16G DDR5单条从去年的450元上下涨到约1800元。 七彩虹刚上架的国产颗粒DDR5-6000 32GB定价3999元,256G单条DDR5已经突破4万元。知乎知乎微博
微软这周甚至公开把"降低Win11内存占用"列为重点工作——连操作系统都开始替你省内存,这轮是什么量级不用多形容。微博

拿它换算一下Strata的入场券:照32G一根3999元的行情,64G约8000元;放一年前,64G(4条16G×450元)不到2000元。也就是说,今天光是"插够跑180B的内存",就要花掉去年一台中端主机半台的钱。
于是出现了本轮最魔幻的对照:评论区那句"当初脑袋抽筋插满128G真是正确的选择"——2024年"贪大求全"塞满内存槽的人,成了唯一一批零成本上180B的幸运儿。 而涨价周期里咬牙上16G新卡+32G内存的人,反而卡在半路:显卡绰绰有余,内存差一口气。更往后看一层,本地AI这波热度本身就在制造新的内存需求,"这个项目友好64G内存"的高频提醒,正在把大容量条子变成下一个被盯上的目标。哔哩哔哩
先别急着装:这轮实测社区自己埋的四颗雷
热闹归热闹,Strata还是个0.1.x的早期项目,翻车反馈同样在评论区挂着:
量化不是随便往下砍。有人实测IQ1m(把512专家剪枝到256)后中文能力"被完全剪枝",对话迅速回退成英文。 也有高赞观点认为"Q4以下质量严重塌陷、循环断流"。原厂IQ3_S≈BF16的分数是发布方口径,档位选择上宁可显存内存换质量。哔哩哔哩
MTP投机解码有死循环问题。233赞的反馈帖:跑swift家IQ3_S量化版做长任务时陷入循环、代码分数塌陷,社区怀疑与jinja对话模板有关,换固定模板可解——新项目,小坑密。
老平台别高估。至强、E5跑得动≠用得住——晒出E5+魔改2080Ti成绩单的机主自己就承认,decode有40,但prefill只有700:聊天挺快,读一份十万字的长文档会等到你怀疑人生。
想走传统稠密路线的,显存阶梯表依然有效。27B稠密的Q4_K_M是15.33GB,加上视觉投影层总占用约16.2GB——16G卡是"刚好够"不是"绰绰有余",上下文得压到8K以内。别用MoE的结论去做稠密的预算。知乎
对号入座:谁直接上,谁掏钱前再算一遍
已经有12–16G显卡+64G以上内存:直接装,这就是你的版本答案。零成本捡AI入场券,40–90t/s的输出速度干日常写作、代码问答完全够用。
16G卡+32G内存(涨价期高位上车):最尴尬的一档,别急着加。补到64G要再花四五千,只为"跑个模型"不值;你有稳定的编码Agent/隐私文档需求再动手,否则先拿云API按月算token账,大概率比给内存厂商送钱便宜。
8G显存老卡+16G内存:这场先不参加。先把系统省出来的那点内存顾好(Win11瘦身、关SysMain这类),本地AI是内存自由以后的事。
正犹豫要不要为AI上5080/5090:逻辑变了。MoE+内存卸载路线下,"中端卡+大内存"的泛用性高过大显存单卡,高价追顶配显存的钱够你买两张卡的内存还多——除非你锁定稠密大模型、微调或批量生产场景。
等等党,先拆账本:近端价格。10月4日的硬件日报都在讲Q4合约价涨幅明显收窄,但收窄不等于下跌——TrendForce 9月30日的四季度预测仍是DRAM合约价环比+10~15%、NAND +15~20%、企业级SSD +23~28%。哔哩哔哩知乎
等等党,账本的另一半:结构性供给。再往后看,2027年HBM出货位元预计年增50–60%仍不够需求、SK海力士新增产能要到2028年才释放,美光财报口径是2027–28年供需比今年更紧。 连英伟达都在给Rubin Ultra评估把HBM堆叠降配的方案,部分产品考虑更多采用8层,说明贵的已经不是"能不能造",而是"排不排得到"。知乎微博微博
等等党,软件账本:进步不等降价。硬件降价等不来,而软件侧的进步这周才刚加完N卡A卡支持、Strix Halo核显适配已经在作者日程上。哔哩哔哩

结尾多说一句
这轮最有意思的变化,不是"180B能在12G卡上跑"这个数字本身,而是装机单第一次换了主角:过去十年DIYer讨论"配什么卡",现在讨论的是"还差几条内存"。PC DIY没死透,死的是一种惯性——你以为门槛在涨价最凶的那个零件上,其实它一直在换地方。
接下来盯三件事:内存现货价会不会被本地AI需求再推一波、Strata到v0.2的稳定性、以及有没有第三方拿IQ3_S档位复测出明显低于原厂的成绩。有任何一个变数落地,上面这几类人的动作就都得重算。