12G显卡跑180B大模型、每秒93个token:开源引擎把显卡钱省了,账单挪到了正在天价的内存上

源自45位全网作者

16:21

国庆这周的B站科技区,标题里反复出现同一个词:Strata。一个10月2日发的实测视频拿下8.2万播放、9378次收藏——收藏比点赞多出一倍还多,这在装机内容里是"先码后看、码完就装"的典型信号。32万粉的零度解说在9月29日跟进"8G显存硬扛125B、N卡A卡都能用"的实测。 今天知乎还在被问的老问题"为了实现大模型的本地部署,应该怎么配置电脑硬件"下面,最新回答已经把方案拆到了3000元、8000元、15000元三档。哔哩哔哩知乎

背景画面却是另一回事:这三个月装机党看到的就是一个字——涨。显卡、内存、固态全线新高,“电脑DIY死透了"这种标题都能上热门。 就在这个当口,Strata把本地AI的门槛问题掀了个面:以前问"你显卡多少钱”,现在问"你内存插了几条"。哔哩哔哩

12G显卡跑180B大模型、每秒93个token:开源引擎把显卡钱省了,账单挪到了正在天价的内存上

180B是怎么塞进12G显存的:显卡放热的,内存兜底的

这套东西由两半组成,模型和引擎各干一半的活。

模型是Qwen3.8-Flash-Next的GSQ-RCO量化版(ISTA-DASLab发布)。它是180B级的MoE(混合专家)模型:125B主体参数+51B的n-gram辅助表+4B的MTP投机解码模块,48层、每层512个专家,但每个token只激活其中10个。 翻译成人话:模型账面180B,实际每次运算只叫醒不到零头的"打工人"。IQ3_S量化后整个文件83.6GB——远超任何消费级显卡的显存——但热专家驻显存、冷专家和n-gram表躺在系统内存里按需调取,这是Strata引擎(目前版本v0.1.31)干的活。N卡能跑,A卡同样实测跑得动——有用户晒出7900XTX的60–80 t/s实测。 连魔改22G的2080Ti都有人在评论区晒了成绩单。哔哩哔哩哔哩哔哩

质量上,发布方自己的评测表里IQ3_S拿到GPQA-Diamond 92.93、LiveCodeBench v6 86.86,三项均分93.26,对比BF16基线的93.12——结论"同等水平,体积不到四分之一"。 先说清楚:这是原厂口径,不是第三方复测,后面会看到这轮实测社区里对量化档位并没有一边倒。哔哩哔哩

12G显卡跑180B大模型、每秒93个token:开源引擎把显卡钱省了,账单挪到了正在天价的内存上

一周内的真实实测拼成一张表:速度几乎和显卡价格无关

单条UGC只能告诉你"我的机器能跑"。把Strata官方README、三个B站视频简介和评论区里带完整配置的回复拼起来,能看出更值钱的东西——不同机位的实际速度分布:

机器配置

量化/上下文

实测速度

来源

RTX 5070 12G + R5 7600 + 64G

IQ3_S

短对话93 t/s;32K输入prefill 2170 t/s

Strata官方README

4080S 32G+5070Ti 16G双卡 + 128G DDR4四通道

IQ3_S

105.8 t/s(官方对24G级估计100–140)

B站实测视频

5070Ti 16G + 48G内存

IQ2_XS、128K、开视觉+MTP

prefill 1500–2000;decode 70–85,模型占内存64G

视频评论区(160赞)

4080笔记本 12G + 64G

IQ3_XXS、256K

40 t/s

视频评论区(85赞)

4080S 32G + 32G内存

IQ2_XS、256K

显存吃满+26G内存,decode 70–100、随轮数回落

视频评论区

双路至强4210 + 128G + 2080Ti 11G

IQ2

35–40 t/s

视频评论区

E5-2698 v2 + 64G + 2080Ti 22G魔改

Q3、128K

decode 40,但prefill只有700

视频评论区

三个规律直接改变配机思路:

  1. decode速度和卡的新旧关系不大。12G的5070和48G双卡平台同处一个数量级,跑180B这件事不再需要5090。哔哩哔哩

  2. 真正的地板是内存容量。社区给出的可用门槛是"至少48G、正常64G、32G尴尬"。 256K上下文的大户往96G、128G走。下限也有:有人拿8G的5060+32G DDR4用最低量化档跑出了20 t/s——但那个档位恰恰是下一节要提醒的塌陷区。哔哩哔哩

  3. 老平台的天花板在CPU和内存带宽。双路至强跑得动,但E5平台的prefill只有700t/s——读一份十万字的文档,等的分钟数全在CPU这一头。

12G显卡跑180B大模型、每秒93个token:开源引擎把显卡钱省了,账单挪到了正在天价的内存上

账单从显卡挪到内存,而内存正在历史最高价上

省下的显存钱,转头要用内存还——偏偏内存是这轮涨价最狠的一档。现货板数据(memoryindex.io汇总DRAMeXchange/TrendForce,9月23日口径):DDR4 16Gb颗粒同比涨约690%,DDR5约480%,老一代反涨过新一代。知乎

消费端的具体体感:16G DDR5单条从去年的450元上下涨到约1800元。 七彩虹刚上架的国产颗粒DDR5-6000 32GB定价3999元,256G单条DDR5已经突破4万元。知乎知乎微博

微软这周甚至公开把"降低Win11内存占用"列为重点工作——连操作系统都开始替你省内存,这轮是什么量级不用多形容。微博

12G显卡跑180B大模型、每秒93个token:开源引擎把显卡钱省了,账单挪到了正在天价的内存上

拿它换算一下Strata的入场券:照32G一根3999元的行情,64G约8000元;放一年前,64G(4条16G×450元)不到2000元。也就是说,今天光是"插够跑180B的内存",就要花掉去年一台中端主机半台的钱。

于是出现了本轮最魔幻的对照:评论区那句"当初脑袋抽筋插满128G真是正确的选择"——2024年"贪大求全"塞满内存槽的人,成了唯一一批零成本上180B的幸运儿。 而涨价周期里咬牙上16G新卡+32G内存的人,反而卡在半路:显卡绰绰有余,内存差一口气。更往后看一层,本地AI这波热度本身就在制造新的内存需求,"这个项目友好64G内存"的高频提醒,正在把大容量条子变成下一个被盯上的目标。哔哩哔哩

先别急着装:这轮实测社区自己埋的四颗雷

热闹归热闹,Strata还是个0.1.x的早期项目,翻车反馈同样在评论区挂着:

  1. 量化不是随便往下砍。有人实测IQ1m(把512专家剪枝到256)后中文能力"被完全剪枝",对话迅速回退成英文。 也有高赞观点认为"Q4以下质量严重塌陷、循环断流"。原厂IQ3_S≈BF16的分数是发布方口径,档位选择上宁可显存内存换质量。哔哩哔哩

  2. MTP投机解码有死循环问题。233赞的反馈帖:跑swift家IQ3_S量化版做长任务时陷入循环、代码分数塌陷,社区怀疑与jinja对话模板有关,换固定模板可解——新项目,小坑密。

  3. 老平台别高估。至强、E5跑得动≠用得住——晒出E5+魔改2080Ti成绩单的机主自己就承认,decode有40,但prefill只有700:聊天挺快,读一份十万字的长文档会等到你怀疑人生。

  4. 想走传统稠密路线的,显存阶梯表依然有效。27B稠密的Q4_K_M是15.33GB,加上视觉投影层总占用约16.2GB——16G卡是"刚好够"不是"绰绰有余",上下文得压到8K以内。别用MoE的结论去做稠密的预算。知乎

对号入座:谁直接上,谁掏钱前再算一遍

  • 已经有12–16G显卡+64G以上内存:直接装,这就是你的版本答案。零成本捡AI入场券,40–90t/s的输出速度干日常写作、代码问答完全够用。

  • 16G卡+32G内存(涨价期高位上车):最尴尬的一档,别急着加。补到64G要再花四五千,只为"跑个模型"不值;你有稳定的编码Agent/隐私文档需求再动手,否则先拿云API按月算token账,大概率比给内存厂商送钱便宜。

  • 8G显存老卡+16G内存:这场先不参加。先把系统省出来的那点内存顾好(Win11瘦身、关SysMain这类),本地AI是内存自由以后的事。

  • 正犹豫要不要为AI上5080/5090:逻辑变了。MoE+内存卸载路线下,"中端卡+大内存"的泛用性高过大显存单卡,高价追顶配显存的钱够你买两张卡的内存还多——除非你锁定稠密大模型、微调或批量生产场景。

  • 等等党,先拆账本:近端价格。10月4日的硬件日报都在讲Q4合约价涨幅明显收窄,但收窄不等于下跌——TrendForce 9月30日的四季度预测仍是DRAM合约价环比+10~15%、NAND +15~20%、企业级SSD +23~28%。哔哩哔哩知乎

  • 等等党,账本的另一半:结构性供给。再往后看,2027年HBM出货位元预计年增50–60%仍不够需求、SK海力士新增产能要到2028年才释放,美光财报口径是2027–28年供需比今年更紧。 连英伟达都在给Rubin Ultra评估把HBM堆叠降配的方案,部分产品考虑更多采用8层,说明贵的已经不是"能不能造",而是"排不排得到"。知乎微博微博

  • 等等党,软件账本:进步不等降价。硬件降价等不来,而软件侧的进步这周才刚加完N卡A卡支持、Strix Halo核显适配已经在作者日程上。哔哩哔哩

12G显卡跑180B大模型、每秒93个token:开源引擎把显卡钱省了,账单挪到了正在天价的内存上

结尾多说一句

这轮最有意思的变化,不是"180B能在12G卡上跑"这个数字本身,而是装机单第一次换了主角:过去十年DIYer讨论"配什么卡",现在讨论的是"还差几条内存"。PC DIY没死透,死的是一种惯性——你以为门槛在涨价最凶的那个零件上,其实它一直在换地方。

接下来盯三件事:内存现货价会不会被本地AI需求再推一波、Strata到v0.2的稳定性、以及有没有第三方拿IQ3_S档位复测出明显低于原厂的成绩。有任何一个变数落地,上面这几类人的动作就都得重算。

内容由AI生成

精选参考来源

1. 180B的MoE大模型,怎么能塞进一张12GB显卡?Strata × Qwen3.8-Flash-Next本地实测

2. 强推神项目Strata!12G显卡跑Qwen3.8FlashNext!速度93t/s!

3. 8G 显存竟能跑 125B 大模型!内存硬抗 Qwen3.8-Flash-Next,N卡、A卡都能用!本地部署实测 | 零度解说

4. 电脑DIY死透了,看完这个视频我的心也死了!正常价格VS现在价格,看明白了把!

5. AMD显卡7900xtx开源项目Stratawin11跑Qwen3.8FlashIQ3_XSS实测60-80t/s

6. 第四季度内存固态涨幅大幅收窄|显卡日报10月4日

7. 为了实现大模型的本地部署,应该怎么配置电脑硬件?

8. 内存条为什么越来越贵:涨得最凶的不是 AI 用的那一代

9. 国产内存造出来了,你的内存条还是1800块

10. 国产颗粒的 32GB 内存条也要 3999 元,存储涨价离见顶还有多远?

11. 【#1盒内存条堪比上海1套房#,#一个256G内存条价格已超4万元#】如果说黄金是传统意义上的避险资产,那么在2025年下半年到2026年初的全球市场上,大幅跑赢金价的,却是一根根不起眼的内存条。全球DRAM(内存)市场正经历一轮“史上最强”的涨价周期。自2025年7月以来,DRAM价格持续快速上行,多数品类...全文

12. 【内存涨价倒逼系统瘦身:微软详解Win11为何要降低RAM占用】内存价格持续上涨,微软将降低Win11内存占用列为重点工作,将从系统底层到应用框架多层面优化内存利用率,目前已取得阶段性进展。#微软Win11#

13. A股科技股下一个主线可能就是CPU了,继内存后CPU又炒起来了美光(存储大厂)财报提醒:2027、2028年内存的供需紧张程度,会比2026年还要严重。就算现在新建的内存工厂全部投产,产能也跟不上需求。很多客户现在主动签长期锁货合同,不是预判降价,反而是怕后面涨价、拿不到货。当前高端AICPU产能...全文

14. 2027年的存储,到底会不会过剩?在9月29日披露,由于价格和供应约束,GPU和ASIC厂商正在研究降低单颗芯片的HBM配置,部分产品考虑更多采用8层方案。一个行业已经贵到逼客户重新设计产品,至少说明2027年初面临的主要矛盾还不是“卖不出去”,而是先进内存太抢手。这恰恰是市场容易高估2027年供给的地...全文

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章