「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

源自943位全网作者

10:05

国庆假期第三天,"在自己电脑上跑大模型"这个圈子同时炸了两条消息,方向完全相反。

第一条来自开源社区。一个叫 Strata 的推理引擎刷屏了:一张 12GB 显存的 RTX 5070,配 64GB 内存,把总参数约 176B 的 Qwen3.8-Flash-Next 跑到了 93 token/s。B 站、小红书、知乎同时开测,小红书那条"12G显卡畅跑Qwen3.8 flash"发出去一天多,收藏冲到 3300+,评论区一堆人在报自己的配置和速度。很多人的第一反应是:我那张吃灰两年的老卡,是不是又能用了?小红书

第二条来自英伟达。美东时间 10 月 2 日,官方给桌面 AI 主机 DGX Spark 加了一个 64GB 统一内存的新配置,10 月 23 日起通过宏碁、华硕、戴尔、技嘉、惠普、微星六家 OEM 开卖,起售价 4999 美元。而这台机器去年首发的时候,是 128GB 内存,卖 3999 美元。知乎

内存砍掉一半,起售价反而贵了 1000 美元,涨幅 25%。今年 2 月,128GB 的 Founders Edition 已经从 3999 涨到过 4699 美元;这一轮媒体报道的 128GB 新价格是 6950 美元——这个数字最早出自 guru3d,几家转述口径一致,但英伟达官网现在只写"通过授权渠道购买",没有公开标价页,所以先当媒体报道看,等渠道价签落地再确认。Tom’s Hardware 补了一句更现实的:市面上 128GB 的 GB10 整机,实际成交价已经到了 7000 到 9000 美元。知乎微博知乎

这两件事放在一起,说的其实是同一句话:本地跑大模型的门槛,正在从"显存"挪到"内存"。而内存,恰好是 2026 年涨得最狠的那个零件。

门槛降了,门票涨了。这才是这个国庆本地 AI 圈最真实的样子。下面把这两件事拆开算清楚。

一、Strata 到底做了什么:不是把模型压小,是把模型"分房间放"

先说清楚原理,不然那些速度数字看不懂。

Qwen3.8-Flash-Next 是阿里 8 月 26 日开源的模型,基于下一代 Qwen4 架构,多模态,180B 级稀疏 MoE。它有几个数字很关键:总参数约 176B,48 层、每层 512 个路由专家,但每个 token 只激活 6B。结构上大致是 125B 主体 + 51B 的 n-gram 哈希嵌入表 + 4B 的 MTP,那块 51.2B 的哈希表一家就占了全部权重的 29%。知乎

"总参数很大、激活很小"这个组合,是整件事能成立的前提。以前跑大模型,显存要装下全部权重,因为不知道下一步会用到哪一部分。MoE 不一样——每个 token 只走 512 个专家里的 10 个,绝大部分权重在绝大部分时候是闲着的。闲着的部分,就不必待在显存里。

Strata 干的就是这件事,社区把它的架构概括成"四室调度"。哔哩哔哩

  • 显存:常驻核心注意力混合器 + 当前热门的专家。12GB 就够。

  • 内存:64GB 系统内存并行承载那 24,576 个 MoE 稀疏专家。

  • NVMe 固态:预取那块 51B 的 n-gram 大表。

  • CPU:负责调度和本地计算,所以它对 CPU 和内存带宽是有要求的。

社区实测的一张监控面板,基本就是上面那段话的实锤:12GB 显存被吃到 11.8GB,64GB 系统内存被吃到 60.9GB,168K 上下文,输出 48.2 token/s。显存这一栏几乎没有富余,但真正扛住模型主体的,是那条 64G 内存。小红书

「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

翻译成买东西的语言:这套方案把成本从"一张大显存显卡"换成了"一大条内存 + 一块够快的固态"。 一份真实的配置单长什么样,下面这张就是——显卡、内存、固态三样凑齐,钱主要花在中间那样上。

「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

这个转换有多值钱,看实测就明白了。Strata 官方 README 给的那台机器,配置低得有点反常识——RTX 5070 12GB + 锐龙 5 7600 + 64GB 内存,跑 GSQ-RCO IQ3_S(83.6GB):短对话 93 token/s,32K prompt 的预填充速度 2170 token/s。B 站有个团队用双卡 48GB 显存 + 128GB DDR4 复现,跑到 105.8 token/s,正好落在官方给的"24GB 卡约 100–140"区间里。知乎哔哩哔哩

更值得看的是社区自己攒出来的那张配置表。我翻了 B 站三个视频的评论区、知乎的实测帖和小红书的部署笔记,把能对上号的数据拉了一遍:

配置

量化

实测速度

来源口径

RTX 5070 12G + R5 7600 + 64G

IQ3_S 83.6GB

短对话 93 t/s;32K 预填充 2170 t/s

Strata 官方 README

RTX 4080S 32G + 5070Ti 16G + 128G DDR4

IQ3_S

105.8 t/s

B 站第三方复现

RTX 4090 24G + 64G

—

40–100 t/s,均值约 60

B 站评论区实测

RTX 5060Ti 16G + 64G DDR4

IQ3-XXS

200K 上下文后仍稳定 40–50 t/s

B 站评论区实测

RTX 4060Ti 16G + 64G

IQ3_XXS

30 t/s(换 Strata 前只有 15–16)

B 站实测

4080 笔记本 12G + 64G

IQ3-XXS

256K 上下文 40 t/s

B 站评论区实测

RTX 5090 + 48G DDR5

Q3_S

decode 90 / prefill 1800+

社区分叉版实测

双 3080 20G

—

decode 120 / prefill 2900

B 站实测

双 2080Ti 22G + 32G DDR4

Q3_S

decode 45–60 / prefill 1200–1600

社区分叉版实测

RX 7900 XTX + Xeon E5-2696v4 + 62G

Coder IQ1_M

持续输出 61.9 t/s

知乎代码审计 + 实测

2080Ti + 64G 内存

IQ3-XXS

25 t/s,40 分钟写了 1000 多行

B 站评论区实测

DGX Spark 128G(带宽 273GB/s)

Qwen3.8-27B 稠密

开 MTP 约 20 t/s;长上下文掉到个位数

知乎实测

看这张表有三个地方值得停一下。

第一,最低门槛比传闻中还低。 有人实测原版 IQ3-XXS,内存吃掉 57GB,显存只吃 7GB。也就是说 8G 显存的卡理论上也能进,前提是你有那 64G 内存。

第二,速度差异主要不来自显卡,来自平台。 一位用单卡 3080 20G 的人测了两天,结论是"吃 U、吃显卡、吃内存带宽、吃 PCIe 带宽、吃硬盘带宽"——同一张 3080,配 Xeon 2680v4 预填充只有 300–600,换 5900X 能到 800–1600,差了两三倍。这意味着你在评论区看到的每一个速度数字,都得连着 CPU 和内存规格一起读,单看显卡型号做判断会错得离谱。哔哩哔哩

第三,最后那行 DGX Spark 需要解释一下,不然容易被误读。 4999 美元的官方盒子跑 27B 只有 20 t/s,12G 的 5070 跑 176B 却有 93 t/s,看着像打脸,其实不是同一件事:Qwen3.8-27B 是稠密模型,每个 token 都要过全部 27B 参数;Flash-Next 是稀疏 MoE,每 token 只激活 6B,计算量差了四倍多。DGX Spark 的真问题是统一内存带宽只有 273GB/s——知乎那篇实测定得很准,“内存带宽是硬伤”,不开 MTP 的话上下文一长生成就掉到个位数,131K 上下文的首字延迟接近 4 分钟。它的强项在预填充,长文档喂进去反而比 5090 稳。知乎

一句话总结这一节:Strata 让"12G 老显卡跑大模型"从标题党变成了可复现的事实,但它换来的代价是把瓶颈推给了内存容量、内存带宽、CPU 和 NVMe。

二、正好,内存是今年最贵的那个零件

这就是这件事最拧巴的地方。

Strata 火起来之后,B 站那条 2080Ti 部署视频底下,点赞最高的一批评论里有一条只有五个字:“16+32 天塌了”——16G 显存 + 32G 内存,是过去两年最主流的甜品级配置,恰好被这套方案的 64G 内存门槛卡在门外。小红书

另一条更直接:"正常人誰會有 64GB 的記憶體的,到頭來還是跑不了。"底下 15 条回复,有人晒 128G 说正在用,也有人在问 32G 行不行——答案是勉强,显存加内存总量撑得住就能跑,但会频繁撞墙。哔哩哔哩

再看这一轮内存的价格。

小红书一个装机号 9 月 22 日记的账:16G 内存从 450 涨到 1800,翻了两番。8 月 24 日另一条涨价预警更具体,金百达黑刃 DDR5-6000 C36 的 16G×2 套条,历史最低价 719 元,当时报价 3689 元,涨了 2970。小红书

10 月 2 日的国庆行情速览结论只有一句话——“除了 CPU,其他全在涨”,内存是这轮震中,连拆机条一个月都涨了两成,低价套条每天都在消失。小红书

老平台也没躲过去。9 月 29 日的 DRAM 现货盘口上,16Gb 规格 DDR4 颗粒均价 83.66 美元,同容量 DDR5 只报 57.833 美元——上一代比新一代贵了将近 45%。知乎有人在回答里点破了传导链:Flash 本地部署有了新方案、需要大内存,二手 DDR4 服务器主板价格直接翻倍,“这种纯跌价的主板都能大涨,说明内存还有不小的上涨空间”。知乎

「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

供给端的数据更硬。伯恩斯坦 9 月研报:当前内存毛利率已达 91%,闪存 87%,远超历史上任何一轮周期——此前最高的一次峰值毛利率是 76%。91% 是什么概念,成本 9 块的东西卖 100 块。瑞银预测明年传统 DRAM 毛利率会到 95%,伯恩斯坦预估这轮周期 2028 年结束。知乎

美光 CEO 的说法是,2027 和 2028 年的供需可能比 2026 年更紧,而且 2027 年超过 75% 的产出已经被客户承诺采购——明年的货还没生产出来,位置已经被占完了;爱达荷州新厂要到 2028 年末才开始出片。知乎

连英伟达自己都是这么算账的。它给 64GB 版 DGX Spark 找的官方话术是"保持可及的价格点",HotHardware 的翻译版本更直白:用减内存对冲 RAM 涨价。海外媒体给这轮行情起了个外号叫 “RAMpocalypse”(内存末日),Tom’s Hardware 给这次发布的标题是"内存末日里给本地 AI 爱好者的救生圈"——能不能跑,比跑多大重要。

「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

英伟达顺带把"两台凑一台"这条路也铺好了:两台 64GB 通过 QSFP 线直连,组成 128GB 内存池,官方称可支持最高 2000 亿参数模型,在 Qwen3.8-27B 的测试里集群性能约为单机的 1.7 倍——注意是 1.7 不是 2,互联开销真实存在。但换个角度,两台买到的核心不是翻倍算力,是翻倍内存容量:让原本装不下的模型装进来,这比"同一个模型快一点"值钱。

不过,别把"涨"听成"明天必须买"

这里得给一盆冷水,因为上面这些数字全是卖方口径。

宏碁董事长陈俊圣 9 月直接反驳了存储三巨头的说法:内存一路涨到 2027 并不是事实,反垄断法规限制厂商直接协商定价,于是大厂通过公开放话涨价、互相传递调价信号;他还判断新增产能会在 2027 年年中集中落地,价格大概率在那时见顶。这条帖子 471 赞、237 评论,装机圈吵得很凶。小红书

小红书一个持续跟存储行情的作者给了一个更具体的数:9 月下旬,渠道端头一回出现"卖家让价",DDR5 64G 中位报价从 19165 掉到 18036,降了 5.9%。他的概括只有十个字——“指数在喊涨,渠道在降价”。同一个人还吐槽:“我购物车里那根内存条,躺了半年,一分钱没涨。”小红书

知乎一个 5 万浏览的回答给出的零售口径是:16G D5 全新 1300–1500、二手 900 左右,“价格基本持平买方市场”。

还有一条更容易被读错的信号:10 月 2 日美股收盘,存储板块集体重挫,希捷科技、西部数据双双跌超 10%,盘中一度分别砸出 16% 和 14% 的深坑,但美光科技只跌超 2%。微博

砸盘的原因是东芝一纸扩产公告,不是 AI 存储需求塌了——市场自己把话说得很清楚:美光只跌了 2% 出头,远没有希捷、西数狠,说明 DRAM/NAND 的 AI 需求逻辑没被东芝这颗石头砸到。机械硬盘崩的是"冷数据、近线"那条涨价逻辑,和你要买的内存条不是同一套供需——看到"存储股暴跌"就以为内存要降价,是这轮行情里最容易抄错的一个方向。微博

更值得注意的是零售端已经开始分化。一个持续记录 GPU 和内存行情的账号,9 月 24 日那期的结论是:GPU 板块 17 款里 10 涨 4 跌 3 平,RTX 5090 32G 风扇版从 47,300 涨到 49,300;但 DDR5 的 64G 规格,10 个主流规格里有 9 个回落,是当期最明显的偏弱板块。小红书

所以更准确的描述是:高位横盘 + 局部松动 + 结构性分化,不是单边上涨。囤货等涨这件事,历史上接盘的人都不好看。真正该做的动作是搞清楚自己缺哪一档,而不是被"再等就买不起了"推着下单。

三、三笔账,一笔一笔算

账一:一次性硬件账——你缺的其实不是显卡

把"12G 显卡跑 125B"翻译成购物清单,大概率是这样:一张你可能已经有的老卡(8G 显存起步,12–16G 舒服)+ 64G 内存 + 一块够快的 NVMe。

新增支出主要落在内存上。按前面那套装机号记录的零售口径,一套 DDR5 16G×2 从 719 涨到 3689;凑 64G 意味着四条,或者两条 32G。DDR4 老平台看似便宜,但现货颗粒价已经倒挂到比 DDR5 贵 45%,二手服务器主板价格翻倍,"便宜"这条路正在快速关闭。

一个反直觉的结论:这波最划算的人,是那些一年前莫名其妙买了 64G 内存、被朋友说"你买这么多干嘛"的人。 他们的显卡可能一分钱没涨、甚至还在跌——10 月 1 日的显卡日报里,锐龙 7500F 跌到 599 元历史最低,CPU 是全线涨价里唯一在跌的品类——而那块"多买的内存"一夜之间从浪费变成了入场券。

账二:持有成本账——本地不等于免费

小红书上有人把这笔账算得很实在:以最常见的消费级方案为例,单卡 RTX 4090 整机约 3 万元,双卡约 5 万元;把折旧、电费、运维全摊进去,单卡每月约 1906 元,其中折旧 625、电费 281、运维 1000;双卡每月约 2604 元。小红书

这组数字里最容易被吵起来的是"运维 1000 元"——你可以说自己的时间不值这个价,也可以说折腾两天装环境就是这么多。但至少电费和折旧是硬的。

知乎那个"本地部署一个大模型就实现 token 自由,真的吗"的问题下,一个 290 赞、113 万浏览的回答给了三条判断标准:① 必须是消费级方案,别拿工业级说事;② 最起码电价要比 token plan 便宜,最好是电价 + 折旧也比它便宜;③ 本地模型能力得合格,不能太弱智、速度不能太慢。他的结论分两半:

“我认为刚刚跨过消费级的及格线,但由于现在消费级的硬件涨价太多,所以还是有点不值得的。”
“我们也算过电费和 token plan 的费用,认为电费已经低于 token plan 了,也就是说 Qwen3.8 Flash Next 已经达到消费级本地部署的可用线了,而且是非常可用。”

翻译一下:能力线过了,价格线没过。 他还给了个参照——Qwen3.8 Flash Next 大概是国产模型第五名的水平,能稳赢它的只有 Kimi K3、GLM5.3、Qwen3.8 Max 和 HY4 预览版。而想在消费级硬件上跑它的 Q8 量化,“基本上要接近十万的价格”——比如 Mac M5 Ultra 256G,或者两台 DGX Spark 组集群,都是巴掌大的盒子,价格却是一台车的量级。知乎

「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

那么账怎么翻得过来?看你的用量。小红书上有个 8 月的帖子写得很扎心——从 3 月份开始接触 AI,不知不觉在各个厂商消耗掉的 Tokens,已经够上一台 50 系显卡了。如果你属于这一类——每月订阅 + API 账单四位数往上,那硬件账两三年就能算平。如果你每月花不到 500,这套硬件要五年以上才回本,而五年后这张卡大概早就不够看了。小红书

顺带说一句,本地部署还有一个不进账本但真实存在的需求:B 站那条"云端 AI 已经这么强了我为什么还要跑本地模型"的视频底下,479 条弹幕里反复出现的是隐私、离线、无审核、以及"断网了也能用"。有位评论说得很到位:钱多、爱折腾、能变现的人可以一直玩下去;但对经济不宽裕的人来说,“速度慢、模型差、投入成本高加上电费,模型还在高速发展,新的好模型出来你机器又跟不上了——这帐无论如何是算不平的”。这句反方意见值得每个准备下单的人先读一遍。哔哩哔哩

账三:能力折价账——跑起来了,和能干活,中间还有一层

这是最容易被"93 token/s"这种数字盖过去的一笔。

好消息是量化本身的质量损失比想象中小。ISTA-DASLab 的原厂评测里,IQ3_S 的 GPQA-Diamond 是 92.93、LiveCodeBench v6 是 86.86、三项均分 93.26;BF16 基线分别是 91.92、87.43、93.12——同等水平,体积不到四分之一。哔哩哔哩

坏消息是社区实测暴露的问题基本都不在跑分表上。10 月 2 日知乎有人发了一份 7800 字的 Strata 代码审计报告,六路并行审加本机实测,在引擎里找到两个会产出错误结果的 bug。具体是这几条:知乎

  1. Q2 别碰。 评论区高赞的原话:“Q2 就别玩了,Q3 就很强”;另一条是"Q2 掉智有点严重,能上 Q3 就上 Q3,真不行就回去跑 27B 的 IQ3-S"。省下的那点内存,换不回可用的输出。

  2. 长任务死循环。 有人拿 Swift 1.5 的 IQ3_S 版和阿里 API 原版对比,数学推理只是略微落后,但编程能力"因为长任务死循环导致分数塌陷严重"。他给的归因很专业:低精度量化、MoE 模型开 MTP,都是容易陷入死循环的常见诱因,这是 MoE 相对稠密模型的天然劣势。

  3. MTP 是把双刃剑。 单流全面提速,并发反而变慢。DGX Spark 那台机器不开 MTP 长上下文掉到个位数、开了能到 20 t/s,是同一件事的两面。

  4. 引擎本身还在打补丁。 那份审计里,`expert_cache.cpp:185` 的 `open_sized` 会把逐层准入信息清掉,导致不同层的专家落进同一 slot、后写覆盖先写,“GPU 算出貌似合理的错误专家”;另一处在跨层切分下自适应交换会读错 cache,写进错误字节,产生"静默错误 token"。报告还指出"投机解码逐 token 相同"在默认设置下并不成立,而仓库自带的测试抓不到这些问题。

  5. 老平台支持差。 2080Ti 那条部署视频的标题就是"很牛!很强!很大坑!“——UP 主整理了 20 系老显卡、12 代以前 CPU 的踩坑文档,最后的结论是"可以体验玩玩,但距离成为 27B 本地部署的上位替代者还有很多问题,省心还是用 27B 吧”。

  6. 和 27B 的强弱还有分歧。 有人说"Q3 Flash 比 27B 强太多了,知识库就不是一个水平,干活更细",也有人坚持"qwen3.8-next 推理质量还不如 qwen3.8-27B"。这个分歧现在没有定论,别当成共识。

对了,还有一条被反复提到的连带效应:Strata 运行时吃 CPU,评论区已经有人在开玩笑说"这项目真要是火起来,那 CPU 估计也得涨价了"。玩笑归玩笑,前面那位测了两天的用户已经把 CPU、内存带宽、PCIe 带宽、硬盘带宽列成了四个瓶颈——你升级的时候不能只盯着内存条。

四、四档机器,对号入座

第一档:16G 显存 + 64G 内存(或以上)。
你是这波最大的受益者,而且一分钱不用花。直接上 Strata + IQ3_S 或 IQ3-XXS,别碰 Q2。参照系:5060Ti 16G + 64G DDR4 在 200K 上下文之后还能稳 40–50 t/s;4090 24G + 64G 平均 60 上下。这个档位现在能干的活,已经接近一年前双卡 24G 的水平。

第二档:16G 显存 + 32G 内存。
"16+32 天塌了"说的就是你。唯一的动作是补内存,但现在补在高位。三条路:① 看你主板支不支持,先加两条凑到 64G,接受这笔溢价;② 继续用 Qwen3.8-27B 的 IQ3-S,稠密模型对内存容量没那么贪,稳定性还更好;③ 什么都不做,等 DDR5 64G 规格的回落趋势确认。第二条路是我最推荐的默认解——评论区已经有人给了参照:单卡 3080 用 ninfer 跑 27B 的 GSQ,156K 长上下文,写代码 decode 峰值还能破百。哔哩哔哩

第三档:8–12G 显存 + 64G 内存。
能跑,官方 README 那台 5070 12G 就是这个档,93 t/s 就是它跑出来的。但速度对 CPU 和内存带宽非常敏感,同一张卡换个平台可能差两三倍。笔记本用户注意散热和功耗墙,4080 笔记本 12G + 64G 的实测是 256K 上下文 40 t/s,比台式同档低一截。

第四档:想整机买一台"官方本地 AI 盒子"的。

  • DGX Spark 64GB / 4999 美元(约 3.5 万人民币):目前少有的"整机 + 全栈"现成答案,Ollama、vLLM、llama.cpp、LM Studio、PyTorch with CUDA 全支持,预装英伟达 Agent Toolkit、CUDA-X、Nemotron,10 月底还有 Sync Model Launcher 一键部署。适合常驻跑 30B–100B、在意数据不出本地的人。

  • Mac 路线:社区总结很干脆——M6、M5 Pro 跑不动,M5 Max 勉勉强强,M5 Ultra 畅跑;要买就 M5 Max 128G 或 M5 Ultra 96G/256G。统一内存架构省心,但 M5 Ultra 256G 接近十万,128G MacBook M5 Max 五万多,而 M3 Max 128G 配 oMLX 的实测反馈是"提升有限"。小红书

  • 两台 DGX Spark 组集群:约 7–8 万,128GB 内存池,1.7 倍性能,能跑 Qwen3.8 Flash Next 的 Q8 量化和 MiniMax H3。这是目前消费级本地部署的能力天花板,也是"接近十万"这个说法的出处。往上还有四台并联的玩法,聚合 512GB 内存,官方口径能上 700B 级模型——但那就已经不是消费级预算了。小红书

「12G显卡跑125B」刷屏同一周,英伟达把DGX Spark内存砍半、价格反涨25%:本地AI的门槛刚从显存挪到了内存——而内存正是今年涨得最狠的零件,动手前先对号四档机器、算清三笔账

买这台机器之前,有两个真实槽点得先知道。知乎有人借了一台试用,“随手布置了一个 Qwen3.8 27B,让他改个 BAT,改了一个小时烫得要死”。微博上有长三角的用户说得更细:这台机器散热设计糟糕到玩家自己 3D 打印罩子、配空气净化器强制送风,因为当地夏天气温已经接近标称的 30 度运行上限。知乎微博

五、现在动手还是再等:盯这三个信号

不要盯新闻标题,标题永远是"还要涨"或者"要崩了"。盯这三个可验证的东西:

信号一:DDR5 64G 规格的零售价,连续两期。 9 月 24 日那期行情里,64G 是 10 个主流规格中 9 个回落的最弱板块;9 月下旬渠道端 DDR5 64G 中位报价还从 19165 掉到 18036。如果这个趋势再延续两期,说明零售端确实见顶;如果掉头走强,说明松动只是短期。有持续记录的行情号不多,找一个固定跟。

信号二:Strata 的 issue 区。 那份代码审计提到的"投机解码逐 token 不一致"修没修,直接决定它能不能从"能跑"变成"能干活"。一个还在产出静默错误 token 的引擎,速度再快也不该放进生产流程。

信号三:内存厂的订单兑现。 卖方预测要打折听——说"未来还会更紧"的人本身就是卖内存的。但"2027 年超过 75% 产出已被客户承诺采购"和"爱达荷新厂 2028 年末才出片"这两件事是硬的,前者是已签合同,后者是物理工期。伯恩斯坦给的周期终点是 2028 年,瑞银和宏碁董事长的反驳都改变不了这个时间量级。等等党这次要等的,不是一次促销,是一轮周期。知乎

最后

如果你手里已经有 64G 内存,这波是纯白捡——你那张 12G 老卡一夜之间从"跑不动"变成"能干活",一分钱不用花,国庆剩下的几天足够你把它折腾明白。

如果你还差那 64G,就要冷静一点:你买的不是"免费 AI",是一张在历史高位的内存票,去换一个还在打补丁的推理引擎、一个量化后可能死循环的 MoE 模型,以及一笔至少三年的持有成本。它值不值,取决于你每个月真实烧掉多少 token,以及你有没有隐私、离线这类云端替代不了的刚需。

如果你连显卡都还没有——那更简单,先别买。用 API 把你的任务、数据、流程和验收标准跑清楚,比先买硬件稳得多。DGX Spark 那篇测评里有句话说得挺好,采购顺序应该是:任务与验收 → 数据与依赖 → 容量与 SLA → 三年总账 → 最后才是设备。知乎

门槛真的降了,门票也真的涨了。这两件事同时成立,不矛盾——它只是把"要不要入场"这个问题,从技术题变回了一道算术题。

内容由AI生成

精选参考来源

1. AI科技与狠活!12G显卡畅跑Qwen3.8 flash!

2. 英伟达推出64GB版DGX Spark,内存砍半,4999美元起售,128GB版涨价至6950美元

3. 内存减半,价格反涨:64GB 版 DGX Spark 卖 $4,999,NVIDIA 把「内存通胀」写进了 AI 硬件

4. 【英伟达推出64GB版DGX Spark,内存砍半,4999美元起售,128GB版涨价至6950美元】英伟达瞄准本地AI需求推出新版DGX Spark,可本地运行最高1000亿参数模型,于10月23日通过OEM厂商上市。

5. 五款 Qwen3.8-Flash-Next GGUF 拆解:社区怎么把 180B 级 MoE 装进 32GB 显存

6. 12GB显存跑180B大模型?Strata引擎让Qwen本地部署突破瓶颈 | Cloud Codes

7. 12gb显存本地部署大模型最佳方案

8. Strata 让普通游戏电脑跑 1250 亿参数大模型

9. 180B的MoE大模型,怎么能塞进一张12GB显卡?Strata × Qwen3.8-Flash-Next本地实测

10. 2080ti,Strata本地部署Qwen3.8 Flash Next!很牛!很强!很大坑!

11. DGX Spark跑Qwen 3.8 27B推理实测:内存带宽是硬伤

12. 强推神项目Strata!12G显卡跑Qwen3.8 Flash Next!速度93t/s!

13. 内存涨价预警📈DDR4/DDR5

14. 10月装机避坑|硬件行情速览

15. 内存到挂!DDR4比DDR5贵44%,内存市场的风向可能变了

16. 内存已超过10倍暴利|显卡日报10月1日

17. 内存涨价,可能才刚到半场

18. 怒揭内幕!内存涨价竟是厂商联手操盘

19. 内存条涨价,为啥我购物车没动

20. 国庆假期美股先给了个前奏:纳指新高、英伟达破顶,但存储双雄被一纸扩产干崩10%——A股要等到10月8日(周四)才开门,节后开门的资金地图已经写了一半。

21. 5090继续走强,64G DDR5普遍回落?

22. 自建本地大模型,真能省下 token 吗

23. 很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?

24. 本地部署大模型才是普通人玩 AI 的底气

25. 云端AI已经这么强了,我为什么还要跑本地模型?(拥有自己的算力的体验)

26. Strata 引擎评测报告 · Qwen3.8-Flash-Next Coder (IQ1_M) — 代码审计 + 本机实测

27. 想买Mac部署大模型的都清醒一点

28. 4台DGX Spark|桌面级AI超算集群

29. 如何评价NVIDIA RTX Spark?

30. DGX Spark 的散热设计十分糟糕,因此玩家们开发了各种用空气净化器强制送风的3D打印罩子。

31. DGX Spark 值不值得买?先过这五个门槛

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章