这周我连着碰到两件事,放在一起看特别有意思。
一件事是库克在财报电话会上,把这轮内存涨价形容成"百年一遇的洪水"。摩根士丹利统计,过去一年DRAM和NAND存储芯片价格已经涨到原来的约6倍。36氪6月份苹果把MacBook全系起售价又上调了一轮,MacBook Pro涨3000元、MacBook Air涨1500元。官网下单一台24GB的MacBook Air,发货排到9月。36氪
另一件事是,B站和知乎上玩Mac本地大模型的那批人,最近晒的配置越来越"离谱":三台MacBook Pro用雷雳5线串成一排,Mac Studio混搭两台英伟达DGX Spark,把400GB、500GB的大模型硬塞进多机拼起来的内存池里。哔哩哔哩
这两件事其实是一件事:当内存又贵又难买,Apple Silicon用户获取"统一内存"的方式,正在从"加钱选配"变成"组网扩容"。
先说清楚这轮内存危机到了什么程度
数据都摆在这:花旗研究显示,今年二季度DRAM平均售价环比涨44%,NAND涨53%;TrendForce预计三季度合约价还要再涨13%到18%。库克在财报会上承认,供应限制主要影响Mac,而且9月季度会"环比显著加剧"。
落到买机器这件事上,就是非常具体的痛:截至8月初,苹果官网16GB版MacBook Air发货要2到3周,24GB和32GB版本要等4到6周;深圳三家苹果直营店,24GB的Air一台现货都没有。时代财经走访的结论很扎心——“越是高内存配置,到货等待时间越长”。
也就是说,被这轮涨价缺货卡得最死的,恰恰是本地AI玩家最想要的那种大内存机器。等?等来的大概率是下一轮涨价。美光的说法是供应紧张要到2028年才会逐步改善。36氪乐观的Omdia也只敢说2027年价格"可能开始修正"。36氪

但先泼盆冷水:你真需要那么大内存吗
这是我写这篇之前反复核实的部分,因为社区里"8GB跑26B"之类的噱头太多了。
真实情况是:模型端的量化和蒸馏进步,正在把本地跑的内存门槛往下打。8月12日Meta开源的Muse-Glimmer-30B,一个正经能干活的Agent模型,4bit量化后不到20GB,一台32GB内存的M4/M5 Max MacBook就能跑,B站有人实测能到30 token/s。36氪哔哩哔哩知乎上还有开发者用vates v2,让80B参数的MoE模型在约10GB内存下跑到"日常可用"。知乎

所以如果你的目标只是日常跑个27B到30B级别的模型,单机24到32GB就是现在的甜点区,后面聊的组网扩容跟你没关系,别被焦虑带着加钱。
真正被逼着扩容的,是两类需求:一是想跑100B以上MoE或者超大参数模型的,二是长上下文。举个实测例子:Qwen3.8-27B在M4 Max上,4K到16K上下文时解码稳定在42 token/s,一到31K上下文直接跳水到11.3——吃的全是内存。
三条扩容路线的真实水平
社区现在实际跑通的路线,大致三条,各有各的坑。
路线一:同代Mac串联。今年4月就有博主把三台M5 MacBook Pro用雷雳5线串起来,用EXO做流水线并行:384GB内存池,把323GB的Qwen3.5-397B塞了进去;跑122B模型双节点能到73 token/s。哔哩哔哩听着很爽,但注意另一组数据——小模型双节点只提速22%,扩展并不是线性的。这条路线的好处是机器平时还能各干各的活,坏处是雷雳5只存在于高端机型,你串的每台机器都不便宜。
路线二:单机顶配,一步到位。M3 Ultra的512GB统一内存目前是桌面端天花板,有人用它2.5bit极限量化跑GLM-5.1;笔记本端则是M5 Max的128GB。好处是省心、稳定、速度快;坏处也直白——贵,而且这轮内存危机里,顶配恰恰是最缺货、涨价最狠的那一档。
路线三:异构混搭,也是最近讨论度最高的。知乎上一篇8万多阅读的长文,记录了M3 Ultra加两台DGX Spark的三机组合:512GB名义内存,用llama.cpp的RPC后端,跑通了406GB的GLM-5.2 Q4量化版。但实测数据值得所有人冷静一下:27B模型单机解码21.13 token/s,三机组网后只剩9.98;406GB的GLM-5.2跑起来稳定在2.76 token/s,计算图被切成106段,作者自己都说异构支持"仍处于早期阶段"。
作者总结的那句话,我认为是这轮讨论里最值钱的一句:三机组网的核心价值不是让所有模型都更快,而是聚合多台设备的内存,运行任何单机都放不下的模型。知乎

我的判断
一句话版本:组网买的是容量,不是速度。任何路线,一旦跨设备,单请求解码速度几乎必降。想清楚这个前提,选择就不难了:
日常用30B及以下:单机24到32GB,这个行情下越早买越便宜;
想要70B到100B还有交互速度:单机大内存没有替代品,要么收二手大内存机器,要么出旧换新;
必须跑200GB以上的MoE、做实验或者团队共用:上组网或异构,接受"能跑但不快",并且留好折腾的预算——三台机器llama.cpp版本必须对齐、406GB权重冷启动要等好几分钟、雷雳5线和万兆交换机的钱也不能漏算。
最后留三个值得盯的信号。一是8月下旬社区在传的M7 Ultra机型可能给到1.5TB统一内存(未经苹果证实),如果成真,单机天花板会被改写。知乎二是TrendForce四季度合约价走势,以及长鑫存储能不能真正进苹果供应链(目前只是测试阶段)。36氪三是llama.cpp和EXO的异构支持成熟度——GLM-5.2的MTP加速一旦在异构方案里跑通,组网的速度账就得重算。

内存危机把Apple Silicon的统一内存,从"买的时候选配多少"变成了"手里的资产怎么配置"。好消息是量化技术还在狂奔:30B的Agent模型已经能压进20GB,80B MoE约10GB内存就能可用——内存通胀和模型瘦身在赛跑,胜负未分。但如果你就打算在这个窗口期出手,先把路线定了再看价格,比干等划算。