这几天AI硬件圈发生了一件挺有意思的事:三件看似不相关的动态在同一周汇合,全都指向同一家公司——英伟达。
9月22日,苹果新款Mac Studio(M5 Ultra版)正式开售交付,46999元起;9月24日,高盛发了一份观点相当直接的研报:如果更多推理任务迁移到终端设备和企业自有机器上,英伟达在AI推理增量里能拿到的份额,可能低于市场当前的预期——他们甚至建议客户用"做多苹果、做空英伟达"的期权组合来表达这个判断。同一天,苹果硬件主管Johny Srouji接受路透社采访的话被广泛转发:企业一旦买断设备,就不用再为每一次推理请求向云端按token付费。华尔街见闻微博
再加上一个预告:10月下旬,512GB内存版的Mac Studio将到货。华尔街见闻
对盯着英伟达的人来说,这事有两层意义。往大了说,这是苹果第一次把"本地推理"做成明码标价的商品,摆上货架跟英伟达的推理地盘正面竞争;往小了说,如果你正盘算着置办一台跑大模型的机器,这就是一个真金白银的选择题——堆N卡、买Mac,还是干脆租API?今天把这三笔账一次算清。
先复盘:苹果是怎么把演示变成商品的
这条时间线其实不短。今年6月的WWDC上,LM Studio和苹果现场演示了一出好戏:四台Mac Studio组成集群,用雷雳5互联,拼出约1.5TB的统一内存池,在本地跑起了月之暗面的万亿参数模型Kimi K2.6(MoE架构,激活参数320亿),实测生成速度28 tokens/s。当时这个演示就在圈里炸了一波——放在几年前,本地跑万亿参数模型是天方夜谭。微博

8月25日,苹果正式发布新款Mac Studio:M5 Max版19999元起,M5 Ultra版46999元起,标配96GB统一内存加1TB存储。M5 Ultra最高36核CPU加80核GPU,内存可选到256GB、512GB,最高内存带宽1.2TB/s,机身带6个雷雳5接口。256GB加4TB的配置参考售价97999元。256GB加16TB的顶配要142999元。8月27日开启预购,9月22日正式发售。微博微博微博

9月初还有一条容易被忽略的消息:The Information爆料,OpenAI已经采购了数万台Mac mini和Mac Studio,还在追着苹果要货;Anthropic则通过AWS租用Mac算力,一台每月五百到九百多美元。别以为大公司买Mac是为了剪视频——人家是拿去做AI的。微博
然后就是9月24日高盛的研报,把这一切上升成了对英伟达的"叙事挑战"。
第一笔账:容量账——"每块钱能买到的内存"第一次能打
玩过本地大模型的都知道,最难受的从来不是速度,是容量。模型权重要塞进显存,塞不下就得换小模型或者上更狠的量化,智力跟着掉。
N卡这边什么行情?消费级旗舰RTX 5090,32GB显存,官方指导价16499元——但盯过行情的都知道,这卡从上市起就被AI算力需求成批买走,美国市场最低售价已经到了5000美元左右,欧洲部分成交价突破5200欧元。国内这边,微星魔龙版年初上架京东就标价25999元。5月中国特供版的价格已经逼近3.4万,9月初微博上流传的一份行情统计更直接:全球RTX 5090的平均行情价,高出发售价136%。想堆容量,只能多卡,而多卡意味着主板、电源、机箱、散热全套加码。知乎微博微博

Mac这边:M5 Ultra起步就是96GB统一内存,可以选到256GB、512GB。512GB是什么概念?DeepSeek R1满血版671B参数,4-bit量化后约404GB,单台机器直接装下。上一代需要"摆一排显卡"才能干的活,现在桌子底下一台19.7厘米见方的小盒子理论上就能干。微博

按"每GB多少钱"算一笔粗账:
RTX 5090:按指导价16499元/32GB,约516元/GB;按9月全球平均行情价(约3.9万元)算,超过1200元/GB
Mac Studio M5 Ultra 96GB版:46999元,约490元/GB
Mac Studio M5 Ultra 256GB版:97999元,约383元/GB
英伟达自家的DGX Spark(128GB统一内存):价格已涨到4万元上下,约310元/GB
这里必须说清楚两点:第一,统一内存同时也是系统内存,你买的是整台电脑,不是单独一张卡,口径并不完全对等;第二,5090的显存带宽约1.79TB/s,比M5 Ultra的1.2TB/s还高。但对"跑大模型"这件事,顺序永远是先装得下、再谈快不快——这就是为什么本周知乎上会出现"实测Mac Studio本地跑大模型表现意外反超RTX 5090,二者该如何选"这样的热问。反超的不是绝对速度,是每块钱能买到的可用容量。知乎
还有一个背景板:这轮内存涨价潮里,一条32GB的DDR5内存条中位价已经摸到5000元左右,四条就是2万。想靠"买准系统回家插内存"给N卡路线省钱的旁门,也被堵上了一半。相比之下,苹果的统一内存至少是明码标价、不会一周一个价的。微博
第二笔账:速度与生态账——这里要泼冷水
容量账算完先别激动,有几个数字必须掰清楚。
首先,28 tokens/s是四台机器集群的实测,跑的还是激活参数只有320亿的MoE模型,不是单机成绩。单台M5 Ultra跑一个70B级别的稠密模型,4-bit量化后权重约40GB,容量上单机就能装下,速度上限则由1.2TB/s的带宽决定——够用,但别拿它跟数据中心的推理集群比。
其次,GPU算力本身不算强。B站上的全平台GPU性能对比里,M5 Ultra的成绩被归到"比肩RTX 3090"一档——那是2020年的旗舰。苹果的思路从来不是拼算力,是拼内存池。哔哩哔哩
第三,生态护城河是真实存在的。8月刚开源的Kimi K3(2.8万亿参数,官方MXFP4权重就有1.56TB),英伟达和AMD的显卡拿到了Day0支持,苹果生态的移植到8月底还"没影"。买Mac跑本地模型,你要有为新模型等适配、等框架更新的心理准备;而CUDA那边的vLLM、TensorRT-LLM这些推理栈,都是被生产环境毒打过无数轮的。最说明问题的是:苹果自己的一部分高要求AI任务,也放在谷歌云上用英伟达GPU跑——它最清楚这活谁干得好。微博华尔街见闻
第四,评测口径很乱。有的频道说AI性能提升46%,有的说最高4.2倍——数字差出这么多,说明"提升多少"完全取决于跟谁比、跑什么负载。看到任何单独的"X倍",都先问一句:对比对象是谁。
所以,高盛那份研报的合理解读不是"苹果要干翻英伟达",而是:推理的增量市场可能被分流。训练和数据中心推理,短期仍然牢牢在英伟达手里;但"企业自己跑稳定负载的推理""个人本地跑模型"这类场景,第一次有了N卡之外的正经选项。高盛自己的论据也很直白:英伟达当前隐含波动率处于疫情前以来最低,期权定价几乎没给"推理向本地迁移"这个变数留任何风险溢价——这才是他们建议买看跌期权的原因。微博
第三笔账:买还是租——那笔刷屏的"算完后悔"账
8月底,一位博主算了笔账,被转得很广:Kimi K3的API价格大约是一百万输出token一百块人民币,而搞一套四台M5 Ultra的本地集群要40万人民币起——同样的钱,够买大约40亿个token。他的结论很直接——算完这笔账,他把购物车里的Mac Studio删了,只留了个Mac mini。这笔账对绝大多数个人用户都成立:只使用推理、用量又不大的话,API几乎永远更便宜。本地部署要划算,得同时满足用量够大、频率够高、长期稳定这三个条件。微博
但有三类需求,API替代不了:
隐私与合规:数据不能出内网,金融、法务、医疗场景是典型。这正是Srouji那句"买断设备、不按token付费"瞄准的人群。
稳定高频负载:7×24小时跑满的推理服务,按token计费按月算就是天价,买断反而可控。Anthropic租Mac算力一台每月500到900多美元,可以当参考价。微博
离线与端侧:没有网络的地方,云再便宜也与你无关。
还要提醒一句"买"的隐藏成本:46999元只是单机起步价,想跑万亿参数就要四台集群、40万起步;功耗虽然远低于GPU集群,但也同样是电。倒是这轮行情里有个反直觉的"利好":显卡不但没跌,反而在涨——微博上有电竞店晒出真实回收案例,客户当年花31000元买的5090整机,一个月前单卡就卖出了36000元。不过对真要用卡的人来说,这不算什么安慰:卡卖了,模型用什么跑?微博

对号入座:三类人,三种答案
如果你以打游戏为主,AI只是偶尔尝鲜:这篇跟你关系不大。游戏生态在N卡这边,DLSS 5也在N卡这边,该买GeForce买GeForce,别为了AI买Mac结果发现游戏没法玩。你真正该操心的是显卡涨价的节奏,那是另一个话题。
如果你以本地推理为主——个人AI助手、代码模型、隐私数据场景:5万元档位现在是真正的分岔口。两张5090(64GB显存)按当下行情总价要6万元往上,一台M5 Ultra 96GB版只要46999元——账面上反而是Mac便宜,但决策不能只看价格:要微调、要训练、要新模型Day0支持,留在N卡;纯推理,图安静、省电、不折腾,Mac第一次值得认真考虑。预算宽裕又不着急的,建议等10月下旬512GB版到货、看完单机实测再掏钱——那才是"一台装下DeepSeek R1满血版"的完全体。

如果是小团队想自建推理:别一步到位。高盛研报其实给出了一张验收清单:实测推理速度、并发用户数、总拥有成本——这三个变量没有公开实测数据之前,先拿一台单机跑你们自己的真实负载,跑满一个月再决定扩不扩容。OpenAI和Anthropic都在成规模地用Mac,等于在替所有中小团队趟路,跟着他们的采购动向走不会太离谱。
接下来值得盯的四个信号
最后留一份观察清单,省得以后再到处翻:
10月下旬512GB版的实测:单机跑DeepSeek R1满血版的速度、多机集群的稳定性,这是苹果"本地推理"故事成色的试金石;
MLX/LM Studio的适配速度:Kimi K3这批新模型什么时候有Mac移植、四机集群方案会不会产品化——现在那套还是演示级玩法;
英伟达的应对:DGX Spark这条产品线的价格和迭代节奏、显存供应行情。如果5090继续溢价,Mac的相对价值只会更高;
期权市场会不会重新定价:高盛说英伟达隐含波动率太低,如果"推理向本地迁移"的叙事在未来一两个季度被更多数据坐实,波动会来的。
总结一下:英伟达的推理护城河,不会因为几台Mac Studio就决堤——数据中心规模、CUDA生态、训练市场,短期都动不了。但这个9月值得记一笔:苹果亲自下场,把"本地推理"从极客玩具变成了货架商品,连高盛都开始教人做空这个叙事了。对普通玩家最实际的意义是:跑大模型这件事,第一次有了N卡之外的正经选项;而手里攥着预算等5090降价的人,现在多了一个"再等等"的理由。
你会选哪条路?评论区聊聊。