4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

源自377位全网作者

09-25 14:03

这几天AI硬件圈发生了一件挺有意思的事:三件看似不相关的动态在同一周汇合,全都指向同一家公司——英伟达。

9月22日,苹果新款Mac Studio(M5 Ultra版)正式开售交付,46999元起;9月24日,高盛发了一份观点相当直接的研报:如果更多推理任务迁移到终端设备和企业自有机器上,英伟达在AI推理增量里能拿到的份额,可能低于市场当前的预期——他们甚至建议客户用"做多苹果、做空英伟达"的期权组合来表达这个判断。同一天,苹果硬件主管Johny Srouji接受路透社采访的话被广泛转发:企业一旦买断设备,就不用再为每一次推理请求向云端按token付费。华尔街见闻微博

再加上一个预告:10月下旬,512GB内存版的Mac Studio将到货。华尔街见闻

对盯着英伟达的人来说,这事有两层意义。往大了说,这是苹果第一次把"本地推理"做成明码标价的商品,摆上货架跟英伟达的推理地盘正面竞争;往小了说,如果你正盘算着置办一台跑大模型的机器,这就是一个真金白银的选择题——堆N卡、买Mac,还是干脆租API?今天把这三笔账一次算清。

先复盘:苹果是怎么把演示变成商品的

这条时间线其实不短。今年6月的WWDC上,LM Studio和苹果现场演示了一出好戏:四台Mac Studio组成集群,用雷雳5互联,拼出约1.5TB的统一内存池,在本地跑起了月之暗面的万亿参数模型Kimi K2.6(MoE架构,激活参数320亿),实测生成速度28 tokens/s。当时这个演示就在圈里炸了一波——放在几年前,本地跑万亿参数模型是天方夜谭。微博

4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

8月25日,苹果正式发布新款Mac Studio:M5 Max版19999元起,M5 Ultra版46999元起,标配96GB统一内存加1TB存储。M5 Ultra最高36核CPU加80核GPU,内存可选到256GB、512GB,最高内存带宽1.2TB/s,机身带6个雷雳5接口。256GB加4TB的配置参考售价97999元。256GB加16TB的顶配要142999元。8月27日开启预购,9月22日正式发售。微博微博微博

4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

9月初还有一条容易被忽略的消息:The Information爆料,OpenAI已经采购了数万台Mac mini和Mac Studio,还在追着苹果要货;Anthropic则通过AWS租用Mac算力,一台每月五百到九百多美元。别以为大公司买Mac是为了剪视频——人家是拿去做AI的。微博

然后就是9月24日高盛的研报,把这一切上升成了对英伟达的"叙事挑战"。

第一笔账:容量账——"每块钱能买到的内存"第一次能打

玩过本地大模型的都知道,最难受的从来不是速度,是容量。模型权重要塞进显存,塞不下就得换小模型或者上更狠的量化,智力跟着掉。

N卡这边什么行情?消费级旗舰RTX 5090,32GB显存,官方指导价16499元——但盯过行情的都知道,这卡从上市起就被AI算力需求成批买走,美国市场最低售价已经到了5000美元左右,欧洲部分成交价突破5200欧元。国内这边,微星魔龙版年初上架京东就标价25999元。5月中国特供版的价格已经逼近3.4万,9月初微博上流传的一份行情统计更直接:全球RTX 5090的平均行情价,高出发售价136%。想堆容量,只能多卡,而多卡意味着主板、电源、机箱、散热全套加码。知乎微博微博

4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

Mac这边:M5 Ultra起步就是96GB统一内存,可以选到256GB、512GB。512GB是什么概念?DeepSeek R1满血版671B参数,4-bit量化后约404GB,单台机器直接装下。上一代需要"摆一排显卡"才能干的活,现在桌子底下一台19.7厘米见方的小盒子理论上就能干。微博

4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

按"每GB多少钱"算一笔粗账:

  • RTX 5090:按指导价16499元/32GB,约516元/GB;按9月全球平均行情价(约3.9万元)算,超过1200元/GB

  • Mac Studio M5 Ultra 96GB版:46999元,约490元/GB

  • Mac Studio M5 Ultra 256GB版:97999元,约383元/GB

  • 英伟达自家的DGX Spark(128GB统一内存):价格已涨到4万元上下,约310元/GB

这里必须说清楚两点:第一,统一内存同时也是系统内存,你买的是整台电脑,不是单独一张卡,口径并不完全对等;第二,5090的显存带宽约1.79TB/s,比M5 Ultra的1.2TB/s还高。但对"跑大模型"这件事,顺序永远是先装得下、再谈快不快——这就是为什么本周知乎上会出现"实测Mac Studio本地跑大模型表现意外反超RTX 5090,二者该如何选"这样的热问。反超的不是绝对速度,是每块钱能买到的可用容量。知乎

还有一个背景板:这轮内存涨价潮里,一条32GB的DDR5内存条中位价已经摸到5000元左右,四条就是2万。想靠"买准系统回家插内存"给N卡路线省钱的旁门,也被堵上了一半。相比之下,苹果的统一内存至少是明码标价、不会一周一个价的。微博

第二笔账:速度与生态账——这里要泼冷水

容量账算完先别激动,有几个数字必须掰清楚。

首先,28 tokens/s是四台机器集群的实测,跑的还是激活参数只有320亿的MoE模型,不是单机成绩。单台M5 Ultra跑一个70B级别的稠密模型,4-bit量化后权重约40GB,容量上单机就能装下,速度上限则由1.2TB/s的带宽决定——够用,但别拿它跟数据中心的推理集群比。

其次,GPU算力本身不算强。B站上的全平台GPU性能对比里,M5 Ultra的成绩被归到"比肩RTX 3090"一档——那是2020年的旗舰。苹果的思路从来不是拼算力,是拼内存池。哔哩哔哩

第三,生态护城河是真实存在的。8月刚开源的Kimi K3(2.8万亿参数,官方MXFP4权重就有1.56TB),英伟达和AMD的显卡拿到了Day0支持,苹果生态的移植到8月底还"没影"。买Mac跑本地模型,你要有为新模型等适配、等框架更新的心理准备;而CUDA那边的vLLM、TensorRT-LLM这些推理栈,都是被生产环境毒打过无数轮的。最说明问题的是:苹果自己的一部分高要求AI任务,也放在谷歌云上用英伟达GPU跑——它最清楚这活谁干得好。微博华尔街见闻

第四,评测口径很乱。有的频道说AI性能提升46%,有的说最高4.2倍——数字差出这么多,说明"提升多少"完全取决于跟谁比、跑什么负载。看到任何单独的"X倍",都先问一句:对比对象是谁。

所以,高盛那份研报的合理解读不是"苹果要干翻英伟达",而是:推理的增量市场可能被分流。训练和数据中心推理,短期仍然牢牢在英伟达手里;但"企业自己跑稳定负载的推理""个人本地跑模型"这类场景,第一次有了N卡之外的正经选项。高盛自己的论据也很直白:英伟达当前隐含波动率处于疫情前以来最低,期权定价几乎没给"推理向本地迁移"这个变数留任何风险溢价——这才是他们建议买看跌期权的原因。微博

第三笔账:买还是租——那笔刷屏的"算完后悔"账

8月底,一位博主算了笔账,被转得很广:Kimi K3的API价格大约是一百万输出token一百块人民币,而搞一套四台M5 Ultra的本地集群要40万人民币起——同样的钱,够买大约40亿个token。他的结论很直接——算完这笔账,他把购物车里的Mac Studio删了,只留了个Mac mini。这笔账对绝大多数个人用户都成立:只使用推理、用量又不大的话,API几乎永远更便宜。本地部署要划算,得同时满足用量够大、频率够高、长期稳定这三个条件。微博

但有三类需求,API替代不了:

  1. 隐私与合规:数据不能出内网,金融、法务、医疗场景是典型。这正是Srouji那句"买断设备、不按token付费"瞄准的人群。

  2. 稳定高频负载:7×24小时跑满的推理服务,按token计费按月算就是天价,买断反而可控。Anthropic租Mac算力一台每月500到900多美元,可以当参考价。微博

  3. 离线与端侧:没有网络的地方,云再便宜也与你无关。

还要提醒一句"买"的隐藏成本:46999元只是单机起步价,想跑万亿参数就要四台集群、40万起步;功耗虽然远低于GPU集群,但也同样是电。倒是这轮行情里有个反直觉的"利好":显卡不但没跌,反而在涨——微博上有电竞店晒出真实回收案例,客户当年花31000元买的5090整机,一个月前单卡就卖出了36000元。不过对真要用卡的人来说,这不算什么安慰:卡卖了,模型用什么跑?微博

4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

对号入座:三类人,三种答案

如果你以打游戏为主,AI只是偶尔尝鲜:这篇跟你关系不大。游戏生态在N卡这边,DLSS 5也在N卡这边,该买GeForce买GeForce,别为了AI买Mac结果发现游戏没法玩。你真正该操心的是显卡涨价的节奏,那是另一个话题。

如果你以本地推理为主——个人AI助手、代码模型、隐私数据场景:5万元档位现在是真正的分岔口。两张5090(64GB显存)按当下行情总价要6万元往上,一台M5 Ultra 96GB版只要46999元——账面上反而是Mac便宜,但决策不能只看价格:要微调、要训练、要新模型Day0支持,留在N卡;纯推理,图安静、省电、不折腾,Mac第一次值得认真考虑。预算宽裕又不着急的,建议等10月下旬512GB版到货、看完单机实测再掏钱——那才是"一台装下DeepSeek R1满血版"的完全体。

4台Mac跑通万亿参数模型、28 tok/s:苹果把“本地推理”摆上货架,高盛说这动了英伟达的推理地盘——本地AI堆5090还是租GPU,先对完这三本账

如果是小团队想自建推理:别一步到位。高盛研报其实给出了一张验收清单:实测推理速度、并发用户数、总拥有成本——这三个变量没有公开实测数据之前,先拿一台单机跑你们自己的真实负载,跑满一个月再决定扩不扩容。OpenAI和Anthropic都在成规模地用Mac,等于在替所有中小团队趟路,跟着他们的采购动向走不会太离谱。

接下来值得盯的四个信号

最后留一份观察清单,省得以后再到处翻:

  1. 10月下旬512GB版的实测:单机跑DeepSeek R1满血版的速度、多机集群的稳定性,这是苹果"本地推理"故事成色的试金石;

  2. MLX/LM Studio的适配速度:Kimi K3这批新模型什么时候有Mac移植、四机集群方案会不会产品化——现在那套还是演示级玩法;

  3. 英伟达的应对:DGX Spark这条产品线的价格和迭代节奏、显存供应行情。如果5090继续溢价,Mac的相对价值只会更高;

  4. 期权市场会不会重新定价:高盛说英伟达隐含波动率太低,如果"推理向本地迁移"的叙事在未来一两个季度被更多数据坐实,波动会来的。

总结一下:英伟达的推理护城河,不会因为几台Mac Studio就决堤——数据中心规模、CUDA生态、训练市场,短期都动不了。但这个9月值得记一笔:苹果亲自下场,把"本地推理"从极客玩具变成了货架商品,连高盛都开始教人做空这个叙事了。对普通玩家最实际的意义是:跑大模型这件事,第一次有了N卡之外的正经选项;而手里攥着预算等5090降价的人,现在多了一个"再等等"的理由。

你会选哪条路?评论区聊聊。

内容由AI生成

精选参考来源

1. 4台Mac Studio跑通万亿参数模型,苹果向英伟达的推理叙事发起挑战

2. 4台Mac Studio跑通万亿参数模型,苹果向英伟达的推理叙事发起挑战(高盛观点摘要)

3. LM Studio联合苹果用四台Mac Studio集群跑上万亿参数Kimi K2.6

4. 新的Mac Studio:M5 Max/M5 Ultra处理器规格与售价

5. #笔吧评测室# 苹果Mac Studio M5 Ultra 256GB统一内存 参考售价97999元

6. M5 Ultra Mac Studio顶配142999元,512G版10月底才出

7. The Information爆料:OpenAI采购数万台Mac mini和Mac Studio;Anthropic租Mac算力

8. 一车一车的吃啊!RTX 5090成批量地流入服务器,再现当年挖矿“盛况”

9. 微星GeForce RTX 5090 D 32G魔龙显卡上架京东,标价25999元

10. #中国特供版英伟达5090又要涨价#:涨幅超2000元,售价逼近3.4万

11. 目前全球RTX 5090的行情价,平均高出发售价136%

12. M6和M5 Ultra对照Kimi K3:什么机器能本地跑满血(含API成本账)

13. 实测 MacStudio 本地跑大模型表现意外反超 RTX5090,二者该如何选?

14. 一条32GB的内存条中位价竟然干到5000左右去了

15. 全平台GPU性能对比(苹果M5ultra新加入,比肩3090!)

16. 客户当年31000元买的5090整机,一个月前单卡回收价36000元

17. 官网悄悄上新Mac mini和Mac Studio,9月22日正式开售(正文图1来源)

18. WWDC26苹果AI特别讲座重头戏:4台Mac Studio本地运行Kimi K2.6模型(正文图2来源)

19. Mac Studio - Apple (中国大陆)(正文图4官方产品图来源)

20. RTX5090 FE创始人版开箱(正文图6来源)

21. Mac Studio M5 Ultra 256GB 开箱(封面图来源)

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章