这几天,"苹果 M5 Max 大模型推理反超 RTX 5090"的说法在知乎、B站数码圈传得很广。源头是本周知乎上一个讨论度很高的问题:有人把搭载 RTX 5090 Laptop(24GB 显存)的雷蛇灵刃 18,和 128GB 统一内存的 M5 Max MacBook Pro 放在同一张测试桌上,结论是——在 12B 到 35B 规模的中小模型上,M5 Max 的推理表现"反超"了。知乎
几乎同一时间,另一条消息也在今天流出:有海外博主在 X 上晒出了苹果自研 Apple Silicon AI 服务器的内部照片——定制 2U 机架,内部 4 列硬件、每列 8 个计算单元,整机可能搭载 32 颗 M5 系列芯片,由 Mac Studio 负责软件控制。微博连苹果自己,都在把 Apple Silicon 往 AI 算力里塞。

两条消息叠加,不少人开始心动:是不是该买台 Mac 跑本地大模型了?先别急。三五万预算出手之前,有三笔账得算明白。
第一笔账:"反超"到底反超了什么
先泼一盆冷水:这不是一场全面胜利,而是特定战场上的胜利。
这个战场叫"显卡装不下的模型"。本地跑大模型,逻辑简单粗暴:模型得先完整装进显存或内存,然后才谈得上快慢。RTX 5090 Laptop 是 24GB 显存,一个 Q4 量化的 32B 模型权重就接近 20GB,再叠加上下文和 KV cache,基本顶到天花板;往上到 70B 或者千亿参数的 MoE 大模型,5090 只剩两条路——借道内存慢到不可用,或者干脆跑不起来。
而 M5 Max 的 128GB 统一内存,可以让整个模型住在"GPU 够得着"的地方。所以本周刷屏的这个结论,真实的含义是:那些 5090 根本跑不动的大模型,M5 Max 不但能跑,还能跑出可用的速度。这是"先解决能不能跑"对"只谈跑得多快"的降维。
反过来,在显存装得下的模型上,N 卡的生成速度优势依然明显,训练、微调场景里 CUDA 生态的地位也没被撼动。这周 B 站一支热门搬运视频的标题就很直白:《本地运行 AI 的真相:内存才是关键,而非显卡》——两边吵的其实不是同一件事。哔哩哔哩
小红书博主星港机研所的实测也有代表性:他拿 M5 Pro 64GB 的 MacBook Pro 对比 RTX 5060 Ti 16GB,结论相近——Mac 跑本地 AI 的优势不在"快",而在"能跑更大、更安静、更省电"。小红书
顺便提个醒:最近还有一支"8GB MacBook 跑通 26B 大模型"的视频很火,本质是用 SSD 当推理缓冲、再叠加 MoE 模型低激活参数特性的技巧。能跑通不假,但那个速度,和 128GB 统一内存的流畅完全是两种体验,别把技术演示当日常。
第二笔账:这一代 M5 Max,为什么会像一张"计算卡"
如果把 M5 Pro/Max 只当成"更快的一代芯片",就低估它了。极客湾 5 月的深度评测点破了一件事:这是苹果第一代采用 Chiplet 结构的笔记本 SoC,M5 Pro 用的是和 M5 Max 完全相同的 CPU Tile,两者区别只在 GPU 和内存规格。哔哩哔哩

这意味着苹果在把 M 系列做成"可拼接的算力模块"。也难怪发布时张黑黑那支《苹果牌 AI 计算卡》会火——他的核心论点是:M5 Max 正在脱离传统笔记本 SoC 的逻辑,长出苹果专业级 AI 计算的轮廓。哔哩哔哩再对照今天流出的"一机 32 颗 M5"的苹果 AI 服务器,这条线从你桌上的 MacBook,一路延伸到了苹果自己的数据中心。
对跑模型的人来说,最实际的一点没变:统一内存就是本地大模型的门票,M5 Max 把这张门票的上限抬到了 128GB。笔吧评测室 8 月那支 65 万播放的《我找到了最适合用 Mac 的群体》能火,本身就说明——"今天到底谁该用 Mac"正在被重新定义,而答案越来越偏向需要本地跑重负载的人。
第三笔账:钱,以及现在买还是再等等
这笔账最扎心。本地大模型机器,本质上买的是内存,而内存正在经历一轮罕见的涨价周期:6 月 25 日,苹果对 Mac 和 iPad 全线调价,受影响产品平均涨幅约 23%。微博网友统计的单机型涨幅是:MacBook Air 涨 1400 元,MacBook Pro 涨 2100 元,Mac Studio 涨 9000 元。小红书

7 月 31 日财报会上,库克亲自解释:内存价格正在"指数级暴涨"。界面新闻更远期的是供应链消息——三星、SK 海力士、美光 2027 年的 DRAM 和 HBM 产能,已经被 AI 订单预订一空。小红书
今天古尔曼的最新通讯里还提到:iPhone 18 面临同样的内存供应问题,涨价"仍然不可避免"。微博AI 抢走了算力,抢走了内存,现在正传导到你手里这台设备的标价上。
芯片这一侧的最新爆料,正好把"买还是等"的纠结摆上了台面。据爆料,苹果今年将时隔两年更新 iMac 产品线,年内推出搭载 M6 芯片的 24 英寸新版本,M6 也将首发 Mac 的 2nm 工艺。微博但另一边,路线图消息称,Mac Studio 和 Mac mini 的更新目前因全球 RAM 短缺而面临延误。微博一边是新芯片要来,一边是缺货延期,我的建议按预算分三档:

玩 8B—14B 小模型,预算 1 万以内:24GB 统一内存是起步线,8GB 的 MacBook Neo 再便宜也别为了跑模型买。这一档优先看 M4/M5 基础款的 24GB—32GB 配置,或者成色好的上一代大内存机型,别追顶配。
主力跑 32B—70B 量化、本地知识库、AI 编程,预算 1.5 万—3 万:M5 Pro 或 M5 Max 的 48GB—64GB 是甜点位。注意一点:如果你等的是 Mac Studio,M5 Ultra 版本的爆料 6 月底就已出现。哔哩哔哩但要做好它因内存短缺推迟的心理准备,"等等"可能等来的不是降价,是更晚。
必须跑千亿参数 MoE,预算 5 万档:128GB 的 M5 Max MacBook Pro 是目前笔记本形态里几乎唯一的一体化方案,媒体实测报价在 5 万元左右。哔哩哔哩走 N 卡路线则要多卡或工作站级投入,且单卡仍受显存上限约束。
只有一种情况我建议你直接选 N 卡:你的主场景是小模型高速生成、训练和微调。那个战场上,Mac 没有胜算。
最后留几个值得持续盯的信号:M5 Ultra Mac Studio 的发布时间、9 月上旬苹果秋季发布会后的真机节奏、双 11 的渠道价走势,以及 MLX 生态的模型适配速度。内存涨价周期里,"等降价"和"等新芯片"是两个方向相反的赌注,下单前先想清楚自己赌的是哪边。
你本地跑模型用的是什么设备、多大内存?欢迎在评论区聊聊,给后来者一个参考。