2026年9月22日,新款 Mac Studio 国行正式开卖。这一代最扎眼的不是外观(外观和上代一模一样),而是 M5 Ultra 芯片背后那行字:最高 512GB 统一内存、1.2TB/s 带宽。对本地部署圈子来说,这是第一台官方宣传语就写着"在设备端运行超大规模大语言模型"的 Mac。
过去一周,能买到的第一批货(96GB 和 256GB 版)已经被全网测了个底朝天:笔吧评测室那台 256G 内存+4TB 硬盘、售价 97999 元的顶配评测已经刷屏。 有 UP 主用 56 个案例逐例留档、连每次请求的插座功耗都记了表。 今天早上又上线了一期 87 例的大模型分档实测。 而评论区里,最热的几条却一条比一条扎心。哔哩哔哩哔哩哔哩哔哩哔哩
这篇把 B 站、小红书、知乎和海外横评的实测数据、价格档位和评论区对照组全部汇总,回答一个问题:预算 4 万到 10 万、想上大内存跑本地模型的人,这一代 Mac Studio 到底该买哪一档,还是根本不该买。
先把机器和价签说清楚
8 月 25 日晚上苹果无预警上架,9 月 22 日开售,M5 Ultra 版国行 46999 元起(96GB 统一内存+1TB 存储,教育优惠 43599 元)。 往上两档价格跳得很快:256GB 版按芯片和存储不同,大约 76999 元(30 核 CPU+64 核 GPU+1TB)到 86749 元(满血 36 核+80 核+1TB)。 而真正的容量旗舰 512GB 版官方还没开卖,要等到 10 月下旬,定价也未公布。微博小红书微博

上一代的故事大家都知道:512GB 的 M3 Ultra 被本地 AI 需求硬生生从七万块炒到了十几万,一台跑模型的电脑活成了理财产品。 但注意,现在苹果官翻渠道 32 核+512GB+1TB 的 M3 Ultra 标价 63099 元——理财神话和官翻价之间,差着一整个黄牛市场。哔哩哔哩小红书
更要紧的是大环境:今年不是"再等等就降价"的年份。三大内存厂 2027 产能全部售罄,RTX 5090 街价冲上 6200 美元,连 Mac mini 都被喊出"一年涨千元"。 Mac mini 这代起售价比上一代贵了一整千档位,苹果自己也承认是涨价后重新定价。 这一轮想靠等待省钱,大概率等来的是涨价。哔哩哔哩微博
第一笔账:容量——买 Mac 买的是"装得下"
先把原理说透,这是所有判断的地基。本地推理的文本生成速度,基本不由算力决定,而由内存带宽 ÷ 模型体积决定——每生成一个 token,机器要把整个模型权重读一遍。苹果 MLX 文档自己都写明:生成后续 token 的速度受内存带宽限制,而非计算能力。知乎
拿这个公式套一下就很清楚:70B 参数模型 4bit 量化后约占 40GB。RTX 5090 带宽 1792GB/s,理论上限约 45 tok/s,但它只有 32GB 显存,装不进去——天花板是 45,实际是 0。 M5 Ultra 带宽 1.2TB/s,理论 30 tok/s 上下,慢,但它能把 256GB 甚至 512GB 全部当显存用。这就是 Mac 路线和 N 卡路线的根本分工:GPU 赢在速度,输在容量;模型越大,越对苹果有利。 一张八千多美元的专业卡显存 96GB,一台桌面 Mac 塞 512GB——这是两种架构的差别,不是堆料多少的差别。知乎
256GB 档位实际能装什么?实测口径:Qwen3.8-27B 稠密模型加 259K 超长上下文毫无压力;DeepSeek 旗舰的 MXFP4 完全版量化后约 156GB 也能整个放进内存,有用户推算 prefill 600–1200 t/s、推理约 80 t/s。 这是任何单张 N 卡做不到的事。知乎
第二笔账:速度——全网实测矩阵,和三盆冷水
各路实测数据汇总如下(不同团队、不同引擎和量化,取区间比取单点更接近真相)。256G 顶配的留档实测里,Qwen3.8-27B oQ4e 日常 103 tok/s、259K 上下文降到 34 tok/s,换 Q3_K_XL+DFlash2 量化能到 111 tok/s。 海外横评里 M3 Ultra 只有 35~60 tok/s,M5 Ultra 的 Decode 提升非常明显。哔哩哔哩小红书
场景 | 实测结果 | 来源 |
|---|---|---|
Qwen3.8-27B 日常对话 | oQ4e 量化 103 tok/s,Q3_K_XL+DFlash2 111 tok/s | 256G 顶配 56 例留档实测 |
Qwen3.8-27B 海外复测 | 代码生成 120–140 tok/s(oQ4e–oQ8e) | 海外横评(小红书转述) |
Qwen3.8-27B @259K 上下文 | 34 tok/s | 56 例留档实测 |
Qwen3.8-Flash-Next | prefill 3385 tok/s;128K 生成 103;256K 生成 69 | 56/87 例留档实测 |
DeepSeek 旗舰 oQ4e | 量化翻车,仅 16 tok/s,同卡位最慢 | 56 例留档实测 |
本地生图 | Krea 2 Turbo 1K 图 17 秒;Qwen Image 2.1 1K 50 秒、2K 2.5 分钟;Ideogram 4 2K 要 12.7 分钟 | 56 例留档实测 |
本地视频 | MiniMax H3 73 帧三步 LoRA 60 秒;1152 长档 11.8 分钟 | 56 例留档实测 |
整机功耗 | 待机约 52W,生图常见 80–320W,峰值 355W | 插座实测 |

优化派的数字也在往上顶:有人在 256GB 上魔改 MLX 内核跑 DeepSeek-V4.1-Flash,130K 上下文 prefill 约 2473 tok/s,跑满 1M 仍有 1898 tok/s。 香港团队用新引擎实测,Flash-Next Q4 能到 114 tok/s。插座口径的功耗也记了档:整机待机约 52W,生图常见 80–320W,全场峰值 355W。哔哩哔哩哔哩哔哩
三盆冷水也得泼。
其一,prefill 还是那堵墙。 官方宣传峰值 AI 算力是 M3 Ultra 的 4.3 倍。 但热评第一(113 赞)的原话是:这一代还是没解决 AI 推理效率,尤其 prefill 问题,可能 M5 这代就这样了,得 M6 或者 M7 来彻底转型。 另一条 29 赞的评论更直接:"这成绩白瞎了 1.2TB/s 的带宽。"峰值算力是营销口径,长提示词的读入速度才是日常体感——恰好在 4.3 倍宣传里最容易被藏起来的那一项。知乎哔哩哔哩
其二,评论区全是对照组。 有人报出自己的双卡 3080 配置:27B 模型 prefill 1300、推理 90,整机价格是苹果的十分之一。哔哩哔哩
5090D 用户的报告更扎心:ninfer+MTP3 跑 27B nvfp4 模型,prefill 七八千每秒、输出 150–200,fp8 KV 能开满 256K 上下文,除了塞不下更大的模型没有任何缺点。 还有更狠的:"本来还想买,看了 27B 4bit 的性能之后,还不如 3 个 V100 32GB 快。"只要你的模型塞得进 32GB 显存,N 卡方案的速度和价格都是碾压局。哔哩哔哩
其三,软件优化还没吃满。 有实测者承认 MTP(多 token 预测)都还没开,“还有优化空间,过段时间到货捣鼓下”。 说明现在这批数字还有上行空间,别把首周成绩当最终成绩。哔哩哔哩
第三笔账:反常识——256G 塞得下,不等于跑得爽

这是整件事里最反直觉、也最值钱的一条结论。有博主做了个双盲测试:在真实的 10 万行 TypeScript 项目上,让 Qwen3.8-27B 和 DeepSeek-V4-Flash 各执行 8 个任务,再由大模型盲审打分,结果是 Qwen3.8-27B ≈ DeepSeek-V4-Pro,远大于 DeepSeek-V4-Flash,他的原话结论是"不值得为 DeepSeek-V4-Flash 上 256G,即使上了,大概率也不能流畅运行"。小红书
翻译一下:你多花三万块从 96G 升到 256G,是为了塞下更大的 MoE 模型;但 MoE 大模型在 Mac 上恰恰被 prefill 卡住脖子,塞进去了也未必流畅;而塞不进 96G 的 27B 小模型,实际干活能力却不输旗舰。容量账和体验账,在这里是拧着的。
但另一边,96G 也不是无死角:有用户实测 Qwen3.8-Flash 级别的 MoE"128G 可用,刚好 96G 的 Ultra 用不了"。 于是社区裂成了两派——一派喊"M5 Ultra 96G 就是版本答案,你不需要 256G"。 另一派认为"要么 96G 要么 512G,256G 反而不上不下"。小红书小红书哔哩哔哩
四类人,四条路
① 日常 27B+Agent 开发党(Obsidian Copilot、本地脚本任务、DSH 工具链):买 96G,46999 元起步。27B 跑到 50 tok/s 以上就迈过"能用"门槛,实测用户口径是"跑 27B 稠密模型或 35B MoE 模型,覆盖日常 85% 以上需求"。 这是全档位性价比最高的一档,也是"版本答案"派的基本盘。哔哩哔哩
② 要 Flash-Next 级 MoE+超长上下文、或者本地生视频的工作流党:256G 是你的档,但买 76999 元的 30 核+1TB 版就够了,满血 36 核对推理速度帮助有限,省下的一万块够加 2TB 存储。别为"顶配信仰"多掏两万。
③ 要 DeepSeek 完全版、奔着几百 GB 模型去的:现在的 256G 是半山腰,等 10 月下旬 512G 版定价落地再决策——有科技博主已经预告"售价离谱",它一公布,256G 和官翻 M3U 的相对价值立刻重估。 评论区那句"富哥不用急着现在买,10 月底还有 512G 内存的版本",说的就是这个窗口。 同时盯着官翻 M3 Ultra 63099 元这一档——上一代带宽 819GB/s、prefill 更慢,但 512G 是实打实的。前提是想清楚:prefill 这堵墙在 512G 上同样存在。微博哔哩哔哩
④ 模型能塞进 24G/32G、只在乎速度和预算的:别碰 Mac。5090D 单卡约 2.0–2.3 万元,高端型号更贵。 二手双 3080 整机只要苹果十分之一价格;连云 API 都才涨 5%,轻度用户先算 token 账再算硬件账。小红书

接下来盯这四个信号
512G 版官方定价(10 月下旬):公布当天,256G、官翻 M3U、甚至双 DGX Spark 方案的性价比排序都会重写;
MTP、投机解码等优化落地进度:首周成绩还有 10%–30% 的上行空间,优化党可以再等一版驱动;
双 11 渠道价:教育优惠+渠道补贴叠加后,96G 有希望再往下探——但注意内存涨价周期里,优惠幅度可能被直接吃掉;
对照锚点:有用户推算双 DGX Spark 方案与 256G 版价格相当,“优点是加载能到 1700,但是推理 40 较慢”——N 卡阵营的大内存平价路线也在动,两边都盯着再出手。知乎
最后一句判断收尾:这一代 Mac Studio 换给你的是"装得下"(容量)和"放得下"(355W 峰值功耗、运行安静、数据不出门),从来不是"跑得快"。为速度买它的人会失望,为容量买它的人,先想清楚自己的模型是不是真的需要那 200 个 G。