昨晚苹果没开发布会,官网新闻稿直接甩了出来,Mac mini 和 Mac Studio 两条桌面产品线一起换代。知乎
但让本地大模型圈子停下来多看两眼的,不是换代本身,而是新闻稿里的措辞:Mac mini 被叫做「常开的智能体设备」,Mac Studio 被叫做「端侧 AI 的终极台式机」。苹果第一次把 Mac 的定位,直接写成了跑本地 AI 的机器。知乎
参数和价格大家都搬了,这篇不重复。我把知乎、微博、B 站这两天的讨论翻了一遍,替想跑本地大模型的人算三笔账:这笔钱买到的内存能装下哪些模型、带宽能喂出多少速度、同样的钱还有什么别的选择。

先对齐事实:这一晚到底上了什么
四颗芯片,两台机器,全是冲着本地 AI 去的。先看价格。Mac mini M6 是 6999 元起,M5 Pro 版 12999 元起。微博Mac Studio 的 M5 Max 起售价 19999 元,比上一代一分没涨。哔哩哔哩
旗舰 M5 Ultra 是 46999 元起(个别报道写成 42999,以官网预购页为准)。微博微博
时间表也说一下:今日开启预购,9 月 22 日正式开售,但注意——512GB 内存版本要等到 10 月底才上市。微博
现在官网能点到的最高配置是 256GB,社区里已经有人扒了价:这一版已经要 9 万,官网没有 512GB,上一代 M3 Ultra 512GB 也早下架了,想要大容量只有等。哔哩哔哩而且内存出厂焊死,无法后期升级,没有后悔药可买。微博
还有一个背景要放进来看:两年前 M4 版 Mac mini 首发 4499,今年 6 月被悄悄调到 5999,这次直接 6999,两轮累计涨了 56%。知乎锅不全在苹果——今年内存价格涨得离谱,MacBook Air 都一度一机难求、苹果要去找新供应,本地大模型这台机器,是踩着内存涨价周期上市的。36氪

再说 M6 这颗芯片:苹果首款 2nm 工艺芯片,主流 M 系列第一次搭载三种核心,2 颗超大核 + 4 颗性能核 + 6 颗能效核合计 12 核 CPU,12 核 GPU,每个核心首次内置神经网络加速器。微博内存带宽拉到 170GB/s,统一内存最高 32GB。官方口径「AI 性能提升 4 倍」,但注意提升的分布——新闻稿演示里用 LM Studio 处理大模型提示词最高快 4.8 倍,Excel 表格计算却只快 1.5 倍,晶体管预算全押在 AI 上了。知乎
真正的主角是 M5 Ultra:苹果第一颗四芯粒的 M 系列芯片,芯粒之间带宽超过 4.4TB/s,36 核 CPU + 80 核 GPU,统一内存最高 512GB,内存带宽 1.2TB/s,AI 峰值算力最高是 M3 Ultra 的 4.5 倍。知乎官方口径是最高 512GB 统一内存,可本地运行 70B 大模型——这个 70B 后面要展开说。微博
第一笔账:你要跑的模型,到底吃多少内存
这是这台机器最核心的购买理由,也是最容易算错的一笔。先放一张对照表:
模型 | 规格 | 占用 | 塞进哪一档 |
|---|---|---|---|
Qwen3.8-27B | BF16 满血 / Q8 / Q4 | 55.6G / ≈27G / 17G | 32GB 能跑量化,64GB 舒服 |
DeepSeek V4 Flash(288B) | BF16 / Q4 | ≈576G / ≈150G | Q4 要 256GB 档,Q8 得上 512GB |
GLM-5.2 | Q4_K_S | ≈406G | 512GB 是「刚好」 |
Kimi K3(1bit 极限量化) | 动态 1bit | ≈594G | 单机塞不下,要集群 |
表里的数字,来自这两周的社区实测和上手视频。哔哩哔哩知乎微博
三个容易踩的坑。
第一,物理内存不等于权重预算。知乎操作系统、运行时、KV cache、计算缓冲区全要从内存里扣,真实能装权重的永远比标称少一截,所以「512GB 跑 406GB 的 GLM-5.2 量化版」不是宽裕,是刚好。
第二,苹果官方口径是「可本地运行 70B 大模型」。微博这个数字保守到像在自谦——社区实测早就越过了这条线:Unsloth 把 Kimi K3 极限 1bit 量化之后,体积还是 594GB,一台机器装不下。微博70B 大概率是官方按最保守口径写的话术,别拿它当能力上限。
第三,WWDC26 上,LM Studio 的工作人员现场演示过这套玩法:四台 Mac Studio 用 Thunderbolt 5 加 RDMA 连成一张低延迟网络,共享一个内存池,硬是把万亿参数级的开放权重模型 Kimi K2.6 在本地跑了起来,四机推理最高是单机的 3 倍。知乎微博方向是真的,但那是四台 46999 元起步的机器,总价奔着 20 万去,这是给团队看的,不是给个人的。

一句话总结这笔账:64GB 是「跑 27B 很舒服」,128GB 是「跑 288B 量化入门」,256GB/512GB 才是「前沿开放权重入场券」——而入场券 9 万起,512GB 还得等 10 月底。
第二笔账:1.2TB/s 带宽,到底能喂出多少速度
内存装得下,不代表跑得快。本地推理的解码速度基本被内存带宽锁死,粗算公式是:解码速度 ≈ 内存带宽 ÷ 模型常驻体积。
三个锚点数据。
上一代实测:27B Q8 在 Mac 单机上,解码 21.13 tok/s、预填充 273.78 tok/s。知乎
新机带宽:M5 Ultra 官方规格 1.2TB/s,按上面的公式,跑 27B Q8(约 27GB)的解码理论上限在 40 tok/s 上下,跑 DeepSeek V4 Flash Q4(约 150GB)上限掉到 8 tok/s 左右——理论上限不是实测,兑现多少看软件栈优化,等 9 月 22 日首批实测。
同预算的对手 RTX 5090,带宽约 1.7TB/s,比 M5 Ultra 还高,但大多数工作站独显的显存「也就几十个 GB」,150GB、406GB 的模型根本装不进去。知乎知乎
社区这两天已经在吵这件事了。B 站评论区的分歧很直白:「轮cpu带宽,比win都都高了吧,但论gpu,max都不够n卡零头。。。估计就ultra能比,但都这样了不如直接n卡了」。哔哩哔哩也有老用户泼冷水:「我的M4 pro,内存大,但是没啥用,带宽不够, 速度慢得很」——这台机器不是堆内存就能理解的。
我的判断:这笔账的答案取决于你跑什么。跑 27B 这种装进任何显卡都没压力的小模型,Mac 没有速度优势;跑 288B、400GB 这种显存根本装不下的模型,Mac 是少数「单机能跑」的选择,这时候理论上限 8 tok/s 就算打对折也能用——「能跑」和「跑不了」是两回事。还有一个容易被忽略的细节:上一代实测里,预填充比解码快一个量级(273.78 对 21.13),而多机拼接只会拖慢单请求解码,对长上下文的 Agent 场景,这是真问题。知乎
第三笔账:同样的钱,还能买什么
把预算拉到同一水平线上对比(价格来自社区近两周的真实成交和讨论):
方案 | 大概价格 | 跑什么 | 短板 |
|---|---|---|---|
Mac Studio M5 Max 128GB | ≈2 万 | 27B 满血、288B 极限量化 | 速度上限待实测 |
Mac Studio M5 Ultra 256GB | ≈9 万 | 288B Q4 舒服 | 贵,512GB 要等 |
DGX Spark ×2 | 6-7 万/台 | V4 Flash 40+ tok/s | 上手门槛高 |
RTX 5090 组装 | 更低 | 27B/35B 飞快 | 显存装不下 288B |
值得单独说两句的是 DGX Spark。这台被叫「小金砖」的机器社区评价两极:玩得转的人,双机跑 DeepSeek V4 Flash 能到 40+ tok/s,长上下文也有 20-30。知乎单机也有深度优化分支做到 35 tok/s 加 766K 上下文。知乎玩不转的人吐槽上手门槛,非行内人装一套环境要折腾两天多。知乎
价格也说透:私人采购两台 DGX Spark 是六七万一台,和一台 256GB 的 Mac Studio 一个量级,它更便宜的是「跑得快」这件事本身,还带 CUDA 生态。知乎

还有一个容易被忽略的选项:不买。现在已经有人在做 Mac Studio M3 Ultra 的远程租赁,按月付租金,先验证你的需求是不是真的需要 512GB 这个量级,再决定要不要一次性砸进去。知乎
所以,哪些人现在可以预购
要 7×24 常开 Agent、数据不能出本机、预算 2 万上下:M5 Max 128GB 是这条产品线的甜点位,可以直接预购。知乎
目标是 288B 及以上的前沿开放权重:别急。9 月 22 日首发先看第一批实测(尤其 llama.cpp 和 MLX 对新芯片的优化进度),真正的大菜是 10 月底的 512GB 版,现在连价格都没公布。微博上那句话很代表:「新MacStudio并不贵,买256G内存还是512G内存是一个问题」——这个问题 10 月底之前没有完整答案。微博
纯速度党、性价比党:看 DGX Spark 双机或者 5090 组装,Mac 不是你的菜。知乎
评论区说「性能严重过剩」「不买,没有需求」的大多数:你们是对的。这台机器是给本地跑大模型和 8K 渲染的重度用户准备的,日常办公买它纯属浪费。微博微博
顺带说下苹果为什么押注「常开」:OpenRouter 的数据显示,今年 2 月之后,AI Agent 消耗的 token 量超过了人类,半年涨到原来的 14 倍——总得有机器替我们接住这些 token。知乎接下来值得盯三个信号:9 月 22 日开售后的首批真机实测、10 月底 512GB 版本的定价、以及 llama.cpp 这轮提速在新芯片上能不能兑现。有结果了再聊。