关注本地部署大模型的朋友,应该都看到苹果 8 月 25 日丢出来的这个大新闻:没有发布会,直接上架新款 Mac mini 和 Mac Studio,明早(8 月 27 日)9 点开启预购,9 月 22 日正式发售。极客公园智东西
如果只是常规换代,不值得单独写一篇。但这次苹果几乎把「本地大模型」写在了脸上:官网产品页直接展示 Ollama、LM Studio 这些本地推理工具,明确说可以在设备端跑 DeepSeek、Kimi、GLM 这些开源模型,还能结合 Qwen 在本地生成图像,Mac mini 被定位成「全天候智能体计算工具」。知乎智东西它还支持多台机器用雷雳 5 连成集群跑更大的模型。极客公园
这基本是头部 PC 厂商第一次把「本地跑大模型」做成桌面机的主打卖点。对大模型开发者来说,这是个值得停下来看一眼的信号——但要不要掏钱,得先把账算明白,因为这次涨价是真的,宣传数字里的门道也是真的。

一、先看坏消息:全线涨价,入门门槛高了 2500 元
先说价格。新款 Mac mini M6 版起售价 6999 元(IT之家标题为 6999 元,知乎提问页同样采用该数字;智东西的编译稿写的是 5999 元,两个数字不一致,明早预购开启后以苹果官网为准)。知乎智东西对比 2024 年 M4 版 4499 元的起售价,入门门槛一口气抬高了 2500 元。知乎背景是全球内存芯片供应紧张、价格飙升——苹果 6 月就已经上调过一轮美区 Mac、iPad 价格,这次是第二轮传导。
四款机型的配置和价格,帮大家整理成一张表:
机型 | 芯片 | 统一内存 | 内存带宽 | 起售价 |
|---|---|---|---|---|
Mac mini | M6(2nm 首发) | 16 / 24 / 32GB | 170GB/s | 6999 元 |
Mac mini | M5 Pro | 24 / 48 / 64GB | 307GB/s | 13999 元 |
Mac Studio | M5 Max | 36GB 起,最高 128GB | 最高 614GB/s | 19999 元 |
Mac Studio | M5 Ultra(四晶粒) | 96GB 起,最高 512GB | 1.2TB/s | 46999 元 |
注意两点:M5 Ultra 的 512GB 内存版本要等到 10 月下旬才推出;美区 Mac Studio 顶配(256GB+16TB)卖到 18299 美元,这代产品的价格上限明显是冲着「本地 AI 工作站」去的。极客公园

二、宣传数字怎么看:「快 4 倍」到底指什么
官方话术里最抓人的是「M6 版 AI 性能较 M4 最高提升 4 倍」「LM Studio 中 LLM 提示词处理速度最高是 M4 版的 4.8 倍」。智东西
这两句话大概率是真的,但要搞清楚它们说的是哪一段:提示词处理(prefill,预填充)是算力密集环节,新芯片的 NPU 和架构升级确实能直接兑现。可你日常感知最强的「模型吐字速度」,是生成阶段(decode),它主要被内存带宽卡脖子,提升幅度远没有宣传数字那么夸张。
一句话分清:如果你的场景是 Agent 工作流、长上下文批量处理,吃的是预填充,新机提升实打实;如果你主要想本地跑个模型做日常问答、代码辅助,在意的是吐字快不快,那要看的是内存那两个数字,而不是「AI 性能 ×N」。
三、内存这笔账怎么算:容量决定能不能跑,带宽决定快不快
这是本文的核心,学会了你自己就能给任何一台机器做选型。
第一条:内存容量决定「能不能跑」。模型权重的占用 ≈ 参数量 × 量化位数 ÷ 8。比如 27B 模型做 6-bit 量化,权重约 21~23GB。知乎再往上还要留给操作系统和 KV cache 的空间,上下文越长,KV 吃得越多。
第二条:内存带宽决定「快不快」。生成阶段每吐一个字都要把权重近似过一遍,理论上限 ≈ 内存带宽 ÷ 权重占用。按这个公式粗算(数量级估算,具体以实测为准):
M6(170GB/s)跑 27B 6-bit(约 22GB):生成上限约 7~8 tok/s,能用,但不算快
M5 Pro(307GB/s):同模型约 14 tok/s,接近舒适线
M5 Max(最高 614GB/s):约 28 tok/s
M5 Ultra(1.2TB/s):50 tok/s 往上,接近云端 API 的体感
顺带说一个容易被忽略的点:MoE 小激活模型(比如激活参数只有 3B 的 35B 级模型)生成时只读取激活部分,低带宽机器上也能跑得飞快;但稠密模型就是老老实实吃带宽。所以「这台机器跑模型快不快」,答案永远是「看你跑哪个模型」。
把账算完,各档配置的适用人群就很清楚了:
16GB 标配(6999 元):只能跑 8B 级别小模型,属于「体验玩具」。认真做开发别为这个配置买单,现在随便一台 16GB 的旧电脑装个 Ollama 也能达到同样效果。
M6 + 32GB:入门之选。最近社区热推的本地主力模型就是 27B 级别(6-bit 量化后 21~23GB),32GB 能让它常驻;代价是带宽偏弱,吐字偏慢,适合预算优先、对速度不敏感的人。知乎
M5 Pro + 48GB / 64GB:这代的甜点位。48GB 从容跑 27B,64GB 还能摸一摸 70B 的 4-bit;雷雳 5 接口也给后续多机集群留了余地。
Mac Studio M5 Max + 128GB:多模型常驻、跑 100B 级别的重度用户。
M5 Ultra:96GB 起步就要 46999 元,512GB 顶配是给要跑数千亿参数模型的工作室准备的,不是个人开发者的预算。

另外提醒一句:量化不是越狠越划算。社区实测数据里,27B 模型从 6-bit 压到 4-bit,代码能力的量化指标明显劣化,复杂推理肉眼可见退化。知乎内存紧张时宁可降一档参数量、保 6-bit,也别硬上大模型的 4-bit。
四、两个「场外选项」:小米 AICube 和 RTX 5090
苹果官宣前两天,雷军也官宣了小米 AICube 原型机:玄戒 O3 + O100 + D100 三颗自研芯片,150W 持续性能释放,号称本地部署 120B 大模型,还有 120B+3B 双模型快慢系统切换。微博微博

话题热度很高,但必须泼盆冷水:它是工程原型机——没有售价、没有上市时间、连操作系统和软件生态都没公布。知乎知乎上 26 万阅读的高赞回答说得很直白:「现在没必要买,看看就好」。知乎
我的判断:AICube 目前不构成任何人的购买替代方案,但值得列入观察清单。它身上的 80GB 统一内存 + 传闻中的 LPDDR6 如果真能量产,并且被小米打进消费级价位,本地大模型硬件的定价格局会被重写。知乎到时候再看,不亏。
另一个选项是独显路线。以 32GB 显存的 RTX 5090 为例,显存带宽大约是 M6 版 Mac mini 的十倍,生成速度远快于 Mac;但 32GB 显存上限摆在那里——120B 模型塞不进去,70B 也要极限量化。知乎简单说:要快,买显卡;要大,买统一内存。Mac 的核心竞争力从来不是速度,而是「单机能跑下多大的模型」。
五、结论:谁该买,谁该等
不买的:现有机器内存已经够跑你想跑的模型(哪怕慢一点)——这代涨价 2500 元,不值得为「吐字快一点」换机;只想体验一下本地模型的,先用现有电脑装 Ollama,一分钱不花。
明早值得预购的:M5 Pro + 48GB/64GB。做本地开发测试、在意数据不出本机、需要长上下文和常驻 Agent 环境的开发者,这是这代最不后悔的配置。
等的:想要 512GB Studio 的(10 月下旬才上);想看小米 AICube 定价的(没有时间表,纯观察)。
老 Mac 用户:生成体验主要看带宽,M6 的带宽相比上代提升有限,内存不缺就别急着升级。
最后一个容易混淆的点:本地跑开源模型,和 Apple Intelligence 在国区的审批进度是两码事,前者不依赖后者,别被部分标题带偏。
你现在本地跑的是什么模型、什么配置、吐字速度多少?评论区聊聊,后续有机会把大家的实测按带宽汇总成一张对照表。