2500元涨价,明早预购开启:Mac mini M6的「4倍AI性能」,本地大模型能吃到多少

源自277位全网作者

08-27 03:57

明早 9 点,M6 版 Mac mini 国行开启预购,9 月 22 日发售。极客公园如果你打算买一台来跑本地大模型,交定金之前,这篇文章值得先看完。

昨晚发布之后,圈里已经吵翻了。B站「值不值得买」主题的视频一夜之间冲上十几万播放,高赞评论说得很直白:「不值得买,首先价格起飞,起步还是 16+256 拉完了。我去年买了两个 M4 的 mini 才花了 5700 多,M6 主要给了两个超大核和两个 GPU核心,剩下没提升,堪比 ipad air 挤牙膏」。哔哩哔哩小红书上「16+256 m6 mac mini要6999??」的帖子也在刷屏,楼主第一反应是「吓到了。。之前m4最低配的16+256 涨价我记得是4000多涨价到了5000多吧」。小红书

大家盯着的都是那 2500 块的涨价。M6 芯片、16+256G 配置卖 6999 元,而 24 年发布的上一代 M4 同配置只要 4499 元,「相比之下,今年的Mac mini直接涨价了2500元」,这力度搁谁身上都得愣一下。知乎但对真要在本地跑模型的人来说,还有一个更要紧的问题,藏在苹果的脚注里,今天的讨论里几乎没人提。

2500元涨价,明早预购开启:Mac mini M6的「4倍AI性能」,本地大模型能吃到多少

先说清:「4 倍」加在「读题」上,不在「吐字」上

本地跑大模型其实分两段。知乎网友把它拆得很清楚:「提示词灌进去,它读完那一大段,这叫读题,吃算力;然后它一个词一个词往外蹦,这叫生成,吃带宽」。知乎

那苹果「AI 性能最高快 4 倍」测的是哪一段?「苹果脚注写得挺老实:8000 词元的长提示词、一个 140 亿参数的 4 位量化模型,用一个叫 LM Studio 的本地推理工具,比的就是读题那一段」。知乎这一段 M6 确实有本钱:每个 GPU 核心里都塞了神经加速器,双 16 核神经引擎,官方宣称 AI 算力是 M1 的 8 倍还多。哔哩哔哩

可日常用本地模型是「问一句、答一屏」,绝大部分时间花在吐字上。吐字速度由内存带宽决定,而这恰恰是 M6 mini 在整个 Mac 产品线里最细的那条腿。

2500元涨价,明早预购开启:Mac mini M6的「4倍AI性能」,本地大模型能吃到多少

吐字到底快多少?苹果其实自己测过

不用等第三方实测。苹果自家的机器学习博客对比过 M5 和 M4:带宽差距在同一量级时,「吐字速度实测提升 19% 到 27%。不是 4 倍,是两成多」。知乎

套到这台 Mac mini 上:M4 mini 带宽是 120GB/s,而按网友对照官方规格页的读法,「起售那台标的是 153GB/s,加到 24GB 以上才够得到 170。也就是高了 28%」。知乎多数媒体报道时用的是 170GB/s 这个数字。哔哩哔哩28% 的带宽提升,按苹果自己的换算,吐字速度的现实预期就是两到三成;就算按 170GB/s 算,提升也就是三成多的量级,跟「4 倍」都不挨着。153GB/s 这个数字目前是单一网友信源,预购前建议自己去官网规格页复核;如果属实,这是丐版除了 16GB 内存之外的第二个暗坑。

2500元涨价,明早预购开启:Mac mini M6的「4倍AI性能」,本地大模型能吃到多少

全系带宽一张表,跑 27B 大模型的账都在这

对跑大模型的人,内存带宽是第一参数。吐字理论上限 ≈ 带宽 × 利用率(按 0.8 估)÷ 模型占用。以这季的当红开源模型 Qwen3.8-27B 的 Q4 量化(约 16GB)为例:

机型

内存带宽

27B Q4 吐字理论上限

Mac mini M4(老款)

120GB/s

约 6 tok/s

Mac mini M6 丐版 16GB

153GB/s(网友读规格页)

约 7 tok/s

Mac mini M6 24GB+

170GB/s

约 8 tok/s

Mac mini M5 Pro(最高 64GB)

307GB/s

约 15 tok/s

Mac Studio M5 Max 入门 36GB

460GB/s

约 22 tok/s

Mac Studio M5 Max 高配

614GB/s

约 30 tok/s

Mac Studio M5 Ultra(最高 512GB)

1200GB/s

约 58 tok/s

这张表有实测锚点:有人在 M5 Pro/48GB 的 MacBook Pro 上跑 Qwen3.8-27B,「最好的纯 4-bit 方案在约 16K context 下能达到 16.11 token/s;llama.cpp 的 Q4_K_M 主模型加 DFlash2 Q4_K_M 草稿,也能达到 14.52 token/s」。知乎理论值 15、实测 14.5–16.1,对得上,说明这张表可以拿去做购买决策的参照。

丐版第二个暗坑:16GB 连当红模型都装不下

带宽不够还能忍,内存不够是硬伤。十六个 G,「系统先吃掉一块,剩给模型也就十来个 G 吧,塞得下这个量级的量化模型,再往上就别想了」。知乎

而这一季的当红模型 Qwen3.8-27B,光 Q4 量化就要 16GB 上下,还没算上下文缓存,没算想加速时得额外塞进去的草稿模型。苹果自己也认:「M6 版有个绕不开的天花板,统一内存 16GB 起步,最高 32GB。32GB 跑日常 AI 工具是够的,7B、14B 的模型随便跑。但你想上 32B 的模型,就得掐着量化精度一颗一颗算内存了」。知乎

就算装下了,还有得等。同一份实测里,「16K context 下,最快的 oMLX 4-bit 也要等 42.7 秒;Q4 + DFlash2 要等 69.4 秒」,32K 上下文最短也要 96.8 秒才吐出第一个字。知乎

测试者的结论很直接:它能完成推理,「却很难提供稳定、低等待、可扩展的长上下文体验」。知乎48GB 的机器尚且如此,16GB 的丐版留给大模型的空间,自己想象。

2500元涨价,明早预购开启:Mac mini M6的「4倍AI性能」,本地大模型能吃到多少

也说句公道话:这三种情况,4 倍你能吃到

长提示词场景。长文档摘要、整个代码库分析、RAG 拼接这类「大进小出」的活儿,读题提速是实打实的:「用 LM Studio 处理大模型提示词,M6 版 Mac mini 的速度最高是 M1 版的 13.5 倍、M4 版的 4.8 倍。而 Excel 表格计算呢,只有 M4 版的 1.5 倍」。知乎这两天圈里传的「4.8 倍」其实就是首词响应这个数,含金量是真的,只是方向跟大多数人想的不一样。

投机解码组合。DFlash2/MTP 这类「草稿模型」加速,会把吐字从带宽问题变回算力问题,M6 的神经加速器正好用得上。有实测数字:「之前 Qwen3.8-27B 加上 DFlash2 ,在 M2 Max 上就只有不到 12 t/s 的速度,但是 M5 Max mbp 上可以在 DFlash 加持最高到 70 tok/s 的速度运行 Qwen3.8-27B」。知乎前提有两个:主模型加草稿模型都得装进内存,27B 加 DFlash2 在 16GB 机器上连门都进不去,这个红利主要属于 24GB 以上的配置;而且别以为打开开关就起飞,「它首先需要目标模型、草稿模型、量化格式和后端版本都匹配」。知乎现在还有 oMLX 版本加载不了 DFlash2 草稿权重、直接静默回退成普通引擎的情况。

常开小机器场景。这才是 M6 mini 最稳的用法。之前 OpenClaw 爆火,「这类工具要一台机器长期开着跑,因此量大管饱的 Mac mini M4 成为了版本答案」,一路被捧成「龙虾神机」。极客公园这种用法要的是 7B–14B 小模型加全天候低功耗常驻,16GB 够了,带宽表也不用看。甚至有项目专门组织闲置 Mac 出售推理算力,「目前说有几百台 Mac 在线,平均每台机器主人能赚 $120–200 / 月」。知乎连库克都在财报会上亲口说,这些设备是运行智能代理工具的绝佳平台。冲着常开买,丐版就够,不用为「4 倍」缴税。

等一等不会更便宜,折扣区在老款

很多人的第一反应是:涨这么多,等等呗。但这 2500 块是全行业的「内存税」:2026 年第一季度,「一般型 DRAM 合约价季度环比涨了 93% 到 98%,其中 PC 用 DRAM 单季涨幅超过 100%,是有记录以来最高」。极客公园

三星、SK 海力士把先进产能转去做 HBM,消费级内存的产能被挤压,涨价的远不止苹果:戴尔商用 PC 涨了 10%–30%,联想全系涨约 15%,Framework 干脆把 64GB 订单降配成 32GB。「机器越便宜,内存在成本里的分量越重,涨价越藏不住」,Mac mini 作为最便宜的 Mac,自然首当其冲。极客公园

2500元涨价,明早预购开启:Mac mini M6的「4倍AI性能」,本地大模型能吃到多少

所以新款短期不会降,真正的折扣区在老款清仓。M4 mini 现在部分渠道「16+256G 的款式国补后5099元」。知乎知乎评论区还有人晒出更低的活动价。老 M4 带宽只有 120GB/s,但丐版 M6 同样卡在 16GB 内存上,小模型场景下两者的体验差距,远小于价格差距。

最后,给三类人一张清单

  • 目标就是跑 27B 级大模型的:别碰 6999 的丐版,内存带宽双死局。预算万元左右选 24GB 定制版(对应 170GB/s 带宽),或者直接 12999 元起的 M5 Pro 版(24GB+512GB),带宽 307GB/s、最高 64GB 内存。知乎后者带宽是前者的近两倍,这才是 mini 产品线里跑大模型的真正起跑线。

  • 想要一台常开 Agent 小机器的:可以买,但别为「4 倍」买。16GB 丐版跑 7B–14B 小模型足够,下单前先比比 M4 老款清仓价。

  • 重度需求(长上下文、RAG、多人服务)的:跳过 mini 看 Studio。M5 Max 版 19999 元起,注意入门档对应的是 460GB/s 带宽,宣传图里那个 614GB/s 是高配档的数字;512GB 的 M5 Ultra「还要等到 10 月下旬」。知乎

后面有三个信号值得继续盯:一是 9 月 22 日发售之后,丐版机型的真实带宽和吐字实测(验证 153 还是 170GB/s 之争);二是 MLX 系工具对 DFlash2/MTP 加速的兼容进度——现在的情况是,加速开关不一定真的在跑;三是 M4 老款清仓价的走势,它越低,「老款 + 小模型」这条路的性价比就越高。

涨价不可怕,可怕的是买错预期。4 倍是真的,但它写在读题上;你的大模型在等的,从来是带宽。

内容由AI生成
7
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章