9月22日,新一代Mac mini正式开售:M6芯片,6999元起。 开售第四天,小红书上一篇《Mac mini M6到了》的开箱帖,评论区已经吵翻了,最狠的一条是"又一个被忽悠用Mac跑本地ai的",还有人直接断言"这配置想本地模型,你开玩笑呢吧"。 “跑本地,mini都是弟弟,应该上Studio”“本地模型聊聊天还行,干活没法用"也是这条帖子下面的高赞回复。但就在9月26日晚上,另一篇真机实测帖给出了完全相反的结论:Mac mini M6 32GB跑27B大模型,能,而且是真的可以日常使用。 一边是"被忽悠”,一边是"真能日常用"。作为一个正打算花钱搞本地大模型主机的人,这时候最容易犯两个错误:要么被开箱热情带着冲一台低配,要么被评论区劝退、错过这一代真正变了的地方。这篇就把两边吵架的依据全部摊开,算清账,再对号入座。新浪微博小红书小红书
一、先看实测:32GB的M6跑27B,到底是什么体验
先说数据,全部来自真机实测,不是官方宣传。机器是Mac mini M6、32GB统一内存,跑当前本地圈公认的"智商天花板档"模型Qwen3.8-27B(Q4量化,文件16.34GiB),用llama.cpp走Metal GPU加速,实测生成速度8.33 token/s。 完整数据是这四条:小红书
Prompt处理速度:约220 token/s,长文档喂进去不心疼
生成速度:8.33 token/s(无审查版Q4_K_M为8.57 token/s,差距聊胜于无)
Metal推荐最大工作集约26.8GB,确认是真GPU推理,不是CPU硬扛
Q8量化版接近29GB,32GB内存塞不下;Q4的16GB才留得下系统和上下文的余量

8.33 token/s是什么概念?大约每分钟输出500个token,一个1000 token的长回答要等2分钟左右。对比一下:云端大模型基本是"秒回",而人的阅读速度大约就是每分钟几百字——所以8 t/s属于"能用、但你能明显感觉到它在打字"的水平。顺带提醒一句,海外博主宣传的"M6跑27B达53+ TPS"和国内实测差距很大,口径不同(量化档、上下文长度、是否只测了首token都可能掺水),买之前别拿宣传数字做决策依据。 而评论区说"被忽悠"的人,依据也真实存在:27B这个体量放本地,Q4刚好、Q8装不下;想在32GB机器上追求更大量化精度或更长上下文,物理上就是不够。KV cache会随上下文长度线性吃内存,“模型装得下,一上长上下文就爆"是本地玩家的经典翻车点,知乎上自托管爱好者的原话是"上下文长度被显存钉死”。哔哩哔哩知乎
二、把三条本地路线摆在一起看,速度就是用途
Mac mini只是本地大模型的路线之一。最近一周能采到的真机实测,至少有三条典型路线,按价格和速度排给你看。
路线一:Mac统一内存(约7000-10000元)——就是上面那台M6 32GB。8 t/s出头的生成速度,安静、省电、不占地方,开箱即用。适合轻度聊天、文档问答这类"等得起"的场景。
路线二:A卡大显存(约1.6万元整机)——7900XTX 24GB显存,同样跑Qwen3.8-27B的Q4版(约17GB),实测平均速度约50 token/s,上下文能撑到160k token,一本长篇小说一次读完。 曾经"AMD跑AI劝退"的ROCm生态,现在是真的能用了,只是优化仍然比N卡少一截,这也是玩家圈公认的取舍。小红书

路线三:低配穷哥们(8GB显卡+32GB内存)——最反常识的一条:8GB显卡跑通了177B参数的Qwen3.8-Flash-Next,模型文件72.5GB,靠的是把放不下的部分卸载到内存和虚拟内存。代价是只有6 token/s,一问一答等半分钟,不适合聊天;但拿去挂机出活——写长稿、啃长文档、批量核数——完全成立,实测6项考试对了56分。 博主的原话很准:“穷哥们手里的卡,上限比想象的高。”小红书
把三条路线摆在一起,你会发现一个被很多新手忽略的规律:在本地大模型这里,速度就是用途。30 t/s以上才能交互式协作,8 t/s只能"发出去就去干别的",6 t/s就纯挂机。所以那位自托管爱好者的总结值得抄下来:本地部署给你的是"数据主权"和"边际成本为零",不是一个不要钱的员工。 把它当成一个不知疲倦、但只有短期记忆的实习生,预期就对了——批量改写、分类、翻译、embedding、涉密材料这些活交给本地;长链路改代码、复杂排错,还是云端的强项。知乎
三、为什么这一波值得围观:厂商集体押注端侧
如果只是Mac mini更新,还轮不到"本地大模型"兴趣圈集体围观。真正值得注意的是同一周发生的几件事拼在一起。
苹果公布了一份本地AI推理能力设备支持图表:iPhone和iPad在16GB统一内存条件下可运行140亿活跃参数的模型,Mac设备最高可支持1.6万亿参数规模的模型。 苹果还给出了硬门槛——本地推理需要约76GB/s的内存带宽,而即将到来的A20 Pro带宽达115.2GB/s。新浪微博

M6本身是苹果首款2nm芯片,CPU、GPU都是12核,本地跑大模型速度最高可达M4的4.8倍,而且首次给Mac mini的每颗GPU核心加入了神经网络加速器——这是专门为本地推理加的硬件,不是顺带的。 同一周的骁龙峰会上,高通宣布第六代骁龙8至尊版首次在手机端侧跑通300亿参数MoE模型,AI读邮件、提行程全程无需云端。 手机、迷你主机、桌面工作站,几家厂商在同一个月里把"本地跑大模型"写进了硬件卖点。这意味着接下来一年,端侧模型的适配、量化方案、软件工具链会快速变好——这也是"现在买硬件"和"再等等"之间真正的变量。新浪微博新浪微博
四、价格账和两个明确的坑
到消费决策环节,把账算清楚。起售价6999元(M6、16GB/256GB);京东国补后5919元起,叠加教育优惠有博主报到5269元。 而预算充足、目标就是大模型的,可以直接看Mac mini M5 Pro,最高64GB统一内存。新浪微博
跑大模型建议直接上32GB内存——但32GB要加钱选配,而且这一档等货最狠:从8月27日预购到9月22日开售,官方渠道等了近一个月才到货。 预算不够等32GB的也有办法,美国32GB/1TB版1799美元、免税州提货,国内32GB+256GB+10G网口的现货,深圳已经有人9500元收。新浪微博小红书小红书

两个坑必须说。第一,256GB版实测SSD速度减半,且这一代NAND直接焊死在主板上,第三方扩容的路被堵死了——而27B的Q4模型一个就16GB,加上Qwen、DeepSeek各家模型库,256GB硬盘是真正的短板,买256GB版跑模型的,大概率很快就要靠外接硬盘过日子。 第二,今年起售价比去年贵了约一千块,"一年涨千元"的吐槽已经上了热搜,介意首发价的可以等国补和渠道价稳定再出手。新浪微博新浪微博
五、对号入座:四种人四种买法
只是好奇、还没用过本地模型的:别买任何硬件。先拿现有的电脑配个商用API把逻辑跑通,国内主流平台都有免费额度,日常使用几块钱能用很久。 等你真遇到本地部署能解决的问题——涉密数据、高频批量调用、离线环境——自然知道该怎么选。小红书
有隐私/离线刚需、使用强度不高的:Mac mini M6 32GB是这一代最省心的入场券。安静、省电、开箱即用,8 t/s对文档问答够用。记住两条:买32GB内存、别买256GB硬盘。
追求交互速度和长上下文、想折腾本地Agent的:上显卡方案。24GB显存的卡是27B的甜点位,50 t/s和160k上下文才是"能干活"的门槛,预算按1.5万往上做整机组。
只想挂机批量出活、预算有限的:低配也能玩,8GB显卡+大内存+把虚拟内存上限拉高,6 t/s挂一晚上照样出活。这条路的上限比你想象的高。
六、继续盯这三个信号
一是量化技术:三值量化已经把27B压到5.9GB、保留98.2%的FP16性能,16GB内存的Mac就能跑27B——这类技术成熟会直接改写上面的内存选购建议。 二是2MB的纯C小工具colibri,把744B模型拆成"常用专家放内存、其余放硬盘",低配路线的天花板还在被抬高。 三是Qwen3.8生态的量化版本迭代速度,小米MiMo、GLM的本地量化版也在跟进,模型端的选择只会更多。哔哩哔哩小红书
一句话收尾:这一代Mac mini M6没有"被忽悠"那么惨,也没有开箱帖说的那么神——它是一台合格的27B级本地AI入门机,但8.3 token/s的速度把用户分成了三派,而你要做的只是先想清楚自己是哪一派,再掏钱。