最近"买台Mac跑大模型"这个念头,估计不少人都动过。WWDC26之后M5 Ultra把统一内存带宽拉到1.2TB/s,新一批Mac mini M6陆续到货,再赶上MiniMax H3这波开源视频模型本地跑的热潮,Mac突然又成了本地部署圈的中心话题。小红书
但社区里吵得也凶。小红书上一篇《想买Mac部署大模型的都清醒一点》,十几条评论吵机型吵到不可开交,博主直接甩结论:M6、M5 Pro跑不动,M5 Max勉勉强强,M5 Ultra畅跑。另一篇《本地大模型很好,但Mac不好》更是92条评论吵翻了天。有老玩家总结得更直白:每次发本地部署,评论区必吵,有人说Mac mini好,有人说必须上塔式机,两边都觉得对方外行。小红书小红书小红书
我把最近一周全网的实测帖扒了一遍,发现吵的根源其实是同一件事:把"模型能塞进去"当成了"机器能干活"。这中间隔着三堵墙,每一堵都有人用真金白银撞过。
第一堵墙:统一内存不是显存,苹果默认只批给你75%
Mac玩家最容易踩的第一个坑,是拿N卡的显存记账方式直接套统一内存。Mac上跑大模型,系统默认只允许GPU划走大约75%的统一内存(wired_mem_limit)——也就是说,你那台128G的Mac,GPU真正能用的只有96G左右,还没开跑就先被系统收走一块。小红书
有博主用M3 Max(128G内存)+ oMLX硬跑103.94G的Qwen3.8-Flash-Next量化版,把坑全踩了一遍:Metal内存上限107.52GB,模型权重先占掉98.21GB——91%没了,只剩约9GB留给KV Cache和预填充缓冲。结果就是调度器只能把预填充块从4096一路砍到416甚至96,预填充速度从19.8 tok/s直接掉到0.8 tok/s。小红书
注意,这时候解码速度其实还有25-34 tok/s,对这个体量的模型属于正常水平——慢的不是推理,是内存。博主的原话很扎心:“128G跑104G是「刚好塞下」”。刚好塞下,恰恰是最危险的状态:权重把内存吃干抹净,留给"干活用的活钱"所剩无几。小红书
这套账N卡玩家其实熟悉——之前聊过"27B权重只有7.2GB、12G卡却吃到10.8GB",就是只算权重不算KV Cache的坑。Mac版多一层:还没轮到你算,系统先砍你25%。

第二堵墙:带宽管吐字快慢,算力管首字等多久
第二个误会更隐蔽:只盯着带宽数字买机器。统一内存的带宽决定的是模型"开口之后"吐字快不快;但你点下发送到它吐出第一个字之间的那段"读题"(预填充),吃的是纯算力。系统提示、历史对话、挂载的文件、Agent一轮轮的工具调用,几乎每轮都要重新吞一遍。跑个Agent流水线,题目越长,这段等待越明显。小红书
这正好解释了一个反常识现象:为什么二手M1 Ultra、M2 Ultra"纸面800GB/s带宽"放到今天并没有想象中香。有博主拿自己的M1 Pro和公司的M4 Pro实测,再对照社区benchmark,结论是老Ultra跑纯LLM解码确实还能打,但一进真实生产力场景——Agent、长上下文、多轮工具调用——就力不从心,新一代芯片在预填充和GPU架构上的差距开始显现。小红书
而在M5 Ultra之前,Mac这截"读题"能力一直是短板。M5 Ultra能不能补上,开售后的实测才算数,现在提前吹或提前贬都不靠谱。这也是当前Mac跑大模型最大的悬念。小红书
第三堵墙:SSD缓存救不了内存不够
第三个坑,是"内存不够拿SSD凑"的幻想。
还是那台128G硬跑104G模型的实测:很多人以为oMLX这类框架能把模型切一部分到SSD上跑——错。进SSD的只有KV Cache(注意力状态),98.2G的权重必须完整待在内存里,一克都不能少。小红书
更妙的是缓存块的机制:这个混合架构的缓存块是4096 token一块,博主前三轮提示词长度分别是53、116、1518 token——一块都凑不满,缓存效率0%、缓存文件0。直到第4轮一次性塞了9740 token,才第一次真正写入缓存。博主总结:它治的是重复预填充的首字延迟,治不了内存不够。小红书

视频党单独算:M5 Ultra跑MiniMax H3的四档实测
如果奔着这波H3本地跑视频的热潮去买Mac,有一份针对M5 Ultra、跑42.5GB的MiniMax H3的调研值得整段看完。调研的结论先行:显存够霸权,但算力是瓶颈,纯跑视频千万别盲目冲超大内存。同样是受75%划拨上限约束,四档内存表现截然不同:小红书
96GB:GPU可用约60GB,跑720p尚可,跑1080p极易触发OOM或SSD Swap导致卡死,属于踩线临界;
128GB:GPU可用约96GB,权重与1080p去噪激活值完整常驻,零换页损耗,是最经济的安全线,也是甜点档;
256GB:显存充沛到可以直接加载原生FP16/BF16未量化权重(约80GB),挂多重ControlNet画质零衰减;
512GB:算力根本喂不饱显存,跑纯视频纯属浪费,唯一价值是做多模态Agent本地服务器,常驻70B以上的编剧大模型加音视频全管线。
速度上的现实更残酷:同一个1080p、5秒的片段,RTX 4090魔改48G约9分钟出片,M5 Ultra被拉开约45倍差距。小红书
慢的原因是Mac缺乏专用低比特Tensor Cores,且MPS暂不支持SageAttention这类加速,视频模型正好把这两个短板全踩中。调研的选购建议一句话:Mac日常主力+夜间离线渲染,选128GB;商业级高频AI视频生产力,果断选N卡;严禁为了纯跑视频去买256G/512G。顺带一提,统一内存赛道不止苹果一家在卷,B站已经有博主晒出7000美元级别的Dell ProMax(Nvidia GB10、128GB统一内存)全家桶配置,Llama.cpp、Ollama、vLLM的对比都做了——这个赛道的价格战才刚开始。小红书哔哩哔哩

真要买,钱怎么花
综合几位博主的调研,预算分档大致是这样的:
约1.9万:M5 Pro 48GB。27B/32B级模型,本地Agent、知识库、日常开发能比较舒服地跑;
约2.75万:M5 Max 64GB。重度Agent、长上下文,轻度生图,更均衡;
约3.95万:M5 Max 128GB。被调研博主列为最推荐的一档——128GB才真正进入70B/100B级MoE的实用范围,且已有Qwen3.8-Flash-Next的真实部署数据背书。小红书
二手M2 Ultra、M4 Max不是不能买,但只有价格优势足够大才值得——老芯片的预填充短板摆在那里。至于15万的256G Mac Studio,社区里"当算力买不值、当理财产品真香"的争论就没停过,那已经是另一个故事了。小红书小红书

什么人该走Mac路线,什么人趁早转弯
把上面的账合起来,人群边界其实很清楚:
Mac路线成立的人:以跑语言模型为主,做本地Agent、私有知识库、文献阅读这类活;在意安静、省电、24小时挂机当家用AI主机;或者本来就缺一台主力Mac,跑模型只是加分项。这类人内存直接往128G配,64G是底线。
趁早转弯的人:文生图、AI视频是主业或强需求的,Mac连甜点都算不上,老老实实走N卡——这也是最近二手N卡价格往上飙的原因之一,需求是真实存在的。小红书
谁都别劝的人:只是好奇"本地跑大模型是什么感觉"的。先用手里现成的电脑装个Ollama或LM Studio,跑个9B级小模型试试需求是真是假,再决定要不要为这件事花两万块。为好奇买单,是这波热潮里最容易后悔的一种买法。
接下来值得盯的三个信号
一是M5 Ultra开售后的预填充实测数据——它决定"Mac读题慢"这块最后的心病补没补上;二是MPS什么时候支持SageAttention这类加速,直接决定Mac跑视频模型的可用性;三是二手M2 Ultra、M4 Max的价格走势,老旗舰的带宽红利还剩多少溢价空间。
你手上的Mac现在跑的什么模型、几个token每秒?评论区报个数,给后来人当个参考。
校验提示文案
校验提示文案