这两周本地AI圈就两件事:DeepSeek把V4系列API价格往上抬了一大截。哔哩哔哩阿里反手开源了Qwen3.8-27B,后者发布48小时冲上Hugging Face趋势榜第一,Ollama单渠道5天36万下载,LM Studio上线38分钟下载破万,连Cline都官宣它成了开发者选得最多的本地模型。知乎于是一堆人开始盘算:要不要买张卡,把这玩意儿部署到本地?
先别急着下单。今年消费级显卡什么行情,装机党都懂——存储芯片产能往服务器倾斜,内存、固态、显卡全线涨价。有B站UP主两个月前4199买的RX 7900 XT,现在二手价比全新还贵。哔哩哔哩这个节骨眼上为了跑个模型去追高买卡,账不一定算得过来。
其实很多人桌上就有一台现成的"本地AI主机"被忽略了——你的Mac。
过去几天我把知乎、小红书、B站上能找到的Mac跑Qwen3.8-27B的实测几乎翻了个遍,从16G丐版M1到128G的M3 Ultra都有人真跑过。今天这篇就把这些散落的实测归拢成一张表、三个真相、几个坑,你对照自己的内存档位,基本就能决定要不要上手。
先说清楚:为什么这代模型,Mac反而有机会
很多人对本地部署的印象还停在"27B模型至少要30G显存"。这个说法对传统模型没错,但Qwen3.8-27B有两个特殊之处。
第一是架构。它是64层混合注意力:只有16层用全注意力,剩下48层换成Gated DeltaNet线性注意力。知乎通俗讲,别人每个token都记一笔流水账,它只记余额——KV cache大约只有同尺寸传统模型的四分之一。这也是它27B的身板敢标262K原生上下文的原因。
第二是量化生态跟得快。模型发布没几天,MLX 4bit、Unsloth的Dynamic 3.0超级量化(最低压到1-2bit、6~8GB)就全出来了。小红书4bit版本主体约15GB,加上下文实际占用峰值也就18GB上下——24GB内存的Mac理论上装得下,还带富余。

再加上苹果统一内存的先天优势:显存即内存,不存在"N卡显存不够直接OOM"的问题,内存有多大模型就能吃多大。这是Mac在本地AI这条路上唯一的、但很关键的长板。
全网实测汇总:你的内存在哪一档
以下全部来自社区真实发帖(发布集中在8月18日到22日这几天),我按内存档位归拢,速度单位都是token/s,约等于每秒蹦几个字:
8G~16G:能点亮,但别谈体验
8G内存Mac:靠Unsloth Dynamic 3.0的UD-IQ2_S(约6-8GB)确实能部署起来,小红书原帖18个赞,但这是1-2bit极限压缩,属于"证明可行性",不是让你天天用的。
16G丐版M1:有人实测跑通了代码任务,评价是"智商在线",只是token输出速度稍慢。小红书但注意另一个信源的提醒:16G老款只能退到2bit,质量肉眼可见往下掉,“这份钱别硬省”。小红书
24G:及格线,玩具档
M4 Mac mini 24G:MLX 4bit+MTP,峰值内存18.17GB,普通短回答约4 token/s,MTP接受率高时接近10。小红书
MacBook Air M5 24G:普通4bit 8 token/s;oQ3.5e+fp16 MTP能到15,但上下文一到10K就掉到10,原帖结论很直白——“15 t/s也就是个大玩具,日常问两句还行,指望它干活会等到怀疑人生”。小红书
32G:甜点档
HN上的真实报告:5年前的32G M1,跑4bit(占15G内存),稳。知名开发者Simon Willison也把Qwen3.8塞进了Mac,吐槽的是默认设置而不是硬件。小红书
48G:能干活的门槛,但长上下文是短板
M5 Pro 48G:oMLX 4bit在16K/32K上下文下约16/15.6 token/s。听着还行?但32K上下文时,首个token要等97~113秒。小红书实测者结论:偶尔离线聊天没问题,当稳定主力做长文档问答,不行。
64G~128G:生产力档
M4 Max 128G:oMLX跑Qwen3.8-27B,长文本生成实测33 token/s。小红书
M5 Max:4bit+MTP优化后能到50~60 token/s,而同样的M4 Max跑普通MLX 4bit大约只有23。知乎
顶配128G MacBook Pro:基准4bit 27.9,换DFlash2加速到41,再调权重配置干到55.9。小红书
M3 Ultra(Mac Studio)+ DFlash2:短推理95.1,代码59.2,长文45.4——这是目前Mac阵营的天花板数据。小红书另外还有一台Mac Studio(M2)实测33,也落在高带宽档的合理区间。小红书

三个真相,看之前先建立预期
真相一:"能跑"和"能用"是两回事。
8G、16G那些"跑通了"的帖子大多在展示极限操作,不是日常可用状态。从实测密度看,社区真正把它当日常工具用的,基本都在32G及以上。
真相二:速度主要看内存带宽,不是内存容量。
同样是24G,M5 Air(8 token/s)和M4 mini(4 token/s)有差距但都不快;到了M4 Max/M2 Max这个带宽档,直接跳到23~33;M3 Ultra带宽拉满,短推理能上95。本地推理每生成一个token都要把整个模型权重从内存读一遍,带宽就是天花板。所以判断你的Mac行不行,别看"内存够不够装下",要看"芯片是哪一档带宽"。
真相三:免费加速都有代价,别看到"提速100%"就冲。
MTP(多token预测)是这代模型自带的加速,开和不开速度差接近一倍。但M5 Air那位实测者踩出了关键坑:MTP本身千万别跟着量化——同样的底子,配fp16 MTP是15 token/s,配量化MTP只剩12,不开MTP更是9。小红书量化把草稿接受率打下来,等于白算一轮,速度不升反降。
几个具体坑,都是别人真金白银踩出来的
LM Studio两个默认设置不改,再好的硬件都像卡了。上下文长度默认8192,思考强度默认最高档。小红书结果就是:让模型画个圆,它先在"包豪斯绘图氛围"里雕20分钟,2万token的窗口当场塞满,吐出来一个半成品。手动把上下文上限拉到262K、思考强度调到low或medium,两分钟出头交活,成色不打折。这锅硬件不背。
思考模式是真能磨人。同一张图,开思考21分钟画好,关思考137秒但构图直接塌。没有完美解,只能按任务切——急活关思考,细活开思考。
24G内存开MTP要盯着内存。有实测是4bit+MTP一轮对话直接爆内存。小红书想稳就选oQ3.5e+fp16 MTP这个组合,或者把上下文压到8K。
长上下文别指望Mac。48G内存的M5 Pro,32K上下文首字等97秒起。要长期处理长文档、喂整个代码库,社区的一致建议是上服务器或者N卡方案,别跟Mac较劲。小红书

按档位给结论
8G/16G:建议只当尝鲜。装个Unsloth Dynamic量化版感受一下"本地AI是怎么回事"可以,别指望它替你干活。
24G:聊天、翻译、总结、轻量代码问答够用,记住选oQ3.5e-fp16-mtp(24G)这个组合,把它当"免费的离线助手"而不是生产力。
32G:甜点档。4bit稳跑,配合改好的LM Studio设置,这是性价比最高的"认真入门"档位。
48G-64G:可以当主力聊天/编程助手,但避开长上下文重度场景。
128G Max或Ultra:已经是正经生产力,50~95 token/s,写代码、跑agent都成立。

最后补一句大实话:这波显卡涨价周期里,"先把手头的设备用起来"比"追高买新卡"理性得多。Qwen3.8-27B的价值恰恰在于它把旗舰级开源能力的门槛拉到了消费级硬件上——社区甚至估算过,全球1.1亿台苹果芯Mac里,至少两成内存是够跑4bit的。小红书
接下来值得持续盯的信号:MLX生态对MTP的支持成熟度、Unsloth Dynamic量化的质量口碑、以及苹果会不会在系统层面给本地模型推理做优化。这几个变量任何一个兑现,Mac档位的结论都可能往上抬一档。
你的Mac是多大内存?跑过或者正准备跑的,评论区交个作业,速度多少、卡的哪一步,咱们对一对。