上周同一周里,两个Mac用户晒出了Qwen3.8-27B的实测结果,结论完全相反。
一位用的是MacBook Pro M5 Max 128GB,苹果笔记本的顶配。他跑的是BF16全精度版,引擎选oMLX,实测速度9 token/s,最长一次等了1800秒才输出一份超长课堂笔记,帖子的结论就四个字:无法使用。小红书
另一位用的是搭载M4 Max芯片的Mac Studio,统一内存大约只有前一位的三分之一。他跑的是MLX 4bit量化版,实测28 token/s,聊天、写文案、翻译、图片识别都顺,帖子标题直接喊出“Mac 真能跑 27B 大模型”。小红书内存少一半,速度反而快了三倍多。这不是玄学,是Mac跑本地大模型的规则跟N卡完全不一样。如果你也打算这周让自己的Mac加入Qwen3.8-27B的大军,先别急着下载——统一内存机器有三笔账必须先算清,算错了,轻则浪费50GB带宽,重则把顶配新机跑成打字机。
先说这个模型凭什么刷屏
8月14日,阿里正式开源Qwen3.8-27B:270亿参数的稠密模型,原生多模态,能看懂图片和视频,上下文原生262K,Apache 2.0协议,商用也免费。知乎
热度是实打实的:发布48小时冲上Hugging Face趋势榜第一,当天在Hacker News登顶,LM Studio上线38分钟下载破万,Ollama单渠道5天36万下载,编程工具Cline上线4天它就成了开发者选得最多的本地模型。知乎
第三方榜单也跟上了:Artificial Analysis的Intelligence Index给它52分,与GPT-5.6 Luna打平,比DeepSeek V4 Pro、GLM-5.2的53分只差1分。知乎Agentic Index 51分排第7,前面只剩Claude Opus 5、GLM-5.3、Grok 4.6。知乎社区因此给它起了个外号叫“模型斩杀线”——一个个人买得起、本地跑得动的开放权重模型,第一次摸到了前沿闭源模型的能力区间。

对Mac用户来说,这件事的意义很具体:这是第一个“一台Mac就能装下、且能力够用”的旗舰级开源模型。但“装得下”和“跑得爽”之间,隔着三笔账。
第一笔账:量化,决定的不只是体积,还有三倍的速度差
回到开头那个矛盾。M5 Max 128G为什么只有9 token/s?
Mac的统一内存没有独立显存的概念,模型权重整个吃内存,生成速度大致遵循一个粗暴的公式:生成速度约等于内存带宽除以模型权重体积。BF16版的27B权重大约54GB。知乎M5 Max的内存带宽按五百多GB/s算,540除以54,理论上限就是10 token/s上下——实测9,严丝合缝。内存装得下,不代表跑得动。
换成4bit量化,权重缩到16-17GB,同一台机器的理论上限直接翻三倍多。这就是为什么M4 Max 48G跑4bit能到28 token/s,而M5 Max跑BF16只有9。

社区的量化选择经验已经比较一致:内存够就上8bit,嫌慢就4bit。4bit快接近一倍,质量损失在日常聊天里感知不强,但长推理任务会偶尔露怯。知乎
至于262K上下文,得益于这代模型的混合注意力架构:64层里只有16层是全注意力,其余48层是线性注意力。KV缓存占用因此只有同尺寸传统模型的约四分之一。知乎48GB的Mac Studio跑4bit也敢开长上下文。

第二笔账:引擎,Mac上不是一个Ollama走天下
N卡用户基本Ollama/vLLM二选一,Mac这边选项多得多,而且各有脾气:
MLX:苹果自家的机器学习框架,Apple Silicon上的“亲儿子”,mlx-community的量化权重更新通常最快,适合愿意敲命令的用户。
Ollama:最省心。注意一个关键变化:Ollama从0.19版开始把Apple Silicon后端切到了MLX,Mac上跑本地AI从“能用”变成“真正吃到统一内存红利”。哔哩哔哩
LM Studio:图形界面,适合完全不想碰终端的人,但性能不一定是最优解——有实测显示,M2 MacBook上换用带SSD卸载机制的引擎后,速度从16 token/s提到47。哔哩哔哩
oMLX等优化引擎:主打KV缓存分级、冷数据卸载SSD,适合小内存跑大上下文,但新模型适配需要等,翻车概率也更高(开头那个翻车案例用的就是它加BF16的组合)。
另外有个细节对Mac用户特别实用:Ollama官方模型页的应用列表里,Claude Code就在第一行,两条命令就能把Claude Code的后端换成本地模型。知乎对代码不能出内网的人来说,这可能是目前最值得评估的方案——没有API费用,agent随便跑,token随便烧。
第三笔账:MTP和上下文,63 tok/s为什么变成11
Qwen3.8-27B内置了MTP(多token预测),可以理解为自己带了个打草稿的助手。这个开关开没开,速度差接近一倍:有B站博主在M4 Max 128G上用4bit量化加MTP实测,短上下文解码63.1 token/s,4K到16K稳定在42上下。哔哩哔哩代价是MTP会多吃内存、压缩可用上下文。所以看到谁报了一个很高的速度,先问一句:开没开MTP。
同一个测试里还有个反直觉的发现:上下文冲到31K,速度断崖式掉到11.3。哔哩哔哩也就是说长上下文不是不能开,是开了之后速度会换一档。拿它当agent后端时,决定流畅度的其实也不是生成速度,而是每一轮“读档”的预填充速度——上下文堆到几万字后,每轮开工前的等待会明显变长。内存带宽比纸面的tok/s数字更值钱。
各档Mac对号入座
把这几天知乎、小红书、B站、微博的实测拼在一起,大致是这么个分布:
统一内存 | 能跑什么 | 实测参考 |
|---|---|---|
16GB(M4 MacBook Air/Mac mini入门) | 27B稠密版别硬上;可跑7-9B小模型或MoE模型(有16G Air跑通MiniMax h3的案例) | 先体验生态,别急着升级 |
24-32GB(M4 Pro、老M1-M3 Pro/Max) | 4bit版紧凑可用,上下文要省着开 | 有32G老Mac跑通Qwen3.8的分享 |
48GB(M4 Max) | 4bit舒适,长上下文可开 | 实测28 tok/s |
64-128GB(M4/M5 Max) | 8bit可选,4bit+MTP最快,262K上下文无压力 | M4 Max短上下文63 tok/s;M5 Max 4bit约25,开MTP可到50-60 |

注意一个Mac特有的坑:内存焊死不可升级。买之前没想清楚,买之后就只剩换机一条路。而且今年硬件整体在涨价,有实测用户吐槽“等Mac Studio新型号,512G的价格估计要值一台小BMW”。小红书
Mac用户必须知道的几个坑
这几条来自社区真实反馈,比跑分重要:
默认推理档位会疯狂过度思考。 有国外开发者让它画个骑自行车的鹈鹕SVG,它在“要不要加同心辅助圆”这种问题上琢磨了21分钟,烧掉两万多个推理token;关掉推理,两分多钟完事。知乎日常使用建议把reasoning_effort调到medium或low。
token消耗比上一代高不少。 有并排实测:3.8在10个任务里赢9个,但平均token消耗接近3.6的三倍,有个任务想了7分多钟烧了三万多token。本地跑烧的是自家的电不心疼,但如果你打算走API按量计费,这笔账要算清楚,已经有人测完换回了3.6。
知识截止要留个心眼。 它自报训练数据到2026年,但一追问2024年之后的具体事就露馅。
别迷信1M上下文。 官方说用YaRN技术能外推到1M,但社区实测跑到的都是262K,1M目前还是发布会数字。
最后说清楚:谁值得跑,谁别折腾
值得在Mac上跑Qwen3.8-27B的,是这三类:有隐私需求、代码文档不能出本机的;想给Claude Code这类agent当免费后端、彻底摆脱token焦虑的;以及日常聊天、写作、翻译、读图这些中等强度任务的。
不太适合的:追求云端旗舰那种秒回速度的(本地4bit普遍20-60 tok/s,长任务要有耐心),以及主要做超长复杂推理的——社区共识是日常编程和agent任务它跟云端旗舰的差距已经很小,但真正复杂的长推理,云端还是更稳。知乎这个判断有数据支撑:官方基准里它的SWE-bench Pro拿61.7分,反超Claude Opus 4.6 Max的53.4,LiveCodeBench也略胜。小红书但在Terminal Bench、GPQA Diamond这类更考验深度推理的测试上还落后。知乎优势和短板都摆在明面上,按自己的任务类型对号就行。

硬件决策上给三个建议:手里是16GB机器的,先用小模型或免费API把生态玩明白,别为了27B冲动换机;准备新购机的,内存直接按32GB起步,想舒适跑27B就奔48-64GB去;已经拿着64GB以上机器的,恭喜你,这台机器现在是全家的算力中心,接上Claude Code就是零边际成本的agent工位。
继续观察的信号也有三个:MLX生态对新模型的day-0适配速度、Ollama和各引擎对MTP的支持进度、以及下一代Mac Studio的定价。本地模型第一次摸到了“能用”的门槛,而Mac大概率是这张门票里噪音最小、功耗最低的那一张——前提是,先把这三笔账算清再下载。