当前位置:
AIGC文章详情

同样是Qwen3.8-27B:M5 Max 128G喊“不可用”,M4 Max 48G跑出28 tok/s喊“真香”——Mac用户下载前先把这三笔账算清

源自142位全网作者

03:10

上周同一周里,两个Mac用户晒出了Qwen3.8-27B的实测结果,结论完全相反。

一位用的是MacBook Pro M5 Max 128GB,苹果笔记本的顶配。他跑的是BF16全精度版,引擎选oMLX,实测速度9 token/s,最长一次等了1800秒才输出一份超长课堂笔记,帖子的结论就四个字:无法使用。小红书

另一位用的是搭载M4 Max芯片的Mac Studio,统一内存大约只有前一位的三分之一。他跑的是MLX 4bit量化版,实测28 token/s,聊天、写文案、翻译、图片识别都顺,帖子标题直接喊出“Mac 真能跑 27B 大模型”。小红书内存少一半,速度反而快了三倍多。这不是玄学,是Mac跑本地大模型的规则跟N卡完全不一样。如果你也打算这周让自己的Mac加入Qwen3.8-27B的大军,先别急着下载——统一内存机器有三笔账必须先算清,算错了,轻则浪费50GB带宽,重则把顶配新机跑成打字机。

先说这个模型凭什么刷屏

8月14日,阿里正式开源Qwen3.8-27B:270亿参数的稠密模型,原生多模态,能看懂图片和视频,上下文原生262K,Apache 2.0协议,商用也免费。知乎

热度是实打实的:发布48小时冲上Hugging Face趋势榜第一,当天在Hacker News登顶,LM Studio上线38分钟下载破万,Ollama单渠道5天36万下载,编程工具Cline上线4天它就成了开发者选得最多的本地模型。知乎

第三方榜单也跟上了:Artificial Analysis的Intelligence Index给它52分,与GPT-5.6 Luna打平,比DeepSeek V4 Pro、GLM-5.2的53分只差1分。知乎Agentic Index 51分排第7,前面只剩Claude Opus 5、GLM-5.3、Grok 4.6。知乎社区因此给它起了个外号叫“模型斩杀线”——一个个人买得起、本地跑得动的开放权重模型,第一次摸到了前沿闭源模型的能力区间。

同样是Qwen3.8-27B:M5 Max 128G喊“不可用”,M4 Max 48G跑出28 tok/s喊“真香”——Mac用户下载前先把这三笔账算清

对Mac用户来说,这件事的意义很具体:这是第一个“一台Mac就能装下、且能力够用”的旗舰级开源模型。但“装得下”和“跑得爽”之间,隔着三笔账。

第一笔账:量化,决定的不只是体积,还有三倍的速度差

回到开头那个矛盾。M5 Max 128G为什么只有9 token/s?

Mac的统一内存没有独立显存的概念,模型权重整个吃内存,生成速度大致遵循一个粗暴的公式:生成速度约等于内存带宽除以模型权重体积。BF16版的27B权重大约54GB。知乎M5 Max的内存带宽按五百多GB/s算,540除以54,理论上限就是10 token/s上下——实测9,严丝合缝。内存装得下,不代表跑得动。

换成4bit量化,权重缩到16-17GB,同一台机器的理论上限直接翻三倍多。这就是为什么M4 Max 48G跑4bit能到28 token/s,而M5 Max跑BF16只有9。

同样是Qwen3.8-27B:M5 Max 128G喊“不可用”,M4 Max 48G跑出28 tok/s喊“真香”——Mac用户下载前先把这三笔账算清

社区的量化选择经验已经比较一致:内存够就上8bit,嫌慢就4bit。4bit快接近一倍,质量损失在日常聊天里感知不强,但长推理任务会偶尔露怯。知乎

至于262K上下文,得益于这代模型的混合注意力架构:64层里只有16层是全注意力,其余48层是线性注意力。KV缓存占用因此只有同尺寸传统模型的约四分之一。知乎48GB的Mac Studio跑4bit也敢开长上下文。

同样是Qwen3.8-27B:M5 Max 128G喊“不可用”,M4 Max 48G跑出28 tok/s喊“真香”——Mac用户下载前先把这三笔账算清

第二笔账:引擎,Mac上不是一个Ollama走天下

N卡用户基本Ollama/vLLM二选一,Mac这边选项多得多,而且各有脾气:

  • MLX:苹果自家的机器学习框架,Apple Silicon上的“亲儿子”,mlx-community的量化权重更新通常最快,适合愿意敲命令的用户。

  • Ollama:最省心。注意一个关键变化:Ollama从0.19版开始把Apple Silicon后端切到了MLX,Mac上跑本地AI从“能用”变成“真正吃到统一内存红利”。哔哩哔哩

  • LM Studio:图形界面,适合完全不想碰终端的人,但性能不一定是最优解——有实测显示,M2 MacBook上换用带SSD卸载机制的引擎后,速度从16 token/s提到47。哔哩哔哩

  • oMLX等优化引擎:主打KV缓存分级、冷数据卸载SSD,适合小内存跑大上下文,但新模型适配需要等,翻车概率也更高(开头那个翻车案例用的就是它加BF16的组合)。

另外有个细节对Mac用户特别实用:Ollama官方模型页的应用列表里,Claude Code就在第一行,两条命令就能把Claude Code的后端换成本地模型。知乎对代码不能出内网的人来说,这可能是目前最值得评估的方案——没有API费用,agent随便跑,token随便烧。

第三笔账:MTP和上下文,63 tok/s为什么变成11

Qwen3.8-27B内置了MTP(多token预测),可以理解为自己带了个打草稿的助手。这个开关开没开,速度差接近一倍:有B站博主在M4 Max 128G上用4bit量化加MTP实测,短上下文解码63.1 token/s,4K到16K稳定在42上下。哔哩哔哩代价是MTP会多吃内存、压缩可用上下文。所以看到谁报了一个很高的速度,先问一句:开没开MTP。

同一个测试里还有个反直觉的发现:上下文冲到31K,速度断崖式掉到11.3。哔哩哔哩也就是说长上下文不是不能开,是开了之后速度会换一档。拿它当agent后端时,决定流畅度的其实也不是生成速度,而是每一轮“读档”的预填充速度——上下文堆到几万字后,每轮开工前的等待会明显变长。内存带宽比纸面的tok/s数字更值钱。

各档Mac对号入座

把这几天知乎、小红书、B站、微博的实测拼在一起,大致是这么个分布:

统一内存

能跑什么

实测参考

16GB(M4 MacBook Air/Mac mini入门)

27B稠密版别硬上;可跑7-9B小模型或MoE模型(有16G Air跑通MiniMax h3的案例)

先体验生态,别急着升级

24-32GB(M4 Pro、老M1-M3 Pro/Max)

4bit版紧凑可用,上下文要省着开

有32G老Mac跑通Qwen3.8的分享

48GB(M4 Max)

4bit舒适,长上下文可开

实测28 tok/s

64-128GB(M4/M5 Max)

8bit可选,4bit+MTP最快,262K上下文无压力

M4 Max短上下文63 tok/s;M5 Max 4bit约25,开MTP可到50-60

同样是Qwen3.8-27B:M5 Max 128G喊“不可用”,M4 Max 48G跑出28 tok/s喊“真香”——Mac用户下载前先把这三笔账算清

注意一个Mac特有的坑:内存焊死不可升级。买之前没想清楚,买之后就只剩换机一条路。而且今年硬件整体在涨价,有实测用户吐槽“等Mac Studio新型号,512G的价格估计要值一台小BMW”。小红书

Mac用户必须知道的几个坑

这几条来自社区真实反馈,比跑分重要:

  1. 默认推理档位会疯狂过度思考。 有国外开发者让它画个骑自行车的鹈鹕SVG,它在“要不要加同心辅助圆”这种问题上琢磨了21分钟,烧掉两万多个推理token;关掉推理,两分多钟完事。知乎日常使用建议把reasoning_effort调到medium或low。

  2. token消耗比上一代高不少。 有并排实测:3.8在10个任务里赢9个,但平均token消耗接近3.6的三倍,有个任务想了7分多钟烧了三万多token。本地跑烧的是自家的电不心疼,但如果你打算走API按量计费,这笔账要算清楚,已经有人测完换回了3.6。

  3. 知识截止要留个心眼。 它自报训练数据到2026年,但一追问2024年之后的具体事就露馅。

  4. 别迷信1M上下文。 官方说用YaRN技术能外推到1M,但社区实测跑到的都是262K,1M目前还是发布会数字。

最后说清楚:谁值得跑,谁别折腾

值得在Mac上跑Qwen3.8-27B的,是这三类:有隐私需求、代码文档不能出本机的;想给Claude Code这类agent当免费后端、彻底摆脱token焦虑的;以及日常聊天、写作、翻译、读图这些中等强度任务的。

不太适合的:追求云端旗舰那种秒回速度的(本地4bit普遍20-60 tok/s,长任务要有耐心),以及主要做超长复杂推理的——社区共识是日常编程和agent任务它跟云端旗舰的差距已经很小,但真正复杂的长推理,云端还是更稳。知乎这个判断有数据支撑:官方基准里它的SWE-bench Pro拿61.7分,反超Claude Opus 4.6 Max的53.4,LiveCodeBench也略胜。小红书但在Terminal Bench、GPQA Diamond这类更考验深度推理的测试上还落后。知乎优势和短板都摆在明面上,按自己的任务类型对号就行。

同样是Qwen3.8-27B:M5 Max 128G喊“不可用”,M4 Max 48G跑出28 tok/s喊“真香”——Mac用户下载前先把这三笔账算清

硬件决策上给三个建议:手里是16GB机器的,先用小模型或免费API把生态玩明白,别为了27B冲动换机;准备新购机的,内存直接按32GB起步,想舒适跑27B就奔48-64GB去;已经拿着64GB以上机器的,恭喜你,这台机器现在是全家的算力中心,接上Claude Code就是零边际成本的agent工位。

继续观察的信号也有三个:MLX生态对新模型的day-0适配速度、Ollama和各引擎对MTP的支持进度、以及下一代Mac Studio的定价。本地模型第一次摸到了“能用”的门槛,而Mac大概率是这张门票里噪音最小、功耗最低的那一张——前提是,先把这三笔账算清再下载。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章