同样的128G Mac,有人跑出9 tok/s直呼不能用,有人跑出63 tok/s:Mac跑Qwen3.8-27B前先做对3个选择

源自12位全网作者

11:38

Qwen3.8-27B 开源才 4 天,「Mac 到底能不能跑」这个问题,圈子里已经吵成了两派。一边是小红书用户率先用 MacBook Pro M5 Max 128G 上手,BF16 全精度权重配 oMLX 引擎,输出速度只有 9 tok/s,结论两个字:无法使用。小红书另一边是 B 站 UP 主把同款 Qwen3.8-27B 装进 M4 Max 128G,短上下文解码 63.1 tok/s,4K-16K 稳定在 42 tok/s 上下,还顺路跑完了一整套修 bug 的编程流程。哔哩哔哩同一个模型,同样 128G 统一内存,速度差了 7 倍。先说结论:这不是硬件问题,而是量化档位、推理引擎、思考开关这三个选择没做对。选错了,顶配 Mac 也只能当打字机用。

同样的128G Mac,有人跑出9 tok/s直呼不能用,有人跑出63 tok/s:Mac跑Qwen3.8-27B前先做对3个选择

这次 Qwen3.8-27B 是什么,为什么 Mac 用户该关心

8 月 14 日阿里千问开源 Qwen3.8 系列,其中 27B 是「刚好适合个人设备」尺寸的稠密模型:270 亿参数,4bit 量化后权重只有 15GB 上下,Apache 2.0 协议可免费商用,还自带视觉理解和原生 262K 上下文。知乎热度也是现象级的:开源仅仅两天,下载量就突破 100 万次,直接登顶 HuggingFace 全球大模型趋势榜。知乎

跑分是它底气的一部分:最新评测数据显示,qwen3.8 27b 的综合性能和最新版 DeepSeek V4 Flash 相当。小红书社区进一步引用 Artificial Analysis 的数据称,Qwen3.8-27B 的得分居然和 DeepSeek V4 Flash 0731、GPT-5.6 Luna Max 持平。知乎一句话:这是目前最接近「旗舰级体验、消费级硬件可跑」的开源模型。而对没有 N 卡的 Mac 用户来说,自己的机器就是唯一入口。

同样的128G Mac,有人跑出9 tok/s直呼不能用,有人跑出63 tok/s:Mac跑Qwen3.8-27B前先做对3个选择

7 倍差距从哪来:三个选择

选择一:量化档位,BF16 是最大的坑。前面「哭晕在厕」的实测就卡在这里——BF16 全精度意味着约 54GB 的权重,Mac 每生成一个 token 都要把整套权重从统一内存里读一遍,内存带宽跟不上,速度自然上不去。换成 4bit,权重压缩到约 15GB,理论速度上限直接翻三倍还多。另一个极端是 2-bit,千万别碰:27B 压到 2-bit 后会出现循环、乱码、质量崩溃。小红书4bit 是 24GB 统一内存 Mac 的起步档,32GB 以上可以上 6-8bit,Q8 的质量损失已经可以忽略。

选择二:引擎加 MTP。Mac 路线目前大致四条:LM Studio(GGUF 和 MLX 版本都支持,门槛最低)、Ollama、llama.cpp、mlx-lm。M4 Max 跑出 63 tok/s 用的就是 MLX 后端加 MTP 投机解码。哔哩哔哩MTP 是 Qwen3.8 自带的投机解码头,引擎支持就打开,基本是白捡的提速。还有个容易忽略的细节:社区里有人提醒,NVFP4 是对 N 卡特殊优化的量化格式,Mac 上优先选 MLX 生态的量化版本更稳。小红书

同样的128G Mac,有人跑出9 tok/s直呼不能用,有人跑出63 tok/s:Mac跑Qwen3.8-27B前先做对3个选择

选择三:思考开关。Qwen3.8 默认把推理强度拉满,有实测是一道简单题空转 21 分钟、烧掉两万多 token。知乎在 Mac 上这种代价还会被放大:有人开启无限制思考模式让它画一只「鹈鹕骑自行车」,雷霆大思考 3 小时以上才出成果。哔哩哔哩日常问答和写作,把思考预算调低或直接关掉,深度思考留给真正的难题。

Mac 统一内存档位表

Mac 不看显存,看统一内存容量和内存带宽。综合各平台实测,大致是这张图:

  • 16GB:不推荐。4bit 权重就要约 15GB,加上系统和 KV cache,基本没有余量;

  • 24GB:入门底线,只能跑 4bit,社区版的官方建议也是 24GB 内存 Mac 起步。小红书

  • 32GB:4-6bit,舒适区起点;

  • 48GB:6-8bit,社区已经有人在这个档位把它当 agent 后端用;

  • 64GB 及以上:8bit 加更长上下文;

  • 128GB:直接上 8bit 或更低,把内存留给上下文,别想着「内存大就跑 BF16」,9 tok/s 的教训就在前面;

  • 极限玩家也有:Qwen3.8-Max 2.4T 被 Unsloth 量化到 397GB 后,410GB 内存的 Mac Studio 可以本地运行。哔哩哔哩但那是表演项目,不是日常项目。

速度还有个粗公式:Mac 的解码速度约等于内存带宽除以权重占用字节数。所以 M4 Max(546GB/s 带宽)跑 4bit 能到 40 tok/s 以上,M1 Max(400GB/s)跑 8bit 就只有约 8 tok/s 的输出。哔哩哔哩M1 到 M4 的基础款芯片带宽大概在 70-120GB/s,跑 4bit 也就是个位数到 10 tok/s 上下,轻度使用「能出字」,别指望「快」。

到底能干啥:把预期对齐一下

综合各方实测,画面大概是这样的:

  • 16K 上下文以内的问答、写作、总结、数据处理:放心用;

  • 编程助手:活能干但节奏偏慢,M4 Max 修一个 bug 全程 5 分 15 秒、发了 59 次请求,UP 主的原话结论是「写代码不太行」。哔哩哔哩

  • 长上下文:31K 就有断崖,同一份实测里 31K 直接从 42 tok/s 掉到 11.3。262K 上下文听听就好,在 Mac 上当应急选项;

  • 多模态图片理解:可用,llama.cpp 配 mmproj、MLX vision 两条路社区都已经跑通。

也有人把它当成付费订阅的替代品:有用户说本地部署后「能代替云端模型 80% 的活」,彻底治好了用量焦虑。小红书如果你的主力需求就是日常问答和文本处理,机器统一内存又够,这条路是真省钱的。

同样的128G Mac,有人跑出9 tok/s直呼不能用,有人跑出63 tok/s:Mac跑Qwen3.8-27B前先做对3个选择

也泼点冷水:这些人不用遭这个罪

  1. 只想要「又快又好用」的 AI:直接用千问 App 或 API 就行,不必折腾。本地真正的价值是隐私、免费、无网可用,而不是比云端快;

  2. 追求速度的,N 卡确实更快。B 站实测对比里,5090 能跑到约 157 Token/s,3090 也有约 53 Token/s,而 Mac 只有约 30 Token/s。哔哩哔哩Mac 受内存带宽限制,怎么优化都追不上;

  3. 还有一个值得留意的观点:稠密模型未必是 Mac 上的最优形态,有实测者直言在 M5 Max 128G 上跑下来,体验最好的还是一年多前的 OSS-GPT 120B。小红书理由是 MoE 大模型每次只激活一部分参数,天然适合「大内存、低带宽」的场景。这只是个人体验,但指向一个真实方向:Mac 用户不必把全部希望押在稠密 27B 上。

值得盯的信号

社区已经翻到了下一款的痕迹:Qwen3.8-35B-A3B 应该是有的,有人发现魔搭的一个 GitHub 提交中提到了它。小红书MoE 架构、只激活 3B 参数,如果真落地,恰恰是对 Mac 最友好的形态——速度翻几倍,质量不打骨折。不急着上车的 Mac 用户,可以等它一等。

最后一句话收尾:Qwen3.8-27B 确实是眼下 Mac 能跑的最强开源模型,但前提是你下的是 4bit MLX 量化版、开了 MTP、调低了思考强度。直接下 BF16 硬跑,然后骂模型不行——那真不怪模型,怪选择。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章