不是只有 N 卡能跑 Qwen3.8-27B:Mac、AMD、核显实测全整理

源自12位全网作者

10:28

这几天本地部署圈基本被 Qwen3.8-27B 刷屏了。但我刷了一圈发现,晒速度、出教程的大多是 N 卡用户:5090 跑到 150 tokens/s,3090 也有 40 往上。评论区里另一拨人一直在追问:“我只有 Mac 能不能跑”“AMD 卡行不行”“不买 N 卡是不是就没戏了”。

我把这几天 B站、知乎、小红书上能找到的非 N 卡实测都翻了一遍,今天把账算清楚:Qwen3.8-27B 不是 N 卡专属,但每条路线的速度、价格和坑,差别比想象中大。

先说清楚:这个模型为什么值得本地跑

给还没跟上的朋友补两句背景。Qwen3.8-27B 是阿里 8 月中旬开源的 270 亿参数稠密模型,原生多模态,262K 上下文,Apache 2.0 协议可商用。小红书它用了混合注意力架构(48 层线性注意力 + 16 层全注意力),KV Cache 开销大降,这是单卡能跑长上下文的关键。

不是只有 N 卡能跑 Qwen3.8-27B:Mac、AMD、核显实测全整理

但先把丑话说在前面:官方跑分和第三方复现有出入。官方自报 SWE-bench Pro 61.7、OSWorld 84.3,社区交叉验证后的主流口径比较克制——在它擅长的 agentic coding、浏览器操作这些场景确实能碰一碰顶级闭源模型,但 GPQA、HLE 这类硬推理还是落后。知乎知乎有位做了 8 信源交叉实测的老哥说得直接:“接近 Opus 那句话,别信。”

所以合理的期待是:本地跑一个写代码、跑 agent、做日常助手都够用的模型,而不是免费获得一个顶级闭源。

Mac 阵营:速度最慢,但最省心

先给结论:Mac 能跑,而且门槛最低,但决定体验的不是芯片名号,是内存带宽。

小红书上有位博主连夜更新了"Mac 大模型 8 月甜点表",结合 B站几期实机测试,数据大致是这样:

  • M3 Ultra(819GB/s 带宽):Q4 量化 30+ tokens/s,FP8 约 20,桌面端目前最能打的 Mac;

  • M4 Max(546GB/s):次一档,急用的话现在买搭载它的 Mac Studio 更划算,因为 M5 Studio 预计 10 月才上;

  • M5 Pro 48GB(307GB/s):跑 Q6 量化很舒服,是这代的甜点配置,别盲目上 Max,除非你要跑 70B 以上或者多模型并行;

  • 16GB 内存:Ollama 下 4bit 版本只占 12.6GB,能装进去、能跑,但带宽就一百多 GB/s,速度别指望,当"能用"就好;

  • 8GB:macOS 自己要吃掉 3GB 上下,留给模型的实在不够,真别折腾。小红书

两个避坑提醒:一是别买 M3 Pro,这一代带宽倒退,跑大模型反而比 M2 Pro 慢;二是 Mac 跑 Qwen3.8-27B 推荐 Ollama 或 MLX,48GB 机器上已经有人用 MLX 把 4bit 模型 + RAG 服务整套跑起来了,模型文件约 27GB,磁盘先留够空间。小红书知乎

知乎上有个高赞观点我觉得很到位:如果你没时间大战 CUDA、PowerShell 和各种环境变量,把折腾的时间成本算进去,MacBook 反而是最经济的方案。知乎装个 Ollama 就能用,这个省心程度是 N 卡路线给不了的。

当然也得泼盆冷水:本地不等于免费。有博主按每天 24 小时运行算过,一台 100W 功耗的机器一个月就是 72 度电。知乎调用量不大的话,本地 + 云端混合用才是更理性的姿势——重复、隐私敏感的活走本地,复杂任务回退云端。

不是只有 N 卡能跑 Qwen3.8-27B:Mac、AMD、核显实测全整理

AMD 阵营:速度能打,但必须绕开 ROCm 这个坑

这是本次盘点里最被低估的路线。AMD 这次对 Qwen3.8-27B 是 Day-0 官方支持,模型发布当天就能跑。知乎

先看数据:

  • Radeon AI PRO R9700 32GB:官方实测最高 51.8 tokens/s(llama.cpp + Vulkan 后端,MTP=2);

  • RX 7900 XTX 24G:Q4_K_M 量化占 21.3G 显存,有老哥初测 33 tokens/s,调参后稳定 43+;B站另有保姆级教程用 262K 上下文 + KV Cache 量化 + MTP 压榨到 53 TPS;

  • 锐龙 AI Max+ 395(128GB 统一内存的核显方案):官方数据 24.5 tokens/s(MTP=4),社区实测 q5_k_m 量化能到 28,但注意——上下文一过千就掉到十几,而且这模型思考量巨大,有人吐槽"放那想了几万 token 还在 wait"。

重点说坑。AMD 路线最大的雷是 ROCm:有实测过 20 多组参数的用户反馈,ROCm 6.x 对 RDNA3 的支持很不稳定,加载的模型频繁停摆、输出无限循环,最后换回 Vulkan 后端才一切正常。知乎7900 XTX 那位老哥也明确说自己走的是 Vulkan,“不是 ROCm,因为 ROCm 6.x 对 RDNA3 支持拉垮”。

所以 AMD 路线记住三句话:用 Vulkan 不用 ROCm;LM Studio 里记得取消勾选"Try mmap"、开启 MTP(AI Max 395 设 4,R9700 设 2);显卡至少 24GB 显存起步,这是 27B Q4 量化的入场券。知乎

不是只有 N 卡能跑 Qwen3.8-27B:Mac、AMD、核显实测全整理

价格上这条路线是真香:7900 XTX 比 4090 便宜一大截,显存还同为 24G,速度大概慢个一两成,性价比很突出。

其他路线:能跑,但各有各的定位

顺手把几条小众路线也交代了:

  • 老计算卡(比如双 V100 32G):18~30 tokens/s,Q8 量化能开满 256K 上下文,但 prefill 会随着上下文变长一路掉速。适合垃圾佬折腾,不适合当主力;

  • 无独显办公机:核显 + CPU 混合推理确实"能跑",但"能跑"和"能用"是两回事,几毛钱一个 token 的 API 真的更划算。

跨源速度对照表

把全网实测拼在一起看(均为社区/媒体实测,非官方口径):

硬件

量化

实测速度

备注

RTX 5090

Q4

60~157 t/s

N 卡参照系,最近一周涨价凶猛

RTX 3090

Q4

40~53 t/s

N 卡参照系

AMD R9700 32G

官方口径

51.8 t/s

Vulkan + MTP=2

RX 7900 XTX 24G

Q4_K_M

33~53 t/s

Vulkan,调参后

锐龙 AI Max+ 395

Q5_K_M

24.5~28 t/s

128GB 统一内存

Mac M3 Ultra

Q4

30+ t/s

819GB/s 带宽

Mac M5 Pro 48G

Q6

流畅

本代甜点

双 V100 32G

Q8

18~30 t/s

垃圾佬玩具

三个公共坑:不管你用什么硬件都躲不开

最后这三个坑跟显卡无关,是 Qwen3.8-27B 模型本身带来的,Mac 和 AMD 用户一样会撞上:

  1. 雷霆思考。这模型默认思考链极长,动辄几万 token,等待时间感人。彻底关思考会降智(有实测正确率掉到 85% 左右),社区目前的最优解是打 V22 聊天模板 + 开中度思考:正确率不掉,耗时缩短 47%,上下文占用最多省 86%。哔哩哔哩

  2. 别沿用 3.6 的老设置。之前针对 Qwen3.6-27B 的社区提示词优化在 3.8 上是负作用,会导致思考解析异常、工具调用出错甚至死循环,升级后记得清理。哔哩哔哩

  3. 框架版本要看清。有人实测 vLLM 0.27.1 对 3.8 是负优化,llama.cpp 目前相对稳定。

不是只有 N 卡能跑 Qwen3.8-27B:Mac、AMD、核显实测全整理

到底谁该动手

按人群给个简单判断:

  • 手持 48GB 以上 Mac:直接上,Ollama/MLX 装好就能干活,慢一点但零折腾,写代码、跑 agent、接 RAG 都够;

  • 有 24G 显存的 A 卡(7900 XTX 这一档):目前最被低估的路线,Vulkan + MTP 调好,体验只比 3090 慢一点点,价格优势明显;

  • 在观望 AI Max 395 迷你主机:128GB 内存池的想象力在于能塞下更大模型,但跑 27B 追求长上下文速度的话,它不是最优选;

  • 无独显、预算紧:先用云端 API 把需求验证清楚,别为了跑模型去买自己用不上的硬件;

  • 非要买新卡:那就是另一个话题了——N 卡最近的价格,各位应该都听说了。

接下来值得盯的信号:10 月的 M5 Studio、社区还在冒出来的新量化版本(已经有 13GB 级别的 27B 变体了)、以及官方对雷霆思考的修复。这条赛道一周一个样,先跑起来的人,坑也先踩完。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章