这几天如果你关注本地大模型,一定被一个名字刷屏了:Qwen3.8-27B。
8 月 14 日晚上阿里开放权重,到今天第五天,它依然挂在 HuggingFace 全球趋势榜第一。知乎海外开发者跑完实测,给它起了个简单粗暴的外号——能在你笔记本上免费运行的 Opus 4.6 Max。微博两天下载量破百万,算上 unsloth 的量化版接近三百万次。知乎
热度是真的。但把知乎、小红书、B站、微博和海外这两天几十篇实测翻完,我想先泼一盆冷静的温水:模型确实强,但眼下部署体验高度依赖「你怎么跑」。有人一张 24GB 显存的卡跑到 40+ token/s 直呼真香,也有人 128GB 的 M5 Max 只跑出 9 token/s,直呼不能用。
差别就在几个设置、一个量化版本。这篇把全网实测收拢到一起,按硬件、按坑、按决策给你捋清楚。
先搞明白:为什么偏偏是 27B 火成这样
简单交代下背景。Qwen3.8-27B 是原生多模态稠密模型:270 亿参数,能看图、能读视频,原生 262K 上下文(YaRN 外推可到 1M),Apache 2.0 协议可自由商用。知乎Q4 量化后,文件大约 17GB。
17GB 就是它的甜点所在:24GB 显存的消费级显卡装得下,48GB 统一内存的 Mac 装得下,16GB 显存挤一挤也能上低量化。官方自己都说,27B 是「全球 AI 社区呼声最高的模型尺寸」。微博大到能干正事,小到一张消费级卡就能装下。
跑分确实猛:测真实修代码能力的 SWE-bench Pro 拿了 61.7,Claude Opus 4.6 Max 是 53.4。知乎OSWorld 电脑操作 84.3,领先 Opus 11 分以上;第三方 Artificial Analysis 的智能指数高达 52,超过 Claude。小红书

但跑分归跑分。多个信源交叉验证后,社区比较一致的结论是:写代码工程、浏览器和桌面操作这类 Agent 任务,它确实能打平甚至超过 Opus;可到了 GPQA、HLE 这类硬推理,仍然落后。知乎「本地 Opus」这话半真半假,理解成「在它擅长的赛道,你不用再为顶级闭源 API 付费」就好。
顺手辟个谣:这两天有帖子用 hfviewer 对比,说 3.8 和 3.6「0 changes,就是换皮」。后来有人较真去对了 GGUF 文件的 sha256——完全不一样。那个工具比的是 HF 页面配置文件(chat template 和 tokenizer),不是权重,3.8 是真新模型,别被带偏。知乎
全网实测一览:先找到你的机器
这是全文最值钱的部分。我把各平台实测按硬件档位归拢了一下,对号入座即可。
8GB 显存笔记本:B站有 UP 主实测,所有功能可用但速度极慢,最后的结论是「租了一台 4090,快 300 倍」。哔哩哔哩这个配置别硬上。
Mac Mini M4 32GB:跑 MLX 4bit 版,5~6 token/s。有博主让它写个计算器,默认设置下它思考了 51 分钟——东西做得挺精致,但这效率日常没法用。微博
MacBook M5 Pro 48GB:Ollama + MLX NVFP4 量化,64K 上下文时输出约 17 token/s;拉到 128K 掉到 13,峰值内存 42GB,占掉统一内存的 88%。实测者的建议很实在:48GB 机器日常守 64K,读超长文档再临时开 128K,跑之前关掉浏览器。小红书

24GB 显存(3090 / 4090 / 7900 XTX):这一档是本次实测的主力。知乎一位 7900 XTX 用户做了 8 信源交叉验证 + 本地实测:Q4_K_M 量化占 21.3GB 显存,初测 33 token/s,调参后稳定 43+。知乎另有客户端里还有人跑到约 62。知乎他的结论很有代表性:agentic coding 是真质变,已经把它从备选扶成主力模型。
32GB 显存(5090):最舒服的一档。量化后模型约 20GB,显存绰绰有余。小红书SGLang 官方 Day-0 实测,单张 5090 配 NVFP4 解码速度 206 token/s——这已经是接近云端 API 的体验。微博
128GB 统一内存(M4/M5 Max、DGX Spark):LM Studio 跑 Q4_K_M 大致 15~30 token/s;DGX Spark 上开启 MTP 多 token 预测能提速约 72%。知乎今天还有新消息称推测解码技术 DFlash2 在 M5 Max 上跑到 70 token/s(第三方博客数据,等独立复现)。微博但注意一个反面案例:有人用 oMLX 引擎硬跑 BF16 全精度,只有 9 token/s,直接判定不可用。小红书Mac 上别碰 BF16,用 MLX 量化版。

AMD 核显(Ryzen AI Max):官方给了 Day-0 支持,有实测输出 24.5 token/s。知乎核显到这个水平,作为「能不能用」的参考线够了。
一圈看下来,三个结论:
「能跑」和「能用」差距巨大。8GB 也能跑,但慢 300 倍。
量化决定下限,上下文吃内存。同一台 Mac,128K 和 64K 的内存占用差出近四成。
调优空间比想象大。7900 XTX 光调参数就从 33 提到 43+ token/s。
默认设置的三个坑:全网吐槽最一致的部分
坑一:默认推理强度 xhigh,模型戏太多。 Qwen3.8 默认开着最高推理强度。Django 联合创始人 Simon Willison 是最早一批实测者,他让模型画「鹈鹕骑自行车」的 SVG,模型思考了 21 分钟、烧掉 22276 个思考 token。知乎让它画个圆,它先规划了一整套「几何研究、动态光晕、包豪斯配色」的内心戏。
他的建议很直接:第一次用,先把 reasoning_effort 调到 low,或者干脆关掉推理。同一只鹈鹕,关掉推理后 2 分 17 秒出图。知乎但也别以为关掉就万事大吉:同一轮测试里,关掉推理后再做照片边界框识别,框的位置就出现了偏移——复杂任务上,推理的价值还是在的,关键是按需开关,而不是挂着 xhigh 跑所有东西。知乎

坑二:默认上下文太小,反而加剧过度思考。 LM Studio 默认上下文只有 8192,xhigh 的模型一思考就把它塞满,直接卡死。知乎Simon 的解法是直接拉满到 262144。而 Mac 端实测正好相反:上下文不是越大越好,48GB 机器建议守在 64K。小红书本质是同一件事——上下文是用内存换的,按你的显存定。
坑三:量化选错,白忙一场。 BF16 的反面案例上面说了。简单规则:24GB 显存选 Q4_K_M,目前社区验证最充分;32GB 可以上 Q5 或 NVFP4;Mac 用 MLX 的 NVFP4 / 4bit;16GB 及以下关注 IQ3 / Q3 小量化版,社区已经有 8.5GB 的 1bit 版本,但那个质量解决的是「有没有」,不是「好不好」。知乎
到底值不值得上?按配置给结论
24GB 显存以上:现在就值得换。成本是 17GB 硬盘空间和十几分钟配置时间。记住三件事:推理调 low、上下文按显存拉、量化用 Q4_K_M。拿它干 agentic coding 的话,多位实测者口径一致——「没有理由不换」。知乎
16GB 显存:IQ3 量化可以尝鲜,但更建议等社区出更成熟的小量化版。上一代 3.6 还能战,不急这一两周。知乎
8GB 或轻薄本:别硬上。实测 300 倍的差距不是调参能抹平的,租云卡或直接用 API 更划算。哔哩哔哩
Mac 用户:别碰 BF16,用 MLX 量化版;追速度的话盯紧 MTP 和 DFlash2 这两个方向,Mac 端的优化还在快速演进。
想为此装机的:冷静。多位实测者提到内存和硬件正在涨价。小红书别为一个模型去添一张新卡。参考一下价位:DGX Spark 首发价约合人民币 2.9 万元。知乎先用现有设备验证自己是不是真有高频需求,再谈升级。模型几周一个新版本,硬件买了就是买了。
最后补一句背景:这次 Qwen3.8 还开源了 2.4T-A95B 的 MoE 旗舰(自定义许可,个人免费、大规模商用需另行授权),但那不是普通电脑的菜。知乎真正砸到消费级硬件上的,就是这颗 27B。
知乎上有个说法我挺认同:Qwen3.8-27B 的意义,是第一次把前沿级 coding agent 的门槛,降到普通后端工程师伸手就能够到的地方。知乎
17GB 的文件,下载下来就永久免费。值不值得,对照一下上面的表,答案就有了。