被叫作「本地 Opus 4.6」,两天下载破百万:Qwen3.8-27B 全网实测汇总,部署前先看完这份对照表

源自18位全网作者

17:17

这几天如果你关注本地大模型,一定被一个名字刷屏了:Qwen3.8-27B。

8 月 14 日晚上阿里开放权重,到今天第五天,它依然挂在 HuggingFace 全球趋势榜第一。知乎海外开发者跑完实测,给它起了个简单粗暴的外号——能在你笔记本上免费运行的 Opus 4.6 Max。微博两天下载量破百万,算上 unsloth 的量化版接近三百万次。知乎

热度是真的。但把知乎、小红书、B站、微博和海外这两天几十篇实测翻完,我想先泼一盆冷静的温水:模型确实强,但眼下部署体验高度依赖「你怎么跑」。有人一张 24GB 显存的卡跑到 40+ token/s 直呼真香,也有人 128GB 的 M5 Max 只跑出 9 token/s,直呼不能用。

差别就在几个设置、一个量化版本。这篇把全网实测收拢到一起,按硬件、按坑、按决策给你捋清楚。

先搞明白:为什么偏偏是 27B 火成这样

简单交代下背景。Qwen3.8-27B 是原生多模态稠密模型:270 亿参数,能看图、能读视频,原生 262K 上下文(YaRN 外推可到 1M),Apache 2.0 协议可自由商用。知乎Q4 量化后,文件大约 17GB。

17GB 就是它的甜点所在:24GB 显存的消费级显卡装得下,48GB 统一内存的 Mac 装得下,16GB 显存挤一挤也能上低量化。官方自己都说,27B 是「全球 AI 社区呼声最高的模型尺寸」。微博大到能干正事,小到一张消费级卡就能装下。

跑分确实猛:测真实修代码能力的 SWE-bench Pro 拿了 61.7,Claude Opus 4.6 Max 是 53.4。知乎OSWorld 电脑操作 84.3,领先 Opus 11 分以上;第三方 Artificial Analysis 的智能指数高达 52,超过 Claude。小红书

被叫作「本地 Opus 4.6」,两天下载破百万:Qwen3.8-27B 全网实测汇总,部署前先看完这份对照表

但跑分归跑分。多个信源交叉验证后,社区比较一致的结论是:写代码工程、浏览器和桌面操作这类 Agent 任务,它确实能打平甚至超过 Opus;可到了 GPQA、HLE 这类硬推理,仍然落后。知乎「本地 Opus」这话半真半假,理解成「在它擅长的赛道,你不用再为顶级闭源 API 付费」就好。

顺手辟个谣:这两天有帖子用 hfviewer 对比,说 3.8 和 3.6「0 changes,就是换皮」。后来有人较真去对了 GGUF 文件的 sha256——完全不一样。那个工具比的是 HF 页面配置文件(chat template 和 tokenizer),不是权重,3.8 是真新模型,别被带偏。知乎

全网实测一览:先找到你的机器

这是全文最值钱的部分。我把各平台实测按硬件档位归拢了一下,对号入座即可。

8GB 显存笔记本:B站有 UP 主实测,所有功能可用但速度极慢,最后的结论是「租了一台 4090,快 300 倍」。哔哩哔哩这个配置别硬上。

Mac Mini M4 32GB:跑 MLX 4bit 版,5~6 token/s。有博主让它写个计算器,默认设置下它思考了 51 分钟——东西做得挺精致,但这效率日常没法用。微博

MacBook M5 Pro 48GB:Ollama + MLX NVFP4 量化,64K 上下文时输出约 17 token/s;拉到 128K 掉到 13,峰值内存 42GB,占掉统一内存的 88%。实测者的建议很实在:48GB 机器日常守 64K,读超长文档再临时开 128K,跑之前关掉浏览器。小红书

被叫作「本地 Opus 4.6」,两天下载破百万:Qwen3.8-27B 全网实测汇总,部署前先看完这份对照表

24GB 显存(3090 / 4090 / 7900 XTX):这一档是本次实测的主力。知乎一位 7900 XTX 用户做了 8 信源交叉验证 + 本地实测:Q4_K_M 量化占 21.3GB 显存,初测 33 token/s,调参后稳定 43+。知乎另有客户端里还有人跑到约 62。知乎他的结论很有代表性:agentic coding 是真质变,已经把它从备选扶成主力模型。

32GB 显存(5090):最舒服的一档。量化后模型约 20GB,显存绰绰有余。小红书SGLang 官方 Day-0 实测,单张 5090 配 NVFP4 解码速度 206 token/s——这已经是接近云端 API 的体验。微博

128GB 统一内存(M4/M5 Max、DGX Spark):LM Studio 跑 Q4_K_M 大致 15~30 token/s;DGX Spark 上开启 MTP 多 token 预测能提速约 72%。知乎今天还有新消息称推测解码技术 DFlash2 在 M5 Max 上跑到 70 token/s(第三方博客数据,等独立复现)。微博但注意一个反面案例:有人用 oMLX 引擎硬跑 BF16 全精度,只有 9 token/s,直接判定不可用。小红书Mac 上别碰 BF16,用 MLX 量化版。

被叫作「本地 Opus 4.6」,两天下载破百万:Qwen3.8-27B 全网实测汇总,部署前先看完这份对照表

AMD 核显(Ryzen AI Max):官方给了 Day-0 支持,有实测输出 24.5 token/s。知乎核显到这个水平,作为「能不能用」的参考线够了。

一圈看下来,三个结论:

  1. 「能跑」和「能用」差距巨大。8GB 也能跑,但慢 300 倍。

  2. 量化决定下限,上下文吃内存。同一台 Mac,128K 和 64K 的内存占用差出近四成。

  3. 调优空间比想象大。7900 XTX 光调参数就从 33 提到 43+ token/s。

默认设置的三个坑:全网吐槽最一致的部分

坑一:默认推理强度 xhigh,模型戏太多。 Qwen3.8 默认开着最高推理强度。Django 联合创始人 Simon Willison 是最早一批实测者,他让模型画「鹈鹕骑自行车」的 SVG,模型思考了 21 分钟、烧掉 22276 个思考 token。知乎让它画个圆,它先规划了一整套「几何研究、动态光晕、包豪斯配色」的内心戏。

他的建议很直接:第一次用,先把 reasoning_effort 调到 low,或者干脆关掉推理。同一只鹈鹕,关掉推理后 2 分 17 秒出图。知乎但也别以为关掉就万事大吉:同一轮测试里,关掉推理后再做照片边界框识别,框的位置就出现了偏移——复杂任务上,推理的价值还是在的,关键是按需开关,而不是挂着 xhigh 跑所有东西。知乎

被叫作「本地 Opus 4.6」,两天下载破百万:Qwen3.8-27B 全网实测汇总,部署前先看完这份对照表

坑二:默认上下文太小,反而加剧过度思考。 LM Studio 默认上下文只有 8192,xhigh 的模型一思考就把它塞满,直接卡死。知乎Simon 的解法是直接拉满到 262144。而 Mac 端实测正好相反:上下文不是越大越好,48GB 机器建议守在 64K。小红书本质是同一件事——上下文是用内存换的,按你的显存定。

坑三:量化选错,白忙一场。 BF16 的反面案例上面说了。简单规则:24GB 显存选 Q4_K_M,目前社区验证最充分;32GB 可以上 Q5 或 NVFP4;Mac 用 MLX 的 NVFP4 / 4bit;16GB 及以下关注 IQ3 / Q3 小量化版,社区已经有 8.5GB 的 1bit 版本,但那个质量解决的是「有没有」,不是「好不好」。知乎

到底值不值得上?按配置给结论

24GB 显存以上:现在就值得换。成本是 17GB 硬盘空间和十几分钟配置时间。记住三件事:推理调 low、上下文按显存拉、量化用 Q4_K_M。拿它干 agentic coding 的话,多位实测者口径一致——「没有理由不换」。知乎

16GB 显存:IQ3 量化可以尝鲜,但更建议等社区出更成熟的小量化版。上一代 3.6 还能战,不急这一两周。知乎

8GB 或轻薄本:别硬上。实测 300 倍的差距不是调参能抹平的,租云卡或直接用 API 更划算。哔哩哔哩

Mac 用户:别碰 BF16,用 MLX 量化版;追速度的话盯紧 MTP 和 DFlash2 这两个方向,Mac 端的优化还在快速演进。

想为此装机的:冷静。多位实测者提到内存和硬件正在涨价。小红书别为一个模型去添一张新卡。参考一下价位:DGX Spark 首发价约合人民币 2.9 万元。知乎先用现有设备验证自己是不是真有高频需求,再谈升级。模型几周一个新版本,硬件买了就是买了。

最后补一句背景:这次 Qwen3.8 还开源了 2.4T-A95B 的 MoE 旗舰(自定义许可,个人免费、大规模商用需另行授权),但那不是普通电脑的菜。知乎真正砸到消费级硬件上的,就是这颗 27B。

知乎上有个说法我挺认同:Qwen3.8-27B 的意义,是第一次把前沿级 coding agent 的门槛,降到普通后端工程师伸手就能够到的地方。知乎

17GB 的文件,下载下来就永久免费。值不值得,对照一下上面的表,答案就有了。

内容由AI生成

精选参考来源

1. Qwen3.8-27B爆火全球:本地大模型的“甜点位”到了

2. 阿里刚刚开源了Qwen3.8-27B模型,在海外开发者那口碑不错。看到一句被大家反复提及的、简单但很有传播力的宣传:Qwen3.8-27B是能在你笔记本上免费运行的Opus4.6Max。看到了很多有意思的梗图,顺带分享下,不出意外每次国内发新模型,达里奥就会被大家拖出来把玩一次。想起很久前看到千问定...全文

3. 本地Opus你要不要!Qwen3.8-27B开源

4. 开源!Qwen3.8-27B如约而至今天,我们正式开源Qwen3.8系列模型,所有开发者、科研机构和企业均可自由下载、部署和使用Qwen3.8模型。27B(270亿参数)是全球AI社区呼声最高的模型尺寸,就在刚刚,Qwen3.8-27B 也已开源上线!🎯部署方便,流畅实用Qwen3.8-27B是原生多模态稠密(Dense)模型,部署便捷,量化后在“消费级”显卡上即可流畅运行,快且实用,图文视频全理解。模型支持262K 原生上下文,YaRN技术可轻松扩展至 1M tokens。🎯性能进阶,表现卓越较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了Qwen3.7-Plus。Qwen3.8-27B也拥有Qwen3.8系列模型的共性,可以端到端完成复杂任务,直接交付经得起检验的可靠成果。现在,我们以宽松的 Apache 2.0 协议开放模型权重,所有人都可免费下载、部署及商用。此前,旗舰模型Qwen3.8-Max也已开源模型权重。截至目前,我们已累计开源 460余个模型,Qwen的全球下载总量超 30 亿次,衍生模型数超30万个,成为全球AI社区最受欢迎的开源模型家族。未来,Qwen将继续与AI开源社区同行,我们也期待全球开发者朋友能基于Qwen做出更多更好的新模型、新应用、新创造~😊#千问大模型##Qwen##AI#

5. 源神归来!Qwen3.8-27B杀疯了,Artificial Analysis放榜智能指数高达52,超过Claude

6. 一张 RX 7900 XTX 跑 Qwen3.8-27B:8 个独立信源 + 本地实测后,我把它换成了管理机主力模型

7. [中配]实测Qwen3.827B在8GB笔记本上的真实表现:所有功能可用但速度慢,租用4090后快300倍

8. #Easy同学正在独立开发#在MacMiniM432G上测试了下Qwen3.827b,MLX4bit版本。能跑到5~6tokens/s,让写一个计算器,思考了51分钟不过效果很惊艳,光影和声音这些细节做得非常好,唯一的小问题是,不能计算(点加号以后无法输出结果)顺手放网上了,感兴趣的...全文

9. Macbook M5 Pro 48G 测试 Qwen 3.8 27B

10. Qwen3.8-27B本地部署实测:很好但别用默认设置,社区优化后潜力很大,可稍晚入手!

11. 成了!Qwen 3.8本地部署,速度起飞

12. 小模型之王回归!来自@Alibaba_Qwen的Qwen3.8-27B开源了,SGLang中Day-0支持已上线:-在单个RTX5090上,结合我们的NVFP4和DSpark,解码速度达206.1tok/s-在DGXSpark上,解码速度达38.28tok/sQwen3.8-27B再次提高了小模型在代理规划和长时程任务上的能力上限。(小模型)...全文

13. Qwen 3.8 27B:17GB 的开源模型,已经能跟顶级闭源模型掰手腕了

14. 推测解码技术DFlash的新版来了:DFlash2详细介绍:inco.ai/blog/dflash2/作者ZhijianLiu介绍,可以在M5MaxMacBookPro上以70tok/s的速度运行Qwen3.8-27B~

15. 哭晕在厕!Qwen3.8-27B已测

16. Qwen3.827B:在集成显卡上跑到24.5Tokens/s输出

17. 怎么看阿里Qwen3.8-2.4T-A95B正式开源,有什么特别,为什么不是Apache2.0协议?

18. 怎么看Qwen3.8-27B把前沿codingagent搬进消费级硬件?对后端转AI有什么意义?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章