Qwen3.8-27B在你显卡上能跑多快?扒了十几个社区实测,整理出这份速度配速表

源自17位全网作者

07:43

8月14日晚,阿里开源了Qwen3.8-27B:270亿参数、Apache 2.0协议免费商用、262K上下文。小红书 开源第4天,本地部署圈现在基本就在吵两件事:它到底有多强,以及——我的机器跑它到底能有多快。

第一个问题已经大致有答案了。知乎上已经有人替大家盘过官方跑分:不仅超过 Qwen3.6-27B,也超过了闭源的 Qwen3.7-Plus。知乎 其中SWE-bench Pro拿到61.7,超过Claude Opus 4.6 Max的53.4,但注意这是官方自报成绩,不代表第三方复现。哔哩哔哩 社区实测普遍承认“27B这个体量目前最能打”,虽然也有《三宗罪》这种泼冷水的万字吐槽,但吵归吵,没人否认它的能力上限。

Qwen3.8-27B在你显卡上能跑多快?扒了十几个社区实测,整理出这份速度配速表

第二个问题更要紧,也更混乱。同样一张RTX 5090,有实测用Unsloth GGUF加MTP,跑到约157 tok/s,3090约53 tok/s。哔哩哔哩 另一份FP8的实测则是稳定60 tok/s,峰值能冲100+。哔哩哔哩 差距2.5倍,信哪个,直接决定你今晚下不下载这20多个GB的模型文件。

我把这4天B站、知乎、小红书、微博上十几个独立实测扒了一遍,交叉核对后整理成下面的内容。下载模型之前,先对号入座。

一、全网实测速度汇总:先看你的卡在哪一档

硬件

版本/框架

实测输出速度

来源

RTX 5090 32G

Unsloth GGUF + MTP

约157 tok/s

B站·鲲鹏Talk

RTX 5090 32G

NVFP4 + SGLang + MTP

约150 tok/s

小红书·超级e

RTX 5090 32G

FP8

稳定60,峰值100+

B站·鲲鹏Talk

RTX 3090 24G

Unsloth GGUF + MTP

约53 tok/s

B站·鲲鹏Talk

RTX 3090 24G

FP8

40~47 tok/s

B站·鲲鹏Talk

RX 7900 XTX 24G

llama.cpp + KV Q4 + MTP

53 TPS

B站·玩客笔记

4×RTX 5060 Ti 16G

P2P直连

解码90~100 tok/s

B站·困梦的杂物间

2080 Ti 22G魔改

IQ4_NL + MTP

39.5 tok/s

B站·硅基包工头

Mac M3 Ultra 512G

Q4 / FP8

30+ / 约20 tok/s

B站·鲲鹏Talk

Mac mini(M4 Pro)

oMLX Q4

约15 tok/s

小红书·和光同尘

Mac mini M4 32G

MLX 4bit

5~6 tok/s

微博·Easy

8GB显存笔记本

低比特量化

能跑,但很慢

B站·声译看世界

几个值得注意的点:

24GB显存是“跑得舒服”的分水岭。 3090、7900 XTX这一档24G卡,Q4量化下都能稳在40~53 tok/s,日常对话、写代码完全够用。有实测还专门检查了它的前端代码生成能力,结果相当惊艳:在提示词设计比较到位的情况下,它能够生成视觉效果非常丰富、交互非常炫酷的前端页面。哔哩哔哩 不过评论区一位4090D用户的反馈很典型:前端生成能力比Qwen3.6-27B强不少,但代码一次通过率反而降了,得返工。哔哩哔哩 能力有提升,但不是无脑提升。

Mac的“统一内存”解决的是装不装得下,不是跑得快不快。 M3 Ultra 512G能轻松装下各种大版本,但Q4也就30 tok/s出头。哔哩哔哩 同样是Mac mini,芯片不同差距也很明显:有用户用M4 Pro芯片跑oMLX Q4约15 tok/s,峰值内存占用17GB上下,而Q4量化本身大约17GB,刚好卡在舒适区。小红书 基础款M4 32G用MLX跑4bit则只有5~6 tok/s,有用户让它写个计算器,思考了51分钟。微博 同样是“能跑”,带宽差一档,速度就差一档——在苹果上,内存带宽约等于推理速度。

Qwen3.8-27B在你显卡上能跑多快?扒了十几个社区实测,整理出这份速度配速表

老卡不是不能跑,是“能跑”和“好用”之间隔着一道坎。 2080 Ti 22G魔改卡能跑到39.5 tok/s(IQ4_NL+MTP),这在老卡里已经是极限操作。哔哩哔哩 8GB显存的笔记本所有功能可用,但速度只有0.26 tok/s,租一张4090能到86.67 tok/s,差距约300倍。哔哩哔哩 低配的意义是体验和尝鲜,不是生产力。

二、同一张卡为什么差出2.5倍?看速度之前先看三件事

157和60不是谁在造假,是条件根本不一样。所有实测数据,先看这三个变量:

1. 量化格式。 Q4_K_M(约17GB)是社区主流,速度和质量的平衡点;FP8(约27GB)在部分框架下反而更慢;Q6/Q8精度更高但更吃显存,有用户32G显存跑Q6只有25 tok/s。别默认“精度越高越好”,也别默认“位数越低越快”。知乎一篇实测给的选择标准很朴素:16GB显卡先试UD-Q3_K_XL;24GB从Q4开始;显存足够再看Q6、Q8或BF16。知乎

2. 推理框架。 llama.cpp是目前个人部署的主力,vLLM/SGLang适合有并发需求的场景。一个坑要注意:有实测发现vLLM 0.27.1对Qwen3.8是负优化,建议先停留在0.26.0。哔哩哔哩

3. 有没有开MTP(多Token预测)。 这是这代模型最大的速度变量。Qwen3.8-27B原生支持MTP,llama.cpp里加`–spec-type draft-mtp`就能启用。一位网友的血泪反馈:不开MTP时输出40多tok/s,一个任务等了二十分钟;开了MTP=2之后输出60~80 tok/s,体感完全是两个模型。哔哩哔哩 所以看任何“XX显卡跑Qwen3.8”的实测,先问一句:什么量化、什么框架、开没开MTP。三个都不说只报数字的,参考意义有限。

三、装进去不是终点:别忘了给KV Cache算账

这是很多教程不会告诉你的部分。Qwen3.8-27B的BF16完整权重合计约55.56GB,也就是51.75GiB。知乎 量化后从10GiB到52GiB不等:

  • UD-Q2_K_XL:应急用,能力打折明显

  • IQ4_XS:约14.63GiB,16GB卡“刚好能塞进去”,但留给运行时的空间太少

  • Q4_K_M:约17GB,24GB卡的主流选择

  • Q6/Q8/BF16:32GB以上再考虑

Qwen3.8-27B在你显卡上能跑多快?扒了十几个社区实测,整理出这份速度配速表

关键点在于:权重文件能塞进显存,只代表能启动,不代表能舒服地用。 Qwen3.8-27B支持262K原生上下文(YaRN可扩到1M),按FP16算每个token的KV cache约占64KiB——开满262K上下文,KV cache就要吃掉约16GiB显存。知乎 这就是为什么24G卡跑Q4_K_M时显存占用会顶到99%:不是模型文件大,是上下文在吃显存。哔哩哔哩 应对办法社区已经跑通了:KV cache本身也可以量化(llama.cpp的`-ctk q4_0 -ctv q4_0`),再把上下文从8K/16K起步慢慢加,别一上来就拉满262K。日常写作、写代码,32K以内足够。

四、三个免费的提速手段,比换卡见效快

这代模型社区吐槽最狠的其实不是显存,是“雷霆思考”——默认xhigh推理强度下,画个圆它都能先思考几千token。有用户让它画一张鹈鹕骑自行车的SVG,这一张图足足跑了21分钟:光推理就用了22,276个token。知乎 另一位用户32G显存算个线段距离,等了30分钟、烧掉50K上下文才完成。哔哩哔哩 好消息是,这几个问题都有免费解法:

1. 降思考强度。 新版llama.cpp已支持`–reasoning-effort`参数。哔哩哔哩 社区的通用方案是换用修复版chat template(如V22模板)+中度思考,实测正确率100%不变、耗时缩短47%、上下文占用最高节省86%。哔哩哔哩 直接关掉思考不推荐——有实测正确率会掉到85%左右。

2. 开MTP。 前面说过,对这代模型几乎是必选项。

3. KV cache量化。 配合上一条,能把长对话轮数从6~7轮拉回10轮以上。

另外两个容易踩的坑:上一代Qwen3.6的提示词优化在3.8上会起负作用,导致思考解析异常、工具调用错误、死循环,迁移过来记得清理。哔哩哔哩 第一次用官方默认设置觉得“慢到没法用”的,先把推理强度调到medium或low再下结论。

五、那到底要不要升级显卡?

这周B站已经有实测视频直接以“这次显卡又要涨价了…”为题。哔哩哔哩 结合这个背景,我的判断分四档:

  • 手持24GB卡(3090/7900XTX等): 不用动。这就是Qwen3.8-27B的甜区,Q4_K_M+MTP+KV量化,40~53 tok/s的体验在本地模型里已经是第一梯队。

  • 手持16GB卡: 能玩,但要管理预期。UD-Q3_K_XL起步,上下文收着点用;它更适合当“体验版”,不适合当主力Agent。

  • 手持8~12GB卡或Mac mini: 本地跑27B的性价比很低,要么低比特尝鲜,要么把预算花在云端API上更实在。

  • 正在纠结要不要加价上5090: 除非你有明确的多模型并发、微调需求,否则为单个27B模型花这个钱不值——53 tok/s和157 tok/s在日常使用里的体感差距,远没有价格差距大。

Qwen3.8-27B在你显卡上能跑多快?扒了十几个社区实测,整理出这份速度配速表

接下来值得持续盯的信号:社区修复模板还在快速迭代(这周已经出了好几版);vLLM等新版本对3.8的适配优化;以及Qwen后续会不会放出更适合本地的MoE版本——评论区已经有人在喊“等35B”了。哔哩哔哩 本地部署的魅力就在于此:模型是免费的,优化是社区共享的,你手里那张卡的每一分性能,都能被榨出来。

内容由AI生成

精选参考来源

1. 阿里开源Qwen3.8-27B

2. Qwen3.8-27B本地部署实测:很好但别用默认设置,社区优化后潜力很大,可稍晚入手!

3. Qwen3.8-27B正式开源:官方跑分、架构与本地部署成本

4. Qwen3.8-27B本地实测:5090跑到157 Token/s!3090也有53 Token/s,Mac约30 Token/s,170HX达43 Token

5. Qwen3.8-27B真是“本地部署王者”?实测来了!Mac M3 Ultra 512G仅30+Tokens/s,FP8约20,5090稳定60+最高100+,

6. Qwen3.8-27B-NVFP 本地部署

7. 泼冷水!Qwen3.8 27B三宗罪:很强!很难伺候!很难用!

8. Qwen3.8-27B 开源了!Mac mini 直接跑

9. #Easy同学正在独立开发#在MacMiniM432G上测试了下Qwen3.827b,MLX4bit版本。能跑到5~6tokens/s,让写一个计算器,思考了51分钟不过效果很惊艳,光影和声音这些细节做得非常好,唯一的小问题是,不能计算(点加号以后无法输出结果)顺手放网上了,感兴趣的...全文

10. 39.5Token每秒! 千问3.8 27B 2080Ti 22B单卡本地部署提速

11. [中配]实测Qwen3.8 27B在8GB笔记本上的真实表现:所有功能可用但速度慢,租用4090后快300倍

12. Qwen3.8-27B 发布:性能调研及本地部署建议

13. 【干货】Qwen3.8-27B变强的代价及部署情况

14. 【通义千问3.8】53 TPS极速!7900XTX 24G满血压榨!262K长上下文+KV Cache+MTP本地部署保姆级教程

15. 【分享】改善Qwen3.8雷霆大思考

16. Qwen3.827B500题10维度测评!打趴GLM5.2?这次显卡又要涨价了…

17. 千问3.8-27B

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章