当前位置:
AIGC文章详情

Qwen3.8-27B是第一个摸到GPT-5.6级别的本地模型,偏偏赶上内存涨了4倍:我把全网15组实测聚起来,算了笔跑起来的账

源自57位全网作者

07:56

上周四(8月14日),阿里把Qwen3.8-27B开源了。微博这周知乎上冒出来一个热帖,叫「Qwen3.8-27B被称为新的模型斩杀线,为什么?」——理由是评测机构Artificial Analysis的最新数据:Qwen3.8-27B在Intelligence Index上拿了52分,和GPT-5.6 Luna一模一样,只比DeepSeek V4 Pro、GLM-5.2的53分低一分。知乎这是头一回,一个你能在自己电脑上跑起来的开放权重模型,摸到了前沿闭源模型的能力区间。

社区反应很直接:B站上雷达图对比视频播放量冲到8.8万、评论886条。unsloth的GGUF量化包上线ModelScope一天下载破万。知乎各平台的部署教程密集到刷屏。彭博社8月17日报道,Qwen系列下载量已经超过30亿次。B站微博

但我想聊的不是模型多强——这个已经有很多人说过了。我想聊一个特别扫兴、但特别现实的问题:这个模型出生的时间点,正好是硬件最贵的时候。

Qwen3.8-27B是第一个摸到GPT-5.6级别的本地模型,偏偏赶上内存涨了4倍:我把全网15组实测聚起来,算了笔跑起来的账

先泼一盆冷水:AI越强,硬件越贵,而且涨的正是AI最需要的那部分

先上数据:

  • 央视网8月14日报道,手机、平板、笔记本电脑价格「已经涨到肉疼了」,不少笔记本涨了上千元甚至几千元。微博

  • 开学季数码三件套,配齐一套中配比去年多花1500-2500元;

  • 知乎上有装机博主算了笔账:去年800元能买到的16GB DDR5内存,现在要3000-4000元,涨了4倍。知乎DRAM合约价2026年二季度环比上涨58%-63%,TrendForce预测三季度涨幅收窄到10%-20%,但价格回落到正常水平,至少要等到2027-2028年。

为什么涨?因为三星、SK海力士、美光这三大原厂把产能疯狂转向HBM高带宽内存——那是AI训练卡的刚需。消费级DDR5被挤压,这是结构性变化,不是黄牛炒作。微博

这里有个反直觉的地方,也是我想帮你先分清楚的:这波涨价,涨得最狠的不是显卡,是内存。新消费级显卡反而相对稳定——RTX 5060比上代4060只贵了15%-20%,中高端卡价格波动不超过500元。知乎真正坚挺的是两类东西:一是内存条和搭载大内存的整机,苹果128GB统一内存的M5 Max MacBook Pro,折合人民币要4万-5万;NVIDIA DGX Spark首发价3999美元,约2.9万元。知乎二是二手大显存AI卡——社区里的说法是,3090已经破万了。B站所以「等降价再买卡跑AI」这个想法,这次大概率要落空:涨的恰恰是AI最吃的那几样。

Qwen3.8-27B是第一个摸到GPT-5.6级别的本地模型,偏偏赶上内存涨了4倍:我把全网15组实测聚起来,算了笔跑起来的账

跑起来Qwen3.8-27B,到底需要什么

先说清楚这个模型的硬件账怎么算。Qwen3.8-27B是dense稠密模型,意味着每生成一个token,全部270亿参数都要参与计算,整个模型必须完整塞进显存,少一层都不行。知乎这跟MoE模型「只唤醒一部分专家」完全不是一个逻辑。

好消息是它原生支持262,144的上下文、图片视频理解,还自带MTP多token预测加速模块,Apache 2.0协议免费商用。微博坏消息是,显存就是入场券:

精度

模型体积

显存门槛

BF16满血

约54GB

双卡专业卡/数据中心

Q8

约31.5GB

32GB显存起步

Q4(UD-Q4_K_XL)

约17.9GB

24GB比较舒服

3-bit(UD-Q3_K_XL)

约13.4GB

16GB入场

2-bit(IQ2_XXS)

约9GB

尝鲜可用,能力保留约82.5%

一句话总结:16GB是入场券,24GB是舒适区,32GB以上才算自由。另外提醒一句,它是多模态模型,想看图还得额外下一个约0.93GB的mmproj视觉投影文件,这也是显存开销。知乎

全网15组实测聚成一张表:你的钱能买到多少速度

接下来是这篇的重头戏。我把知乎、B站、小红书、评论区里能找到的真实部署实测聚到了一起,全部来自过去9天的真人真机测试,按显存档位排好:

硬件

显存/内存

量化版本

实测速度

来源

RTX 5070 Ti

16GB

3-bit

聊天80 / Agent 113 tok/s(开MTP)

知乎实测

16GB显卡通用

16GB

UD-Q3_K_XL

70 tok/s

B站实测

RTX 3090 Ti

24GB

官方Q4

62 tok/s(10K上下文56.1)

知乎实测

RX 7900 XTX

24GB

Q4

53-62 tok/s(ROCm)

B站实测

V100(二手)

32GB

nvfp4

50+ tok/s

B站实测

2080 Ti 22G魔改

22GB

-

39.5 tok/s

B站实测

RTX 4090D

24GB

Q4_K_M

不到40 tok/s(未开MTP)

B站评论区

RTX 3090

24GB

Q3

40 tok/s上下

B站评论区

M4 Max

128GB统一内存

nvfp4

33.1 tok/s

小红书实测

32GB显存

32GB

Q6

25 tok/s

B站评论区

Ryzen AI Max+ 395

共享内存

-

24.5 tok/s

AMD官方展示

DGX Spark

128GB统一内存

Q4_K_M

约20 tok/s

社区实测

RTX 5060+CPU

8GB

Q4

3.8-4 tok/s

知乎实测

纯CPU

-

Q4

2.7-2.8 tok/s

知乎实测

Radeon AI PRO R9700

32GB

-

51.8 tok/s

AMD官方展示

几个可以直接带走的结论:

第一,20-60 tok/s是「实用线」。 一般认为输出速度到了20 tok/s以上,体感就接近在线API了。知乎40以上很舒服。照这个标准,24GB档的3090Ti、7900XTX、3090,16GB档的5070Ti跑3-bit,都已经过线。B站

第二,16GB显存上,问题不是「3-bit还是4-bit」,而是「3-bit还是没有」。 这是我觉得最反常识的一点。网上教程几乎都推荐4-bit,但5070Ti 16GB的实测发现,Q4_K_M光权重文件就超过了整张卡的可用显存,硬塞进去之后部分权重被甩到系统内存,每个token都要过一次PCIe——实测比3-bit慢了大约300倍,GPU占用100%但功耗只有76W,因为它在等数据,不是在算。知乎所以16GB卡请直接下UD-Q3_K_XL,别在4-bit上浪费时间。

第三,offload救不了小显存。 同一份实测里,往CPU卸载一层,速度直接砍掉六成。知乎8GB显存的5060混合加速只有3.8-4 tok/s,纯CPU更是只有2.7。知乎这个速度只能叫「能跑」,不能叫「能用」。所以8GB及以下的卡,我的建议是别折腾27B了,等小尺寸版本或者直接用云端。

第四,这波涨价里真正的性价比之王,全是「老家伙」。 二手V100 32GB,5000元以内,跑nvfp4能到50 tok/s以上——博主的原话是「速度大约RTX Pro 6000D的一半,价格是它的二十分之一」。B站2080Ti 22G魔改卡39.5 tok/s。B站这两张卡当然有门槛:V100是数据中心卡,功耗高、没视频输出、要会折腾Linux;魔改卡有显存稳定性风险。但对会折腾的人,这是5000元以内唯一能「实用」的路。

Qwen3.8-27B是第一个摸到GPT-5.6级别的本地模型,偏偏赶上内存涨了4倍:我把全网15组实测聚起来,算了笔跑起来的账

按预算说结论

0元方案: 先别买任何硬件。Qwen3.8-Max的API已经上线,官方chat.qianwen.com也能用。微博先用云端把「我到底拿它干什么」想清楚。很多人的真实场景,云端免费额度就够。

Qwen3.8-27B是第一个摸到GPT-5.6级别的本地模型,偏偏赶上内存涨了4倍:我把全网15组实测聚起来,算了笔跑起来的账

手里已有卡: 16GB选UD-Q3_K_XL,24GB选官方Q4或UD-Q4_K_XL,32GB可以上Q5/Q6。知乎先把默认的xhigh推理强度降下来——默认设置下它画一张图能思考21分钟。知乎调到medium或low,体验是两个世界。这一步不花钱,比换卡立竿见影。

5000元以内新购: 会折腾选二手V100 32G或2080Ti 22G魔改,速度过实用线,代价是稳定性和折腾成本。知乎不会折腾就建议别买,这个预算买新卡只能买到16GB,体验打折。

6000-8000元: 新显卡是这波涨价里少数「正常」的配件,价格波动不大。知乎但要想清楚:这个价位的新卡大多是16GB显存,只能跑3-bit。B站有博主出过7599元的一体机方案,标称40 tok/s,可以作为一个参照物去比价。B站

万元以上: RTX 5090 32GB目前3万元左右,还有溢价,是主流消费级里唯一能舒服跑大显存量化的卡。知乎除非你确定要长期重度使用,否则这个溢价不值得现在吃。

Mac用户: 如果你已经有台大统一内存的Mac,直接跑,M4 Max 128GB实测33 tok/s,够用。小红书但千万别为了跑这个模型去买128GB配置的Mac——4-5万元的成本,这个账怎么算都不划算。知乎

值得继续盯的三个信号

  1. Qwen3.8-35B-A3B。 8月中旬已经有泄露信息,评论区一堆人在喊「等35B」。B站MoE架构每次只激活约3B参数,对显存的要求会低一个量级——如果属实,现在为27B买的卡可能很快就不是最优解。这是「等等党」目前最硬的论据。

  2. 内存价格走势。 DRAM回落到正常价位至少要2027-2028年,这是多家分析机构的共识。知乎所以结论有点扎心:刚需越等越贵大概率是真的,非刚需也不差这几个月。

  3. 社区优化版本。 这9天里已经冒出了思考压缩版等一堆社区魔改。B站还有投机解码草稿模型,单并发吞吐最高3.4倍。知乎本地模型的乐趣和麻烦都在这:你买的不只是一个模型,是一个还在快速进化的生态。

最后说一句我自己的判断:Qwen3.8-27B真正的意义,是第一次把「模型能力」和「部署成本」这两件一直绑在一起往上走的事拆开了——能力进了前沿区间,部署进了个人电脑区间。但在硬件涨价潮里,这份「自由」的入场费也变了。账我给你算完了:16GB入场、24GB舒适、二手老卡性价比最高、内存是真凶、35B值得等。剩下的,看你到底是缺一个模型,还是缺一个用途。

精选参考来源

1
开源!Qwen3.8-27B如约而至今天,我们正式开源Qwen3.8系列模型,所有开发者、科研机构和企业均可自由下载、部署和使用Qwen3.8模型。27B(270亿参数)是全球AI社区呼声最高的模型尺寸,就在刚刚,Qwen3.8-27B 也已开源上线!🎯部署方便,流畅实用Qwen3.8-27B是原生多模态稠密(Dense)模型,部署便捷,量化后在“消费级”显卡上即可流畅运行,快且实用,图文视频全理解。模型支持262K 原生上下文,YaRN技术可轻松扩展至 1M tokens。🎯性能进阶,表现卓越较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了Qwen3.7-Plus。Qwen3.8-27B也拥有Qwen3.8系列模型的共性,可以端到端完成复杂任务,直接交付经得起检验的可靠成果。现在,我们以宽松的 Apache 2.0 协议开放模型权重,所有人都可免费下载、部署及商用。此前,旗舰模型Qwen3.8-Max也已开源模型权重。截至目前,我们已累计开源 460余个模型,Qwen的全球下载总量超 30 亿次,衍生模型数超30万个,成为全球AI社区最受欢迎的开源模型家族。未来,Qwen将继续与AI开源社区同行,我们也期待全球开发者朋友能基于Qwen做出更多更好的新模型、新应用、新创造~😊#千问大模型##Qwen##AI#
2
Qwen3.8-27B 被称为新的「模型斩杀线」,为什么?如何看待这一变化?
全部
来源
内容由AI生成

精选参考来源

1. 开源!Qwen3.8-27B如约而至今天,我们正式开源Qwen3.8系列模型,所有开发者、科研机构和企业均可自由下载、部署和使用Qwen3.8模型。27B(270亿参数)是全球AI社区呼声最高的模型尺寸,就在刚刚,Qwen3.8-27B 也已开源上线!🎯部署方便,流畅实用Qwen3.8-27B是原生多模态稠密(Dense)模型,部署便捷,量化后在“消费级”显卡上即可流畅运行,快且实用,图文视频全理解。模型支持262K 原生上下文,YaRN技术可轻松扩展至 1M tokens。🎯性能进阶,表现卓越较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了Qwen3.7-Plus。Qwen3.8-27B也拥有Qwen3.8系列模型的共性,可以端到端完成复杂任务,直接交付经得起检验的可靠成果。现在,我们以宽松的 Apache 2.0 协议开放模型权重,所有人都可免费下载、部署及商用。此前,旗舰模型Qwen3.8-Max也已开源模型权重。截至目前,我们已累计开源 460余个模型,Qwen的全球下载总量超 30 亿次,衍生模型数超30万个,成为全球AI社区最受欢迎的开源模型家族。未来,Qwen将继续与AI开源社区同行,我们也期待全球开发者朋友能基于Qwen做出更多更好的新模型、新应用、新创造~😊#千问大模型##Qwen##AI#

2. Qwen3.8-27B 被称为新的「模型斩杀线」,为什么?如何看待这一变化?

3. Qwen3.8-27B 实测:V100 上的部署要点与 Q4/Q8 全量基准

4. 2026/08/17 彭博社:阿里报告Qwen下载超30亿次,分发优势何时变成收入

5. 【#电子产品价格已经涨到肉疼了#】#刚需怎样买电子产品能省钱# 最近,不少人想买电子产品时发现,手机、平板、电脑等已经涨到“肉疼”了,不少笔记本电脑价格涨了上千元甚至是几千元。为什么涨这么猛?问题出在成本上。去年下半年开始,全球AI算力需求暴增,内存、硬盘、显卡这些核心部件价格一路走高。企业将大量先进产能转向利润更高的AI高宽带内存,直接导致手机、电脑等消费级内存和硬盘严重缺货,价格大涨。目前存储成本在笔记本电脑整机中的占比,已经从过去的15%飙升到了30%以上,高端机型甚至突破35%,导致终端产品售价水涨船高。而且业内判断存储芯片供需紧张可能会延续到2027年,很多人都担心电子产品会越来越贵。#闪迪宣布100%现金返还# 央视网的微博视频

6. 2026年攒机避坑指南:内存涨4倍,显卡反而成良心?

7. Qwen3.8-27B本地部署实测:很好但别用默认设置,社区优化后潜力很大,可稍晚入手!

8. v100跑Qwen3.8 27B千问nvfp4 速度超50tokens大约pro6000d一半的速度,在目前显卡大涨价环境下可能最具性价比的ai运行显卡了。

9. Qwen3.8-27B实测 (5070Ti 16GB VRAM)

10. 如何评价阿里开源的 Qwen3.8-27B?

11. 24G显卡本地运行Qwen 3.8 27b的一些优化经验

12. 【通义千问3.8】53 TPS极速!7900XTX 24G满血压榨!262K长上下文+KV Cache+MTP本地部署保姆级教程

13. 39.5Token每秒! 千问3.8 27B 2080Ti 22B单卡本地部署提速

14. 【#阿里Qwen3.8Max正式上线#】8月3日,千问Qwen3.8-Max模型正式上线,总参数量2.4万亿,这是Qwen家族迄今最强大的模型。据官方介绍,新模型基于Qwen3.5架构构建,在编程、办公、科研与长程任务上全面升级,整体性能处于全球大模型第一梯队。目前,Qwen3.8的API已上线千问AI平台,并接入阿里今日同步推出的Agent产品“千问办公”。Qwen3.8-MAX模型权重将于下周开源,同时还将开源Qwen3.8-27B。价格方面,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,而输入与输出的国际价格为Opus 5的40%与24%。(IT之家)

15. M4 Max 跑qwen-27b,token生成:33.1 tok/s

16. 泼冷水!Qwen3.8 27B三宗罪:很强!很难伺候!很难用!

17. 专治Qwen3.8 27B雷霆思考!思考压缩版Qwen3.8 27B测评:DavidAU/Qwen3.8-27B-Cold-Fusion

18. Qwen3.8-27B-DFlash2 开源:1.92B 草稿模型,SGLang 单并发吞吐达自回归 3.4 倍

19. 【全网首发】7599元40t/s,本地部署qwen3.8最强agent前端编程小模型,无需使用linux,支持claw与知识库。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章