上周四(8月14日),阿里把Qwen3.8-27B开源了。微博这周知乎上冒出来一个热帖,叫「Qwen3.8-27B被称为新的模型斩杀线,为什么?」——理由是评测机构Artificial Analysis的最新数据:Qwen3.8-27B在Intelligence Index上拿了52分,和GPT-5.6 Luna一模一样,只比DeepSeek V4 Pro、GLM-5.2的53分低一分。知乎这是头一回,一个你能在自己电脑上跑起来的开放权重模型,摸到了前沿闭源模型的能力区间。
社区反应很直接:B站上雷达图对比视频播放量冲到8.8万、评论886条。unsloth的GGUF量化包上线ModelScope一天下载破万。知乎各平台的部署教程密集到刷屏。彭博社8月17日报道,Qwen系列下载量已经超过30亿次。B站微博
但我想聊的不是模型多强——这个已经有很多人说过了。我想聊一个特别扫兴、但特别现实的问题:这个模型出生的时间点,正好是硬件最贵的时候。

先泼一盆冷水:AI越强,硬件越贵,而且涨的正是AI最需要的那部分
先上数据:
开学季数码三件套,配齐一套中配比去年多花1500-2500元;
知乎上有装机博主算了笔账:去年800元能买到的16GB DDR5内存,现在要3000-4000元,涨了4倍。知乎DRAM合约价2026年二季度环比上涨58%-63%,TrendForce预测三季度涨幅收窄到10%-20%,但价格回落到正常水平,至少要等到2027-2028年。
为什么涨?因为三星、SK海力士、美光这三大原厂把产能疯狂转向HBM高带宽内存——那是AI训练卡的刚需。消费级DDR5被挤压,这是结构性变化,不是黄牛炒作。微博
这里有个反直觉的地方,也是我想帮你先分清楚的:这波涨价,涨得最狠的不是显卡,是内存。新消费级显卡反而相对稳定——RTX 5060比上代4060只贵了15%-20%,中高端卡价格波动不超过500元。知乎真正坚挺的是两类东西:一是内存条和搭载大内存的整机,苹果128GB统一内存的M5 Max MacBook Pro,折合人民币要4万-5万;NVIDIA DGX Spark首发价3999美元,约2.9万元。知乎二是二手大显存AI卡——社区里的说法是,3090已经破万了。B站所以「等降价再买卡跑AI」这个想法,这次大概率要落空:涨的恰恰是AI最吃的那几样。

跑起来Qwen3.8-27B,到底需要什么
先说清楚这个模型的硬件账怎么算。Qwen3.8-27B是dense稠密模型,意味着每生成一个token,全部270亿参数都要参与计算,整个模型必须完整塞进显存,少一层都不行。知乎这跟MoE模型「只唤醒一部分专家」完全不是一个逻辑。
好消息是它原生支持262,144的上下文、图片视频理解,还自带MTP多token预测加速模块,Apache 2.0协议免费商用。微博坏消息是,显存就是入场券:
精度 | 模型体积 | 显存门槛 |
|---|---|---|
BF16满血 | 约54GB | 双卡专业卡/数据中心 |
Q8 | 约31.5GB | 32GB显存起步 |
Q4(UD-Q4_K_XL) | 约17.9GB | 24GB比较舒服 |
3-bit(UD-Q3_K_XL) | 约13.4GB | 16GB入场 |
2-bit(IQ2_XXS) | 约9GB | 尝鲜可用,能力保留约82.5% |
一句话总结:16GB是入场券,24GB是舒适区,32GB以上才算自由。另外提醒一句,它是多模态模型,想看图还得额外下一个约0.93GB的mmproj视觉投影文件,这也是显存开销。知乎
全网15组实测聚成一张表:你的钱能买到多少速度
接下来是这篇的重头戏。我把知乎、B站、小红书、评论区里能找到的真实部署实测聚到了一起,全部来自过去9天的真人真机测试,按显存档位排好:
硬件 | 显存/内存 | 量化版本 | 实测速度 | 来源 |
|---|---|---|---|---|
RTX 5070 Ti | 16GB | 3-bit | 聊天80 / Agent 113 tok/s(开MTP) | 知乎实测 |
16GB显卡通用 | 16GB | UD-Q3_K_XL | 70 tok/s | B站实测 |
RTX 3090 Ti | 24GB | 官方Q4 | 62 tok/s(10K上下文56.1) | 知乎实测 |
RX 7900 XTX | 24GB | Q4 | 53-62 tok/s(ROCm) | B站实测 |
V100(二手) | 32GB | nvfp4 | 50+ tok/s | B站实测 |
2080 Ti 22G魔改 | 22GB | - | 39.5 tok/s | B站实测 |
RTX 4090D | 24GB | Q4_K_M | 不到40 tok/s(未开MTP) | B站评论区 |
RTX 3090 | 24GB | Q3 | 40 tok/s上下 | B站评论区 |
M4 Max | 128GB统一内存 | nvfp4 | 33.1 tok/s | 小红书实测 |
32GB显存 | 32GB | Q6 | 25 tok/s | B站评论区 |
Ryzen AI Max+ 395 | 共享内存 | - | 24.5 tok/s | AMD官方展示 |
DGX Spark | 128GB统一内存 | Q4_K_M | 约20 tok/s | 社区实测 |
RTX 5060+CPU | 8GB | Q4 | 3.8-4 tok/s | 知乎实测 |
纯CPU | - | Q4 | 2.7-2.8 tok/s | 知乎实测 |
Radeon AI PRO R9700 | 32GB | - | 51.8 tok/s | AMD官方展示 |
几个可以直接带走的结论:
第一,20-60 tok/s是「实用线」。 一般认为输出速度到了20 tok/s以上,体感就接近在线API了。知乎40以上很舒服。照这个标准,24GB档的3090Ti、7900XTX、3090,16GB档的5070Ti跑3-bit,都已经过线。B站
第二,16GB显存上,问题不是「3-bit还是4-bit」,而是「3-bit还是没有」。 这是我觉得最反常识的一点。网上教程几乎都推荐4-bit,但5070Ti 16GB的实测发现,Q4_K_M光权重文件就超过了整张卡的可用显存,硬塞进去之后部分权重被甩到系统内存,每个token都要过一次PCIe——实测比3-bit慢了大约300倍,GPU占用100%但功耗只有76W,因为它在等数据,不是在算。知乎所以16GB卡请直接下UD-Q3_K_XL,别在4-bit上浪费时间。
第三,offload救不了小显存。 同一份实测里,往CPU卸载一层,速度直接砍掉六成。知乎8GB显存的5060混合加速只有3.8-4 tok/s,纯CPU更是只有2.7。知乎这个速度只能叫「能跑」,不能叫「能用」。所以8GB及以下的卡,我的建议是别折腾27B了,等小尺寸版本或者直接用云端。
第四,这波涨价里真正的性价比之王,全是「老家伙」。 二手V100 32GB,5000元以内,跑nvfp4能到50 tok/s以上——博主的原话是「速度大约RTX Pro 6000D的一半,价格是它的二十分之一」。B站2080Ti 22G魔改卡39.5 tok/s。B站这两张卡当然有门槛:V100是数据中心卡,功耗高、没视频输出、要会折腾Linux;魔改卡有显存稳定性风险。但对会折腾的人,这是5000元以内唯一能「实用」的路。

按预算说结论
0元方案: 先别买任何硬件。Qwen3.8-Max的API已经上线,官方chat.qianwen.com也能用。微博先用云端把「我到底拿它干什么」想清楚。很多人的真实场景,云端免费额度就够。

手里已有卡: 16GB选UD-Q3_K_XL,24GB选官方Q4或UD-Q4_K_XL,32GB可以上Q5/Q6。知乎先把默认的xhigh推理强度降下来——默认设置下它画一张图能思考21分钟。知乎调到medium或low,体验是两个世界。这一步不花钱,比换卡立竿见影。
5000元以内新购: 会折腾选二手V100 32G或2080Ti 22G魔改,速度过实用线,代价是稳定性和折腾成本。知乎不会折腾就建议别买,这个预算买新卡只能买到16GB,体验打折。
6000-8000元: 新显卡是这波涨价里少数「正常」的配件,价格波动不大。知乎但要想清楚:这个价位的新卡大多是16GB显存,只能跑3-bit。B站有博主出过7599元的一体机方案,标称40 tok/s,可以作为一个参照物去比价。B站
万元以上: RTX 5090 32GB目前3万元左右,还有溢价,是主流消费级里唯一能舒服跑大显存量化的卡。知乎除非你确定要长期重度使用,否则这个溢价不值得现在吃。
Mac用户: 如果你已经有台大统一内存的Mac,直接跑,M4 Max 128GB实测33 tok/s,够用。小红书但千万别为了跑这个模型去买128GB配置的Mac——4-5万元的成本,这个账怎么算都不划算。知乎
值得继续盯的三个信号
Qwen3.8-35B-A3B。 8月中旬已经有泄露信息,评论区一堆人在喊「等35B」。B站MoE架构每次只激活约3B参数,对显存的要求会低一个量级——如果属实,现在为27B买的卡可能很快就不是最优解。这是「等等党」目前最硬的论据。
内存价格走势。 DRAM回落到正常价位至少要2027-2028年,这是多家分析机构的共识。知乎所以结论有点扎心:刚需越等越贵大概率是真的,非刚需也不差这几个月。
社区优化版本。 这9天里已经冒出了思考压缩版等一堆社区魔改。B站还有投机解码草稿模型,单并发吞吐最高3.4倍。知乎本地模型的乐趣和麻烦都在这:你买的不只是一个模型,是一个还在快速进化的生态。
最后说一句我自己的判断:Qwen3.8-27B真正的意义,是第一次把「模型能力」和「部署成本」这两件一直绑在一起往上走的事拆开了——能力进了前沿区间,部署进了个人电脑区间。但在硬件涨价潮里,这份「自由」的入场费也变了。账我给你算完了:16GB入场、24GB舒适、二手老卡性价比最高、内存是真凶、35B值得等。剩下的,看你到底是缺一个模型,还是缺一个用途。