上周五(8月14日)Qwen3.8-27B一开源,本地AI圈直接炸了。
有多炸?两天下载量破100万,Hugging Face Trending榜连续霸榜第一,社区已经贡献了500多个量化版本,相关模型下载量超500万知乎。海外开发者直接喊出"本地Opus",B站标题一个比一个猛:“这次真的封神了”“最低 8GB 显存就能跑”哔哩哔哩哔哩哔哩。
看到这儿,很多人的第一反应是:我这显卡能跑这种级别的模型了?要不要升级?
先别急着掏钱,把这份账本看完。我把这三天全网十几套社区实测扒了一遍,覆盖从8G显存的入门卡到大内存Mac、N卡、A卡。结论一句话:这模型确实强,但"能跑"和"好用"中间,隔着一整套设置。
为什么偏偏是27B让大家疯狂
30秒背景。Qwen3.8-27B是270亿参数的稠密多模态模型,原生262K上下文,Apache 2.0协议完全开放商用知乎。官方跑分超过了上一代Qwen3.6-27B,甚至超过闭源的Qwen3.7-Plus知乎。第三方平台Artificial Analysis的跑分里,它也已经和DeepSeek V4 Flash、GPT-5.6 Luna站在同一档微博。
27B这个尺寸的微妙之处在于:Q4量化后文件只有17GB左右,刚好塞进24GB显存,16GB省一省也能装下知乎。再小,撑不住现在大家想跑的复杂Agent和编程任务;再大,就脱离消费级硬件了。同一周,Meta的30B模型Muse Glimmer、英伟达的Nemotron 3.5 Lightning 30B-A3B也先后放出——大厂集体押注"个人电脑刚好跑得动"这个甜点位知乎。
社区讨论的问题已经不是"到底能不能跑",而是"8.5GB到30GB的量化版本,16G显存选哪个最划算"。Hugging Face的统计也印证了这一点:Qwen系GGUF量化模型每月下载量约3960万次,在本地推理模型里断层领先知乎。这本身就是代际变化的证据。

账本:每档显存到底跑成什么水平
直接上数据。以下全部来自这三天社区实测,各家量化、框架、上下文设置都不同,看个量级,别抠精确数字。
24G显存(RTX 4090/5090、AMD 7900XTX):完整跑,体验舒适
RTX 5090用Unsloth GGUF实测约157 tok/s哔哩哔哩。
RTX 4090开MTP加速约65 tok/s;SGLang在单张RTX 5090特定配置下给出过206 tok/s的解码成绩(测试条件不同,别直接横比)知乎。
AMD 7900XTX实测约62 tok/s,AMD官方这次给了Day 0支持知乎微博。
这一档直接Q4/Q5量化+长上下文,是目前的标准答案。还有硬核玩家用四张5060Ti 16G做P2P直连,解码跑到90-100 tok/s——不过四卡折腾的成本,普通人别碰哔哩哔哩。
16G显存(RTX 5060Ti/4060Ti、RX 9070XT):能跑,量化版本是关键
Q3量化约40 tok/s。
APEX-I-Nano量化版(10.4GB)在单张5060Ti上约50 tok/s,显存还有余量——这是评论区玩家交的作业,量化版选对了,16G的体验比想象中好哔哩哔哩。
想上Q4就得砍掉视觉模块或者用CPU借内存,上下文也别想开大。
16G不是不能用,是要会选量化档。
Mac大内存:能装下,速度另说
M5 Max MacBook Pro用LM Studio能跑同一个17GB的Q4_K_M量化版知乎。但M1 Max 64G跑8bit版本,输出只有约8 tok/s哔哩哔哩。也有玩家用32G统一内存的Mac Mini M4跑MLX 4bit版,输出大概5-6 tok/s微博。Mac的优势是统一内存能装下更大模型,劣势是慢。手里已有大内存Mac的值得玩,专门为它买一台,性价比不如装机。

8G/12G显存:不建议当主力
最小的GGUF版本也有8.5GB,塞进8G显存得大量CPU卸载知乎。"最低 8GB 显存就能跑"的标题确实存在哔哩哔哩。但那不是日常体验的起点。
三个坑:部署过一半的人都踩过
这部分建议收藏。这模型"难伺候"的一面,三天里被社区集体验证过了。
坑一:默认"雷霆思考",简单问题也先想两万token
Qwen3.8默认推理强度是xhigh。Django联合创始人Simon Willison实测:让它画一只鹈鹕骑自行车的SVG,思考了21分钟知乎。关掉推理重跑同一条提示词,2分17秒搞定。下图就是关掉推理后两分多钟画出来的成品。

他的建议很直接:第一次用,先把推理强度调到low甚至直接关掉知乎。玩家的总结更扎心:“不开思考表现得像个智障,打开思考又实在想太多”哔哩哔哩。好消息是新版llama.cpp已经支持–reasoning-effort参数,调起来不难。
坑二:262K上下文很好看,显存不答应
长上下文、MTP加速、视觉模块,这三样在24G卡上会抢显存。有玩家的4090D被迫三选二哔哩哔哩。5060Ti开26K上下文能跑30 tok/s,拉到48K直接爆显存掉到3 tok/s哔哩哔哩。同一台机器从3.6升到3.8,多轮对话从10轮缩到6-7轮——思考占比从90%涨到95%,上下文被内耗吃掉了哔哩哔哩。
坑三:旧教程别照搬,框架别乱升
vLLM 0.27.1对3.8是负优化,建议停在0.26.0哔哩哔哩。
Qwen3.6时代的提示词优化技巧,在3.8上会导致思考解析异常、死循环。
量化别低于Q4,有人实测Q2版本输出10万token也达不到Q4的效果哔哩哔哩。
那么,卡到底要不要买
分情况:
手里已经有24G卡:恭喜,直接部署,一分钱不用花。
16G卡:先跑Q3或APEX量化试试。能接受"能力强但思考慢",就完全够用,不用急着升级。
准备新装机:社区流传的参考价——二手RTX 4090 24G约1.2-1.4万元,RTX 5090 32G约2万元+微博。有玩家选择等RTX 5070 Ti Super,注意这卡官方还没发布,别拿现在的需求去赌它微博。
AMD用户:7900XTX是目前最像样的N卡替代,Day 0支持、实测62 tok/s,但整体生态成熟度仍比N卡慢半拍。
被DeepSeek调价刺伤的重度用户:这波DeepSeek涨价确实把不少人推向本地知乎。但账要算清楚——本地适合高频、重复、数据敏感的任务,偶尔的重度任务还是云端便宜。合理姿势是混合路由,别指望一台机器全替代知乎。

接下来值得盯的三件事
NVFP4量化和官方上下文开放进度,直接决定16G卡的体验上限;
传闻中的35B-A3B MoE版本:目前官方仓库没有确切信息,真出了对16G用户是更大的利好,但不必持币等它哔哩哔哩。
同周开源的MiniMax H3视频模型也在刷屏,8G显存就能本地出视频哔哩哔哩。本地AI生成的门槛,正在以肉眼可见的速度被拉平——今天的27B甜点位,说不定就是明天的入门线。
Qwen3.8-27B带来的最重要变化,不是又一个新模型,而是个人电脑能干的事上限又被抬高了一截。但记住两句话:部署之前,先把推理强度调低;买卡之前,先看完这份账本。