千问3.8-27B开源这波,热度已经烧了一整周,评论区最多的还是同一个问题:我的显卡,到底能不能跑?
先把结论放前面:能跑,而且比很多人想的强;但"能跑"和"跑得舒服"是两回事。这一周B站、知乎、海外LocalLLaMA社区的实测帖快被刷爆了,我把十几份独立实测翻了一遍,今天不教部署,只帮你算一笔账——你的配置属于哪一档,值不值得现在动手。
先说它凭什么火
简单回顾下这模型为什么动静这么大。千问官方给的说法是,27B是"全球AI社区呼声最高的模型尺寸":270亿参数的稠密多模态模型,支持思考和非思考两种模式,8月14日正式开源,Hugging Face和魔搭都能直接下载,任何人可以免费部署使用。知乎
跑分这次确实有点凶:Agent编程评测SWE-bench Pro,它拿了61.7分,比Claude Opus 4.6 Max的53.4分高出8分多。钛媒体在Artificial Analysis的人工智能指数上,也有社区讨论认为它已经追平了GPT-5.6。知乎
同系列的旗舰千问3.8-Max跑分同样能打:考察命令行办事能力的Terminal-Bench 2.1,它的平均通过率拿到86.6%,距离GPT-5.6 Sol只差2.2个百分点。钛媒体考察多指令遵循的IFBench,它更以82.8%反超GPT-5.6 Sol的72.7%。

热度也有数据撑:开放两天下载量突破100万次,连续几天霸占全球模型热榜第一;海外LocalLLaMA论坛因为讨论帖太多太重复,版主干脆专门开了一个千问3.8集中讨论帖。知乎

显存这笔账:8GB是传说,17G才是门槛
网上最抓眼球的那句"最低8GB显存就能跑",建议理解成"能启动",而不是"能用"。把全网实测捋一遍,大概是这么个分层:
24G显存档(4090 / 3090 / 7900XTX):最舒服的一档。 官方4比特量化版体积约17.74GB,装进去还有富余留给上下文。有知乎用户把输出速度从默认的20-30 tps优化到50-60 tps,体感跟在线的DeepSeek v4 flash相差无几。知乎B站还有博主实测7900XTX跑到53 TPS,带262K长上下文。哔哩哔哩
16G显存档(5070Ti、4060Ti 16G等):得压到3比特。 有人专门实测了5070Ti 16G,结论是4比特根本跑不起来,整套实测都用3比特。知乎精度和上下文长度,要有取舍的心理准备。
老卡档(2080Ti 22G):实测39.5 tokens/s。 老旗舰并没有完全掉队。哔哩哔哩
Mac / 老数据中心卡:也能上桌。 48GB统一内存的MacBook Pro,已经有人跑通了GGUF版本。知乎甚至V100 32GB这种老数据中心卡,也有人用nvfp4压出超50 tokens的速度。哔哩哔哩
提醒一句:这些数字来自不同人的独立实测,量化版本、上下文长度、驱动设置都不一样,只能当量级参考,不是承诺值。

两个坑:教程不会告诉你,但实测帖全在喊
显卡够了也别急着点火,默认设置直接部署,大概率踩两个坑。
坑一:思考太长。 原版默认的思考输出非常长,社区管这叫"雷霆思考"——一个问题先输出一大段推理才给答案,速度全耗在这上面。哔哩哔哩官方留了个口子:新增的reasoning_effort功能,可以按任务难度控制思考深度,更省资源。知乎
社区还有一条路:用海外作者放出的思考压缩衍生版,B站已经有专门的对比评测。哔哩哔哩
坑二:默认设置不是最优解。 知乎一篇热帖的标题很直白,很好但别用默认设置,社区优化后潜力很大,可稍晚入手。知乎意思是这模型的实战表现很吃部署参数——量化格式、上下文分配、思考控制都有讲究,光下载就跑,体验到的不是完全体。
再泼一点冷水:真正的满血旗舰千问3.8-Max有2.4万亿参数,对普通人来说,这种体量基本只能在线使用。钛媒体27B的价值,是把旗舰级体验搬进自己家;但高难度长任务,别指望它完全替代云端旗舰,该上云还得上云。

四类人,四个判断
手里已经有24G显存:直接部署,血赚。 从官方4比特版起步,按社区方案调参。你现在拿到的是当前本地部署的最优解,处理编程和长文Agent任务尤其值。
16G显存:先试再决定。 3比特是折中方案,日常对话、轻度编程够用;重度长上下文需求,体验会有明显折扣,建议先租云显卡试一天再决定要不要折腾。
没显卡 / 小显存:别为它买卡。 一是现在显卡价格不太平。之前人厌狗嫌的RTX 5080,都涨到12999元了。钛媒体二是云端并不缺选择——千问自家渠道就能用上旗舰模型,社区里还有人分享过39元的token月卡玩法。知乎先用免费的云端版本把需求摸清楚,等优化成熟、价格回落再动手,一点不亏。
Mac大内存用户:可以认真考虑。 32GB以上统一内存,GGUF/MLX方案已经齐了,这是少数"不用买新硬件也能上桌"的路线。
为什么现在值得盯
最后说下时机。8月中旬DeepSeek调价之后,整个社区都在重新算本地开源模型的经济账。哔哩哔哩有人直接把千问3.8-27B叫作"开源模型的DeepSeek时刻"——本地模型第一次被认真当成生产工具看。哔哩哔哩如果你一直想玩本地大模型但嫌门槛高,这是近两年最成熟的一次机会。
接下来两个观察信号:一是官方会不会出手解决思考过长的问题(比如官方思考压缩版);二是9月下旬云栖大会,千问还会端出什么。有进展这笔账还得重算一次。