周四晚(8月14日),阿里正式开源Qwen3.8-27B,Apache 2.0协议,免费下载、免费商用。这两天正好是它发布后的第一个周末,知乎、B站、小红书上的Day0实测已经刷了屏:有人感叹"27B把旗舰打懵了",也有人直接泼冷水"很强,但很难伺候,很难用"。我把全网零散的实测归拢成三个问题:你的显卡跑不跑得动、它到底有多强、先动手的人踩了哪些坑。看完再决定要不要下载。
先搞清楚这是个什么模型
27B参数的Dense稠密模型,原生多模态,自带完整Vision Encoder,一次部署就能同时做文本和图像理解,不用外挂视觉模型。
262K原生上下文,通过YaRN技术可以外推到1M。
新增reasoning_effort参数,可以根据任务难度控制思考深度,简单任务能省下一大截资源。知乎这个参数后面讲坑的时候还会用到,先记住它。
千问系列刚刚成为HuggingFace生态里下载量破30亿的开源模型家族,目前已开源超460个模型,衍生模型超30万个。微博同一天AI圈还是三连发:上午智谱端出GLM-5.3,凌晨谷歌把Gemini3.7Flash甩了上来,到了晚上,千问也把Qwen3.8-27B开源了。知乎但三者里真正"能在你家显卡上跑起来"的,只有27B这一个。

"Opus级"先别激动,看清楚前缀
这两天流传最广的说法,是"27B追平Opus"。冷静看证据:在官方公布的一部分代码、办公和指令遵循评测里,它确实已经达到或超过了此前旗舰的水平。小红书社区把它总结成一句更狠的话——“开始追上半年前的Opus”,注意,前缀是"半年前"。
再看官方Text Performance对比图,结论是有赢有输:SWE-bench Pro上27B拿61.7分,高于Opus 4.6 Max的53.4分;但Terminal Bench 2.1上,对方仍以78.2对73.0领先。官方自己的口径也比较克制:较上一代Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了Qwen3.7-Plus。知乎

所以判断很明确:如果你的需求是"本地跑一个写代码、干办公活的Agent",27B已经真实可用;如果想让它下载下来就打平今天最贵的付费API,大概率要失望。
显存档位表:你的卡在哪一档
社区这两天的Day0实测(主要是Unsloth GGUF量化加llama.cpp路线)可以归拢成一张档位表。注意全部是个人实测样本,量化版本和配置不同,结果会有出入,当参考不当承诺:
显存档位 | 代表硬件 | 能跑什么 | 参考速度 |
|---|---|---|---|
32GB | RTX 5090 | BF16全量或高比特量化 | 约157 token/s |
24GB | RTX 3090/4090、老P40 | Q4_K_M舒适全载 | 3090约53 token/s |
16GB | 5060Ti/4060Ti 16G | 低比特量化加offload,可用但要折腾 | 4卡P2P解码90-100、预填充约2800 |
10GB左右 | 2080Ti 10G | 一键工具降低门槛 | — |
Mac统一内存 | M系列大内存机型 | GGUF直接跑 | 约30 token/s |
矿卡改造 | 170HX | 能跑,纯折腾向 | 约43 token/s |
速度数据主要来自Day0实测视频:5090约157、3090约53、170HX约43、Mac约30 token/s。哔哩哔哩官方首日还拉上AMD和英伟达做了边缘部署优化:英伟达RTX5090单卡最快可达每秒131个token,AMD R9700约51.8 token/s。微博硬件兼容性也相当宽,连改装水冷的老P40 24GB都在跑Q4_K_M。小红书
三条结论:
24GB是这次的舒适区:Q4_K_M全量进显存,速度可用,还有余力上更高比特。家里有3090、4090的不用犹豫,直接开装。
16GB是"能跑但要折腾"档:接受低比特量化和部分offload才有体验;多卡P2P是一条被实测验证过的路,但门槛不低。
显存不到10GB、或者完全不想折腾的,建议直接用API或者等量化生态再熟一点,不必硬上。
变强的代价:Day0已经踩出来的四个坑
这部分是宣传材料里不会写的,也是最影响实际体验的。有UP主用四张5060Ti 16G做了P2P直连实测,总结得很实在,我对照其他信源核实过:
思考token暴涨:概括、故事类任务里,思考占上下文的比重从90%升到约95%,262K上下文更容易触发压缩,同样硬件的多轮对话从能撑10轮缩到6-7轮。哔哩哔哩好在有reasoning_effort,简单任务直接把思考深度调低,不然token全烧在思考上。
vLLM 0.27.1目前对3.8是负优化:实测建议先保留0.26.0,等上游适配修复。
别沿用3.6时代的优化:GitHub上流传的3.6-27B提示词优化方案直接搬到3.8上,会导致思考解析异常、工具调用错误甚至死循环,旧配置记得清理。
驱动还有隐藏加成:升到610.57.04后,四并发场景约有13%提升,属于免费性能。

也有更直白的声音。B站一支以"三宗罪"为题的实测视频这两天在流传,结论就是"很强!很难伺候!很难用!"。哔哩哔哩槽点基本就是上面这四条——模型确实强,但部署、调参、配置都有真实门槛。不想碰命令行的,社区也有一键方案,admAgent支持Qwen3.8 27B一键下载部署启动,2080Ti 10G显存也能装下。哔哩哔哩
这个周末,不同人该怎么做
24GB以上显存、玩过llama.cpp或Ollama:部署,就现在。周末正是Day0黄金窗口,Q4_K_M加llama.cpp是最快上手路线;想进一步压榨推理效率,可以盯NVFP4量化,官方和社区都在推。
16GB显存:能跑,但把预期降一档,做好offload和量化折腾的心理准备;如果主力用途是写代码Agent,本地加API混用,体验会比纯本地舒服。
没有独显、不想折腾:直接用官方API体验Qwen3.8就行,开源权重跟你关系不大,不用焦虑。
想为它专门买卡:不建议。开源模型尺寸迭代太快,今天的27B甜点位,半年后可能就变了;二手3090值得考虑的前提是它足够便宜,就算下一代不适配,损失也有限。

接下来两周值得盯三个信号:vLLM、llama.cpp对3.8的适配修复进度,NVFP4量化方案的成熟度,以及思考token占比过高的问题会不会有官方优化。有新进展我会继续跟进。