8 月,阿里把 Qwen3.8-27B 开源了,一个 27B 参数的原生多模态模型,Apache-2.0 协议,权重完整放开。知乎另一边,B 站上标题写着"Qwen3.8-27B劝退,对普通用户没意义。"的视频正在收获播放量。哔哩哔哩还有一边,一周之内,Hugging Face 上点赞破万、月下载量冲到 170 万次以上,社区量化版本刷出了 700 个。知乎同一个模型,评价撕裂成两半。
我们花了三天,把知乎、小红书、B 站上 20 多条实测逐条核对完,结论对得上:劝退视频的问题不在模型,而在拿错配置去测;而一张显卡能不能跑,本质上是道算术题。这篇文章把这道算术讲清楚,再给一张按显存档位走的选型表。
一、先搞清楚这是个什么模型
先看规格:
BF16 原始权重大约 28B 参数 × 2 字节 = 54GB,16G 显存想都别想。知乎
原生多模态:能理解图像和视频,从 STEM 图表到小时级的视频都能读,本地跑不用再挂第二个视觉模型。
原生 262K 上下文,官方可扩到 1M,不靠各种「长度插值补丁」硬撑。知乎
64 层结构里 48 层是 Gated DeltaNet 线性注意力、16 层是 Gated Attention 标准注意力,KV 缓存压力比传统模型低。
能力面单独说:Agent 编程能力官方口径比上一代直接翻了三倍,测自主编程的 DeepSWE 从 13.3 跳到 42.2。知乎

于是知乎上出现了"Qwen3.8-27B 被称为新的「模型斩杀线」,为什么?如何看待这一变化?“这样的问题。知乎B 站 AI 日报也直接以"新「斩杀线」,24G 单卡就能跑"为题做了报道。哔哩哔哩能被叫斩杀线,原因很简单:这是第一个把带 Agent 能力的多模态长上下文模型,塞进消费级显卡显存区间的开源模型。分水岭的意义不在跑分,在于"普通人够得着了”。
二、为什么评价两极:劝退视频错在哪
先看劝退方的测试:视频拿 IQ1 级别的量化跑模型,模型智力大打折扣,速度也难看得起来,结论直接给到"对普通用户没意义"。评论区一眼看出了不对劲,热评直接开炮:最起码你也测个 q4km,再评价行不行吧,q1 真的绷不住。哔哩哔哩
一条 17 赞的评论说得更直白:这不是模型没用,是你电脑没用。
还有垃圾佬现身说法:我 6000 块的平台双 2080ti 22G,搞定 3.8 27b 90tps,用 nvfp4 跑 262k 上下文。哔哩哔哩
也有 5090 车主直接回怼:Q1 量化玩啥,我 5090 跑 Q5 能跑 70 token/s。
从劝退视频里的 2 tok/s,到评论区跑出来的 70–90 tok/s,差了接近 40 倍。同一个模型,变量就三个:量化档位、显存大小、权重能不能全进显存。看懂这三个变量,就能看懂下面的选型表。
三、20+ 实测核对:哪档显存该跑哪个量化
这一周各平台的实测已经很多了。知乎有人用双 2080Ti 22G 魔改卡测试,双卡开启 MTP 多 token 预测后,输出速度最高能到 50+ tok/s。知乎把这些数据抽出来按显存档位归拢,就是下面这张表:
显存档位 | 代表硬件 | 建议量化 | 实测参考 |
|---|---|---|---|
8GB | RTX 4060 8G 等 | IQ2 级(约 9–11GB) | 质量损失明显,只建议尝鲜 |
16GB | RTX 5060 Ti / 4060 Ti 16G | IQ3_S(约 12GB,全量进显存) | 实测 50 tok/s |
24GB | RTX 3090 / 4090 | Q4_K_M – Q5_K_M | 单 4090 最高 150 tok/s |
32GB+ | RTX 5090 | Q5_K_M / Q6_K_M | 70–108 tok/s |
统一内存 64GB | Mac M4 Max | MLX 4bit | 约 26 t/s |
多卡服务器 | V100 22G 魔改卡 ×2–6 | Q4_K_M+MTP / nvfp4 | 22–90 tok/s |

表里的速度都有实测出处。N 卡这边,单张 RTX 4090 跑出过 150 tok/s。哔哩哔哩苹果这边,M4 Max Mac Studio 跑 4bit 量化实测 26 t/s。小红书现阶段的单卡天花板 RTX 5090,也被测出过 108 Tok/s。哔哩哔哩
结论一:16GB 是分水岭。 IQ3_S(约 12GB)能完整放进 16G 显存,这是"质量×体积"的最优解;硬上 Q4_K_M(16.5GB)就必须分几层给 CPU,速度立刻打骨折。知乎前面说的 5060 Ti 16G 实测 50 tok/s,跑的正是这套方案。小红书低于 16G,要么接受更低的量化质量,要么接受更慢的速度。
结论二:老卡不神话。 V100 便宜,但多卡速度不是线性叠加:从 1 张到 2 张提升很明显,8 张的输出速度出现了大幅下降。小红书矿卡更要谨慎:170HX 大矿卡跑起来速度和 V100 差不多,但稳定性堪忧、价格离谱。哔哩哔哩

结论三:家用别想开满 262K。 KV 缓存随上下文长大,262K 上下文的光缓存就要 67GB,比模型本身还重一倍。知乎真要长上下文,得上多卡服务器:已经有人用 6 张 V100 跑长上下文方案,1 万出头、速度超过 22 tok/s。哔哩哔哩家用 16G/24G,开 8K–32K 上下文就是正常使用。
四、买卡之前先算账:三笔账和三个坑
先记住这个公式:需要的显存 ≈ 模型文件体积(体重) + KV 缓存(桌面大小) + 系统余量。知乎
KV 缓存这笔账单独算:这个模型每个 token 的注意力缓存约 256KB,8K 上下文约 2GB,32K 约 8GB。知乎再把 Q4_K_M 文件本身约 17GB 加进去,24G 显存才刚刚够看;16G 就必然要在量化和上下文里二选一。
评论区踩出来的坑还有三个:
下载先看仓库:权重发布前,Hugging Face 上出现过一大批同名假仓库。看到"Qwen3.8-27B"别急着下,认准官方 Qwen 组织发布。
下载再看体积:量化名字只是"菜谱名",同是 Q4_K_M,lmstudio-community 版 16.8GB、ggml-org 版 19.0GB、AtomicChat 版 17.1GB。知乎质量也天差地别,选官方或高下载量的版本最稳。
上下文上限要自己改:RTX 5090 显卡(32GB)下,Ollama 只给了 32K 上下文,而 Hermes 需要至少 64K 上下文。小红书跑 Agent 框架前,记得手动把上下文参数改上去。

五、谁不该玩:先算成本这笔账
先看硬币另一面的 API 价格:OpenRouter 上 Qwen3.8-27B 的价格已经低到每百万输入 token 0.40–0.45 美元。知乎这周国产大模型还刚经历了一轮涨价:8 月 17 号 DeepSeek 涨价生效,V4-Pro 高峰输出 27 块/百万 token,但涨价之后,本地部署反而比以前更香了。小红书
两类人确实值得本地跑。一类是 Agent 重度用户:Agent 任务是"token 碎钞机",一个自动修 bug 的循环轻松烧掉十几万 token。知乎长期按 API 计费会很肉疼。另一类是隐私和离线场景:数据不能出内网,本地就是唯一解。
反过来,只是偶尔聊天写文档、又不想折腾安装的,每百万输入 0.45 美元的 API 比再买一张显卡省心。社区里很多人摸索出的混合用法其实更划算:日常任务本地跑,遇到本地模型连续翻车两次的难题再调 API,混合使用成本最低。知乎
六、三个值得继续观察的信号
llama.cpp 刚更新大版本 0.2.0,号称速度提升最高 42%。哔哩哔哩本文实测的速度数字,可能很快会被一次版本更新刷新。
开源阵营这边还有更大的玩家入场:据环球时报报道,美国英伟达公司计划投入 60 亿美元打造顶尖的开源 AI 大模型。微博开源竞赛才刚开始。
社区侧的加速外挂也出现了:投机解码 DFlash2 发布了 Qwen3.8-27B 的支持,号称性能 3 倍。哔哩哔哩
最后回到那条劝退视频。模型没有绝对的"不能跑",只有"在你的卡上怎么跑"。对照上面这张表,把显存、量化和上下文预算算清楚,大多数坑都能绕开。已经跑起来的朋友,欢迎把显卡型号、量化版本和速度留在评论区——这张选型表,需要更多人的实测才能更准。