开头:装完 27B 的人,这周开始撞第二个墙
9月1日阿里开源 Qwen3.8-27B 那天,知乎热榜第一不是娱乐话题,是"如何评价Qwen3.8-27B",65万人围观。一个多月过去,这颗27B已经成了本地推理吧的"默认主力":单卡7900XTX有人跑通了,双16G入门卡有人跑通了,10G显存靠Bonsai2的5.9GB量化版也塞下了。知乎知乎
但这一周(9月18日到9月25日),社区集中爆出来的新问题变了口味:不再问"下哪个量化版",而是问"怎么一开长上下文就崩"。证据链很整齐:
9月21日,一张RTX 4060 Ti 16G的万字实测长文,标题就叫《16GB显卡挑战Qwen3.8-27B 256K上下文》,内容包含3次CUDA OOM复盘;
9月25日凌晨,4070 12G用户写自己接opencode:ollama下载的8B小模型"能力不够、Agent也不行",最后换llama.cpp才把64K上下文塞进12G;
9月23日,双V100系列博客测完llama.cpp Q4_K_M:256K是极限,“384k以上OOM”;
B站双16G实测视频标题直接写"从『能跑』到『能用』",列了六个坑;小红书科普帖《显存为什么会爆?》《有缓存为什么聊天长了还会变慢?》在同期起量。小红书
一句话定位这篇内容写给谁:不是写给还没装27B的人,是写给已经装完、平时聊天没问题、这周试着接Claude Code/opencode/RAG、然后被上下文长度咬住的人。权重是门票,上下文才是日常开销——这笔账现在有了跨显卡的实测数字。

一、先修正一笔老账:16G为什么居然"够得着"256K
很多人对27B显存的印象还停在"54GB FP16、起码24G卡"的全注意力算术上。Qwen3.8-27B是混合注意力架构:64层里只有16层真正做KV缓存,另外48层是线性注意力(GDN),只带固定大小的状态。这是两篇独立实测(4060Ti KVMem文、5090 262K文)互相印证的架构事实,不是配置省出来的。知乎
于是长上下文的显存可以完全公式化。每个token在KV上有 16层×4个kv_head=64个位置,head_dim 256。不同精度的"每位置字节数"有实测锚点:FP8=516B、K8V4=402B、NVFP4=288B——5090作者拿bench结果校验,三档全部零偏差。用法就是把"每token字节数×上下文长度"当乘法做:知乎
精度档 | 163,840 token 的KV占用 | 拉满262,144 |
|---|---|---|
BF16 | 10.62 GiB(加22.09GiB权重,32G卡物理装不下) | — |
NVFP4 | 2.81 GiB | 4.50 GiB |
同一公式在4060Ti上换个写法也能对上:256K上下文的KV,全精度约16GiB、q4_0量化后约4GiB——这才是16G卡"够得着"的真正原因。知乎
但注意那个物理结论:32G卡想跑满上下文,KV量化不是优化项,是必需项。知乎

二、一周跨卡实测:同一颗模型,各家"上下文天花板"差在哪
把这一周各平台的实机数据摆在一起(均为作者自测、口径不完全一致,看量级别看绝对值):
设备 | 权重方案 | 实测上下文 | 速度表现 | 主要代价 |
|---|---|---|---|---|
4070 12G | LowGPU NoMTP IQ3(9.5GB) | 64K,余量约400MiB | prefill 787 t/s,decode 23.6 t/s | 放弃MTP、弃ollama转llama.cpp |
4060Ti 16G | IQ3_S 11.3GiB+MTP头 | MTP开启时原生仅96K;KVMem方案逻辑256K | 原生33 t/s档,KVMem再慢10–20% | MTP多占1.5GiB;预发布引擎 |
2×V100(系列博客) | Q4_K_M 16.4GB+MTP草稿1.37GB | 单卡顶格256K,384K即OOM | KV q8_0后单流33.3→45.2 t/s;双卡聚合84–109 t/s | 官方预编译缺失需自编译 |
3080 20G | vLLM | 256K | prefill约1500 t/s,MTP3单发约60 t/s | 折腾参数 |
7900XTX 24G | GGUF(Vulkan+MTP/ROCm多方案) | 方案指南级 | 社区目录实测 | A卡驱动栈文档 |
5090 32G | NVFP4 21.7GiB | 拉满RoPE硬上限262,144 | 长上下文decode反而+7.6% | KV量化质量代价待验 |
这张表最反直觉的一行是16G内部:同样是16G卡,一位作者开了投机解码,上下文就只能给到98304(96K),再往上"不是加载失败,就是一算就崩"。另一位用Q4_K_M+KV q8_0,把256K跑到了单流44.7–48 tok/s。差距不在卡,在KV精度档和引擎组合。知乎知乎
三、三个实测互相打架的地方,恰是最容易踩的坑
① "256K"是逻辑上限,不是你单次prompt的上限。 4060Ti那篇给了很难反驳的细节:换KVMem方案后,5.95万token的prompt稳定通过,12万token必崩——日志显示prefill以450 t/s全速跑完了266秒,在切换到解码阶段需要重新分配图缓冲时失败,因为16G卡当时只剩500–600MiB余量。同一个方案还有代码级暗坑:–kvmem-gen-reserve 官方配方建议16384(包含思考token),但该参数代码默认值是256——不显式设置,每轮只能生成256 token,很多人"模型变笨了"其实是撞在这里。知乎
② KV量化的速度收益,跨引擎不能搬,方向都会反。 5090作者翻到llama.cpp资料写着:KV量化到4 bit,decode慢37%~92%。而他本机NInfer实测:长上下文(32K以上)decode反而快7.6%,8K短上下文还慢2.2%,拐点在16K~32K之间;原因也不是省带宽,而是KV精度改变了生成轨迹、把投机解码接受率抬高了7.2个百分点。他的原话值得裱起来:跨引擎的KV量化数据不能迁移,方向都可能反过来——要么自己测,要么承认在猜。知乎
③ 困惑度看不见的任务级崩塌。 换NVFP4 KV的代价:困惑度+0.90%,看着无害。但作者同时引用了一条他未能验证的记录:Qwen在q4_0下工具调用正常、但长文档能力恶化近七倍——说明损害可能集中在特定任务上,而困惑度看不出来。他的处理是诚实的:明确标注未验证,换档后要用你自己的真实长文档任务抽验。这条"待验证"也放进下面的观察清单。知乎
补一个Windows用户的隐藏账: 显存贴线时WDDM会静默把分配换页到系统内存(PCIe约32GB/s量级,比显存带宽低一到两个数量级),不报错、不OOM、不弹窗——只是突然变慢。5090那篇标题动作"把显示器插到核显上",本质是花一根线买回1.42GiB,把262K拉满后的余量从0.96GiB抬回2.38GiB——买的不是性能,是不掉进退化区的确定性。顺带两个辟谣:任务管理器显示"32G卡只有31.5G可用"是驱动与WDDM保留区,不是被核显抢了;WSL/Docker用户看到的vmwp大额占用是GPU-PV直通的推理进程本身,拔显示线不会少。知乎

四、对号入座:你的卡开多少上下文、要不要花钱
按这一周的实测数据,把常见档位拆开说(判断原则只有一个:先量你真实会话会喂到多少token,再反算显存,不要为"256K"三个字付钱):
8G及以下:社区共识是别折腾27B接agent。8GB以下的显存或内存,勉强跑起来体验也很差,不如直接用云端;日常问答用7B/9B档,行内补全1.5B小模型反而顺滑。知乎
12G(如4070):ollama默认档接不住系统级代码任务——这位用户挨个试过8B/9B小模型,Qwen3-8B能力不够、Agent也不行,最后换llama.cpp+低显存量化,才把64K上下文塞进12G卡、余量约400MiB。知乎
16G:纯聊天8K–32K绰绰有余;要接Agent/RAG,Q4_K_M/Q4_0档KV+128K是甜点,256K能到但别同时开MTP;KVMem这类"内存换显存"方案目前是预发布、慢10–20%、单轮生成有硬上限,观察即可不必上。
20–24G(3080 20G/4090/7900XTX):256K从容,重点转向引擎选型:3080 20G上vLLM已经能做出prefill约1500 t/s、256K、MTP3单发60 t/s的成绩。llama.cpp这边则吃上下文弹性,B站双16G入门党的"六个坑"实录适合对照着走。哔哩哔哩哔哩哔哩
32G(5090):拉满262K需要NVFP4 KV+核显线两件套;只是偶尔喂到几万token的话,开65K或131K,能白省2~4GiB余量。
Mac统一内存:M5 Max上Qwen3.8-27B最高可达144 tok/秒、LM Studio首日支持,但Mac的统一内存要打折算——标称16GB不等于有16GB给模型用,开着IDE、浏览器、Docker再常驻一个27B会很吃力。知乎

五、这笔账的走向,以及值得收藏的观察清单
风向数据有两个交叉印证。一是采用度周报(覆盖9月13–20日):Qwen3.8-27B的HF主权重近30天下载量772.7万→736.5万,环比-4.7%,作者口径写得清楚——装机面在降温,调用面在涨;同期另一份周报提到,官方两条权重渠道里NVFP4这七天几乎翻倍。也就是说,新鲜感装机的浪潮过去,留下的正是每天真用、会被上下文咬到的这批人。二是架构端在从源头解这个题:小米MiMo负责人发文预告V3将采用新架构HySparse2,瞄准越来越重的Agent场景输入。一篇直接移除传统注意力瓶颈的单作者论文也在中秋前后空降AlphaXiv热榜第一。"带KV的层数"正在被一代新架构主动砍。知乎小红书小红书
接下来一个月,这四个信号值得盯:
KVMem这类"主机内存放KV、显存只留工作窗口"的方案何时转正、有无第三方长文档质量复测——官方宣称"近乎无损"的那组自评(LongMemEval-S 85.6% vs 86.6%),目前还只是官方口径。知乎
双V100博客那组"256K极限/384K OOM"数字在别的卡上能否复现——单卡Q4_K_M的上下文极限是256k(=训练长度,无溢出警告),384k以上直接OOM。知乎
已官宣在训练的Qwen4-27B是否延续混合注意力比例——延续,则今天这套KV公式直接复用;
"q4档长文档能力恶化七倍"传闻是否被验证;验证前,任何量化档换完都用真实长文档抽测。
收个尾:27B的权重是一次性投入,上下文是每天的成本。下次想花钱升级硬件之前,先把这一周各卡型的实测余量对一遍——"能跑"和"能用"之间,隔的往往不是显卡,是一档KV精度和一行reserve参数。
(本文各显卡数据均为原作者公开实测自述,口径与驱动版本不一,复现请以自己机器为准;引用信源见角标。)