全网晒Qwen3.8速度:5090跑190,8年老V100跑出59,差的不只是显卡

源自45位全网作者

02:59

过去半个月,本地推理圈子最热闹的固定节目是晒 Qwen3.8 的 tokens/s。知乎上有个问题直接变成了跑分现场:"关于QWEN3.8-27B,大家的速度都是多少tokens/s?“评论区画风非常分裂:有人 5090 单并发跑到 190。知乎也有人把一台服役 8 年的双 V100 老服务器拉到单流 59.3、并发 220。同一代模型,速度差出将近 10 倍,先别急着怀疑自己的卡。把这两周知乎、B站、GitHub 讨论区的 20 多组实测对完一遍之后,结论其实很清楚:差距主要不写在显卡上,写在三个地方——你在跑哪个"Qwen3.8”、用的哪个引擎、量化和卸载怎么配的。

第一件事:你说的"Qwen3.8",其实是两个脾气完全不同的模型

这是现在跑分混乱的最大来源。8 月 14 日阿里先开源了 Qwen3.8-27B,8 月 26 日又开源了 Qwen3.8-Flash(权重命名 Qwen3.8-Flash-Next),两者虽然同属一代,硬件账却是两套算法。

Qwen3.8-27B:稠密 27B,BF16 权重 54.7GB,混合注意力架构——64 层里只有 16 层全注意力产生 KV cache,其余 GDN 线性注意力的状态恒定、不随上下文增长,所以长上下文的显存账不能套纯 Transformer 公式。知乎GGUF 里内嵌 MTP 头,带多模态,Q4 量化后 24GB 显存级别的卡就能装下,是目前晒速度大赛的绝对主角。

Qwen3.8-Flash-Next:Qwen4 架构的预览版,125B 主模型外挂 51B 的 N-gram 嵌入模块,每个 token 只激活约 6B 参数,MoE 共 512 个专家取 top-10,原生 262K 上下文,可经 YaRN 扩到 1M。知乎官方定价每百万 token 输入 1 元、输出 3 元,训练成本比上一代 Qwen3.7-Plus 降了约九成。知乎它对标前沿闭源模型的能力,但对本地部署者真正的意义是:这是一个单卡绝对装不下(光 4bit 就要 90GB+)、必须靠卸载策略才能跑起来的模型。

开源协议也值得一句说清:27B 是 Apache 2.0,Flash-Next 采用 Qwen 社区许可证,允许免费商用,但如果你要做模型即服务(MaaS)或 AI 办公助手类业务,需要另行获得授权。魔搭社区

全网晒Qwen3.8速度:5090跑190,8年老V100跑出59,差的不只是显卡

一句话记住:27B 是"显存够不够"的问题,Flash-Next 是"卸载策略会不会配"的问题。拿 27B 的速度去预期 Flash-Next,或者反过来,都会得出离谱的结论。

全网实测汇总:各档位硬件的速度都在这了

按硬件档位整理这两周社区晒出的代表性数字(均为社区自测,配置不同,只可参考量级)。

旗舰消费卡跑 27B:

  • RTX 5090:NInfer 引擎 + NVFP4 量化 + MTP,180K 上下文下 120~150 t/s。知乎

  • RTX 5080:约 40 t/s。

  • 双 3090 + vLLM FP8:可开 256K 上下文。

统一内存阵营:

  • AMD Ryzen AI Max+ 395(128GB 笔记本):27B Q4_K_M,decode 约 23.31 t/s,prefill 221~272 t/s。知乎

  • DGX Spark(128GB 统一内存):跑 Flash-Next 约 22~25 t/s,是目前把"专家卸载 + n-gram 走 NVMe"方案做得最完整的平台,已有专门的可复现仓库。

  • M5 Max 128GB:Flash-Next IQ4_XS,空上下文 33 t/s,满 262K 上下文掉到 10.9 t/s;M1 Ultra 128GB 约 20 t/s。知乎

全网晒Qwen3.8速度:5090跑190,8年老V100跑出59,差的不只是显卡

老卡整活区(本次最大惊喜):

  • 双 V100S-32GB(8 年机龄):1Cat-vLLM(vLLM 的 SM70 特化 fork,683 星)跑出单流 59.3 t/s、并发 220 t/s、256K 上下文,FP8 权重 30.9GB;同一台机器用 llama.cpp Q6_K 单卡只有 12.18 t/s,双卡开 MTP 后提到 46 t/s。知乎

  • 4 卡 V100 NVLink 整机:B站作者用 1Cat-vLLM 1.5.0 跑 27B NVFP4,称输出处可达 280 t/s。哔哩哔哩注意这是四卡 NVLink 满配环境的数字,别按单卡理解。

  • 单张 4090 跑 Flash-Next:专家层卸载到内存后普遍 15~20 t/s,想到 40+ 要双卡分层或 96GB 大显存卡;AMD 7900 XTX(24GB)+ 64GB 内存开 MTP 投机采样,稳态也有 20.1~22.8 t/s。哔哩哔哩

全网晒Qwen3.8速度:5090跑190,8年老V100跑出59,差的不只是显卡

同一张卡差几倍,小字写在这三处

引擎比想象中大。 vLLM 主线目前对 Qwen3.8 并不友好:GGUF 解析走 transformers 白名单,里面没有这一代架构,官方 AWQ/GPTQ-Int4 也还没放出。知乎双 V100 那台机器在主线 vLLM 上三连败——启动卡死、Triton autotuner OOM、量化包 404,最后是一个 683 星的特化 fork 救的场。N 卡新卡这边,NInfer 的 NVFP4 路线是目前 5090 上跑 27B 最快的组合之一,Mac 上也刚有 MTP-LX 这样的专项加速分支冒头。选模型之前,先确认你的卡有没有"对的引擎"。

MTP 是免费的速度,但不是无脑的速度。 Qwen3.8 的 GGUF 内嵌了约 105MB 的 MTP 头,开对参数,llama.cpp 路线能从 26 t/s 提到 46 t/s 这个量级。但 MTP 不是所有引擎都支持,收益也看场景:有 UP 主在 MLX 上实测,1K、4K、16K、64K 四个上下文点位,开 MTP 单请求生成全部更快,可切到连续批处理后,2 路总吞吐下降 20.2%,4 路下降 10.8%。哔哩哔哩看到别人晒的速度,先问一句"开 MTP 了吗、单流还是并发"。

老卡和 Flash-Next 各有陷阱。 没有 NVLink 的老卡做张量并行是纯负收益——层间通信走 PCIe/UPI 只有 10~20GB/s,对比 HBM2 的 900GB/s,双 V100 实测张量切分比层切分更慢,记住"老卡只切层"。而跑 Flash-Next 的标准姿势已经被社区验证收敛:专家层甩到 CPU 内存,51B 的 n-gram 表单独 mmap 到 NVMe。知乎这块"外挂记忆"本质是查找表,放盘上对速度的伤害,远小于把它塞进内存挤爆显存。

买卡还是调 API:这笔账现在很好算

Qwen3.8-Flash 的官方定价摆在这:每百万 token 输入 1 元、输出 3 元,免费商用。按重度使用每天 1000 万输出 token 算,一个月也才 900 元上下。所以对大多数人,结论很简单:想要 Flash-Next 级别的能力,直接用 API;为了跑它去买卡,大概率是负收益——除非你要的是私有化、离线、无限并发这三样里的至少一样。

全网晒Qwen3.8速度:5090跑190,8年老V100跑出59,差的不只是显卡

27B 的账不一样。它 Q4 装进一张 24GB 卡就能长期免费私有使用,对把本地模型当 Copilot、喂私有代码和文档的人,一张中高端卡几个月就回本。至于 V100 这类老卡,59 t/s 很浪漫,但那是给已有机器的人准备的整活路线,专门去买二手老卡跑推理,电费、稳定性和折腾时间都要算进去。

接下来值得盯的三个信号

  1. vLLM 主线何时原生支持 Qwen3.8:GGUF 架构白名单和官方 AWQ 什么时候补齐,补齐后 fork 们的红利会收窄,引擎格局会重排一次。

  2. MTP 生态成熟度:从 llama.cpp 到 MLX,各引擎的 MTP 支持还在快速迭代,同一张卡的速度上限大概率还会涨。

  3. 价格战的另一边:8 月 26 日和 Qwen3.8-Flash 同天发布的还有 GLM-5.3-Flash——此前匿名登顶海外榜单的 OxAlpha 真身。知乎DeepSeek-V4-Flash 也在同一轮降价周期里。本地跑不跑是一回事,API 端"免费商用 + 白菜价"的底线被这一代模型集体拉低,是所有用 API 的人都能直接享受的红利。

最后提醒一句:社区跑分全是各家自测,量化版本、上下文长度、是否开 MTP 都会让数字翻倍或腰斩。抄作业之前,先核对配置;晒成绩的时候,把配置带上——这大概是这两周 Qwen3.8 跑分现场教会我们的最重要的一件事。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章