当前位置:
AIGC文章详情

Qwen3.8-27B 开源第一周:有人 A 卡跑 65 tok/s,有人只有 28,差的不全是卡,是路线

源自158位全网作者

08:02

8 月 14 日 Qwen3.8-27B 开源,同一天 AMD 官方博客挂出了 Day-0 支持文章。接下来这一周,A 卡圈子基本就在一件事:把这个 27B 跑起来。B 站上 7900XTX 的一键整合包视频几天破 7000 播放,评论区晒速度的、吵 ROCm 和 Vulkan 谁快的、问 16G 显存能不能上的,排着队来。

如果你手里正好是一张 24G 的 A 卡,或者正犹豫要不要为本地大模型补一张卡,这篇文章把你最需要的三件事一次说清:这模型值不值得跑、各路线真实速度是多少、那些互相矛盾的速度帖到底该信哪个。

这代 27B,第一次把"前沿能力"塞进单卡 24G 的讨论范围

先说为什么这周值得折腾。Qwen3.8-27B 是个 270 亿参数的稠密模型,原生支持图像和视频理解,上下文 262K,Apache 2.0 全开放,代码评测在 SWE-bench Verified 拿到 72.4 分、LiveCodeBench v6 拿到 80.7 分。知乎能力上,Artificial Analysis 的 Intelligence Index 给它打了 52 分——和 GPT-5.6 Luna 同分,只比 DeepSeek V4 Pro、GLM-5.2 的 53 分低 1 分。知乎知乎上有人把这件事叫"模型斩杀线":一个能本地跑的开放权重模型,第一次摸到了前沿闭源模型的区间。

对 A 卡用户更实际的是体积账:BF16 全精度权重约 54GB,听起来还是劝退,但 4-bit 量化后权重只有 13.5GB 上下,算上 KV Cache 和运行时开销,24GB 显存第一次成为"认真可讨论"的门槛。知乎这也是为什么 AMD 官方 Day-0 文章直接把舒适线划在 24GB 以上,而 7900XTX 恰好踩在这条线上。AMD 官方博客

Qwen3.8-27B 开源第一周:有人 A 卡跑 65 tok/s,有人只有 28,差的不全是卡,是路线

官方和三个社区的速度,放一起看差接近 3 倍

这周我汇总了官方博客和 B 站、知乎、小红书上能对上口径的实测,全是解码(生成)速度。AMD 官方 Day-0 数据基于 Windows + llama.cpp Vulkan 后端初测:Radeon AI PRO R9700 32G 最高 51.8 tok/s,Ryzen AI Max+ 395 最高 24.5 tok/s。AMD 官方博客

Qwen3.8-27B 开源第一周:有人 A 卡跑 65 tok/s,有人只有 28,差的不全是卡,是路线

社区这边:7900XTX 在 Linux/WSL 下用 ROCm 7.14 + FP4 整合包(ROCmFPX),有人跑出解码 65.57 tok/s、预填充 724.97 tok/s,上下文开到 150K 还带视觉。哔哩哔哩另一路 llama.cpp 调优(KV Q4 + MTP)的 7900XTX 报 53 TPS;48G 的 W7900 单卡 ROCm 开 MTP 是 41.3 tok/s,不开加速的基线只有 29.4。小红书

路线 / 硬件

解码速度(tok/s)

口径

7900XTX 24G · ROCm 7.14 + FP4 整合包(Linux/WSL)

65.6

社区实测,150K 上下文 + 视觉 + MTP4

7900XTX 24G · llama.cpp 调优(KV Q4 + MTP)

53

社区实测,短上下文

R9700 32G · 官方 Day-0(Win11 Vulkan,MTP=2)

51.8

AMD 官方初测

7900XTX 24G · Win11 Vulkan(NVFP4/Q4)

40–50

社区实测稳定区间

W7900 48G · ROCm + MTP

41.3

社区实测

W7900 48G · ROCm 基线(未开加速)

29.4

社区实测

7900XTX 24G · 长上下文连续输出 40 分钟

28

社区实测,衰减后

Ryzen AI Max+ 395 · 官方(Win11 Vulkan,MTP=4)

24.5

AMD 官方初测

一眼看去矛盾就来了:同一张 7900XTX,凭什么有人 65、有人 53、还有人连续跑 40 分钟长上下文任务后掉到 28?

速度帖互相"打脸",其实四个变量在起作用

把帖子按测试条件拆开,差距就解释得通了,基本是四个变量。一是上下文长度:有玩家连续跑两小时任务,后期只剩 10 几 tok/s,也有人跑 40 分钟长上下文后稳定在 28 t/s,而同一张卡跑 27B 短任务能到 36+ t/s。哔哩哔哩知乎评论区一句大实话:"标榜测试的都很鸡贼,只标一开始的最高输出。"所以 65 和 28 可以同时为真,一个是短上下文峰值,一个是长任务稳态。

二是量化。FP4、Q4、Q8 KV 各差一档,显存占用和速度一起变。三是 MTP(投机采样),这是社区整合包和官方设置共同强调的提速开关,llama.cpp 教程里也把它列为三大提速项之一。哔哩哔哩AMD 官方还特意注明 draft 数要开对:Ryzen AI Max+ 设 4、Radeon AI PRO R9700 设 2。AMD 官方博客开没开、开对没开,速度差 30% 以上。四是测速方法:默认 8K 短上下文的测速工具,跑出来的数字天然比真实使用高。

理解这四条,再看任何速度帖都不会上头:先问上下文多长、什么量化、开没开 MTP,再决定要不要信。

路线怎么选:Linux ROCm、Windows Vulkan,还是先别买卡

手里有 7900XTX、能接受 Linux 或 WSL 的话,目前社区跑分最高的是 ROCm 7.14 + FP4 整合包这条线,262K 级上下文和视觉都能开,代价是要把环境装稳——整合包作者写明的环境要求是 Ubuntu 24.04.1 或相同内核系统、装好 ROCm 7.14。哔哩哔哩注意这个包目前基本只保 7900XTX,其他卡要自己改启动脚本。

纯 Windows、不想折腾系统,就走 LM Studio / llama.cpp 的 Vulkan 后端,AMD 官方 Day-0 数据也是这条路,稳定省心。两个官方设置别漏:MTP 开对 draft 数;高级设置里取消勾选 Try mmap。AMD 官方博客成本也要清楚:Windows Vulkan 目前社区实测上下文只稳到 128K(KV Q8),多模态投影要走 CPU;但它的速度并不难看,NVFP4 模型稳定 40–50 t/s,官方 Q4 跑 100K 上下文也有 35–40 t/s。哔哩哔哩

Qwen3.8-27B 开源第一周:有人 A 卡跑 65 tok/s,有人只有 28,差的不全是卡,是路线

只有 16G 显存(9070XT、9060XT 这类):能跑,但要 Q4 + KV 量化、上下文收着用,别按 24G 的预期要求自己,官方原话是 24GB 才"舒适"。还没卡、想买一张追这波的话:二手 7900XTX 已经被这波行情抬到 4600 元上下,评论区已经有人转头研究双 3080。哔哩哔哩为模型追高买卡,先想清楚你要的是峰值速度还是长期可用性。

接下来盯三个信号

ROCm 这边,7.14 的已知问题修复节奏是一条主线;另一条是 vLLM 在 8 月初补上了 AMD ROCm 模型适配和三路位置编码输入,这条路径什么时候成熟到生产可用,决定了 A 卡在服务场景的上限。小红书推理侧则看 DFlash 2 这类新投机解码在 A 卡上的落地速度——W7900 上它和 MTP 打平(41.6 vs 41.3),但在长 prefill 场景还有空间。

一句话收尾:Qwen3.8-27B 这代模型,24G A 卡用户是真正被照顾到的人;但跑分帖看看就好,选对路线、设对 MTP、管好上下文,才是把 65 tok/s 变成日常体验的全部秘密。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章