Qwen3.8-27B刚发布,7900 XTX已经跑到65 tok/s:A卡吃新模型前,先看清这4条路线

源自128位全网作者

11:20

Day-0 这次真的成了常态

Qwen3.8-27B 八月中旬发布,AMD 官方在发布当天就把它列进了 Day-0 支持名单,官方部署指引直接面向 Radeon 显卡与 Ryzen AI Max 平台。哔哩哔哩七月底,2.8 万亿参数、100 万 token 上下文的 Kimi K3 同样是 Day-0 级支持。知乎这个月社区里又有人把全模态视频模型 MiniMax H3 在 24G 显存的卡上跑通了。小红书对 A 卡本地推理用户来说,“新模型发布等半年适配”已经是老黄历,现在的新模型发布日就是上手日。

Qwen3.8-27B刚发布,7900 XTX已经跑到65 tok/s:A卡吃新模型前,先看清这4条路线

模型发布不到 48 小时,社区就给出了现成方案:基于 llama.cpp 深度调优 A 卡的 ROCmFPX 项目放出了 7900 XTX 专用一键整合包,打包了 ROCmFP4 量化、MTP 多 token 投机和 kvturbo 加速。作者把环境要求写得明明白白:Ubuntu 24.04.1 或相同内核的 Linux 系统、装好 ROCm 7.14、显卡是 7900 XTX,其它环境不做任何保证。哔哩哔哩

实测数字:上限很高,但别当日常速度

目前最亮眼的成绩单来自社区用户在 WSL Ubuntu 下的实测:ROCmFP4 量化加 mtp4 投机,prefill 724.97 tok/s,生成 65.57 tok/s,这张 24G 卡是他在闲鱼 4600 元收的。哔哩哔哩另一位用户测得 Q5 量化、128K 上下文下 55 tok/s。哔哩哔哩

Windows 端也有答案:有人重新编译后平均 47.4 tok/s,上下文总长能开到 262,144;Q5 量化在 Windows 下能跑到 50~70 tok/s。哔哩哔哩

不过跑分和长时间运行是两回事。有人连续跑了 40 分钟,速度稳定在 28 tok/s 上下,整合包作者的回答很直白:长上下文加 MTP 设置影响,这个数也算正常,“现在标榜测试的都很鸡贼,只标一开始那时的最高输出”。哔哩哔哩看峰值找兴奋点,看持续速度定日常预期,两个都看才不吃亏。

Vulkan 和 ROCm 的胜负,两个月就反转

一直关注 A 卡推理的人,应该记得五月那个著名案例:有人在 Windows + 7900 XTX 上跑 Qwen3.6-27B,本来以为 AMD 跑大模型肯定要靠 HIP/ROCm,结果他那台机器上 Vulkan 反而明显更快——ROCm 后端 prefill 只有约 210 tok/s、decode 21~23,Vulkan 则做到 prefill 约 660、decode 55~60+,帖子标题直接问“Vulkan 赢了?”。小红书到了八月中旬,Qwen3.8 实测视频的评论区里有人重新在 Windows 上测:ROCm 的预填充速度反而比 Vulkan 快 30%~50%,解码差距不大。哔哩哔哩别忘了 ROCm 版本本身也在快速迭代:有人对比 ROCm 7.2 和 7.13 两个版本,Qwen3.6-27B 的预处理速度暴涨 3 倍。哔哩哔哩在这个圈子里,排名是有保质期的,而且保质期越来越短。

Qwen3.8-27B刚发布,7900 XTX已经跑到65 tok/s:A卡吃新模型前,先看清这4条路线

四条路线,按系统和折腾意愿选

ROCm 原生(Linux / WSL2):目前上限最高的路线,ROCmFPX 整合包为 7000 系深度调优了 ROCmFP4 量化和 MTP 投机,但作者明确说当前版本只适用 7000 系显卡,其它型号得自己拉源码编译量化。哔哩哔哩

Vulkan(LM Studio / llama.cpp):Windows 用户最省心的路线,装上就能用。想在 Windows 走 ROCm 路线的,可以直接编译 ROCmFPX 的 Windows 移植项目,前提是装好 HIP SDK,可能会踩坑。哔哩哔哩

Ollama:先避坑。它对 A 卡用户有三大致命痛点:投机采样无入口、FA 只有全局变量、WSL 会静默切 CPU 推理;有人的机器因此只跑出个位数速度,卸载 Ollama 换 LM Studio 后同一台机器直接到 60 tok/s。哔哩哔哩

多卡与混插:不满足于 24G 显存的,已经有人探路了。3090+3080+R9700×2 四卡混插跑 CUDA+ROCm 混合推理,预处理速度提升约 2.5 倍。哔哩哔哩也有人直接上双 7900 XTX:Z790 HERO 主板支持双 PCIe 插槽直通 CPU、通道拆分,配 2000W 电源,Ubuntu 24.04 下用 Ollama 跑 35B 模型大概 50 tok/s。小红书

坑位清单,都是社区实测出来的

  • MTP 接受率会随长对话下降:有实测接受率只有 0.59,输出速度自然上不去,持续速度大概率低于跑分。哔哩哔哩

  • Prefill 随上下文衰减:社区反馈初始 1000 tok/s 左右,100K 上下文时大概 500,接近 200K 降到约 200。哔哩哔哩

  • 显存悬崖:128K 上下文要吃掉 22.8GB 显存外加共享显存,decode 从 55~60 掉到 41 tok/s,能跑但不建议默认开满,日常 50K~64K 是更经济的档位。小红书

  • Windows 环境变量多:社区的统一经验是 A 卡日常用 AI 建议装 Linux,有人在 Windows 下用 LM Studio + ROCm 跑模型经常死机。哔哩哔哩

Qwen3.8-27B刚发布,7900 XTX已经跑到65 tok/s:A卡吃新模型前,先看清这4条路线

价格:4600 的成交和“涨得不想买”的吐槽并存

这两天的价格信号有点分裂。一边是跑分用户 4600 元闲鱼收卡上车(前文已提),另一边“7900xtx 涨得不想买了,现在琢磨 3080*2”这样的吐槽开始出现。哔哩哔哩本地推理需求确实在抬高这张上代旗舰的身位,甚至有硬核玩家已经装了两张在一台机器里。我的判断:手里有卡的直接部署 Day-0,零成本;准备买新卡又看到溢价的,别追,这一波涨价是情绪和话题推起来的,卡不会消失,合理价位总会有。

Qwen3.8-27B刚发布,7900 XTX已经跑到65 tok/s:A卡吃新模型前,先看清这4条路线

大背景:生态在补短板,差距也还在

ROCm 这波势头是实打实的。ROCm.AI 在 Advancing AI 2026 大会首度亮相,将 AI 辅助开发、智能部署与 AI 驱动的软件优化融为一体,覆盖从云基础设施到 AI PC 的全线平台。知乎Anthropic 官宣了 2GW 的 AMD Helios 算力部署计划,还披露一名工程师让 Claude 周末自行运转,完成了 MI355 芯片与 ROCm 平台的全套适配与性能调优(媒体报道)。微博但差距也是真的:技术频道对 CUDA 13 与 ROCm 7.14 的深度对比里,GPU 白名单限制、Linux 安装噩梦、Windows 生态缺失依然是痛点清单上的前几名。哔哩哔哩对本地玩家翻译一下:环境每个月都在变好,但路线还得自己挑。

谁该动手,谁该等

  • 手里有 7900 XTX:直接上 ROCmFPX 整合包(Ubuntu 24.04.1 + ROCm 7.14),Day-0 跑 Qwen3.8-27B,成本是一晚上折腾时间;

  • Windows 不想折腾的用户:先走 LM Studio 的 Vulkan 路线,同时观望 ROCmFPX Windows 移植项目的进展;

  • 9070 XT 和其它 A 卡用户:整合包暂不保证,盯 ROCmFPX 仓库更新,或把源码扔给 AI 帮你编译一版;

  • 准备买卡的:不追高,盯三个信号——整合包的显卡覆盖范围、AMD Day-0 模型名单的长度、Ollama ROCm 版本补上投机采样入口的进度。

A 卡本地推理现在是月月更新的节奏,今天的坑可能下个月就修好,今天的溢价也可能下个月回落。与其押注单个时间点,不如把信号记下来,等合适的时候再动手。

内容由AI生成

精选参考来源

1. Run Qwen 3.8 27B on AMD Ryzen AI Max and Radeon Graphics Cards Day-0

2. AMDGPU跑Qwen3.8-27B性能效果实测

3. 7900XTX打开Qwen3.8-27B的正确方式。使用ROCm才是最舒服的。全网首发7900xtx专用加速一键整合包,有详细测试。

4. ROCmFPX(llama.cpp 的 A 卡调优分支)

5. 同一台机器速度5变60,我只是卸载了Ollama|AMD本地大模型全网教程纠错实录

6. 7900XTX跑27B,Vulkan赢了?

7. AMD ROCm 为 Kimi K3 提供 Day-0 生产级开源部署支持

8. ROCm.AI 正式发布:智能体 AI 工作流,化繁为简

9. 【一周末打通AMD全套适配:#Anthropic#用Claude自举而非英伟达硬件,打破CUDA“人力壁垒”】Anthropic不仅官宣了2GW的AMDHelios算力部署计划,还披露,一名工程师让Claude周末自行运转,完成了AMDInstinctMI355芯片与ROCm平台的全套适配与性能调优,周一便拿到了Anthropic领先模型在该硬件上“周末...全文

10. 3090+3080+R9700*2混插跑大模型实测!CUDA+ROCm混合推理,预处理速度直接起飞2.5倍!

11. AI 本地跑模型双7900xtx 48G显存跑35B模型

12. CUDAvsROCm深度对比:为什么AMD显卡跑AI大模型处处受限?|CloudCodes

13. ROCm7.13让A卡起飞!Qwen3.6-27B预处理速度暴涨3倍,CUDA竟成瓶颈?|N卡A卡混合推理深度实测

14. 白嫖AI视频创作MiniMaxH3官方工作流,AMDGPU一键部署加手把手教学

15. 7900 XTX,把 MiniMax H3 本地跑通了

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章