AMD Day 0支持Qwen3.8-27B,7900XTX实测55 tok/s:A卡玩家想冲“本地Opus”,先看清这张显存档位表

源自6位全网作者

01:10

8月14日晚,阿里把Qwen3.8-27B的权重丢上了Hugging Face。270亿参数、稠密架构、原生多模态、Apache 2.0协议,262K上下文还能外推到1M,跑分直接跟DeepSeek V4 Flash、GPT-5.6 Luna Max坐一桌。知乎知乎海外开发者的评价简单粗暴:“本地版Opus”。知乎

AMD Day 0支持Qwen3.8-27B,7900XTX实测55 tok/s:A卡玩家想冲“本地Opus”,先看清这张显存档位表

但这条新闻对A卡玩家的意义,比对N卡用户大得多。就在今天(8月18日),AMD官宣给Qwen3.8-27B提供Day 0支持——模型发布第一天,就能在AMD硬件上本地跑起来。知乎

要知道,过去A卡在本地大模型圈是什么待遇:新模型发布,CUDA那边教程都卷出三轮了,ROCm这边还在"等适配"。这次AMD能把支持做进Day 0,关键不是ROCm突然给力了,而是路线变了:官方给的方案是llama.cpp + Vulkan后端,Windows上直接就能跑,不依赖ROCm那套环境。知乎评论区有人问"为什么不用ROCm",跑过测试的人答得很直白:Windows上ROCm缺胳膊少腿,正经工程才上Linux。哔哩哔哩换句话说,AMD这次是把"A卡跑AI"的门槛从"装一套Linux环境"降到了"装个LM Studio"。

先看大家最关心的:我的A卡到底能跑多快?

把官方数据和社区实测放在一起看(注意各家条件不同,别直接横比):

硬件

测得速度

条件

来源

Radeon AI PRO R9700 32GB

最高51.8 tok/s

Win + llama.cpp Vulkan,MTP=2

AMD官方

RX 7900 XTX 24GB

55 tok/s

Q5量化、128K上下文

B站用户实测(附完整参数)

锐龙 AI Max+ 395

最高24.5 tok/s

Win + llama.cpp Vulkan,MTP=4

AMD官方

RX 9060 XT 16GB

能跑,但要降到Q3_K_M

Q4会爆显存

社区实测反馈

两个信息量很大的细节:R9700的prefill 512能到919.7 tok/s,说明长文档喂进去不卡;而7900XTX这个55 tok/s,是在开着128K上下文的前提下跑出来的,日常用完全够看。哔哩哔哩

AMD Day 0支持Qwen3.8-27B,7900XTX实测55 tok/s:A卡玩家想冲“本地Opus”,先看清这张显存档位表

但先别急着下载。这几天社区高强度实测下来,这模型的坑非常具体,而且几乎每个都跟你的显存和设置有关:

1. MTP不是可选项,是必选项。 Qwen3.8-27B的思考链非常长,不开MTP(多token预测投机解码),有用户实测输出只有40多 tok/s,一个任务等二十分钟;开了MTP=2之后直接到60~80 tok/s。哔哩哔哩AMD官方也特意标注:AI Max+平台MTP设4,R9700设2。知乎不开MTP跑这模型,等于自罚一倍。

2. LM Studio里记得取消勾选"Try mmap"。 这是AMD官方文档里专门点名的设置,很多人装完就开聊,速度不对就是因为漏了这一步。知乎

3. 显存档位决定量化版本,硬上会爆。 24GB显存(7900XTX、9070XT这个级别)跑Q4/Q5比较从容;16GB的9060XT跑Q4会爆显存,得降到Q3_K_M,而Q3基本被社区认为是"能用的底线"。哔哩哔哩官方给的门槛是"24GB可变图形内存或显存",这个数字不是随便写的。知乎

4. 24G显存还有一笔隐形账:上下文和MTP二选一。 有4090D(24G)用户实测,想跑64K上下文,就得在关闭MTP和关闭视觉功能里选一个。哔哩哔哩想要"长上下文+MTP+视觉"全都要,32GB起步。

5. 思考强度别拉满。 这代模型默认思维链很长——有用户一个计算线段距离的小问题等了30分钟、烧掉50K上下文。哔哩哔哩社区公认的最优解是把reasoning_effort设为medium:新版llama.cpp可以直接设参数,LM Studio可以改chat template。思考不能完全关,关了效果掉档,medium是质量和速度的平衡点。

再说说反方观点,免得只看官方通稿上头。B站一条3.8万播放的"泼冷水"视频标题很直白:很强、很难伺候、很难用。哔哩哔哩评论区重度用户的反馈可以归纳为三条:思考过度浪费上下文(有人思考到65536 token输出上限还没动笔);Q4_K_M量化下编程容易出bug,换Q8明显变稳但速度掉到10几 tok/s;还有急性子用户直接换回了上一代Qwen3.6-27B。当然也有反方:有用户用3.8一次打通了3.6几个月没打通的问题,还有人被它"自己装无头浏览器、自己写测试脚本、自己截图修bug"的agent能力惊到,说这模型该改名qwen3.8-coder-27b。

所以这模型到底值不值得A卡玩家上手?我的看法分三档:

  • 24GB显存的A卡用户(7900XTX/9070XT):直接冲。Q4_K_M/Q5量化+MTP,50+ tok/s的体验已经过了"能用"线,是目前A卡平台性价比最高的本地旗舰模型玩法。

  • 16GB显存用户(9060XT等):能跑但体验打折,Q3_K_M是底线,上下文也别指望开高。适合尝鲜,不适合当主力。

  • 锐龙 AI Max+ 395迷你主机用户:24.5 tok/s够用但不算快,优势在于128GB统一内存能把上下文开得很大,适合跑长文档、agent这类对速度不敏感的任务。

AMD Day 0支持Qwen3.8-27B,7900XTX实测55 tok/s:A卡玩家想冲“本地Opus”,先看清这张显存档位表

最后给几个值得继续盯的信号:一是AMD说软件层优化还在推进,Day 0之后性能预计还会上调。知乎二是社区在传的35B A3B(MoE版)——注册表里出现过又被删了,如果真发,速度会有质的飞跃。哔哩哔哩三是vLLM对A卡的支持进度,真要做工程部署,llama.cpp只是起点。

这一次,A卡玩家终于不用在CUDA的热闹里当观众了。模型下载17GB起步,硬盘先备好。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章