8月14日,阿里开源了Qwen3.8-27B:27B稠密参数、原生多模态、262K原生上下文、可外推到100万、Apache 2.0协议。知乎这一周本地部署的讨论热度很高,但和以前不一样的是——知乎、B站、小红书上,相当一部分人不再默认推N卡,开始推AMD。
原因很直白:N卡的价格,已经有点看不懂了。
8月18日的显卡行情观察里,5070以上的显卡在缓慢上涨,5080受AI需求影响直接暴涨。哔哩哔哩到8月19日,RTX 5070 Ti报到7455元,RTX 5080报到9750元。哔哩哔哩而另一边,24GB显存的RX 7900 XTX,在同一份观察价里连续多日稳在4999元。4999元买24GB显存,7455元买16GB显存——对跑本地大模型的人来说,这个对比非常直观。
但大家也都知道,A卡跑大模型一直是"非主流"路线,ROCm到底行不行、实测速度是不是真的,是所有人心里的问题。我把最近一个月各平台的实测样本翻了一遍,今天把这笔账算清楚。
一、为什么是Qwen3.8-27B,把"消费级显卡"这局点着了
这个模型对本地用户特别友好:Q4量化之后,模型本体大约16~17GB,正好卡在消费级显卡显存的甜点位上。能力上,按部署实测作者的说法,Agent编程能力比上一代提升明显,部分基准超过Claude Opus 4.6,有人直接称它是"目前27B级别最能打的本地模型"。知乎更关键的是它原生多模态:能看图、能看视频,本地部署不再是纯文字聊天那一套,出图、视频工作流也能接上。
于是问题变得很具体:在消费级显卡上,花最少的钱,怎么把它跑起来、跑得舒服?
二、先算账:显存决定"能不能跑",带宽决定"跑得快不快"
跑本地大模型,真正重要的硬件指标不是"卡多高端",而是两个:
一个是显存。模型权重加上上下文缓存,装不下就是装不下,连启动都谈不上。Qwen3.8-27B做Q4量化后约16~17GB,再留出KV cache,16GB显卡是卡着线进的,24GB才有余量。知乎262K超长上下文听着很美,但落到本地显存上,日常跑8K~32K才是常态,这部分也吃显存。

另一个是显存带宽。生成文本本质上是把权重一遍遍从显存里读出来,带宽直接决定每秒能吐多少token。这恰恰是A卡最被低估的地方:7900 XTX的384-bit位宽,带宽960GB/s,和7455元的5070 Ti(896GB/s)是一个量级。
按8月19日的显卡观察价算一笔账:
显卡 | 新卡观察价 | 显存 | 带宽 | 每GB显存成本 |
|---|---|---|---|---|
RX 7900 XTX | 4999元 | 24GB | 960GB/s | 约208元/GB |
RX 7900 XT | 约4000元(个别实测用户入手价) | 20GB | 800GB/s | 约200元/GB |
RX 9070 XT | 5699元 | 16GB | 640GB/s | 约356元/GB |
RTX 5060 Ti 16G | 3349元 | 16GB | 448GB/s | 约209元/GB |
RTX 5070 Ti | 7455元 | 16GB | 896GB/s | 约466元/GB |
表格的结论很简单:5000元以内,24GB显存的选择只有7900 XTX一个,每GB成本208元,和5060 Ti 16G打平;而5070 Ti要466元/GB,是它的2.2倍。想把27B跑得从容,24GB是"门票",这张门票目前在A卡这边最便宜。
实测样本也支持这笔账。一位用7900 XTX跑了三个月本地模型的知乎用户,27B级模型能跑到36+ tok/s,ComfyUI出图、出视频也全靠它。知乎小红书上,Qwen3.8-27B开源第三天就有人发了7900 XTX的实测。小红书N卡那边也不是没有答案:5060 Ti 16G(3349元)同样跑通了Qwen3.8-27B,作者的说法是"16G显存跑出旗舰级"。知乎36 tok/s是什么概念?中文输出大约每秒几十个字符,远快于人的阅读速度,日常对话、写代码、跑Agent都够用,瓶颈基本不在速度上。
三、再泼冷水:2026年的ROCm能用,但不像CUDA那么省心
A卡跑大模型,劝退点从来在软件。翻完样本后的结论是:2026年真的能用,但坑比N卡多,而且坑的位置你猜不到。
好消息是生态确实在变好。知乎上有用了多年的老用户今天刚写:“2025年ROCm还很脆弱,2026年我已经在用了”。知乎Ollama、LM Studio这些主流工具,在Windows上已经支持ROCm硬件加速,7000系及以上还有一键安装包,B站相关教程的收藏量都是几百起步。哔哩哔哩

但坑也是真的。那位跑了三个月的知乎用户专门写了篇"踩坑实录",多卡环境里HIP_VISIBLE_DEVICES的设备分配问题这种,每一个都够折腾一晚上。最有代表性的是B站一位UP主的系列实测:4000元的7900 XT反复黑屏掉驱动,全网都说是电源带不动,他最后查出真凶是LM Studio里一个默认拉到2048的参数,改成512,速度从5 tok/s拉到80+,花费0元。哔哩哔哩另一位UP主的解法更直接——“卸载Ollama”,同一台机器速度从5变60。哔哩哔哩反过来,也有教程作者用Ollama的ROCm加速,7900 XT稳定跑80+ tok/s。哔哩哔哩这说明什么?环境差异巨大,一个软件版本、一个驱动版本,结果可能完全不同,没有可以闭眼抄的标准答案,只有"自己测一遍"。
另外两条边界说清楚:想微调、想训练,N卡依然是绝对优势,别拿A卡硬上;A卡现在主要承接的是推理和ComfyUI系的出图、视频生成。
四、结论:谁该买,谁别买
建议买的:
想本地跑27B~32B级模型,预算5000元左右,能接受折腾半天——7900 XTX是当前的显存性价比之王,顺便4K游戏也能玩。
手里已经是AM5平台或DDR5整机,想加一张卡专门跑本地AI,没有平台换代成本。
别买的:
纯小白,不碰命令行,指望一键即用——3349元的5060 Ti 16G加CUDA生态更省心,或者干脆用云API,别买卡。
主要目的是微调、训练,或者要跑绑定CUDA的专业软件——直接N卡。
预算不到3000元还想硬上27B——先从更小的模型玩起,或者等行情回落。
还有一条值得留意的路线:AMD Ryzen AI Max+ 395这类128GB统一内存的迷你主机,B站上讨论热度不低,适合要跑更大模型的用户,但价格目前一点不便宜。哔哩哔哩
五、真要入手:行动清单和接下来盯什么
7900 XTX已经是产品周期末期的卡,新货库存在收缩,走靠谱渠道、留好凭证,别贪来历不明的低价。
电源别省:这张卡TDP 355W,建议850W起步。
别急着装Linux。先在Windows下试Ollama或LM Studio的ROCm版,对大多数人够用。
跑模型别一次把batch和上下文拉满,一点点往上加;出了问题先查参数,再怀疑硬件。

接下来值得盯三个信号:ROCm的版本更新(生态口碑的转折点还在延续);9070 XT会不会跌破5000元(真跌了,16GB加新架构低功耗,会是很有力的挑战者);以及Qwen3.8官方量化版本的更新节奏。
最后把话说透:这一波不是A卡突然变强了,是涨价潮把"大显存性价比"推到了AMD这边。4999元的24GB显存、960GB/s带宽,是目前把27B大模型跑舒服的最稳一张票。代价是,你要比CUDA多容忍一些软件生态的坑。值不值,取决于你每天真用几个小时——用得重,折腾半天,一周就回本。