如果你这几天在逛A卡的AI讨论区,大概率会撞上一种精神分裂式的观感:
一边,是官方在秀肌肉。10月9日,AMD ROCm 团队自己的技术博客发了一篇长文:一台 8 卡 MI355X 节点(每卡 288GB HBM3e,单节点合计约 2.25TB),跑 Kimi Linear 48B-A3B 这个 MoE 模型,把上下文从 1024 token 一路推到 6710 万 token——是模型官方宣称 1M 上限的 64 倍。17 个长度档位、每档跑 3 遍,prefill 时间和 decode 吞吐全部公开。小红书
另一边,是社区在"打脸"。同一天,Phoronix 的评测被翻译进中文圈:结论很扎眼——同样的 AMD 设备上,开源的 Vulkan 后端跑大模型,吞吐量是 AMD 自家 ROCm 后端的 1.5 到 3 倍。知乎
中间还夹着第三条:半导体分析机构 SemiAnalysis 点名披露的一段旧事——在 vLLM 这个全球最主流的开源推理引擎里,手握 AMD GPU 支持代码生杀大权的 ROCm “守门人”、EmbeddedLLM 团队的 Tun Jian Tan(社区称 TJ),替 AMD 维护了两年半底层代码,却长期连一台能随时登录的测试机都没有。知乎
三条帖,同一个周末,同一家公司。先别急着站队"AMD AI 行了/又不行了",这四组数据其实各自只回答各自设备的问题。把它拆开对完账,才知道哪条路适合你。
第一本账·场景:先把四条数据的"适用范围"钉死
很多人吵崩,是因为把不同设备上的结论互相乱套。先把账表立起来:
数据 | 设备 | 对比/路径 | 关键数字 | 适用人群 |
|---|---|---|---|---|
Phoronix 后端对比 | Radeon AI PRO R9700 工作站、锐龙 AI Max+ 395 迷你主机 | Lemonade 2026.39.1 / llama.cpp,ROCm 后端 vs Vulkan 后端 | Qwen3-14B 上 Vulkan 吞吐约 1.5 倍;Qwen3.5-14B 上约 3 倍;TTFS 首包 ROCm 略快 | 桌面 A 卡、395/掌机级设备跑 GGUF 本地模型的 |
vLLM 守门人缺卡→得卡 | MI355 数据中心卡 | 从"盲猜写内核"到专属持久集群 | 得卡后 19 天,MiniMax M3 长上下文吞吐提升 11 倍(SemiAnalysis 口径);Qwen3.5 投机解码最高 5 倍 | 自建/租用 MI 级集群、吃 vLLM 路线的 |
ROCm 官方博客 64M | 8 卡 MI355X 节点(2.25TB HBM) | Kimi Linear 48B-A3B,FP8 KV cache | 6710 万 token 上下文,KV cache 峰值约 252GB | 服务器级、超长上下文业务 |
Claude 写内核救卡 | 8 张 Radeon Pro V620(RDNA2,单卡 32GB) | 自写 vLLM 分支 + RDNA2 推理内核 | prefill 从 350–450 t/s 到 16K 提示词 3274 t/s(作者称约快 800%);生成 MTP 开约 63 均/97 峰、关约 40–50 t/s | 手里有老 A 卡、官方名单外的 |
看清楚了吗:这四条不矛盾,甚至是同构的——AMD 的 AI 软件体验,强不强势,取决于你的设备恰好在谁的火力覆盖范围里。数据中心 MI 卡有官方集群和 AITER 优化路径兜底;消费级单卡上,开源后端(Vulkan、llama.cpp 生态)反而是性能主力;老卡就只剩社区(甚至 AI 帮你写内核)这一条腿。
第二本账·设备:Phoronix 这组数到底意味着什么
Phoronix 这次测试的设计是"同设备内对比",不是跨设备比卡——System76 工作站(R9700)和 Framework Desktop(395)各自跑一遍 ROCm 后端和 Vulkan 后端:
Qwen3-14B-GGUF:ROCm 首包响应(TTFS)更快,但 Vulkan 吞吐量接近 1.5 倍;
Qwen3.5-14B-GGUF:ROCm TTFS 仍略好,Vulkan 吞吐拉开到约 3 倍;
llama.cpp 上同样如此,且 Vulkan 还多一层跨 GPU 推理的优势。
翻译成人话:单卡、GGUF、聊天/批量生成场景,Vulkan 后端更快出字;对首字延迟敏感的交互,ROCm 仍有位置。但注意证据边界——这是 Linux 桌面工作站 + 14B 档模型的样本,不是消费游戏卡的全体,也不是 70B 以上大模型,更不是集群。别拿这组数去推导"ROCm 全面完蛋",也别拿官方 64M 的集群成果去推导"你的 9070XT 装个 ROCm 就起飞"。
顺带一提,这组对比能成立的前提,恰恰是开源社区这两年一直在给 AMD 设备"补内核"。这就得说第三本账。
第三本账·后端:守门人故事才是机制层
按吴建明 10 月 9 日对 SemiAnalysis 披露内容的转述(单一信源转引,细节以当事机构原帖为准):vLLM 里 AMD GPU 支持的第一个补丁出自 TJ 之手,此后两年多,从注意力内核到 MoE 加速基本是他带 EmbeddedLLM 团队一行行啃的。而 AMD 提供给 vLLM 社区的测试设备,长期只有一台没配高速互联的 MI355 单机,坏了数月无人过问;DeepSeek 某代大版本发布当天,N 卡阵营因为维护者手中有充足测试集群做到 Day-0 适配,A 卡阵营因为没机器做回归测试而错失首发窗口。
转机在今年 5 月:AMD 调拨了价值约 360 万美元的芯片集群给社区做持久开发基地。之后的产出是:重构注意力后端(ROCm AITER 路径)后,19 天内把 MiniMax M3 长上下文吞吐拉升 11 倍;LMSYS 与 AMD 联合报告称,深度优化后的 MI355X 在 DeepSeek-R1 分离式推理的每百万 token 综合成本上击败对照组 B200 方案;7 月 Advancing AI 峰会上,苏姿丰把 AMD AI Core Contributor 奖当场颁给了 TJ。知乎
这套叙事和英伟达的打法是同一枚硬币的两面:CUDA 护城河的真实形态之一,就是把最贵的卡直接塞给开源维护者长期持有,让优化天然发生在自家硬件上。AMD 过去把测试机当"固定资产"管,等于把修车师傅挡在车门外——硬件参数赢了发布会,开发者拿回家跑崩,就是这么来的。
而 ROCm 博客那篇 64M 长文,则是硬币的另一面:官方一旦拿到机器、进入状态,输出的是硬工程细节——8 张卡分摊 KV cache 的坑(每卡独立存一份完整 cache,节点总显存够不算数)、FP8 是必选项(BF16 每 token 8KB、67M 直接爆 504GB/卡)、超 16M 上下文要新版 KV 地址指针、以及一句很老实的免责声明:不验证 67M 下的任务精度,上生产前自己跑评测集。 这些坑值得所有做多级卡集群的抄作业,但对单卡用户只有谈资价值。小红书
第四本账·窗口:老卡和犹豫者该盯什么
小红书 10 月 9 日流传的 V620 故事是个极端样本:8 张云游戏退役卡(单张约 350 美元、合计 256GB 显存),llama.cpp 跑 prefill 只有 350–450 t/s,vLLM 干脆起不来,机主本来都准备挂出去卖——最后让 Claude 写了一套 RDNA2 推理内核、自己构建测试迭代,prefill 干到 3274 t/s,卖卡计划取消。 但同样要说清边界:跑分只用 4 张卡、并发 1,分支尚未公开,$2800 只算了卡钱(整机约 $3000)。它证明的是"老 A 卡的残值开始由内核决定",不是"你手边那张 6600XT 明天就能跑大模型"。小红书
把四条帖按人群收拢成一张选择表:
桌面消费 A 卡 / 395、掌机级设备,日常 GGUF 本地推理:优先 llama.cpp/Lemonade 的 Vulkan 后端起步,追求首包延迟或对官方工具链有刚需再上 ROCm;别把"装了 ROCm 才算正宗"当前提。
在蹲 MI 级/二手企业卡自建:ROCm + AITER 路径是目前官方火力最足的线,但注意 ROCm 10.1 已经对老消费卡动过刀,支持名单变化直接影响你二手残值,买卡前先看名单再谈性能。
手里是 RDNA2 及更早的卡:官方适配是别想了,路线在 llama.cpp 分支和社区内核(以及等开源),残值判断按"有没有人替你写内核"来定,别按发布会跑分来定。
还在纠结要不要靠免费 token 过渡:AMD 模型工场的额度与排队体验近期争议不少,本篇不重复展开——它解决的是"不想换卡也能用",不解决"我的卡能不能打"。
至于接下来盯什么信号,给六个:①AMD 是否对"Vulkan 吞吐反超"做出官方回应(后端优化或驱动层面的动作);②ROCm 下一版对 RDNA 消费卡的支持名单(双 11 前动卡的必看,这是残值风险);③V620 作者的 vLLM 分支是否开源;④下一个重磅开源模型发布时,vLLM 的 AMD Day-0 能不能赶上——这是检验"送卡换生态"是否真跑通的试金石;⑤微软 Win11 AI 框架对 GGUF 本地推理的支持进展(已有用户反馈 A 核显识别问题);⑥11 月初 AMD 财报电话会里软件生态叙事有没有从"硬件卖爆"转向"开发者留存"。
最后回到开头那个"精神分裂":其实不分裂。AMD AI 现在就是两层皮——硬件和数据中心软件栈肉眼可见地在变厚,消费端体感仍然要靠社区后端兜着。用 A 卡跑模型的人,早就该从"信不信官方"这个问题毕业了:该问的是你的设备在谁的火力范围里,你打算押哪一层。
你的卡是什么型号、现在跑的哪个后端、数字多少?评论区把机型和 tok/s 摆出来,咱们攒一份自己的实测名单。