如果你最近还在按 token 给云端大模型 API 交钱,可能已经感觉到不对劲了:价格在往上走。今年 8 月 23 日起,DeepSeek 开始实行峰谷计费,高峰时段部分档位涨幅最高到 1100%;往前数,腾讯云年内两次涨价,智谱三次。知乎摩根士丹利的研报数字更直接:2026 年二季度,国内大模型平均 API 输入价比 2025 年一季度涨了 48%。
于是越来越多人动了"自己在家跑一个"的念头。这两周,这个念头又多了一个落点——8 月 25 日发布的 Qwen3.8-27B:27B 参数的稠密模型,被普遍认为是"消费级显卡能跑的最大甜点位"。知乎AMD 在发布当天就给自家硬件做了 Day 0 适配,单张 Radeon AI PRO R9700 32GB 就能直接跑。知乎
所以这几天,这张 2025 年中发布的卡,在社区和评论区又被反复提起:国内不到一万的价格、32G 显存,在内存和显卡都在涨价的当口,它居然还没跟涨。知乎

先别急着回答"值不值"。几天前一桩刚被翻案的"冤案",可能会直接改了你的购买方案。
一、“R9700 双卡跑不了 vLLM”?实测说,锅不在 AMD
本地大模型圈之前流传一个很广的结论:R9700 没法用 vLLM 跨两张卡跑模型。按知乎一位实测者的说法,连 Puget Systems 的评测都白纸黑字写着"stock vLLM 根本无法跨两张 R9700 服务模型"。知乎这句话劝退了很多双卡方案。要知道,27B FP8 的权重约 29GB,单张 32G 卡塞进去直接 OOM——按实测者的说法,连 180MB 的 activation 都分配不出来。双卡不是"更快",是"唯一能跑起来"的路。双卡跑不了,很多人就只能转头去买二手 3090。
但这位实测者花了两天,把结论翻了过来:能跑,而且问题根本不在 AMD 的驱动。
过程有点惊悚。第一轮测试用的是 X870 EAGLE 主板,两张卡之间的 RCCL 通讯(张量并行的跨卡加总)表现是这样的:fp32 直接 abort,fp16 死锁,bf16 不报错、但算错。最后一项才是最危险的——服务跑起来了,HTTP 200,token 数正常,但输出内容是错的。如果不专门去验证数值,这种错会直接混进生产环境。
查到最后,根因在主板上:这台 X870 EAGLE 只有一个 CPU 直连的 PCIe x16,第二张卡插的那个槽,“长得像 x16,电气上是 x1”。实测带宽:卡 0 是 52.5 GB/s,卡 1 只有 1.6 GB/s,差 32 倍。
换到两条插槽都是 CPU 直连、能拆 x8/x8 的 X870E AORUS XTREME AI TOP,同一套测试、同一个 ROCm 版本:卡 1 带宽从 1.6 涨到 28.16 GB/s,RCCL 正确性 12/12 全过(包括之前会静默算错的 bf16),vLLM TP=2 直接跑通——连社区公认的 NCCL_PROTO=Simple 绕路方案都没用上。知乎翻译一下:很多人以为的"ROCm 不行、A 卡多卡不行",其实是主板插槽接线不行。这个坑不是 R9700 独有的,任何双卡方案都可能踩,只是 R9700 的卖点恰好是多卡拉通大模型,官方物料里就写着支持双卡甚至四卡串联,所以被这句传言砸得最狠。36氪

二、想组双卡,先看主板,再看卡
这次实测还给出一个硬知识点:AM5 平台的 CPU 只有 24 条 PCIe 通道,双卡上限就是 x8/x8——而且这个上限不看芯片组标签,看主板怎么接线。知乎同样是 X870E 芯片组,只给一个 CPU 直连 x16 的板子(比如 X870E EAGLE),照样不行。
所以打算上双 R9700 的,下单前先确认三件事:
主板有两条 PCIe 插槽,且都是 CPU 直连,不是芯片组转接的;
这两条插槽能拆出至少 x8/x8;
商品页或手册里明确写了双槽的通道分配;没写的,问清楚再买,别猜。
卡间带宽在这里不是"快慢问题",是"对错问题":双卡张量并行每一层都要做跨卡加总,带宽不够,轻则变慢,重则死锁、静默算错。这也是为什么说这个知识点能改购买方案——你原本留给"再买一张 R9700"的预算,可能得分一部分给一块接线正确的板子。
双卡跑通之后的成绩也在实测里(Qwen3.8-27B FP8、TP=2):单人使用,首字延迟 0.1 秒,28–30 tok/s;8 人同时用,总吞吐 160 tok/s,人均还有 21.9;32 并发打到 392 tok/s 就饱和了;64 并发总吞吐只多出 2.6%,人均速度却砍半。知乎结论很实用:真要做服务,并发上限设 32,多出来的排队,别让所有人一起变慢。
照例提醒一句:这是单一实测者的数据,样本只有一台机器,模型、量化、环境不同结果会有出入,当参考基准,别当保底承诺。

三、单卡速度:官方数字别裸信,看条件
AMD 官方给的 Day 0 数据是:单张 R9700 跑 Qwen3.8-27B 最高 51.8 tok/s。知乎注意条件:Windows 平台、llama.cpp + Vulkan 后端、开 MTP=2(多 token 投机解码),取三次以上运行的平均值。同场的锐龙 AI Max+ 395 是最高 24.5 tok/s——这张卡大概是这颗处理器跑同一个模型的两倍快。
社区实测比官方数字还要高一些:小红书一位 Windows 用户用 UDQ4_K_XL 量化加 MTP,短 prompt 能到 60–75 tok/s,长 prompt 降到 55 左右。小红书一位奥地利用户跑 Q6_K_M、174K 上下文、KV cache 全 q8,刚好填满 32G,开 MTP 后 35 tok/s。B 站还有人拿 R9700 跑通了 MiniMax H3 和 ComfyUI,结论是速度接近 3090,“不用怕黑屏干不了活,是张稳稳的干活卡”。哔哩哔哩
评论区有条标准值得记住:要用 agent 智能体,30 tok/s 是及格线。低于这个数,agent 反复调工具时会明显发呆。按这条线衡量,单张 R9700 跑 27B 的主流量化,舒服过线。
但先别急着下单,这张卡有一个真罩门,而且不是调参能解决的。
四、真罩门:长输入掉速,得等上游修
那份实测里还发现:输入一长,速度掉得很凶。40 token 输入时 30 tok/s,1311 token 掉到 21.3,5090 token 只剩 11.5。一开始以为是显存带宽瓶颈,算了一下不对——5K 输入的 KV cache 只有 167MB,怎么算都不该掉成这样。翻服务器日志找到了真正原因:vLLM 没用上 ROCm 定制的 paged attention kernel,回退到了 Triton 实现。再往源码里追,gfx1201(R9700 的核心)其实是被支持的,但有个前提:模型的 head_size 必须等于 128,而 Qwen3.8-27B 是 256。知乎翻译一下:这是框架层的形状限制,写死在模型结构里。换 ROCm 版本不改,调参数不改,只能等 vLLM 上游补。
所以判断可以给得很明确:拿它当对话助理、写作、代码生成这类短中输入的活,体验很好;想拿它做长文档分析、超长上下文 RAG,8K 输入之后的掉速要有心理准备。
另外,prefill(首字前处理)速度目前在评论区还有争议:有人说"prefill 很慢,不推荐",也有人晒出"prefill 1000 tok/s、decode 50"的成绩。量化、后端、上下文设置不同,差异很大,在意这一点就别只看别人的截图,上手前自己跑一遍基准。
五、本地大模型玩家的四条路,各算各的账
把社区现在讨论最多的几条路摆到一起(价格为近期各渠道的行情,有浮动):
路线一:单张 R9700,约 1 万。 27B 主流量化(Q6、Q8、UDQ4 一类)全装得下,30 tok/s 及格线轻松过,新卡有保修,环境也省心。短板是 27B FP8 单卡装不下,长输入罩门照旧。适合:个人自用、以对话/写作/代码为主、不想碰二手硬件的人。
路线二:双张 R9700,卡价约 2 万,还要加一块双 CPU 直连插槽的主板。 这是 27B FP8 满血跑起来的唯一路子,还能对外服务 32 并发。但总价更高,而且你得有折腾 vLLM + ROCm 环境的耐心。适合:小团队共用,或者想把本地模型做成服务对外提供的人。
路线三:二手双 3090,整机约 1.5 万。 24G×2 共 48G,显存比双 R9700 还大,能装更激进的量化甚至更大的模型,显存带宽也是老优势。但 3090 不原生支持 FP8 计算:FP8 模型在它上面是"权重按 FP8 存、计算转回 FP16",速度红利吃不到。知乎二手卡水深,尽量找个人一手自用、能现场跑测试的;双卡电源建议 1000W 往上。适合:预算敏感、有鉴别二手硬件能力、想要更大显存上限的人。
路线四:预算有限,或者愿意等。 更便宜的 24G 卡也在进步,评论区有人用 Intel 的 24G 卡跑 27B Q5,优化后 20 tok/s,还没过及格线,但价格低得多。小红书“16G 卡跑 27B"的量化方案这两天也在快速迭代,已经有人在本地实测低显存量化版 Qwen3.8-27B,相关攻略帖有一百多收藏。小红书这个档位现在入手是"能用”,不是"好用"。

(AI Max 395 迷你主机那条路之前聊过:跑 27B 是 24.5 tok/s,不用装机但价格被炒高,这里不展开。)
值得继续盯的三个信号
vLLM 上游什么时候放宽 gfx1201 的 head_size 限制。 这直接决定 R9700 的长输入罩门会不会消失,也是双卡方案从"能用"到"全面好用"的最后一块拼图。
R9700 的价格。 硬件涨价潮里它目前还守在万元内,一旦跟涨,这四条路的性价比排序就要重算。
Qwen3.8 家族的量化和 MTP 生态。 同一张卡,靠投机解码和量化优化还能再挤速度,社区已经在拿 1.41GB 的草稿模型把单流速度翻倍了。
最后收个尾:这张卡不完美,长输入掉速、生态比 N 卡年轻,都是事实。但这一次,劝退清单上最狠的那条——“双卡跑不了”——锅不在卡,在主板上。下单前先把主板接线查明白,这一步零成本,但能帮你省掉两天怀疑人生的排障。