N卡A卡插一台机器跑大模型,真的行:社区实测2个多月,3组数据和3个坑

源自211位全网作者

13:23

上周四晚上,Qwen3.8-27B 开源小红书本地大模型圈子照例进入“我手里的卡能不能跑”的算账时间:24G 显存的卡刚好够,16G 的开始研究量化,8G 的已经准备放弃。

N卡A卡插一台机器跑大模型,真的行:社区实测2个多月,3组数据和3个坑

但还有一条路,很多人没意识到——你手里那张 N 卡,可以和一张 A 卡插在同一台机器里,一起干活。

这不是设想,是已经被社区反复实测跑通的玩法:llama.cpp 现在支持多后端加载,CUDA、ROCm、Vulkan 可以编进同一个版本,N 卡走 CUDA、A 卡走 ROCm,模型层分给两张卡,一起推理。哔哩哔哩B站 UP主“佰年之玖”从 5 月初一路实测到 7 月中,把各种组合测了个遍,评论区还有一堆网友跟进晒自己的配置。我把这些数据拢到一起,给想折腾的朋友一个判断依据。

先看几组硬数据。

第一组:RTX 3080 20G + RX 9070 16G,两张卡一共 36G 显存,跑 Qwen3.6 35B 的 Q4_K_M 量化,32K 上下文以内预处理速度 3000-3500 tok/s,输出约 70 tok/s。哔哩哔哩上下文拉到 65K,预处理几乎不衰减;拉到 80K,预处理还能维持在 4000 tok/s 左右。长文档问答、喂整本书这种场景,这个预处理速度是真的香。

第二组:V100 32G + R9700,测下来有个反常识的结论——同一个 CUDA-ROCm 组合,跑 27B 模型时是最快的,跑 35B 时预处理反而是最慢的。哔哩哔哩35B 换 N 卡 CUDA + A 卡 Vulkan 组合,预处理速度才是最高的。哔哩哔哩也就是说没有万能配置,模型多大,直接决定你该用哪个后端组合。

第三组是版本的影响:同样是 CUDA+ROCm 跑 Qwen3.6-27B,ROCm 7.13 比 7.2 的预处理从约 500 tok/s 提到约 1500 tok/s,三倍差距。哔哩哔哩装环境之前,先确认版本,别拿旧教程照抄。

往上堆卡也有空间:2 张 R9700 32G + 3090 24G + 3080 20G 四卡混插,112G 显存跑 Qwen3.5-122B-A10B,对比 LM Studio + Vulkan,预处理快约 2.5 倍,输出也快 10 tok/s。哔哩哔哩评论区还有网友跟进:5060Ti + MI50 32G 的老组合,PCIe 3.0 主板,跑 Qwen3.6 35B 初始输入 900、输出 60 tok/s,上下文到 100K 左右衰减到输入 600、输出 45。哔哩哔哩老平台也能玩,但带宽瓶颈要心里有数。

数据之外,有几个坑必须提前知道。

一是混合推理赚的是预处理,不是输出。输出速度其实不如纯 Vulkan 后端平稳,它真正的价值是让你用便宜卡堆出大显存、喂进长上下文。天天只聊几句天的,感知不到好处。

二是开 MTP(多 token 预测)会让显存占用明显膨胀,原本能跑的上下文要缩水才能启动。哔哩哔哩两张卡分到的层数也会不一样,实测图表里的数字往往不是这套硬件的真实上限。

三是波动。同时调两个后端,推理稳定性不如单后端,这是当前实测的普遍反馈。哔哩哔哩

那到底适合谁?

适合:手里已经有 N 卡,显存被卡在“跑不了更大的模型”上,愿意用 Linux 或 Docker 折腾,需求偏长上下文。加一张 16G 能跑,加 32G 更从容;评论区被反复点名的是一些退役计算卡,图的就是便宜大显存,但兼容性、散热、供电都得自己把关。

不适合:Windows + Ollama 一键党——混合推理目前主要在 Linux/Docker 环境有现成方案,Ollama 在 Windows 下的混合表现,评论区问了还没人给出确定答案;还有纯追输出速度的、以及单卡 24G 跑 27B 本来就够用的——27B 这个级别,一张卡就能吃下。小红书真没必要为了折腾而折腾。

想试的话,建议别先买卡:社区已经有现成的 CUDA/ROCm/Vulkan 三后端 llama.cpp Docker 镜像,先借来验证自己的卡组合能不能跑、跑多快,确认有提升再决定加不加卡。主板插槽和 PCIe 版本先查好,PCIe 3.0 的老机器在长上下文预处理上掉速是实测过的。电源余量更要算仔细:有人拿电表实测了双卡平台跑 Qwen3.8-27B 的整机功耗,读数 643W——混插功耗更高的高端卡之前,先看看电源额定够不够。

N卡A卡插一台机器跑大模型,真的行:社区实测2个多月,3组数据和3个坑

往后看,这个玩法还有几个值得盯的信号。Ollama、LM Studio 这类一键工具什么时候跟进混合后端,是它能不能出圈的关键。ROCm 版本迭代对预处理速度的提升很猛,7.13、7.14 这条线值得跟;AMD 在 7 月底还发布了 ROCm.ai,用 AI 智能体帮忙完成 AMD 平台上的安装、部署、故障排查和性能调优。知乎这条路如果走通,社区吐槽多年的“Linux 装机噩梦”可能会明显缓解。

N卡A卡插一台机器跑大模型,真的行:社区实测2个多月,3组数据和3个坑

再就是新模型的 Day-0 支持:Qwen3.8-27B 发布后,AMD 官方几天内就给出了 llama.cpp 部署实测。AMD官网Kimi K3 也有 ROCm 的 Day-0 方案,AMD 连 KDA 注意力、MoE 稀疏计算这些新架构的适配进度都列了出来,目标是从 Day-0 起就能在 Instinct GPU 上部署。知乎开源新模型能不能第一时间在混合环境跑起来,决定了这套配置的上限。

N卡A卡插一台机器跑大模型,真的行:社区实测2个多月,3组数据和3个坑

老 N 卡别急着出。在本地大模型这个场景里,它可能是你性价比最高的那部分显存。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章