本文深入测试了搭载四张 XFX 讯景 Radeon AI Pro R9700 显卡的工作站,通过实测 DeepSeek 70B 等大模型,展示了 128GB 显存在本地 AI 推理中的表现,验证了 RDNA 4 架构与 ROCm 生态的实战价值。
智能速览
单卡生成1024分辨率图片仅需5.5秒,FP8效率更优
四卡互联总显存达128GB,可流畅运行DeepSeek 70B模型
视频生成模型显存占用高达30GB,逼近32GB单卡极限
ROCm 7.1.1生态完善,Linux环境下支持主流AI工具与模型
多卡并行推理吞吐量达137 tokens/s,延迟控制良好
精华内容
AI应用对显存需求日益增长,本次测试通过四张32GB显存的R9700显卡,探讨高性价比本地算力解决方案的可行性。
硬件架构与规格
Radeon AI Pro R9700 基于 RDNA 4 Navi48 核心,拥有 64 个计算单元及 128 个 AI 加速器,Boost 频率 2920MHz。该显卡配备 32GB GDDR6 显存,位宽 256-bit,功耗 300W。设计上采用涡轮散热与全金属外壳,并优化了尾部供电接口,非常适合多卡堆叠部署。
单卡生成效率测试
实测 ComfyUI 运行 ZImage Turbo 模型,FP8 格式下生成 1024x1024 图片仅需 5.5 秒,显存占用约 15GB;BF16 格式耗时约 7 秒,显存占用 20GB。对比发现,FP8 格式在画质相近的情况下效率更高。视频生成方面,Wan 2.2 14B 模型显存占用峰值达 30GB,逼近单卡上限。
四卡并联大模型推理
利用 vLLM 引擎,四卡工作站成功运行 DeepSeek R1 Distill Llama 70B FP8 量化版,平均每卡占用 27GB 显存。在 10 并发测试中,Token 吞吐量达 137 tokens/s,平均延迟 0.06 秒。测试表明,即使在多人并发场景下,系统仍能保持低延迟响应,稳定性出色。
软件生态与兼容性
ROCm 7.1.1 版本已支持 PyTorch 2.9,Linux 环境下对 ONNX 及 FlashAttention 2 等组件支持优于 Windows。通过官方提供的 Docker 镜像,可快速部署 vLLM 等推理引擎,简化了环境配置流程。实测显示,AMD 平台运行主流 AI 工具的门槛正在降低。
Radeon AI Pro R9700 凭借大容量显存和合理的定价,为本地 AI 部署提供了高性价比选择。四卡互联方案在满足 70B 级大模型运行需求的同时,保证了良好的并发性能。随着 ROCm 生态的持续完善,这套方案在本地算力构建中展现出强大的竞争力。
关键评论
以为单卡128G才跑得进来,结果看个寂寞
若有这一张我就知足了
显存带宽不太行
这个不用cuda吗?
ds70b有点过时了,try glm flash 30b或者qwen coder next 80b