当前位置:
AIGC文章详情

128GB显存!本地跑Deepseek 70B?!【XFX讯景Radeon AI Pro R9700显卡四卡工作站测试】

源自UP主:超能网

02-10 10:07

本文深入测试了搭载四张 XFX 讯景 Radeon AI Pro R9700 显卡工作站,通过实测 DeepSeek 70B 等大模型,展示了 128GB 显存在本地 AI 推理中的表现,验证了 RDNA 4 架构与 ROCm 生态的实战价值。

128GB显存!本地跑Deepseek 70B?!【XFX讯景Radeon AI Pro R9700显卡四卡工作站测试】智能速览

  • 单卡生成1024分辨率图片仅需5.5秒,FP8效率更优

  • 四卡互联总显存达128GB,可流畅运行DeepSeek 70B模型

  • 视频生成模型显存占用高达30GB,逼近32GB单卡极限

  • ROCm 7.1.1生态完善,Linux环境下支持主流AI工具与模型

  • 多卡并行推理吞吐量达137 tokens/s,延迟控制良好

128GB显存!本地跑Deepseek 70B?!【XFX讯景Radeon AI Pro R9700显卡四卡工作站测试】精华内容

AI应用对显存需求日益增长,本次测试通过四张32GB显存的R9700显卡,探讨高性价比本地算力解决方案的可行性。

硬件架构与规格

Radeon AI Pro R9700 基于 RDNA 4 Navi48 核心,拥有 64 个计算单元及 128 个 AI 加速器,Boost 频率 2920MHz。该显卡配备 32GB GDDR6 显存,位宽 256-bit,功耗 300W。设计上采用涡轮散热与全金属外壳,并优化了尾部供电接口,非常适合多卡堆叠部署。

单卡生成效率测试

实测 ComfyUI 运行 ZImage Turbo 模型,FP8 格式下生成 1024x1024 图片仅需 5.5 秒,显存占用约 15GB;BF16 格式耗时约 7 秒,显存占用 20GB。对比发现,FP8 格式在画质相近的情况下效率更高。视频生成方面,Wan 2.2 14B 模型显存占用峰值达 30GB,逼近单卡上限。

四卡并联大模型推理

利用 vLLM 引擎,四卡工作站成功运行 DeepSeek R1 Distill Llama 70B FP8 量化版,平均每卡占用 27GB 显存。在 10 并发测试中,Token 吞吐量达 137 tokens/s,平均延迟 0.06 秒。测试表明,即使在多人并发场景下,系统仍能保持低延迟响应,稳定性出色。

软件生态与兼容性

ROCm 7.1.1 版本已支持 PyTorch 2.9,Linux 环境下对 ONNX 及 FlashAttention 2 等组件支持优于 Windows。通过官方提供的 Docker 镜像,可快速部署 vLLM 等推理引擎,简化了环境配置流程。实测显示,AMD 平台运行主流 AI 工具的门槛正在降低。

Radeon AI Pro R9700 凭借大容量显存和合理的定价,为本地 AI 部署提供了高性价比选择。四卡互联方案在满足 70B 级大模型运行需求的同时,保证了良好的并发性能。随着 ROCm 生态的持续完善,这套方案在本地算力构建中展现出强大的竞争力。

128GB显存!本地跑Deepseek 70B?!【XFX讯景Radeon AI Pro R9700显卡四卡工作站测试】关键评论

  • 以为单卡128G才跑得进来,结果看个寂寞

  • 若有这一张我就知足了

  • 显存带宽不太行

  • 这个不用cuda吗?

  • ds70b有点过时了,try glm flash 30b或者qwen coder next 80b

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章