RTX PRO 6000 单卡追平四张 RTX 5090:功耗仅需 1/4
一张 NVIDIA RTX PRO 6000 Blackwell GPU,在跑 230B 参数大模型时的 token 生成速度,几乎追平了四张 RTX 5090 组建的卡皇集群——而它的功耗只有后者的四分之一。实测数据显示,单卡 RTX PRO 6000 达到 118.74 tok/s,四张 RTX 5090 为 120.54 tok/s,差距微乎其微。但功耗一侧,差距天壤之别:RTX PRO 6000 只需 600W,四张 RTX 5090 要 2300W。

性能几乎持平,功耗只有 1/4
测试使用 MiniMax M2.7,这是一款 230B 参数的 AI 推理模型。所有平台均采用 Unsloth 的 UD-IQ3_XXS 量化方案(GGUF 格式),上下文长度为 32k,最大 token 长度为 4096。结果如下:单卡 RTX PRO 6000(96GB VRAM)达到 118.74 tok/s,首 token 延迟(TTFT)765ms;四张 RTX 5090(4 × 32GB,共 128GB VRAM)为 120.54 tok/s,TTFT 725ms;四张 RTX 4090(4 × 24GB,共 96GB VRAM)只有 71.52 tok/s,TTFT 1045ms。作为参考,NVIDIA DGX Spark(128GB 系统)只有 24.41 tok/s。

为什么单卡能追平多卡?
多卡互联虽然能堆叠更多 VRAM,但卡间通信会带来额外开销,拖累实际效率。RTX PRO 6000 凭借 96GB 超大单卡显存,直接装下 230B 模型的量化版本,省去了多卡协作的协调成本,在这款模型上实现了与四卡集群相当的吞吐量,同时大幅降低了复杂度与功耗。
价格与功耗综合对比
从成本来看,单张 RTX PRO 6000 定价约 9500 美元,四张 RTX 5090 总价约 14000 美元,DGX Spark 约 4699 美元。功耗方面,四张 RTX 5090 平台峰值 2300W,四张 RTX 4090 平台 1800W,RTX PRO 6000 单卡仅 600W,DGX Spark 全机 240W。这意味着 RTX PRO 6000 在特定大模型任务上,实现了比四卡 RTX 5090 更高能效、更低总拥有成本的表现。
对 AI 用户意味着什么
RTX PRO 6000 定位并非消费级游戏显卡,而是面向 AI 工作站和专业数据中心的旗舰产品。它展示的趋势是:在特定 AI 推理任务上,单卡大显存配合高带宽的设计路线,比多卡堆叠更高效。对于需要本地部署大模型的用户来说,这是一个值得关注的信号——大显存单卡方案在性价比和能效上,可能比想象中更实用。
