DGX Spark自发布以来争议不断,它究竟是性能不佳的产物,还是特定人群的必备工具?通过自费实测,深入探究其在大模型推理和图像生成中的真实表现,揭示其真正的市场定位和核心价值。
智能速览
DGX Spark运行70B大模型推理速度较慢,仅6.3 TPS。
对于32B等较小模型,其性能优势并不明显。
在SD文生图测试中,生成1K图片需9秒,4K需269秒。
128GB大显存在多轮生成任务中未报错,优势明显。
其核心价值在于不可替代的CUDA生态系统。
精华内容
为了客观评价DGX Spark,针对最受争议的两项性能进行了专项测试,数据揭示了它在不同应用场景下的真实能力与局限。
大模型推理表现
在VLM大模型推理测试中,DGX Spark的表现略显尴尬。即便利用128GB大显存,在int4精度下运行70B模型时,速度仅为6.3 TPS,仅能勉强满足单机低并发使用。而当切换到32B等较小模型时,其性能提升并不显著,速度甚至不及高端消费级GPU。这揭示了DGX Spark的一个核心困境:它能运行需要大显存的模型,但速度慢;对于不依赖大显存的模型,它又缺乏速度优势。
文生图实测
转向Stable Diffusion文生图测试,在FP8精度的SDXL模型下,DGX Spark的表现有所改观。生成一张1024分辨率图片耗时约9秒,表现尚可。但当分辨率提升至4K时,耗时飙升至269秒,压力巨大。不过,128G显存的优势在此环节得以体现,在多次连续生成过程中,设备保持了稳定,未出现因显存不足导致的报错。这表明它在处理对显存要求苛刻的高分辨率或批量任务时具备稳定性。
市场定位解析
单纯从性能参数对比,DGX Spark可能并非最优选,一些竞争对手的产品在部分场景下表现更强。但它的真正价值点在于对完整CUDA生态系统的支持。对于从事文生图、图生图及视频生成等领域的开发者而言,CUDA是难以绕开的核心工具。因此,DGX Spark并非为追求极致性价比的用户设计,而是更像是为特定专业需求、依赖CUDA生态的小众人群打造的专属工作站。
综合来看,DGX Spark并非一款普适性的高性能设备,其价值高度依赖于用户的特定需求。它用庞大的显存和CUDA生态,换来了在专业领域的不可替代性。在选择AI工作站时,你是更看重绝对的跑分性能,还是特定生态系统的完整性呢?
关键评论
对于依赖CUDA生态的开发者来说,缺少CUDA支持是难以弥补的硬伤。
有观点认为其实际性能不佳,甚至不如消费级的4090或未来的5090显卡。