NVIDIA DGX Spark 以“桌面超算”之名,试图将数据中心级的 AI 算力带入个人工作室。这款设备能否真正在桌面上流畅运行大模型微调与推理?本次联合实测通过详实的数据,深入探究其在 LLM 训练和图像生成等关键场景下的真实性能,为潜在用户提供可靠参考。
智能速览
LLM微调实测:1620步收敛耗时14.6小时,验证集准确率达94.80%。
LLM推理性能:128并发下短文本吞吐量可达635.15 tokens/s。
文生图推理:生成1024x1024图像仅需16秒,与RTX 3090速度接近。
相较于RTX 3090,拥有更大统一内存,可运行更大规模的模型。
相较于A100/H100,噪音更小,无需专业机房,运维成本更低。
目标用户为个人开发者、小型工作室,是一款训推一体机。
精华内容
为了全面评估 DGX Spark 的硬核实力,测试团队选取了 LLM 微调与推理、文生图模型推理两大核心场景,并与市面主流 GPU 进行了性能对比。
LLM微调实测
测试基于 Qwen3-4B-Instruct 模型进行 LoRA 微调。DGX Spark 使用 bf16 精度,在 1620 步后收敛,总耗时 14.6 小时,平均每步用时 0.54 分钟,最终验证集准确率达到 94.80%。作为对比,8 卡 RTX 3090 耗时 5.4 小时,而 4 卡 A100 仅需 1.2 小时。数据表明,DGX Spark 虽慢于专业计算卡,但具备独立完成大模型微调的能力。
LLM推理性能
推理测试在 EvalScope 框架下进行,模拟不同并发数的请求。在 128 并发下,处理 2k token 的短文本时,吞吐量达到 635.15 tokens/s;处理 8k token 的长文本时,吞吐量为 132.53 tokens/s。这显示了其在高并发场景下提供服务的潜力,首 token 时延也处于可接受范围,能够满足多数开发与部署需求。
文生图推理测试
在文生图模型 Z-Image-Turbo 的测试中,DGX Spark 生成一张 1024x1024 分辨率的图像耗时 16 秒,与 RTX 3090 的 10 秒和 A100 的 6 秒处于同一量级,远快于 V100 和 Apple M3 MAX 的 60 秒。值得注意的是,RTX 3090 在此任务中显存几乎占满,而 DGX Spark 凭借 128GB 统一内存,对未来更大模型的兼容性更强。
综合定位分析
DGX Spark 的核心优势在于其平衡性。相较于部署在机房的多卡 A100/H100,它体积小、噪音低,适合办公室环境,无需专业运维。相较于游戏卡如 RTX 3090,其巨大的统一内存是关键优势。相较于 Apple Silicon,它拥有更成熟的 CUDA 生态和 CX-7 IB 网络多机互联能力,为未来扩展留出空间。
综合来看,DGX Spark 成功地将强大的算力浓缩于桌面形态,在性能、易用性和生态上找到了平衡点。它为中小型团队和个人开发者提供了新的算力选择,但高成本仍是其普及的门槛。这款桌面超算能否真正开启 AI 开发的民主化时代?