北京安联通 × 情感机器(Swanlab):联合实测 DGX Spark,共探桌面超算硬核实力

源自公众号:北京安联通科技有限公司

01-27 19:10

NVIDIA DGX Spark 以“桌面超算”之名,试图将数据中心级的 AI 算力带入个人工作室。这款设备能否真正在桌面上流畅运行大模型微调与推理?本次联合实测通过详实的数据,深入探究其在 LLM 训练和图像生成等关键场景下的真实性能,为潜在用户提供可靠参考。

北京安联通 × 情感机器(Swanlab):联合实测 DGX Spark,共探桌面超算硬核实力智能速览

  • LLM微调实测:1620步收敛耗时14.6小时,验证集准确率达94.80%。

  • LLM推理性能:128并发下短文本吞吐量可达635.15 tokens/s。

  • 文生图推理:生成1024x1024图像仅需16秒,与RTX 3090速度接近。

  • 相较于RTX 3090,拥有更大统一内存,可运行更大规模的模型。

  • 相较于A100/H100,噪音更小,无需专业机房,运维成本更低。

  • 目标用户为个人开发者、小型工作室,是一款训推一体机

北京安联通 × 情感机器(Swanlab):联合实测 DGX Spark,共探桌面超算硬核实力精华内容

为了全面评估 DGX Spark 的硬核实力,测试团队选取了 LLM 微调与推理、文生图模型推理两大核心场景,并与市面主流 GPU 进行了性能对比。

LLM微调实测

测试基于 Qwen3-4B-Instruct 模型进行 LoRA 微调。DGX Spark 使用 bf16 精度,在 1620 步后收敛,总耗时 14.6 小时,平均每步用时 0.54 分钟,最终验证集准确率达到 94.80%。作为对比,8 卡 RTX 3090 耗时 5.4 小时,而 4 卡 A100 仅需 1.2 小时。数据表明,DGX Spark 虽慢于专业计算卡,但具备独立完成大模型微调的能力。

LLM推理性能

推理测试在 EvalScope 框架下进行,模拟不同并发数的请求。在 128 并发下,处理 2k token 的短文本时,吞吐量达到 635.15 tokens/s;处理 8k token 的长文本时,吞吐量为 132.53 tokens/s。这显示了其在高并发场景下提供服务的潜力,首 token 时延也处于可接受范围,能够满足多数开发与部署需求。

文生图推理测试

在文生图模型 Z-Image-Turbo 的测试中,DGX Spark 生成一张 1024x1024 分辨率的图像耗时 16 秒,与 RTX 3090 的 10 秒和 A100 的 6 秒处于同一量级,远快于 V100 和 Apple M3 MAX 的 60 秒。值得注意的是,RTX 3090 在此任务中显存几乎占满,而 DGX Spark 凭借 128GB 统一内存,对未来更大模型的兼容性更强。

综合定位分析

DGX Spark 的核心优势在于其平衡性。相较于部署在机房的多卡 A100/H100,它体积小、噪音低,适合办公室环境,无需专业运维。相较于游戏卡如 RTX 3090,其巨大的统一内存是关键优势。相较于 Apple Silicon,它拥有更成熟的 CUDA 生态和 CX-7 IB 网络多机互联能力,为未来扩展留出空间。

综合来看,DGX Spark 成功地将强大的算力浓缩于桌面形态,在性能、易用性和生态上找到了平衡点。它为中小型团队和个人开发者提供了新的算力选择,但高成本仍是其普及的门槛。这款桌面超算能否真正开启 AI 开发的民主化时代?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章