第三弹!听听博主讲NVIDIA DGX Spark好评还是差评?
以下是各位博主对 NVIDIA DGX Spark (GB10) 的实测性能数据和关键比较的整理:
DGX Spark 的核心优势在于其 128 GB 的 LPDDR5X 统一内存,使其能够加载和运行比大多数高端消费级 GPU 更大的模型,例如需要 60 到 65 GB 内存的 GPT OSS 12B 模型。然而,其内存带宽(约为 273 GB/s 或 275 GB/s)是其在原始推理速度上的主要瓶颈。
一、 大型语言模型 (LLM) 推理性能对比
多个博主将 DGX Spark 与配备多张高性能显卡的台式机进行了对比,尤其是 Digital Spaceport (DS) 频道提供的 LMSYS 组织数据和 Bijan Bowen (BB) 的直接对比。
1. LMSYS Org / Digital Spaceport 的数据(对比 Quad 3090s Rig)

2. Bijan Bowen 的对比数据 (对比 Dual 3090 Ti 和 AMD Strix Halo)

3. NetworkChuck 的对比数据 (Larry vs. Terry - Dual 4090s)
NetworkChuck 将 DGX Spark (Larry) 与他自己的双 RTX 4090 服务器 (Terry) 进行了对比,结果显示在原始推理速度上,4090 平台具有明显优势:
4. Level1Techs 的性能指标
Level1Techs 提供了基于 FP8 和 BF16 的 Llama 模型性能数据,并强调 NVFP4 格式是 Blackwell 架构的优势,它通过减少位宽来弥补内存带宽的不足。
Llama 3.2B (FP8):93 FPS。
Llama 3.2B (BF16):62 FPS。
Llama 3.1 8B (Nvidia FP4):39 tokens/s (相较于其他量化格式的 23 tokens/s 有显著提升)。
Llama 3.3 70B (NVFP4, TRT LLM 后端, 使用推测性解码):预计速度约为 11.12 tokens/s。
二、 训练与微调 (Fine-Tuning) 性能
DGX Spark 在训练大型模型方面展现了其统一内存的优势,因为它能够加载大型数据集,而无需担心 VRAM 限制。
Tim Carambat 的 Gemma 3 4B Fine-tuning 示例:
使用 Unsloth 框架微调 Gemma 3 4B 模型。
在 DGX Spark 上完成训练耗时 4.3 分钟。
作为对比,在 Nvidia T4 Cloud GPU (Colab) 上运行相同的训练任务平均耗时约 17 分钟。
NetworkChuck 的训练对比 (较小模型):
DGX Spark (Larry):每迭代耗时 3 秒。
Dual 4090s (Terry):每迭代耗时 1 秒。
结论:虽然 Terry 快约 3 倍,但 DGX Spark 的关键能力在于它能加载和训练 70B 级别的模型,而 Terry 的 48GB VRAM 则无法实现。
三、 推测性解码 (Speculative Decoding) 性能
推测性解码是一种软件优化,通过使用一个较小的、快速的模型来预测多个 Token,然后由主模型并行验证,从而提高端到端吞吐量。
LMSYS Org 测得 Llama 3.1 8B (SGLang):开启推测性解码后,解码速度的端到端吞吐量提升了 近 2 倍。
NetworkChuck 运行了一个包含 Llama 3.3 70B 的推测性解码系统,使用了 77 GB 的统一内存,运行速度“非常快”。
四、 图像/视频生成性能
DGX Spark 支持使用 Comfy UI 等工具进行图像和视频生成,利用其大内存池运行更大的模型以获得更高质量的结果。
Bijan Bowen 的 Stable Diffusion (Image) 示例: 生成一张 1024x1024 图像耗时 6.4 秒。
NetworkChuck 的 Comfy UI (Image Generation) 示例: DGX Spark (Larry):速度约为每秒 1 迭代 (1 iteration per second)。 Dual 4090s (Terry):速度约为每秒 11 迭代 (11 iterations per second)。
总结 DGX Spark 的主要性能特点
大内存容量,实现多模型和超大模型运行: 凭借 128 GB 统一内存,DGX Spark 能够轻松运行多代理框架(Multi-agent frameworks),例如同时运行 GPT OSS 12B、Deep Seek Coder 6.7B 和 Quinn 3 Embedding 4B 等多个模型,总内存占用约为 89 GB。
FP4 优化: DGX Spark 的 Blackwell 架构是为运行 NVFP4 格式而专门设计的,这使得它能够在较低的内存带宽下保持接近 FP8 的精度,实现性能加速。
微调速度快: 在 Gemma 3 4B 模型的微调测试中,DGX Spark 的速度比云端 Nvidia T4 GPU 快约 4 倍。
原始推理速度受限: 由于 LPDDR5X 统一内存的带宽限制(约 275 GB/s),DGX Spark 在直接的 Token 生成速度上通常不如配备专用高速 VRAM 的高端消费级 GPU (如 4090 或 3090 Ti)。
功耗和噪音: DGX Spark 在空闲时功耗约为 44-45W,在 CPU 压力测试下约为 120-125W,额定最大功耗为 240W。它在重负载下运行安静(低于 40 dBA),而相比之下,一台双 4090 服务器在运行时功耗可能超过 1100W,且运行一年电费预计为 $1400,而 Spark 约为 $315。
博主们对 NVIDIA DGX Spark 的评价总体上是正面且非常兴奋的,但这种正面评价是有条件的,并且集中在其作为 AI 开发者工具和大内存平台的独特价值上,而不是其原始推理速度(Raw Inference Speed)。
以下是博主们评价的详细总结,包括积极评价、负面评价/顾虑,以及他们为何最终持正面态度:
一、 积极评价(正面)
1. 核心价值:统一大内存与开发体验
DGX Spark 最被看重和赞扬的特点是其 128 GB 统一内存,以及由此带来的处理大型模型的能力。
运行超大型模型的能力: 博主们普遍认为,DGX Spark 的 128 GB 统一内存是其最大的优势,使其能够运行单个消费级 GPU 无法承载的大型模型,例如需要 60-65 GB 内存的 GPT OSS 120B 模型。
出色的开发与生态系统: 许多博主称赞 Spark 及其随附的 NVIDIA 生态系统和软件体验。它被视为一个 “盒子里的 AI 实验室” (AI lab in a box),能够让开发者轻松上手,且所有驱动和软件栈(如 CUDA、Python、DGXOS)都预配置好了,“开箱即用”。
多模型工作流(Agentic AI): Spark 能够同时运行多个大模型(Multi-agent frameworks)用于复杂的 AI 工作流,例如同时运行 GPT OSS 120B、Deep Seek Coder 6.7B 和 Quinn 3 Embedding 4B,这在内存受限的消费级卡上是不可能的。
高可扩展性: 通过内置的 ConnectX-7 网卡和 RDMA 网络,Spark 提供了在小型设备中前所未有的集群和扩展能力,允许用户堆叠(stack)两个 Spark 以获得 256 GB 的内存,并且其工程设计与大型数据中心 DGX 系统兼容,这意味着开发者在 Spark 上编写的代码和解决方案可以平滑扩展到云端或数据中心。
2. 功耗、体积与设计
DGX Spark 的物理尺寸、功耗和噪音控制获得了高度赞扬:
超安静运行: 即使在重负载下(CPU 压力测试达到 120-125W),该设备也**“令人震惊地安静”**,噪音低于 40 dBA。
高能效比: 它的设计使其能够放入背包中,具有超高的便携性。空闲功耗低至 44-45W,额定最大功耗为 240W,相比之下,一台双 4090 服务器功耗可达 1100W,每年的电费成本差异巨大。
出色的微调能力: 在 Gemma 3 4B 微调测试中,DGX Spark 的速度比云端的 Nvidia T4 GPU 快约 4 倍(4.3 分钟对比约 17 分钟),体现了其在训练工作流中的效率。
二、 负面评价和顾虑
1. 原始推理速度和带宽瓶颈
原始性能(Raw Inference) 是 DGX Spark 受到的主要批评点,尤其是在与配备高速 GDDR6X VRAM 的消费级旗舰卡(如 RTX 3090/4090)对比时。
内存带宽限制: 博主们普遍指出,DGX Spark 使用的 LPDDR5X 统一内存(带宽约为 273 GB/s 或 275 GB/s)是其性能的主要瓶颈。
对比旗舰卡速度慢: 在直接的 Token 生成速度(Decode Tokens/s)上,Spark 显著慢于 4090 或 3090 Ti 平台。 NetworkChuck 的对比显示,在 Quinn 3 8B 模型推理中,双 4090 (Terry) 的速度(132 tokens/s)是 Spark (Larry) 的 3.6 倍(36 tokens/s)。 Digital Spaceport 的数据显示,Spark 在 Gemma 3 27B Q8 上的速度(4.5 tokens/s)远低于 Quad 3090 rig(25.4 tokens/s)。
长上下文处理速度: 在处理 70,000 token 的长文本提示时,虽然 Spark 最终完成了任务,但其提示处理速度(Prompt Processing)明显慢于双 3090 Ti 桌面机。
2. 价格和性价比顾虑
DGX Spark 的价格(Founders Edition 约为 $3999)被认为是主要的障碍。
消费级用户性价比低: Bijan Bowen 直言,对于 95% 的普通消费者来说,DGX Spark 的价值不高,因为同样的预算可以购买一台 Stricks Halo(~$1800) 加上一张 RTX 4090(~$2000),后者在原始推理速度上更具优势。他认为如果 Spark 降价到 $2500 甚至 $3000,性价比才会成为“毋庸置疑的选择”。
缺乏性价比导致评价“柔和”: 有些评论者(如 Tech Dregs)指出,许多早期评测没有将 Spark 与 AMD Stricks Halo 或 Mac Studio 进行直接性能基准测试,这使得这些“正面”评价显得“柔和”或**“避重就轻”**,暗示定价或性能不足以支撑其作为一款通用高性能 AI 设备。
三、 结论:博主们的定位与最终态度
尽管存在速度和价格上的顾虑,绝大多数博主仍给予 DGX Spark 高度赞赏,主要基于其清晰的定位。
博主们认为 DGX Spark 的目标受众不是追求最高推理速度的普通消费者或游戏玩家,而是 AI 开发者、学生和需要训练/微调大型模型的人群。
开发者的理想选择: “如果你是一名 AI 开发者,你的主要工作是开发 AI、微调(Fine-tuning)数据科学方面的内容,那么这可能是适合你的设备”。它被视为一个可以替代租用昂贵云 GPU 的本地解决方案。
FP4 与架构优化: Spark 的 Blackwell 架构专为 NVFP4 格式设计,允许它在保持与 FP8 相近精度的同时,通过减少位宽来弥补 LPDDR5X 的内存带宽限制,从而实现性能加速。Level1Techs 强调 NVFP4 是该设备的“真正的加速剂”。
未来的可扩展性: 通过 ConnectX-7 实现的 RDMA 网络和多设备扩展能力被视为**“绝妙的主意”和“颠覆性设备”**,为个人和企业提供了一条清晰的、可从小规模扩展到数据中心级别系统的路径。
总结: 博主们普遍认为 DGX Spark 在其特定细分市场(AI 开发、大模型容量、低功耗、可扩展性)是杰出的,甚至是“游戏规则的改变者”。但对于仅追求原始推理速度的普通用户而言,价格和带宽限制使得其吸引力较低。
