第四弹:NVIDIA DGX Spark大战M4max 大模型推理

2025-10-18 16:13:29 0点赞 1收藏 0评论

根据我平时做的笔记,以下是对 NVIDIA DGX Spark 和 Apple M4 Max 在大型语言模型(LLM)推理性能方面的详细比较。

DGX Spark(GB10 Grace Blackwell Superchip)和 M4 Max(Apple Silicon)都配备了 128 GB 的统一内存(Unified Memory),这使得它们能够处理远超传统消费级 GPU 硬件能运行的超大型模型。

1. 核心硬件与内存带宽对比

DGX Spark 和 M4 Max 的主要性能差异源于它们的内存带宽:

第四弹:NVIDIA DGX Spark大战M4max 大模型推理

内存带宽的瓶颈: DGX Spark 的系统内存带宽有限(约 273 GB/s)是 AI 推理性能的主要瓶颈。相比之下,M4 Max 的内存带宽显著更高,最高可达 546 GB/s。这种更高的带宽通常能使 M4 Max 在相同或相似的模型测试中实现更高的每秒输出 Token 数(TPS)。

DGX Spark 的 FP4 优势: DGX Spark 利用 Blackwell 架构的优势,强调对 NVFP4 格式的硬件支持。FP4 是一种低精度格式,它通过减少位数来换取带宽,可以将内存占用缩小约 3 到 3.5 倍(相比 FP16)或约 1.8 倍(相比 FP8)。NVIDIA 声称,这使得 Spark 在使用 FP4 时感觉非常快,并且在保持准确度损失低于 1% 的情况下,性能接近 FP8 质量。

2. LLM 推理性能数据对比 (Tokens Per Second, TPS)

根据提供的测试数据和评测结果,我们可以对比两者的实际推理速度:

第四弹:NVIDIA DGX Spark大战M4max 大模型推理

主要观测结果:

M4 Max 在特定测试中展现出更高的峰值 TPS: 在某些中小型模型的短输入测试中(如 granite-4.0-h-tiny、ERNIE-4.5-21B),M4 Max 的 TPS 能够达到 110 TPS 到 152 TPS。这很可能是得益于其更高的内存带宽(546 GB/s)。

DGX Spark 在通用模型上的推理速度相对较慢: 在通用 LLM 推理任务中,DGX Spark 的解码速度通常被认为相对较慢,尤其是与高性能消费级 GPU 相比。例如,在 Olama 上运行 GPT OSS 20B 时的解码速度约为 50 TPS。

DGX Spark 在大模型上的表现: DGX Spark 能够运行极大的模型,例如 GPT OSS 120B,其解码速度约为 12 TPS。但在使用 MXFP4 优化时,GPT OSS 120B 短输入速度可达 59 TPS。

预填充(Prefill)性能差异: DGX Spark 在处理长上下文(Long Context)的预填充(Prompt Processing)速度上,有时不如高带宽的专用 GPU 系统,例如在 Llama 3.3 70B Q4KM 的长上下文测试中,DGX Spark 的提示处理速度明显慢于双 3090 Ti 桌面系统。然而,对于 GPT OSS 20B 模型,有测试显示 DGX Spark 的预填充速度(680 tokens/秒)比 Quad 3090 rig(254 tokens/秒)更高。

3. 性能特点与应用场景

尽管 M4 Max 在原始内存带宽和部分模型测试中可能具有速度优势,DGX Spark 则在特定的 AI 开发者工作流中展现出独特的价值:

DGX Spark 的独特优势

FP4 优化: DGX Spark 具有专用的 Blackwell 硬件,支持 NVFP4 格式,能以极高的效率运行超大型模型。

多模型与多代理工作流: DGX Spark 的 128 GB 统一内存使其能够同时运行多个大型模型,这对构建本地多代理(Multi-agent)系统至关重要。例如,一个多代理系统可以同时运行 GPT OSS 12B (作为主管模型)、Deep Seek Coder 6.7B (代码生成模型) 和 Quinn 3 (嵌入模型),占用约 89 GB 内存。

NV Sync 和开发者生态: DGX Spark 提供了一个交钥匙的、易于设置的 DGX OS (基于 Ubuntu) 和 NVIDIA Sync 应用,为开发者提供了便捷的远程访问和 AI 工具链(如 VS Code、Cursor AI Workbench)的集成。

可扩展性: DGX Spark 拥有 ConnectX7 RDMA 网卡和双 200 Gb/s 端口,可以轻松地将两台设备直接连接起来,将统一内存扩展到 256 GB,从而运行更大的模型。

M4 Max 的优势

更高带宽带来的性能潜力: M4 Max 的高内存带宽使其在许多推理任务中能提供更快的响应速度,尤其是在 Apple 的 MLX 框架下。

能效比和便携性: M4 Max 通常集成在 MacBook Pro 等机型中,在能效比和便携性方面具有优势,尽管 DGX Spark 本身也被宣传为超便携的 AI 工作站

价格比较: M4 Max 所在的 Mac Studio (M3 Ultra) 定价较高(512 GB 版本 10,000 美元),但 M4 Max MacBook Pro 起价约 3,199 美元(14 英寸)。DGX Spark 的零售价约为 3,999 美元。

总结: M4 Max 凭借其更高的内存带宽,在原始推理速度(TPS)方面可能优于带宽受限的 DGX Spark。然而,DGX Spark 凭借其 128 GB 的统一内存FP4 硬件优化以及 NVIDIA 成熟的 AI 软件和互联生态系统,使其成为 AI 开发者进行模型训练、微调和多代理工作流开发的“盒子里的 AI 实验室”。

来源:网页链接

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松