Lamabda基于B200的数据中心

源自UP主:柔风细雨踏青荇

02-06 23:37

走进Lambda位于俄亥俄州的数据中心,实地探访首批投入使用的NVIDIA B200 GPU集群。这次展示揭示了价值数亿美元的AI算力背后的核心技术,从高效的散热方案到复杂的网络架构,为理解下一代AI基础设施提供了宝贵视角。

Lamabda基于B200的数据中心智能速览

  • Lambda集群已部署数千个NVIDIA B200 GPU,并持续扩张。

  • 数据中心配备36兆瓦电力设施,含独立变电站与劳斯莱斯发电机。

  • Supermicro服务器采用风冷设计,通过巨型热交换器高效散热。

  • 网络采用400Gbps InfiniBand,每个GPU配有专用NVIDIA BlueField-3 DPU。

  • Lambda提供“一键式”服务,支持从16到超1500个GPU的灵活集群配置。

Lamabda基于B200的数据中心精华内容

这台由数千个NVIDIA B200 GPU组成的超级集群,不仅是算力的堆砌,更是电力、散热和网络技术的极致融合。其背后的工程设计,决定了AI训练的效率与极限。

36兆瓦电力保障

数据中心的稳定运行首先依赖于强大的电力系统。该CoLogix设施总功率达36兆瓦,并配备了专属变电站。为确保不间断供电,场地内部署了多台劳斯莱斯发电机,单台功率1.6兆瓦,并配有大型电池备份系统(UPS)。所有这些设备都经过严格的安全和定期检查,确保在任何外部情况下都能为数据中心提供持续的电力保障。

风冷与液冷方案

本次参观的Supermicro HGX B200服务器主要采用风冷技术。数据中心通过冷热通道封闭设计,将冷空气吸入服务器,热空气被引导至热通道,再通过巨型热交换器进行冷却,类似汽车散热器原理。这种风冷方案部署速度更快。对于更高密度的计算需求,Lambda也已部署采用液冷技术的NVIDIA GB200 NVL72机架,通过液体冷却才能实现72个GPU的高度集成与稳定运行。

400Gbps高速网络

为满足GPU间海量数据交换,集群网络架构至关重要。这里采用了NVIDIA Quantum-2 InfiniBand网络,提供400Gbps的传输速率。每台Supermicro服务器背后都配备了8个NVIDIA ConnectX-7网卡,实现每个GPU都有一个独立高速通道。此外,还集成了NVIDIA BlueField-3 DPU,它不仅是一张网卡,更是一个拥有16个核心和独立操作系统的数据处理单元,能有效分担主机的网络任务,为多租户环境提供支撑。

HGX B200平台解析

集群的核心计算单元是Supermicro NVIDIA HGX B200 8-GPU平台。一个机箱内集成了8颗B200 GPU、双路CPU、内存及网络模块。可抽出的托盘上密布着8个巨大的GPU散热片。在主机板部分,包含了用于引导系统的SSD、负责网络连接的BlueField-3 DPU、用于AI训练数据的NVMe存储区域。为了给整个系统供电,配置了6个5250瓦的钛金级高效电源,并采用双路输入设计以提高供电效率和可靠性。

一键式集群服务

自建如此规模的AI集群需要巨额资金、时间和专业技术。Lambda的“OneClick”集群服务正是为此提供解决方案。用户可以通过云端界面,轻松配置从16个GPU起步、扩展到超过1500个GPU的集群。这种即开即用的模式,极大地降低了企业和研究机构使用顶级AI算力的门槛,让资源能更专注于算法和模型开发本身。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章