走进Lambda位于俄亥俄州的数据中心,实地探访首批投入使用的NVIDIA B200 GPU集群。这次展示揭示了价值数亿美元的AI算力背后的核心技术,从高效的散热方案到复杂的网络架构,为理解下一代AI基础设施提供了宝贵视角。
智能速览
Lambda集群已部署数千个NVIDIA B200 GPU,并持续扩张。
数据中心配备36兆瓦电力设施,含独立变电站与劳斯莱斯发电机。
Supermicro服务器采用风冷设计,通过巨型热交换器高效散热。
网络采用400Gbps InfiniBand,每个GPU配有专用NVIDIA BlueField-3 DPU。
Lambda提供“一键式”服务,支持从16到超1500个GPU的灵活集群配置。
精华内容
这台由数千个NVIDIA B200 GPU组成的超级集群,不仅是算力的堆砌,更是电力、散热和网络技术的极致融合。其背后的工程设计,决定了AI训练的效率与极限。
36兆瓦电力保障
数据中心的稳定运行首先依赖于强大的电力系统。该CoLogix设施总功率达36兆瓦,并配备了专属变电站。为确保不间断供电,场地内部署了多台劳斯莱斯发电机,单台功率1.6兆瓦,并配有大型电池备份系统(UPS)。所有这些设备都经过严格的安全和定期检查,确保在任何外部情况下都能为数据中心提供持续的电力保障。
风冷与液冷方案
本次参观的Supermicro HGX B200服务器主要采用风冷技术。数据中心通过冷热通道封闭设计,将冷空气吸入服务器,热空气被引导至热通道,再通过巨型热交换器进行冷却,类似汽车散热器原理。这种风冷方案部署速度更快。对于更高密度的计算需求,Lambda也已部署采用液冷技术的NVIDIA GB200 NVL72机架,通过液体冷却才能实现72个GPU的高度集成与稳定运行。
400Gbps高速网络
为满足GPU间海量数据交换,集群网络架构至关重要。这里采用了NVIDIA Quantum-2 InfiniBand网络,提供400Gbps的传输速率。每台Supermicro服务器背后都配备了8个NVIDIA ConnectX-7网卡,实现每个GPU都有一个独立高速通道。此外,还集成了NVIDIA BlueField-3 DPU,它不仅是一张网卡,更是一个拥有16个核心和独立操作系统的数据处理单元,能有效分担主机的网络任务,为多租户环境提供支撑。
HGX B200平台解析
集群的核心计算单元是Supermicro NVIDIA HGX B200 8-GPU平台。一个机箱内集成了8颗B200 GPU、双路CPU、内存及网络模块。可抽出的托盘上密布着8个巨大的GPU散热片。在主机板部分,包含了用于引导系统的SSD、负责网络连接的BlueField-3 DPU、用于AI训练数据的NVMe存储区域。为了给整个系统供电,配置了6个5250瓦的钛金级高效电源,并采用双路输入设计以提高供电效率和可靠性。
一键式集群服务
自建如此规模的AI集群需要巨额资金、时间和专业技术。Lambda的“OneClick”集群服务正是为此提供解决方案。用户可以通过云端界面,轻松配置从16个GPU起步、扩展到超过1500个GPU的集群。这种即开即用的模式,极大地降低了企业和研究机构使用顶级AI算力的门槛,让资源能更专注于算法和模型开发本身。