面对新一代 AI 工作负载的挑战,华为推出了 CloudMatrix 384 AI 超节点平台。该架构通过重构数据中心体系,以大规模互连和高算力密度,为解决算力瓶颈提供了新的技术路径。
智能速览
精华内容
华为 CloudMatrix 384 试图通过架构创新,在制程受限的情况下实现算力的跨越式提升。
架构重构
CloudMatrix 架构彻底突破了传统以 CPU 为中心的分层式设计。其核心是统一总线(UB)互连网络,使 NPU、CPU、DRAM、SSD 等组件无需 CPU 中介即可直接通信。这种设计解耦了各类资源,支持细粒度按需组合,消除了传统节点级互连的瓶颈,使超大模型能够在逻辑超节点内高效分布执行。
硬核规格
CloudMatrix 384 集成了 384 颗 Ascend 910C 芯片和 192 颗 Kunpeng CPU。系统采用全光链路互联,配备 6912 个光模块,卡间带宽达 2.8Tbps,延迟低于 1 微秒。其三层网络设计(UB、RDMA、VPC)确保了无阻塞通信,在逻辑上等效为一个统一编址的大型计算节点。
性能对比
在算力表现上,一套完整的 CloudMatrix 384 系统可提供 300 PFLOPS 的 BF16 稠密计算性能,几乎是英伟达 GB200 NVL72 的两倍。同时,其总显存容量和内存带宽也分别具备 3.6 倍和 2.1 倍的优势。然而,这一优势以高功耗为代价,其功耗约为竞品的 4.1 倍。
战略取舍
尽管芯片制程落后一代,但华为通过增加 5 倍数量的加速器,配合全互联拓扑,成功抵消了单芯片性能的不足。这种 Scale-up 方案契合本土产业链优势,虽然能效比存在差距,但在当前建设条件下并非决定性限制因素。
CloudMatrix 384 展示了通过架构优化弥补硬件差距的可行性。虽然能效是当前短板,但其高算力密度和灵活的资源调度,为大规模 AI 计算提供了另一种具有竞争力的解决方案。