在近期举办的技术大会上,华为正式发布了面向人工智能时代的全新计算架构Peerium及其配套的高速互联协议“灵衢”(Unified Bus),并展示了Atlas 950与Atlas 960超节点硬件。这一发布在科技界引发了广泛讨论,其中“突破冯·诺依曼单机架构”的说法更是成为了公众关注的焦点。

要客观理解这一技术发布,首先需要厘清术语上的争议。在华为国内的宣传口径中,常使用“突破冯·诺依曼单机架构”和“颠覆主从架构”等表述;而在华为公布的学术论文以及英文官方网站中,对该架构的定位则是“嵌套并行冯·诺依曼架构”(Nested Parallel von Neumann Architecture),使用的词汇是“扩展”(extends)而非完全“推翻”。

从计算机基础理论来看,Peerium架构并没有抛弃冯·诺依曼体系的核心要素。系统中的处理器依然在读取指令、执行计算,程序和数据也依然保存在存储器中。因此,技术团队的核心工作并非颠覆教科书中的计算原理,而是重新定义了“单机”的物理与逻辑边界。传统计算架构中,单台计算机的边界通常限制在一个主板或一台服务器内部;而Peerium架构试图通过工程手段,将数十万甚至上百万个处理器在逻辑上整合,使其像“一台更大的计算机”那样协同工作。
这一架构重构的背后,是当前超大规模AI大模型训练面临的现实工程痛点。在传统的AI算力集群中,通常由成千上万台独立的服务器通过以太网或InfiniBand连接。随着集群规模扩大到十万卡级别,大量的计算资源被消耗在跨节点的数据搬运、通信等待和全局同步上。业界数据显示,在传统集群架构下,十万卡规模训练大模型时的实际模型浮点算力利用率(MFU)往往仅有20%左右,这意味着绝大多数计算单元在很多时候都在“等待数据”。

Peerium架构解决这一痛点的思路可以概括为软件与硬件的“双重嵌套”。
在软件层面,该架构提出了“Nested BSP”(嵌套批量同步并行)编程模型。经典的BSP模型将并行计算分为局部计算、通信和屏障同步等阶段,但当节点数量达到数十万时,全局同步会拖慢所有处理器的节奏。Nested BSP则引入了递归分层的概念,将大集群的同步拆解为多层局部的同步。从最内层的张量并行、上下文并行,到外层的专家并行、流水线并行和数据并行,每一层都在自己的物理范围内进行高频同步,减少了跨大尺度域的等待时间。同时,论文强调在每一层级中,各节点均为平等关系,消除了传统主从控制节点的调度瓶颈。
在硬件和互联层面上,灵衢总线(Unified Bus)提供了关键支撑。传统集群中,服务器内部使用总线协议(如PCIe),跨服务器通信则需要转换为网络协议(如RDMA或TCP/IP),这种转换带来了显著的时延和能量损耗。灵衢总线则尝试用统一的协议贯穿从芯片封装、单板、机架到超节点的整个系统。它摒弃了CPU作为主控、加速卡作为从设备的主从结构,让CPU、NPU、内存和存储设备在总线上实现平等互联。更重要的是,它将跨节点的通信拉回到原生内存语义(load/store操作),使远程内存访问的时延显著降低,跨柜往返时延压缩至微秒级。

此外,该体系在物理部署上采用了“物理稀疏,逻辑紧密”的设计理念。随着芯片功耗增加,将大量高算力芯片紧密挤在一个机架内会面临极大的散热和供电挑战。华为在Atlas 960等硬件中引入了近封装光学(NPO)技术,将电光转换的边界从传统的一米级别向内移动到芯片封装边缘的十毫米级别。这种光互连技术在保护极高带宽和低时延的同时,允许物理设备在机房内适当拉开距离部署,不必强行追求兆瓦级高密度机架,降低了冷却和电力基建的压力。
从竞争格局与产业路线来看,Peerium架构体现了不同的系统设计哲学。海外巨头如英伟达倾向于在机柜内部追求极致的直连密度与单点性能;而华为在面临先进制程和显存供应链限制的背景下,选择将互联边界扩大到整个机房,通过光互连、统一内存寻址和系统级调优来提升集群的整体有效利用率,尝试用系统架构的效率来弥补单点硬件上的差距。

理性来看,Peerium架构和Nested BSP模型的提出是一项极具深度的系统工程创新,为应对后摩尔时代的AI算力瓶颈提供了一条清晰的路径。然而,从学术论文和架构发布,到规模化商业落地,中间仍需跨越巨大的工程门槛。统一内存寻址在百万级节点规模下的缓存一致性维护、局部节点故障时的系统容错能力,以及上层生态(如软件开发工具栈、算子库迁移)的适配,都需要在真实的商业负载中接受长期检验。
综合而言,华为并没有推翻冯·诺依曼计算机的基础逻辑,而是将冯·诺依曼架构的设计思想从“单机”拓展到了“百万卡超级集群”。这一创新的价值在于将AI算力的竞争维度从单纯的比拼“单卡峰值性能”,转向了比拼“超大规模集群的实际利用效率”,为全球AI算力基础设施的建设提供了一种全新的系统级解题思路。