在大模型快速演进的当下,每当人们谈论AI算力,目光往往第一时间投向芯片本身的性能指标与制程工艺。然而,如果将视线从单颗芯片拉远到由成千上万颗芯片组成的巨大集群,就会发现一个尴尬的现实:芯片算得再快,大部分时间可能都在等待其他芯片传输数据;规模越大的集群,通信开销和效率损耗就越严重,买到的峰值算力往往难以转化为实际有效的计算产出。
面对这一产业痛点,华为轮值董事长徐直军提出了一个需要行业共同审视的观点:重新理解AI算力,关键不仅在于做出一颗更强的大芯片,更在于如何通过系统架构与互联技术的创新,让成千上万甚至百万级处理器像一台计算机一样高效协同工作。
传统计算机架构诞生于数十年前,其计算与存储分离、中央处理器统筹主从设备的模式,在面对AI时代超大规模并行计算时正面临严峻挑战。随着集群规模迈向万卡甚至十万卡,数据在不同芯片、机柜乃至数据中心之间频繁搬运,导致大量的电能与时间被浪费在通信等待和协议转换上。当单点硬件微缩的红利逐渐放缓,依靠单纯堆叠单卡数量已无法带来线性的算力增长。
针对这一瓶颈,华为推出了名为Peerium的全新计算架构,并配套推出了关键的互联技术——灵衢(UnifiedBus)。过去,总线通常只管机箱内部的近距离连接,而远距离通信则交给网络协议,两者之间的衔接转换带来了不可忽略的时延与损耗。灵衢的思路是将总线协议延伸到更大的物理空间,让CPU、NPU、内存与存储资源能够跨越机柜甚至数据中心直接交互,抹平协议转换的开销。这种平等互联与统一寻址的设计,旨在消除算力孤岛,把百万级处理器逻辑上重构成一个整体。

在具体的工程落地层面,信号如何在物理介质中高速传输是另一个核心课题。随着数据传输速率的飞速提升,传统铜缆的有效传输距离被压缩至极致,散热与功耗压力剧增。业界普遍认同“铜退光进”的大趋势,但在具体技术路线的选择上存在分歧。
目前光互联主要有CPO(共封装光学)和NPO(近封装光学)两条路径。CPO将光引擎与主芯片直接封装在一起,性能极限更高,但一旦光引擎损坏,整颗主芯片可能随之报废,维护成本高且制造良率挑战极大。相比之下,华为选择的NPO路线则是一次务实的工程折中:将光引擎部署在芯片附近,保留极短的板上电连接,其余转向光连接。这种设计既发挥了光传输的高带宽、低功耗优势,又保留了组件独立维护与替换的空间,使整体综合成本得以显著降低,更适合超大规模智算中心的稳定运行。

在最新发布的硬件落地产品中,基于NPO技术与灵衢总线的昇腾960超节点正式亮相。通过近封装光引擎替代海量传统光模块,系统不仅大幅降低了整机功耗,更减少了单点故障率,提升了超大集群的连续稳定运行时间。这也印证了系统工程的逻辑:在算力基础设施中,稳定性和实际的算力利用率(MFU)往往比单纯的理论峰值更为重要。

除了硬件与架构的重构,生态与产品的迭代节奏同样是算力能否转变为生产力的关键。在芯片路线规划上,相关的硬件演进正在按照一年一代的节奏推进,同时通过软件栈的持续开源与主流框架的无缝对接,降低开发者的迁移与适配成本。通过将底层互联协议开放,并推动行业标准的建立,使得算力底座能够更好地承载百模千态的训练与推理需求。
从“单卡崇拜”转向“系统工程”,重新理解AI算力的本质,意味着把焦点从单一硬件参数延伸到架构效率、互联带宽、稳定运行与综合能效的全局考量。面对未来长期的算力需求增长,通过架构创新弥补单点技术的局限,让庞大的芯片集群实现高效、普惠且稳定的协作,正成为AI基础设施演进的核心方向。