全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

在上海举办的WAIC 2026人工智能大会上,华为的昇腾950超节点(Atlas 950 SuperPoD)首次真机公开亮相,这也是业界最大规模的超节点!
同时,华为还带来了昇腾850E风冷超节点真机展示,让普通机房无需液冷改造,就能享受超节点的极致性能。
按照华为官方的说法,这标志着昇腾在超大规模算力基础设施领域再上新台阶,为大模型时代提供坚实算力支撑。
首先给大家介绍一下昇腾950超节点是何方神圣,再来了解一下它的诞生和亮相有何意义。
如今是一个AI算力的新时代,谁能在硬件基础设施、软件生态支持、规模化商用落地三大方面抢在前头,谁就把握了时代脉搏,无论对于企业还是对于国家,意义之重大怎么形容都不为过。
受制于种种封禁的限制,中国半导体行业尤其是AI行业,一直在一片荆棘中艰难前行,而华为作为中国科技企业的当家代表,更是承担着更多、更重的责任。

2025年9月的华为全联接大会上,华为轮值董事长徐直军正式发布了昇腾950系列芯片和基于此打造的超节点。
昇腾950超节点的基本单元为单柜64卡,理论上最高可以支持到8192卡高速互联,是此前昇腾900超节点384卡的20多倍,更是NVIDIA NVL144的接近60倍。
8192卡并行,FP8数据精度算力可以达到8 EFlops,也就是每秒800亿亿次浮点计算,FP4精度更是可高达16 EFlops,也就是每秒1600亿亿次浮点计算,同时互联带宽高达16.3PB/s,内存总容量达1152TB,训练性能比昇腾900超节点提升17倍之多。
本次真机亮相的昇腾950超节点,还不是全满血状态,只有1024卡互连,相当于只释放了1/8的实力,但饶是如此,规模之大在业内也是当仁不让的第一。
它可以提供1 EFlops FP8(每秒100亿亿次浮点计算)的强劲算力,相当于一套顶级的超级计算机。
支持256TB内存,同样是业界最大,而且采用统一编码地址技术,支持全局单一虚拟地址空间,也就是如此海量内存被视为一个整体统一管理。
作为大规模集群的关键制约因素,互连带宽同样不成问题,可提供TB级别的NPU互连带宽,从而全面释放训练和推理性能。
还有就是低至3μs(微秒)的超低RTT往返时延,可以支撑海量级别的训练和推理场景并发执行。

作为整个超节点的中枢大脑,昇腾950系列芯片基于华为自研的第三代达芬奇(DaVinci)架构,集成华为自研的Linx816 CPU核心,支持物理双线程技术,最多8核心16线程。
AI子系统集成最多36个Cube核心、72个Vector核心,并内置DVPP(数字视觉预处理)子系统、专用安全算法引擎。
它全面支持TF32、FP16、BF16、FP8、MXFP8、HiF8、INT8、MXFP4等多种数据精度格式,支持SIMD/SIMT混合编程模式,配备大容量二级缓存、超高片上访存带宽。
核心互联采用华为自研的灵衢2.0协议,相比传统互联协议通信带宽提升15倍,单跳通信时延从2μs(微秒)降至200ns(纳秒)。
I/O扩展方面集成72条HiLink SerDes信道,可划分为18个x4端口,每个端口的互连速率都可以高达4×112Gbps,因此整个芯片对外I/O带宽峰值达到2TB/s。
网络协议全面支持URMA、UB Memory、PCIe 5.0、UBoE等等,从而为大规模集群组网提供高吞吐、低延迟的连接保障。

昇腾950系列分为昇腾950PR、昇腾950DT两个版本,架构完全相同,只是AI核心与算力、内存规格容量与带宽有所区分,应用场景也有所不同。
昇腾950PR配备最多32个Cube核心、64个Vector核心,峰值总算力FP4 1784 TFlops(每秒1784万亿次)。
内存搭配HiBL 1.0,容量128GB或112GB,带宽1.6TB/s或1.4TB/s,主要面向推理Prefill(预填充)阶段、推荐业务场景,成本相比于HBM系列高带宽内存低得多。
昇腾950DT则是最多36个Cube核心、72个Vector核心,峰值算力FP4 2007 TFlops(每秒2007万亿次)。
内存改为更高规格的HiZQ 2.0,容量144GB或96GB,带宽高达4TB/s,主要面向推理Decode解码阶段和训练场景,因为它们对内存容量、带宽要求更高。


强大的硬件算力有了,等于打好了地基,但是要想盖起高楼大厦,更关键的是离不开软件生态。
NVIDIA CUDA几乎垄断了AI开发行业标准,而华为昇腾针对AI场景打造了自己的异构计算架构“CANN”(神经网络计算架构),并全面开源。
CANN对上支持多种AI框架,对下服务AI处理器与编程,发挥着承上启下的关键作用,是提升昇腾AI处理器计算效率的关键平台。
目前,CANN正在持续拥抱开源生态,在多个层级上全面提升昇腾AI的易用性,包括算子编程提供多种可选并全面拥抱Python编程生态,AI预训练全面支持PyTorch生态,AI后训练全面拥抱RL开源生态,AI推理全面支持主流技术生态。
CANN开源项目迄今已有68个社区上线,月活开发者达到3500+,同时联合90多个三方社区,优化使用体验,软硬协同提升训推效率。
比如DeepSeek就一直在大力支持华为昇腾及其CANN,通过原生支持昇腾、PyTorch存储库,能够以最小的资源代价,实现CUDA到CANN的无缝转换,从而更容易将华为的硬件集成到AI工作流程中。

有了足够优秀的软硬件技术,最后要跨过的关卡,就是规模化商用落地,将技术转化为实际效益,提升行业乃至国家实力。
目前,昇腾超节点已经初步实现了规模化落地,在20多个行业场景中都有典型案例,包括但不限于:
态势感知、智能泊位、AI科研、矿山安全生产、云智算服务、基模训练、智能客服、家庭AI助手、AI听差、视频生成、医疗影像辅助诊断、AI智能体、教学辅助、数智风控、手机券商、校园管理、代码生成、电子病历、QA智能问答、自动驾驶、跨模态理解、视觉感知、功率预测、BUG定位修复、钢铁智能生产、智慧勘探、编程助手、全模态AI助手。

当然,故事到这里并没有结束,而只是个新的开始。
昇腾950超节点的8192卡满血版本,也已经上路,相信不久后就能一睹它的真容。
根据官方路线图,华为将在2027年第四季度推出下一代昇腾960,2028年第四季度再拿出下下一代昇腾970。
昇腾960新加入FP32双精度浮点格式,算力翻番到FP4 4 PFlops,互连带宽提升10%达到2.2TB/s,内存最高做到288GB容量、9.6TB/s带宽。
基于昇腾960的超节点,最大规模能做到15488卡,对比现在几乎翻了一倍。
昇腾970继续开足马力,算力再次翻番到FP4 8PFlops,互连带宽几乎翻倍到4TB/s,内存最大容量虽然还是288GB,但是带宽再次跃升到14.4TB/s。
华为力量,或者说全行业汇聚的中国力量,必将继续壮大!
