全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

2026-07-28 22:18:16 0点赞 0收藏 0评论
全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

在上海举办的WAIC 2026人工智能大会上,华为的昇腾950超节点(Atlas 950 SuperPoD)首次真机公开亮相,这也是业界最大规模的超节点!

同时,华为还带来了昇腾850E风冷超节点真机展示,让普通机房无需液冷改造,就能享受超节点的极致性能。

按照华为官方的说法,这标志着昇腾在超大规模算力基础设施领域再上新台阶,为大模型时代提供坚实算力支撑。

首先给大家介绍一下昇腾950超节点是何方神圣,再来了解一下它的诞生和亮相有何意义。

如今是一个AI算力的新时代,谁能在硬件基础设施、软件生态支持、规模化商用落地三大方面抢在前头,谁就把握了时代脉搏,无论对于企业还是对于国家,意义之重大怎么形容都不为过。

受制于种种封禁的限制,中国半导体行业尤其是AI行业,一直在一片荆棘中艰难前行,而华为作为中国科技企业的当家代表,更是承担着更多、更重的责任。

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

2025年9月的华为全联接大会上,华为轮值董事长徐直军正式发布了昇腾950系列芯片和基于此打造的超节点。

昇腾950超节点的基本单元为单柜64卡,理论上最高可以支持到8192卡高速互联,是此前昇腾900超节点384卡的20多倍,更是NVIDIA NVL144的接近60倍。

8192卡并行,FP8数据精度算力可以达到8 EFlops,也就是每秒800亿亿次浮点计算,FP4精度更是可高达16 EFlops,也就是每秒1600亿亿次浮点计算,同时互联带宽高达16.3PB/s,内存总容量达1152TB,训练性能比昇腾900超节点提升17倍之多。

本次真机亮相的昇腾950超节点,还不是全满血状态,只有1024卡互连,相当于只释放了1/8的实力,但饶是如此,规模之大在业内也是当仁不让的第一。

它可以提供1 EFlops FP8(每秒100亿亿次浮点计算)的强劲算力,相当于一套顶级的超级计算机。

支持256TB内存,同样是业界最大,而且采用统一编码地址技术,支持全局单一虚拟地址空间,也就是如此海量内存被视为一个整体统一管理。

作为大规模集群的关键制约因素,互连带宽同样不成问题,可提供TB级别的NPU互连带宽,从而全面释放训练和推理性能。

还有就是低至3μs(微秒)的超低RTT往返时延,可以支撑海量级别的训练和推理场景并发执行。

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

作为整个超节点的中枢大脑,昇腾950系列芯片基于华为自研的第三代达芬奇(DaVinci)架构,集成华为自研的Linx816 CPU核心,支持物理双线程技术,最多8核心16线程。

AI子系统集成最多36个Cube核心、72个Vector核心,并内置DVPP(数字视觉预处理)子系统、专用安全算法引擎。

它全面支持TF32、FP16、BF16、FP8、MXFP8、HiF8、INT8、MXFP4等多种数据精度格式,支持SIMD/SIMT混合编程模式,配备大容量二级缓存、超高片上访存带宽。

核心互联采用华为自研的灵衢2.0协议,相比传统互联协议通信带宽提升15倍,单跳通信时延从2μs(微秒)降至200ns(纳秒)。

I/O扩展方面集成72条HiLink SerDes信道,可划分为18个x4端口,每个端口的互连速率都可以高达4×112Gbps,因此整个芯片对外I/O带宽峰值达到2TB/s。

网络协议全面支持URMA、UB Memory、PCIe 5.0、UBoE等等,从而为大规模集群组网提供高吞吐、低延迟的连接保障。

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

昇腾950系列分为昇腾950PR、昇腾950DT两个版本,架构完全相同,只是AI核心与算力、内存规格容量与带宽有所区分,应用场景也有所不同。

昇腾950PR配备最多32个Cube核心、64个Vector核心,峰值总算力FP4 1784 TFlops(每秒1784万亿次)。

内存搭配HiBL 1.0,容量128GB或112GB,带宽1.6TB/s或1.4TB/s,主要面向推理Prefill(预填充)阶段、推荐业务场景,成本相比于HBM系列高带宽内存低得多。

昇腾950DT则是最多36个Cube核心、72个Vector核心,峰值算力FP4 2007 TFlops(每秒2007万亿次)。

内存改为更高规格的HiZQ 2.0,容量144GB或96GB,带宽高达4TB/s,主要面向推理Decode解码阶段和训练场景,因为它们对内存容量、带宽要求更高。

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

强大的硬件算力有了,等于打好了地基,但是要想盖起高楼大厦,更关键的是离不开软件生态。

NVIDIA CUDA几乎垄断了AI开发行业标准,而华为昇腾针对AI场景打造了自己的异构计算架构“CANN”(神经网络计算架构),并全面开源

CANN对上支持多种AI框架,对下服务AI处理器与编程,发挥着承上启下的关键作用,是提升昇腾AI处理器计算效率的关键平台。

目前,CANN正在持续拥抱开源生态,在多个层级上全面提升昇腾AI的易用性,包括算子编程提供多种可选并全面拥抱Python编程生态,AI预训练全面支持PyTorch生态,AI后训练全面拥抱RL开源生态,AI推理全面支持主流技术生态。

CANN开源项目迄今已有68个社区上线,月活开发者达到3500+,同时联合90多个三方社区,优化使用体验,软硬协同提升训推效率。

比如DeepSeek就一直在大力支持华为昇腾及其CANN,通过原生支持昇腾、PyTorch存储库,能够以最小的资源代价,实现CUDA到CANN的无缝转换,从而更容易将华为的硬件集成到AI工作流程中。

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

有了足够优秀的软硬件技术,最后要跨过的关卡,就是规模化商用落地,将技术转化为实际效益,提升行业乃至国家实力。

目前,昇腾超节点已经初步实现了规模化落地,在20多个行业场景中都有典型案例,包括但不限于:

态势感知、智能泊位、AI科研、矿山安全生产、云智算服务、基模训练、智能客服、家庭AI助手、AI听差、视频生成、医疗影像辅助诊断、AI智能体、教学辅助、数智风控、手机券商、校园管理、代码生成、电子病历、QA智能问答、自动驾驶、跨模态理解、视觉感知、功率预测、BUG定位修复、钢铁智能生产、智慧勘探、编程助手、全模态AI助手。

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀

当然,故事到这里并没有结束,而只是个新的开始。

昇腾950超节点的8192卡满血版本,也已经上路,相信不久后就能一睹它的真容。

根据官方路线图,华为将在2027年第四季度推出下一代昇腾960,2028年第四季度再拿出下下一代昇腾970。

昇腾960新加入FP32双精度浮点格式,算力翻番到FP4 4 PFlops,互连带宽提升10%达到2.2TB/s,内存最高做到288GB容量、9.6TB/s带宽。

基于昇腾960的超节点,最大规模能做到15488卡,对比现在几乎翻了一倍。

昇腾970继续开足马力,算力再次翻番到FP4 8PFlops,互连带宽几乎翻倍到4TB/s,内存最大容量虽然还是288GB,但是带宽再次跃升到14.4TB/s。

华为力量,或者说全行业汇聚的中国力量,必将继续壮大!

全球规模最大 每秒100亿亿次!华为昇腾950 1024卡超节点真机首秀
展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松