9月这半个月,机房圈的问话方式变了。
以前客户问的是"这次交换机走几家",现在开口是"我们要上超节点,你给配一版"。而且这不再是PPT需求:中国移动这轮AI算力集采直接拉到6208张加速卡、776套计算节点,华为的昇腾384超节点累计部署已经越过750套。第一财经
云厂商这边动作更快:阿里云8月12日把"真武M890超节点实例"正式上线开售,按64卡一个高速互联单元交付,官方口径是国内首个成功运行超2万亿参数大模型的超节点形态算力。第一财经9月8日,中金和银河证券同一天发研报,一个说超节点有望成为AI算力的重要组织方式,一个喊"放量拐点"。
做了多年华三这条线的网工、集成商、投标的人,这个秋天大概率会碰到同一件事:需求单上多了"超节点"三个字,报价单位从"台"变成了"柜"甚至"套"。先别顺着客户的思路去问"要多少卡",这第一个问题本身就问错了。
"多少卡"不是分水岭,"统一内存编址"才是
超节点这个词火起来之后,社区里最硬的一次争议来自今年2月,36氪那篇文章把底线划得很清楚:没有内存统一编址,仍是服务器堆叠。36氪翻译成人话:把一堆八卡机用更快的网卡捆在一起,交付单上写"超节点",机房里跑的还是老逻辑。
这个标准恰好也是各家自说自话里最含糊的一条。新华三自己在《超节点技术白皮书》里给出的定义是机柜级紧耦合算力单元:CPU、GPU/NPU、DPU、内存、外存通过AI优化高速互联组织起来,靠统一软件栈做资源池化。知乎
更实在的证据藏在页码里:这份白皮书光"S80000软件栈分层架构"一张图就排在第309页、前后编号到了图192——三百多页的体量,大半篇幅在讲互联协议、CXL、Load/Store、操作系统、液冷、供电、部署、巡检这些工程件。知乎和华为、中兴的同类报告摆在一起,气质完全不同:三份白皮书分别回答"为什么需要超节点"、“怎么设计"和"真进了机房还缺哪些东西”。
所以判断"真假超节点",验收前至少对三个条件:有没有内存语义,是支持跨节点的Load/Store访问还是只是带宽大一点的RDMA;软件栈有没有分层,资源池化、调度、通信库优化在哪一层做,出了问题查哪一层;运维上是不是"一台计算机",训前巡检、拓扑可视化、故障隔离自愈在不在交付范围内。超节点里单点故障的爆炸半径,比传统服务器大一个数量级。
华三这版口径,藏着三个数字、一张网和一个标准
官方口径里的第一个数字来自产品谱系:UniPoD S80000覆盖32卡到1024卡全系列,单机柜最高128卡,弹性扩展可到16384卡。第一财经厂商同时宣称训练性能提升70%、推理性能提升3倍——注意,这两个倍数出自自家测试条件,第三方实测口径目前还没有公开,写标书引用时要留一手,别把宣传指标当验收指标。
第二个数字是这张网的分层:华三把网络拆成Scale-Up机内互联、Scale-Out集群内互联、Scale-Across跨域互联三层,强调全链路无阻塞。知乎这对做了几年fabric的人是双刃剑:好消息是超节点不会取消Scale-Out,高频强耦合的通信留在Scale-Up域里,跨超节点的大规模扩展还是你熟的那套以太网——你的工作没有被"吸收进机柜",变的只是分工边界。知乎坏消息是你得对三层域的协同负责,而不只是自己那台交换机有没有拥塞。
还有一个容易被当成公关话漏掉的:WAIC 2026期间,在人工智能工委会牵引下,国内数十家产业链伙伴共同启动了G-Link通用高速互连标准建设,设计理念写着"软硬解耦"和"开放的Scale-Up互联"。知乎它和华为专有互联路线摆在一起,差异不在性能宣传,而在绑定风险的分配:白皮书里把UALink、CXL、ESUN、OISA、UB、G-Link所有路线都过了一遍的厂商,赌的就是智算中心不愿意永远只围着一家芯片、一家交换、一套软件栈建设。知乎
至于那第三个数字的底气——“适配兼容超过100款AI加速卡、与20余家国内芯片厂商建立深度合作”,是新华三高级副总裁刘新民在WAIC现场的原话。知乎
这个秋天接单的三笔账
第一笔:机柜点不点得亮。 超节点整机柜交付,第一关不是网络是建筑。单机柜功耗跳涨之后,供电容量、液冷管路、Manifold、漏液检测、楼板承重全是前置条件,中金9月8日的研报专门算了这笔账:预计2028年国内超节点液冷配套市场规模将达到148亿元。东方财富华三的白皮书里也确实花了大量篇幅讲机房条件、整柜交付、液冷管路、Manifold、漏液检测、训前巡检这些细节。知乎这不是书呆子气,是整柜交付真的会卡在"设备到了、机房点不亮"上。弱电和机房承包的人,报价前先去客户机房看配电间和冷源,比翻产品手册有用。
第二笔:标书条款怎么写。 "1024卡超节点一套"这种写法,给的是产能,不是效率。真正该写进技术条款的:Scale-Up带宽域的大小和语义(内存寻址还是纯RDMA)、RAS指标(故障隔离粒度、训前巡检覆盖率)、交付范围里液冷供电的界面划分。Kimi K3的技术博客已经替客户把门槛立好了:2.8万亿参数的模型,官方明确建议在64张及以上加速卡组成的超节点配置中部署。第一财经大模型厂商开始用通信域规模定义部署门槛了,标书还停留在"卡数×单卡算力"就落后了。
第三笔:验收之后谁来值夜班。 华三反复讲"IT运维和CT运维合而为一"、AD-DC智算版软件栈、故障自愈。对甲方网工,这笔账最实际:现有值班表、巡检SOP、故障工单模板,多少条在整柜超节点上还成立?答案是大部分不成立——机柜级紧耦合之后,一次漏液告警的处置优先级,可能高过你过去处理过的任何一起广播风暴。培训窗口应该在签合同之前问清楚,别等上线了才谈。
别拿股市的节奏排机房的工期
反证也要摆上桌:这波"超节点"声量里有一部分是金融侧的,统计口径下紫光股份7月1日到22日股价累计上涨58%、市值站上1300亿元。36氪券商讲"十倍弹性"、机构闭门会喊"64卡成主流"——但"64卡成主流"目前只是调研口径,不是任何集采规范里的数字:移动集采按"套"招、阿里实例按64卡卖、华三从32卡起做全系列,标准还没收敛。你在机房里要的是可验收的条款,不是叙事。
三类人分开行动:正在写标书的集成商,把第二笔账的三组条款先补齐再报价;在机房值班的华三系网工,趁这波把Scale-Across和液冷告警处理捡起来,这是从"配交换"跳到"整柜交付"的门票;只关心紫光和新华三股价的,盯9月8日那批定增问询函回复文件就行,产能和订单的事,公告里问出来的比股吧里喊出来的准。
接下来值得盯的三个信号:G-Link第一批芯片和整机的适配名单;运营商下一轮集采的技术规范怎么写Scale-Up条款;以及S80000整柜交付的第一个公开案例。白皮书三百页是承诺,机房点不点得亮,才是兑现。