华为阿里隔5天先后发布「超节点」:真武V900的3倍、昇腾960的提前三个季度,哪些数字该当真

源自28位全网作者

15:50

9月的国产算力圈,出现了两年来最整齐的一幕。9月17日华为全联接大会2026上,轮值董事长汪涛公布了一个让产业链意外的消息:昇腾960提前就绪,性能翻番。 仅隔5天,杭州云栖大会上阿里平头哥发布新一代训推一体芯片真武V900,B站有UP主干脆把这5天称为"国产算力系统级突围加速:华为、阿里仅隔5天"。 更值得玩味的是,两家发布会通稿的关键词,破天荒地不再是单卡算力跑分,而是同一个词——超节点。如果你是被CUDA喂大的AI Infra工程师、正在给公司看智算选型的决策人,这篇就是替你核完两本账后写的:哪些数字可以当真,哪些口径要打折扣,接下来9个月盯什么信号。知乎哔哩哔哩

先把两本账摆开:960超节点 vs 真武V900超节点

华为这边(全联接大会2026,据现场报道口径):

  • 昇腾960DT定于2027年一季度发布,比原计划提前三个季度;960PR排到2027年三季度,也提前了一个季度,此后970、980按"一年一代"直接画到2029年。知乎

  • 昇腾960超节点:全球首个NPO光引擎超节点,可扩展4096卡,披露8 EFLOPS FP8 / 16 EFLOPS FP4,用5500颗Hi-ONE替代原约4.8万颗800G光模块,功耗降低超550kW、可用度99.8%。知乎

  • 交付账更硬:昇腾910C超节点部署超1000套、950开始规模商用、超节点客户370+,上一代950的官方口径是1024卡、1 EFLOPS FP8、256TB统一内存、互联RTT 3μs,CANN开源社区月活开发者超3500人。

阿里这边(云栖大会,官方口径):

  • 真武V900,训推一体AI芯片:216GB大容量显存、片间互联带宽1200GB/s、原生支持FP8/FP4,官方说法是"单芯片性能是真武M890的3倍",并称其为目前算力性能最强的中国自研AI芯片。知乎

  • 与自研ICN Switch互联芯片组成超节点,官方称具备原生内存语义和内存统一编址能力、可实现千卡全带宽高速互联,同一套架构覆盖单机8卡到千卡集群;再配上磐脉智能网卡、镇岳SSD主控和倚天CPU,走的是"算存网"全栈协同。

  • 落地口径:官方数据显示真武系列芯片已经服务超过650家企业客户,真武超节点实例宣称是国内首个跑通Qwen3.8、Kimi K3两大超2万亿参数模型的超节点。

华为阿里隔5天先后发布「超节点」:真武V900的3倍、昇腾960的提前三个季度,哪些数字该当真

单卡这条线也要记一笔,平头哥的迭代节奏是"每代3倍":2024年首颗训推一体的真武810E起步,2026年5月的阿里云峰会上真武M890亮相,144GB显存、800GB/s片间互联、支持FP32到FP4多种数据精度;仅仅四个月后,V900把显存顶到216GB、互联推到1200GB/s,时间比外界预期大幅提前。 华为则是把"一年一代"写进时间表,用"提前三个季度"这种在芯片行业极其罕见的词,证明自己整条链路过了临界点。知乎

为什么突然都不晒单卡TFLOPS了

这不是发布会话术的巧合,是负载结构变了。

2026年的主流大模型几乎全员MoE:"专家"往往分布在不同AI芯片上,每个Token都要根据路由结果被动态发送给对应的专家,计算完成后再重新汇集,由此产生了大量All-to-All通信。 带宽和时延跟不上,"专家并行"省下的计算就会全赔在通信里。Agent浪潮又叠了一层:复杂任务要经历规划、推理、调用工具、读取数据、再次推理等几十轮循环,上下文窗口突破百万级,导致KV Cache不断膨胀,多Agent协同再带来海量并发。知乎

于是衡量算力的公式从单一的"算力"一项,变成了"算力×内存×互联"。华为的AI基础设施开始引入PB级KV Cache支持,官方口径是10万卡将成为十万亿级参数模型训练的新标配。 社区讨论里也随之出现一个耐人寻味的转向:衡量指标从单卡TOPS转向芯片利用率、通信时延、可用度、有效Token。拿这把新尺子回头量V900,三个升级点恰好一一落位:低精度降推理成本、216GB扩单卡承载、1200GB/s缓解通信压力。说白了,单卡再快,卡间传不动就是摆设;堆卡数谁都会,难的是让一堆卡在训练和推理时表现得像一台机器。知乎

真假超节点:三道门槛逐条对照

"把128张卡用网线连起来"不叫超节点。按Scale-up/Scale-out的通行定义,超节点要让同一集群的算力卡像一个统一计算引擎,得连闯三道门。

第一道门是内存语义:彻底摒弃消息语义,走向更底层的Load/Store级内存直接访问,让芯片A读芯片B的显存像读本地内存一样——微秒级的AI通信,"发包-封包-路由-解包"的开销不可忍受。 第二道门是统一编址:物理连起来不等于逻辑上一台机器,要把分散的资源抽象成统一地址空间,否则程序员还得自己处理数据放置。第三道门是规模不缩水的全带宽:8卡好办,难的是从几十卡放大到几百乃至上千卡后,依然保持足够高的带宽、低时延和稳定通信。知乎

对照两家:阿里的答案是ICN Switch交换芯片,官方强调内存语义、统一编址、千卡全带宽三样齐全,同一套架构覆盖单机8卡到千卡集群;华为的答案是NPO光互联把4096卡焊成一台机器,而且不是PPT——昇腾超节点已经过了千套装机、370多家客户的工程验证。两家在这三道门上的口径都是完整的,真正的分歧在下一个问题:这些能力,你什么时候能用上、敢不敢押上去。

华为阿里隔5天先后发布「超节点」:真武V900的3倍、昇腾960的提前三个季度,哪些数字该当真

哪些数字要先打七折

热闹归热闹,社区里的冷水同样值得听。我筛了四条最容易被带节奏的口径。

"3倍"是自比,不是他比。官方只给了相对M890的倍数,绝对算力参数没有公布,微博上已经吵成两派:一派翻出旧账,“当年升腾910A参数发出来,世界最强"结果体验拉胯,不发参数反而务实;另一派直接吐槽"什么参数都无”。 对工程选型来说,纸面倍数算不出tokens/s,等第三方集群实测才是硬道理。微博

发布≠能用。多方信息把真武V900的量产时间指向2027年一季度,随后才在阿里云数据中心规模化部署——也就是说,未来一年多市场上真正可买可租的仍是M890这一代,“发布"和"交付"之间隔了整整两个季度。 有科技博主的判断更直白:纸面硬件规格对标英伟达H200,显存容量甚至更高,不过芯片预计2027年一季度才量产,软件生态、大规模集群实测仍有追赶空间。 昇腾960DT同样排在2027年一季度,两家在这件事上难得同步:新品都是"期货”,现在能下单的都是现款。知乎微博

华为阿里隔5天先后发布「超节点」:真武V900的3倍、昇腾960的提前三个季度,哪些数字该当真

愿景数字和装机数字要分账。云栖这天阿里一天扔出三颗"炸弹"——10万亿参数的Qwen4在训练、性能翻三倍的自研芯片真武V900、六年做到20GW的数据中心,去现场逐条"验真"的UP主也提醒要把每颗的口径掰开看。 "50万卡单集群"则是阿里云智算网络的规划口径,官方说法是可稳定支撑50万卡规模单一AI集群——规划能力离已交付的机房还有一段距离。 对比之下,"超节点部署超1000套、客户370+"这种可考核的装机量,含金量反而更高。哔哩哔哩知乎

生态不是发布会能解决的。CUDA十几年攒下的算子库和调优习惯,不会因为一颗新卡一夜平移;而政企智算中心已经用真金白银换来一条铁律:同一分布式训练任务内,严禁跨不同厂商混插异构芯片,"64张GPGPU+64张NPU凑128卡"的翻车案例就写在架构师的课件里。 异构凑卡听起来省钱,学费已经有人交过了。知乎

现在动手还是再等等:三份人群清单

  • 租云上国产算力的应用团队:先别追新品。盯Q4阿里云真武超节点实例、华为云昇腾实例的实测吞吐与价格曲线,M890/950这一代实例的性价比变化比2027年的新卡更影响你的毛利;推理负载(对生态依赖低、对单位成本敏感)适合先迁,训练大模型继续观望。DeepSeek传出将采购16万颗华为AI芯片这类订单信号,也印证了推理侧先动。知乎

  • 准备自建或采购的决策人:把2027年一季度设为观察哨——V900量产与昇腾960DT发布都卡在这个季度,届时的良率爬坡、供货连续性,才是"提前三个季度"这个故事的照妖镜。现在值得做的,是拿你们最小的真实模型在T-Head SAIL或CANN上跑一次迁移POC,实测算子覆盖率和人天成本,而不是听任何一家的PPT。

  • 一线工程师:这个窗口期熟悉一套国产软件栈的职场性价比,大概率高于再刷一个通用框架证书;MoE和Agent负载下,通信Profiling能力——看清All-to-All到底吃掉多少时间——会是最稀缺的技能,两家发布会没晒的恰恰就是这项。

一句话收束:这一轮国产算力的分水岭,不再是"谁能堆出更多卡",而是"谁的千卡能在生产环境稳定像一台机器,按可预期的价格吐出tokens"。960的提前和V900的3倍,最终都要用装机量、实测吞吐和价格结账。你手上如果有MoE推理任务,愿意先交给国产卡,还是继续加钱买N卡?评论区聊聊你的实测数据。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章