这三天,只要你关注科技圈,大概率被这个话题刷屏过:#华为突破冯诺依曼单机架构#。
9月17日,华为全联接大会2026在上海世博展览馆开幕,华为发布了一个叫 Peerium 的全新计算架构,官方口径是"让百万级处理器成为一台计算机"。观察者网一条微博收获四千多赞、近八百条评论,评论区直接打成三方混战:一派喊"华为基础研究太厉害了",一派阴阳"重新定义计算机架构",还有一派老老实实承认"不明觉厉"——连胡锡进都发了条"不明觉厉!为华为点赞加油"。知乎那边更热闹,有人提问"如何评价华为继推出韬定律后,又发明Peerium计算架构,宣称突破传统图灵与冯诺依曼架构",高赞回答一句话噎死人:“一张口就是颠覆、突破、重新定义……现在直接开始无实物表演了”。观察者网微博
同一件事,为什么读中文新闻稿的人和读英文论文的人,得出了完全相反的结论?这事到底该赞还是该喷?我把官方措辞、技术细节、硬件交付、反对声音全部对了一遍,今天给你拆清楚。先说结论:话术确实夸大了,但夸大的话术底下,压着真实的硬件。这不是一场"无实物表演",而是一场"实物到位、文案用力过猛"的发布会。

一、Peerium 到底解决什么问题:不是"芯片不够快",是"卡多了不干活"
先别管冯·诺依曼,看一个扎心的数字。华为副董事长、轮值董事长汪涛在大会上说:业界10万卡集群的 MFU(模型浮点算力利用率)连30%都不到。翻译一下:你花几十亿买的10万张卡,七成时间处于故障或故障修复状态,真正在算的不到三成。通信占掉训练时间的40%以上——卡与卡之间搬数据,比计算本身还耗时。知乎微博
这不是华为一家的问题,是整个AI算力行业的病。传统集群的本质是"一堆单机用网络连起来":每台服务器内部CPU当老板,GPU/NPU、网卡、硬盘全是打工的,事事经过CPU中转;机器之间再靠以太网传消息。卡从1万堆到10万,通信开销不是线性涨,是指数膨胀,单卡性能提升全被规模效应吃干净。风云学会陈经在微博上打了个通俗的比方:好比打大型网游,网络卡了,你的主机性能再牛,体验也不行。
Peerium 就是冲着这个病去的。官方定义:基于嵌套并行、统一内存寻址、平等互联,实现百万级处理器强扩展的计算架构。三根技术支柱,用人话说就是三件事:
第一,灵衢(UnifiedBus)总线——让所有设备说同一种语言。 传统架构里NPU走PCIe、硬盘走NVMe、网络走以太网,十几种协议并存,设备对话全靠"翻译"。灵衢把协议归一,CPU、NPU、内存、SSD、网卡平等地挂在同一条总线上,谁也不用经过CPU这个"老板"中转——所谓"颠覆主从架构",说的就是这个。关键指标:灵衢2.0把芯片间通信延迟压到200纳秒,跨机柜时延从7微秒降到3微秒,跨柜通信接近柜内通信。作为对比,英伟达NVLink最大支撑576卡互联,灵衢支撑的是8192卡。微博
第二,统一内存寻址——整个集群变成"一块大内存"。 Atlas 950超节点里,8192张昇腾卡的HBM被聚合成1152TB的统一编址共享内存池,任何芯片用全局唯一地址直接读写,不需要知道数据物理上在哪。陈经给了个程序员秒懂的例子:以前大模型训练的参数同步要写 a = recv(b)(网络调用),现在直接写 a = b(内存读写)。这就是"百万处理器成为一台计算机"在技术上的真实含义。
第三,Nested BSP 嵌套并行——分层同步,别开全员大会。 百万处理器如果每轮计算都全局同步,同步开销直接爆炸。Nested BSP 用"团队→部门→全集团"的分层方式做信息对齐,把同步成本压下来。
三件事合起来,就是华为给出的答案:单芯片制程被卡脖子,那就用系统架构创新把"卡海"拧成"一台机器",用规模和互联效率弥补单点性能差距。
二、最大的争议点:"突破冯·诺依曼"到底是不是吹牛
这是全网吵得最凶的地方,也是水分和干货最容易混在一起的地方。
先看华为中文新闻稿的三个词组:“彻底突破冯·诺依曼单机架构限制”“突破传统图灵范式限制”“颠覆了长久以来的主从架构”。有博主翻出华为的英文稿,原话是 extends the von Neumann single-machine architecture——extends,延伸,不是推翻。中文的"彻底突破"和英文的"延伸",一个词的温差,就是这场舆论战的火源。知乎知乎
那技术上到底怎么算?陈经的判断我认为是全网最清醒的一个:"突破冯·诺依曼单机架构"是哲学意义上的——每颗昇腾芯片内部,依然是存储程序、顺序执行的冯·诺依曼式处理器,这一点没有任何突破;突破的是"单机"的边界,从一台服务器扩展到了百万处理器。系统层面上,“冯·诺依曼瓶颈"的表现(CPU中心化、数据搬运为主)确实不存在了,所以说"突破”。但这不是推翻了存储程序原理。微博

还有个更狠的吐槽来自微博博主"多云Me":华为这次确实做成了一项很硬的工程——通过灵衢总线让最多4096张昇腾卡在一个超节点里尽量像一台计算机协同工作。"但估计营销部门看完,觉得’4096张卡像一台机器’还不够震撼,于是顺手把……"后面的话不用我说你也懂。微博
那Peerium算不算"从0到1"的发明?严格说,不算,它是集大成。BSP(批量同步并行)模型是图灵奖得主 Leslie Valiant 在1990年提出的,Nested BSP 是在此基础上的递归扩展变体。统一内存寻址的"表亲"RDMA技术,2000年代初就由 InfiniBand 联盟提出,谷歌TPU集群、英伟达NVLink都在做类似的事;数据中心的CLOS、胖树拓扑,学术界研究了十几年。华为真正的贡献,是把这些分散了几十年的理念第一次整合进同一个系统、统一成一套总线协议、并且做到工程上可部署——这本身就是极高的门槛,但它是"集大成",不是"理论开创"。知乎
所以这一节的判决是:"彻底突破冯·诺依曼"这个说法,夸大了;"把单机边界拓展到百万处理器、并且硬件已经落地"这件事,没夸大。 真正配得上"颠覆冯·诺依曼"名号的,是存算一体、量子计算、光子计算、类脑芯片那一档——它们试图从根上改变"算"和"存"的关系。Peerium 不在那一档,它是把经典架构的工程极限拉到了前无古人的规模。
三、为什么这么多人不信:一笔"韬定律"留下的旧账
Peerium 的舆论环境,绕不开四个月前的另一场争议。
今年5月25日,华为董事、半导体业务部总裁何庭波在中科院科技论文预发布平台发表论文,提出"韬(τ)定律"——用"时间缩微"替代"几何缩微",晶体管不一定做得更小,但通过电路的三维重构让信号跑得更快。当时冷嘲热讽的人很多,前华为科学家杨学志发文痛批这是"营销包装,消费民族公信力",知乎上相关提问挂了一个夏天。不过有意思的是,知乎上对杨学志的反呛也很直接:这位曾预言"5G将是一个彻底的失败通信技术",“我觉得可以把他的言论当做一种反向指标”。知乎知乎
然后就是打脸时刻:9月8日,全球首款落地韬定律、采用逻辑折叠技术的麒麟9050 Pro随Mate XT2三折叠发布,9月12日首销秒罄。实测数据帧率提升12%、功耗下降8%、温度下降8度,最低帧率几乎翻倍。何庭波9月4日又在ChinaXiv更新了论文《Huawei’s τ Chip Was Supposed to Melt?》,补充工程细节回应质疑。知乎知乎新浪科技
看出模式了吗?华为的技术叙事一直是"大词开路",但硬件至今一路兑现。 韬定律如此,Peerium 大概率也是同一部剧本:先用震撼性话术把声量拉满,再用交付把质疑逐条掐灭。这也是为什么"该不该信"这个问题,现在没法给出终局答案——你能做的,是把"话术"和"实物"分开记账,然后盯着交付看。
四、别急着赞:这份"打折清单"请收好
吹之前,先把发布会数据里需要打折的部分挑出来:
MFU提升2.75倍:这是4K超节点组成10万卡集群对比传统8卡服务器架构的数字,出自马尔科夫实验室的仿真结果,不是现网实测。仿真和现网之间隔着什么,做过交付的都懂。知乎
99.8%系统可用度:发布会数据。发布会上的可用度和机柜里的可用度之间,隔着运维团队、环境差异和长期老化。
昇腾960超节点:本次大会的明星(业界首个采用NPO近封装光学技术,单节点4096卡、8 EFLOPS FP8算力),但它是2027年的货——960DT训练版2027年Q1就绪,960PR推理版2027年Q3。今年能摸到的是950。新华网
HBM是真的卡脖子:950DT加速卡两个月内涨价20%-50%,单价突破25万元/片。涨的不是华为想多赚,是HBM成本在涨——950系列被迫拆成两种自研HBM版本,本身就是供给逼出来的工程妥协;国内长鑫产能刚爬坡,业内估计制裁前囤的库存2026年耗尽。
DeepSeek的16万颗大单是"期货":芯片投资超400亿元、部署在乌兰察布1GW数据中心,这单子是行业对昇腾体系的最大信任票,但950DT按路线图2026年Q4才上市,16万颗全部交付可能需要一年以上。订单是意向,交付才是事实。

五、也别跟着喷:这份"硬货清单"同样真实
反过来,嘲讽"无实物表演"的人,需要解释一下这些"实物":
910C超节点已部署超1000套:意味着至少1000个真实生产环境在7×24小时积累运行数据,这比任何仿真都值钱。
25.6万卡昇腾950超节点集群已进入部署阶段:注意,是部署中,不是PPT规划。
Hi-ONE光引擎是业界首个量产NPO产品:5500个光引擎替代4.8万颗800G光模块,功耗直降超550kW,故障点数量级压缩,单体传输容量7.2T。新华网
灵衢2.0的200纳秒芯片间时延:华为干了三十多年通信的老本行,这是"联人、联机器"积累换出来的绝活。华为高管反复讲的逻辑很朴素:单颗芯片算力比英伟达有差距,但在联接技术上强力投资实现突破,就能做到万卡级超节点、做到世界算力最强。微博
今年7月WAIC上的公开对比:Atlas 950 SuperPoD真机首展,算力卡规模、总算力、内存容量、互联带宽分别是英伟达NVL144的56.8倍、6.7倍、15倍和62倍。对比口径值得细究(卡数规模不等于单卡性能),但真机摆在那里。微博

一句话总结这两节:华为在单芯片上确实落后,在系统工程上可能反而走在了前面——这不是安慰,是被制裁逼出来的路线。 没有CUDA可依靠,没有NVLink可使用,只能自己造总线、造光引擎、造存储、造调度,把从协议层到物理层的全栈撸一遍。英伟达靠生态垄断闭环,华为靠垂直整合加开源(CANN),两条完全不同的路,都在从"卖单卡"转向"卖体系"。
六、这事跟你有什么关系
如果你是等Mate90、用华为手机的普通消费者:说实话,没有直接关系,别指望Peerium让你的手机变快。间接关系有两条:一是昇腾算力是华为云和小艺AI的底座,你手机里AI功能的体验上限,取决于这层算力基建;二是麒麟芯片的产能逻辑和韬定律、Peerium是同一套"制裁下全栈自研"的剧本——看懂了这个,你就看懂了华为所有发布会的底层叙事。
如果你需要谈资:记住三句话就够了。第一,Peerium突破的是"单机"的边界,不是冯·诺依曼原理,中文稿的"彻底突破"和英文稿的"extends"差了一个翻译的温度。第二,硬指标是三个数:8192卡一个超节点、1152TB统一内存池、200纳秒芯片间时延。第三,它是集大成不是从0到1——BSP模型1990年就有了,华为的本事是把三十年的学术理念做成了可部署的工程。
如果你关注产业和投资(不构成任何投资建议,只给观察信号):接下来半年盯四件事——950DT四季度上市的实际交付节奏、HBM涨价会不会传导到算力成本、DeepSeek乌兰察布项目的落地进度、以及2.75倍MFU提升有没有现网实测数据放出来。任何一件兑现或爆雷,都会重新定价"华为算力"这四个字。
写在最后
观察者网那条微博的评论区里,有一条不太起眼但被顶得很高的评论:“其实看得有好有不好,好就是国家技术不断突破,略微遗憾就是这种突破已经好久没出现在高校,而在企业”。观察者网
这大概就是Peerium这件事最真实的样子:不用神化,也不用贬低。华为没有推翻冯·诺依曼,但它完成了一件难度极高的工作——把沿用八十年的"单机"边界,拓展到了百万处理器的尺度,而且硬件已经在机房的机柜里跑起来了。当单芯片制程的墙越砌越高,算力竞争的重心正在从"单卡跑分"转向"系统架构",这场战争里,中国企业第一次不是跟随者。
至于"彻底突破"这种大词,交给时间就好——韬定律用三个月打脸了质疑者,Peerium 的验证周期会长一些,但剧本大概率是同一部。我们唯一要做的,是把话术和实物分开记账,然后盯着交付。