十万张芯片泡澡散热,曙光8000如何把PUE压到1.04

源自157位全网作者

11:55

精选参考来源

1
#算力到底有多耗水# 曙光8000超算全速运转一年半,产生的热量足以烧干西湖,这个直观比喻,撕开了AI算力背后巨大能耗的真相。 现在大模型训练、推理的本质,就是用能源换算力。海量芯片持续运算会疯狂产热,传统风冷早已扛不住,浸没式液冷才成了高端算力中心的标配。大量冷却液、冷却水用来带走热量,水资源和电力消耗居高不下。 很多人只看见AI大模型飞速迭代,却忽略它巨大的资源代价。AI不是凭空诞生的技术红利,每一次对话、每一轮模型训练,都在消耗能源。未来算力竞争,拼的不止芯片,还有电力、水资源和散热技术,绿色算力,会成为行业必须攻克的难题。
2
芯片烧到极限时,给它降温得靠金刚石铜。海量芯片一起跑,最先崩的往往不是电力,是热量。芯片越密,热量越容易散不出去,这样频率就得降,算力就上不去。 超算互联网核心节点(曙光8000)的解法,是液冷团队引入金刚石铜材料,从材料层面把散热瓶颈顶开。9月25日起每晚19:27,CCTV-9四集连播《超级工程—曙光8000》,其中一集的主角就是"冷"。 散热只是关键之一。要让十万张芯片像一台机器那样干活,网络用交换芯片自主切换路径,局部故障恢复从分钟级到毫秒级;存储搭十亿量级"超级隧道"扛住并发读写。 冷得住才跑得满:全脑860亿神经元模拟、3.16万亿原子DFT模拟、328万亿网格湍流直接模拟,都在超算互联网核心节点上跑通。 #超算互联网# #液冷散热# #超级工程# #硬核科技#
全部
来源
内容由AI生成

精选参考来源

1. #算力到底有多耗水# 曙光8000超算全速运转一年半,产生的热量足以烧干西湖,这个直观比喻,撕开了AI算力背后巨大能耗的真相。 现在大模型训练、推理的本质,就是用能源换算力。海量芯片持续运算会疯狂产热,传统风冷早已扛不住,浸没式液冷才成了高端算力中心的标配。大量冷却液、冷却水用来带走热量,水资源和电力消耗居高不下。 很多人只看见AI大模型飞速迭代,却忽略它巨大的资源代价。AI不是凭空诞生的技术红利,每一次对话、每一轮模型训练,都在消耗能源。未来算力竞争,拼的不止芯片,还有电力、水资源和散热技术,绿色算力,会成为行业必须攻克的难题。

2. 芯片烧到极限时,给它降温得靠金刚石铜。海量芯片一起跑,最先崩的往往不是电力,是热量。芯片越密,热量越容易散不出去,这样频率就得降,算力就上不去。 超算互联网核心节点(曙光8000)的解法,是液冷团队引入金刚石铜材料,从材料层面把散热瓶颈顶开。9月25日起每晚19:27,CCTV-9四集连播《超级工程—曙光8000》,其中一集的主角就是"冷"。 散热只是关键之一。要让十万张芯片像一台机器那样干活,网络用交换芯片自主切换路径,局部故障恢复从分钟级到毫秒级;存储搭十亿量级"超级隧道"扛住并发读写。 冷得住才跑得满:全脑860亿神经元模拟、3.16万亿原子DFT模拟、328万亿网格湍流直接模拟,都在超算互联网核心节点上跑通。 #超算互联网# #液冷散热# #超级工程# #硬核科技#

3. 0.05毫米、9层部件、PUE 1.04,央视要揭秘机房里的“超级工程”! 干过机房项目的人,看到曙光8000的参数,很难没反应。9层部件塞进不足9厘米空间,装配精度做到0.05毫米;液冷用浸没相变,PUE做到1.04;还有湖水冷却加余热回收,年减排CO2 4万吨。现在这些细节要被央视《超级工程》拍进去了,明晚起CCTV-9晚上7点27。 以前大家聊超级工程,容易想到户外大场面。但真正进过机房就知道,机柜、线缆、液冷、供电、地坪,任何一个微小偏差,都可能传到光模块和计算设备上。上百个团队一起干,设计变更超过100次,光纤连接还要挑灰尘少的时间窗口。这些事不上镜则已,一上镜全是功夫。 我比较期待纪录片怎么处理“工程”和“人”的关系。系统再大,最后还是要靠一群人把参数一点点磨出来,把标准一条条落下去。0.05毫米这种数字,背后不是浪漫,是反复试、反复改。 如果你也好奇一套十万卡系统怎么从图纸变成稳定运行,这波可以蹲。至少对我来说,看央视拍的肯定比看参数有意思多了。 #科技自主# #曙光8000# #超级工程#

4. 真的被低估了!曙光8000的巧思远比堆芯片更厉害 提起曙光8000,很多数人第一反应就是堆芯片、拼规模。但看完央视《超级工程》的预告才发现,这台国产超集群藏着超多意想不到的精妙设计。 造这套十万卡AI超集群,最难的是攻克一堆世界级的工程难题。比如散热卡顿、数据拥堵、突发故障等,随便一个小问题都会被无限放大。 为了解决这些痛点,研发团队脑洞全开、巧招频出。创新金刚石铜液冷工艺,搞定高密度算力散热难题;搭建十亿级数据超级隧道,保障海量数据高速传输,更是把系统故障恢复从分钟级压缩到毫秒级,稳定性直接拉满。 印象最深的是团队借鉴古建筑斗拱的结构原理,打造高密度算力模块,破解现代顶尖科技难题。真的太有巧思了。 这些硬核攻关细节平时几乎很少公开。这次《超级工程》直接把镜头扎进研发现场,把幕后攻关故事拍出来,让我们知道,强大的国产算力从不是冰冷参数,而是一群工程师一点点打磨出来的成果。9月25日至28日锁定CCTV-9,一起看看曙光8000背后这些有意思的设计。 #国产算力##中科曙光##央视超级工程##曙光8000#

5. 今天圈里有人转来央视《超级工程——曙光8000》的预告,看完最大的感受是:十万卡最难的地方,还真不是凑够十万张卡。 系统一大,局部传输异常、数据拥堵和设备波动都会被成倍放大。某个节点出了状况,任务如果等着人工处理,整套集群的效率很快就会被拖下来。曙光8000的网络团队做了一件很硬的事:让交换芯片自主寻找新路径,把系统故障恢复从分钟级压到毫秒级。 从几分钟到几毫秒,字面上只是单位变了,放到长期运行的科研任务里,可能就是一次任务能否继续推进的差别。 与此同时,存储团队还搭起十亿级数据“超级隧道”,保证海量数据跟得上计算节奏;液冷团队用金刚石铜材料处理高密度芯片的散热压力。计算、网络、存储、液冷,没有谁能单独交卷。 央视用四集拆解曙光8000,拍的就是这种环环相扣的工程难度。9月25日起CCTV-9开播,真正懂系统的人,估计会看得很过瘾。 #算力基础设施# #曙光8000# #超级工程# #中科曙光#

6. 一辆汽车的零件大约两万个。超算互联网核心节点(曙光8000)的零件超过10亿个。 9月25日起每晚19:27,CCTV-9四集连播《超级工程—曙光8000》,分别拆解计算、网络、存储、液冷工程背后的秘密:对接误差压进0.2毫米;网络故障恢复从分钟级做到毫秒级;液冷用金刚石铜给芯片降温。 曙光8000已跑完全脑860亿神经元模拟、3.16万亿原子DFT模拟、328万亿网格湍流直接模拟。更关键的是,它只是超算互联网的一个核心节点。 #超算互联网 #超级工程 #硬核科技 #中科曙光

7. 凭什么登上央视《超级工程》?曙光8000的硬实力藏不住了 很多人看到消息第一反应都会好奇:港珠澳大桥、高铁之后,凭什么是曙光8000拿下《超级工程》的主角位置?网上深扒了一下,才算是明白这套算力集群到底有多厉害。 先说系统研发层面,十万张芯片、1万多个计算节点要协同工作。研发团队借鉴古建筑斗拱思路设计高密度模块,组装误差控制在0.2毫米;系统网络做到毫秒级故障切换,局部出问题不会拖累整套算力,工程设计的巧思直接拉满。 建设上更是层层闯关,十亿量级数据传输隧道、金刚石铜裸片直焊液冷方案,解决超大集群的数据吞吐和散热难题。而且它不是停留在实验室的样机,已经投入真实科研任务。前段时间和气象局合作,曙光8000一小时就能算出全球5公里分辨率、未来10天的气象预报,让我国全球数值预报迈入国际第一梯队。 这也是这部纪录片最大看点:不只是罗列参数,而是跟着镜头看团队怎么一步步完成整套系统工程。9月25日CCTV-9开播,一起看看曙光8000如何用算力,撑起国内前沿的科学探索。 #央视超级工程##算力##曙光8000#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章