单机柜100kW:AI服务器散热的生死线

源自111位全网作者

01:29

精选参考来源

1
风冷扛不住了!AI机柜功耗飙到140kW,液冷从“可选”变唯一解
2
冷板式液冷 VS 浸没式液冷(AI算力机房) 一句话总纲:冷板式是当下商业化主力,兼容性强、运维简单;浸没式散热上限更高、PUE更低,但前期投入贵、运维门槛高,只适合超高密度大模型训练场景,短期不会全面替代冷板。 一、原理简单区分 - 冷板式:在GPU/CPU芯片表面贴带水道的金属冷板,冷却液只在冷板内部循环,液体不接触电路板。其余网卡、硬盘、电源还需要少量风扇辅助散热,属于间接冷却。 - 浸没式:把整台服务器浸泡在高绝缘冷却液(氟化液/硅油)里面,芯片、主板直接泡在液体中,热量直接传给冷却液,完全取消服务器风扇,直接接触式散热。 二、优缺点对比 ✅冷板式液冷(当前市场90%份额,主流方案) 优点 1. 服务器改动小,存量机房可以分期改造,不用推倒重建; 2. 运维方式和风冷接近,服务器可以直接插拔更换,工程师上手快; 3. 产业链成熟,浪潮、华为、英伟达H100/B200服务器标配冷板方案; 4. 单机柜支持25~100kW,足够绝大多数AI训练、推理集群;PUE一般做到1.1~1.2。 缺点 1. 只给核心芯片散热,硬盘、电源仍需要风冷辅助,散热天花板有限; 2. 单机柜超过100kW之后,管路、接头、泄漏风险会明显上升; 3. 很难做到PUE<1.1。 ✅浸没式液冷(细分高密场景,试点快速增长) 优点 1. 散热效率极强,PUE最低可做到1.05;单机柜轻松做到100kW+,未来可支持兆瓦级超高密度机柜; 2. 无风扇,机房噪音极低,芯片温度更稳定,长时间满载下GPU不容易降频; 3. 余热回收潜力大,热量可以回收供暖,适合绿电基地长期运营。 缺点 1. 初始投资高:定制服务器、机柜箱体、大量绝缘冷却液,CAPEX比冷板高30%-40%;氟化液很贵,还存在挥发损耗,持续耗材成本高; 2. 运维复杂:维修服务器需要从液槽里捞机器、排液、干燥;对元器件材料兼容性有要求,普通服务器不能直接泡; 3. 机房承重改造要求高,存量机房改造难度极大,基本只能新建机房; 4. 冷却液有环保、安全风险,泄漏处理麻烦。 成本算账:浸没式前期花钱多;运营周期超过6年,电费节省才能覆盖高出的建设成本,回本周期很长。 三、国内落地现状 1. 冷板式:已经大规模商用。阿里云、移动智算、联通智算、浪潮AI集群,绝大多数新建智算中心首选冷板。H100、昇腾950主流AI服务器标配冷板,适合25~80kW机柜的大模型训练、在线推理,东数西算贵州、宁夏、庆阳大量部署。 2. 浸没式:目前以试点、超算、超大模型训练集群为主,整体占比不到10%。 - 案例:贵安浸没式算力方舱、腾讯云、阿里云小规模浸没试点,河南郑州相变浸没项目; - 定位:单机柜100kW以上超高密度训练集群,适合持续不间断跑大模型预训练;在线推理业务基本不用浸没式,运维麻烦,性价比不划算 。 四、投资避坑要点(普通投资者重点看) 1. 很多宣传“浸没式液冷”项目,要看清楚:是已经大规模上架GPU,还是只是实验室/小样机试点; 2. 不要盲目迷信浸没式:不是PUE越低就越赚钱,要算全生命周期成本。如果机柜上架率低,浸没式高昂的前期投入会变成巨大负担; 3. 业务区分:在线推理优先冷板;超大算力长时间离线预训练,才值得考虑浸没式。 极简总结 短期(未来2-3年):冷板式依然是AI智算中心绝对主流; 中长期:随着H200、下一代超高功耗芯片普及,单机柜功率突破100kW,浸没式的占比才会慢慢提升。两者不是替代关系,是按机柜功率、业务类型分工共存。
全部
来源
内容由AI生成

精选参考来源

1. 风冷扛不住了!AI机柜功耗飙到140kW,液冷从“可选”变唯一解

2. 冷板式液冷 VS 浸没式液冷(AI算力机房) 一句话总纲:冷板式是当下商业化主力,兼容性强、运维简单;浸没式散热上限更高、PUE更低,但前期投入贵、运维门槛高,只适合超高密度大模型训练场景,短期不会全面替代冷板。 一、原理简单区分 - 冷板式:在GPU/CPU芯片表面贴带水道的金属冷板,冷却液只在冷板内部循环,液体不接触电路板。其余网卡、硬盘、电源还需要少量风扇辅助散热,属于间接冷却。 - 浸没式:把整台服务器浸泡在高绝缘冷却液(氟化液/硅油)里面,芯片、主板直接泡在液体中,热量直接传给冷却液,完全取消服务器风扇,直接接触式散热。 二、优缺点对比 ✅冷板式液冷(当前市场90%份额,主流方案) 优点 1. 服务器改动小,存量机房可以分期改造,不用推倒重建; 2. 运维方式和风冷接近,服务器可以直接插拔更换,工程师上手快; 3. 产业链成熟,浪潮、华为、英伟达H100/B200服务器标配冷板方案; 4. 单机柜支持25~100kW,足够绝大多数AI训练、推理集群;PUE一般做到1.1~1.2。 缺点 1. 只给核心芯片散热,硬盘、电源仍需要风冷辅助,散热天花板有限; 2. 单机柜超过100kW之后,管路、接头、泄漏风险会明显上升; 3. 很难做到PUE<1.1。 ✅浸没式液冷(细分高密场景,试点快速增长) 优点 1. 散热效率极强,PUE最低可做到1.05;单机柜轻松做到100kW+,未来可支持兆瓦级超高密度机柜; 2. 无风扇,机房噪音极低,芯片温度更稳定,长时间满载下GPU不容易降频; 3. 余热回收潜力大,热量可以回收供暖,适合绿电基地长期运营。 缺点 1. 初始投资高:定制服务器、机柜箱体、大量绝缘冷却液,CAPEX比冷板高30%-40%;氟化液很贵,还存在挥发损耗,持续耗材成本高; 2. 运维复杂:维修服务器需要从液槽里捞机器、排液、干燥;对元器件材料兼容性有要求,普通服务器不能直接泡; 3. 机房承重改造要求高,存量机房改造难度极大,基本只能新建机房; 4. 冷却液有环保、安全风险,泄漏处理麻烦。 成本算账:浸没式前期花钱多;运营周期超过6年,电费节省才能覆盖高出的建设成本,回本周期很长。 三、国内落地现状 1. 冷板式:已经大规模商用。阿里云、移动智算、联通智算、浪潮AI集群,绝大多数新建智算中心首选冷板。H100、昇腾950主流AI服务器标配冷板,适合25~80kW机柜的大模型训练、在线推理,东数西算贵州、宁夏、庆阳大量部署。 2. 浸没式:目前以试点、超算、超大模型训练集群为主,整体占比不到10%。 - 案例:贵安浸没式算力方舱、腾讯云、阿里云小规模浸没试点,河南郑州相变浸没项目; - 定位:单机柜100kW以上超高密度训练集群,适合持续不间断跑大模型预训练;在线推理业务基本不用浸没式,运维麻烦,性价比不划算 。 四、投资避坑要点(普通投资者重点看) 1. 很多宣传“浸没式液冷”项目,要看清楚:是已经大规模上架GPU,还是只是实验室/小样机试点; 2. 不要盲目迷信浸没式:不是PUE越低就越赚钱,要算全生命周期成本。如果机柜上架率低,浸没式高昂的前期投入会变成巨大负担; 3. 业务区分:在线推理优先冷板;超大算力长时间离线预训练,才值得考虑浸没式。 极简总结 短期(未来2-3年):冷板式依然是AI智算中心绝对主流; 中长期:随着H200、下一代超高功耗芯片普及,单机柜功率突破100kW,浸没式的占比才会慢慢提升。两者不是替代关系,是按机柜功率、业务类型分工共存。

3. 未来3年液冷渗透率推演(2026-2028) 一句话总纲:整体液冷的分化非常明显:AI高密训练集群渗透率快速拉满;普通推理服务器、通用业务服务器液冷渗透很慢。冷板式是绝对主力,液冷大盘里面长期占85%+;浸没式增速更高,但只在单机柜≥100MW超高密训练场景放量,整体份额到2028年大概也就10%~15% 。 重要区分:全部服务器的液冷渗透率 VS AI高密GPU服务器液冷渗透率,是两个完全不同的数字,很多报告容易混淆。 一、渗透率拆分 1)AI高密GPU服务器(H100/GB200、昇腾950这类训练集群) - 2025:约33% - 2026:50%~53% - 2027:65%~70% - 2028:75%~80% 逻辑:单机柜功率>25kW之后,风冷经济性大幅下滑;单机柜>40kW,新建项目基本强制液冷。未来3年新建离线训练集群,液冷基本成为标配。 路线内部结构:在这部分AI高密液冷里面,冷板式占85%~90%,浸没式10%以内;到2028年浸没提升到10~15%。 2)全部国内服务器(含普通CPU、低功耗推理服务器,口径最宽) 这个整体大盘渗透率会低很多,因为大量普通业务继续风冷: - 2025:约20% - 2026:37% - 2027:接近50% - 2028:约55% 3)冷板式 VS 浸没式份额(液冷内部的占比,不是全部服务器) - 冷板式:2025年93.5%;2028年维持85%以上,不会被浸没替代,只是份额小幅下滑。 优势:存量机房改造、运维、交付都成熟,适配25~80kW机柜,公有云、运营商新建智算首选。 - 浸没式:2025年6.5%;2028年提升至10%~15%。增速快,但基数小,市场体量远小于冷板。 定位:只给单机柜100kW+的超高密度离线训练集群,面向超大模型预训练;在线推理业务几乎不用浸没式 。 二、哪些场景渗透率提升最快(优先级从高到低) ✅第一梯队:西部离线AI训练智算中心(东数西算八大枢纽,贵州、宁夏、庆阳) 单机柜40~100kW,24小时不间断跑大模型预训练,PUE指标考核严格,天然适合液冷。新建项目液冷渗透率几乎100%,是液冷最大增量来源,优先冷板式,少量超高密试点浸没。 ✅第二梯队:运营商新建智算集群、公有云自建AI训练机房 三大运营商新建智算项目,液冷招标比例已经很高;头部云厂商H100/GB系列集群全部标配冷板。机柜功率大多30~80kW,冷板式为主。 ✅第三梯队:存量机房改造(中高密度GPU集群) 存量机房原来风冷,现在扩容上高功耗GPU,改造优先冷板式。浸没式很难改造存量机房,只能新建。 ⚠️提升很慢、液冷渗透率低的场景: 1. 在线推理集群:单机柜功率低(10~25kW),对延迟敏感,风冷足够,液冷性价比不高; 2. 普通存储、通用业务服务器:发热低,完全不需要液冷; 3. 边缘算力、小型机房:机柜数量少,液冷的工程、运维成本太高,基本继续风冷。 三、2个关键约束,决定渗透率上限 1. 机柜功率阈值是分界线 单机柜<25kW:风冷性价比更高; 25~100kW:冷板式液冷黄金区间(未来三年最大市场); >100kW:浸没式优势显现,但CAPEX高,只有超大模型训练项目才会选择。 2. 能耗指标、PUE政策,加速液冷落地 新建大型算力中心普遍要求PUE≤1.15,风冷很难达标,倒逼高密集群上液冷。但普通低密机房不受这个约束。 四、投资者要避开的认知误区 1. ❌误区:浸没式会取代冷板式 现实:分层共存,不是替代。绝大多数AI集群机柜功率落在25~80kW区间,冷板是最优解;浸没只在兆瓦级超高密场景使用。未来3年冷板依然是绝对主力。 2. ❌误区:所有服务器都会上液冷 普通推理、存储服务器依然大量风冷。液冷的渗透主线是高密度GPU训练集群,不是全部服务器。 3. ❌误区:渗透率线性上涨,不会波动 如果AI算力资本开支收缩,新建智算中心延期,渗透率提升节奏会直接放缓。 极简总结 未来3年,液冷渗透的核心战场是新建高密度AI训练集群,这一块渗透率会快速冲到75%-80%;普通服务器整体渗透率提升偏慢。冷板式持续占据液冷85%以上市场份额;浸没式增速更高,但只局限于单机柜100kW以上超高密预训练场景,整体盘子不大。 风险提示:仅产业科普,不构成任何投资建议。

4. 液冷会彻底淘汰传统风冷?中小型数据中心升级只能硬砸重金吗?

5. 曙光8000的计算芯片为何会产生如此巨大的热量?|AI大模型|并行计算|晶体管|集群|密度_新浪新闻

6. 曙光8000全速运转一年半的热量为什么能烧开西湖?|芯片|集群|液冷|散热|系统_新浪新闻

7. 曙光8000依靠“泡澡”解决算力散热难题

8. 曙光8000有多强?一年半热量能烧开西湖!|芯片|液冷|超级计算机|散热|系统_新浪新闻

9. 何以成就超级工程?曙光8000强闯三道“鬼门关”

10. 亿万克液冷服务器PUE多少

11. 单机柜900kW!PUE<1.04!曙光数创全球首发MW级相变浸没液冷整机柜,提前两年实现英伟达Feynman架构目标,已落地国家超算互联网核心节点!

12. 液冷技术的发展趋势与挑战:AI 算力时代的散热革命

13. 亿万克全浸没式液冷机柜机房PUE可以做到多少?

14. 冷板式液冷 VS 浸没式液冷(AI算力机房) 一句话总纲:冷板式是当下商业化主力,兼容性强、运维简单;浸没式散热上限更高、PUE更低,但前期投入贵、运维门槛高,只适合超高密度大模型训练场景,短期不会全面替代冷板。 一、原理简单区分 - 冷板式:在GPU/CPU芯片表面贴带水道的金属冷板,冷却液只在冷板内部循环,液体不接触电路板。其余网卡、硬盘、电源还需要少量风扇辅助散热,属于间接冷却。 - 浸没式:把整台服务器浸泡在高绝缘冷却液(氟化液/硅油)里面,芯片、主板直接泡在液体中,热量直接传给冷却液,完全取消服务器风扇,直接接触式散热。 二、优缺点对比 ✅冷板式液冷(当前市场90%份额,主流方案) 优点 1. 服务器改动小,存量机房可以分期改造,不用推倒重建; 2. 运维方式和风冷接近,服务器可以直接插拔更换,工程师上手快; 3. 产业链成熟,浪潮、华为、英伟达H100/B200服务器标配冷板方案; 4. 单机柜支持25~100kW,足够绝大多数AI训练、推理集群;PUE一般做到1.1~1.2。 缺点 1. 只给核心芯片散热,硬盘、电源仍需要风冷辅助,散热天花板有限; 2. 单机柜超过100kW之后,管路、接头、泄漏风险会明显上升; 3. 很难做到PUE<1.1。 ✅浸没式液冷(细分高密场景,试点快速增长) 优点 1. 散热效率极强,PUE最低可做到1.05;单机柜轻松做到100kW+,未来可支持兆瓦级超高密度机柜; 2. 无风扇,机房噪音极低,芯片温度更稳定,长时间满载下GPU不容易降频; 3. 余热回收潜力大,热量可以回收供暖,适合绿电基地长期运营。 缺点 1. 初始投资高:定制服务器、机柜箱体、大量绝缘冷却液,CAPEX比冷板高30%-40%;氟化液很贵,还存在挥发损耗,持续耗材成本高; 2. 运维复杂:维修服务器需要从液槽里捞机器、排液、干燥;对元器件材料兼容性有要求,普通服务器不能直接泡; 3. 机房承重改造要求高,存量机房改造难度极大,基本只能新建机房; 4. 冷却液有环保、安全风险,泄漏处理麻烦。 成本算账:浸没式前期花钱多;运营周期超过6年,电费节省才能覆盖高出的建设成本,回本周期很长。 三、国内落地现状 1. 冷板式:已经大规模商用。阿里云、移动智算、联通智算、浪潮AI集群,绝大多数新建智算中心首选冷板。H100、昇腾950主流AI服务器标配冷板,适合25~80kW机柜的大模型训练、在线推理,东数西算贵州、宁夏、庆阳大量部署。 2. 浸没式:目前以试点、超算、超大模型训练集群为主,整体占比不到10%。 - 案例:贵安浸没式算力方舱、腾讯云、阿里云小规模浸没试点,河南郑州相变浸没项目; - 定位:单机柜100kW以上超高密度训练集群,适合持续不间断跑大模型预训练;在线推理业务基本不用浸没式,运维麻烦,性价比不划算 。 四、投资避坑要点(普通投资者重点看) 1. 很多宣传“浸没式液冷”项目,要看清楚:是已经大规模上架GPU,还是只是实验室/小样机试点; 2. 不要盲目迷信浸没式:不是PUE越低就越赚钱,要算全生命周期成本。如果机柜上架率低,浸没式高昂的前期投入会变成巨大负担; 3. 业务区分:在线推理优先冷板;超大算力长时间离线预训练,才值得考虑浸没式。 极简总结 短期(未来2-3年):冷板式依然是AI智算中心绝对主流; 中长期:随着H200、下一代超高功耗芯片普及,单机柜功率突破100kW,浸没式的占比才会慢慢提升。两者不是替代关系,是按机柜功率、业务类型分工共存。

15. 算力火爆带热液冷赛道

16. 470亿液冷赛道爆火,增收反亏成常态,暗战才刚开始

17. 液冷与风冷散热方案对比,算力基建谁更具备长期潜力?

18. AI数据中心液冷产业全景解析:从配套设备走向算力基础设施

19. 跨界科技巨头联手英特尔,拿下数据中心液冷入场券

20. 空气能热泵能进数据中心液冷赛道吗?2026年这场‘冷热之争’正悄悄改写千亿算力江湖

21. 皮肤科小医生的微博

22. 《经济日报》关注贵州液冷探索

23. 散热技术对曙光8000释放算力有多重要?|热量|芯片|集群|AI芯片|CPU_新浪新闻

24. 区区20瓦撑起千亿神经元!人脑这台生物超算的极限究竟在哪?

25. 浸没式液冷技术概述及发展历程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章