算力越强,散热越难:数据中心为什么开始用液体降温

算力越强,散热越难:数据中心为什么开始用液体降温

2026-10-05 14:14:58 0点赞 0收藏 0评论
算力越强,散热越难:数据中心为什么开始用液体降温

谈论人工智能时,人们习惯聚焦模型和芯片,很少提到散热。但在真实的数据中心里,能不能把热量及时带走,直接决定了设备能跑多快、能开多久。当单机柜的功率密度不断上升,传统的风吹降温开始吃力,液体被重新请回了机房。

一、算力的另一面是热量

电子设备工作时会发热,而芯片的功耗几乎全部转化为热量。数据中心里有成千上万台服务器同时运行,如果不能持续散热,芯片会因为温度过高而降频,甚至停机保护。

过去,机房的散热主要靠空气:冷空气从地板送入,穿过服务器带走热量,再从顶部排出。这套方案成熟、成本可控,配合合理的风道设计,能应付相当高的功率密度。问题是,功率密度的增长速度超过了风冷能力的提升速度。

衡量散热效率的常用指标,是整座数据中心的总用电与计算设备用电之比。数值越接近1,说明电力越多地用在计算上,而不是消耗在制冷和配电环节。这个指标之所以被反复提及,是因为它把"散热好不好"变成了可以比较的数字。

二、风冷为什么不够用了

空气的比热容和导热能力都远低于液体。同样的体积,液体能带走的热量要多得多。当单个机柜的功率从几千瓦上升到几十千瓦,需要的风量会急剧增加,风扇转速提高,噪声和能耗随之上升,机房里还会出现明显的局部热点。

 

更现实的问题是空间:为了塞进更多服务器,机柜越来越密,留给风道的余地越来越小。于是,"用液体"从一个可选项变成了必选项之一。

风冷还有一个容易被忽略的限制:它很难做到"按需降温"。机房里不同机柜的功率差异很大,统一的送风容易造成有的地方过冷、有的地方过热。为了让最热的机柜安全运行,往往要把整体温度压低,这在无形中浪费了电力。

三、液冷的几种路线

常见做法有两条。一条是冷板式:把一块内部有微通道的金属板贴在发热量最大的芯片上,冷却液在板内流动,把热量带走,再通过外部换热器散出去。它的优点是改造相对容易,服务器整体结构不用大改,因此目前落地较多。

另一条是浸没式:把整台服务器直接浸在不导电的液体里,让液体接触所有发热元件。散热效率更高、噪声更低,但对液体材料、密封和运维流程的要求都更高,改造成本也更可观。两条路线并不是替代关系,而是对应不同的功率密度和场景。

两条路线之外,还有一些介于其间的做法,例如把发热最集中的部件单独做局部液冷,其余部分继续用风冷。这类混合方案在改造现有机房时更常见,可以在控制投入的同时解决最紧迫的热点问题。选择哪一条路线,通常取决于功率密度、机房条件以及可以接受的改造成本。

 

四、难点不只在技术

液冷真正的挑战,有一半在机房之外。管路怎么布置、漏液如何检测、冷却液如何更换和回收、运维人员如何培训,都是必须回答的问题。一旦出现泄漏,处理成本很高,所以可靠性设计往往比散热效率更受重视。

另一个隐性成本是标准化。不同厂商的设备接口、液体规格、监控协议各不相同,用户在做整体规划时容易被锁定。行业正在推动统一规范,但落地需要时间,也需要足够多的实际部署来验证。

五、能耗与选址:算力的地理学

散热最终指向能耗。数据中心的电力一部分供给计算,一部分用于制冷。提高散热效率,可以直接降低整体能耗,这也是能效指标被反复强调的原因。

 

值得注意的是,散热方式还会影响数据中心建在哪里。液冷对空气温度和湿度不那么敏感,理论上让更多地区具备条件;但液体供应、维护能力和电力结构又成为新的约束。算力的地理分布,正在被这些看似技术性的细节重新塑造。

从更长的时间尺度看,算力、电力与水资源的约束正在越来越紧密地绑在一起。这也让能效从一项技术指标,变成了选址、投资和运营决策中的核心变量。

六、余热回收:把废热变成资源

散热系统排出的热量,过去大多直接释放到环境中。随着规模扩大,越来越多项目开始考虑回收利用:用换热装置把较低品位的热量收集起来,供给周边区域的供暖、温室种植或生活热水。

这件事在技术上是成立的,真正的难点在于匹配。数据中心需要常年稳定散热,而供暖需求集中在冬季,供需在时间上并不同步;热量输送的距离越远,损耗越大。因此余热回收是否可行,往往取决于周边有没有稳定的用热方,以及当地的气候和能源价格。它把数据中心从一个单纯的用电大户,变成了区域能源系统中的一个环节。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松