过去十年,云数据中心的设计大多围绕风冷展开:机柜功率密度控制在每柜5到10千瓦,依靠冷热通道封闭和精密空调,就能把温度压在安全区间。但随着大模型训练与推理负载进入生产系统,单柜功率密度迅速抬升,AI训练集群中30千瓦以上的机柜已不鲜见,高密度部署甚至超过100千瓦。风冷在散热效率、噪声和能耗上的天花板开始显现,液冷由此从可选方案变成必须评估的方案。

两条技术路线:冷板式与浸没式

目前主流的液冷路线有两条。冷板式不改动服务器整体形态,冷却液流经贴合CPU、GPU的冷板带走热量,改造成本相对可控,适合存量机房的分区改造;浸没式则把整机浸入绝缘冷却液,散热能力强,风扇可以取消,但对冷却液材质兼容性、机房承重和运维流程要求更高,更适合新建的高密度园区。多数云厂商采取分层策略:一般业务区继续用风冷,高密度AI区用冷板式,同时以小规模试点验证浸没式。

指标治理:PUE之外还要看WUE

PUE仍是最常被引用的能效指标,液冷方案普遍能把PUE压到1.1附近。但只盯PUE,可能把能耗压力转移到水耗上:冷却塔蒸发、水质处理都会消耗水资源,因此WUE越来越受重视。对云服务商来说,碳排核算、绿电比例和余热回收,也正成为客户采购时会主动询问的内容。

在北方的部分园区,液冷余热已被用于供暖或农业温室,余热回收从概念走向工程实践,这也让能效治理从单点指标变成系统话题。

真正的难点在运维与标准

液冷并非买来设备就结束。冷却液与管路材料的长期兼容性、漏液检测与快速切断、CDU冗余配置、水质与微生物控制、机柜承重与改造窗口,都会成为运维的新课题。与此同时,不同服务器厂商的液冷接口与快接头规格尚未完全统一,云平台在多供应商选型时需要额外适配,推高了集成成本。行业组织与标准化机构正在推进冷板尺寸、接口规范和测试方法的统一,这会明显降低后续规模复制的摩擦。

从成本看,液冷前期投入高于风冷,但在高密度场景下,单位算力的制冷能耗下降、机房占地缩小、风扇功耗取消等收益,可以逐步摊薄总拥有成本。关键在于密度是否真的需要,以及运维团队是否具备相应能力。

结语

算力需求的增长不会停下,能效治理也很难靠单一技术解决。对使用云服务的企业而言,评估云厂商时,除了价格与性能,不妨关注其数据中心的制冷路线、PUE与WUE的披露口径以及绿色电力使用比例;对建设方而言,液冷选型应与业务密度、机房条件和运维能力匹配,先小规模验证再规模复制,并把指标治理、标准跟进与余热利用纳入长期规划。散热这个昔日的配角,正在成为云基础设施竞争力的组成部分。