过去十年,数据中心行业最重要的变化不是服务器越来越快,而是它们越来越热。当 GPU 的功耗从 250W 飙到 700W,当 AI 集群单柜密度突破 100kW,传统的“风扇+空调”风冷体系已经无能为力。这场散热革命不只是工程难题,它直接决定了 AI 时代数据中心的物理形态。

为什么散热是数据中心的生死问题

CPU 和 GPU 是非常娇贵的半导体。Intel、AMD、NVIDIA 的官方规格都明确写着:长期工作温度不能超过 85°C,瞬时峰值不超过 100°C。超过这个温度,芯片会触发降频保护,严重时直接烧毁。一个机柜里几十台服务器同时运行,如果散热跟不上,几分钟内整个机柜就会进入热失控。

这听起来很极端,但在 2020 年代的高密度 AI 集群里,这种热失控的风险是真实存在的。Meta 的 AI 研究员曾公开表示,他们的 LLaMA 训练集群在过去一年里遇到过十几次因散热问题导致的训练中断。

传统风冷的天花板

传统数据中心散热的方式很直觉——用风扇把冷空气吹到服务器,空气吸收热量后排出。CRAC(Computer Room Air Conditioning,机房精密空调)单元是核心设备,把机房温度维持在 20-24°C 范围。这种方案在单柜 5-10kW 时代完全够用。

但空气的导热系数只有 0.026 W/m·K,是非常糟糕的导热介质。同样体积的水,导热系数是 0.6 W/m·K,是空气的 23 倍。当机柜密度突破 20kW,空气已经带不走这么多热量,风冷方案达到天花板。

冷板式液冷:把水冷管贴在 CPU 上

冷板式液冷(Cold Plate Liquid Cooling)是当前最主流的液冷方案。它的原理简单直接——在 CPU、GPU 等高发热芯片上贴一块金属冷板,冷板内部有冷却水管流过,通过水管里的水(或水-乙二醇混合液)把热量带走。

冷板液冷的导热效率是风冷的 1000 倍以上。一块 GPU 冷板可以带走 700W+ 的热量,而传统风冷 GPU 的散热极限约 450W。这意味着同样的散热空间,液冷可以支持 3 倍的算力密度。NVIDIA 的 H100 GPU 默认推荐冷板液冷方案,不再是可选配件。

液冷不是“未来技术”,而是“现在已经必须的技术”。任何一个新建的 AI 数据中心,如果不上液冷,在 18 个月内就会被算力需求淘汰。

浸没式液冷:把服务器泡在液体里

浸没式液冷(Immersion Cooling)是最激进的散热方案。它把整台服务器(不含机械硬盘等不耐液体部件)泡在一个装满不导电冷却液的密封容器里。冷却液直接和服务器表面接触,通过自然对流或循环泵把热带走。

浸没式的散热效率比冷板液冷还要高,因为液体可以同时冷却 CPU、GPU、内存、硬盘、电源等所有部件,不存在“漏冷”的部件。Microsoft 在 2022 年公开了他们的 Natick 项目实验,把整个数据中心沉到苏格兰海岸的海底,用海水自然冷却——这本质上是浸没式液冷的极端版本。

浸没式液冷的缺点也很明显:冷却液价格昂贵(每升几十到几百元)、维护时需要把服务器从液体里捞出来、漏液可能损坏硬件。所以目前主要用在 AI 超算集群这种“算力密度极高、单台服务器价值也极高”的场景。

冷热通道封闭:风冷时代的优化

在向液冷过渡的过渡期,数据中心行业也在持续优化风冷。冷热通道封闭(Cold/Hot Aisle Containment)是过去十年最重要的风冷优化——把机柜的正面(冷通道)和背面(热通道)用透明隔板封闭起来,避免冷热空气混合。

封闭后,CRAC 空调不需要把整个机房都降到 22°C,只需要把冷空气精确送到冷通道。这样可以让空调温度从 22°C 提升到 26°C 甚至 28°C,大幅降低空调能耗。PUE 从 1.6 降到 1.4 是常见的优化效果。

自然冷却:利用气候优势

另一条降温路径是“用大自然的冷”。北方寒冷地区的数据中心(哈尔滨、张北、呼和浩特、爱尔兰、芬兰)可以利用冬季的低温空气直接冷却机房——把 CRAC 空调换成新风系统,引入室外冷空气,排出室内热空气。

这种“自然冷却”(Free Cooling)的极端例子是阿里云张北数据中心。冬季气温可以降到零下 30°C,机房几乎不需要空调,直接用新风自然冷却。PUE 长期低于 1.2,夏季最高也不超过 1.35。这种“白嫖气候”的做法,是数据中心选址的重要策略。

液冷的产业链挑战

液冷虽然好,但产业化还面临不少挑战。第一,标准化不足——不同厂商的冷板尺寸、快接头规格、冷却液配方都不一样,客户被锁定。第二,泄漏风险——水冷管一旦泄漏,对服务器的破坏是灾难性的。第三,冷却液成本——长期运营的开销不一定低于风冷。第四,运维习惯——传统运维工程师对液体冷却不熟悉,需要培训。

2023 年,开放计算项目(OCP)发布了《Liquid Cooling Design Best Practices》白皮书,试图统一液冷标准。Dell、HPE、联想等主流服务器厂商也在推出原厂液冷方案。这些动作都在推动液冷从“特定场景”走向“通用场景”。

散热的尽头:PUE 接近 1.0

PUE(Power Usage Effectiveness)是衡量数据中心能效的核心指标,定义为“数据中心总能耗 / IT 设备能耗”。PUE 1.0 是理论极限,意味着所有电力都用在计算上,没有任何散热、网络、照明的浪费。Google 的部分数据中心已经接近 1.10,微软 2024 年宣布的一个实验性数据中心 PUE 低至 1.05。

未来 5-10 年,随着液冷标准化、AI 优化调度、可再生能源的普及,数据中心的 PUE 会普遍降到 1.10 以下。这不仅意味着运营成本降低,也意味着“数据中心的碳足迹”会大幅改善。

对下载体验的间接影响

散热技术看起来和你的日常下载无关,但它决定了两件事:第一,数据中心能多快地扩张算力——更好的散热意味着同样的建筑面积可以容纳更多服务器,云厂商可以更快扩容。第二,云服务的成本结构——散热成本降低最终会让 CDN、对象存储、计算服务的单价下降。

下一篇我们会看数据中心的另一个核心话题——电力。没有稳定、廉价的电力,再好的散热也无法让数据中心运转起来。数据中心是全球电力消耗增长最快的行业之一,也是“电力即算力”的最好注解。

参考资料