top of page

CoolIT 无风扇液冷推动 AI 机架突破混合冷却极限

3天前
讀畢需時 13 分鐘

CoolIT 表示,其无风扇液冷设计可捕获 AI 服务器中几乎全部的热量,旨在解决 250 kW 机架内仍有 75 kW 热负载的问题。

这一数字揭示了当前常见混合冷却方案的极限。即使系统通过液体带走 70% 的热量,仍有 30% 需由空气冷却。对于 250 kW 的机架,风扇和设施设备仍须排除剩余的 75 kW 热量。

CoolIT 认为,这部分残余负载正让混合冷却越来越难以证明其合理性。其提出的替代方案将冷板从处理器扩展至内存、网络、存储和供电组件。目标是让留在空气中的机架热量低于 1%。

该公司将其称为近乎完全的热量捕获,同时把 100% 作为设计目标。这一区别很重要,因为线缆、电路板及其他表面仍会释放少量热量。

更大的问题不在于液冷是否比风冷更适合冷却处理器。对于密度最高的 AI 硬件,这场较量基本已有定论。新的竞争则发生在保留风冷层的混合式服务器与从一开始就围绕液冷设计的无风扇系统之间。

随着 Nvidia 和服务器厂商将机架级计算推向远超传统数据中心密度的水平,CoolIT 的这一主张应运而生。据其 机架设计 显示,Nvidia 的 GB200 NVL72 已需要约 120 kW 的冷却能力。未来系统正朝着每个机架数百千瓦的方向发展。

在这种功率水平下,仅冷却处理器已无法解决散热问题。

CoolIT 将液冷扩展至处理器之外

CoolIT 无风扇液冷将整台服务器视为一个热系统,而不是由热处理器与周边风冷部件拼凑而成的集合。

该公司在 2026 年 9 月提出的观点始于一个重要变化:热量产生的位置正在改变。GPU 和 CPU 仍是最大的热源,但已不再构成全部的冷却挑战。

内存模块紧邻高功率处理器,并承担日益密集的数据传输任务。网络交换机和接口组件为更大规模的集群提供更高速的连接。存储、稳压器和电源转换硬件同样承受着更高的负载。

这些组件过去可以在服务器已有的气流中稳定运行。这种安排使厂商能够在处理器上安装冷板,同时保留风扇为其他部件散热。

冷板是直接贴装在电子封装上的金属热交换器。冷却液流经内部通道时吸收热量,随后将热量带往冷却液分配单元,即 CDU。

CDU 在控制温度、压力和流量的同时,将设备侧冷却回路与设施水回路隔离。它是大多数直接液冷部署的核心组成部分。

CoolIT 的热量捕获主张 将这一回路延伸至混合式设计中被遗漏的组件。该公司表示,其系统由模块化冷板组件构成,并已在六代无风扇设计中经过测试。

这种模块化方式很重要,因为外围组件的标准化程度低于处理器。CPU 或 GPU 通常具有平整的封装表面和明确的安装点;内存、电源组件、交换机和存储设备则有着不同的形状和位置。

每种组件也都有自己的温度上限和机械限制。完整液冷回路必须适应这些差异,同时不能妨碍维护操作,也不能对电路板施加有害的作用力。

因此,CoolIT 将无风扇冷却定位为服务器设计问题,而不只是更好的处理器冷板。冷却液路径、连接器、歧管、控制系统和组件接口必须作为一个整体运行。

该公司表示,其架构可将风冷所占比例降至 1% 以下。它也承认,严格意义上的 100% 热量捕获几乎不可能,因为部分热量仍会从液体路径之外的表面散失。

这一限定使“无风扇”比“零空气散热”更准确。无风扇服务器可以容忍极少量的被动散热,而无需依靠内部风扇维持组件温度。

这正是此次发布带来的直接变化:液冷正从最热的封装组件扩展至 AI 服务器内部几乎所有重要热源。

250 kW 机架打破混合冷却方程式

按百分比制定冷却方案的问题在于,随着机架功率不断提高,残余空气热负载也会同步增长。

70/30 的液冷—风冷比例用比率表达时看似有效。这意味着液体带走大部分热量,剩余部分则由熟悉的风扇和机房系统处理。

绝对数值呈现出不同图景。50 kW 机架的 30% 是 15 kW;250 kW 机架的 30% 则是 75 kW。

这一残余负载相当于数个传统机架的总功率。它集中在一个已塞满处理器、网络设备、电源架、冷却液歧管和高速线缆的机柜中。

排除这些热量需要大量气流。运营商必须提供冷空气,使其穿过狭窄的服务器通道,收集排出的热空气,并防止其回流至设备进风口。

风扇同样消耗电力,并占据服务器内部空间。更高气流会带来压力、噪声、维护和过滤方面的需求。即使设施已为处理器安装液冷基础设施,这些要求仍然存在。

于是,运营商需要为同一机架维护两套冷却系统。泵、热交换器、歧管和冷却液控制系统服务于液冷回路;风扇、空气处理设备、隔离系统和机房冷却设备则处理剩余的空气热负载。

CoolIT 的核心主张是,在约 250 kW 以上,这种重复配置在商业上将变得缺乏吸引力。这一阈值来自公司建模,而非通用工程标准。

机架的可行性取决于服务器几何结构、冷却液温度、气候、设施设计、冗余要求以及允许的组件温度。经过审慎工程设计的混合系统不会在某一个确切数值上突然失效。

不过,其基本算术关系很难反驳:快速增长总量中的固定百分比,会转化为快速增长的负载。

ASHRAE 的 AI 冷却框架 表示,机架密度已从约 120 kW 迈向数百千瓦,并预计不久后将出现兆瓦级机架。

该框架将直接芯片液冷描述为 AI 和高性能计算的行业标准。直接芯片液冷指冷却液通过连接至特定电子组件的冷板带走热量。

CoolIT 将这一趋势再推进一步。如果几乎每个高负载组件都获得液冷接口,机房便不再需要让大量空气穿过服务器。

这可简化白区设计,即部署机架的数据中心机房区域。它也可将更多热量排放转向温水系统和室外热交换器。

但冷却工作并不会消失。泵仍需循环冷却液,CDU 仍需传递热量,设施最终仍须将这些热量排至室外。

无风扇 AI 服务器改变的是工作发生的位置。它们以受控液体路径取代大流量内部气流,将热量输送至专为集中负载设计的基础设施。

因此,250 kW 这一数字应被视为设计警示,而不是普遍适用的临界悬崖。它标志着继续保留风冷可能带来第二套重大基础设施负担的节点。

CoolIT 无风扇液冷挑战混合冷却的默认方案

当前的主要竞争是全液冷覆盖与混合冷却之间的较量,而非处理器层面的液冷与风冷之争。

混合冷却之所以成为务实的过渡方案,是因为它保留了熟悉的服务器和数据中心设计。运营商可以为高功率芯片增加液冷,而无需重构每个组件,或放弃既有的气流实践。

这种折中降低了部署风险。它也使厂商能够在新近采用液冷的加速器周围,继续使用成熟的风冷内存、存储、网络和供电设计。

Nvidia 的 GB200 NVL72 展现了这一过渡。该机架通过高带宽 NVLink 互连架构连接 72 个 Blackwell GPU 和 36 个 Grace CPU。其计算托盘和交换托盘包含液冷连接,但部署仍涉及广泛的机架与设施集成工作。

该系统的 120 kW 冷却需求已经超出许多现有数据中心机房的设计能力。预计更新的平台将在相近物理占地内配置更高功率。

CoolIT 表示,旗舰级机架系统将在 2028 年前趋向于实现全面热量捕获。该预测与处理器功率的发展方向一致,但时间安排仍属于该公司的判断。

行业并未等待单一供应商来确立这一类别。Hewlett Packard Enterprise 于 2024 年 10 月推出了自己的 100% 无风扇直接液冷架构。

HPE 的设计覆盖 GPU、CPU、内存、存储、网络、电源、机架、Pod 和 CDU。该公司表示,相较于混合式直接液冷,其架构可将每个服务器刀片的冷却功耗降低 37%。

HPE 还宣称,相较于传统风冷系统,其冷却功耗可降低 90%。这些数据来自供应商测试,不应被视为普遍适用的实际运行结果。

不过,HPE 的无风扇架构验证了更广泛的发展方向:以液体冷却更多组件,正成为主要服务器供应商的一项架构选择。

浸没式冷却提供了另一条路径。它将服务器或选定组件置于介电液体中,让液体直接吸收裸露组件的热量。

浸没式冷却无需为每个组件配置独立冷板,便可捕获几乎全部设备热量。不过,它会改变硬件封装、维护流程、液体处理、保修条款和组件认证方式。

冷板系统保留了更熟悉的机架和服务器形态。技术人员在隔离并断开相应冷却管路后,仍可接触干燥的组件。

这种熟悉性使直接液冷在已为 Nvidia 式机架系统做准备的设施中具备采用优势。但它也在每台服务器内部留下了严峻的集成难题。

为每个相关组件添加冷板会增加接口数量。设计人员必须管理流阻、温差、管路走向、连接器位置,以及某个组件冷却不足的风险。

模块化能够有所帮助。CoolIT 表示,其可复用的冷板构件可缩短开发周期,同时支持具有不同物理和热学要求的组件。

这一主张具有合理性,但决定性证据将来自完整的量产系统。运营商需要在真实工作负载、冷却液条件、维护周期和故障场景下获得性能数据。

在这里,对手变得清晰可见。混合冷却支持渐进式采用,并且组件更为熟悉。全面液冷则承诺实现更高密度,同时更少依赖服务器气流。

在较低的机架密度下,运营商仍可能偏好混合设计的灵活性。到了数百千瓦级别,残余空气负载将日益决定整体架构。

无风扇并不意味着无需基础设施

近乎全面的热量捕获让服务器风扇不再处于关键路径,但也将更多责任转移给冷却液输送和设施工程。

无风扇服务器无法通过提高风扇转速来弥补冷却液流量不足。其热稳定性取决于泵、阀门、歧管、控制系统、冷板接触面和热交换器能否正常运行。

因此,冗余变得至关重要。运营商必须决定,在不降低处理器性能或关闭机架的前提下,系统能够容忍哪些泵、CDU、传感器或控制系统故障。

泄漏管理也更贴近昂贵硬件。设计完善的系统会采用经过测试的连接器、压力控制、无滴漏快速断开接头、监控机制和隔离流程。

目标并不是宣称液体永远不会泄漏,而是在冷却液接触脆弱电子元件之前,使故障可被检测、控制和维修。

冷却液化学特性带来了另一项运维要求。水质、添加剂、金属、弹性体、管路和温度都会影响腐蚀和微生物滋生。

即使没有出现外部泄漏,由不兼容材料组装而成的系统也可能在内部劣化。长期可靠性取决于经过验证的材料组合和受控维护。

Open Compute Project 的冷板要求反映了这种复杂性。其指南涵盖冷却液类型、连接方式、CDU 布局、温度、压力和冷却分类。

可维护性同样重要。更换内存或网络组件的技术人员,可能需要断开旧式服务器中并不存在的液冷硬件。

除非制造商仔细设计维护访问方式,否则更多冷却接口可能延长维修流程。设施还需要经过培训的员工、备用组件、冷却液处理设备以及记录完善的隔离步骤。

无风扇系统也对调试提出了新的要求。工程师必须确认每个支路都获得所需流量,并确保滞留空气不会损害传热。

他们还必须在部分负载下验证控制系统。AI 集群很少能完美分配工作负载,因此在负载变化期间,某个托盘的温度可能高于相邻托盘。

第二个不确定因素涉及现有建筑。新的 AI 设施可以围绕液冷回路、更重的机架、更大的管道和高容量散热系统进行设计。

改造旧数据中心机房则更困难。地板承重、管道路径、配电、维护间隙和 CDU 位置都可能限制运营商可部署的密度。

一些设施将采用液对气 CDU,将冷却液热量排入室内空气。当设施水源不可用时,这种方法可以加快部署。

但它也保留了近乎全面液冷捕热本应减轻的设施级空气负担。服务器变成液冷,但建筑仍需通过空气转移热量。

用水量同样需要谨慎看待。直接液冷采用封闭的设备回路,但设施最终采用何种散热方式决定了总用水量。

在适宜气候下,连接干式冷却器的温水回路可以减少或避免蒸发用水。采用冷却塔的系统仍可能消耗大量水。

恰当的比较必须涵盖从芯片到室外环境的完整路径。仅凭服务器热捕获比例,无法确定总能耗或用水表现。

这是对 CoolIT 叙事最重要的检验。近乎全面的热量捕获解决了残余服务器空气负载问题,但并未消除系统级工程需求。

该公司根据其建模描述了一个可信的方向和明确的密度阈值。它尚未公布足够的应用数据,无法将 250 kW 视为普适分界线。

运营商应要求获得经过验证的压降、组件温度、泵能耗、冗余行为、维护时间和设施要求。这些测量结果将决定无风扇设计是否能在实践中简化运维。

效率优势取决于整个冷却链路

更高的热量捕获比例带来了提升效率的机会,但架构和运行条件决定这一机会能否转化为可测量的收益。

服务器风扇并非没有代价。它们消耗电力、占用空间、产生噪声,并推动空气穿过日益受限的组件布局。

ASHRAE 指出,在某些风冷配置中,风扇功耗可占服务器功耗的 10% 至 20%。当数千台服务器持续运行时,这部分开销会变得更加显著。

液体通过紧凑通道携带热量的能力远高于空气。冷板还可在热源附近收集热量,避免让大量空气穿过整块电路板。

这些特性支持更高密度的封装。移除风扇和大型风道可以为计算、网络、电源或更直接的维护访问释放内部空间。

不过,液冷系统也会消耗泵功率。采用狭窄通道、长管路或大量并联支路的设计,可能需要更高压力来维持充足流量。

结果取决于完整的水力设计。降低服务器风扇功耗,并不自动意味着总冷却能耗更低。

冷却液温度是另一项重要变量。根据气候和工作负载要求,较高温度的液体可以实现更多无需冷水机的散热时段。

更高的冷却液温度也可以改善余热再利用的机会。当余热温度足以服务附近建筑或工业流程时,其价值会更高。

组件限制制约着这一机会。处理器、内存、光学设备、电力电子设备和存储设备可能需要不同的进液温度和运行余量。

完整液冷回路必须在不过度冷却其他组件的前提下,满足限制最严格组件的需求。多个回路或精细控制的支路可以应对这些差异,但会增加复杂性。

ASHRAE 描述了从低温回路到高于 45 摄氏度温水条件的不同水温等级。设备兼容性决定运营商可以使用哪一等级。

容量规划还必须考虑瞬态行为。AI 处理器可以在空闲和高利用率之间快速切换,改变整个机架的热输出。

液体具有热容量,可以吸收短时变化,但控制系统仍必须及时响应,且不能造成不稳定的流量或温度状况。

能效也与利用率密不可分。持续运行的高密度机架可以高效利用空间和冷却基础设施。

为峰值功率打造、却经常远低于该水平运行的机架,可能导致泵和设施容量闲置。控制系统需要具备足够的调节范围,以匹配不断变化的需求。

这正是供应商百分比数据需要语境的原因。HPE 的 37% 刀片冷却功耗降低和 CoolIT 的低于 1% 空气目标,衡量的是系统的不同部分。

前者比较的是特定设计下的冷却功率。后者描述的是进入空气的设备热量占比。

任何一个数字都无法单独反映设施范围内的效率。运营商仍需要功率使用效率、冷却系统能耗、用水量、可用容量和实际交付的计算性能数据。

因此,无风扇 AI 服务器最有力的论点并非某个单一效率百分比,而是能够避免在液冷基础设施之外再同步扩展一套独立空气系统。

在 250 kW 及以上的功率水平,防止数十千瓦热量进入室内空气,可以减少设备、气流和封闭措施需求。随着机架功率提升,这一优势将进一步扩大。

但每个站点仍必须验证实际收益。气候、水资源可用性、冗余、工作负载和散热设备都可能改变最终结果。

三个信号将揭示无风扇 AI 服务器是否成为默认选择

接下来的检验在于,近乎全面的热量捕获能否从供应商架构走向主流机架级系统中的可重复部署。

第一个信号是下一代旗舰 AI 机架的液冷覆盖范围。买方应考察供应商是否直接冷却内存、网络、存储和电源组件。

仅对处理器进行液冷将保留混合模式。广泛的组件覆盖则将支持 CoolIT 的观点:热量问题已经超出芯片本身。

Nvidia 未来的机架规范将尤为重要,因为其参考架构会影响服务器制造商、冷却供应商和数据中心规划。

第二个信号是独立测量的设施性能。运营商需要包含泵、CDU、散热系统、用水量和工作负载利用率的结果。

如果一种设计能将超过 99% 的服务器热量捕获到液体中,就应显著降低对室内空气的需求。公开运行数据必须显示,总冷却能耗是否如预期般下降。

最有价值的比较将评估相似工作负载在混合设计和无风扇设计下的表现。它们还应披露冷却液温度、气候条件、冗余配置和利用率。

第三个信号是运维标准化。行业需要可互操作的连接器、冷却液规范、维护流程、监控接口和安全要求。

Open Compute Project 的指南提供了基础,但广泛采用取决于供应商能否一致地实施这些要求。运营商不能将每个机架都当作定制机械系统来对待。

标准化还将使组件更换和多供应商采购更加容易。缺乏标准化时,设施可能不得不依赖专有歧管、液体和维护流程。

CoolIT 赞助的无风扇服务器分析捕捉到了一个真实的转变,尽管其 250 kW 阈值仍是供应商自身的结论。

重要的逆转已经显现。液冷曾经是在空气冷却达到极限后,为处理器增加的补充方案。如今,在液冷几乎处理所有热量之后,空气正在成为被保留下来的补充手段。

这一变化同时给服务器制造商、设施设计师和运营商带来压力。每一方都必须决定,保留混合基础设施是否仍能提供有用的灵活性。

对于规划数百千瓦级机架的买方,眼下应采取的行动是索取完整热图,而非仅查看处理器规格。询问哪些组件仍采用风冷,并计算其绝对热负载。

随后,追踪每一千瓦热量经过液冷回路、CDU、设施系统和最终散热设备的路径。这一过程将显示 CoolIT 无风扇液冷是简化了建筑系统,还是仅仅转移了复杂性。

未来不会因为“无风扇”这个说法听起来高效而变得无风扇。只有当生产系统证明,全面液冷覆盖比保留一个 75 kW 的风冷区域更易于运行时,无风扇才会成为现实。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page