IES 数据中心改造挑战 AI 绿地建设竞赛
IES 数据中心改造获得了一个切合时机的新论据:现有设施无需等待全新园区建成,也能扩展 AI 容量。Data Center Dynamics 于 9 月 8 日推广的一份白皮书称,针对性的升级可释放电力、冷却和机房空间,以支持更高密度的计算。矛盾在于速度。运营商现在就需要容量,而专为 AI 打造的设施从规划、接入到建设和投运,可能需要数年时间。
该白皮书来自建筑性能软件公司 IES,因此其结论应被视为供应商支持的框架,而非独立研究。不过,其所指向的核心问题已有广泛记录。AI 服务器将更多电力消耗和热量集中在每个机架内,而电网接入和关键设备依然难以获得。
这由此引发了现有站点改造与从零开发绿地设施之间的竞争。绿地建设需要作出的设计妥协更少。改造则始于各种限制,但同时也拥有建筑、网络接入、运维人员,有时还包括既有的电网连接。
因此,这并不是主张将每一座老旧数据中心都改造成 AI 设施,而是一个更聚焦、也更具影响力的判断:最快能够投入使用的 AI 容量,或许来自经过审慎筛选的既有数据中心资产,而不只是新建的超大型园区。
IES 让既有容量重回竞争
最直接的变化在于,IES 将改造定位为一种容量战略,而不只是维护项目。
这套改造框架要求托管运营商评估现有设施是否具备 AI 就绪能力。评估范围包括配电、冷却架构、结构承重、连接能力和韧性。这些是相互关联的限制条件,而不是翻新清单上的独立项目。
该框架还倡导分阶段升级和动态仿真。动态仿真利用基于时间的数字模型,测试建筑在工作负载、温度和设备状态变化时的响应。IES 认为,运营商可以在投入资金前,于接近真实的条件下比较不同干预措施。
这一差异至关重要,因为铭牌容量数字很少能说明全部情况。一座设施可能拥有未使用的机房空间,却缺乏足够电力;也可能具备可用的电力容量,却没有切实可行的方式为高密度机架散热。即使同时满足这两项条件,仍可能面临结构、水力、网络或冗余方面的限制。
因此,改造评估首先要找出闲置容量。这类基础设施虽已存在,但若不实施有针对性的改动,便无法支撑目标工作负载。干预措施可能涉及开关设备、母线槽、冷却分配单元、后门热交换器、封闭通道、泵、控制系统,或对特定设备下方结构进行加固。
IES 论点中最有力的部分在于部署顺序。运营商无需将整栋建筑改造成 AI 工厂,而是可以识别合适区域、模拟其影响,并在传统工作负载旁建立有限规模的高密度部署。
这种方式保留了仍能充分发挥作用的设备价值,也避免将所有现有风冷机房视为过时设施。传统服务器、存储系统和较低密度的推理设备可以继续运行,而规模较小的液冷环境则服务于发热量更高的硬件。
这也是为什么这一议题超出了普通设施管理的范畴。改造成为一项部署决策。能够在现有站点中找到可行容量的运营商,可以在竞争对手仍受制于建设和公用事业排期时提供 AI 基础设施。
IES 尚未发布证据证明每一项建模干预都将成功。DCD 页面也未给出通用的部署时间表或回报模型。其有价值的贡献在于决策结构:衡量整座设施、测试相互作用的系统,并且仅在综合限制允许的地方进行升级。
这重新定义了基础设施竞赛。稀缺资源不只是土地或服务器库存,而是能够支撑完整电力、冷却、网络和韧性链条的可部署兆瓦容量。
为什么 AI 基础设施不能等待绿地园区
AI 需求的增长速度,快于为新数据中心供电并调节电力条件的物理系统。
国际能源署报告称,数据中心用电需求在 2025 年增长了 17%。该机构还发现,五家大型科技公司当年的资本支出超过 4,000 亿美元,并预计这一支出将在 2026 年再增长 75%。
这些投资并不能消除物理瓶颈。同一份能源展望指出,变压器、燃气轮机、先进芯片及其他基础设施部件的供应更加紧张。规划流程、许可和电网接入也在延缓项目进度。
IEA 预计,到 2030 年,全球数据中心用电量将翻一番,面向 AI 的设施用电量将在同期增至三倍。单项 AI 任务的能耗效率正在提升,但不断扩大的应用规模和更高强度的工作负载抵消了这些节省。
这种组合让托管服务商、企业运营商和基础设施投资者面临即时压力。客户希望比许多公用事业公司提供新接入更早获得加速器容量。设备采购方还要争夺开关设备、变压器、冷却硬件以及经验丰富的投运团队。
绿地开发仍不可或缺。专门建设的站点能够围绕高密度硬件协调电力架构、结构设计、水系统、网络和维护通道,也可以为未来的冷却和供电技术预留空间。
它的劣势在于时间风险。新建筑依赖土地审批、环境审查、施工、设备供应、公用事业协调和测试。这条链条中任何环节的延误,都可能推迟收入,并让昂贵的计算硬件缺少合适的部署地点。
现有站点的起点不同。它们已经拥有一定程度的已通电容量、光纤路由、安全控制、运维人员和客户接入条件。这些资产并不能保证具备 AI 就绪能力,却缩短了容量决策与实际部署之间的距离。
地理位置可能使这一优势更加重要。AI 训练集群需要大规模电力块,而许多推理应用也受益于靠近用户、企业数据或既有网络交换中心。相比等待建设完成的偏远园区,现有都市设施可能更早支持此类工作负载。
这并不意味着改造可以创造电力。它们无法将受限的公用事业接入变成无限供应。不过,运营商有时可以通过更换设备、改善气流、隔离热量或优化控制系统来回收容量,随后将释放出的容量用于有限规模的 AI 部署。
因此,压力并不对称。拥有可量化余量的运营商可以在竞争对手争取新增供给时采取行动。缺乏余量的运营商则可能将时间花在最终确认必须建设新站点的研究上。
IES 数据中心改造正是在这一节点进入讨论。其价值不太取决于建筑上的雄心,而在于它们能否在新建设施投用前,将现有资源转化为可运营的 AI 容量。
IES 数据中心改造依赖系统级建模
只有当运营商将建筑视为一个整体系统进行建模,并在安装前测试故障条件时,改造方案才成立。
AI 机架影响的不只是室温。它们还可能改变电力负载、水流、泵需求、散热、维护流程和备用电源要求。在某一层面提升容量,可能暴露其他环节的瓶颈。
冷却分配单元(CDU)负责在服务器侧冷却回路与设施侧系统之间传递热量。液对液 CDU 可连接至现有的设施水系统;在缺乏合适水系统时,液对气单元则将热量排入机房。
Schneider Electric 在一份面向 3,818 千瓦 Tier III 设施的参考设计中展示了这两种方案。该设计将高密度 AI 集群部署在传统设备旁,并涵盖风冷、液对气和液对液改造情景。
该示例支持分阶段路径,但也说明了为何这一选择不能简化为购买一款冷却产品。液对气 CDU 会将热负荷重新转移至数据中心机房,房间级冷却系统仍必须在不影响相邻设备的情况下吸收这些热量。
液对液设计可以将热量更直接地转移至设施水回路。然而,运营商必须验证水温、流量、管径、冗余、泵送能力、水质和散热性能。图纸上的适当连接并不保证在峰值条件下具备足够性能。
电力升级也会产生类似的相互作用。高密度机架可能需要调整上游配电、机架供电、保护设定、备用系统和监控。负载集中还会改变局部故障带来的后果。
结构承重是另一项实际边界。加速器机架的重量可能超过旧楼板最初的设计承载能力。泵、歧管、热交换器和更大型的电力组件也可能占用相邻空间。电缆路径和维护净空会进一步压缩可用于计算的区域。
动态仿真可以帮助运营商测试这些相互作用在时间维度上的表现。静态工程计算捕捉的是某个设计工况,而动态模型则可考察室外温度、工作负载曲线、设备分级运行、组件故障和控制响应的变化。
当运营商混合使用新旧基础设施时,这一能力尤为重要。改造区域可能在平均负载下运行正常,但在另一台冷水机组离线时形成不可接受的状况;它也可能满足热管理要求,却削弱了设施承诺的冗余能力。
数字模型不能替代现场测量。其输出依赖于准确的几何数据、设备数据、控制逻辑和运行假设。不完整的模型可能为错误的问题提供一个看似精确的答案。
因此,这一过程应从仪表监测和验证开始。运营商需要掌握实际功耗、空气和水温、压力、流量、湿度以及设备性能的可靠数据。随后,在相信未来情景前,必须将建模行为与观测条件进行比对。
其核心机制是迭代的:测量现有设施、校准模型、找出制约条件,并模拟有针对性的改动。安装后,再将实际表现与建模结果比较,并再次更新模型。
这比简单的设备更换要求更高。它也为判断何时不应改造提供了更清晰的依据。一个站得住脚的模型可以表明,某项干预会损害韧性、超出结构限制,或只是转移瓶颈而无法形成有用容量。
液冷拓展改造边界,但仍有局限
液冷让更高密度的改造成为可能,但无法解决供电不足、结构薄弱或运营管理不善的问题。
Nvidia 的 GB200 NVL72 表明,热管理架构为何已成为 AI 基础设施的核心。该机架级系统采用液冷设计,连接 72 块 Blackwell GPU 和 36 颗 Grace CPU。Nvidia 将该系统描述为一个面向紧密耦合 AI 工作负载的大型 NVLink 计算域。
该公司声称,在其设定的比较条件下,该系统在相同功耗下的性能是 H100 风冷基础设施的 25 倍。这是厂商基准测试,并非对所有工作负载的独立衡量。不过,机架架构证实,领先的加速器平台正越来越多地将液冷纳入其物理设计之中。
液体传递热量的效率高于空气,使运营商能够在更靠近处理器的位置排出热量。直触芯片冷却让冷却液在连接发热组件的冷板中循环。后门热交换器则在热空气离开机架时对其进行冷却。
这些方法适用于不同的改造条件。后门系统无需将每台服务器都转换为直液冷,便可提升可用密度。直触芯片系统从热源处处理散热问题,但需要可靠的液体回路、分配硬件、监控和维护流程。
混合冷却将液冷系统与传统风冷结合。这种方式适合混合型设施:液冷可以吸收大部分处理器热量,而空气仍可冷却内存、存储、网络设备或低密度机架。它也支持分阶段采用。
通过 IEA 技术合作计划发布的一项国际研究估计,液冷在服务器层面的潜在节能幅度为 8%,在设施层面可达 30% 至 40%。该研究认为,整体潜在节能幅度介于 10% 至 21% 之间。
不过,同一项液冷研究也指出,目前采用率较低、标准化有限、初始成本高,以及对长期可靠性的担忧。研究还警告称,电能使用效率(PUE)可能低估液冷带来的部分效率收益。
这些限定条件很重要。PUE 将设施总能耗与交付给 IT 设备的能耗进行比较。它仍然有用,但无法涵盖所有系统层面的影响,也无法描述实际完成了多少有用计算。
较低的 PUE 也不会自动意味着改造在经济或环境层面更具优势。运营商还必须考虑隐含材料消耗、设备更换、用水、制冷剂、利用率以及电力的碳强度。即使集群效率很高,如果利用不足,仍可能浪费资源。
用水策略带来另一项权衡。一些液冷配置可以减少对传统机械制冷的依赖;另一些仍需要设施水回路和外部散热。结果取决于气候、温度目标、设备选择和运行条件。
由于液体被引入昂贵电子设备附近,泄漏问题备受关注。但运营挑战并不止于泄漏检测。团队需要兼容材料、水质控制、隔离流程、备件、训练有素的技术人员,以及 IT 与设施团队之间明确的责任划分。
改造还可能形成双速运行环境。传统机架遵循熟悉的流程,而液冷设备则需要不同的调试与维护规范。文档、告警、变更控制和应急响应必须同时适应两者。
审慎的结论很直接:液冷扩大了能够承载 AI 的建筑范围,但不会让每栋建筑都变得适合部署 AI。运营商仍需要足够的电力容量、结构支撑、散热能力和故障容忍度。
当冷却只是经验证系统方案中的一个组成部分时,IES 数据中心改造最具优势;当运营商将液冷视为现代加速器与传统设施之间的通用适配器时,风险就会升高。
改造与新建服务于不同的工作负载
真正的竞争并非旧建筑与新建筑之争,而是近期部署与长期优化之争。
全新建设的 AI 园区可以围绕大型、同质化集群进行设计。工程师可以将公用事业接入、变电站、备用发电、网络架构、冷却系统和结构载荷作为一个集成系统来规划。因此,对于最高密度的部署,新建仍是更明确的选择。
改造更适合需求边界清晰的场景。企业可能需要在受监管数据附近部署私有推理集群。托管服务商可能会将部分机房改造给需要加速器容量、但不需要超大规模训练园区的客户。研究机构则可能在现有高性能计算环境中增加一个液冷 Pod。
这些用途并不要求每个站点都达到专用 AI 工厂的规模。它们需要的是性能可预测的适宜承载环境。因此,与其询问整个设施是否已具备 AI 就绪条件,不如进行分区评估。
一个站点可能支持采用风冷的低密度推理设备;另一个区域可以容纳后门热交换器;第三个区域或许可以通过 CDU 支持直触芯片冷却。建筑其余部分则仍可专用于传统工作负载。
这种混合密度模式让运营商能够将基础设施与实际需求匹配,也限制了初始投入规模。在客户证明其利用率具有持续性、运营团队积累经验后,容量可以进一步扩展。
Vertiv 曾表示,早期液冷部署大多将发生在现有设施中。其部署指南强调 IT、设施和电力团队之间的协作,因为建筑必须围绕机架的综合需求进行适配。
这一观点来自另一家基础设施供应商,因此同样需要采用审视 IES 时的谨慎态度。供应商会在运营商购买建模、冷却、电力和服务产品时获益。他们的技术框架仍有参考价值,但其采用预测不应被视为中立的市场衡量。
竞争的关键在于利用率。即使改造很快完成,如果客户并不使用,其价值也十分有限。即便新建项目较晚交付,只要能提供更大规模、更低运营复杂度或更好的长期电力获取条件,仍可能表现更优。
硬件迭代周期带来了另一项风险。围绕某一代机架密度或冷却液要求设计的设施,可能需要比预期更早地再次调整。运营商必须区分耐久的基础设施升级与过度绑定特定系统的适配方案。
开放接口可以降低这种风险。标准化连接、易维护的管道、模块化 CDU、灵活的配电系统和预留维护空间,为未来设备变化留下更多余地。专有化假设可能使快速改造演变为另一种形式的锁定。
韧性也区分了可信项目与仓促项目。托管客户购买的不仅是电力,还有可用性。若升级增加了 AI 容量,却削弱了并行可维护性,便可能损害核心服务价值。
因此,正确的比较取决于工作负载规模、交付日期、地点、电力可用性和运营模式。新建仍是许多大型集群的最终选择;改造则为符合经验证限制条件的部署提供了一座桥梁。
这种分工削弱了“某一路线将胜出”的简单论断。最可能的赢家将同时采用两种方式:在现有基础设施具备优势的地方进行改造,在密度或规模不容妥协的地方新建。
三项信号将揭示改造优势是否真实存在
改造论点将接受已测量部署、可重复运营结果以及项目保持韧性的证据检验。
第一项信号是,建模容量能否转化为已投运的 AI 集群。运营商应披露新增可用 IT 容量、部署的冷却类型,以及从评估到投入运行所需的时间。没有投运证据的公告,无法验证速度优势这一论点。
如果多个设施能比同类新建项目更快地上线边界明确的 AI 分区,这一信号将强化 IES 的论点;如果结构、公用事业或设备限制在漫长研究后反复叫停项目,则会削弱该论点。
第二项信号是不同条件下的运营表现。有价值的报告应涵盖利用率、冷却能耗、用水量、组件故障、维护事件以及高温天气下的表现。仅凭平均 PUE 无法证明混合密度改造能够可靠运行。
结果还应区分建模估算与实际测量。当观测到的温度、功率流和控制响应保持在预测范围内时,数字模型才能赢得可信度。持续偏离则会暴露输入数据或系统假设的薄弱之处。
第三项信号是客户采用情况。托管服务商需要的是对改造容量的持续需求,而不只是技术就绪。签约工作负载、重复扩容和高利用率将表明,客户重视在成熟设施内更快部署的价值。
利用率疲弱则可能指向不同的限制因素。客户可能更偏好云端访问、更大的新建集群,或与特定硬件代际匹配的基础设施。他们也可能因可用性保证或未来冷却标准的不确定性而犹豫。
这些信号应在多个报告周期中出现,而非仅见于一次发布公告。改造是一项运营策略,因此其成功取决于投运后的可重复性。首个安装项目只能证明一个团队完成了一项工程。
对于企业采购方而言,眼下的问题是供应商能否记录整个容量链条。这包括公用事业供电、备用电源、机架交付、冷却、散热、网络、结构支撑和维护流程。仅仅声称拥有可用机房面积并不足够。
基础设施团队还应询问故障发生时会怎样。AI 分区能否在泵、CDU、电源模块或冷却单元离线后继续运行?技术人员能否在不中断相邻传统工作负载的情况下隔离问题?改造是否维持了合同约定的韧性水平?
开发者和 AI 产品团队同样关心这些答案。基础设施延迟会影响加速器获取、部署区域、模型训练进度和推理成本。成功的改造计划可以在更靠近现有用户和数据源的位置增加容量。
知识工作者将间接感受到结果。更分布式的推理容量可支持低延迟企业服务和私有化部署。然而,更快的基础设施增长也会加大对本地电网、规划系统和能源供应的压力。
IES 数据中心改造值得关注,因为它们能将闲置或不匹配的基础设施转化为近期可用容量的潜在来源。只有在详细测量确认整个设施能够支持这一变化的情况下,该方案才具备可信度。
下一步取决于运营商。他们应公布实测结果,而非泛泛宣称已为 AI 做好准备。买方应要求提供这些结果,将其与新建项目的替代方案进行比较,并且只有在速度伴随经验证的韧性时,才应视其为有价值。



