top of page

当数据中心变成高耗能的 AI 工厂

9月2日
讀畢需時 14 分鐘

Google News 本周凸显了一个鲜明区别:当加速器集群重塑数据中心的供电、冷却和投资模式时,普通数据中心便会转变为 AI 工厂。相关报告认为,这种变化远不止于安装更快的服务器。AI 基础设施将用电需求集中到日益接近重工业的规模。

这一比较至关重要,因为大多数挂着“数据中心”标签的设施,仍在运行传统企业软件、存储、网站和云服务。它们并非都配备了庞大的训练集群,也不会承受同样的机架级热负荷,更不需要相同的网络架构。

因此,真正的竞争并非 AI 数据中心与早期计算时代建筑之间的对决,而是面向加速器的专用建设与为多样化工作负载设计的灵活设施之间的较量。前者提供集中的计算能力,但也让电力获取、冷却和电网接入成为战略性约束。

AI 工厂与传统数据中心的区别

决定性的变化发生在:AI 工作负载开始主导设施架构,而不再只是占据其中一部分。

传统数据中心可以支撑数据库、网站、电子邮件、虚拟桌面、存储和企业应用。其服务器往往处理许多彼此独立、利用率不均的工作负载。运营商可以迁移部分任务、整合虚拟机,或更换单个系统,而无需重新设计整栋建筑。

以 AI 为核心的设施则以不同方式组织计算资源。数千枚加速器协同工作,用于训练模型或处理大量推理请求。加速器是一类专用处理器,例如 GPU,旨在并行执行大量数学运算。

这些处理器必须快速交换数据。这一要求使高带宽网络成为建筑的核心组成部分,而不再只是可选的性能升级。存储系统也必须持续提供训练数据,避免昂贵的处理器处于闲置状态。

原始分析将加速器集群、高功率密度、专用冷却、快速网络以及以 AI 为中心的业务目标,视为决定性的组合。每个组成部分都会强化其他部分。

更快的处理器在高强度运行时会消耗更多电力,并释放更多热量。将多个处理器装入一台服务器,会提高机架的供电需求。连接大量此类服务器后,便形成一个集群,其冷却和电气系统必须像一台协调运转的机器一样协同工作。

训练和推理也会形成不同的运行模式。训练通过让大量处理器处理大型数据集来构建或更新模型。推理则运行已经训练好的模型,以回答提示词、分类信息、生成媒体内容或支持软件代理。

训练任务可能会连续数天或数周占用大型集群。推理需求会随用户活动而变化,但运营商仍需具备足够容量,以应对流量峰值并满足延迟目标。与利用率较低的企业服务器相比,两者都可能带来更高的持续利用率。

两者之间的界限并不绝对清晰。传统云设施可以包含 AI 区域,而 AI 园区也可以运行常规支持系统。更有价值的区别在于,究竟是哪类工作负载决定了设计。

如果一栋建筑可以在不改变核心供电和冷却系统的情况下部署 AI 服务器,它仍然是配备 AI 设备的通用数据中心。如果加速器需求决定了变电站、供水系统、机架布局和网络设计,这座设施便已跨入 AI 工厂的范畴。

这一界定能避免一种常见的分析错误。汇总的数据中心统计数据将规模较小的企业服务器机房、托管站点、云区域和超大规模 AI 园区混为一谈。将所有设施都视为同等高耗能,会掩盖增长最快的实际所在。

Google News 的聚合报道让这份德国报告获得了更广泛的关注,但其核心议题具有国际性。公用事业公司、地方政府、云服务商和企业采购方,如今都需要一套更精确的词汇来描述自己正在批准或采购的基础设施。

Google News 突出集中的电力难题

AI 并非只是增加更多计算需求;它将这些需求集中为异常庞大、且与特定地点绑定的电力负荷。

国际能源署估计,数据中心在 2024 年全球耗电约 415 太瓦时。其基准情景预计,到 2030 年耗电量将接近 945 太瓦时,略高于日本目前的年度用电量。

该机构预计,针对 AI 优化的设施将推动其中大部分增长。其能源展望称,典型的 AI 专用中心耗电量可相当于 10 万户家庭。正在建设中的最大项目,其需求可能约为这一水平的 20 倍。

这些比较描述的是年度需求,但公用事业公司还必须解决另一个问题:大型 AI 园区会在电网中的某一个特定位置集中取电。设施无法通过平均分摊一个国家全境未使用的发电能力来获得供电。

这种本地集中化改变了规划方式。公用事业公司可能需要新建变电站、输电线路、变压器和发电资源。这些设备的审批和建设周期,往往长于服务器的交付周期。

在美国,最新的全国建模让这种压力变得清晰可见。劳伦斯伯克利国家实验室于 2026 年 6 月发布的2025 年更新报告估计,基准情景下,2030 年数据中心负荷将达到 649 太瓦时。

其不确定性区间介于 521 至 843 太瓦时。在这些情景下,到 2030 年数据中心将占美国总用电量的 9.5% 至 15.3%。中位估计为 11.8%。

这一范围之所以较宽,是因为多个变量仍未确定,包括加速器出货量、设备寿命、服务器利用率、空闲功耗,以及传统数据中心增长的速度。预测不是电表读数,但每一种情景都指向显著扩张。

该实验室的敏感性情景也揭示了 AI 为何重要。增加专用图形处理器的部署数量,会推高预测用电量;AI 服务器更高的利用率和空闲功耗,会进一步将其抬升。

对于公用事业公司而言,压力在每一台服务器安装前就已经到来。开发商会根据规划容量申请电网接入,而多个项目可能瞄准同一地区。公用事业公司必须判断哪些提案可信,同时避免建设客户最终无法充分使用的基础设施。

美国能源部的输电研究草案反映了这一变化。报告描述了一个电网:它正从数十年需求相对平稳的阶段,进入由超大规模 AI 设施、制造业和电气化共同塑造的新时期。

这一转变施压的不只是电力公司。地方官员必须在税收和建设带来的收益,与用水、土地需求、噪声、备用发电以及潜在电价影响之间权衡。现有用户希望得到保证:新基础设施的成本不会简单地转嫁到家庭电费账单上。

传统设施也可能引发类似问题,尤其是在超大规模场景下。区别在于强度和速度。AI 园区将更大的单体接入申请,与由稀缺加速器和竞争性模型研发驱动的建设竞赛结合在一起。

机架密度是最清晰的物理分界线

最实用的判断标准是每个机架的功率,因为功率密度决定传统冷却和电气设计是否仍然可行。

机架密度衡量安装在一个机柜中的设备所承载的电力负荷。许多企业应用仍在较低水平下运行。AI 训练服务器则可能将单个机架推至远超现有大多数设施范围的水平。

Uptime Institute 的2025 年调查发现,82% 的受访运营商没有功率超过 30 千瓦的机架。仅有 9% 表示其设备达到或超过每机架 50 千瓦。

随着密度提升,AI 和高性能计算变得更加突出。在每机架超过 60 千瓦时,这些计算密集型工作负载成为高密度部署的首要原因。

这些数据为戏剧化的行业叙事提供了重要修正。AI 算力正在快速增长,但极端密度仍集中于少数站点。已部署的数据中心基础中,大部分仍更接近传统形态。

密度之所以重要,是因为进入服务器的几乎每一瓦电力最终都会转化为热量。因此,一个消耗 100 千瓦的机架就像一个紧凑的工业热源。可靠地移除这些热量,成为核心生产要求。

传统风冷让冷空气流经服务器,并带走热空气。它在市场的大部分场景中仍然可行。然而,随着机架密度提升,运营商必须在日益受限的空间内输送更大量的空气。

直接液冷通过靠近处理器或其他高热组件的液体传递热量。液体的传热效率高于空气,因此对高密度加速器系统颇具吸引力。这一术语涵盖多种设计,包括附着于芯片上的冷板,以及使用介电液体包围设备的浸没式系统。

液冷并不一定在每栋建筑中都更具优势。改造旧站点可能需要新的管道、分配单元、泄漏控制措施、维护流程和受过培训的工作人员。硬件兼容性和运营标准也仍不统一。

Uptime 的独立冷却研究发现,到 2025 年,液冷的采用仍在缓慢推进。高机架密度是运营商考虑直接液冷的首要原因,而集成难题和故障风险则减缓了部署速度。

这构成了核心基础设施权衡。专用设计能够更有效地运行高密度集群,但专用化会降低灵活性。针对加速器机架、液冷回路和紧密耦合网络进行优化的建筑,代表着与通用设施不同的资本投入。

网络又增加了一层复杂性。单个加速器若在等待数据,便会浪费昂贵的算力,因此 AI 集群使用高速互连来协调处理器。网络拓扑、线缆距离和通信延迟,都可能影响整个训练系统的性能。

存储系统同样必须跟上节奏。训练任务会反复读取大型数据集并写入检查点,后者能在任务中断时保留进度。这些模式不同于提供普通企业文档服务或维护交易数据库。

因此,AI 工厂是一套系统,而不是装满 GPU 的房间。处理器、网络、存储、冷却和供电必须保持平衡。无限制地扩大某一个组件,无法长期弥补其他环节的瓶颈。

这一机制解释了为何一些现有数据中心无法仅通过常规服务器更换就成为大型 AI 场址。它们的电网接入、楼板承重、冷却分配或网络布局,可能在首个大型集群达到满规模前就形成硬性上限。

效率提升并未终结能源争论

AI 硬件在单项任务上的效率可以提高,但总电力和用水需求仍会持续上升。

这正是 AI 基础设施核心的反弹问题。更好的芯片、模型和软件会降低完成单个工作单元所需的资源。成本下降随后会鼓励更多用户、更大的模型、更丰富的输出,以及更多自动化任务。

IEA 于 2026 年 4 月报告称,数据中心电力需求在 2025 年期间增长了 17%。该机构还发现,五家大型科技公司当年投资超过 4,000 亿美元,其合计资本支出预计将在 2026 年进一步增长。

与此同时,该机构表示,每项 AI 任务的能耗正在快速下降。这些发现并不矛盾。单位效率和总体消耗衡量的是不同结果。

更高效的文本模型或许会为每次回答消耗更少能源。但如果服务响应了更多提示、生成更长答案、处理视频,或运行持续性的智能体,总需求依然会上升。

AI 智能体是朝着某一目标执行一系列模型驱动操作的软件。它可以搜索、编写代码、审阅文档、调用其他软件并修订自身工作。因此,一个用户请求可能触发大量推理操作。

同样的张力也体现在设施效率上。电能使用效率(PUE)将数据中心的总用电量除以计算设备消耗的电量。PUE 为 1.2 意味着,IT 每使用 1 个单位的电力,还需要额外 0.2 个单位用于冷却及其他开销。

更低的 PUE 更好,但并不保证总消耗更低。一座高度高效、同时快速扩张加速器容量的设施,可能比规模更小、效率较低的场址消耗更多电力。

Google 说明了这一差别。其 2026 environmental report 表示,公司在 2025 年签约采购了超过 12 吉瓦的新增清洁能源。Google 还称,效率和清洁能源举措避免了超过 5,800 万公吨二氧化碳当量排放。

该公司在 2025 年补充了约 77 亿加仑水量,约相当于其淡水总消耗量的 78%。这些是重要的运营举措,但并未消除基础设施问题。

签约的清洁能源并不总能在数据中心实际用电的确切地点和时段输送电力。项目也可能面临延迟、输电限制或发电表现差异。Google 承认,实际发电量可能与签约容量有所不同。

水资源核算也需要同样谨慎。补水项目可以在流域中恢复水资源,但补水并不等同于避免特定设施取水。当地条件决定了用水是否会与其他需求形成竞争。

冷却技术能够改变水和电之间的平衡。蒸发式系统可能减少机械冷水机的用电,但会消耗更多水。干式冷却可以节约用水,但在某些天气条件下可能需要更多能源或更大的设备。

这些权衡使单一指标具有误导性。低 PUE 并不能揭示电力供应的碳强度。可再生能源合同无法反映逐小时的电网状况。企业用水目标也无法描述每一个当地流域的情况。

因此,审慎的观点并非效率工作没有价值,而是效率主张需要一个绝对分母。读者应询问,在工作负载增长的同时,总电力、用水和碳排放变化了多少。

Google News 的报道可能会放大传统设施与 AI 设施之间简洁的对比。更困难的报道任务,是追踪承诺的效率改善是否超过 AI 服务的扩张速度。目前证据表明,任务层面的效率提升尚未阻止总体需求增长。

电网接入正成为产品的一部分

对 AI 开发者而言,获得可靠电力如今会影响计算能力、部署时间和竞争地位。

云计算曾让客户将基础设施视为一个抽象资源池。开发者选择一个区域、订购虚拟资源,并将实体规划留给供应商。AI 将物理层重新带回采购决策之中。

一家公司可以拥有先进的加速器,却无法以期望的规模运行它们。它仍需要通电的建筑、冷却设备、网络连接和公用事业审批。任何一个环节延误,都会让宝贵硬件无法充分利用。

这改变了开发者的建设地点选择。拥有可用输电容量、合适土地、支持性许可流程和可靠发电能力的地区,变得更具吸引力。靠近主要市场的地点仍保有延迟优势,但对于一些训练工作负载而言,可用电力可能比距离更重要。

训练通常比实时推理更容易迁移。只要能保障数据和硬件,一项长期模型训练任务就可以在具备电力和容量的地方运行。推理服务可能需要更广泛的地理分布,以提供低延迟并遵守数据规则。

结果形成了一张两部分基础设施地图。大型训练园区集中于能源资源丰富的地点,而推理能力则更靠近用户分布。两者都需要加速器,但其网络、可靠性和利用率要求不同。

能源采购也正成为产品战略的一部分。科技公司已签署涉及可再生能源、先进地热能源、核电站和未来小型模块化反应堆的协议。一些项目需要多年才能发电,从而在 AI 需求与新增供应之间形成缺口。

天然气可以填补这一缺口,因为可调度电厂能够在需要时运行。然而,新增化石燃料发电可能增加排放,并使客户面临燃料价格风险。可再生能源项目在某些市场建设更快,但需要输电、储能或补充性发电。

现场发电提供了另一条路径。一个园区可能使用燃料电池、涡轮机、电池或微电网,以降低对延迟电网接入的依赖。这些系统可以提升韧性,但并不能消除环境或监管问题。

弹性计算提供了一个不那么显眼的选择。运营商可以将可容忍延迟的任务转移到电网容量可用或低碳电力充足的时段。这需要软件能够围绕计算与能源条件共同调度工作负载。

并非所有 AI 任务都具有弹性。面向客户的推理需要可预测的响应时间。当数千个处理器必须保持同步时,训练任务中断的代价也可能很高。

因此,公用事业公司需要比拟议园区铭牌额定容量更完善的信息。它们需要预期负载、爬坡行为、备用安排、建设里程碑和灵活性承诺。缺少这些细节,它们就可能围绕投机性请求进行规划。

开发者则面临相反的担忧。披露过多未来容量信息可能暴露竞争计划。在尚不清楚模型、客户和硬件交付能否符合预测前,他们也无法保证利用率。

这种信息缺口给双方都带来压力。公用事业公司希望在建设基础设施前获得确定承诺。AI 公司则希望在让每一项商业承诺完全确定前先获得基础设施。

传统数据中心长期以来一直在协商这些问题,但规模正在变化。最新美国预测的基准情景显示,到 2030 年数据中心用电量将达到 649 太瓦时。在这一水平上,电力采购已不再是后台运营职能。

它成为 AI 供应链的一部分,与芯片、内存、网络和软件并列。模型提供商的有效容量取决于所有这些要素。

三个信号将显示 AI 工厂模式是否成立

下一项考验不是又一则引人注目的园区公告,而是建设、利用率和能源供应能否同步推进。

第一个信号是从已宣布的电力请求到实际运行负载的转化率。开发者经常以吉瓦描述项目,但申请容量并不等于已建成的基础设施。

公用事业公司和监管机构应公布更清晰的数据,包括已签署的并网协议、建设里程碑和已通电容量。已完成接入数量的增长将强化 AI 工厂论点。请求量与运营场址之间不断扩大的差距,则会暴露投机性超额预订或物理瓶颈。

这一差别关系到付费用户。围绕不确定项目建设输电和发电设施,可能产生搁浅成本。等待过久也可能将可信投资推向其他地区,并限制经济发展。

第二个信号是加速器的实际利用率。一整座服务器大厅即使满载,如果昂贵的处理器过多时间处于空闲状态或等待数据,仍可能浪费电力。运营商很少披露一致的全机群利用率数据,这使需求预测更难检验。

更高且持续的利用率将表明,客户正在将已安装容量转化为有价值的 AI 工作。持续偏低的利用率则意味着硬件采购和园区建设可能跑在持久需求之前。

利用率必须结合效率来理解。一台被充分使用的加速器可能比闲置加速器消耗更多电力,却能产出更多有用工作。读者需要同时了解总能耗和已完成工作负载的指标,才能理解结果。

第三个信号是匹配地点的特定能源供应。企业公告经常强调签约的清洁发电。更严格的检验是,新增电力是否会在设施需要时送达相关电网区域。

新增输电、储能、地热发电、核电容量或可靠的可再生能源组合,将强化这样的说法:AI 增长可以得到支持,而不主要依赖现有化石燃料发电。反复的项目延误则会削弱这一说法。

用水也应以同样的地理精度追踪。公司范围的补水百分比无法回答某个社区是否面临季节性压力。场址层面的取水量、消耗量、水源类型和冷却技术能提供更清晰的视角。

这些信号也有助于企业买家。购买 AI 服务的客户通常看到的是模型质量、延迟和使用条款。基础设施限制最终可能影响服务可用性、区域选择及其碳排放特征。

开发者也应关注,因为具备能源意识的软件设计正变得具有经济意义。更小的模型、缓存、批处理、工作负载调度和高效检索,都能减少不必要的加速器活动。这些选择不能替代基础设施,但会影响每个产品所需的基础设施规模。

知识工作者同样与此相关。智能体系统可以成倍增加后台推理,却不让这些活动显现出来。用户应期待供应商说明,自动化工作流如何管理不必要的模型调用,尤其是在相似结果需要不同计算量的情况下。

“AI 工厂”这一标签只有在强化问责时才有意义。它应识别那些将加速器密度、冷却、网络和电力采购结合为一个生产系统的场址。它不应将每一间服务器机房都变成 AI 环境影响的象征。

这份精确性正是这则 Google News 条目持久价值所在。传统设施对于金融、政府、制造业、通信以及日常云服务仍然不可或缺。AI 园区则属于更为集中的类别,其工程和政策影响也有所不同。

未来几个月的问题很明确:已通电容量、实际有效利用率以及新增电力供应,能否跟上已公布的 AI 雄心?应关注这三个信号,而不是那些展示庞大服务器园区的效果图数量。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page