一场 3 吉瓦电网冲击暴露 AI 数据中心控制难题
- Olivia Johnson

- 7月26日
- 讀畢需時 15 分鐘
7 月 22 日,超过 3 吉瓦的数据中心负载突然从电网上消失,Google News 捕捉到了这一严峻警示。北弗吉尼亚州一条输电线路退出运行,促使数据中心几乎同时切换至备用电源。各设施保护了自己的服务器,但它们的集体反应却给区域电网带来了更大的问题。
这场扰动远远超出了弗吉尼亚州范围。在 PJM Interconnection 覆盖区域内均检测到了电压变化,该区域从华盛顿特区延伸至芝加哥。据电网运行数据显示,超过 3 吉瓦约占当时 PJM 电力需求的 3%。
PJM 表示,整体可靠性并未受到破坏。但这并不意味着该事件无害。一次输电故障,就让数千兆瓦的计算基础设施如同一个巨型电气开关般动作。
这次险情暴露了现代数据中心设计中的矛盾。每一座设施都旨在保护自身设备免受不稳定电网供电的影响;但区域电网依赖大型用户在同一扰动期间保持可预测的行为。
这两个目标在北弗吉尼亚州相互冲突。眼前的解决办法并不只是增加发电能力、输电线路或备用发电机。数据中心还需要故障穿越控制、协调恢复、准确的电气模型,以及可执行的并网规则。
一条故障线路触发了 3 吉瓦负载下降
决定性事件并非输电故障本身,而是数据中心保护系统的同步响应。
7 月 22 日事件始于北弗吉尼亚州一条输电线路退出运行。Dominion Energy 表示,附近的数据中心随后短暂切换至备用电源。这家公用事业公司强调,并非由其下令让这些设施脱离电网。
这一区别至关重要。电网运营商会常规性地为输电线路、发电机及其他设备故障做预案,但对于数吉瓦客户负载在没有直接指令的情况下突然消失,他们的管理经验较少。
电网必须几乎持续保持供需平衡。当发电机突然故障时,可用供给低于需求,系统频率便会下降。运营商会为这种熟悉的紧急状况保留备用容量。
大规模数据中心脱网则颠倒了这一关系。发电机仍按此前的负载水平发电,但需求却下降了。过剩电力可能推高频率和电压,直到电网控制系统降低发电量或吸收这种失衡。
PJM 为覆盖 13 个州和华盛顿特区的约 6700 万人口提供服务。此次消失的数据中心需求约相当于事件发生时其总负载的 3%,其规模足以像多座大型发电厂以相反方向突然消失一样影响系统。
这场扰动还表明,本地的保护决策可能产生区域性后果。北弗吉尼亚州汇集了密度异常高的数据中心,因此许多设施可能在几乎同一时刻经历近似的电压扰动。
它们的不间断电源,即 UPS 系统,旨在保护服务器免受电压下降和其他电能质量问题影响。UPS 利用电池和电力电子设备,在备用发电启动或电网状况恢复期间维持计算设备运行。
从每个运营商的角度看,这种保护发挥了作用。服务器保持供电,设施避免让敏感电子设备暴露于不确定电压之下。然而,对电网而言,这种聚合后的切换等同于需求突然消失。
该事件在区域内引发了明显迹象。居民报告灯光闪烁,一些数据中心发电机开始运行。Dominion 后来表示,根据北弗吉尼亚州报道,是这些设施的内部控制系统启动了切换。
并未发生大范围停电。这使该事件成为一次险些酿成事故,而非电网崩溃。但它也让运营商有机会在同一机制于更困难的运行期间再次出现前解决这一问题。
事件发生的时机加剧了担忧。PJM 在 7 月已面临较高的夏季需求和紧张的运行条件。负载突然消失在任何情况下都可能带来风险,而当系统本已承压时,管理难度会更高。
Google News 的报道将注意力集中在故障输电线路上。更具影响力的故事其实发生在数据中心内部:它们的控制系统将短暂的电网扰动视为离网理由,却没有考虑周边数千兆瓦负载可能同时采取的行动。
北弗吉尼亚州此前已出现过这种故障模式
7 月事件的规模大于此前事故,但其基本故障模式早已有记录。
2024 年 7 月,一次雷击在北弗吉尼亚州引发输电级故障。根据提交给 North American Electric Reliability Corporation 的材料,约 60 座设施中约 1500 兆瓦的数据中心负载脱离了电网。
据报道,该电网故障在不到一秒内便被清除。但许多设施仍将计算负载切换至备用电源。它们的保护系统对扰动的反应速度,快于更广泛电力系统传达正常供电已恢复的信息速度。
2025 年 2 月又发生了第二起重大事件。一棵树撞击导致一条 230 千伏输电线路中断,约 1800 兆瓦的数据中心需求转离电网供电。一些设施仍保持并网,表明脱网并非技术上不可避免。
2026 年 7 月事件使报告中的总量突破 3 吉瓦。因此,在两年内,PJM 和 Dominion 已面对三起因输电扰动而导致集中数据中心需求下降的重大案例。
这种重复改变了事件的解读。电网运营商面对的并非一系列罕见且彼此无关的设备故障组合,而是由数据中心电气系统配置方式产生的一致性反应。
此前事件还显示出设施之间的重要差异。一些数据中心能够穿越电压扰动,而另一些则脱网。故障穿越意味着在短暂且定义明确的电压或频率偏差期间保持并网,而不是立即切换离开。
这种差异表明,许多站点可能已经具备所需硬件。更困难的工作在于设置、验证、协调,以及支配这些设置的商业优先级。
数据中心运营商自然会将服务器可用性置于首位。中断可能影响云服务、金融交易、企业软件、流媒体平台和 AI 训练任务。因此,当电能质量变得不确定时,运营商会保守地配置保护系统。
电网可靠性则带来不同的风险权衡。一座设施切换至电池供电,对区域影响微乎其微;数十个园区同时切换,则可能形成规模超过传统发电厂故障的系统性事件。
设施的集中分布使北弗吉尼亚州尤其容易受到影响。当地数据中心往往通过关联的输电走廊接入,并经历共同的扰动。相似的电气设备也可能以类似阈值响应这些扰动。
这会形成共因风险,即多个独立系统因为共享某种条件而同时故障或作出相同反应。即使建筑之间存在物理隔离,若其控制系统以相同方式解读同一电压信号,这种隔离也几乎无法提供保护。
问题不会局限于弗吉尼亚州。得克萨斯州、俄亥俄州、宾夕法尼亚州、佐治亚州等地都在开发大型 AI 园区。一些拟建站点申请的用电量甚至超过许多传统工业综合体。
美国能源部表示,美国数据中心用电量从 2014 年的 58 太瓦时增至 2023 年的 176 太瓦时。根据其大型负载分析,到 2028 年,需求可能达到 325 至 580 太瓦时。
单个项目的申请规模也在不断扩大。该部门曾提到,拟建站点申请的容量最高可达 4.5 吉瓦。如此规模的园区在电网扰动期间不能像普通商业用户那样运行。
AI 基础设施加剧了这一问题,因为其电力需求既庞大又集中。数千个加速器可以在高度同步的计算集群中运行,其冷却系统、网络设备和电力转换系统又增加了额外的电气复杂性。
因此,7 月事件不只是 Data Center Alley 的又一个可靠性问题。它是一个早期案例,展示了当计算园区成为电网规模的参与者、却未承担电网规模性能责任时会发生什么。
Google News 揭示服务器安全与电网安全之间的冲突
核心冲突很简单:数据中心为服务器优化保护机制,而电网运营商需要这些设施保持可预测。
UPS 通常会监测电压、频率、相位及其他电能质量指标。如果这些测量值越过设定阈值,UPS 可以隔离计算负载,并由电池供电。若中断持续,发电机随后可能启动。
在单栋建筑内,这一流程合乎逻辑。它可以防止短暂的电气故障导致服务器宕机或正在进行的工作损坏,也使运营商无需依赖公用事业公司的恢复时间。
问题始于保护阈值对输电级事件过于敏感。短暂的电压暂降并不总意味着供电服务已经中断,它可能只是反映网络其他位置的保护设备正在清除故障。
如果 UPS 将这种暂降误判为持续停电,它就会在最不合适的时刻停止从电网取电。数百套相似系统可能在电网电压尚未稳定前作出同样决定。
传统上,数据中心被视为被动负载。公用事业公司负责向其供电,设施业主管理电表之后的可靠性。但当一个客户园区就可能消耗数百兆瓦时,这种分工已不再足够。
如今,大型 AI 园区在规模上已类似一种电网资源,即便监管机构仍将其归类为客户。其决策可能影响系统频率、电压、备用容量启用和输电潮流。
发电资产所有者已在详细的故障穿越要求下运行。许多风电、太阳能和电池电站必须在规定扰动期间保持并网。这些标准源于此前的事件:基于逆变器的发电资源曾同步脱网并放大电网问题。
大型负荷往往缺乏同等的国家级要求。它们的并网协议可能因公用事业公司、地区、设备供应商和项目日期而异。这使得面对同一信号的电网运营商,看到不同设施表现出不一致的行为。
最直接的回应是要求数据中心永不脱网。但这走得太远。设施必须在严重或持续故障期间保护设备,不安全的连接状态对客户和电网都没有好处。
更好的做法是界定一个安全运行边界。数据中心应在约定的电压和频率范围内,经受短时扰动而保持并网;当条件超出这些范围时,再切换至备用电源。
这类规则需要精确的时间判断。持续数个电气周期的扰动,与持续数秒的停电并不相同。保护系统需要足够的信息,来区分已被清除的故障和仍在持续的供电中断。
它们还需要协调 UPS 设备、开关设备、电池、发电机和公用事业保护装置。每个组件单独配置时都可能是正确的,但组合后的系统仍可能产生意外切换。
Google News 读者可能会将这起事件视为一则关于 AI 日益增长的用电需求的报道。需求增长确实构成压力的一部分,但仅凭用电量无法解释 7 月的这次扰动。
一个完全稳定的 3 吉瓦负荷,可能比一个以不可预测方式脱网又重新并网的较小负荷更容易管理。运行层面的挑战关乎行为,而不只是总能耗。
这种区别也改变了责任归属。新建更多发电厂无法纠正过于敏感的 UPS 设置。再建一条输电线路,也无法协调故障后数千兆瓦负荷的回归。
公用事业公司、数据中心业主、设备供应商和电网运营商必须共同承担这项工作。各方分别控制电气链条中的不同环节。没有其他参与方的数据,任何单一参与者都无法验证完整响应。
行业还必须克服保密方面的顾虑。数据中心企业严密保护设施设计、客户身份和计算容量。电网运营商并不需要这些商业细节,但确实需要可靠的电气模型和运行记录。
缺少这些信息,规划人员只能猜测一个园区会如何运行。随着园区规模接近大型发电站,这些猜测会变得愈发危险。
修复要从穿越能力和更缓慢的恢复开始
数据中心需要两项相互协调的能力:在可控故障期间保持并网,以及在必要切换后逐步恢复。
第一项能力是电压穿越。保护设置应能容忍明确范围内的短时扰动。在输电系统清除故障期间,设施将继续从电网取电。
这并不要求让服务器直接暴露于不稳定电力中。UPS 设备可以调节输入电源,同时维持受控的电网连接。电池可以缓冲短时变化,而不必迫使整个园区在电气上完全退出电网。
研究人员已经在考察这些系统在电网规模下的表现。Pacific Northwest National Laboratory 已为大型数据中心开发电磁暂态模型,其中包括其 UPS 控制和穿越响应。
这些详细模型能够模拟传统规划工具可能遗漏的极快速电气行为。该实验室的数据中心模型旨在帮助公用事业公司研究大型设施在电网扰动期间的反应。
第二项能力是受控重连。当设施必须切换到备用电源时,不应在电压看似恢复正常后立即恢复全部负荷。许多园区同时这样做,可能造成另一轮急剧失衡。
平缓恢复会以可控阶段增加电网需求。设施可以与公用事业公司协调这些阶段,或遵循预先批准的爬坡速率。这能让发电控制系统有时间匹配回归的需求。
这一过程类似于车辆汇入高速公路。让所有车辆停住会造成一种问题,但同时放行所有车辆又会造成另一种。受控爬坡能保持流动,同时避免产生新的冲击。
具体的爬坡速率应反映当地电网条件和设施设计。靠近大规模发电资源接入的园区,与通过受限输电走廊供电的园区,可能适用不同限制。
电网运营商还需要遥测,即从设施实时发送到控制室的测量数据。至少,运营商需要知道大型园区当前使用的是电网电源、电池、发电机,还是处于分阶段恢复过程中。
遥测可减少事件期间的不确定性。它帮助运营商区分输电问题与客户控制响应,也能揭示可能回归的负荷规模及其回归速度。
数据中心应在接入前提供经过验证的电气模型。这些模型需要包括 UPS 阈值、发电机切换、电池行为、保护逻辑和预期的重连序列。
模型验证必须在建设完成后持续进行。设备设置会变化,园区会新增服务器机房,软件更新也会改变控制器行为。数年前获批的模型,可能在多次扩建后变得不准确。
公用事业公司可通过扰动记录和受控测试验证性能。相量测量单元,即 PMU,可提供同步的电压、电流和频率读数。它们能够显示某设施是否遵循了约定的响应方式。
美国能源部强调,PMU 可用于检测与大型数据中心负荷相关的振荡。其监测指南说明了同步测量如何揭示普通电表无法捕捉的行为。
并网协议随后应将这些技术需求转化为可执行的义务。要求可以明确穿越范围、遥测、模型更新、爬坡速率、测试,以及重大控制变更前的通知。
新设施可在获得供电服务前接受这些条款。现有场址的问题更棘手,因为它们依据较旧协议运行,并且可能使用能力不同的设备。
监管机构需要制定分阶段的合规路径。最高优先级应放在高密度地区,在那里一次共同的输电事件可能影响数吉瓦负荷。北弗吉尼亚是最明确的起点。
成本应由责任方承担。控制系统造成可量化区域风险的客户,应为必要的研究、通信和升级提供资金。居民用户无法更改私有数据中心内部的 UPS 设置。
与此同时,监管机构不应将每一次备用切换都视为不当行为。目标是在约定边界内实现可预测行为,而不是剥夺设施业主保护设备的能力。
仅靠备用电源无法解决问题
更多电池和发电机可以保护数据中心,却仍可能使电网行为恶化。
备用电源常被视为设施在停电期间不会给电网带来负担的证明。这种说法解决的是园区内部的连续性问题,却几乎没有说明这种切换会给周边系统带来什么影响。
电池几乎可以瞬间承接计算负荷。这种速度保护了服务器,但也意味着数百兆瓦负荷几乎可以瞬间从公用事业需求中消失。快速设备并不天然等于对电网友好的设备。
发电机带来了另一类时间问题。柴油或燃气机组通常需要比电池更长的时间才能启动和稳定。UPS 会弥合这段间隔,此后设施可能继续与电网隔离。
设施最终必须重新并网。如果运营商将重连视为一项私有运行决策,电网在已下调发电后,可能面临意外的需求激增。
微电网可以改善协调。微电网结合本地发电、储能、负荷与控制系统,可在接入或脱离更大范围电网的情况下运行。但其控制器仍需要就进入和退出孤岛运行制定约定规则。
协调不佳的微电网,只是把同一个问题移到更复杂的控制器之后。它可以平稳脱网,却仍可能在错误时点移除巨大的负荷。
一些运营商可能因电气故障会损坏敏感设备而抵制穿越要求。这种担忧合理。规则必须反映设备限制,不能假定每一次扰动都是安全的。
同样,也没有公开证据表明 7 月 22 日涉及的每一处设施都使用了相同设置。汇总响应指向了一个共同问题,但细节仍属机密。在明确划分具体责任之前,调查人员仍需要设施层面的记录。
据报的 3 吉瓦总量也应被视为初步运行估算。PJM 和 Dominion 可在审查高分辨率测量数据后完善事件序列。各家公司尚未公开披露各自的贡献。
另一个顾虑涉及网络安全。实时协调会在公用事业公司与私有园区之间建立通信连接。这些连接需要认证、分段、后备控制,以及对远程命令的严格限制。
可靠性规则应界定交换的信息,而不暴露敏感的计算运营。电网运营商需要的是电气状态和预期需求,而非客户工作负载或专有 AI 模型的细节。
数据中心的灵活性也有限。一些计算任务可以在时间或地区之间迁移,但交互式服务需要即时处理。公用事业公司不应假定每一种 AI 工作负载都能在电网承压时转为需求响应资源。
不过,不确定性并不是推迟基本标准的理由。监管机构在确立穿越预期之前,发电资源也曾面临类似的技术争议。测试和分阶段实施可以解决设施特有的问题。
更大的风险是在规则不一致的情况下持续增长。2024 年一次 1,500 兆瓦的事件,在 2026 年变成了超过 3 吉瓦的事件。这一趋势并不能证明下一次扰动会再次翻倍,但它缩小了安全余量。
Google News 的报道可能让这起事件看起来像又一场关于 AI 用电量的争论。更紧迫的问题是:当条件不再正常时,大型园区能否继续成为合格的电网公民。
三个信号将表明电网是否正在变得更安全
下一项检验是,运营商能否在下一次输电故障到来前,将一次险些失控的事件转化为可衡量的要求。
第一个信号是 PJM 或 NERC 发布详细的事故审查。该分析应确定引发故障、数据中心切换序列、频率响应以及重连时机。
一份有用的报告将区分那些实现穿越的设施和那些脱网的设施。这种比较能够识别是设备能力、保护设置、并网条款,还是本地电压条件造成了差异。
如果审查包含明确的性能结论,将加强制定针对性标准的理由。若只有未涉及设施行为的笼统总结,规划人员仍将不得不依赖假设。
第二个信号是针对大型负荷的正式穿越框架。PJM、Dominion、NERC 或州监管机构应界定主要设施必须承受的电压和频率范围。
该框架还应涵盖渐进式并网恢复、遥测、模型验证和事后报告。仅有故障穿越要求,只解决了问题的前半部分。
新的并网协议提供了最快的推进路径。公用事业公司可以将合规作为新增容量送电的条件。对于现有园区,则需要根据规模、位置和区域总体风险设定整改期限。
如果这些条款出现在公开申报文件或获批电价表中,行业就将从讨论迈向执行。自愿性指引意味着进步,但无法保证各方采取一致行动。
第三个信号,是在下一次电网扰动期间观察到的独立运行表现。只有当电压确实发生波动时,数据中心的实际行为与模型一致,标准才有意义。
PMU 记录应显示,在可控故障期间断开的设施有所减少。当转供仍有必要时,数据应体现分阶段恢复,而不是再次出现突发负荷变化。
更好的结果未必总是让公众毫无察觉。一些设施可能仍会启动发电机,居民也可能仍会注意到短暂的灯光闪烁。关键指标是总体需求是否仍处于可控状态。
这些信号的重要性也不止于 PJM。得州及其他快速增长市场的电网运营商,也在接入规模相近的大型园区。在自身的数据中心集群达到同等集中度之前,他们可以借鉴北弗吉尼亚的经验。
开发商和企业采购方同样应予以关注。电网性能要求可能影响园区工期、硬件选择、运营流程,以及新增 AI 容量的建设地点。
云服务客户很少了解支撑其计算工作负载的具体电气控制措施。然而,反复发生的电网扰动最终可能影响服务可靠性、区域审批流程和新增容量部署速度。
跟踪这些进展的团队,需要保存来自众多渠道的监管申报文件、工程报告和事件更新。可检索的 AI knowledge base 能够在技术结论不断演变的过程中,将这些记录关联起来。
7 月 22 日的事故没有引发运营商担心的大规模停电。但它在仍有时间解决问题时,暴露了一个控制问题。下一条 Google News 标题应告诉我们,公用事业公司和数据中心业主是否利用了这一警示,还是只是在等待一次破坏性更大的考验。


