3,800 MW 负荷骤降后,PJM 数据中心可靠性面临联邦层面的考验
在一次通常可被正常切除的输电故障期间,3,800 兆瓦需求从电网中消失,使 PJM 数据中心可靠性成为联邦层面的关注事项。7 月 22 日的事件并未引发停电,但它暴露了数据中心保护与区域电网稳定性之间的冲突。
一条 230 千伏输电线路发生故障并导致电压下降后,北弗吉尼亚的数据中心转入备用电源。其系统按设计保护了敏感计算设备。然而从 PJM 的角度看,数千兆瓦负荷在两轮快速变化中消失。
监管机构如今面临艰难取舍。数据中心需要免受电力扰动影响,而电网运营商则需要大型负荷在常规故障期间保持并网。为普通商业用户设计的规则,无法完全覆盖规模堪比发电厂的设施。
一次常规故障触发了异常负荷转移
7 月事件表明,当大量数据中心同步响应时,一次常规输电故障可能演变为区域平衡问题。
此次扰动始于 Dominion Energy 位于北弗吉尼亚的供电区域,时间为 2026 年 7 月 22 日。一条 230 千伏输电线路发生故障,该线路服务区域内高度集中分布着超大规模数据中心。
线路保护系统正常切除了故障。没有断路器卡滞,公用事业公司也未要求客户下线。然而,数据中心控制系统检测到电压扰动,并将大量需求切换至现场备用电源。
据电网运营商在一份可靠性审查中披露的情况,PJM 最初损失约 2,970 兆瓦负荷。第二波使总转移量升至约 3,800 兆瓦。
PJM 的总负荷从 99,984 兆瓦降至 96,205 兆瓦。这意味着在短暂的运行时间窗口内,负荷下降约 3.8%。
电网原本已安排发电机组满足较高水平的需求。当数据中心脱离电网后,发电量暂时超过了剩余负荷。PJM 在努力恢复平衡的过程中,频率和电压随之变化。
区域控制误差用于衡量一个平衡区域内计划电力交换与实际电力交换之间的偏差。由于 PJM 突然拥有超过客户所需的发电量,7 月事件令这一指标大幅转正。
运营人员调度无功功率资源以降低电压,并调整发电出力。九分钟后,PJM 将其区域控制误差恢复至规定限值内。适用的北美可靠性标准允许 30 分钟。
这一响应至关重要。系统保持稳定,运营人员在规定期限内大幅提前纠正了失衡。因此,该事件不应被描述为停电或 PJM 控制室的失误。
Dominion 也表示,并非其切断了数据中心。是这些设施自身的保护系统启动了向备用电源的转移。这一区别意味着直接行动来自设施控制系统,而非公用事业公司主导的负荷削减。
但结果仍然严重,因为扰动跨越了设施边界。每家运营商都独立保护其设备,但叠加后的响应形成了一次电网规模事件。
PJM 称其为历史上最大的一次负荷转移。北弗吉尼亚此前发生的类似扰动,在 2024 年和 2025 年都曾造成约 1,500 兆瓦负荷退出。
这一过程表明,7 月事件并非孤立的设备故障,而是电网官员此前已观察到行为模式的一次更大规模重演。
因此,PJM 数据中心可靠性已不再仅仅关乎为未来园区保障足够电力。它也涉及并网设施在仅持续数分之一秒的扰动期间会如何响应。
为什么 AI 数据中心不同于普通负荷
AI 园区集中了高需求、敏感电子设备和自动化控制系统,其响应速度可能快于传统电网资源。
传统电网规划将用电需求视为相对可预测。用电量会升降,但大多数客户不会在短暂电压变化后同时切断数吉瓦负荷。
超大规模计算对这一假设构成挑战。一个园区可消耗数百兆瓦电力,而多个园区可能共用同一输电走廊,并采用类似的保护设置。
这些设施包含服务器、网络设备、冷却系统、电力变换器、电池和备用发电机。自动化系统监测输入电力,并在电压或频率超出设定阈值时保护设备。
穿越运行要求规定了设备在不断开连接的情况下必须承受的电压和频率条件。发电机组已面临详细的穿越运行规则,因为同步失去大量发电能力可能破坏系统稳定。
大型计算负荷过去并未受到同等的国家级要求约束。电网运营商往往缺乏关于其内部控制、转移阈值或预期恢复顺序的完整信息。
当许多设施使用相似设备时,这一缺口尤为重要。即使每套系统按自身标准正确运行,单次电压暂降也可能触发多个站点的关联响应。
NERC 大型负荷研究将计算需求描述为响应异常迅速且难以建模。一些设施可在数秒内降低用电量,快于传统发电机组调整出力的速度。
NERC 还记录了一座北美数据中心在 36 秒内将负荷从约 450 兆瓦降至 40 兆瓦的情况。该设施随后在数分钟内恢复至原有需求水平。
这类变化影响的不只是能源供应。它们还会影响频率调节、电压控制、运行备用容量以及相邻区域之间计划的电力交换。
AI 工作负载又增加了一层不确定性。训练任务可能形成可变或周期性的用电模式,而冷却系统和电力电子设备会影响无功功率和电能质量。
并非所有 AI 数据中心都采用相同设计。一些设施为关键设备配置不间断电源;另一些则依靠工作负载检查点,让运营商能在中断后恢复训练流程。
这种差异使宽泛假设存在风险。电网规划人员需要针对具体设施经过验证的模型,而不是一个标注为“数据中心”的通用画像。
运营人员还需要了解哪些信号会改变用电量。电价、内部设备保护、计算计划、备用系统状态和合同义务,都可能引发不同的响应。
7 月的负荷转移展示了最直接的风险:一次常规故障导致众多设施以相似方式解读同一电压信号。
结果类似于共因失效,即彼此独立的系统共享某种隐藏依赖。这里的共同依赖是电力扰动,以及设施对此的敏感性。
PJM 官员认为,这次故障本不应导致这些设施退出电网。运营委员会主席 Emanuel Bernabeu 表示,数据中心似乎过于敏感,且断开得过早。
设施运营商则承担着相互竞争的责任。他们必须防止设备受损、保障客户工作负载,并履行可用性承诺。在更严重的扰动中继续保持并网,可能增加这些风险。
这正是 PJM 数据中心可靠性的核心取舍。保守的保护设置或许有助于单个园区,却可能使整个电网更难维持平衡。
PJM 数据中心可靠性如今依赖共同规则
监管应对正推动大型数据中心从被动客户转变为对大电力系统运行负责的参与者。
联邦能源监管委员会,即 FERC,负责监管州际输电和批发电力市场。北美电力可靠性公司,即 NERC,则在 FERC 监督下制定可执行的可靠性标准。
FERC 于 7 月指示 NERC 为计算负荷建立初步监管框架。这项工作涵盖大型数据中心、加密货币设施,以及接入大电力系统的其他电子控制型需求。
NERC 已提出三项基础标准。CLO-001-1 涉及并网研究与建模。CLO-002-1 涵盖运行数据和通信。CLO-003-1 则涉及保护协调与扰动监测。
这些类别针对反复发生的负荷损失事件所暴露的缺口。规划人员需要在接入前获得准确的设施模型;运营人员需要在接入后获取实时信息;工程师则需要在扰动发生时协调保护设置。
NERC 还提议设立新的注册角色:计算负荷所有者和计算负荷运营商。注册将使符合条件的实体进入正式可靠性体系,而不再将其视作普通零售客户。
这一改变带来实际影响。注册实体可能承担与大电力系统可靠性相关的文件记录、监测、报告和合规义务。
NERC 截至 2026 年 9 月 18 日接受有关其初步标准和注册提案的意见。该组织的大型负荷行动计划跟踪这些标准、工作组及配套技术指导。
FERC 要求 NERC 在 2026 年 12 月 31 日前提交初步可靠性标准和注册标准。NERC 还必须制定进一步标准的计划,包括尚未解决的性能要求。
这一时间表揭示了一项重要限制。初步规则可确立建模、通信和保护协调义务,但详细的最低穿越运行要求仍需进一步技术工作。
PJM 不希望等待所有国家级规则出台。该电网运营商正在评估,是否扩大其针对现有及未来计算负荷的并网可靠性要求。
区域性行动具有效率优势。PJM 可利用其费率表、并网流程、运行协议和输电业主协调机制,应对北弗吉尼亚特有的风险。
但区域性方案也会带来复杂性。数据中心运营商会在多个电力市场建设设施。不同的技术要求可能增加工程复杂度,并使合规表现更不一致。
FERC 正在另行审查全部六家区域电网运营商整合大型负荷的方式。其 6 月发布的说明理由命令要求每家运营商为现有费率表作出说明,或提出改革方案。
这些命令涵盖申请流程、输电研究、成本透明度、共址、灵活服务以及获得充足发电能力的途径。它们处理的不只是设施如何接入,也包括其接入后的行为。
这两条监管路径彼此关联。若在缺乏有效运行标准的情况下加快并网,可能会在电网运营商了解其故障响应方式之前,带来集中的新增需求。
相反,过于严格的可靠性要求可能延误项目,或使有价值的灵活性更难发挥作用。数据中心能够快速降低需求;在运营商协调这种响应的情况下,这有助于应对供电紧张。
问题不在于大型负荷是否应当断开。有些扰动确实需要切离,以保护人员和设备。真正的问题是:应在何时、以多快速度、提前多久通知后采取这一措施。
电网规则还必须约束重新接入。如果数千兆瓦负荷同时恢复,恢复过程可能带来第二轮的平衡和电压挑战。
因此,可靠整合需要协调一致的流程。设施应能承受规定范围内的扰动,在切换时通知运营商,并按照商定的恢复计划重新接入。
保护规则必须平衡电网稳定性与设备风险
严格的穿越运行要求可减少负荷突然损失,但也可能将电气与商业风险重新转移给数据中心运营商。
在发生3,800兆瓦切换后,制定穿越运行标准的理由看似直接。如果故障得到正常清除,已接入的设施不应像整个系统即将崩溃一样作出反应。
但技术边界并没有那么简单。电压状况会因地点、持续时间、相位和设备配置而异。一个园区的安全运行范围未必适用于另一个园区。
现有设施构成最棘手的问题。它们是在此前的并网规则下设计的,其中可能包含无法在不改造的情况下满足未来性能曲线的设备。
改造保护系统可能需要工程研究、控制器调整、测试,以及与设备供应商协调。一些站点可能需要增加电能质量调节设备或储能设备。
监管机构必须决定,新要求是否仅适用于未来设施。若将所有现有站点全部豁免,将使已经部署密集集群地区的运行风险得以延续。
追溯适用新规则则会引发成本和管辖权问题。零售服务仍部分受州监管,而FERC的权限主要集中于州际输电和大电力系统可靠性。
标准还必须区分计划内灵活性与失控断开。在电网运营商指令后降低需求的数据中心,可以提供有价值的服务。
由未知本地阈值触发的自动切换则不同。当运营商不知道何种条件会导致一大块需求退出时,便无法有效安排备用资源。
因此,数据共享与物理性能同样重要。PJM需要经过验证的负荷模型、保护阈值、备用切换逻辑、恢复程序,以及设施当前可用性信息。
运营商可能不愿分享敏感技术细节。园区配置可能透露运行方式、客户要求和安全信息。
可行的机制需要受控访问和明确的报告边界。电网运营商需要足够细节来进行规划,但不应因此建立一个不必要的敏感设施数据存储库。
另一个不确定性涉及所有权。园区业主、云服务商、租户、公用事业公司、设备供应商和备用电源运营商,可能分别影响电气响应的不同环节。
签署并网协议的主体未必直接控制服务器供电系统。全国性登记框架必须明确由谁承担各项运行职责。
还存在将所有计算设施一概而论的风险。加密货币矿场通常会对电价作出强烈反应,而云设施通常更优先保障正常运行时间。
AI训练设施对工作负载中断的容忍方式,也可能不同于处理实时交易的服务。保护和灵活性要求应反映可衡量的电气行为。
在可能的情况下,PJM的数据中心可靠性规则应保持以性能为基础。无论建筑内运行何种计算服务,运营商都需要在扰动期间获得可预测的结果。
7月事件并不能证明仅靠数据中心就会威胁电网崩溃。PJM迅速恢复了控制,没有客户被非自愿切负荷,触发事件的线路故障也得到了正确清除。
但它确实证明,聚合负荷行为已达到应受到正式监管的规模。先后发生的1,500兆瓦和3,800兆瓦事件形成了一种监管机构无法忽视的模式。
未来报告应避免将负荷损失与电力供应损失混为一谈。眼前的问题是在需求消失后出现了过剩发电,而不是最初发生了电力短缺。
两种方向都关系到可靠性。需求快速增加可能挤压备用容量,而需求快速下降可能抬高频率和电压。同步恢复则可能在第二种问题之后立即引发第一种问题。
规则应覆盖完整周期,包括扰动检测、穿越运行、切换、运营商通知和分阶段重新接入。若只关注断开的瞬间,机制将不完整。
这一事件令数据中心、公用事业公司和电网运营商承压
责任分布在整个系统中,因此没有单一技术改动能够化解这一风险。
数据中心业主面临最直观的压力。他们可能需要披露设备行为、修改保护设置、参与研究,并接受持续性的运行义务。
云服务商也需要审视其正常运行时间实践是否与电网性能要求冲突。针对单一园区优化的控制方案,若在区域集群中复制,可能产生外部成本。
Dominion等公用事业公司位于园区与区域运营商之间。它们拥有本地输配电资产,管理并网要求,并观察每个设施附近的电气状况。
PJM负责平衡更广泛的区域。它必须规划发电、安排备用、协调输电,并管理覆盖6,700万人区域内的突发变化。
NERC界定可靠性框架,但其技术证据依赖区域运营商和公用事业公司。北弗吉尼亚反复发生的事件,为标准制定提供了异常清晰的记录。
FERC必须在可靠性与另一项联邦优先事项之间取得平衡:更快接入大型负荷。AI开发商认为,漫长的供电交付周期限制了投资与计算能力。
FERC委员David Rosner See曾指出,大型且灵活的负荷能够改变系统运行、规划需求、电网升级和成本分摊。现有系统并非为如今的速度和规模而设计。
速度与可靠性不必相互对立。更好的模型和标准化数据包可以减少并网审查过程中的不确定性。
清晰的性能要求也能避免后期重新设计。开发商可在选择设备前,将穿越运行、遥测和备用切换义务纳入考量。
然而,仓促批准可能固化尚未被充分理解的行为。一个园区可能在输电项目或区域标准跟上之前数年就投入运行。
压力还会延伸到州监管机构和普通客户。输电升级、新增发电和可靠性服务均会产生费用,而这些费用必须由某一方承担。
FERC针对大型负荷的命令特别强调防止成本转移并提高输电成本透明度。即使运行问题获得技术解决,这场争论仍将继续。
在得到适当整合的情况下,数据中心可以为系统带来益处。其控制系统可以降低计算需求、迁移工作负载、使用电池,或在协调指令后切换至现场发电。
7月事件表明,为何这种灵活性必须可见。只有当运营商了解其触发条件、规模、持续时间和恢复路径时,快速响应才有用。
开发商应预期,电力协议对设施的要求将不止于预测峰值负荷。公用事业公司将日益询问设施在电压暂降、频率变化和通信故障时的行为。
设备供应商也将面临类似问题。电源和控制器可能需要标准化性能设置,同时兼顾计算保护与电网要求。
保险机构和融资伙伴也可能审查合规情况。无法满足不断演变规则的园区,可能面临改造义务或运行安排限制。
这种更广泛的压力解释了为何该事件的重要性超出北弗吉尼亚。包括得州、俄亥俄州、佐治亚州和美国中西部部分地区在内的其他区域,也正在吸引类似集中的AI基础设施。
根据PJM经验制定的标准,可能影响全国范围内的项目。反之,碎片化的区域规则可能使电气合规成为数据中心选址的另一项因素。
三个信号将显示监管机构能否弥合这一缺口
下一项考验在于,监管机构能否在下一次大型扰动发生前,将广泛担忧转化为可衡量的义务。
第一个信号是NERC在12月31日前提交的文件。初步标准应清晰分配建模、运行通信、保护协调和扰动记录方面的责任。
薄弱的登记标准会使主要设施游离于框架之外。过于宽泛的标准则可能覆盖不会构成实质性大电力系统风险的较小负荷。
第二个信号是PJM如何处理穿越运行性能。电网运营商必须决定,区域性要求能否先于完整的全国标准出台。
最有用的提案将界定可衡量的电压和频率行为、切换报告及重新接入预期。它还应处理现有园区,而非仅针对新项目。
第三个信号是行业对下一次扰动的反应。规模更小或协调更佳的切换,将表明改进后的设置和通信机制正在发挥作用。
如果在正常清除故障后再次发生数吉瓦级负荷损失,强制性性能标准的必要性将更加明确。备用电源的无序恢复则会暴露另一项缺口。
读者还应关注事件信息是否变得更加透明。公开运行数据帮助确认了7月事件的规模,但设施层面的原因仍不那么清晰。
透明的聚合报告可以在不暴露敏感园区细节的情况下支持问责。它也能帮助公用事业公司在共享设备设置引发关联行为之前识别出来。
更大的启示并非AI数据中心耗电过多。眼前的警示是,集中的数字基础设施能够以超出既有电网实践预期的速度改变需求。
PJM成功控制了7月扰动,但可靠恢复不能替代预防。电网可能会在更困难的运行条件下面临类似事件。
PJM的数据中心可靠性如今取决于将大型计算园区视为主动参与电力系统的主体。它们的行为必须像其他电网级资源一样得到研究、沟通和协调。
对于技术采购方和企业领导者而言,这一问题已不止关乎公用事业政策。云服务的可用性日益取决于设施运营商、公用事业公司、区域电网与联邦监管机构之间达成的协议。组织应向服务提供商了解:关键工作负载将如何应对区域性电力事件、备用切换以及分阶段恢复。它们还应通过可搜索的知识库,在任何单一云环境之外保留运营记录。下一次可靠性事故考验的不只是电气设备,也将检验支撑 AI 基础设施的机构能否以机器般的速度协同运作。



