3ギガワットの系統ショックが露呈したAIデータセンターの制御問題
7月22日、3ギガワットを超えるデータセンター需要が突如として系統から消失した後、Google Newsは厳しい警告を浮き彫りにした。北バージニアの送電線が停止し、データセンターはほぼ同時に非常用電源へ切り替えた。各施設はサーバーを保護したものの、その集団的な対応は地域の電力系統にとってはるかに大きな問題を引き起こした。
この障害はバージニア州を大きく越えて広がった。ワシントンD.C.からシカゴまでを管轄するPJM Interconnection全域で、電圧変動が検知された。系統運用データによれば、3ギガワット超はその時点のPJM電力需要のおよそ3%に相当した。
PJMは、全体としての信頼性は維持されたと報告した。だが、その結果だけで今回の事象を無害と捉えるべきではない。送電設備の単一障害によって、数千メガワットのコンピューティングインフラが一つの巨大な電気スイッチのように動作した。
この危機一髪の事態は、現代のデータセンター設計に内在する対立をあらわにした。各施設は、不安定な系統電力から自社設備を守るよう設計されている。一方、地域の電力系統は、大口需要家が同じ障害の際に予測可能な挙動を取ることに依存している。
北バージニアでは、この二つの目標が相反した。必要なのは、発電設備や送電線、非常用発電機を単に増やすことではない。データセンターには、ライドスルー制御、協調復旧、正確な電気モデル、そして実効性のある系統連系ルールが必要だ。
送電線の停止が3ギガワットの負荷低下を引き起こした
決定的だったのは送電障害そのものではない。データセンターの保護システムが同期して反応したことだ。
7月22日の事象は、北バージニアの送電線が停止したことで始まった。Dominion Energyによると、近隣のデータセンターはその後、短時間にわたり非常用電源へ切り替えた。同社は、これらの施設に系統から離脱するよう命じたわけではないと強調した。
この違いは重要だ。系統運用者は、送電線や発電機、その他の設備が故障することを日常的に想定している。しかし、数ギガワット規模の需要が直接の指令なしに消失する事態を管理した経験は少ない。
電力系統は、ほぼ常時、供給と需要の均衡を保たなければならない。発電機が突然停止すると、利用可能な供給が需要を下回り、系統周波数は低下する。運用者は、このよく知られた緊急事態に備えて予備力を確保している。
データセンターの大規模な切り離しは、この関係を逆転させる。発電機が従来の負荷水準に合わせて発電を続ける一方で需要が減少する。この余剰は、系統制御が発電を減らすか不均衡を吸収するまで、周波数や電圧を上昇させかねない。
PJMは13州とワシントンD.C.で約6,700万人に電力を供給している。失われたデータセンター需要は、事象発生中の総負荷のおよそ3%に相当した。これは、複数の大規模発電所が逆向きに消失するのと同様の影響を及ぼし得る規模だ。
この障害はまた、局所的な保護判断が地域的な影響を生み出し得ることを示した。北バージニアには、異例なほど高密度にデータセンターが集積している。そのため、多くの施設がほぼ同時に、ほぼ同じ電圧異常を経験し得る。
無停電電源装置、すなわちUPSシステムは、電圧低下やその他の電力品質問題からサーバーを保護するために設計されている。UPSは、非常用発電が起動するまで、または系統状態が回復するまで、バッテリーとパワーエレクトロニクスを使ってコンピューティング機器を稼働させ続ける。
その保護は、各事業者の観点では機能した。サーバーは給電を維持し、施設は不確実な電圧に高感度な電子機器をさらすことを避けた。しかし系統側から見ると、この一斉切り替えは需要の急激な喪失として現れた。
この事象は地域内で目に見える兆候も生んだ。住民からは照明のちらつきが報告され、一部のデータセンターでは発電機が稼働し始めた。Dominionは後に、施設内部の制御が切り替えを開始したと述べた。北バージニアの報道による。
広域停電には至らなかった。そのため今回の事例は、系統崩壊ではなくニアミスと位置づけられる。ただし同時に、この仕組みがより厳しい運用状況で再び表面化する前に、運用者が対処する機会でもある。
発生時期も懸念を高めた。PJMは7月中、すでに夏季の高需要と厳しい運用条件に直面していた。急激な負荷喪失はどのような状況でも危険になり得るが、系統がすでに逼迫している場合は管理がさらに難しくなる。
Google Newsの報道は、停止した送電線に注目を集めた。より重大な問題は、データセンターの内部にある。その制御は一時的な系統障害を離脱すべき理由と見なし、近隣にある数千メガワットが何をするかを考慮していなかった。
北バージニアではこの障害パターンが以前にも見られた
7月の事象は過去の事例より大規模だったが、基本的な障害パターンはすでに記録されていた。
2024年7月、落雷により北バージニアで送電レベルの故障が発生した。North American Electric Reliability Corporationに提出された資料によると、約60施設でおよそ1,500メガワットのデータセンター負荷が切り離された。
系統障害は報告によれば1秒未満で解消された。それでも多くの施設はコンピューティング負荷を非常用電源へ切り替えた。保護システムは、通常のサービスが復旧したことを広域電力系統が伝達できるよりも速く、障害に反応した。
2025年2月には、二度目の大きな事象が発生した。倒木により230キロボルト送電線で停電が起き、約1,800メガワットのデータセンター需要が系統電力から離れた。一部の施設は接続を維持しており、切り離しが技術的に不可避だったわけではないことを示している。
2026年7月の事象では、報告された総量が3ギガワットを超えた。したがってPJMとDominionは2年以内に、送電障害後に集中したデータセンター需要が低下する重大な事例を3回経験したことになる。
この繰り返しは解釈を変える。系統運用者が直面しているのは、無関係な設備故障が偶然重なった珍しい事象ではない。データセンターの電気システムがどのように構成されているかによって生じる、一貫した反応を目にしている。
過去の事象では、施設ごとの差異も重要であることが明らかになった。一部のデータセンターは電圧異常をライドスルーした一方、他は切り離された。ライドスルーとは、短時間かつ定義済みの電圧または周波数偏差の際に、即座に切り替えるのではなく接続を維持することを意味する。
このばらつきは、必要なハードウェアが多くの拠点にすでに存在する可能性を示唆する。より困難な課題は、設定、検証、協調、そしてそれらの設定を左右する商業上の優先順位にある。
データセンター運営者がサーバーの可用性を最優先するのは当然だ。障害はクラウドサービス、金融取引、エンタープライズソフトウェア、ストリーミングプラットフォーム、AIトレーニングジョブに影響を与え得る。そのため運営者は、電力品質が不確実になった場合に保護システムを保守的に設定する。
系統信頼性では、リスクの計算が異なる。1施設がバッテリーへ切り替えても、地域全体への影響は無視できる程度だ。しかし数十のキャンパスが同時に切り替われば、従来型発電所の停止を上回る規模の系統事象になり得る。
施設の集中により、北バージニアは特に影響を受けやすい。当地のデータセンターは、しばしば関連する送電回廊を通じて接続され、共通の障害を経験する。また、類似する電気設備は、同程度のしきい値を用いてそれらの障害に反応する可能性がある。
これは、多数の独立したシステムが共通の条件を共有するために、一斉に故障または反応するコモンモードリスクを生む。同じ電圧信号を同じように解釈する制御を持つなら、建物同士を物理的に離してもほとんど保護にはならない。
この問題はバージニア州にとどまらない。テキサス州、オハイオ州、ペンシルベニア州、ジョージア州などで、大規模なAIキャンパスの開発が進んでいる。提案されている拠点の中には、多くの従来型産業複合施設を上回る電力を求めるものもある。
エネルギー省によると、米国のデータセンター電力消費量は2014年の58テラワット時から、2023年には176テラワット時へ増加した。同省は、大規模負荷に関する分析に基づき、需要は2028年までに325~580テラワット時に達し得ると推定している。
個別の要請規模も拡大している。同省は、最大4.5ギガワットの容量を求める計画拠点に言及している。その規模のキャンパスは、系統障害時に通常の商業顧客のように振る舞うことはできない。
AIインフラは、その電力需要が大きく集中しているため、この問題を強める。数千基のアクセラレーターが、高度に同期したコンピューティングクラスターで稼働し得る。冷却システム、ネットワーク機器、電力変換システムも、さらに電気的な複雑さを加える。
したがって7月の事象は、Data Center Alleyにおけるもう一つの信頼性問題にとどまらない。コンピューティングキャンパスが、系統規模の性能責任を引き受けないまま、系統規模の参加者となった場合に何が起きるかを示す初期の事例だ。
Google Newsが明らかにしたサーバー安全性と系統安全性の対立
主要な対立は単純だ。データセンターはサーバー保護を最適化する一方、系統運用者は施設の挙動が予測可能であることを必要としている。
UPSは通常、電圧、周波数、位相、その他の電力品質指標を監視する。これらの測定値が設定されたしきい値を超えると、UPSはコンピューティング負荷を切り離し、バッテリーから電力を供給できる。障害が継続する場合は、発電機が起動することもある。
この一連の動作は、1棟の建物の内部では理にかなっている。一過性の電気的故障がサーバーの停止や進行中の処理の破損を招くのを防ぐ。また、運営者に電力会社の復旧時間からの独立性をもたらす。
問題は、送電レベルの事象に対して保護しきい値が過度に敏感な場合に始まる。短時間の電圧低下は、必ずしも電力供給が失われたことを意味しない。ネットワークの別の場所で保護装置が故障を除去しているだけの場合もある。
UPSがこの低下を継続的な停電と誤認すると、系統電圧が安定する前に、まさに最も不適切な瞬間に系統からの受電を止めてしまう。数百の類似システムが、系統電圧が安定する前に同じ判断を下し得る。
データセンターは従来、受動的な負荷として扱われてきた。電力会社はそこへ電力を供給する計画を立て、施設所有者はメーターの内側で信頼性を管理してきた。しかし、単一の顧客キャンパスが数百メガワットを消費し得るようになると、この分担では不十分になる。
大規模なAIキャンパスは、規制当局が依然として顧客に分類していても、その規模では系統リソースに近い。こうしたキャンパスの判断は、系統周波数、電圧、予備力の起動、送電潮流に影響を及ぼし得る。
発電事業者にはすでに、詳細なライドスルー要件が適用されている。多くの風力、太陽光、バッテリー発電所は、指定された障害時にも接続を維持しなければならない。こうした基準は、インバーターベースの発電設備が一斉に切り離され、系統問題を増幅させた過去の事象を受けて導入された。
大規模負荷には、同等の全国的な要件が設けられていない場合が多い。系統連系契約は、電力会社、地域、機器サプライヤー、プロジェクトの時期によって異なり得る。その結果、同じ信号に直面しても、系統運用者は施設ごとに一貫しない挙動への対応を迫られる。
当然の反応は、データセンターが決して切断されないよう求めることだろう。しかし、それは行き過ぎだ。施設は深刻または持続的な故障時に機器を保護しなければならず、安全でない接続は顧客にも電力網にも利益をもたらさない。
より良いアプローチは、安全な運転範囲を定めることだ。データセンターは、合意済みの電圧・周波数範囲内に収まる短時間の擾乱では系統に接続されたままであるべきだ。その範囲を超える場合には、バックアップ電源へ切り替えるべきである。
こうしたルールには正確な時間管理が必要になる。数サイクルの電気的擾乱と、数秒続く停電は異なる。保護システムには、解消された故障と継続するサービス喪失を区別するための十分な情報が必要だ。
また、UPS機器、開閉装置、バッテリー、発電機、電力会社の保護設備の間で連携を取る必要がある。各コンポーネントは単独では正しく設定されていても、システム全体としては予期しない切り替えを引き起こす可能性がある。
Google Newsの読者は、この事案をAIの電力需要拡大に関するニュースとして目にするかもしれない。需要増は圧力の一部ではあるが、消費量だけでは7月の擾乱を説明できない。
完全に安定した3ギガワットの負荷は、予測不能に切断・再接続を繰り返す、より小さな負荷より管理しやすい場合がある。運用上の課題は、総エネルギー使用量だけでなく、その挙動にある。
この違いは、誰が責任を負うかも変える。発電所を追加しても、過敏なUPS設定は是正されない。送電線を新設しても、故障後に数千メガワットが復帰する動きを調整することはできない。
電力会社、データセンター所有者、機器ベンダー、系統運用者が、この作業を分担しなければならない。それぞれが電力系統の異なる部分を管理している。他者からのデータなしに、単一の参加者が完全な応答を検証することはできない。
業界は機密保持上の懸念も乗り越える必要がある。データセンター企業は、施設設計、顧客の身元、計算能力を厳重に守っている。系統運用者にこうした事業上の詳細は不要だが、信頼できる電気モデルと性能記録は必要である。
それらがなければ、計画担当者はキャンパスがどう挙動するかを推測せざるを得ない。キャンパスの規模が大規模発電所に近づくにつれ、こうした推測はますます危険になる。
解決策はフォールト・ライドスルーと緩やかな復帰から始まる
データセンターには、管理可能な故障時に接続を維持する能力と、必要な切り替え後に段階的に復帰する能力という、連携した2つの能力が必要だ。
第一の能力は電圧ライドスルーである。保護設定は、定義された範囲内の短時間の擾乱を許容すべきだ。送電系統が故障を解消する間も、施設は電力を引き続き受電する。
これは、サーバーを不安定な電力に直接さらすことを意味しない。UPS機器は、制御された系統接続を維持しながら入力電力を調整できる。バッテリーは、キャンパス全体を電気的に切り離すことなく、短時間の変動を緩衝できる。
研究者はすでに、こうしたシステムが系統規模でどのように挙動するかを検討している。Pacific Northwest National Laboratoryは、UPS制御とライドスルー応答を含む大規模データセンター向けの電磁過渡モデルを開発している。
こうした詳細モデルは、従来の計画ツールでは見落とされる可能性のある、非常に高速な電気的挙動をシミュレートする。同研究所のデータセンターモデルは、大規模施設が系統擾乱時にどのように反応するかを電力会社が分析する際の支援を目的としている。
第二の能力は、制御された再接続である。施設がバックアップ電源へ移行せざるを得ない場合、電圧が正常に見えた途端に全負荷を復帰させるべきではない。多くのキャンパスが同時にそうすれば、別の急激な不均衡を生み出しかねない。
ソフトリターンでは、系統需要を計画的な段階で増やす。施設はその段階を電力会社と調整するか、事前承認されたランプ率に従うことができる。これにより、発電制御が復帰する需要に対応する時間を確保できる。
このプロセスは、高速道路への合流に似ている。すべての車両を停止させれば一つの問題になるが、すべてを同時に解放すれば別の問題を引き起こす。制御されたランプは、新たな衝撃を生まずに流れを維持する。
正確なランプ率は、地域の系統条件と施設設計を反映すべきだ。大規模な発電設備の近くに接続されたキャンパスは、制約のある送電回廊を介して供給を受けるキャンパスとは異なる制限を持ち得る。
系統運用者には、テレメトリー、すなわち施設から制御室へ送られるリアルタイム計測値も必要だ。最低限、運用者は大規模キャンパスが系統電力、バッテリー、発電機、または段階的な復帰のどの状態にあるかを把握する必要がある。
テレメトリーは事案発生時の不確実性を減らす。運用者が送電上の問題と顧客側制御による応答を区別する助けとなる。また、どれほどの需要が、どの程度の速さで復帰しそうかも明らかにする。
データセンターは、接続前に検証済みの電気モデルを提供すべきだ。モデルには、UPSのしきい値、発電機の切り替え、バッテリーの挙動、保護ロジック、想定される再接続シーケンスを含める必要がある。
モデル検証は建設後も継続しなければならない。機器設定は変わり、キャンパスにはサーバーホールが追加され、ソフトウェア更新はコントローラーの挙動を変更する。数年前に承認されたモデルでも、複数回の拡張後には不正確になり得る。
電力会社は、擾乱記録と制御試験によって性能を検証できる。フェーザ計測ユニット、すなわちPMUは、電圧、電流、周波数の同期計測値を提供する。これにより、施設が合意した応答に従ったかを示すことができる。
Department of Energyは、大規模データセンター負荷に関連する振動を検出する手段としてPMUを取り上げている。その監視ガイダンスは、同期計測が通常のメーターでは見逃す挙動をどのように明らかにできるかを説明している。
そのうえで、系統連系契約はこうした技術的要件を執行可能な義務へと落とし込むべきだ。要件には、ライドスルー範囲、テレメトリー、モデル更新、ランプ率、試験、主要な制御変更前の通知を盛り込める。
新設施設は、サービス開始前にこうした条件を採用できる。既存サイトは、古い契約の下で運用され、異なる能力を持つ機器を使用している可能性があるため、より難しい問題となる。
規制当局には段階的なコンプライアンスの道筋が必要になる。最優先すべきは、共通の送電事象が数ギガワットに影響し得る高密度地域だ。Northern Virginiaが最も明確な出発点である。
コストは責任に応じて負担されるべきだ。制御システムが測定可能な地域的リスクを生む顧客は、必要な調査、通信、アップグレードの費用を負担すべきである。住宅顧客は、民間データセンター内のUPS設定を変更できない。
同時に、規制当局はあらゆるバックアップ電源への切り替えを不正行為として扱うべきではない。目標は、合意した範囲内で予測可能な挙動を実現することであり、施設所有者が機器を保護する能力をなくすことではない。
バックアップ電源だけでは問題は解決しない
バッテリーや発電機を増やせばデータセンターを保護できる一方で、系統の挙動を悪化させる可能性もある。
バックアップ電源は、停電時に施設が電力網の負担にならない証拠として語られることが多い。しかし、この主張が扱うのはキャンパス内部の継続性である。移行が周辺システムに何をもたらすかについては、ほとんど何も語っていない。
バッテリーは、ほぼ瞬時にコンピューティング負荷を受け止められる。この速度はサーバーを保護するが、同時に数百メガワットの電力会社需要をほぼ瞬時に消失させることも可能にする。高速な機器が自動的に系統に優しい機器とは限らない。
発電機は別のタイミング上の問題をもたらす。ディーゼルまたはガスユニットは、通常、バッテリーより起動・安定化に時間がかかる。UPSがその間をつなぎ、その後、施設は系統から切り離された状態に留まる可能性がある。
施設は最終的に再接続しなければならない。運用者が再接続を私的な運用判断として扱えば、系統は発電量をすでに減らした後に、予期しない需要急増に直面する可能性がある。
マイクログリッドは連携を改善できる。マイクログリッドは、ローカル発電、蓄電、負荷、制御を組み合わせ、広域系統の有無にかかわらず運用できる。しかし、そのコントローラーにも、島嶼運転への移行とそこからの復帰に関する合意済みのルールが必要だ。
連携が不十分なマイクログリッドは、より高度なコントローラーの背後に同じ問題を移すだけである。大規模負荷を不適切なタイミングで取り除きつつ、きれいに切り離されることもあり得る。
一部の運用者は、電気的故障が敏感な機器を損傷し得るとして、ライドスルー要件に抵抗するかもしれない。その懸念は正当だ。ルールは機器の限界を反映し、あらゆる擾乱が安全だと仮定してはならない。
また、7月22日に関与したすべての施設が同一の設定を使用していたという公的な証拠はない。集約された応答は共通の問題を示唆するが、詳細は依然として機密である。正確な責任を割り当てる前に、調査担当者は施設レベルの記録を必要としている。
報告された合計3ギガワットも、初期の運用上の推計として扱うべきだ。PJMとDominionは、高解像度の計測値を精査した後、シーケンスをさらに精緻化できる。個別企業は、自社の寄与分を公表していない。
もう一つの懸念はサイバーセキュリティに関するものだ。リアルタイム連携は、電力会社と民間キャンパスの間に通信リンクを作る。これらの接続には、認証、セグメンテーション、フォールバック制御、リモートコマンドへの厳格な制限が必要である。
信頼性ルールは、機密性の高いコンピューティング運用を露出させることなく、交換する情報を定義すべきだ。系統運用者に必要なのは、電気的状態と予想需要であり、顧客ワークロードや独自のAIモデルの詳細ではない。
データセンターの柔軟性にも限界がある。一部のコンピューティング作業は時間や地域をまたいで移動できる一方、対話型サービスには即時処理が必要だ。系統にストレスがかかるたびに、すべてのAIワークロードがデマンドレスポンスに転換できると電力会社が想定すべきではない。
それでも、不確実性は基本的な標準の導入を遅らせる理由にはならない。規制当局がライドスルー要件を定める前には、発電リソースも同様の技術的議論に直面した。試験と段階的な導入によって、施設固有の問題を解決できる。
より大きなリスクは、一貫しないルールの下で成長が続くことだ。2024年の1,500メガワットの事象は、2026年には3ギガワットを超える事象となった。この推移は次の擾乱が再び倍増することを証明するものではないが、安全余裕を狭めている。
Google Newsの報道では、この事案がAIの電力消費をめぐる新たな争いに見えるかもしれない。より緊急の問いは、状況が正常でなくなったとき、大規模キャンパスが良き系統市民であり続けられるかどうかだ。
系統がより安全になっているかを示す3つのシグナル
次の試金石は、次の送電故障が発生する前に、運用者がニアミスを測定可能な要件へと転換できるかどうかだ。
第一のシグナルは、詳細なPJMまたはNERCの事案レビューである。その分析では、起点となった故障、データセンターの切り替えシーケンス、周波数応答、再接続のタイミングを明らかにすべきだ。
有用な報告書は、ライドスルーを維持した施設と切断した施設を分けて示す。その比較により、機器能力、保護設定、系統連系条件、または地域の電圧条件のいずれが違いを生んだのかを特定できる。
レビューに明確な性能上の知見が含まれれば、対象を絞った標準の必要性を強めることになる。施設の挙動を含まない曖昧な要約では、計画担当者は仮定に頼り続けることになる。
第二のシグナルは、大規模負荷に対する正式なライドスルー枠組みである。PJM、Dominion、NERC、または州の規制当局は、主要施設が耐えるべき電圧・周波数範囲を定めるべきだ。
この枠組みには、段階的な再接続、テレメトリー、モデル検証、イベント後の報告も含めるべきだ。瞬低耐量の要件だけでは、問題の前半にしか対応できない。
新規の接続契約は、最も迅速な手段となる。電力会社は、追加容量の送電開始にあたり、コンプライアンスを条件にできる。既存のキャンパスには、規模、所在地、地域全体のリスクに応じた期限が必要になる。
こうした条件が公開書類や承認済みの料金表に記載されれば、業界は議論から執行へ移行したことになる。自主的なガイダンスは前進を意味するものの、一貫した行動を保証するものではない。
3つ目のシグナルは、次の系統擾乱時に独立して観測される実際の性能だ。電圧が実際に変動した際にデータセンターがモデルどおりに動作して初めて、標準には意味がある。
PMUの記録では、対処可能な故障時に切り離される施設が減少していることが示されるべきだ。切り替えがなお必要な場合でも、データは2度目の急激な負荷変動ではなく、段階的な復帰を示す必要がある。
より良い結果が常に一般の目に触れないとは限らない。一部の施設では依然として発電機が起動し、住民が短時間のちらつきに気づくこともあるだろう。重要なのは、総需要が制御された状態に保たれるかどうかだ。
これらのシグナルはPJM以外でも重要である。テキサス州やその他の急成長市場の系統運用者も、同様に大規模なキャンパスを接続している。自らのデータセンター群が同じ集中度に達する前に、北バージニアの経験を活用できる。
開発事業者やエンタープライズの購入担当者も注視すべきだ。系統性能の要件は、キャンパスのスケジュール、ハードウェアの選択、運用手順、新たなAI容量をどこに構築するかに影響し得る。
クラウド顧客は、自身のコンピューティングワークロードを支える電気制御が何かを知ることはほとんどない。しかし、系統擾乱が繰り返されれば、最終的にはサービスの信頼性、地域での承認プロセス、新規容量展開のペースに影響する可能性がある。
こうした動向を追うチームは、多数の情報源にまたがる規制当局への提出書類、エンジニアリング報告書、インシデント更新情報を保存する必要がある。検索可能なAIナレッジベースは、技術的な知見が進展するなかで、これらの記録を結び付けておける。
7月22日のインシデントは、運用者が懸念していた大規模停電を引き起こさなかった。修正する時間がまだ残されている段階で、制御上の問題を露呈させたのだ。次のGoogle Newsの見出しは、電力会社とデータセンター所有者がこの警告を活かしたのか、それともより深刻な試練をただ待っただけなのかを示すはずだ。



