top of page

VertivのAI負荷安定化、データセンターのレジリエンスを冗長性の先へ

56 分前
読了時間: 20分

Vertivは、AIデータセンターのレジリエンスを冗長設備の枠を超えて高めようとしている。同社は、ミリ秒単位の電力変動に対処するには、電気システム全体にわたる能動的な制御が必要だと主張する。Vertiv AI load stabilityに関する取り組みは、インフラエンジニアリングにおけるより広範な変化を反映している。容量とバックアップ経路は依然として重要だが、それだけで発電機、バッテリー、開閉装置、グリッドが急激な負荷変動時に同期を維持できるとは限らない。

争点は、静的な冗長性と動的な安定性の間にある。従来の設計は、別のコンポーネントや電力経路を用意することで機器故障に備える。AIクラスタは、数千基のアクセラレータが一斉に動作状態を変え、どのコンポーネントも故障していないにもかかわらず急速な電力遷移を生み出し得るため、異なる課題をもたらす。

この違いにより、VertivはABB、Schneider Electric、電力会社、グリッド研究者と並び、それぞれ異なる角度から同じ問題に取り組む立場に置かれている。提案には、より高度なUPS制御や負荷シミュレータから、同期調相機、バッテリーシステム、新たな系統連系要件まで含まれる。

浮かび上がる教訓は明快だ。AIデータセンターは、電源が失われた後に何が起きるかだけで評価できない。運営者は、障害の前、最中、後の各ミリ秒において、施設がどのように振る舞うかも把握しなければならない。

Vertiv AI Load Stability、UPSを能動的な制御レイヤーへ転換

差し迫った変化は、UPSが単に停電をつなぐだけでなく、通常時のワークロード変動を制御する役割を求められていることだ。

従来の無停電電源装置は、コンピューティング機器と上流の電力供給源の間に設置される。よく知られた役割は、別の電源が利用可能になるまで電力を維持することだ。このモデルでは、UPSは主に例外的な事象に対する保険として扱われる。

AIコンピューティングはこのパターンを変える。Vertivによれば、大規模GPUクラスタはミリ秒単位で低負荷と全負荷の間を移行し得る。こうした遷移は、学習ジョブの開始・終了時、同期ポイント到達時、あるいは計算フェーズの切り替え時に発生する可能性がある。

冗長化されたUPSは、別ユニットの故障には耐えられる。しかし、それはバッテリー、コンバータ、発電機、あるいは電力会社との接続に負荷をかけず、繰り返される電力ステップを吸収できることを意味しない。

Vertivの対応は、ファームウェア制御とワークロード固有のテストを組み合わせるものだ。同社のBattery Shield機能は、接続されたバッテリーをサイクルさせずに、特定の負荷ステップをUPS内部で処理するよう設計されている。Input Power Smoothing、すなわちIPSは、蓄えられたエネルギーを使って、上流の発電機や電力会社から見える変動を抑える。

コンピューティング需要が突然増加した場合、UPSは蓄電エネルギーから差分の一部を供給できる。需要が低下した場合は、バッテリー充電を回復させながら、より安定した速度で電力を引き続き受電できる。

これによりUPSは、応答時間が大きく異なる2つのシステムの間のバッファとなる。GPUはほぼ即時に状態を変えられる一方、エンジン、タービン、グリッド制御、一部の電気保護システムはより遅い時間軸で応答する。

Vertivは、自社の制御により、あらゆるケースで自動的にバッテリーを作動させることなく、ゼロから全負荷までの電力ステップを管理できるとしている。これはベンダー側の主張であり、性能はシステム構成、運用上の制限、実際のワークロードプロファイルに左右される。

同社はAI Load Simulatorも開発している。この装置は高速スイッチングとデジタル制御を用い、同期したアクセラレータ負荷に伴う振幅、周波数、デューティサイクルを再現する。

Vertivは最初に、このシミュレータをイタリア・ボローニャの顧客体験センターに導入した。同社によると、このシステムは他の施設や顧客サイトにも拡張されている。

シミュレータが重要なのは、従来のコミッショニング試験が定常負荷バンクを用いることが多いためだ。こうした試験は、機器が指定された負荷を担えるかを確認するが、統合された電力系統が急速な反復変動にどう応答するかを必ずしも示さない。

Vertivのadvanced UPS controlsは、同社の主張を最も明確に表している。運営者は、各コンポーネントの銘板容量を確認するだけでなく、インフラのタイミングと相互作用をテストしなければならない。

この提案は、冗長性を不要にするものではない。冗長性が何を証明すべきかを変えるものだ。バックアップ経路は、制御、バッテリー、発電機、保護装置を順に通過する障害の後も、利用可能な状態を維持しなければならない。

冗長設備が安定したシステムを保証しない理由

冗長性が答えるのは別のコンポーネントが存在するかどうかであり、動的安定性が問うのは急速な遷移の間にシステム全体が制御を維持できるかどうかだ。

データセンターでは、N+1や2Nといった構成で電気的レジリエンスを表すのが一般的だ。N+1設計では、施設は想定負荷に必要な数より1台多くのユニットを備える。2N設計では、完全な容量経路を2系統用意する。

こうした表記は依然として有用だ。保守性や特定の機器故障に対する耐性を伝えられる。一方で、あらゆる共通依存関係、制御の相互作用、過渡応答を説明するものではない。

電力過渡現象とは、電圧、電流、周波数、または需要に生じる短時間かつ急激な変化を指す。両方の電力経路が同じ上流イベントを経験する可能性があるため、過渡現象は名目上冗長化された設計を通過し得る。

共通の制御システムが、複製された機器に同じ応答を出すこともある。同一の保護設定により、2つの独立経路が同じ条件下で切り離される可能性がある。共有の開閉装置、ケーブル経路、燃料システム、ソフトウェアも、追加の共通モードリスクを生み出し得る。

AIはこのリストにワークロード同期を加える。数千基のアクセラレータが、集中的な計算フェーズに一斉に入ったり離れたりする可能性がある。その結果生じる電力変動は、ラックの範囲を超え、施設インフラにまで影響を及ぼし得る。

発電機はタイミングの問題をよく示している。発電機は、周波数と電圧を許容範囲内に保つため、ガバナと励磁制御を必要とする。深刻な負荷ステップは、機械システムが補償できる速度を上回る可能性がある。

発電機が周波数制御を失うと、UPSはその発電機との同期を拒否する場合がある。すると、十分な名目発電容量が利用可能であっても、損傷を防ぐために保護システムが機器を切り離す可能性がある。

バッテリーの挙動には別のトレードオフもある。バッテリーを使ってあらゆる電力変動を平滑化すれば、発電機とグリッドは保護される。しかし、頻繁な浅いサイクルは劣化を早めたり、実際の停電に使える蓄電エネルギーを減らしたりする可能性がある。

すべての変動を上流へ通過させればバッテリーは温存されるが、発電機、変圧器、電力会社との接続は変動の大きい負荷にさらされる。Vertiv AI load stabilityの制御は、この選択を動的に管理しようとするものだ。

冷却システムも安定性分析に含める必要がある。コンピュート需要が突然増加すれば熱が発生するが、冷却液ループ、ポンプ、熱交換器、チラーの応答速度はそれぞれ異なる。したがって、電気的制御と熱的制御は遷移をまたいで連携しなければならない。

これが、個々のコンポーネントをコミッショニングするだけでは不完全な証拠にとどまる理由だ。UPSは工場試験に合格し、発電機は定格を満たし、冷却プラントは設計容量を供給できるかもしれない。それでも、未知のシーケンスのもとで組み合わされた挙動が失敗する可能性はある。

ABBは、従来のワークロードを供給することなく電圧、短絡強度、系統慣性を支える回転機である同期調相機について、関連する主張を進めている。同社のstability gap分析は、これらの装置を大規模データセンターの接続地点に位置付けている。

これらのアプローチは、直接の代替ではなく相互補完的だ。UPS制御はコンピューティング負荷の近くで機能する。バッテリーはエネルギーを迅速に移動できる。同期調相機は地域の電力ネットワークを強化する。発電機と電力会社は持続的なエネルギーを供給する。

エンジニアリング上の課題は、それらを連携させることにある。制御関係を検証せずに機器を追加すると、レジリエンスの向上よりも速く複雑性が増す可能性がある。

AIワークロードが生み出す新たなグリッドリスク

データセンターは切り離しによって自らを保護できるが、複数の施設が同時にその行動を取れば、より広範な電力システムを不安定化させる可能性がある。

これこそが、動的安定性をめぐる議論における最も重要な転換だ。1つのサイトで合理的に見える保護動作が、多数の大規模サイトが同時に応答すると危険になり得る。

データセンターは歴史的に、信頼できる負荷として扱われてきた。電力消費量は大きかったが、電力会社が確立された商業・産業向けの前提でモデル化できる程度には予測可能な場合が多かった。

AIの学習と推論は、その構図を複雑にする。アクセラレータの利用率は、より急峻なランプと頻繁な変化を生む可能性がある。そのタイミングは、ソフトウェアスケジューリング、モデルアーキテクチャ、ネットワーキング、サーバー間の同期に左右される場合がある。

電力会社が重視するのは、年間総消費量だけではない。発電と需要の継続的な均衡を維持しなければならない。どちらの方向であれ突然の変化は、系統周波数と電力潮流に影響する。

大規模データセンターがバックアップ電源へ移行すると、負荷としてグリッドから消える。同じ電圧障害の際に複数の施設が切り離されれば、グリッドは大きな需要ブロックをほぼ瞬時に失う可能性がある。

2026年の技術調査は、送電障害に続いて約1,500MWの負荷が失われた2024年7月の事象を記述している。著者らは、その変化の大部分はデータセンターのバックアップシステムへの切り替えによるものだったと報告している。

この例は、サイトレベルでの移行が成功しても、システムレベルの問題を生み得る理由を示している。施設はコンピューティングサービスを維持する一方で、グリッドは電力生産と消費の間に生じた突然の不均衡を管理しなければならない。

査読済みのgrid integration surveyは、電圧および周波数のライドスルー挙動に注意を促している。ライドスルーとは、一時的なグリッド障害の際にも、定められた制限内で接続と運転を維持することを意味する。

電力会社は、こうした事象の際にデータセンターがどのように振る舞うかについて、ますます正確なモデルを必要としている。従来の静的負荷としてモデル化された施設は、UPS制御、大規模バッテリーシステム、バックアップ発電、同期したAIクラスタが関わると、まったく異なる応答を示す可能性がある。

モデルの品質は、系統連系検討において重要だ。エンジニアは、大規模負荷を接続する前に、故障、電圧回復、周波数応答、保護協調を検討するためにこうした調査を用いる。

モデルが重要な制御ロジックを省けば、検討は実際の挙動を表現しないまま接続を承認する可能性がある。前提が過度に保守的であれば、そのプロセスは不要なインフラを要求したり、有用な容量の利用を遅らせたりする可能性もある。

この課題は地域信頼性組織にも及んでいる。Southeastern Electric Reliability Councilが2026年9月に主催した議論では、突然の負荷喪失、急激な需要変動、施設間の移行が強調された。参加者は、より良いモデルと、より一貫した系統連系慣行を求めた。

このcomputational load reviewは、動的安定性が機器マーケティングの領域を超えつつあることを示している。これは、グリッド計画と系統連系の課題になりつつある。

したがって運用事業者は、両側から圧力を受けることになる。顧客はコンピューティング能力の中断なき提供を求め、電力会社は擾乱時にも予測可能な挙動を必要とする。一方の責務だけを最適化する設計は、もう一方を損なうおそれがある。

目指すべきは、協調されたレジリエンスだ。データセンターは自らの設備を保護し、条件が許す限り系統との接続を維持し、上流側へ不必要な変動を送り出さないようにすべきである。

その仕組みは制御、蓄電、そして現実的な試験に左右される

動的安定性は、協調した応答によって生まれるシステムの挙動であり、完成済みの施設に単一のサプライヤーが後付けできる機能ではない。

第一の層はワークロードの可視化である。運用事業者は、アクセラレータクラスタがいつ電力状態を変えるのか、その変化がどの程度の頻度で起こるのか、またソフトウェアで変化のタイミングをずらせるのかを把握する必要がある。

すべてのAIワークロードが同じように振る舞うわけではない。学習ジョブには、多数のデバイスにまたがる活動を同時に発生させる同期バリアが含まれることがある。推論需要は予測不能なユーザートラフィックに従う一方、バッチ処理ではスケジューリングの柔軟性をより確保できる場合がある。

第二の層は高速な電気的応答である。UPSコンバーターとバッテリーは、回転式発電設備が追随するより前に反応できる。その制御によって、変動のどの程度を施設内で吸収し、どの程度が上流インフラに到達するかが決まる。

第三の層は持続的な供給である。バッテリーだけで、あらゆる変動を無期限にカバーすることはできない。初期遷移の後は、発電機、系統供給、再生可能エネルギー発電、その他のエネルギー源が負荷を引き受けなければならない。

第四の層は保護協調である。遮断器とリレーには、健全なシステムを過度に切り離すことなく設備を守るための設定が必要となる。その設定は、パワーエレクトロニクスと大規模コンピューティング負荷の実際の挙動を反映しなければならない。

第五の層は熱的連続性である。液冷ポンプと制御バルブには、遷移中も電力供給が必要だ。運用事業者は、温度が機器の許容範囲を超えるまでに冷却液の容量がどれだけ熱を吸収できるかも把握しなければならない。

Vertivの負荷シミュレーターは、急激な電力需要変動を再現することで、検証上の隔たりの一部を埋める。これにより、UPS制御が入力を平滑化できるか、発電機が安定を保てるか、切替シーケンスが設計どおり機能するかを明らかにできる。

ただし、シミュレーターはプログラムされたプロファイルに依存するため、実際のワークロード試験も依然として重要である。誤った振幅やタイミングを再現する試験は、導入済みシステムを表していないにもかかわらず、信頼感だけを与えかねない。

最も強力なコミッショニングプログラムは、複数のレベルを組み合わせる。コンポーネント試験は個別の機器を検証し、統合システム試験は相互作用を調べる。ワークロードを踏まえたシナリオは、想定されるアクセラレータの挙動と現実的な故障を再現する。

その後、過去の運用データを用いてこうしたシナリオを更新すべきである。モデル、チップ、ファームウェア、スケジューラーが変化すれば、昨日の負荷プロファイルは時代遅れの代替指標になり得る。

Emersonも、太陽光発電、バッテリー蓄電、データセンター需要をまたぐ統合制御環境について同様の主張をしている。同社の制御アーキテクチャに関する議論は、孤立したポイントソリューションではなく、決定論的な協調に焦点を当てている。

この比較は、業界における中心的な競争を示している。一方の道筋は独立した機器を追加し、冗長化が安全性を生むと考える。もう一方は、制御、モデル、検証を安全システムの一部として扱う。

どちらの道筋も、それだけでは機能しない。ソフトウェアは不十分な物理的容量を補えない。追加のハードウェアも、不安定な制御の相互作用をすべて是正できるわけではない。

運用事業者は、自動化にも境界を設ける必要がある。電力を平滑化するコントローラーは、停電に備えて十分なバッテリー残量を保持しなければならない。コンバーターの限界を尊重し、悪化する上流側の状態を覆い隠さないことも必要だ。

人間の運用担当者には、理解可能な状態表示とフォールバック手順が必要である。説明も訓練もできない自動応答は、実際の条件がプログラムされたシナリオと異なる場合、復旧を遅らせるおそれがある。

サイバーセキュリティも同じ議論に含めるべきである。ワークロードのテレメトリー、UPS制御、蓄電システム、系統インターフェースを接続すると、制御対象領域が拡大する。認証、セグメンテーション、変更管理、手動オーバーライドは、自動化とともに整備しなければならない。

したがって動的安定性に必要なのは、単なる高速応答ではない。試験済みの限界と、各制御判断に対する明確な責任を伴う、統制された応答である。

共通のAI対応標準を支える証拠はなお不十分だ

業界はAI負荷が異なることでは一致しているが、施設がそれらを安全に管理できると証明する単一の公開試験は確立していない。

Vertivの主張は、特定の制御技術と試験機器について述べたものだ。ABBは系統強度を高めるソリューションを推進している。Schneider Electricはフォールトライドスルーを重視し、他のサプライヤーはバッテリー、発電機、ワークロード管理に注力している。

これらの立場は有用なエンジニアリング上の選択肢を示す。しかし、それらはインフラを販売する企業からの提案でもあり、独立した検証が不可欠である。

顧客センターでの実証が成功しても、あらゆる電力会社、発電機の種類、バッテリー化学系、トポロジー、GPUワークロードでの性能が自動的に証明されるわけではない。サイトの条件によって結果は変わり得る。

AI対応データセンターの定義は、依然としてとりわけ曖昧だ。ラック密度、液冷、ネットワーク帯域幅、電力容量、あるいはアクセラレータハードウェアの可用性を指す場合がある。

動的安定性は別の要件を加えるが、購入者には測定可能な受け入れ基準が必要である。どの負荷プロファイルを試験したのか、どの障害シーケンスを含めたのか、どの運用上の限界が適用されたのかを知る必要がある。

標準的な負荷プロファイルはシステム比較に役立つが、標準化には独自のリスクもある。アクセラレータのアーキテクチャやソフトウェアフレームワークの進化に伴い、実際のワークロードも変化する。

より良いアプローチは、少数の共通ストレスケースと施設固有のトレースを組み合わせることだ。共通試験は比較を支援し、ローカルプロファイルは関連性を維持する。

電力会社にも、透明性の高い動的モデルが必要である。こうしたモデルは、不必要な顧客データを公開せずに、低電圧時の応答、周波数保護、UPSの挙動、バッテリーの限界、切替シーケンスを表現すべきだ。

モデル検証はコミッショニング後も継続しなければならない。ファームウェア更新は応答時間を変える可能性がある。バッテリー状態、発電機構成、ITスケジューリングの変更も、施設の挙動を変え得る。

1社のベンダーがモデル、制御システム、性能に関する主張をすべて提供する場合、独立したエンジニアリングレビューは特に重要となる。それは主張が誤っていることを意味しないが、前提条件が1つの組織に集中することを意味する。

研究は、この隔たりを埋め始めている。2026年のある研究では、小型モジュール炉とバッテリー蓄電によって供給される系統接続型データセンターをモデル化した。このシミュレーションは、故障条件下における電気的、コンピューティング、熱的な挙動を調査した。

動的安定性に関する研究では、モデル化された統合システムにおいて電圧および周波数性能の改善が示された。ただし、シミュレーション結果は現場での検証と同じではなく、商用原子炉の導入には追加の不確実性も伴う。

より直接的な証拠は、実運用サイトから得られるだろう。運用事業者は、負荷ランプ、系統擾乱、機器の応答、復旧タイミングを示す匿名化トレースを公開すべきである。

このような証拠がなければ、動的安定性はまた別の広範なマーケティング用語となるおそれがある。サプライヤーは、異なる前提のもとで異なるシナリオを試験しながら、いずれも適応的な挙動を主張できてしまう。

購入者は直接的な質問をすべきだ。検証済みの最大負荷ステップはいくつか。システムはそれをどの程度の頻度で繰り返せるのか。どのバッテリー残量を前提としたのか。試験には発電機同期と冷却の連続性が含まれていたのか。

また、何が故障を引き起こしたのかも問うべきである。有用な試験プログラムは、成功した実証を示すだけではない。制御が飽和する境界、保護が作動する境界、あるいは復旧の信頼性が低下する境界を特定する。

こうした境界が、設計に実際の運用余裕があるかを左右する。システムの遷移限界が不明なままであれば、冗長機器があっても安心材料にはほとんどならない。

動的安定性が標準になるかを示す3つのシグナル

次の段階を左右するのは、系統ルール、再現可能なコミッショニングデータ、そして運用中のAI施設におけるワークロード認識型制御である。

第1のシグナルは、大規模データセンターが系統連系要件でどのように扱われるかである。電力会社や信頼性機関はすでに、フォールトライドスルー性能と急激な負荷喪失により注意を向けている。

より詳細な要件は、動的安定性の意義を強化するだろう。検証済みモデル、指定された電圧・周波数応答、あるいは擾乱時の切替挙動の開示を求める可能性がある。

要件が分断されたままであれば、サプライヤーは地域ごとの電力会社慣行に応じた別々のソリューションを開発し続けることになる。それは比較を困難にし、複数市場で構築する運用事業者のエンジニアリング作業を増やすだろう。

第2のシグナルは、統合試験が再現可能なものになるかどうかだ。Vertivのシミュレーターは、ワークロード形状の電力試験向けに設計されたツールの一例である。他のベンダーや独立研究所にも、比較可能な手法が必要となる。

再現可能な試験は、高速な負荷ランプ、持続的な運転期間、系統擾乱、コンポーネント故障を組み合わせるべきである。また、バッテリー使用量、発電機応答、電圧、周波数、復旧時間も記録すべきだ。

試験と同じくらい、公開も重要である。購入者は、管理された実証と代表的な運用シナリオを区別できるだけの詳細を必要としている。

現場での結果は、Vertiv AI load stabilityが施設設備と上流インフラの双方を保護できるという主張を強めるだろう。バッテリー劣化、制御競合、切替失敗の証拠は、その主張の範囲を狭めることになる。

第3のシグナルは、ワークロードスケジューラーと施設制御の統合である。現在のアプローチの大半は、電力需要が変化し始めてから応答する。協調によって、電力システムへ事前通知を与えられる可能性がある。

スケジューラーは、緊急性の低いジョブのタイミングをずらしたり、遷移を緩やかにしたり、クラスタ間で処理を移動させたりできる。こうした行動は、コンピューティングを制御不能な需要源ではなく、柔軟な負荷として扱うものだ。

このアプローチは、商業面と運用面の問いを生む。クラウド顧客は、約束された時点でコンピューティングリソースが提供されることを期待している。運用事業者は、性能上の約束を破らずに移動できるワークロードを判断しなければならない。

また、ソフトウェアと運用技術の間で信頼できる情報フローが必要となる。データセンターは、すべてのアプリケーションに重要な電気制御への直接的な影響力を与えるべきではない。

それでも、ワークロード認識型の協調は、ハードウェア単独では実現できない道筋を示す。蓄電設備は遷移を平滑化できるが、スケジューリングによって遷移そのものが深刻化するのを防げる場合もある。

インフラチームにとって実践的な対応は、証拠と運用コンテキストを保存することだ。電力トレース、コミッショニング報告書、ファームウェア変更、インシデントレビューは、エンジニアリンググループをまたいで検索可能な状態に維持すべきである。

構造化されたエンジニアリングナレッジベースは、チームが電気的挙動を構成変更やワークロードイベントと結び付ける助けとなる。この結び付きは、過渡現象がミリ秒単位で終わっても、その根本原因が複数のシステムにまたがる場合に価値を持つ。

より大きな問いは、AIデータセンターに冗長性が必要かどうかではなくなっている。必要である。問われるのは、重要な遷移の際に、冗長資産が1つの制御されたシステムとして動作することを、運用事業者が証明できるかどうかだ。

Vertiv、ABB、Schneider Electric、そして系統研究者は、それぞれ異なる立場からこの問題に収束しつつある。採用する機器は異なるが、その診断はますます一致している。

AIインフラでは、レジリエンスが常時求められるものとなった。通常のコンピューティング中、急激な負荷変動時、送電網の障害時、そして復旧プロセス全体を通じて、レジリエンスが確保されていなければならない。

運用者は今後、AI対応をうたう施設を受け入れる前に、動的モデル、ワークロード情報に基づくコミッショニング、そして公開された応答限界を求めるべきだ。数千基のアクセラレータが同時に状態を変えたとき、電力系統全体がどのように振る舞うかを示せる計画中の施設は、どこにあるだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page