top of page

SK hynixのAIインフラは物理的限界に直面:電力と冷却

4 時間前
読了時間: 20分

SK hynixは、より高速なプロセッサだけでは解決できない制約へとAIインフラ分析の焦点を移している。高密度のコンピューティングシステムを稼働させるには、十分な電力と冷却能力が必要だ。

同社による最新のAIデータセンター検証は、性能が現在、統合システムに依存していると論じる。コンピュート、メモリ、ストレージ、ネットワーキング、電力供給、熱管理が一体となって機能しなければならない。1つの層でも弱ければ、高価なアクセラレータが待機状態となったり、性能を抑制されたり、利用できなくなったりする可能性がある。

この議論は、AIインフラ競争の中心を変える。Nvidia、ハイパースケールのクラウド事業者、メモリサプライヤー、電力会社、冷却ベンダーは、もはや別々の課題を解決しているのではない。すべてのサーバーに入る電力は最終的に、施設が除去しなければならない熱になるという、1つの物理的限界を軸に構築を進めている。

この変化は、プロセッサや高帯域幅メモリの重要性を下げるものではない。むしろ、それらの実用的な性能がチップパッケージ外のインフラに左右されることを意味する。拠点がラックへ給電できず、冷却液を循環させられず、施設を電力網へ接続できないなら、より高速なアクセラレータの価値は限られる。

SK hynixのAIインフラ分析はチップの先へ

SK hynixは、電力と冷却を背景的な施設サービスではなく、性能を構成する要素として扱っている。

同社のinfrastructure analysisは、AIシステム設計に関するより広範な議論を展開している。個々のコンポーネントは重要だが、その仕様だけでアプリケーションレベルの性能が保証されるわけではない。

AIトレーニングクラスタは、モデルパラメータ、アクティベーション、チェックポイント、トレーニングデータを繰り返し転送する。推論システムはコンテキストを取得し、メモリを通じて移動させ、アクセラレータを連携させ、許容可能なレイテンシー内に回答を返さなければならない。

あらゆる段階でエネルギーが消費される。また、ユーザーが要求した計算に直接寄与しない転送を含め、すべての転送で熱も発生する。

これにより、依存関係の連鎖が生まれる。アクセラレータにはメモリからのデータが必要だ。メモリとストレージには高スループットの接続が必要になる。ネットワークスイッチは数千台のデバイスを連携させなければならない。電力システムは、それらすべてに中断なく電力を供給する必要がある。

続いて冷却装置が、発生した熱を除去しなければならない。冷却できなければ、ハードウェアは安全な温度範囲に収めるため動作周波数を下げる。サーマルスロットリングと呼ばれるこのプロセスは、コンポーネントを保護する一方で、利用可能な性能を低下させる。

同じ問題は施設規模にも当てはまる。データセンター事業者は、プロセッサを購入しても、それを配備するために必要な電力容量を持たない場合がある。また、電力会社の電力を確保していても、その電力を高密度ラックへ届けるための内部配電設備が不足していることもある。

変圧器、開閉装置、無停電電源装置、バスウェイ、バックアップシステムは、導入スケジュールの一部となる。それらの仕様は、建物が支えられるコンピューティング容量を左右する。

熱の経路も同様に重要だ。熱はシリコンから、パッケージ材料、コールドプレートまたはヒートシンク、冷却液ループ、熱交換器、そして施設の最終的な放熱システムへと移動しなければならない。

どこか1つでも弱い部分があれば、温度が上昇するか、ラック密度が制限される。事業者は、より広い床面積に機器を分散させる、プロセッサの消費電力を下げる、あるいは建物の改修中に導入を延期するといった対応を迫られる可能性がある。

SK hynixは、この移行に直接的な利害を持つ。同社の高帯域幅メモリ製品は、高密度コンピューティングパッケージ内でアクセラレータの隣に配置される。HBMは、メモリダイを積層し、短い垂直経路で接続することでメモリ帯域幅を高める。

このアーキテクチャは、プロセッサへのデータ供給を高速化するのに役立つ。しかし同時に、より狭い領域へコンポーネントと熱を集中させる。

2026年5月、SK hynixは将来のHBM製品向けの統合冷却アプローチを発表した。同社は、iHBM thermal designによって、テストにおけるパッケージ熱抵抗を30%低減したと説明した。

この数値は依然として同社の主張であり、商用での成果は最終製品とシステム設計に左右される。それでも、この発表は、メモリサプライヤーが現在、帯域幅や容量と並んで冷却を論じる理由を示している。

熱性能は製品アーキテクチャの一部になりつつある。もはやサーバーメーカーや施設事業者だけに委ねることはできない。

AIデータセンターの電力需要は電力網より速く拡大している

中核となる電力問題は、総エネルギー消費量だけではない。必要な場所と時間に大量の電力を供給することだ。

国際エネルギー機関は、データセンターが2024年に約415テラワット時の電力を消費したと推定した。これは世界の電力消費量のおよそ1.5%に相当する。

同機関のベースケースでは、データセンターの消費電力は2030年に約945テラワット時へ達すると予測されている。これは世界の電力使用量の3%弱に相当する水準となる。

IEAは、主にAI導入に関連するアクセラレーテッドサーバーの消費電力が、2030年まで年率約30%で増加すると見込む。これらのサーバーは、世界のデータセンター電力消費量で予測される純増分のほぼ半分を占める。

この数値は重要だが、より深刻な運用上の課題は、その所在地にある。データセンターは、特定の電力会社の管轄区域、変電所、送電地域に負荷を集中させる。

電気自動車の車両群は、多数の家庭や充電地点に需要を分散させる。AIキャンパスは、少数の系統接続を通じて数百メガワットを要求し得る。

IEAのenergy demand outlookは、データセンターが2~3年で稼働可能になる一方、大規模なエネルギーインフラにはそれより長い計画・建設期間が必要になることが多いと指摘している。

このタイミングのずれは、電力会社と開発事業者に圧力をかける。テクノロジー企業は需要が強いうちにコンピューティング容量を求める。電力会社は送電網への影響を調査し、変圧器を調達し、変電所を建設し、ときに発電や送電を拡張しなければならない。

計画中のキャンパスは、電力がサーバーに届くまで利用可能なAI容量ではない。発表済み容量、契約済み容量、通電済み容量はそれぞれ異なる指標である。

米国は、この不確実性の規模を示している。2024年のエネルギー省報告書は、データセンターが2023年に国内電力の約4.4%を使用したと推定した。

報告書は、その比率が2028年までに6.7%から12%に達する可能性があると予測した。この範囲が異例に広いのは、AIの導入、ハードウェア効率、稼働率、建設スケジュールを予測することが依然として難しいためだ。

U.S. energy estimateは、提案されているすべての施設が接続を受けられることを意味しない。異なる導入シナリオが、送電網に大きく異なる結果をもたらし得ることを示している。

したがって、電力の利用可能性はAIシステムの建設場所に影響する。トレーニングワークロードは、必ずしもエンドユーザーのすぐ近くに置く必要がないため、利用可能な電力がある地域へ移せる場合がある。

本番推論はそれほど柔軟ではない。工場、病院、金融システム、あるいはインタラクティブなアプリケーションを支えるサービスには、レイテンシー、レジリエンス、データ所在地に関する要件がある場合がある。

企業は、そうした要件と地域の送電網容量のバランスを取らなければならない。ユーザー、光ファイバー接続、適切な土地がある地域でも、電力が予定どおり届かなければ、導入先として不適切になり得る。

この圧力は調達を変えつつある。テクノロジー企業は長期の再生可能エネルギー契約を締結し、原子力発電所の再稼働を支援し、高度地熱プロジェクトに投資し、オンサイト発電を検討している。

こうした行動は供給を増やし得るが、発電機とサーバーの間にあるインフラをなくすものではない。送電線、変電所、変圧器、内部電気システムは依然として必要である。

クリーン発電も、特定のキャンパスに常時一定の電力を自動的に供給するわけではない。風力や太陽光の出力が変化する際、事業者には依然として系統の需給調整、蓄電、安定供給可能な発電、またはその他のリソースが必要となる。

その結果、AI性能の定義はより複雑になる。ベンチマークは、プロセッサがワークロードをどれほど速く完了するかを示せる。しかし、事業者が望む場所で数千台のプロセッサに給電できることまでは保証できない。

120キロワットのラックが冷却の前提を変える

ラック単位の電力密度は、AIデータセンターに空冷のみを前提とした設計から液冷支援型の熱設計への移行を迫っている。

従来のデータセンターでは、サーバーファンと室内レベルのシステムによって調整済みの空気を流し、冷却できるラックにコンピューティング機器を分散配置する。この方式は、多くのエンタープライズおよびクラウドのワークロードで引き続き実用的だ。

高密度アクセラレータシステムは、異なる熱プロファイルを生む。各ラック内により多くのコンピューティング機器、メモリ、ネットワーキング、電力ハードウェアを配置するためだ。

Nvidiaは、GB200 NVL72システムのおおよその消費電力をラック当たり120キロワットとしている。このラックは、72基のBlackwell GPU、Grace CPU、NVLinkスイッチング機器を組み合わせる。

比較すると、多くの従来型エンタープライズラックはその密度の一部で運用されている。正確な差は施設やワークロードによって大きく異なるため、あらゆる環境に当てはまる単一の従来型ラックの数値はない。

重要な変化はアーキテクチャにある。120キロワットのラックは、狭い設置面積に熱を集中させ、同じ負荷に対応するよう設計された電力経路を必要とする。

NvidiaはGB200 NVL72にハイブリッドシステムを採用している。同社の文書では、冷却の内訳を液冷約85%、空冷15%としている。

同社のrack-scale cooling designでは、主要な発熱コンポーネントに取り付けたコールドプレートへ液体を送る。冷却液は、室内の空気よりも発生源に近い場所で熱を吸収する。

ダイレクト・トゥ・チップ液冷は、サーバー全体を液体に沈める方式ではない。プロセッサ、メモリ近傍のコンポーネント、その他の高温デバイスと熱的に接触する密閉型コールドプレートへ、冷却液を循環させる。

冷却液分配装置は、IT機器ループと施設側の水ループの間で熱を移動させる。ポンプ、マニホールド、センサー、制御装置、熱交換器が流量と温度を維持する。

液体は空気よりも単位体積当たりに多くの熱を運べる。このため、ファンだけでは過剰な気流、空間、電力を必要とするラックに適している。

ただし、液冷は空冷を万能に置き換えるものではない。サーバー内には依然として気流を必要とするコンポーネントがあり、施設は回収した熱を建物から排出しなければならない。

事業者には、新たなエンジニアリング要件も加わる。冷却液の化学特性、圧力、流量、コネクタの健全性、結露リスク、漏れ検知を監視する必要がある。

保守手順はより複雑になる。技術者には、高価値の電子機器に近接する流体システムに関する訓練が必要となる。事業者は、クラスタを停止させずにラックを隔離する方法、トレイを交換する方法、ポンプを整備する方法を決めなければならない。

冷却システムは、コンピューティングアーキテクチャにも適合しなければならない。あるプロセッサパッケージ向けに設計されたコールドプレートが、将来のすべてのパッケージを自動的に支えられるとは限らない。

供給温度と流量は、ハードウェア世代ごとに変わり得る。施設計画者は、次世代ラックの導入時に時代遅れとなる熱システムを構築しないようにしなければならない。

既存のデータセンターを改修する場合にも、別の課題がある。古い建物では総電力が十分でも、高密度の液冷システムに必要な配管、床荷重、ラック寸法、排熱能力が不足している可能性がある。

事業者はアクセラレーターサーバーをより多くのラックに分散できるが、その場合はケーブル長と必要な床面積が増える。また、物理的な距離がレイテンシーや信号品質に影響する高速ネットワークも複雑になり得る。

プロセッサーの電力を下げることもできるが、性能は低下する。リアドア型熱交換器や封じ込め型の空冷システムを導入する方法もあるが、これらの手法も密度の上昇に伴って限界に直面する。

新設では、より大きな柔軟性が得られる。設計者は、想定されるラック負荷を基に、電気系統と熱システムを最初から一体的に設計できる。

ただし、それで不確実性がなくなるわけではない。現在設計される建物は、数年後に納入されるハードウェアを支えなければならないが、その間にもプロセッサーの消費電力、冷却インターフェース、クラスタアーキテクチャは変化し続ける。

電力対性能が新たなインフラのトレードオフになる

競争の軸はもはや、最高性能のチップと低速なチップの比較ではない。理論上の性能と、実際に導入可能な性能との比較である。

ハードウェアベンダーは、トランジスタ、メモリ帯域幅、高速インターコネクトを追加することで性能を向上できる。性能ワットあたりが改善しても、こうした向上はパッケージの複雑さやシステム電力の増加につながることが多い。

性能ワットあたりとは、システムがエネルギーの単位当たりに完了できる計算作業の量を示す指標である。これは不可欠な指標だが、総需要が減るかどうかまでは事業者に示さない。

より効率的なハードウェアは、1つのタスクに必要なエネルギーを減らせる。その結果、コスト低下がタスク数の増加、モデルの大型化、より長い推論プロセス、導入範囲の拡大を促す可能性がある。

このリバウンド効果により、効率向上と電力消費の増加は両立し得る。需要の拡大が、作業単位当たりのエネルギー必要量の低下を上回るためだ。

AIエージェントは、さらに別の変数を加える。エージェントは1つの回答を生成する前に、モデルを繰り返し呼び出し、文書を検索し、ソフトウェアツールを使い、中間結果を評価する場合がある。

そのため、ユーザーの1回の操作が複数回の推論処理を引き起こすことがある。動画生成、科学計算ワークロード、長時間の推論も、短いテキスト応答より多くの計算を必要とし得る。

事業者には複数の層で効率性が求められる。プロセッサーは効率的に計算を実行しなければならない。メモリは、過度な待機やデータ移動を発生させずにプロセッサーへデータを供給する必要がある。

ネットワークは、最小限の遅延でデバイスを連携させなければならない。ソフトウェアは、電力を消費し続ける機器をアイドル状態に放置しないよう、ジョブをスケジューリングする必要がある。

冷却設備は、過大なオーバーヘッドを加えずに熱を除去しなければならない。施設は電力を効率的に変換し、配電する必要がある。

このため、電力使用効率、すなわちPUEだけでは問題全体を説明できない。PUEは、施設全体の電力消費量と、IT機器が使用する電力を比較する指標である。

PUEが低いほど、施設運用上のオーバーヘッドが小さいことを示す。しかし、プロセッサーが十分に活用されているか、ソフトウェアが効率的に作業をスケジューリングしているか、モデルが必要以上の計算を使っていないかは分からない。

優れたPUEを持つ施設でも、利用率の低いアクセラレーターを稼働させている可能性がある。逆に、やや高いPUEでも、システム全体がワークロードにより適合していれば、より有用な計算作業を提供できる場合がある。

重要なのは、電力、コスト、レイテンシー、信頼性の制約内で提供される有用な作業量である。AIの利用率やワークロード当たりのエネルギーについて、企業が標準化されたデータをほとんど開示していないため、この成果を測定することは依然として難しい。

ここで、SK hynixのシステム全体を捉える枠組みが役立つ。メモリ帯域幅はアクセラレーターを稼働させ続けられるが、帯域幅の拡大はパッケージ電力や発熱にも影響する。

情報が長い電気経路を何度も移動しなくて済むため、データ移動を減らせばエネルギーを節約できる。メモリを計算処理の近くに配置すれば速度と効率を改善できるが、パッケージの高密度化は放熱を難しくする。

これが中核となるトレードオフである。統合を密にするとデータ移動は改善する一方、熱負荷は集中する。

同じ緊張関係はラック規模でも現れる。高密度システムはネットワーク経路を短縮し、より多くのアクセラレーターを密接に接続された1つの領域に配置する。

一方で、より大容量の電力供給と、より高性能な冷却ループが必要になる。施設がそのラックを支えられなければ、より低密度の設計を選ぶ必要があり、ネットワークやスペース面での利点の一部を失うことになる。

インフラベンダーは、連携されたリファレンスアーキテクチャで対応している。チップメーカーは、システムが顧客に届く前から、サーバーメーカー、電力機器サプライヤー、冷却専門企業と協業する。

この協業は統合リスクを減らすが、事業者の選択肢を狭める可能性もある。厳格に仕様化されたラックでは、特定の冷却液温度、電源シェルフ、コネクター、管理ソフトウェアが求められる場合がある。

顧客は検証済みの設計を得る一方、特定の機器チェーンへの依存度を高める。1つのコンポーネントを変更するだけでも、システム全体での検証が必要になることがある。

クラウドプロバイダーは、カスタムサーバー、ネットワーク、ソフトウェア、建物を大規模に連携させられるため優位に立つ。小規模な事業者や企業は通常、既存施設と複数のサプライヤーを利用する。

そのため、より難しい改修判断に直面する。AIワークロードをクラウドへ移せば、現地施設のアップグレードを回避できるが、運用コスト、データ管理、レイテンシー、サプライヤー依存に関する問題が生じる。

自社で構築すれば管理性は得られるが、電力容量、冷却に関する専門性、長期の計画が必要となる。正しい選択は、プロセッサーの仕様だけでなく、ワークロードの特性に左右される。

液冷は熱移動を解決するが、すべての制約を解決するわけではない

冷却技術はより高密度なコンピューティングを可能にするが、送電網の容量を生み出したり、経済的なAIサービスを保証したりするものではない。

液冷をめぐる熱狂は、ときに複数の問題を1つにまとめてしまう。液体は空気より効率的にチップから熱を移動させるが、電力は依然としてラックまで届けなければならない。

回収した熱も、屋外へ放出するか、再利用するか、別の場所へ移送する必要がある。ポンプや排熱設備も引き続きエネルギーを消費する。

水使用量も、システム全体に左右される。液冷ラックは閉じた技術用ループ内で運用できる一方、施設の別の場所では蒸発式冷却塔を使用している場合がある。

別の施設では、使用水量が少ない代わりにエネルギー消費が増える、または暑い天候時の冷却効率が下がるドライクーラーを使用している可能性がある。気候と地域の水資源の利用可能性が、最適な設計に影響する。

液冷が水使用をなくす、あるいは必然的に水使用を増やすという主張には文脈が必要である。答えは、冷却液ループ、排熱設備、運用温度、気候、発電方式に依存する。

信頼性についても、同様の慎重さが求められる。電子機器の近くに液体を置くことは漏れの懸念を生むが、従来の空冷施設にも水系統や機械設備は存在する。

運用リスクを左右するのは、エンジニアリングの品質、監視、コンポーネント設計、保守である。熱移動媒体にかかわらず、管理の不十分な冷却システムは故障し得る。

すべてのラックが定格電力で継続的に稼働する保証もない。実際の利用率は、ワークロードのパターン、ソフトウェアスケジューリング、チップの供給可能性、顧客需要によって決まる。

設計者は依然として、想定されるピークに対応する容量を必要とする。めったに発生しないピークに合わせて施設のあらゆる部分を過剰構築すれば、設備投資コストが上がり、低負荷時の効率が下がる可能性がある。

設備不足は逆の問題を生む。施設は、高価なアクセラレーターを所有していても、同時にフル性能で稼働させられないかもしれない。

こうした不確実性は投資判断を複雑にする。IEAが複数の需要シナリオを明示的にモデル化しているのは、AIの普及、効率性、インフラのボトルネックが消費量を異なる方向へ動かし得るためである。

その高効率ケースは、ハードウェア、ソフトウェア、施設の改善によって、同じデジタルサービスを提供しながら電力使用量を減らせることを示している。より高い成長を見込むシナリオは、普及の加速と供給制約の少なさを反映している。

どちらの結果も保証されていない。企業は、各AIワークロードが長期的に生み出す収益を把握する前に、大規模なインフラ投資を約束している。

それは、取り残される容量のリスクを生む。特定のラック形式や冷却規格に最適化された施設は、ハードウェア設計が変化した場合に高額な変更を要する可能性がある。

逆のリスクも現実的である。規格の安定を待てば、顧客が必要とする時点で事業者が容量を確保できない可能性がある。

SK hynix自身も不確実性に直面している。HBMと高密度AIシステムへの需要が伸び続ければ、同社は恩恵を受ける。したがって、その公開分析は中立的な観察者ではなく、サプライチェーンの参加者によるものだ。

同社の結論は、測定された導入データに照らして評価されるべきである。有用な証拠には、実際のラック利用率、提供された計算作業量、冷却エネルギー、コンポーネント温度、ダウンタイム、施設全体のコストが含まれる。

需要の伸びがより緩やかでも、物理的な議論は有効であり続ける。電気的・熱的な限界が、導入済みシステムが持続できる範囲を決定するためだ。

不確実なのは、市場が必要とするインフラの量、それがどこに建設されるか、そしてAIサービスから得られる収益が投資を正当化するかどうかである。

ボトルネックが緩和しているかを示す3つのシグナル

次の段階は、通電済み容量、稼働中の冷却データ、実ワークロード下での効率によって測られる。

第1のシグナルは、発表されたデータセンタープロジェクトと、確定した系統接続を受ける施設との隔たりである。建設発表は開発者の意欲を示すが、通電済みメガワットは導入可能な容量を明らかにする。

電力会社の系統連系スケジュール、変圧器の供給可能性、変電所建設、プロジェクトの遅延に注目すべきである。スケジュールの短縮は、電力供給がAI投資に追いつきつつあるという見方を裏付ける。

遅延が続けば、逆の結論が強まる。それは、プロセッサー生産が、そのプロセッサーを活用するために必要なインフラより速く拡大し得ることを示す。

第2のシグナルは、高密度液冷ラックの運用データである。ベンダーはすでに設計仕様を公開しているが、事業者には持続的な本番ワークロードから得られる証拠が必要だ。

関連する指標には、冷却液温度、ポンプのエネルギー、ラック稼働率、保守要件、コンポーネント故障率、施設電力の単位当たりの計算出力が含まれる。

標準化の進展も重要となる。共通のコネクター、熱インターフェース、動作範囲は、統合コストを下げ、ハードウェアのアップグレードを容易にできる。

要件が断片化すれば、特に多数の顧客やベンダーの機器をサポートしなければならないコロケーション施設で、導入が遅れることになる。

第3のシグナルは、AIサービス需要が効率向上を上回るかどうかである。IEAは個々のタスクに必要なエネルギーが大幅に改善すると予測しているが、総消費量は利用量とワークロードの複雑さに左右される。

より効率的な推論がインフラへの圧力を緩和するのは、計算需要が管理可能なペースで増える場合に限られる。エージェント、動画生成、より長い推論ワークロードは、そうした改善分を吸収し得る。

標準化された開示があれば、顧客と政策立案者は有用な計算需要の成長と、回避可能な無駄を区別しやすくなる。企業は現在、エネルギーと排出量を組織全体の大まかな水準で報告しており、個別のAIサービスを評価することは難しい。

世界の電力見通しは、データセンターの消費量が2030年までに2倍以上になると予測している。この予測は運命ではないが、計画上の課題の規模を示している。

SK hynixによるAIインフラ分析は、問うべき物理的な問題を的確に示している。次の制約は、メーカーが生産できるアクセラレータの数だけではない。運用者が効果的に電力を供給し、冷却し、接続し、活用できる数でもある。

開発者や企業の購入担当者は、AI容量がどこで稼働しているのか、アクセラレータをどれほど効率的に活用しているのか、そして需要が増えた場合に何が起こるのかを、今こそ問うべきだ。調達チームは、プロセッサ、メモリ、モデル性能と並行して、電力供給と冷却の準備状況を評価する必要がある。

最も重要なベンチマークは、もはやチップの仕様書には収まらないかもしれない。それは、制約のある1メガワットごとに、施設全体がどれだけ信頼性の高いAI処理を提供できるかという指標だ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page