CoolITのファンレス液冷がAIラックをハイブリッド冷却の限界の先へ押し上げる
CoolITによると、同社のファンレス液冷設計はAIサーバーの熱を実質的にすべて回収でき、250 kWラック内に残る75 kWの課題に対処できるという。
この数値は、現在一般的なハイブリッド方式の限界を示している。液体で熱の70パーセントを回収するシステムでも、残る30パーセントは空気で処理しなければならない。250 kWでは、ファンと設備機器が残り75 kWを除去する必要がある。
CoolITは、この残余負荷によってハイブリッド冷却を正当化することがますます難しくなると主張する。同社が提案する代替案は、コールドプレートの対象をプロセッサーからメモリー、ネットワーキング、ストレージ、電源コンポーネントへと広げるものだ。目標は、空気側に残るラックの熱を1パーセント未満に抑えることである。
同社はこれを、100パーセントを設計目標とする「ほぼ完全な熱回収」と呼ぶ。この区別は重要だ。ケーブル、回路基板、その他の表面からは、なお少量の熱が放出されるためである。
より大きな論点は、液体がプロセッサーを空気より効率的に冷却できるかどうかではない。最も高密度なAIハードウェアでは、その勝負はほぼ決着している。新たな競争は、空冷層を維持するハイブリッドサーバーと、当初から液冷を前提に設計されたファンレスシステムの間で展開されている。
CoolITの主張は、Nvidiaとサーバーメーカーがラックスケールコンピューティングを従来のデータセンター密度を大きく超える水準へ押し上げるなかで登場した。NvidiaのGB200 NVL72は、同社のrack designによると、すでに約120 kWの冷却能力を必要とする。将来のシステムは、1ラック当たり数百kWへ向かっている。
この水準では、プロセッサーだけを冷却しても熱問題は解決しない。
CoolIT、液冷をプロセッサーの外へ拡張
CoolITのファンレス液冷は、サーバー全体を、空冷部品に囲まれた高温プロセッサーの集合ではなく、一つの熱システムとして扱う。
同社が2026年9月に示した主張は、熱の発生場所における重要な変化から始まる。GPUとCPUは依然として最大の熱源だが、もはや冷却課題のすべてを占めるわけではない。
メモリーモジュールは高電力プロセッサーの近くに配置され、ますます高負荷なデータ移動を処理する。ネットワークスイッチとインターフェースコンポーネントは、より高速なリンクを備えた大規模クラスターを支える。ストレージ、電圧レギュレーター、電力変換ハードウェアにも、より重い負荷がかかっている。
これらのコンポーネントはかつて、サーバー内をすでに流れている気流のなかで問題なく動作していた。その構成により、メーカーはプロセッサーにコールドプレートを配置する一方、その他の部品にはファンを残すことができた。
コールドプレートは、電子パッケージに直接取り付けられる金属製熱交換器である。内部チャネルを通過する冷却液が熱を吸収し、冷却液分配ユニット(CDU)へ運ぶ。
CDUは、温度、圧力、流量を制御しながら、機器側の冷却ループを施設水ループから分離する。これは、ほとんどの直接液冷導入における中核的な要素である。
CoolITの熱回収に関する主張は、このループをハイブリッド設計で取り残されるコンポーネントまで広げる。同社によれば、これらのシステムは、6世代のファンレス設計で試験したモジュール式コールドプレートブロックで構成される。
このモジュール式アプローチは重要である。周辺コンポーネントはプロセッサーほど均一ではないためだ。CPUやGPUは通常、定義済みの取り付け点を持つ平坦なパッケージだが、メモリー、電源コンポーネント、スイッチ、ストレージデバイスは、形状も配置場所も異なる。
各コンポーネントにはそれぞれ温度上限と機械的制約もある。完全な液体ループは、保守作業へのアクセスを妨げたり、回路基板に有害な力を加えたりせずに、こうした違いに対応しなければならない。
したがってCoolITは、ファンレス冷却を単に優れたプロセッサー用コールドプレートではなく、サーバー設計の課題として提示している。冷却液の流路、コネクター、マニホールド、制御装置、コンポーネントのインターフェースは、一つのシステムとして動作する必要がある。
同社によれば、そのアーキテクチャーは空冷の比率を1パーセント未満に低減できる。また、一部の熱は液体経路外の表面から逃げるため、文字通り100パーセントの回収はほぼ不可能であることも認めている。
この留保により、「ファンレス」は「空気中へ放出される熱がゼロ」よりも正確な表現になる。ファンレスサーバーは、コンポーネント温度を維持するために内部ファンを使わず、わずかな受動的な放熱を許容できる。
これが今回の発表がもたらす直接的な変化である。液冷は、最も高温なパッケージから、AIサーバー内のほぼすべての重要な熱源へ拡大している。
250 kWラックがハイブリッド冷却の方程式を崩す
割合に基づく冷却計画の問題は、ラック電力が増えるたびに残余の空冷負荷も増大することだ。
70対30の液冷・空冷分担は、比率で表せば効果的に見える。液体が大半の熱を除去し、残りを従来どおりのファンと室内システムが処理するという意味である。
しかし絶対値は異なる姿を示す。50 kWラックの30パーセントは15 kWだが、250 kWラックの30パーセントは75 kWになる。
この残余負荷は、複数の従来型ラックの総消費電力に相当する。しかもそれは、プロセッサー、ネットワーキング、電源シェルフ、冷却液マニホールド、高速ケーブルで既に密集した1台のキャビネット内に存在する。
この熱を除去するには、大量の気流が必要となる。事業者は冷気を供給し、狭いサーバー通路を通して移動させ、排気を集め、それが機器吸気口へ再循環しないようにしなければならない。
ファンも電力を消費し、サーバー内部のスペースを占有する。気流を増やすと、圧力、騒音、保守、ろ過に関する要求が生じる。施設がプロセッサー向けの液冷インフラを導入した後も、こうした要件は続く。
事業者はその結果、同じラックのために二つの冷却システムを維持することになる。ポンプ、熱交換器、マニホールド、冷却液制御装置が液体ループを担い、ファン、空調機、封じ込め設備、室内冷却が残る空冷負荷を担う。
CoolITの中心的な主張は、この重複が約250 kWを超えると商業的に魅力を失うというものだ。このしきい値は同社のモデリングによるものであり、普遍的なエンジニアリング標準ではない。
ラックの実現可能性は、サーバー形状、冷却液温度、気候、施設設計、冗長化要件、許容されるコンポーネント温度に左右される。綿密に設計されたハイブリッドシステムが、ある一つの正確な数値で突然動作しなくなるわけではない。
ただし、根底にある計算は反論しにくい。急速に増大する総量の一定割合は、急速に増大する負荷となる。
ASHRAEのAI cooling frameworkによれば、ラック密度は約120 kWから数百kWへ移行している。また近い将来には、メガワット級ラックも見込まれている。
このフレームワークは、直接チップ液冷をAIおよびハイパフォーマンスコンピューティング向けの業界標準として説明している。直接チップ液冷とは、選択した電子コンポーネントに取り付けたコールドプレートを通じ、冷却液が熱を除去する方式である。
CoolITはこの流れをさらに一歩進める。ほぼすべての高負荷コンポーネントに液冷インターフェースを設ければ、室内はサーバー内へ大量の空気を流す必要がなくなる。
これは、ラックが動作するデータホール領域であるホワイトスペースの設計を単純化できる可能性がある。また、より多くの熱除去を温水システムや屋外熱交換器へ移すことも可能になる。
ただし、冷却作業そのものがなくなるわけではない。ポンプは冷却液を循環させなければならず、CDUは熱を移送し、最終的には施設がその熱を外部へ放出する必要がある。
ファンレスAIサーバーは、作業が行われる場所を変える。大量の内部気流を、集中負荷向けに構築されたインフラへ熱を届ける制御された液体経路に置き換えるのである。
このため、250 kWという数値は普遍的な断崖ではなく、設計上の警告として読むべきだ。空冷を維持することで、第二の大きなインフラ負担が生じ得る地点を示している。
CoolITのファンレス液冷、ハイブリッドという既定路線に挑む
主要な競争は現在、プロセッサーにおける液冷対空冷ではなく、全面的な液冷カバー率対ハイブリッド冷却である。
ハイブリッド冷却は、使い慣れたサーバーおよびデータセンター設計を維持できたため、現実的な移行策となった。事業者は、すべてのコンポーネントを再設計したり、確立された気流管理の慣行を放棄したりせずに、高電力チップへ液冷を追加できた。
この妥協は導入リスクを下げた。また、メーカーは、新たに液冷化されたアクセラレーターの周囲で、実証済みの空冷メモリー、ストレージ、ネットワーキング、電源設計を使うことができた。
NvidiaのGB200 NVL72は、この移行を示している。このラックは72基のBlackwell GPUと36基のGrace CPUを、高帯域幅のNVLinkファブリックで接続する。コンピュートトレイとスイッチトレイには液冷接続が含まれるが、導入には依然として大規模なラックおよび施設の統合作業が伴う。
このシステムの120 kWの冷却要件は、多くの既存データホールが提供できるよう設計されていた水準をすでに上回る。より新しいプラットフォームでは、同程度の物理的設置面積にさらに大きな電力を収めることが予想される。
CoolITは、主力のラックスケールシステムが2028年までに完全な熱回収へ向かうと述べている。この予測はプロセッサー電力の方向性と一致するが、その時期はあくまで同社の評価である。
この分野の確立を一社のサプライヤーだけに業界が委ねているわけではない。Hewlett Packard Enterpriseは2024年10月、独自の100パーセント・ファンレス直接液冷アーキテクチャーを発表した。
HPEの設計は、GPU、CPU、メモリー、ストレージ、ネットワーキング、電源、ラック、ポッド、CDUを対象にする。同社によれば、このアーキテクチャーはハイブリッド直接液冷と比べ、サーバーブレード当たりの冷却電力を37パーセント削減する。
HPEはまた、従来の空冷システムと比べて冷却電力を90パーセント削減できると主張している。これらの数値はベンダーの試験に基づくものであり、普遍的な運用結果として扱うべきではない。
それでもHPEのfanless architectureは、より広範な方向性を裏付けている。より多くのコンポーネントを液体で冷却することは、大手サーバーサプライヤーの間でアーキテクチャー上の選択肢になりつつある。
液浸冷却は別の経路を提供する。サーバー、または選択したアセンブリーを、露出したコンポーネントから直接熱を吸収する誘電性液体内に配置する方式だ。
液浸は、個別のコールドプレートを使わずに機器の熱をほぼすべて回収できる。ただし、ハードウェアのパッケージング、保守手順、液体の取り扱い、保証、コンポーネント認定を変える必要がある。
コールドプレートシステムは、より使い慣れたラックおよびサーバー形式を維持する。技術者は、適切な冷却ラインを分離して切り離した後、乾いたコンポーネントにアクセスできる。
この親しみやすさは、すでにNvidia型ラックシステムの準備を進めている施設において、直接液冷に導入上の優位性を与える。一方で、各サーバー内部には厳しい統合課題が残る。
関連するすべてのコンポーネントへコールドプレートを追加すると、インターフェースの数が増える。設計者は、流動抵抗、温度差、チューブの経路、コネクターの配置、特定コンポーネントへの冷却不足のリスクを管理しなければならない。
モジュール化は役立つ可能性がある。CoolITによれば、再利用可能なコールドプレートの構成要素により、異なる物理的・熱的要件を持つコンポーネントをサポートしながら、開発を短縮できる。
この主張には妥当性があるが、決定的な証拠は完全な量産システムから得られるだろう。事業者には、現実的なワークロード、冷却液条件、保守サイクル、障害シナリオにわたる性能データが必要である。
ここで対立構図が明確になる。ハイブリッド冷却は段階的な導入とコンポーネントの親和性を提供する。全面液冷は、サーバーの気流への依存を抑えながら、より高い密度を実現すると期待されている。
ラック密度が低い段階では、運用者は依然としてハイブリッド設計の柔軟性を選好できる。数百キロワット規模になると、残存する空冷負荷がアーキテクチャを左右する度合いを増していく。
ファンレスはインフラ不要を意味しない
ほぼすべての熱を回収すればサーバーファンは重要経路から外れるが、その分、冷却液供給と設備エンジニアリングの責任が重くなる。
ファンレスサーバーは、ファン速度を上げて弱い冷却液流量を補うことができない。熱的な安定性は、ポンプ、バルブ、マニホールド、制御系、コールドプレートの接触、熱交換器が正しく機能することに依存する。
したがって、冗長化は不可欠となる。運用者は、プロセッサーのスロットリングやラック停止を伴わずに、どのポンプ、CDU、センサー、制御系の障害まで許容できるかを決めなければならない。
漏水管理も高価なハードウェアのすぐ近くへ移る。適切に設計されたシステムでは、検証済みコネクター、圧力制御、液だれしないクイックディスコネクト、監視、隔離手順が用いられる。
目的は、液体は決して漏れないと主張することではない。冷却液が脆弱な電子機器に達する前に、障害を検知、封じ込め、修理可能にすることである。
冷却液の化学特性も、別の運用要件を生む。水質、添加剤、金属、エラストマー、チューブ、温度はいずれも腐食と生物学的増殖に影響する。
互換性のない材料で組み立てられたシステムは、外部漏れが見られなくても内部で劣化する可能性がある。長期信頼性は、検証済みの材料組み合わせと管理された保守に左右される。
Open Compute Projectのcoldplate requirementsは、この複雑さを反映している。そのガイダンスは、冷却液の種類、接続方法、CDUの配置、温度、圧力、冷却分類を扱う。
保守性も同じくらい重要だ。メモリーやネットワーク部品を交換する技術者は、旧来のサーバーにはなかった液冷ハードウェアを切り離す必要があるかもしれない。
冷却インターフェースが増えると、メーカーがアクセス性を慎重に設計しない限り、修理作業は長引く可能性がある。施設側にも、訓練を受けたスタッフ、予備アセンブリ、冷却液の取り扱い機器、文書化された隔離手順が必要になる。
ファンレスシステムは、コミッショニングにも新たな要求を課す。エンジニアは各分岐に必要な流量が届いていること、また閉じ込められた空気が熱伝達を妨げていないことを確認しなければならない。
部分負荷時の制御も検証する必要がある。AIクラスタでは作業負荷が完全に均等に分散されることはめったになく、変動するワークロードの中では、あるトレイが隣接するトレイより高温になる場合がある。
第2の不確実性は既存建物に関わる。新設のAI施設は、液体ループ、より重いラック、より大きな配管、高容量の排熱設備を前提に設計できる。
古いデータホールの改修はより難しい。床荷重、配管経路、電力分配、保守用クリアランス、CDUの設置場所が、運用者が展開できる密度を制約する場合がある。
一部の施設では、冷却液の熱を室内空気へ放出する液空CDUを採用する。これは、施設用水が利用できない場所での展開を加速できる。
しかし、ほぼ完全な液冷によって低減しようとしている施設レベルの空調負荷は残る。サーバーは液冷化されても、建物はなお空気を介して熱を移動させる。
水使用量についても同様に慎重な検討が必要だ。直接液冷は密閉された装置ループを使用するが、総水消費量は施設における最終的な排熱方式によって決まる。
ドライクーラーに接続した温水ループは、適した気候では蒸発による水使用を削減または回避できる。冷却塔システムでは、依然として相当量の水を消費する可能性がある。
適切な比較には、シリコンから屋外環境までの経路全体を含める必要がある。サーバーの熱回収率だけでは、総エネルギー使用量や水効率を示せない。
これはCoolITの論点に対する最も重要な検証項目である。ほぼ完全な熱回収は残存するサーバー空調の問題を解決するが、システム全体のエンジニアリングの必要性をなくすわけではない。
同社はモデリングに基づき、もっともらしい方向性と明確な密度の閾値を示している。ただし、250 kWを普遍的な境界とみなすために十分な実運用データは公表していない。
運用者は、検証済みの圧力損失、コンポーネント温度、ポンプエネルギー、冗長性の挙動、保守時間、施設要件を求めるべきだ。これらの測定値が、ファンレス設計が実際に運用を簡素化するかを決める。
効率性の根拠は冷却チェーン全体に左右される
熱回収率が高まれば効率向上の機会が生まれるが、その機会が測定可能な改善になるかどうかは、アーキテクチャと運転条件によって決まる。
サーバーファンは無償ではない。電力を消費し、スペースを占有し、騒音を発生させ、ますます制約の厳しいコンポーネント配置に対して空気を押し込む。
ASHRAEは、一部の空冷構成ではファン電力がサーバー電力の10〜20%を占める場合があると指摘している。数千台のサーバーが継続的に稼働する場合、このオーバーヘッドはさらに重要になる。
液体は、コンパクトな流路を通じて熱を運ぶ能力が空気よりはるかに高い。コールドプレートは熱源の近くで熱を回収するため、ボード全体に大量の空気を流す必要を避けられる。
こうした特性は、より高密度な実装を支える。ファンと大きな空気流路を取り除けば、コンピュート、ネットワーキング、電力供給、あるいはより直接的な保守アクセスのために内部容積を確保できる。
ただし、液冷システムはポンプ電力を消費する。狭い流路、長いチューブ、または多数の並列分岐を持つ設計では、十分な流量を維持するためにより大きな圧力が必要になる可能性がある。
結果は油圧設計全体に依存する。サーバーファンの消費電力が減っても、総冷却エネルギーが自動的に下がるとは限らない。
冷却液温度も主要な変数だ。より温かい液体は、気候やワークロード要件に応じて、チラーを使わない排熱を可能にする時間を増やせる。
より高い冷却液温度は、排熱再利用の機会も改善しうる。温度が近隣の建物や産業プロセスに十分な水準であれば、廃熱はより有用になる。
コンポーネントの限界が、この機会を制約する。プロセッサー、メモリー、光学デバイス、パワーエレクトロニクス、ストレージは、それぞれ異なる入口温度と運転マージンを必要とする場合がある。
完全な液体ループは、すべてを過度に冷却することなく、最も制約の厳しいコンポーネントを満たさなければならない。複数のループや慎重に制御された分岐でこの差異に対応できるが、複雑性は増す。
ASHRAEは、低温ループから摂氏45度を超える温水条件までの水クラスを説明している。運用者が使用できるクラスは、機器の互換性によって決まる。
容量計画では、過渡的な挙動も考慮しなければならない。AIプロセッサーはアイドル状態と高利用率の間を急速に移行し、ラック全体の発熱量を変化させることがある。
液体には短時間の変動を吸収できる熱容量があるが、それでも制御系は不安定な流量や温度条件を生じさせずに応答しなければならない。
エネルギー効率は利用率とも切り離せない。高密度に実装され、一貫して稼働するラックは、スペースと冷却インフラを効率的に利用できる。
ピーク電力向けに構築されながら、通常はそれを大きく下回るレベルで稼働するラックでは、ポンプと施設容量が十分に活用されない可能性がある。制御系には、変動する需要に対応できる十分な範囲が必要となる。
これが、ベンダーの比率に文脈が必要な理由だ。HPEの37%のブレード冷却削減と、CoolITの1%未満という空気への熱放出目標は、システムの異なる部分を測定している。
前者は特定の設計における冷却電力を比較する。後者は、機器の熱のうち空気へ到達する割合を示す。
どちらの数値も単独では、施設全体の効率を示さない。運用者には、電力使用効率、冷却システムのエネルギー、水使用量、利用可能容量、提供されるコンピュート性能がなお必要である。
したがって、ファンレスAIサーバーの最も強い根拠は、単一の効率比率ではない。液冷インフラと並行して別個の空調システムを拡張する必要を避けられる点にある。
250 kW以上では、数十キロワットが室内空気へ流入するのを防ぐことで、機器、気流、封じ込めの要件を減らせる可能性がある。この利点はラック電力の上昇とともに大きくなる。
それでも、この利点はサイトごとに検証しなければならない。気候、水の利用可能性、冗長性、ワークロード、排熱設備によって、最終的な結果は変わりうる。
ファンレスAIサーバーが標準になるかを示す3つの兆候
次の試金石は、ほぼ完全な熱回収がベンダーのアーキテクチャから、主流のラックスケールシステム全体で再現可能な導入へ移行するかどうかだ。
第1の兆候は、次世代の主力AIラックにおける液冷の対象範囲である。購入者は、ベンダーがメモリー、ネットワーキング、ストレージ、電力コンポーネントを直接冷却しているかを確認すべきだ。
プロセッサーだけの液冷では、ハイブリッドモデルが維持される。広範なコンポーネントをカバーするなら、熱の問題がチップを超えたというCoolITの主張を裏付けることになる。
Nvidiaの将来のラック仕様は特に重要になる。参考アーキテクチャがサーバーメーカー、冷却サプライヤー、データセンター計画に影響を与えるためだ。
第2の兆候は、独立して測定された施設性能である。運用者には、ポンプ、CDU、排熱、水消費量、ワークロード利用率を含む結果が必要だ。
サーバー熱の99%以上を液体へ回収する設計なら、室内空調の需要を実質的に減らすはずである。公表される運転データは、総冷却エネルギーが予想どおり低下するかを示さなければならない。
最も有用な比較では、ハイブリッド設計とファンレス設計で類似したワークロードを評価する。冷却液温度、気候条件、冗長性、利用率も開示すべきである。
第3の兆候は、運用の標準化だ。業界には、相互運用可能なコネクター、冷却液仕様、保守手順、監視インターフェース、安全要件が必要である。
Open Compute Projectのガイダンスは基盤を提供するが、広範な採用はサプライヤーがこれらの要件を一貫して実装することにかかっている。運用者はすべてのラックをカスタム機械システムとして扱うことはできない。
標準化は、コンポーネント交換とマルチベンダー調達も容易にする。標準化がなければ、施設は独自仕様のマニホールド、流体、保守プロセスに依存するリスクを負う。
CoolITがスポンサーとなったfanless server analysisは、250 kWという閾値がベンダー側の結論にとどまるとしても、現実の移行を捉えている。
重要な逆転はすでに見えている。液冷はかつて、空冷が限界に達した際にプロセッサーへ追加される補助的な技術だった。今では液体がほぼすべてを処理した後、空気が残される補助的な存在になりつつある。
この変化は、サーバーメーカー、施設設計者、運用者に同時に圧力をかける。各グループは、ハイブリッドインフラを維持することが依然として有用な柔軟性をもたらすかを判断しなければならない。
数百キロワット級のラックを計画する購入者にとって、直近の行動はプロセッサー仕様だけでなく、完全な熱マップを要求することだ。どのコンポーネントが空冷のままなのかを確認し、その絶対負荷を計算する。
次に、液体ループ、CDU、施設システム、最終排熱設備を通るすべてのキロワットを追跡する。この作業により、CoolITのファンレス液冷が建物を簡素化するのか、それとも複雑性を移すだけなのかが分かる。
将来がファンレスになるのは、その言葉が効率的に聞こえるからではない。全面液冷の方が、75 kWの空冷領域を抱えるよりも運用しやすいことを、本番システムが示したときにファンレスになる。



