top of page

FroreのLiquidJetに関する主張が、デリッド化したRubin GPUの本番導入を議題に押し上げる

8月6日
読了時間: 19分

Frore Systemsは、自社のLiquidJetコールドプレートがNvidia Rubin GPUの温度を10°C下げ、性能を15%向上させられると主張している。nvidia tomの記事が重要なのは、ハイパースケーラーがさらに踏み込んだ手段、すなわち本番サーバーに冷却ハードウェアを搭載する前にGPUのリッドを外すことを検討しているためだ。

この手法ではLiquidJetをシリコンにより近づけられ、Rubinで最も熱が集中する箇所の熱伝達を改善できる可能性がある。一方で、高価なアクセラレーターを組み立て時の損傷、漏れ、不均一な取り付け圧、長期的な材料不良から守る保守的なエンジニアリング慣行にも挑戦することになる。

したがって中心となる競争は、LiquidJetと単一の競合コールドプレートの対決ではない。最大限のダイ直冷却性能と、ハイパースケールインフラに求められる保守性・信頼性要件とのせめぎ合いである。Froreの数値は上振れ余地を示すが、運用事業者がそれを安全に実現できるかは本番検証で決まる。

Nvidia Tomの主張は、冷却をトークン出力に直接結び付ける

Froreは、このコールドプレートを単にRubinを温度上限内に収める手段ではなく、演算性能を構成する部品として提示している。

元の冷却レポートによると、LiquidJetはRubin GPUの温度を10°C下げられるという。同社はこの温度低下が、15%の性能向上につながるともしている。

ただし、独立した研究機関または導入顧客が開示された条件下で再現するまでは、これらの数値は企業側の主張にとどまる。ワークロードの選定、冷却液温度、流量、電力設定、チップ個体差、比較対象となるコールドプレートの設計はいずれも結果に影響し得る。

GPU温度が自動的により有用な処理量へ変換されるわけではないため、この比較は特に重要になる。すでに目標クロックを維持しているアクセラレーターは、より低温で動作しても追加のトークンを生成しない可能性がある。一方、熱制約を受けるGPUは、低温化によってより高い周波数または電力をより長く維持できれば恩恵を受けられる。

Froreの性能に関する議論は、後者の状況に依存しているように見える。熱除去が改善されれば、局所的なホットスポットを抑え、動作上の余裕を維持し、より安定したクロックを支えられる。結果として、トークン処理量の増加、学習時間の短縮、あるいは固定されたラック電力枠内での性能向上という形で効果が現れる可能性がある。

多くの推論事業者にとって、トークン生成は経済的に重要な指標だ。同じ導入済みGPUでより多くのリクエストを処理できるコールドプレートは、追加の建屋、電力接続、クラスター拡張を必要とせずにラック当たりの収益性を高められる可能性がある。

ただし、「性能」には厳密な定義が必要だ。学習スループット、推論時の毎秒トークン数、レイテンシー、メガワット当たりの総トークン数は関連する指標だが、相互に置き換えられるものではない。

報じられた15%の向上には、明確なベースラインも必要となる。一般的なコールドプレートとの比較は、Nvidiaが検証したRubin冷却設計との比較とは異なる意味を持つ。シミュレーションされた熱負荷の結果は、本番用Rubinシリコンによる測定ほどの重みを持たない。

Froreは以前の設計でも同様の主張をしている。Computex 2026で同社は、高密度AIトレイ向けの統合冷却アセンブリであるLiquidJet Nexusを披露した。ODMによるテストでは、評価対象の基準ソリューションと比べて約6°Cの温度低下と10%のトークン生成向上が確認されたとされる。

LiquidJet Nexusは、複数の発熱部品向けコールドプレートを1つのアセンブリに統合する。この構成にはGPU、CPU、ネットワーク機器、電力変換器、電圧レギュレーターなどを含められる。共有構造は継手や潜在的な漏れ箇所を減らせるが、全体の信頼性は依然として製造品質と導入品質に左右される。

以前の設計は、競合アセンブリの34ミリメートルに対し、厚さ17ミリメートルだったと報じられている。Froreは重量が65%軽いとも主張した。冷却ハードウェアが限られた空間を電力供給やネットワーキングと奪い合う高密度システムでは、こうした寸法が重要になる。

最新のnvidia tomの主張は、従来型パッケージインターフェースの改善から、デリッド化したシリコンへの直接接触の検討へと意欲を引き上げている。この変化こそが、漸進的な冷却の話を本番エンジニアリングの試験へと変える。

10°Cの低下は、ラック規模の検証でも維持されるなら意義深い。より難しい問いは、ハイパースケーラーが性能上の利点を打ち消す故障モードを持ち込まずに、この低下を実現できるかどうかだ。

デリッド化は熱障壁と保護層を取り除く

リッドを外せばRubinのシリコンと冷却液の間の経路は短くなるが、同時にパッケージング上のリスクがデータセンターのサプライチェーンへ移る。

GPUのリッドは、しばしば統合型ヒートスプレッダーと呼ばれ、シリコンパッケージの上部にある金属表面だ。熱をより広い領域へ拡散させると同時に、その下にある繊細な部品を保護する。

通常、熱はGPUダイからインターフェース材料を通り、リッドへ入り、さらに別のインターフェースを経てコールドプレートへ移動する。材料の境界が増えるごとに熱抵抗が加わり、スタック全体を通る熱移動が遅くなる。

デリッド化ではヒートスプレッダーを取り外し、冷却アセンブリが露出したパッケージにより直接接触できるようにする。経路が短くなれば、特に熱が集中するホットスポット周辺で、シリコンと冷却液の温度差を小さくできる可能性がある。

ダイ直冷却自体は新しい発想ではない。愛好家は長年にわたりプロセッサーのリッドを外してきたほか、特殊な高性能システムでは、慎重に制御された直接接触アセンブリが使われてきた。ハイパースケールの本番環境では、ほぼ同一のシステムを数千台導入・保守しなければならないため、リスクの性質が異なる。

Rubinパッケージは、高出力の演算ダイに加え、高帯域幅メモリやその他のパッケージ部品を組み合わせている。それらの高さ、熱負荷、機械的許容差は必ずしも一致しない。コールドプレートは、隣接する構造を損傷せず、意図した表面に接触しなければならない。

取り付け圧は極めて重要になる。圧力が不足すれば、熱を閉じ込める隙間が残る可能性がある。圧力が過剰なら、シリコンに亀裂を入れ、パッケージを変形させ、下部のはんだ接続を損傷するおそれがある。

材料が膨張・収縮しても、圧力は均一に保たれなければならない。GPUは低いアイドル温度とより高温の動作条件の間を繰り返し移行する。こうした熱サイクルはインターフェース材料をずらし、時間の経過とともに機械的接続へ負荷を与える可能性がある。

したがって、この冷却アセンブリには初期状態で低い温度を示すだけでは不十分だ。輸送、設置、保守、現実的な電力状態での長期サイクルを経た後も、その性能を保たなければならない。

液体への曝露も別の懸念を生む。リッド付きパッケージの上で漏れが起きても、すでに深刻だ。露出したシリコン周辺での漏れや結露は、さらに許容度が低い可能性がある。

Froreの技術的な回答は、3次元の短いループ状ジェットチャネルを中心に構成したコールドプレートだ。冷却液はプレート全体を横切る長く均一なチャネルを流れるのではなく、特定の領域を狙った小さな経路を通る。

従来のマイクロチャネル式コールドプレートでは、液体はより長い機械加工済みの流路を移動することが多い。こうした流路は摩擦と圧力損失を生み、十分な流量を維持するために必要なポンプ動力を増やす。

Froreによれば、そのアーキテクチャはプロセッサーのサーマルマップ、つまりパッケージ全体で既知となっている熱分布に向けて冷却液を導く。同社は半導体製造に近いプロセスを接合金属構造へ応用し、従来の機械加工では作りにくい内部形状を可能にしている。

同社は以前、LiquidJetが1平方センチメートル当たり600ワットに達するホットスポット密度に対応できるとしていた。また、以前の設計では、単位流量当たり50%多く熱を除去でき、圧力損失を4分の1に抑えられるとも主張した。

これらの数値は、冷却性能向上のもっともらしい仕組みを示している。より短いチャネルは流体抵抗を減らせる一方、狙いを定めたジェットは冷却面に沿って形成される温かい境界層を乱すことができる。

しかし、この仕組みだけで本番導入に関する問いは解決しない。小さなチャネルは、汚染、腐食生成物、製造時の異物、冷却液化学組成のばらつきに敏感になり得る。高度に最適化された熱構造であっても、実際の設備保守運用の中で使い続けられなければならない。

デリッド化は責任の所在も変える。通常、Nvidiaは定義された機械的許容差のもとで、完全なパッケージと冷却インターフェースを検証する。リッドを外す場合、システムビルダー、冷却サプライヤー、またはハイパースケーラーが、より大きな統合作業の負担を引き受ける必要がある。

すでにカスタムアクセラレーターやラック全体を設計している組織にとって、その移行は受け入れ可能かもしれない。標準保証、交換可能な部品、ベンダー認定の保守手順に依存する小規模事業者には、より難しい。

それでも魅力は明らかだ。追加のインターフェース層がRubinの熱抵抗の相当部分を占めるなら、それを取り除くことでコールドプレート設計者は制約となる表面へ直接アクセスできる。

したがって、10°Cという主張は技術的には理解できる。その商業的価値は、Froreとそのパートナーがダイ直冷却を特殊な改造ではなく、再現可能な製造プロセスとして提供できるかにかかっている。

Rubinは熱余裕を経済的資源へ変える

Rubinの高密度化により、温度の1度ごと、ポンプ動力の1ワットごとが、容量計画上の判断になる。

NvidiaはVera Rubinを、単なるアクセラレータカードの寄せ集めではなく、ラック規模のプラットフォームとして設計した。Vera Rubin NVL72は、72基のRubin GPU、36基のVera CPU、ネットワーキング、メモリ、電力供給、冷却を協調したシステムに統合する。

Nvidiaによると、Rubinインフラは、主要コンポーネントすべてを液冷する同社初の世代だ。これには演算チップ、ネットワーク機器、従来は一部をサーバーファンに依存していたその他のハードウェアが含まれる。

同社の液冷設計は、最大45°Cでラックに入る冷却液に対応する。より温かい設備水を使えば、適した気候ではチラーを使わない排熱が実用的になり、冷却液自体を冷やすためのエネルギーを減らせる。

より優れたコールドプレートを活用する方法は、大きく2つある。事業者は冷却液の条件を維持したまま、アクセラレーター性能の向上を目指せる。または、必要なシリコン温度を維持しながら、入口温度を上げる、あるいは流量を減らすこともできる。

前者はGPU当たりのトークン数を狙う。後者は冷却オーバーヘッドを下げることで、メガワット当たりのトークン数を狙う。電力に制約のあるデータセンターでは、電力上限やワークロード需要に応じて、いずれの成果にも価値がある。

Froreは、この柔軟性を明示的に説明している。同社のLiquidJetロードマップでは、事業者は追加の熱余裕をGPU性能の向上またはより温かい冷却液での運用へ振り向けられるとしている。

この枠組みは、冷却サプライヤーがトークン生成を見出し指標として使う理由を説明する。ハイパースケーラーがリターンを得るのは、ダイ温度が低いことだけではない。彼らが重視するのは、完了した学習処理、提供した推論リクエスト、稼働率、そして設備容量である。

Nvidiaは、自社アーキテクチャを通じて同様のシステムレベルの経済性を追求している。同社によれば、Rubinの45°C設計は適切な環境でドライクーラー運用を可能にし、エネルギー集約的なチラーを不要にする。

同社のVera Rubin architectureも、共通マニホールド、液冷電源コンポーネント、クイックディスコネクト、漏れ封じ込め機能を採用している。Nvidiaは、こうした改善により十分な電力削減が実現し、同じ電力予算内で最大10%多いNVL72ラックをサポートできると主張している。

Froreは実質的に、coldplateによってこの経済性をさらに前進させられると論じている。LiquidJetがより小さい圧力損失でより多くの熱を除去できるなら、施設はポンプに使うエネルギーを削減するか、追加の熱的ヘッドルームを計算処理に割り当てられる可能性がある。

これが主要な競争上の緊張関係だ。Nvidiaの統合冷却経路は、検証済みのラックおよびパートナーエコシステムを優先する。Froreのアプローチは、各チップに最も近い表面を最適化することで追加の効率を約束する。

両者の経路は完全に相容れないわけではない。FroreはLiquidJetを、既存のマニホールドや液冷ループと連携できるドロップインアップグレードとして説明している。ハイパースケーラーはNvidiaのより広範なラックアーキテクチャを使いながら、熱設計スタックの一部を置き換えられる可能性がある。

ただし、導入にdeliddingが必要となる場合、「ドロップイン」という表現は複雑になる。外部配管は変わらないかもしれないが、パッケージの取り扱い、組み立て、テスト、保証範囲、修理手順はいずれも変化する。

経済性の計算には、こうした運用面の影響を含めなければならない。15%のスループット向上は、特に大規模な推論フリート全体では、大きな統合作業を正当化し得る。初期ハードウェア故障率がわずかに上昇するだけでも、その価値の一部を相殺しかねない。

アップタイムはピークスループットと同じくらい重要だ。稼働時に15%多くのトークンを生成するサーバーでも、保守要件によって可用性が大幅に低下するなら、利点はほとんどない。

同じ原則は歩留まりにも当てはまる。ハイパースケーラーは、どれだけのアクセラレータが、delidding、coldplateの取り付け、システム組み立て、輸送、現場保守を損傷なく乗り切るかを把握する必要がある。

こうしたコストがこのアイデアを非現実的にするわけではない。大手クラウド事業者は日常的に、サーバー、冷却ループ、ネットワーク、カスタムシリコンを共同設計している。一般的な購入者には利用できない、管理された組立ラインや自動検査プロセスを確立できる。

Froreは、カスタムシリコン向け設計を含め、LiquidJetソリューションについてハイパースケーラーの過半数と協業していると述べている。同社は、報じられたdelidded Rubin構成について本番顧客を公表していない。

この違いは重要だ。技術協議、評価プログラム、認定サンプル、確約済みの本番導入は、それぞれ異なる導入段階を表す。

nvidia tomの報道は、業界が理論的関心から本格的な本番評価へ移行しつつあることを示唆している。公的な証拠は、なおその解釈に追いつく必要がある。

15%の向上は信頼性とベンチマークの精査を乗り越えなければならない

LiquidJetを最も強く支持するには、完成したRubinラックから得られる独立したスループット結果と長期信頼性データが必要になる。

熱設計のデモは通常、システムの有利な一部分を切り出す。coldplateが効率的に熱を除去できることは示せても、データセンター全体が同じ割合で恩恵を受けることまでは証明しない。

本番ベンチマークでは、GPUモデル、電力制限、クロック挙動、冷却液の入口温度、流量、圧力、ワークロード、ソフトウェアスタック、比較対象ハードウェアを開示する必要がある。こうした詳細がなければ、読者は報告された向上の源泉を特定できない。

チップ間のばらつきも重要だ。公称上同一のGPUでも、リーク、温度、周波数挙動は異なり得る。信頼できる比較では、冷却効果と通常のシリコンばらつきを分離できるだけの十分なデバイス数をテストする必要がある。

10°Cという結果と15%の性能主張も、実験的に結び付ける必要がある。低温化はリーク電力を減らし、より高い持続クロックを支え得るが、その関係は動作点によって変わる。

熱的限界を下回って動作するGPUでは、性能変化はほとんど見られない可能性がある。追加のヘッドルームを活用するよう構成されたGPUはより多くの電力を消費し得るため、施設効率に関する主張は複雑になる。

最も有用な指標は、完了した作業量と総エネルギーを組み合わせたものだろう。ジュール当たりのトークン数、ラック当たりのトークン数、メガワット時当たりのトークン数は、LiquidJetがデバイス周波数だけでなく経済的な出力を改善するかを明らかにする。

推論レイテンシーはスループットと並べて示されるべきだ。一部の構成は、より多くのリクエストをバッチ処理することで総トークン毎秒を増やす一方、個々のユーザーが体験する応答時間にはほとんど寄与しない。

トレーニングには別の測定上の課題がある。より低温のGPUはクロックを維持できるが、全体的なトレーニング速度はメモリ、ネットワーク、集合通信、チェックポイント、ソフトウェア効率にも左右される。

信頼性の証拠にも、同様に広い範囲が必要だ。coldplateベンダーは一般に、圧力、腐食、熱サイクル、振動、衝撃、漏れのテストを行う。deliddedの本番ハードウェアでは、機械的な位置合わせや露出したパッケージに関する懸念が加わる。

事業者は、代表的なRubinパッケージに対する加速寿命試験を求めるべきだ。また、通常の保守作業を実験室作業に変えてしまうことなく技術者が実行できる、現場交換可能な手順も必要になる。

冷却液の清浄性は長期的な試験課題となる。Froreの内部構造は、小さく精密に成形された流路に依存している。認定では、選定した冷却液、シール、チューブ、施設ループに長期間さらした後の性能を測定すべきだ。

異種金属はガルバニック腐食を引き起こし得るため、材料互換性が重要となる。生物増殖、溶存酸素、粒子、化学添加剤も、時間の経過とともに冷却性能を変化させる可能性がある。

データセンターは冷却液をろ過・監視できるが、より厳しい要件は運用の複雑さを増す。その複雑さは、ポンプエネルギーやGPU温度の低減と比較衡量しなければならない。

供給能力も不確実性を生む。Froreは、金属ウェハー上で半導体製造の概念を用いていると述べている。この手法は詳細な構造を可能にするが、ハイパースケーラーには大規模な数量にわたる一貫した生産が必要だ。

したがって、成功した認定では、多数のcoldplateにまたがる寸法ばらつきと流量バランスを測定する必要がある。例外的に優れた1つのサンプルだけでは、フリート全体の性能を確立できない。

競合各社の対応も導入を左右する。従来のcoldplateサプライヤーは、チャネル形状、界面材料、取り付けシステム、製造方法を改善できる。Nvidiaは、顧客にGPUのdeliddingを求めずに熱抵抗を低減するため、パッケージやラック設計を改訂できる。

NvidiaがOpen Compute Projectを通じてMGXラックアーキテクチャの多くを標準化するという決定は、コンポーネント革新の余地を生む。同時に、代替冷却アセンブリが満たす必要のある機械的・運用上の期待値も確立する。

Froreの優位性はカスタマイズにあるかもしれない。同社の製造方法は、各プロセッサのホットスポットマップに合わせてチャネル構造を適合させることを意図している。これは、熱分布の異なるRubin、Rubin Ultra、ハイパースケーラー設計のアクセラレータにとって価値を持ち得る。

カスタマイズはバージョン管理の作業も生む。パッケージ改訂、電力プロファイル、チップ構成によって、異なるcoldplate設計が必要になる可能性がある。事業者は、正しい冷却アセンブリが製造と保守を通じて各アクセラレータに対応していることを確認しなければならない。

delidded GPUへの関心が報じられていることは、一部のハイパースケーラーが、見込まれるフリートレベルのリターンが十分に大きい場合、この複雑さを受け入れていることを示唆する。それは、この慣行が標準化したことを意味しない。

Nvidiaのサポートの正確な条件が決定的となる。事業者は、保証範囲、承認された組み立てパートナー、許容される取り付け方法、テレメトリー、交換手順について明確さを求めるだろう。

こうした問いに公的な回答が得られるまで、15%という数値は、確実に見込めるフリート改善ではなく、有望なテスト結果として扱うべきだ。

この慎重な見方はLiquidJetを否定するものではない。優れた熱比較から本番インフラへ技術を移行させるために必要な証拠を特定するものだ。

LiquidJetが本番導入に到達するかを示す3つのシグナル

顧客が裏付けたベンチマーク、Nvidiaの認定、ラックスケールの信頼性結果が、この冷却性能の向上が導入可能な容量になるかを決定する。

最初のシグナルは、特定されたハイパースケーラー、サーバーメーカー、または独立試験機関によるベンチマークだ。実際のRubinハードウェア上で、LiquidJetと開示された基準coldplateを比較するべきである。

そのテストでは、冷却液の条件、電力設定、持続周波数、ワークロードのスループット、総冷却エネルギーを報告すべきだ。また、lidded構成とdelidded構成を分けて示す必要がある。

報告された10°Cおよび15%の結果に近い独立した確認が得られれば、Froreの主張は大幅に強まる。より小さな向上でも設計を無効にするわけではないが、統合の経済性は変化する。

2つ目のシグナルは、正式なプラットフォームサポートだ。Nvidia、既存のMGXメーカー、または大手サーバーベンダーが、関連するcoldplateと組み立てプロセスを認定する必要がある。

認定は、direct-die coolingが定められた製造公差とサポート手順に収まることを示す。また、deliddingが出荷前、システムインテグレーター段階、あるいは別の管理された取り決めの下で行われるのかも明確にする。

Nvidiaはすでに、液冷をVera Rubin systemsの中心に据えている。この取り組みは熱設計の革新にとって対応可能な市場を生むが、すべての冷却設計を自動的に有効化するものではない。

承認されたLiquidJetオプションは、coldplateがRubinエコシステム内で選択可能な性能コンポーネントになり得るという主張を強める。沈黙が続けば、導入はより大きな統合責任を伴うカスタムプログラムに限定され続けるだろう。

3つ目のシグナルは、完成したラックからの耐久性の証拠だ。購入者には、長期運用における故障率、熱性能のドリフト、漏れ性能、冷却液保守要件、保守結果が必要となる。

この証拠は、もう1つの短期デモより重要だ。AIインフラは継続的に稼働し、わずかな信頼性の差でも数千のアクセラレータ全体では増幅される。

有用な導入レポートでは、標準的なRubin冷却と比較したアップタイムと保守を示すべきだ。また、繰り返しの電源サイクル後も、初期の熱的利点が安定して維持されるかを示す必要がある。

読者がdelidded Rubin GPUを通常の本番慣行として扱う前に、これらのシグナルが現れるべきだ。ハイパースケーラーはしばしば複数のエンジニアリング経路を並行して評価し、多くは認定段階を超えて進まない。

より広いトレンドはすでに定まっている。冷却はAIデータセンターにおける性能と容量の方程式に組み込まれた。Rubinの完全液冷アーキテクチャは、この関係を明示している。

なお定まっていないのは、パッケージ周辺の最後の熱的障壁を取り除くために、事業者がどれだけのリスクを受け入れるかだ。Froreは、同社のターゲット型チャネルとdirect-dieアプローチが、より積極的な設計を正当化すると考えている。

nvidia tomの主張は、この論点に具体的な数値を与えている。温度は10°C低く、性能は15%高い。これらの数値は注目を集めるに十分大きいが、フリートの購入判断を導くにはまだ十分に文書化されていない。

インフラチームは今、より低温なデモチャートではなく、ワークロードレベルの証拠を求めるべきだ。ピークスループットと並行して、総エネルギー、アップタイム、保守性、ハードウェア歩留まりを比較すべきである。

開発者やAIプロダクトチームにとって、その影響はさらに下流に現れる。より優れた冷却は、利用可能な推論容量の増加、より安定したレイテンシー、生成トークン当たりのインフラコスト低下を意味し得る。

これらの利点が現実のものとなるのは、冷却システムが量産段階を乗り越えた場合に限られる。注目すべきは、実名の顧客、要件を満たしたRubin構成、そして長期間にわたるラックデータだ。この3つのシグナルを総合すれば、LiquidJetが有望な実験にとどまるのか、それともAI向け熱設計における次の一歩となるのかが明らかになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page