top of page

OpenAIのCXLによるHBM代替への疑念が浮き彫りにするAIメモリの真のトレードオフ

58 分前
読了時間: 20分

OpenAIは、高帯域幅メモリのコストと希少性を抑えようとする圧力が高まるなかでも、CXLでHBMを代替できるという見解を退けたと報じられている。OpenAIのアクセラレータ研究者は、AIモデルを実行するための説得力あるCXLのユースケースを見いだせていないと述べた。Intelのアーキテクチャ担当幹部も別途、CXLはHBMの代替ではなく、ストレージの補完としてより適していると主張した。

これらの発言は、AIインフラの購入者にとって魅力的な考え方に疑問を投げかける。Compute Express Link、すなわちCXLは、プロセッサがコヒーレントなインターコネクトを通じて追加メモリにアクセスすることを可能にする。より大きな容量、共有プール、より柔軟なリソース配分を約束する。しかし、柔軟性があっても、稼働中のモデル実行に求められる帯域幅はなくならない。

より本質的な点は、CXLが失敗したということではない。CXLとHBMは、メモリ問題の異なる部分を解決するということだ。HBMは、頻繁にアクセスされるデータを非常に高い帯域幅でアクセラレータの近くに置く。CXLは容量を拡張し、アクセス頻度の低いデータをより安価な階層へ移せる。

この違いは、メモリ供給業者、アクセラレータ設計者、クラウド事業者に対し、より賢い階層構造を構築するよう促している。したがって中心的な競争は、代替可能な製品としてのCXL対HBMではない。代替の経済性と、高価なAIプロセッサを稼働させ続けるのに十分な速度でデータを移動させるという物理的要件との対立である。

OpenAIのCXLによるHBM代替論は帯域幅の試練に直面

報じられたOpenAIとIntelの発言は、技術を無関係にすることなくCXLの役割を限定している。

これらの発言は、2026年9月16日にカリフォルニア州サンタクララで開催されたAI Infrastructure Summitのパネルで出された。Financial Newsによると、アクセラレータ設計に携わるOpenAIの研究者Daniel Morrisは、実際のモデル実行におけるCXLの有用性に疑問を呈した。

「実際にAIモデルを実行するという観点から、CXLの用途を見つけられない」とMorrisは述べたと報じられている。彼が挙げた可能性のある役割は、大規模モデルがほとんどアクセスしない非アクティブな情報を保持することだった。

Intelのシステムオンチップ・アーキテクチャ責任者であるVidhya Thyagarajanも、同様の区別を示したと報じられている。CXLを通じたメモリプーリングは有用になり得るが、HBMを置き換えるものではないと彼女は述べた。CXLを二次ストレージの補完として位置付けた。

報じられたIntelの見解で最も重要なのは、データ移動に関する部分だった。GPUとCXL接続メモリの間を移動する情報は、HBMほど高速では「決してない」と、翻訳されたパネル報道は伝えている。

これらの発言については慎重な帰属が必要だ。これは正式なOpenAIまたはIntelの方針声明として公表されたものではなく、韓国メディアが報じ、TrendForceが要約した内容である。入手可能な英語版Financial Newsの記事も、AI支援による翻訳であることを明記している。

両社とも、この発言に付随するベンチマークを公開していない。OpenAIも、CXLに有用なモデル実行ワークロードがないことを証明する技術論文を公表していない。Intelもまた、より広範なCXLエコシステムの主要な参加者であり続けている。

それでも発言が重要なのは、アクセラレータとシステムアーキテクチャを担う専門家から出たものだからだ。両者の区別は基本的な制約を反映している。容量と帯域幅は関連しているが、互いの代替にはならない。

HBMは、広いインターフェースを用いて積層DRAMをプロセッサの近くに配置する。その設計は、高並列アクセラレータが必要とする持続的なデータ移動を支える。CXLはPCI Express技術に基づくリンクでメモリとデバイスを接続し、コヒーレントなアクセスとコンポーザビリティを優先する。

CXLは、より大きなメモリプールをプロセッサから見えるようにできる。しかし、そのプール内のすべてのバイトを自動的にローカルHBMのように動作させることはできない。距離、リンク幅、スイッチング、プロトコルのオーバーヘッド、競合が、依然として実効性能を左右する。

これが、報じられた発言によって生まれる緊張関係だ。業界は高価なHBMからの解放を望んでいるが、その需要を生むワークロードは依然としてメモリスループットに敏感である。

したがって、CXLによるHBM代替論は、不均等なメモリ位置から同等の性能が得られると仮定する時点で成り立たない。より信頼できる議論は、どのデータを近くに維持すべきか、どのデータをより遠くに移せるかを決めることから始まる。

AIアクセラレータが依然としてHBMに依存する理由

AIプロセッサには大規模な作業データセットへの高速かつ反復的なアクセスが必要なため、HBMの代替は依然として難しい。

現代のアクセラレータは、多数の数学演算を並列に実行する。これらの演算ユニットには、モデルの重み、活性化値、その他の中間データを安定的に供給する必要がある。メモリが十分な速さで情報を届けられなければ、プロセッサの一部は計算せず待機することになる。

この状態は一般にメモリ帯域幅の圧力と呼ばれる。演算ユニットを増やしても解決にはならない。システムは、それらのユニットを稼働状態に保つのに十分な実用帯域幅を提供しなければならない。

トレーニングでは、特に厳しいメモリトラフィックが発生する。大規模なアクセラレータ群が、パラメータと中間結果を繰り返し交換する。HBMは物理的に近く、広いインターフェースを備えるため、この持続的な移動に適している。

推論ではパターンが異なるものの、帯域幅が無関係になったわけではない。デプロイされたモデルも、依然として重みにアクセスする必要がある。各トークンの生成には、とりわけ小規模なリクエストバッチを処理する場合、大量のモデルデータの読み出しが必要になる可能性がある。

長いコンテキストを扱うワークロードやエージェント型ワークロードは、別のメモリ問題を生む。これらは、それまでのトークンのアテンション情報を保持するキー・バリュー・キャッシュを蓄積する。このキャッシュは、アクセラレータのそばで利用可能な容量を圧迫するほど大きくなり得る。

CXLは、帯域幅の要件よりも、この容量圧力に自然に対応できる。追加メモリを公開し、ホストやデバイス間での共有を支援できる。しかし、活発に使用されるキャッシュをより狭いリンク越しに移動すると、新たなボトルネックが生じる可能性がある。

公式のCXL概要では、3つの関連プロトコルが説明されている。CXL.ioはデバイスの検出と管理を扱う。CXL.cacheはプロセッサメモリへのコヒーレントなアクセスを支える。CXL.memは、ホストがCXLデバイスに接続されたメモリへアクセスできるようにする。

これらの機能は、メモリの拡張、プーリング、共有を支える。一方のサーバーではメモリが不足し、別のサーバーには未使用リソースがあるという、遊休容量を削減できる。また、変化するワークロード要件に応じてインフラを構成する助けにもなる。

この運用上の柔軟性には価値がある。しかし、それはHBMとは異なる問いに答えるものだ。CXLが問うのは、より多くのメモリをどのようにアクセス可能にするかである。HBMが問うのは、毎秒十分な量のデータをプロセッサへ到達させる方法である。

CXL 4.0はこの答えを改善する。この仕様は信号速度を毎秒64ギガトランスファーから128ギガトランスファーへ倍増させ、バンドルポートを導入する。バンドリングにより、デバイスポートを組み合わせて接続帯域幅を増やせる。

CXL Consortiumは、新しい標準が信号速度を高めながらプロトコル遅延を追加しないとも述べている。この主張は、リモートCXLメモリがアクセラレータの隣にあるHBMと同一のエンドツーエンド特性を持つことを意味しない。

実際の性能には、メモリデバイス、コントローラ、スイッチ、トポロジー、ソフトウェアによる配置、ワークロードのアクセスパターンが含まれる。より高速な標準はリンクを改善できるが、システム内のあらゆる差異をなくすわけではない。

したがって、CXL 4.0仕様はある批判を弱めるが、アーキテクチャ上の違いを消し去るものではない。CXLの帯域幅は改善している一方、HBMは依然として最高性能の階層を占めている。

これが、報じられたOpenAIの懐疑論が重要である理由だ。OpenAIは、アクセラレータの利用率がサービス容量と運用効率に直接影響するワークロード向けのインフラを設計している。先進プロセッサがアイドル状態になると、データ移動の遅さは高コスト化する。

報じられたIntelの見解には別の意味がある。IntelはCXLの確立を支援し、現在もこの標準に関する製品とデモンストレーションを支えている。そのため、Intelのアーキテクトによる限定的な評価は、CXLそのものの否定ではない。

むしろそれは、CXLの主要な支援者でさえ代替という物語には限界があると見ていることを示唆する。Intelは、ローカルの高帯域幅メモリが別の機能を担うことを認識しながら、CXLメモリを支持できる。

真の競争は代替ではなく階層化にある

CXLは、低速なHBMとしてではなく、もう一つのメモリ階層として扱うときに、より説得力を持つ。

階層型アーキテクチャは、アクセス頻度と性能要件に応じてデータを配置する。頻繁に使う情報は高速で希少なメモリに置かれる。活動度の低い情報は、より大容量で安価な領域へ移される。

プロセッサは数十年にわたり、この原則に依存してきた。レジスタ、キャッシュ、主記憶、ストレージは、速度と容量のバランスを取る。AIシステムは現在、この階層をアクセラレータ、ホストメモリ、共有メモリ、フラッシュストレージにまたがって拡張している。

代替という物語は、これらの階層を誤解を招く比較へと圧縮してしまう。AIサーバーからCXLがHBMを取り除けるかを問う。より有用な問いは、ワークロードの各段階でどのデータをHBMに残す必要があるかを問うものだ。

OpenAIの報じられた立場は、コールドデータの保管余地を残している。モデルがほとんど必要としない情報は、常に希少なHBMに置くことを正当化するとは限らない。CXLなら、その情報をソリッドステートストレージに置かずにアクセス可能な状態に保てる可能性がある。

課題は予測にある。アクセラレータが要求する前に、どの情報がアクティブになるかをシステムが把握しなければならない。転送が遅れれば生成は停止し、より安価な階層を使う経済的メリットは失われる。

ここで、ワークロードを認識するソフトウェアが中心的な役割を担う。データ配置、プリフェッチ、キャッシュの退避、スケジューリングが、CXLが有用な容量を拡張するのか、単に遅延を加えるだけなのかを決める。

SK hynixの研究者は、2026年6月に具体的な試みを発表した。Inference Tiered Memory Expansionアーキテクチャは、CXLハイブリッドメモリをホストメモリとフラッシュストレージの間に配置する。

この設計は、長いコンテキストを扱う推論のための共有コンテキスト基盤を対象とする。量産グレードのCXLメモリモジュール、PCIe Gen5ソリッドステートドライブ、FPGAプロトタイプを使用する。研究者らは、予測可能なアクセスパターンを持つモデルの重みとプレフィックスキャッシュに焦点を当てた。

このITME研究では、従来のCPUオフロードと比べて最大35.7%のスループット向上が報告された。このシステムはCXLメモリをバイトアドレス可能な中間層として使い、ストレージから情報を先回りして移動させた。

この結果は、報じられたOpenAIのCXLによるHBM代替への疑念と矛盾しない。ITMEは、CXLをローカルHBMのドロップイン代替として提示していない。より高速なメモリとより低速なストレージの間に、CXLの明確な役割を割り当てている。

この実験は、ホストメモリの限界を超える容量も対象としている。その価値は、より低速なストレージへのアクセスを避け、リモート拡張を単純化することにあり、すべてのモデル操作でHBMの帯域幅に匹敵することではない。

この違いは、ベンダーの主張を解釈するうえで重要だ。ベンチマークは、SSDベースのベースラインと比較してCXLがシステムを改善することを示せる。しかし、それは必ずしもCXLがHBMのみの構成に匹敵することを示すわけではない。

CXLは、比較が意図された階層を反映している場合に測定可能な向上をもたらし得る。MicronのCXLモジュールとIntel Xeon 6プロセッサを使用した研究者らは、2024年に別の例を報告した。

その構成は、8台のCXLデバイスと12本のDDR5チャネルを組み合わせた。ソフトウェアは、2種類のメモリにまたがってページをインターリーブした。研究者らは、読み取り専用帯域幅が24%向上し、読み取りと書き込みを混在させた帯域幅が最大39%向上したと報告した。

テストされた高性能コンピューティングおよびAIワークロード全体で、幾何平均の性能向上は24%だった。繰り返しになるが、この結果はCXLをCPUメモリシステムへの追加要素として測定したものであり、GPU向けHBMの代替として測定したものではない。

これらの研究は、より限定的ながら実用的なCXLの価値提案を裏付けている。CXLは容量を拡張し、CPUメモリの総帯域幅を向上させ、低速なストレージへの依存を減らすことができる。また、アクセスパターンがプリフェッチを許容する場合には、共有コンテキスト層も支援できる。

これらの利点はいずれも、CXLがHBMに勝ることを必要としない。必要なのは、システムアーキテクトがレイテンシと帯域幅が許容範囲に収まる場所へCXLを配置することだ。

SamsungとSK Hynixは両方向から圧力を受ける

メモリサプライヤーはHBMの利益率を守りつつ、CXL製品が主力メモリと並んで価値を生むことを示さなければならない。

Samsung ElectronicsとSK hynixは、HBMサプライチェーンで強固な地位を占めている。アクセラレータ需要の継続は、両社により大容量かつ高速なHBM世代へ投資する理由を与えている。

報じられたOpenAIとIntelの発言は、その市場を後押しするものだ。CXLがアクティブなモデルメモリを担えないなら、アクセラレータベンダーは性能が重要なデータのために引き続きHBMへ依存することになる。

しかし、HBMの役割が安定しているからといって、市場が静的になるわけではない。AI推論は、より多様なメモリシステムへの需要を生み出している。容量、レイテンシ、消費電力、帯域幅、コストは、トレーニング、対話型推論、バッチ処理、コンテキスト保存で異なる。

そのためSamsungとSK hynixには、複数の階層で製品を販売する動機がある。アクセラレータの近傍にHBMを供給しながら、拡張と共有のためのCXLメモリモジュールを開発できる。

この戦略は、インフラ投資の方向が変わった場合にも両社を守る。低コストを求める顧客は、システム当たりのHBMを減らすかもしれないが、HBMを完全になくすわけではない。メモリベンダーは、CXL接続DRAMや他の階層を通じて引き続き市場に参加できる。

ITMEの研究は、この可能性を示している。SK hynixはCXLハイブリッドメモリをHBMの直接的な代替として位置付けなかった。そのアーキテクチャは、HBM、DDR、CXLメモリ、SSDからなる階層に新たな層を組み込んだ。

このアプローチは、見かけ上の競争をポートフォリオの拡張へと変える。階層が増えれば配置判断も増えるが、追加の製品やソフトウェア要件も生まれる。

クラウドプロバイダーも関連する圧力に直面している。HBMを豊富に搭載したアクセラレータは、顧客が効率的に利用して初めて価値を発揮する。予約済み容量、アイドル状態のメモリ、過大な構成は、推論の実効コストを押し上げかねない。

CXLプーリングは、一部のメモリをより柔軟に割り当てる方法となり得る。ワークロードごとにピークが異なる場合、共有プールは遊休化した容量を減らせる。効果はトポロジー、分離、ソフトウェア対応、予測可能なサービス品質に左右される。

アクセラレータ設計者は最も難しいトレードオフに直面する。各チップにどれだけのローカルメモリをパッケージングするかを決めなければならない。メモリが少なすぎればモデルとコンテキストを制約し、多すぎればパッケージの複雑性を高め、ワークロードが使わない場合でも希少な容量を割り当ててしまう。

信頼性の高い階層型設計により、アクセラレータメーカーはアクティブなデータにはHBMを割り当て、より低温の情報を別の場所へ移すことが可能になる。ただし、ハードウェアには十分なリンク帯域幅が必要であり、ソフトウェアはデータが緊急に必要になる前に移動させなければならない。

Nvidia、AMD、Google、Intel、およびカスタムアクセラレータチームはいずれも、ローカルメモリ、ネットワーキング、スケールアウトシステムの間で異なるバランスを模索している。各社のアーキテクチャを容量だけで比較すべきではない。

総メモリ容量が多いサーバーでも、アプリケーション性能は低い場合がある。実効スループットは、プロセッサが各階層へアクセスする頻度と、転送が有用な計算と重複するかどうかに左右される。

これが、CXLの導入が単一の普遍的な結果をもたらさない理由だ。データベースのワークロード、CPUベースの分析、モデルサービング、トレーニング、検索システムではアクセスパターンが異なる。あるワークロードに最適な階層構造が、別のワークロードには害となる可能性がある。

したがってCXLのより広範な成功は、劇的なHBM代替比率がなくても実現し得る。導入は、メモリ拡張モジュール、コンポーザブルサーバー、コンテキストストア、ストレージトラフィックを抑えたインフラという形で現れるかもしれない。

その結果は、HBMの直接的な競合製品を期待する人々を失望させるだろう。それでも、AIサーバーによるメモリ割り当てのあり方における重要な変化を意味する。

報じられた判断には重要な限界がある

標準、製品、AIワークロードはいまも変化しているため、パネルでの2つのコメントだけでCXLの将来を決めることはできない。

第1の制約は証拠に関するものだ。最も強い発言は、カンファレンスのパネルについてのメディア報道に由来する。引用された報道では、録画、議事録、ベンチマークパッケージ、または対応するOpenAIの公開資料は利用できなかった。

読者は、これらのコメントをOpenAIのすべてのワークロードがCXLを拒絶している証拠と解釈すべきではない。Morrisはモデル実行で実用的な用途を見いだすことが難しいと述べたと報じられているが、その評価の範囲は依然として不明確である。

この発言は、現在のアクセラレータ設計、現在のソフトウェア、または特定のモデル群を指している可能性がある。コンテキスト保存、前処理、検索、チェックポイント、将来の分散型システムまで含むとは限らない。

Intelの立場にも文脈が必要だ。同社はCXLの開発を支援し、Xeonプロセッサ向けのメモリモードを実演している。報じられた批判はHBMの代替に関するものであり、コヒーレントなメモリ拡張の有用性に向けられたものではない。

第2の制約は技術進歩に関するものだ。CXL 4.0は標準のシグナリングレートを2倍にし、バンドルポートをサポートする。これらの機能を実装する製品は、実際のワークロードでなお検証を必要とする。

仕様上の帯域幅は、アプリケーションの帯域幅ではない。エンジニアは、実現されるスループット、レイテンシ分布、競合、消費電力、障害時の性能を測定しなければならない。

第3の制約はソフトウェアに関わる。メモリ階層化が有効に機能するのは、システムがデータを賢く配置する場合に限られる。方針が不適切なら、ホットデータを低速な階層へ移動させたり、使われない情報の転送に帯域幅を浪費したりする可能性がある。

長いコンテキストでの推論は、場合によってはこの問題をより扱いやすくする可能性がある。プレフィックスキャッシュとモデル重みは、予測可能なアクセスパターンを持ち得る。その予測可能性は、プリフェッチと再利用の機会を生む。

他のワークロードは依然として寛容ではない。不規則なアクセス、急速に変化するリクエスト、厳しいレイテンシ要件は、リモートメモリの利用を難しくし得る。平均スループットは、深刻なテールレイテンシの問題を隠すこともある。

第4の制約は、各主張で選ばれるベースラインにある。CXLはHBMではなく、ホストDDRやSSDアクセスと競合することが多い。ストレージに対する好結果は、アクセラレータローカルメモリとの同等性を証明するものではない。

逆の誤りもあり得る。CXLがHBMに匹敵できないことを示しても、経済的価値がないことの証明にはならない。低い階層に必要なのは、その階層で利用可能な代替手段を上回ることだけだ。

したがって有用な評価では、データ、ワークロード、ベースラインを定義しなければならない。どの情報がHBMに置かれ、どの情報がCXLを通じて移動し、転送がどの程度の頻度で計算を遅らせるかを特定すべきだ。

消費電力にも同様の精査が必要である。システム全体でデータを移動させるとエネルギーを消費する。より大きなメモリプールは高コストなストレージ操作を減らせるが、スイッチングと転送にもコストがかかる。

メモリが共有される場合、信頼性と分離は重要になる。運用者には、予測可能な障害処理、アクセス制御、暗号化、可観測性、サービス保証が必要だ。こうした運用要件は、ハードウェアが利用可能になった後も導入を遅らせる可能性がある。

CXL Consortiumは、バージョン4.0における信頼性、可用性、保守性の改善を説明している。これらの機能はインフラとしての根拠を強化するが、仕様上の文言よりも本番環境での証拠のほうが重要である。

したがって正しい結論は、見出しの主張よりも限定的だ。入手可能な証拠は、CXLがHBMを直接代替することへの懐疑を支持している。しかし、CXLがAIインフラに無関係だと宣言する根拠にはならない。

次にCXLの位置付けを示す3つのシグナル

次の段階を決めるのは、本番環境での測定、アクセラレータ統合、そして階層化が推論の総コストを下げることを示す証拠だ。

第1のシグナルは、ハイパースケーラーとモデル開発者による導入の証拠である。OpenAI、Microsoft、Google、Meta、Amazon、その他の事業者は、大半の研究者には利用できない規模でメモリアーキテクチャをテストできる。

重要な開示では、容量増加とアプリケーション性能を区別する必要がある。有用な結果は、モデルのスループット、レイテンシ、アクセラレータ利用率、CXLメモリへアクセスするリクエストの割合を報告すべきだ。

共有コンテキストやコールドな重みに関する本番導入は、階層化の論拠を強めるだろう。ストレージに近い役割から前進できなければ、報じられたOpenAIの評価を補強することになる。

第2のシグナルは、CXL 4.0の帯域幅とバンドルポートを実装するハードウェアだ。コンソーシアムは2025年11月にCXL 4.0をリリースしたが、仕様は広く利用可能なプラットフォームに先行する。

今後のシステムは、どれだけのリンク帯域幅がアプリケーションに到達するかを実証しなければならない。ベンダーは、スイッチングとマルチデバイス構成が負荷時にも予測可能なレイテンシを維持することを示す必要がある。

強い結果は、CXLがコールドストレージに限定されるという見方を弱めるだろう。ただし、同じ期間にHBMも進化するため、それだけでHBMの代替を確立するわけではない。

第3のシグナルは、ITMEのようなアーキテクチャに対する独立した検証だ。報じられた35.7%のスループット改善は有望だが、特定のプロトタイプとベースラインに基づくものである。

独立したチームは、異なるモデル、コンテキスト長、リクエストパターン、ストレージ構成をテストすべきだ。また、テールレイテンシ、エネルギー、ソフトウェアのオーバーヘッド、復旧時の挙動も測定すべきである。

再現された改善は、CXLが推論にとって有用な中間層を占めることを示すだろう。予測可能なワークロード以外で結果が振るわなければ、そのアーキテクチャは特殊な導入に限られることになる。

これらのシグナルは、誰が最も大きな圧力に直面するかも明らかにする。ローカル帯域幅が不可欠であり続けるなら、HBMサプライヤーが直ちに代替されるリスクは低い。それでも、推論が生み出すあらゆる層に向けた製品を必要とする。

CXLベンダーは、容量が性能を保証するかのような売り方をやめなければならない。最も強い根拠は、測定可能なアクセスパターンに従ってデータを配置する完全なシステムから生まれる。

AIインフラの購入者は、各モデルフェーズでデータがどこに存在するかを問うべきだ。また、本来はコールドであるはずのオブジェクトが突然ホットになったときに何が起きるかも問うべきである。

OpenAI、CXL、HBM代替をめぐる議論は、最終的に有益な修正を浮き彫りにしている。メモリアーキテクチャは、あるコンポーネントが他のすべてを排除する競争ではない。距離、帯域幅、容量、ソフトウェアによって形作られる割り当ての問題である。

これらの主張を評価するチームは、ベンチマークの詳細、ワークロードの前提、アーキテクチャの意思決定を検索可能なエンジニアリングナレッジベースに保存すべきだ。次のベンダーによる実演は、単純化された代替のスローガンではなく、そうした前提と比較すべきである。

最初の独立したCXL 4.0導入、本番環境のコンテキストメモリシステム、ワークロードレベルのコストデータを注視してほしい。これらの結果が、CXLが不可欠なAIメモリ階層となるのか、それとも特殊な拡張経路にとどまるのかを明らかにする。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page