PanmnesiaとMetaのCXLアーキテクチャ、AIコンピューティングをラックの枠を超えて拡張
PanmnesiaとMetaは、単一のコヒーレントなコンピューティングドメイン内で最大960基のAIアクセラレータを接続できるCXLアーキテクチャを提案した。この設計は、密結合型ラックシステムと従来のデータセンターネットワークの境界に挑むものだ。ただし、重要な留保がある。これは選定されたシリコン部品に裏付けられたアーキテクチャ提案であり、960基のアクセラレータを実運用配備したものではない。
PanmnesiaとMetaのCXLアーキテクチャは、2026年8月10日にNature Reviews Electrical Engineeringで公開されたReview Articleに掲載されている。CPU、アクセラレータ、メモリを、1つの大規模プロセッサ内の部品に近い形で動作させることを目指す。Compute Express Link、すなわちCXLは、共有メモリアクセスとハードウェア管理のキャッシュコヒーレンスをサポートするオープンインターコネクトだ。
この目標により、CXLはNVLink、Ethernet、InfiniBandを含む既存のスケールアップ接続やスケールアウトネットワークと並ぶ位置付けとなる。これらの技術は、分散コンピューティングの異なる部分を担う。論文は、CXLによって予測可能でメモリに近い通信をAIデータセンター全体へさらに広げられると主張している。
この提案が重要なのは、大規模なAIジョブが参加デバイスのうち最も遅いものを待つことが多いためだ。アクセラレータを追加すれば理論上の処理能力は増えるが、同時に通信経路も増え、遅延が生じる機会も増す。したがって本質的な競争は、CXLと特定ベンダーの比較ではない。密に同期するAIワークロードにおける、ハードウェア管理コヒーレンスとソフトウェア協調型ネットワーキングの比較である。
Panmnesia Meta CXL Architectureが実際に提案していること
この提案は、CXLをサーバーのメモリ拡張からAIシステム向けのラック間スケールアップファブリックへと広げる。
査読済みのCXL architecture reviewは、データセンター設計における「one-chip-like」アプローチを説明している。この表現は、すべてのサーバーが物理的に融合されることを意味しない。離れたリソースが、大規模コンピューティングパッケージ内部に似た通信規則とメモリ規則に従うことを意味する。
現在のAIシステムには通常、複数の通信層がある。単一のサーバーやラック内のアクセラレータは、専用の高帯域幅リンクを利用できる。ラック間を移動するトラフィックは一般にEthernetまたはInfiniBandネットワークを通る。その通信の調整には、ソフトウェア、ネットワークインターフェース、プロトコルスタック、データコピーが関与する。
これらの層は、ルーティングの柔軟性と障害分離をもたらす。しかし、その一方でタイミングの予測可能性は低下する。リクエストは異なるキュー深度、ソフトウェア処理、輻輳、経路長に直面しうる。大規模な同期ジョブでは、参加するアクセラレータが集団通信や同期ポイントで足並みをそろえることが多いため、こうした差が表面化する。
レビューは、より高速な処理と低速な処理の間の差であるレイテンシのばらつきを、中心的な制約として挙げている。平均レイテンシも依然として重要だが、低い平均値は重大な外れ値を隠しかねない。1つの参加者が遅れるだけで、ほかの数百基のアクセラレータが待機状態に置かれる可能性がある。
PanmnesiaとMetaは、トレイ、ポッド、ファブリックレベルのリソースから成る構造化された階層全体へ、コヒーレントドメインを拡張することを提案している。キャッシュコヒーレンスは、共有データのコピーをプロセッサやデバイス間で一貫した状態に保つ仕組みだ。ハードウェア管理のコヒーレンスにより、アプリケーションがネットワークソフトウェアを通じてあらゆるデータ移動を調整する必要性を減らせる。
提案アーキテクチャは、3つの中核ハードウェア要素に依存する。高ファンアウトのノンブロッキングスイッチは、内部競合を抑えつつ多数のリソースを接続する。リンクアクセラレーションユニットは、デバイス側の通信機能を処理する。ファブリックコントローラは、より大きなドメイン全体でリソースを設定・管理する。
この階層は、固定または規則的なホップ数の維持を目指している。ホップとは、データが中間接続またはスイッチを通過するたびに発生する単位だ。リソースが異なる物理的な場所に配置されていても、経路を一貫させることでレイテンシのばらつきを狭められる可能性がある。
これは、1台のサーバーに追加メモリを接続する以上に野心的な構想だ。公開された設計では、CPU、アクセラレータ、メモリデバイスを組み合わせ可能な構成要素として扱う。ワークロードは、リモートの各コンポーネントを独立したネットワーク宛先として扱う代わりに、共有アドレス構造を通じてこれらのリソースにアクセスできる。
著者らは、1つのコヒーレンスドメインに最大960基のアクセラレータを配置する構成を説明している。この数字は、より大きなファブリック上でアクセラレータをグループ化する論文中のアーキテクチャ配置に基づくものだ。独立したベンチマークで検証済みの実運用クラスターと解釈すべきではない。
この区別こそが、本件の中心的な緊張関係を定義する。提案システムはラック間コヒーレンスの設計図を提示する一方、公開されている証拠が検証しているのはその設計図の一部に限られる。Natureでの掲載はアーキテクチャの研究上の意義を裏付けるが、商用導入の準備完了を認証するものではない。
AIインフラに高速なアクセラレータ以上のものが必要な理由
課題は演算性能の不足だけではなく、同期通信、メモリ容量、予測不能な停止にある。
AIインフラの供給企業は長年にわたり、アクセラレータのスループットを高めてきた。しかし、より大規模なモデルは作業をより多くのデバイスに分散するため、通信が総実行時間に占める比率は増している。各アクセラレータは、パラメータ、アクティベーション、勾配、ルーティング情報をほかのコンポーネントと交換しなければならない。
同期型の学習ジョブは、多くの場合、参加するすべてのデバイスが1つのステージを終えて初めて先へ進める。次の計算が遅延したピアからのデータに依存する場合、高速なデバイスだけが先行することはできない。システムが大きくなるほど、低速な経路に遭遇する確率も高まる。
Natureのレビューによると、AIモデルのパラメータ数は5年間で100万倍に増加した。この比較は論文の動機を示すものだが、モデル規模だけでインフラ要件が決まるわけではない。アーキテクチャ、スパース性、精度、ワークロード設計も、モデルが必要とする計算資源とメモリ量に影響する。
推論もまた別の圧力点となる。大規模なレコメンデーションシステムや言語システムでは、メモリ集約型サービスが多数のサーバーに分散される場合がある。ネットワーク型システムでもこの処理は可能だが、明示的なデータ転送、ソフトウェアによる調整、リソースの複製を必要とすることが多い。
CXLは、計算とリモートメモリの間のインターフェースを変える。すべてのリモートリソースをネットワークエンドポイントとして提示するのではなく、ロードおよびストア操作を通じてメモリを公開できる。そのため、プロセッサはメモリ指向のセマンティクスを用いて、接続済みまたはプールされた容量をアドレス指定できる。
CXL specificationsは、利用可能な設計空間を段階的に広げてきた。初期バージョンは、ホストとデバイス間のコヒーレントな接続に焦点を当てていた。後続のバージョンでは、スイッチング、メモリプーリング、デバイス間の直接通信、より広範なファブリック機能が追加された。
この進化が、PanmnesiaとMetaが今この提案を行う理由を説明している。CXLはポイントツーポイントのサーバー接続モデルを超えた段階に進んだ。新しいファブリック機能はより複雑なトポロジーを支えるが、標準準拠だけで予測可能なデータセンター性能が実現するわけではない。
Metaはすでに、より限定的な実運用用途を検討している。同社のVistaraメモリエクスパンダチップは、回収したDDR4メモリをCXL経由で新しいサーバーに接続する。このデバイスは、追加容量を別個のNUMAノード、すなわち異なるアクセス特性を持つメモリ領域として提示する。
この実装は、データセンター全体のコヒーレンスではなく、容量とハードウェア再利用に対応するものだ。それでも、ハイパースケーラーがCXLに注目する理由を示している。ある世代のサーバーハードウェアに接続されていたメモリが、ホストプラットフォームの変更時に無用になる必要はない。
報道によれば、MetaはMemServer設計でローカルDDR5メモリと、より低速なCXL接続DDR4を組み合わせている。Linuxは頻繁に使われるページをローカルメモリに保持し、アクセス頻度の低いページを拡張階層へ移動できる。この構成は、低速なメモリへの頻繁なアクセスが性能を低下させうるため、ワークロードの挙動に左右される。
Panmnesiaは、2026年6月のInternational Symposium on Computer Architectureで別の結果を報告した。同社のISCA deployment summaryによると、MetaはCXLメモリによって分散AI推論に必要なサーバー数を最大25パーセント削減した。
同じ企業リリースによれば、Metaは分散キャッシュの平均応答時間を約29パーセント短縮した。これらの結果は、特定の実運用サービスおよび構成に関するものだ。レビューで示されたラック間アーキテクチャ全体を検証するものではない。
それでも、これらの数値は大きな提案を具体的な経済課題へと結び付ける。十分に活用されていないメモリは計算能力を遊休化させうる一方、メモリ不足は運用者にサーバー追加を迫る可能性がある。より適切なプーリングは、すべてのマシンに最大限の容量を搭載しなくても、この不均衡を抑えられる。
したがって当面の圧力は、固定的なサーバー境界を中心に構築されたインフラにかかる。また、限定された物理ドメイン内で高速なアクセラレータ通信を実現するプロプライエタリなスケールアップシステムにも及ぶ。購入者は、予測可能な性能を損なうことなく、より大規模な導入環境でその利点を得たいと考えている。
ハードウェアコヒーレンスとソフトウェア協調型ネットワークの対決
主な競争軸は、制御されたハードウェアファブリックと、ソフトウェアを通じて分散リソースを調整する柔軟なネットワークとの間にある。
EthernetとInfiniBandはすでに非常に大規模なAIクラスターを接続している。成熟したルーティング、運用、セキュリティ、障害管理を支えている。そのスケールは不可欠であり、Panmnesia Meta CXL Architectureがそれらを時代遅れにするわけではない。
この提案が対象とするのは、ネットワークタイミングの変動によって影響を受けるワークロードだ。従来のスケールアウト通信では、ソフトウェアがリモートバッファを特定し、転送を送信し、完了を検出する必要があることが多い。各ステップがオーバーヘッドや遅延のばらつきを加える可能性がある。
CXLファブリックは、接続されたデバイス全体で共有アドレスモデルを維持できる。ハードウェアもコヒーレンス維持に参加できる。この設計により、リモートメモリやアクセラレータは、要求元プロセッサとより密接に統合されているように見える。
この違いは、プロジェクトを運営する2つの方法に似ている。1つは独立したチーム間で正式なメッセージを送る方法だ。もう1つは、参加者が継続的に同期された共有環境で作業できるようにする方法である。後者は調整の手順を減らせるが、より強い依存関係も生み出す。
Panmnesiaが提案するスイッチが重要なのは、初期のCXLがPCI Expressから複数の構造的特性を継承していたためだ。階層ベースのルーティングでは、一般にデバイスをツリー構造で編成する。ツリーは管理しやすい一方、その形状が経路、ファンアウト、大規模ファブリックの設計を制約する可能性がある。
ポートベースのルーティングは、ファブリックポートに割り当てられた識別子を使ってトラフィックを転送する。より柔軟なトポロジーを可能にし、代替経路を提供できる。Panmnesiaによると、同社のスイッチはポートベースと階層ベースの両方のルーティングをサポートし、互換性を維持しながら導入の選択肢を広げる。
リンクアクセラレーションユニットは、エンドポイント近傍で実行される処理に対応する。コヒーレンス処理やその他のプロトコル活動に伴う遅延を抑えることを目指す。ファブリックコントローラはその後、システム全体での設定とリソース割り当てを調整する。
これらのコンポーネントは単に1つのベンチマークにおける平均レイテンシを下げるのではなく、経路を安定化させることを意図している。レビューは、ルーティング、キュー、コントローラ、競合トラフィックによって生じる変動をハードウェアが制御すべきだと主張する。予測可能性は偶発的なベンチマーク結果ではなく、アーキテクチャ上の特性となる。
Panmnesiaは、CXLおよびPCIeファブリックコントローラーとリンクアクセラレーションユニットがシリコン検証を完了したと述べている。同社はまた、ファブリックスイッチが製造され、プレリリース版シリコンの供給が始まっているとも説明している。これらの主張はソフトウェアシミュレーション以上の進展を示す一方、完全なデータセンター展開には至っていない。
公開報告では、提案設計におけるサーバー間アクセスは数百ナノ秒台とされる。従来のネットワークベースのアクセスはマイクロ秒単位で動作する場合がある。これらの分類には多様な構成が含まれるため、この比較は普遍的なベンチマークではなく、アーキテクチャ上の指針として扱うべきである。
960台のアクセラレーターで構成されるドメインという主張は、意図するスケールを示している。ただし、その規模におけるアプリケーションスループット、利用率、耐障害性を実証するものではない。購入者には、トレーニング、推論、メモリプーリング、障害復旧にわたるワークロードレベルの結果が必要となる。
独自仕様のアクセラレーター相互接続も、もう一つの重要な比較対象である。NVLinkとNVSwitchは、対応するNvidiaシステム内で高帯域幅のGPU通信を提供する。ほかのアクセラレーター供給企業も、自社製品を中心に同等のスケールアップ技術を展開している。
こうしたリンクは、多くの場合、緊密な統合と成熟した集団通信のサポートを実現する。しかし、購入者を特定のアクセラレーター製品群やシステム設計に縛る可能性もある。CXLの魅力は、プロセッサ、メモリ、異種デバイスをまたぐ業界標準インターフェースにある。
オープン標準だからといって、自動的に相互運用性が実現するわけではない。コントローラー、スイッチ、ファームウェア、オペレーティングシステム、アクセラレーターは、依然として互換性のある動作を実現する必要がある。すべてのコンポーネントがプロトコル準拠試験に合格していても、性能は変動し得る。
そのため、提案されたファブリックは追加のインフラストラクチャ層として捉えるべきである。EthernetとInfiniBandは、広域性と独立した障害ドメインの恩恵を受けるトラフィックを引き続き担うことになる。専用アクセラレーターリンクも、高度に統合されたシステム内では引き続き有用である。
CXLはその中間を占めることになる。メモリに近いアクセスとコヒーレンスを、サーバー、ラック、あるいは従来のスケールアップ筐体の外へ拡張する。価値は、施設全体にチップレベルの障害感度を持ち込まずに、その緊密な結合を運用者が得られるかどうかに左右される。
真の試験は、変動性、距離、そして障害封じ込めにある
長距離リンク、輻輳、あるいは単一コンポーネントの障害によってシステム全体の挙動が予測不能になるなら、コヒーレントドメインの有用性は低下する。
電気信号伝送は、この提案における最も明確な物理的制約を生む。高速電気リンクは、距離が伸びるにつれて信号品質が低下する。リタイマーは信号を再生できるが、追加されるコンポーネントごとに遅延、消費電力、コスト、運用上の複雑性が増す。
CXLは当初、サーバー内部および近接システム間の比較的短い接続向けに設計された。ラックをまたいで延伸するには、慎重なチャネル設計が必要となる。データセンター全体へ拡張するには、異なる物理的アプローチが求められる。
このレビューは、電気的限界を超える道筋として光リンクとCXL-over-opticsを挙げている。CXL-over-opticsは、メモリおよびコヒーレンスのセマンティクスを維持しようとしながら、CXLトラフィックを光通信で伝送する。光伝送は、同等の電気リンクよりも長い距離をカバーできる。
ただし、光技術があらゆる遅延を取り除くわけではない。電気光変換、スイッチング、プロトコル処理、より長い物理的な伝送距離はいずれも応答時間に影響する。課題は、同期型AIワークロードに対応できるほど厳密に総経路を制御することにある。
このアーキテクチャは、障害の影響範囲も拡大する。従来の分散システムでは、ノードとネットワーク経路は独立して障害を起こすものと想定される。ソフトウェアは、再試行、複製、あるいは障害を避けた処理の分離を行える。
大規模なコヒーレントシステムでは、共有状態が増加する。スイッチ、メモリデバイス、コントローラー、または光経路の喪失は、複数の参加者に影響し得る。復旧では、障害によってシステムの過大な部分が停止しないようにしつつ、正しさを維持しなければならない。
Natureのレビューは、コヒーレンス、メモリ階層、ファブリック制御、光統合を継続的な研究領域として明示している。その主要論点では、このアーキテクチャが依然として電気リンクの制約内にあることも述べられている。この表現は、「一つのチップ」という比喩が示唆する以上に慎重なものだ。
セキュリティも未解決の課題を生む。共有メモリシステムでは、ワークロードおよびテナント間の厳格な分離が必要となる。大規模なCXLファブリックは、より多くのデバイスにまたがってアドレス空間、管理インターフェース、メモリ内容を保護しなければならない。
運用ソフトウェアは、スイッチシリコンと同じほど重要になる。ファブリックコントローラーには、リソースの検出、ポリシー適用、輻輳監視、障害分離、保守の調整が求められる。運用者は、どの経路がレイテンシーの外れ値を引き起こしたかを可視化する必要もある。
この提案はソフトウェアを不要にするものではない。より時間に敏感な調整をハードウェアへ移し、構成とポリシーを管理プレーンに委ねる。この分離は実行時オーバーヘッドを減らせる一方、難度の高い制御問題を生む。
アプリケーションの挙動も別の制約となる。局所性が予測可能なワークロードでは、頻繁にアクセスされるデータをコンピュートの近くに維持し、アクセス頻度の低いデータにはプール容量を利用できる。ランダムアクセスパターンのワークロードでは、より多くのファブリックトラフィックが発生し、より大きなレイテンシーペナルティを受ける可能性がある。
Metaのメモリ階層化の例は、このトレードオフを反映している。ローカルDDR5は、接続されたDDR4階層より大幅に高い帯域幅を提供する。ソフトウェアが安定したワーキングセットを特定し、それをプロセッサの近くに維持できる場合、ページ配置は機能する。
同様の原則はアクセラレーターにも当てはまる。CXLメモリは容量を追加できるが、GPUのそばに搭載された高帯域幅メモリの帯域幅と近接性を再現することはできない。適切な比較は、リモートCXL容量とローカルHBMを個別に対比することではない。
むしろ運用者は、どのデータを各階層に配置すべきかを問う必要がある。モデル重み、キー・バリューキャッシュ、埋め込み、チェックポイント、中間結果には、それぞれ異なるアクセスパターンがある。追加の距離を許容できるものもあれば、ローカル帯域幅に依存するものもある。
独立した試験では、好ましい平均値だけでなく、より多くの指標を測定する必要がある。有用な評価では、テールレイテンシー、輻輳時の挙動、転送バイト当たりのエネルギー、障害復旧、アプリケーション完了時間を報告すべきである。試験ではトポロジーとワークロード配置も変える必要がある。
最も重要な証拠の不足はスケールにある。Panmnesiaは中核コンポーネントのシリコン検証について説明している。Metaは本番環境でのCXLメモリ利用について説明している。しかし、どちらの結果も、複数ラックにまたがる960台のコヒーレントアクセラレーターを対象とした公開済みのエンドツーエンド試験には当たらない。
報じられたアーキテクチャ比較は、この設計を提案段階の方向性として適切に位置付けている。また、数百ナノ秒台という数値を、あらゆる導入環境における独立検証として読むべきではないとも指摘している。
こうした慎重さは論文の価値を損なうものではない。レビュー論文は、新興分野を整理し、研究の方向性を示すことが多い。この出版物の価値は、ある商用製品がすでにあらゆる要件を満たしていることの証明ではなく、システムレベルの論証にある。
CXLはメモリ拡張からファブリックコンピューティングへ移行している
より大きな変化は、CXLを追加メモリ接続から、コンポーザブルなAIインフラストラクチャの有力なバックボーン候補へと変える。
CXLは当初、サーバーメモリを拡張する実用的な手段として注目を集めた。Type 3デバイスは、コヒーレントなホストインターフェースを通じてメモリ容量を追加できる。その後のプーリングにより、各サーバーに同一のメモリを予約するのではなく、複数のホストが共有容量から利用できるようになる。
これは一般的な利用率の問題を解決する。一部のサーバーではメモリが不足する一方、ほかのサーバーでは容量が未使用のままとなる。共有プールは、実際の需要に近い場所へリソースを移動させ、遊休化したハードウェアを減らせる。
半導体業界の企業は、CXLコントローラー、メモリ拡張装置、スイッチ、リタイマーを開発してきた。IntelとAMDは、サーバープロセッサを通じてCXLをサポートしている。メモリおよびインフラストラクチャ供給企業も、同じ標準に対応するデバイスを投入している。
PanmnesiaとMetaのCXLアーキテクチャは、こうしたコンポーネントレベルの用途を超える。予測可能な経路を備えた構造化コンピューティングシステムとして、ファブリックを扱う。メモリプーリングは、より大きなコヒーレントドメイン内の一機能となる。
この方向性は、購入者によるインフラストラクチャの評価方法も変える。CXLメモリカードは、容量、レイテンシー、帯域幅、互換性によって評価できる。データセンターファブリックには、トポロジー、ルーティング、管理、分離、障害時の挙動を対象とする追加の指標が必要となる。
MetaのVistaraプロジェクトは、有用な歴史的ステップを示している。このカスタムCXL 2.0チップは、DDR4メモリをDDR5を中心に構築された新しいシステムへ接続する。公開されたVistaraの実装詳細は、ラック間アクセラレーターファブリックではなく、本番運用を意識したメモリ拡張設計を説明している。
このより限定的な用途は重要である。成功する標準は、段階的な導入を通じて広がることが多いためだ。運用者はメモリ拡張から始め、プーリングを加え、スイッチングを採用し、その後により野心的なコヒーレントドメインを試験できる。各段階が運用上の知見を蓄積する。
Panmnesiaの戦略は、その進展に沿った複数の領域をカバーする。同社のポートフォリオには、コントローラーIP、エンドポイント設計、スイッチ、リタイマー、ファブリック管理が含まれる。同社は、単独のコンポーネントベンダーではなく、アーキテクチャ供給企業としての位置付けを目指している。
ただし、商業上の位置付けと導入は別の問題である。Natureの記事にはPanmnesiaとMetaの著者が名を連ねているが、共著は供給契約の発表を意味しない。また、MetaがPanmnesiaの完全なファブリックを導入することを確認するものでもない。
Metaには、オープンな相互接続を研究する強い理由がある。ハイパースケーラーは、多様なプロセッサ、アクセラレーター、ストレージシステム、メモリ世代を運用している。標準化された接続は、特定のデバイス製品群への依存を低減し、より柔軟なリソース利用を支え得る。
同時に、ハイパースケーラーは標準製品が要件を満たさない場合、独自シリコンを開発することが多い。Vistaraは、Metaが社内ユースケース向けに特化型CXLデバイスを構築できることを示している。したがってPanmnesiaは、プロトコル自体を超える価値を示さなければならない。
同社の差別化は、低レイテンシー制御、柔軟なルーティング、大規模ファブリック、エンドポイント高速化にかかっている。これらの主張には、代替となるCXLスイッチや独自のスケールアップシステムとの比較が必要である。購入者はソフトウェア統合と製造準備状況も評価する。
競争の結果として、単一の普遍的な勝者が生まれるわけではない。AIデータセンターはすでに複数の相互接続層を組み合わせている。単一のファブリックでは、あらゆる距離とトラフィックパターンを最適化できないためだ。焦点となるのは、各層がどこで始まり、どこで終わるかである。
サーバー内部では、ローカルリンクとメモリバスが引き続き不可欠である。アクセラレーター筐体内では、独自のスケールアップファブリックが非常に高い帯域幅を提供できる。ラック間では、EthernetとInfiniBandが確立された到達性と運用上の独立性を提供する。
CXLは、これらの層の間に新たなコヒーレント領域を作り出す可能性がある。この領域には、プールされたメモリ、ストレージクラスデバイス、CPU、一部のアクセラレーターが含まれる可能性がある。その規模は、許容できるレイテンシー、障害境界、経済性によって決まる。
このReview Articleは、この領域にコヒーレントなアーキテクチャ上の語彙を与えている。トレイは近接するコンポーネントをグループ化する。ポッドはより大きなリソース群を接続する。ファブリック層は、規則的な経路を維持しようとしながら、これらのグループを結ぶ。
このモデルはチップ設計に似ている。現代のプロセッサも、リソースを階層的に構成しているためだ。コア、キャッシュ、メモリコントローラー、相互接続は、構造化された領域に配置される。この提案は、同様の配置およびルーティング原則をデータセンター規模で適用する。
この類推にも、やがて限界が訪れる。データセンターはより長い距離にまたがり、交換可能な機器を含み、独立したワークロードを処理する。一つのパッケージ内でチップ設計者が許容するすべての制約を、受け入れることはできない。
最も信頼できる解釈は、文字どおり部屋ほどの大きさのプロセッサではない。従来のネットワークよりも大きなハードウェア管理領域、より直接的なリソースアクセス、そして厳密なタイミング制御を備えたデータセンターということだ。
この設計が机上の構想を脱せるかを示す3つのシグナル
次の段階は、エンドツーエンドの実証、光接続の検証、そして運用者が大規模なコヒーレント・ファブリック内に障害を封じ込められることを示す証拠にかかっている。
最初のシグナルは、完全なアーキテクチャを用いたマルチラックのワークロード実証だ。提案されているスイッチ、リンク加速ユニット、ファブリックコントローラー、メモリー、CPU、アクセラレーターを組み合わせる必要がある。コンポーネント単位の検証では、共有トラフィック下で生じるすべての相互作用を明らかにできない。
説得力のあるテストでは、意味のある数のアクセラレーターにわたり、同期型AIトレーニングまたは推論を実行するだろう。中央値およびテールレイテンシー、達成帯域幅、利用率、ジョブ完了までの総時間を報告すべきだ。結果には、アイドル状態のファブリックだけでなく、輻輳や混在トラフィックも含める必要がある。
提案されている960アクセラレーター規模に近い証拠は、論文の中心的な主張を強く裏付ける。より小規模な実証でも、ラック間で予測可能なスケーリングを示せれば意義はある。コンポーネントレベルの結果に依存し続けるなら、最大の主張は未検証のままとなる。
2つ目のシグナルは、光接続上のエンドツーエンドCXLプロトタイプだ。電気リンクは、コヒーレント・ファブリックが到達できる距離を制限する。したがって、データセンター全体というビジョンにとって、光伝送は任意の付加要素ではない。
有用なプロトタイプは、変換遅延、リンク安定性、消費電力、光障害からの復旧を測定しつつ、CXLの動作を維持しなければならない。また、スイッチとコントローラーが長距離にわたって一貫したパスをどう維持するかも示す必要がある。
光接続の検証に成功すれば、コヒーレント・ドメインが隣接ラックを越えて拡張できるという主張が強まる。遅延が過大だったり、運用が複雑すぎたりすれば、CXLは再び小規模なポッドに限定されるだろう。その場合、EthernetとInfiniBandがラック間接続の役割をより多く維持することになる。
3つ目のシグナルは、障害分離とソフトウェア運用に関する本番環境の証拠だ。大規模なコヒーレント・ファブリックには、デバイスまたはパスが障害を起こした際の明確な復旧手順が必要である。また、ワークロードが停止する前に輻輳やレイテンシーの変動を特定する監視機能も求められる。
ファブリックテレメトリー、ホットプラグの挙動、セキュリティ境界、部分障害からの復旧に関する公開情報に注目したい。導入発表では、限定的な試験と本番サービスを明確に区別すべきだ。サプライヤーとの関係も、研究協力とは分けて扱う必要がある。
このシグナルは、また一つのレイテンシー主張よりも速くアーキテクチャを強化も弱体化もさせうる。障害の封じ込めが難しくなるなら、運用者はコヒーレンス・ドメインを拡大しない。予測可能性には、通常時の実行だけでなく復旧も含まれなければならない。
Panmnesia Meta CXLアーキテクチャは、現実のAIインフラ問題に対する本格的な答えを提示している。通信遅延によってアクセラレーターがアイドル状態になるなら、数を増やしても比例した性能向上は得られない。ハードウェア管理型コヒーレンスは、システム設計者にその協調コストを削減する別の手段を与える。
この提案の重要性は、その仕組みと残された隔たりにある。PanmnesiaとMetaは、査読済みのアーキテクチャ上の論拠を、コンポーネントシリコンとより限定的な本番環境の証拠へと結び付けた。しかし、データセンター全体が一つのチップとして動作する様子は、まだ示していない。
開発者と企業の購入担当者は、今後、アクセラレーターのピーク台数だけを見るべきではない。データがどこに置かれ、どれほど頻繁に移動し、どのリンクが運び、ある経路が遅くなった場合に何が起こるのかを問うべきだ。ベンダーが結果を公開する際には、上記の3つのシグナルを追跡したい。マルチラック試験が安定したテールレイテンシーと封じ込められた障害を確認できれば、CXLは共有メモリー技術から、AIを定義するファブリックへと進むだろう。



