top of page

AMD Heliosが72基のGPUを統合、だが試金石を握るのはNvidia

8月12日
読了時間: 23分

AMDはHeliosを、キャビネット内で接続されたアクセラレータサーバーの寄せ集めではなく、72基のGPUから成る単一システムとして投入した。AMDのServeTheHomeによるアーキテクチャ解説が重要なのは、同社がAIラックのほぼすべての主要レイヤーを制御するようになったためだ。

Heliosは、Instinct MI455Xアクセラレータ、EPYC Veniceプロセッサ、Pensandoネットワーク、ROCmソフトウェア、液冷対応の電力インフラを組み合わせる。GPUを単一のスケールアップ・ファブリックで接続する商用EthernetスイッチングシリコンはBroadcomが供給する。

この組み合わせこそが真の対立軸を生む。AMDはもはやアクセラレータカード単体でNvidiaに挑んでいるのではない。Nvidiaのラックスケールモデルに対抗すると同時に、Nvidiaのシステムを模倣しにくくしてきたクローズドなネットワーク手法を退けている。

Heliosは仕様上は説得力がある。ただし、ピーク仕様だけでは、実際のアプリケーション性能、ソフトウェアの成熟度、供給量、運用経済性は証明されない。オープン性が調達上の優位性になるのか、単なるアーキテクチャ上の選好にとどまるのかは、こうした未解決の問いによって決まる。

AMD ServeTheHomeの報道が明らかにするHeliosの内部

Heliosによって、AMDの競争単位は単一GPUから統合AIラックへと変わる。

このシステムは、18基の液冷コンピュートトレイに搭載された72基のInstinct MI455Xアクセラレータで構成される。各トレイには4基のGPUと、Veniceのコードネームを持つ第6世代EPYC 9006プロセッサ用の1ソケットが搭載される。

AMDは各MI455Xに432 GBのHBM4メモリを割り当てている。ラック全体では、スケールアップ・ドメイン内で利用可能な高帯域幅メモリは約31 TBとなる。

高帯域幅メモリ、すなわちHBMはGPUの近くに配置され、従来型サーバーメモリを大幅に上回る速度でデータを供給する。この容量は、大規模モデル、長いコンテキスト、推論キャッシュ、そしてそうでなければより多くの分割を必要とするワークロードにとって重要だ。

AMDはCDNA 5 architectureのドキュメントで、MI455Xごとに最大23.3 TB/sのメモリ帯域幅を記載している。ラックはこれらのデバイスを集約し、理論上は毎秒1ペタバイトを超える帯域幅を持つメモリシステムを構成する。

物理レイアウトはアクセラレータ数と同じくらい重要だ。Heliosは、一般的なラックより幅広いOpen Compute Project Open Rack Wideフレームを採用する。この設計は、高密度コンピュートトレイ、ケーブル、電源機器、液冷ハードウェアのためのスペースを確保する。

ラックには6基のスケールアップ・スイッチトレイが含まれる。各トレイには2基のBroadcom Tomahawk 6スイッチチップが搭載され、Helios全体では12基のスイッチチップとなる。

各Tomahawk 6デバイスは102.4 Tbpsのスイッチング容量を提供する。そのEthernetレーンが内部ファブリックを形成し、すべてのアクセラレータが単一のスイッチホップを介して相互に通信できるようにする。

このファブリックは、しばしばUALoEと略されるEthernet over UALinkを担う。UALinkはアクセラレータ向けのスケールアップ接続を定義し、Ethernetはその基盤となるトランスポートと商用スイッチングハードウェアを提供する。

AMDによれば、各MI455Xは3.6 TB/sの双方向スケールアップ帯域幅を受け取る。72デバイス全体では、総帯域幅は約260 TB/sに達する。

これが、Heliosが単一の72-GPUシステムとして動作するというAMDの主張を支える仕組みだ。従来のクラスターでは、多くの場合、メモリの所有権を別々のサーバーに分割し、複数のネットワーク段階を経由してデータを受け渡す。

Heliosはラック内でこうした境界を減らす。依然として個別のプロセッサとメモリデバイスで構成されるが、その単一ホップのファブリックにより、ソフトウェアから見ればより密接に接続されたアクセラレータ・ドメインとなる。

AMDのMI455X specificationsは、どれほど多くのネットワーク機能がGPUパッケージ上に移されたかも示している。各アクセラレータモジュールには、2基の拡張I/Oダイと36本の双方向UALoEリンクが含まれる。

この変化により、ネットワークはアクセラレータアーキテクチャの一部となる。コンピュートプラットフォームの設計後に選定される付属品ではなくなった。

Heliosは、スケールアップ・ドメインを超える通信にもPensandoハードウェアを使用する。各GPUは3枚の800 Gbps Vulcanoネットワークインターフェースカードに接続でき、アクセラレータごとに最大2.4 Tbpsのスケールアウト帯域幅を提供する。

スケールアウト・ネットワークは、複数のラックをより大規模な導入環境へ接続する。Pensando Salinaデータ処理ユニットが、管理、ストレージアクセス、アプリケーション要求を含むフロントエンドトラフィックを処理する。

したがって、このラックには2つの異なるネットワーク層がある。BroadcomのシリコンがHelios内のアクセラレータを結び、AMD PensandoデバイスがHeliosをストレージ、サービス、他のラックに接続する。

電力供給がシステムを完成させる。背面の50ボルト直流バスバーがラックに電力を供給し、液冷が高密度コンポーネントから熱を除去する。

AMDのAdvancing AIイベントからの報道では、ラックの消費電力は225 kWから245 kWの間とされていた。この要件により、Heliosは高密度電力供給と液冷に対応していないデータホールには適さない。

公開されたプラットフォーム詳細によれば、ラックの重量は約5,000ポンドに達する場合もある。購入者は導入を通常のサーバー更新ではなく、施設プロジェクトとして扱う必要がある。

そのため、ServeTheHomeがアーキテクチャに焦点を当てるのは妥当だ。中心的な製品は、コンピュート、メモリ、ネットワーク、電力、冷却、機構、ソフトウェアを含む統合そのものである。

AMDが今、ラック全体を構築する必要があった理由

Nvidiaは、すべての有力アクセラレータベンダーにシステム規模での競争を強いた。

現代のAIワークロードは、アクセラレータ間でデータを移動させることに相当な時間を費やす。モデル、アクティベーション、中間結果が長い待機を生むことなくコンピュートエンジンに届かなければ、演算速度の向上だけでは十分ではない。

この現実は、協調して動作する単位として設計されたシステムに有利に働く。Nvidiaは、72基のGPU、CPU、NVLinkスイッチング、ネットワーク、冷却、ソフトウェアを組み合わせるNVL72プラットフォームでこのモデルを確立した。

AMDは以前、システムベンダーがサーバーやクラスターに組み込む競争力のあるアクセラレータを販売していた。このモデルは顧客に選択肢を与えた一方、より多くの統合作業をAMDの直接的な管理の外に残していた。

同社はGPUを改善しても、システムレベルでは敗れる可能性があった。ネットワークトポロジー、集団通信、冷却上限、ソフトウェアチューニング、サーバー設計は、アクセラレータ単体で測定された優位性を帳消しにしかねない。

Heliosは完全なリファレンスアーキテクチャを提供することで、この弱点に対処する。AMDはコンピュートトレイ、スケールアップトポロジー、スケールアウトネットワーク、ラック形式、電力供給、冷却手法、関連ソフトウェアを規定する。

このタイミングは、AMDの最新のデータセンター向け専用コンピュートアーキテクチャであるCDNA 5の登場も反映している。MI455Xは2 nmプロセスで製造された8基のコンピュートチップレットを採用し、その下に2基の3 nmファブリック・アンド・キャッシュダイを配置する。

さらに2基のI/Oダイが外部通信を管理する。12層のHBM4スタックがロジックを取り囲み、高度なパッケージングがコンポーネントを1つのアクセラレータモジュールに接続する。

このチップレット設計により、AMDは異なる製造プロセスで異なる機能を最適化できる。コンピュート密度、メモリインターフェース、キャッシュ、ネットワークのすべてが、同じシリコン特性を必要とするわけではない。

MI455Xは3,200億個のトランジスタと256基のワークグループプロセッサを搭載する。ワークグループプロセッサは、AIおよび科学技術計算の処理グループを実行するリソースを編成する。

AMDは、MXFP4、MXFP6、MXFP8、FP8などのフォーマットで低精度AI計算を狙う。これらのフォーマットはより少ないビットでモデル値を表現し、アプリケーションが許容できる精度を維持できる場合にスループットを高める。

アクセラレータは、MXFP4演算で40.3ペタフロップスという公称ピークに達する。ラック全体では、AMDはFP4で最大2.9エクサフロップス、FP8で1.4エクサフロップスのピーク性能を掲げる。

これらの数値は理論上のピークであり、完全なモデルで測定された結果ではない。ただし、MI455Xとともにラック統合が登場した理由を説明している。

単一のアクセラレータは今や十分なデータを移動させ、十分な電力を消費するため、周辺システムが利用可能な演算能力をアプリケーションが活用できるかどうかを左右する。AMDには、意味のある規模でCDNA 5の能力を引き出すためにHeliosが必要だった。

同社は2025年にZT Systemsを買収し、ハイパースケールラック設計におけるエンジニアリング経験を得た。AMDはその後、製造事業を分離し、既存サーバーパートナーとの直接競合を抑えた。

この取引により、AMDはHeliosの唯一の供給者になることなく、より深いシステムの専門性を得た。HPE、Supermicro、クラウドプロバイダー、その他のパートナーは、このリファレンス設計から製品を構築できる。

Microsoftは、自社データセンターにHeliosを導入する計画を発表している。HPEも以前、このアーキテクチャを採用すると表明しており、AMDにハイパースケールとエンタープライズの両方のインフラへの道筋を与えている。

AMDはCESで、Heliosがはるかに大規模なAIシステムの青写真になると述べた。同社のrack-scale previewは、この設計をトレーニング、推論、将来のマルチラック導入に結び付けている。

したがって、圧力はNvidiaだけに及ばない。サーバーメーカーはAMDのエンジニアリングをどこまで採用するかを判断し、クラウドプロバイダーはオープンなリファレンスプラットフォームが統合リスクを低減するかを見極めなければならない。

チップサプライヤーも新たな購買パターンに直面する。顧客はますます、アクセラレータを単独のベンチマークスコアを持つ交換可能なカードではなく、完全なシステムの一部として評価するようになっている。

オープンEthernetはAMDによるNvidiaへの最大の挑戦

主要な競争は、AMDのオープンEthernetラックと、Nvidiaの垂直統合型NVLinkプラットフォームの間で繰り広げられる。

Heliosは、いくつかの重要な点でNvidiaのVera Rubin NVL72に似ている。どちらも18基の液冷コンピュートトレイに72基のアクセラレータを配置し、高帯域幅通信のために専用スイッチトレイを使用する。

違いはスケールアップ・ネットワークの制御にある。NvidiaはNVLinkとNVLinkスイッチングを自社プラットフォームに組み込み、プロトコル、シリコン、トポロジー、ソフトウェア統合に対する直接的な権限を持つ。

AMDは、Ethernet上で動作するオープンなアクセラレータリンクを使用する。BroadcomがTomahawk 6スイッチシリコンを提供し、UALinkがアクセラレータ間でこのファブリックを介して通信する方法を定義する。

この選択により、AMDは独自のスイッチアーキテクチャではなく、商用ネットワーク技術を活用できる。システムベンダーとハイパースケーラーは、使い慣れたEthernetツール、サプライヤー、運用慣行で取り組める。

オープンであることは、エンジニアリング作業なしにすべてのコンポーネントを交換できることを意味しない。スケールアップ・ネットワークには、厳格なレイテンシー、輻輳、信頼性、同期、ソフトウェア要件がある。

それでも、公開されたインターフェースはパートナーにラックをカスタマイズする余地をより多く与える。クラウドプロバイダーは、すべてのレイヤーを単一ベンダーに依存することなく、ネットワーク、管理、導入の選択肢を調整できる。

Broadcomの役割は、この主張をより具体的なものにする。Tomahawk 6は200 Gbpsの512レーンを提供し、AMDが示すスケールアップレートで72基のGPUを接続するのに十分な容量を備える。

Helios architecture reportは、この提携が重要である理由を示している。AMDのハードウェアポートフォリオは幅広いが、システム設計を制御するためにすべてのコンポーネントを製造する必要はない。

これにより、Nvidiaに代わる連合ベースの選択肢が生まれる。AMDはGPU、CPU、Pensandoネットワークデバイス、ソフトウェア、プラットフォームエンジニアリングを提供する。Broadcomは中核となるスケールアップ・スイッチングシリコンを提供する。

HPEやその他のメーカーは、この青写真をシステムへと具体化できる。クラウド事業者は、ネットワークとソフトウェアの選択に対するより大きな影響力を維持しながら、これらのシステムを導入できる。

Nvidiaは対照的な提案を示している。より緊密な統合によって外部変数を減らし、単一ベンダーが最適化したプラットフォームを顧客に提供する。

この管理体制は、性能チューニングを簡素化できる。Nvidiaは、GPUの挙動、スイッチシリコン、通信ライブラリ、ドライバー、ネットワーキング、アプリケーションフレームワークを、単一のロードマップに沿って調整できる。

AMDは、1社がすべての要素を保有しなくても、オープン標準で同等の効率を達成できると賭けている。この提案は、トポロジー図だけでなく、実際のワークロードに耐えなければならない。

両システムはラック外でも異なる。Heliosは各アクセラレーターに800 GbpsのVulcanoインターフェースを3基割り当て、GPUあたり2.4 Tbpsのスケールアウト帯域幅を実現する。

公開されているVera Rubin構成では、各GPUに1.6 TbpsのConnectX-9インターフェースを1基組み合わせている。そのためAMDは、アクセラレーターあたりのスケールアウト帯域幅が50%多いと主張する。

この比較は、ソフトウェアがリンクを効率的に活用できるという前提で、複数ラックにまたがるワークロードに有利だ。大規模な学習ジョブと分散推論サービスは、1ラックにワークロード全体を収められない場合、このレイヤーに依存する。

AMDは、メモリ容量と帯域幅でも優位性を主張している。Heliosはラック全体で31 TBのHBM4を提供し、AMDによれば、これは競合するNvidiaプラットフォームより50%多い容量に相当する。

メモリ容量が増えれば、モデル分割を減らし、キー・バリューキャッシュ用の領域を広げられる。キー・バリューキャッシュは、推論システムが先行するコンテキストを再計算せずに後続トークンを生成できるよう、アテンションデータを保存するものだ。

この利点は、長コンテキスト推論や、多数の同時リクエストを処理するモデルにとりわけ重要だ。ただし、容量だけでレイテンシーやスループットが決まるわけではない。

ソフトウェアスケジューリング、カーネル品質、通信効率、ワークロードの形状が、顧客に届く実効性能をなお左右する。NvidiaのCUDA環境は、多くのAIチームにとって確立された基準点であり続けている。

ROCmは近年のInstinct世代を通じて改善され、主要フレームワークもAMDハードウェアをサポートするようになった。それでもHeliosでは、72基のアクセラレーターを1つのプラットフォームとして予測可能に動作させる責任が、より大きくAMDに委ねられる。

したがって、オープン対統制型の競争は哲学的なものではない。パートナー主体のアーキテクチャが、統合プラットフォームの実効性能と信頼性に匹敵できるかという、測定可能な問いである。

仕様だけでは性能は決まらない

AMDの最も強力な数値は、独立したラックレベルのテストで確認されるまで、ベンダー側の主張にとどまる。

AMDは、Heliosが主要な競合システムよりアクセラレーターあたり15%高いピークFP4性能を提供すると主張している。また、トークンあたりの経済性が最大30%向上すると予測する。

こうした主張には慎重な位置付けが必要だ。ピークFP4演算は、理想条件下でサポートされる最速の低精度演算を示すものであり、実運用モデルの持続的な速度を示すものではない。

トークンあたりのコスト比較には、さらに多くの前提が必要となる。ハードウェア利用率、電力、冷却、ソフトウェアライセンス、人員、モデル精度、バッチサイズ、システム可用性はいずれも結果に影響する。

AMDは中立的な所有コスト比較を可能にする形では、公開価格を開示していない。購入者はハードウェア、サポート、ネットワーキング、導入契約についても、規模に応じて異なる条件を交渉することになる。

ラックレベルの数値は、性能の見方をさらに複雑にする。AMDはHeliosのピークFP4性能を2.9エクサフロップスと掲げる一方、NvidiaはVera Rubin NVL72でより高い3.6エクサフロップスのラック性能を公表している。

これらの数値の定義は異なる可能性がある。Nvidiaの結果には一部の推論タスクに適した圧縮動作が含まれる場合がある一方、AMDはサポートされる生の精度レートを強調している。

The Registerのラック比較も、この違いを指摘している。一部のワークロードはNvidiaの適応型圧縮の恩恵を受けられるが、別のワークロードではAMDの非圧縮の数値により近い演算が必要になる。

どちらの比較も、普遍的な勝者を示すものではない。学習、ファインチューニング、高密度推論、Mixture-of-Expertsモデル、長コンテキストの提供では、ハードウェアに異なる負荷がかかる。

Mixture-of-Expertsモデルは、トークンごとに選択されたパラメーター群だけを有効化する。演算量を削減できる一方、GPU間に厳しい通信パターンを生み出す。

メモリ容量やスケールアウト帯域幅がアプリケーションの制約となる場合、Heliosは優れた性能を発揮する可能性がある。Nvidiaは、ソフトウェアスタックがより少ない名目上のリソースから多くの処理を引き出せる場合、優位を維持するかもしれない。

同じ注意は、AMDのシングルホップメモリという表現にも当てはまる。Heliosは緊密に接続されたHBMドメインを提供するが、72個の物理メモリプールを従来型の単一の均一メモリデバイスに変えるわけではない。

ソフトウェアは依然として、データ配置、アクセラレーターの所有権、同期、通信コストを理解する必要がある。スイッチをまたぐリモートHBMアクセスは、1つのGPUパッケージ内のローカルアクセスと同じようには動作しない。

帯域幅に加えてレイテンシーも重要だ。AMDは印象的な総スループットを公表しているが、詳細なアプリケーション結果によって、競合や不規則なトラフィック下でファブリックがどう動作するかが明らかになる。

信頼性も別の課題を生む。72 GPUラックは、アクセラレーター、プロセッサー、スイッチ、ネットワークインターフェース、冷却接続、電力コンポーネント、ケーブル、ソフトウェアを、1つの運用ドメインに統合する。

ワークロードがラックを1つのシステムとして扱う場合、障害のコストはより大きくなる。運用者には、障害分離、テレメトリー、チェックポイント、保守性、予測可能な復旧手順が必要だ。

ダブル幅ラックは、設備面の制約ももたらす。225 kWから245 kWという電力範囲は、多くの既存エンタープライズデータホールの容量を上回る。

この密度では液冷が必須となる。購入者には、適切な冷却液分配、電力変換、床荷重、保守アクセス、訓練を受けた運用チームが必要となる。

こうした要件は、Heliosをすべての競合製品に対して不利にするものではない。Nvidiaのラックスケールシステムも同様のインフラ要件を生む。

しかし、到達可能な市場を限定する。Heliosは当初、ハイパースケールデータセンター、専門的なAI施設、国立研究所、高密度液冷設備向けに設計された拠点に属する。

最大の不確定要素は依然としてソフトウェアだ。ROCmは、成熟したNvidia導入環境で開発者が期待する使いやすさと性能に匹敵しながら、ラックのトポロジーをサポートしなければならない。

顧客には、安定した集団通信、最適化されたカーネル、フレームワーク統合、可観測性、オーケストレーション、新しいモデルアーキテクチャへの迅速な対応が必要となる。

AMDは以前より、その経路を多く制御している。プロセッサー、アクセラレーター、ネットワークインターフェース、リファレンスシステムを所有することで、同社エンジニアにはベンダー間の問題を排除する機会が増える。

ただし、制御しているからといって直ちに成熟度が生まれるわけではない。最初の本番導入では、プレゼンテーション用ベンチマークやリファレンス設計では予見できない問題が明らかになるだろう。

HeliosはNvidiaと同じく購入者にも圧力をかける

Heliosはインフラ購入者に2つ目のラックスケールの選択肢を与えるが、評価作業もより難しくする。

信頼できる代替案は、交渉力を高められる。ハイパースケーラーは、統合されたNvidiaラックと、独立して組み立てられたAMDサーバーの寄せ集めを比較する必要がなくなる。

物理的な野心が似通った、2つの72 GPUラックアーキテクチャを比較できる。どちらも、データセンター規模の学習と推論に向けた協調型プラットフォームとして提供される。

これにより、調達比較はより有意義になる。購入者は、ラックあたりのメモリ、スケールアップ帯域幅、スケールアウト帯域幅、電力、冷却、ソフトウェアの準備状況、保守性、ワークロード結果を検討できる。

AMDに関するServeTheHomeの詳細分析も、サプライチェーン選択の重要性を強調している。Broadcomのスイッチとオープンラック標準は、メーカーが実装を差別化する余地を広げる。

HPEはHeliosを自社のシステムエンジニアリングおよびJuniperネットワーキングの専門知識と組み合わせられる。Supermicroは、すでに同社の液冷プラットフォームを運用している顧客を狙うことができる。

クラウドプロバイダーは、マネージドサービスを通じてMI455Xの容量を提供できるため、小規模な顧客が物理ラックを自ら設置する必要を減らせる。

AMDはこのモデルによって展開力を得るが、パートナーが一貫して実行することにも依存する。あるメーカーによる統合が不十分なら、より広範なプラットフォームへの評価を損なう可能性がある。

Nvidiaの統制された設計は、そのばらつきを抑える。顧客が得られるアーキテクチャ上の選択肢は少ないが、アプリケーションチューニングとサポートの対象がより均一になるという利点もある。

したがってエンタープライズの購入者は、オープン性を自動的なコスト削減と見なすべきではない。カスタマイズが価値を生むのは、組織にそれを活用するエンジニアリング能力がある場合に限られる。

標準的なモデルをマネージドクラウドサービスで実行する企業は、基盤となるスイッチの供給元よりも、提供されるトークン数と可用性を重視するかもしれない。

カスタムのネットワーキングおよびスケジューリングソフトウェアを構築するハイパースケーラーは、公開インターフェースやマーチャントシリコンにより大きな価値を見いだす可能性がある。

1台のサーバーのメモリを超えるモデルを扱う研究者は、Heliosの31 TB HBMドメインの恩恵を受けられる。同じ容量は、より大きな推論キャッシュと、より多くの同時リクエストも支援できる。

開発者にとって重要なのは、ハードウェアの多様性がソフトウェアのポータビリティに影響するからだ。実用的な第2のラックアーキテクチャがあれば、フレームワークプロジェクトやモデルベンダーはCUDA以外にも最適化する理由を強く持てる。

このプロセスは自動的には進まない。アプリケーションチームは、カーネル、数値挙動、通信ライブラリ、コンテナイメージ、監視ツール、デプロイワークフローを検証しなければならない。

業界全体も、標準をめぐる競争から恩恵を受ける。UALinkとUltra Ethernetには現在、要求の厳しいAIワークロード下で性能を測定できる注目度の高いシステムがある。

成功すれば、より多くのスイッチベンダー、アクセラレーター設計者、システムビルダーの参加を促すだろう。結果が弱ければ、独自統合が有利だという見方を強めることになる。

AMDは自社にも圧力をかけている。年次のアクセラレーター投入では、ラック設計、ネットワーキング、ソフトウェア、製造チェーンが同じスケジュールで進化する必要がある。

部品の遅延は、システム全体を遅らせかねない。アクセラレーター、CPU、スイッチ、ネットワークインターフェース、冷却、ファームウェア、ドライバー、フレームワークが一体として機能して初めて、プラットフォームは完成する。

同社によれば、Heliosは生産段階に入り、2026年第3四半期末までの出荷が見込まれている。このスケジュールにより、同製品はNvidiaのVera Rubin投入に近い位置となり、1世代丸ごと遅れることはない。

このタイミングは、AMDの従来の不利を縮める。同時に、ソフトウェアや供給が顧客の期待に届かなかった場合の言い訳もなくす。

生産発表は、主要パートナーによる導入計画を報じた。次の試金石は、これらの約束が利用可能な本番容量へと転換するかどうかだ。

評価のために設置されたラックは、収益を生むワークロードを処理するフリートとは異なる。購入者は、管理された条件下での短いデモではなく、数週間にわたり再現可能な結果を求めるべきだ。

Heliosが機能するかを決める3つのシグナル

出荷量、独立したワークロード結果、複数ラックにまたがる信頼性が、Heliosが市場を変えるかどうかを決める。

第1のシグナルは、生産・出荷の実行だ。AMDは第3四半期末までにHeliosを出荷すると見込んでおり、顧客は9月末までにどのシステムが到着するかを注視すべきだ。

名前の挙がった導入先は重要だが、数量はさらに重要である。複数の稼働フリートが確認されれば、AMDとパートナーがHBM4を調達し、MI455Xデバイスをパッケージ化し、ラックを組み立て、液冷サイトを稼働させられることが示される。

遅延はAMDのタイミングに関する主張を弱める。Heliosの供給不足が続く四半期ごとに、Nvidiaの導入基盤と生産経験の価値はさらに高まる。

第2のシグナルは、独立したアプリケーションベンチマークだ。レビュー担当者は、現行の言語モデル、Mixture-of-Expertsワークロード、ファインチューニングジョブ、長コンテキスト推論における完全なラック単位の結果を必要としている。

有用なテストでは、レイテンシー、スループット、消費電力、利用率、精度、障害時の挙動を報告すべきだ。ピーク演算性能だけでは、実際のワークロード中に72基のGPUが稼働し続けるかどうかは分からない。

ベンチマークでは、ソフトウェア面で必要な作業量も比較すべきである。数週間にわたるカスタムカーネル開発を要するプラットフォームは、ハードウェア面で魅力的な結果を示すかもしれないが、プロジェクトリスクを高める可能性がある。

最も有益な比較では、モデル、バッチサイズ、数値形式、サービスレベル目標を揃えることになる。そうでなければ、ベンダーは自社アーキテクチャに有利な設定を選べてしまう。

結果は、計算集約型ワークロードだけでなく、メモリ集約型ワークロードも対象とすべきだ。アプリケーションが過剰な通信オーバーヘッドなしにHeliosの容量と帯域幅の両方を活用できれば、その主張の説得力は増す。

第3のシグナルは、信頼性の高いマルチラックスケーリングだ。Heliosの1ラックではEthernet上のUALinkを試験する一方、より大規模な導入ではPensando Vulcanoインターフェースと、それを取り巻くUltra Ethernetネットワークも試される。

AMDは、ジョブがラック境界をまたいでも性能が予測可能なまま維持されることを示さなければならない。その規模では、輻輳、集合通信、ジョブスケジューリング、コンポーネント障害への対応がより難しくなる。

大規模顧客は、障害が発生したアクセラレータやネットワークリンクをどれほど迅速に切り分けられるかを注視する。また、ジョブを継続、再起動、あるいは直近のチェックポイントから復旧できるかも測定するだろう。

強力なマルチラック結果は、AMDのオープンネットワークという主張を支えることになる。汎用スイッチ、オープン仕様、パートナーによるエンジニアリングが、協調して機能するAIシステムを実現できることを示すためだ。

スケーリングが弱ければ、Nvidiaのより緊密な統合に有利に働く。ファブリック全体を制御することが、仕様だけでは捉えきれない運用上の優位性を依然としてもたらすことを示唆するだろう。

こうしたシグナルは、読者が今後のAMD ServeTheHomeレポートをどう解釈するかを左右すべきだ。新たな図表やピーク性能値も有用だが、現在はアーキテクチャ上の意図よりも本番環境での証拠のほうが重要になっている。

Heliosは単なる別のInstinctサーバーではない。これは、AMDが蓄積してきたデータセンター資産を、競争力のある単一製品へと統合しようとする試みだ。

MI455Xは低精度演算性能と432 GBのHBM4を提供し、Veniceはホスト処理を担う。Pensandoはスケールアウトネットワーキングを提供し、ROCmはシステムをAIフレームワークへ接続する。

BroadcomのTomahawk 6シリコンは、72基のアクセラレータ間を結ぶ中核リンクを提供する。Open Rack Wideハードウェアは、メーカーに共通の物理的基盤を与える。

この組み合わせにより、HeliosはNvidiaのAIインフラ戦略に対するAMDの最も包括的な挑戦となる。同時に、AMDはより厳しい評価基準にさらされることにもなる。

顧客はもはや、アクセラレータの仕様だけで同社を評価しない。ラックの可用性、アプリケーション性能、ソフトウェア品質、施設要件、信頼性、サポートを一つのパッケージとして評価することになる。

次の問いは実務的なものだ。Heliosが本番データセンターに導入された後、独立した運用事業者はAMDの主張を再現できるのか。最初の大規模導入を追い、完全なワークロード結果を比較し、オープンEthernetが1ラックを超えても効率を維持できるかを注視したい。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page