top of page

AMDとCerebras、低レイテンシー・高スループットAI推論で提携

AMDとCerebrasは、これまで異なる方向からAI推論に取り組んできた2つのコンピューティングシステムを結び付けた。7月23日に発表された両社の提携は、高スループットと低レイテンシーの両立を狙う。

Tom's Hardwareの報道によると、この分離型プラットフォームでは、プロンプト処理をAMD Heliosに割り当てる。Cerebras Wafer-Scale Engineは、メモリー負荷の大きいトークン生成を担う。両社は、Cerebras単独構成と比べ、ワット当たりの毎秒トークン数を最大5倍に高められると見込んでいる。

この主張は、独立した本番ベンチマークではなく、依然として両社のモデリングに基づくものだ。それでも、外部検証によって数値が裏付けられる前から、このアーキテクチャには意味がある。AMDとCerebrasは、AIリクエストの全段階を単一のアクセラレータ群が担うべきだという前提に異議を唱えている。

Nvidiaはすでに、ソフトウェアとハードウェアの戦略を通じて推論処理を分離している。今回の提携は、その分離を混在アーキテクチャの競争力を訴える論拠へと変える。AMDはラックスケールの処理能力を提供し、Cerebrasは特化型のデコード性能を提供する。

その構図は、ホメロスの『オデュッセイア』にある敵対的な遭遇ではなく、巨人たちの協調的な会合に近い。それぞれの巨人が、自らのアーキテクチャに適した仕事を担う。両者をつなぐ仕組みが効率的に機能するかどうかが、この提携を見栄えのよい図解以上のものにできるかを左右する。

Tom's Hardwareの報道が示す、変化の正体

AMDとCerebrasは、物理的に異なる2つのコンピューティングプラットフォームから、1つの推論サービスを構築している。

両社は7月23日、AMDのAdvancing AI 2026イベントで技術提携を発表した。このシステムは、AMD Heliosのラックスケール・インフラストラクチャとCerebras Wafer-Scale Engine技術を組み合わせる。

Cerebrasは、自社データセンターにHeliosシステムを導入する計画だ。両社によると、最初の一般提供は2026年後半にCerebras Cloudを通じて始まる見通しである。

この導入計画は、今回の発表を緩やかな互換性合意とは区別する。Cerebrasは自社のWSEラックの隣でAMD機器を運用し、統合インフラをサービスとして提供する。

このアーキテクチャは、大規模言語モデルの推論を主に2段階へ分割する。Prefillはユーザーのプロンプトを処理し、生成に必要な内部状態を作成する。Decodeは、ユーザーが目にする応答トークンを繰り返し生成する。

これらの段階は、ハードウェアに異なる負荷をかける。Prefillは、プロンプトに長い文書、取得したレコード、または広範な会話履歴が含まれる場合、計算負荷が高くなる。Decodeはモデルデータを繰り返し読み出すため、メモリー帯域幅と低い通信オーバーヘッドに大きく依存する。

AMD Heliosは、大きなコンテキストウィンドウを持つプロンプトを含め、prefillを処理する。Cerebras WSEシステムは、decodeとトークン生成を処理する。オーケストレーション層は、各リクエストとその中間状態をこれらの環境間で移動させなければならない。

公式のinference partnershipは、この分担を、対話性と全体的な処理能力のどちらかを選ぶ必要をなくす方法として提示している。AMDがスループットエンジンを提供し、Cerebrasが低レイテンシーの生成エンジンを提供する。

両社によると、統合プラットフォームはワット当たりの毎秒トークン数を最大5倍に高められる。この比較では、同程度の対話性におけるキロワット当たりの毎秒トークン数を用いている。

AMD Performance LabsとCerebrasは、2026年7月に、1兆パラメーターのKimi 2.6モデルを使用して結果をモデリングした。基準となったのはCerebras WSE単独構成であり、競合するNvidiaシステムではない。

この限定は重要である。5倍という数値は、あらゆる代替手段に対して5倍の優位性があることを示すものではない。特定のCerebras導入環境にAMDの処理能力を加えた場合、どの程度効率を改善できるかの推定値だ。

Tom's Hardwareは、もう1つの大きな欠落情報も指摘した。AMDとCerebrasは、2つのプラットフォームをどのように相互接続するのか説明していない。完全なワークフローについて、レイテンシー、スループット、利用率、信頼性の測定値も公表していない。

キー・バリューキャッシュ、すなわちKV cacheの移動は、特に重要である。このキャッシュにはprefill中に作成された情報が保存され、decodeシステムは以前の計算を繰り返すことなくリクエストを継続できる。

接続が遅ければ、大規模なキャッシュ転送は特化による利点を相殺しかねない。効率的なルーティングは、高速なWSEが過負荷のHeliosラックを待つことも防がなければならない。

したがって今回の発表は、性能に関する疑問を解決する前に競争地図を変える。AMDは、ウェハースケールプロセッサを設計せずにレイテンシー重視の推論へ参入する道を得る。Cerebrasは、自社の特徴的なアーキテクチャを置き換えることなく、大容量のプロンプトエンジンを得る。

この提携は、その設計に具体的な提供時期も与えた。顧客は2026年末までにCerebras Cloudを通じてこの構想を試せるようになる見込みだ。それまでは、アーキテクチャには説得力があるものの、その運用特性は未検証のままである。

AI推論が2つのハードウェア課題に分かれつつある理由

この提携が成立したのは、プロンプト処理とトークン生成がもはや単一で均質なワークロードとして振る舞わないためだ。

単純なチャットボットでは、この違いは見えにくい。ユーザーが短い質問を入力し、モデルが処理し、回答が表示される。推論の両段階は十分に速く進むため、インフラストラクチャは意識されない。

エージェント型ソフトウェアは、このパターンを変える。コーディングエージェントは、リポジトリー、issue履歴、ツール出力、繰り返しのフィードバックを取り込める。リサーチエージェントは、応答を生成する前に多数の文書を取得できる。

これらのアプリケーションは、プロンプト長と同時実行需要を増加させる。また、1つのユーザー操作に対してエージェントが複数回のモデル呼び出しを行うことがあるため、応答遅延もより目立つようになる。

Prefillは、すべての入力トークンを並列に処理する。その要求は、コンテキスト長、モデル規模、リクエスト量に応じて増大する。大規模GPUシステムは、高密度な計算を多くのアクセラレータに分散できるため、この処理に適している。

Decodeの挙動は異なる。通常、モデルは各新規トークンが以前の出力に依存するため、トークンを逐次生成する。高速な演算能力だけでは、速い応答は保証されない。

プロセッサは、重みとキャッシュされた状態に継続的にアクセスしなければならない。メモリー帯域幅、データ移動、スケジューリングは、ピーク演算性能の数値より重要になる場合がある。バッチ数を抑えれば応答性を改善できるが、システム全体の効率は低下しうる。

この相反関係が、インフラストラクチャにおける中心的な課題を生む。運用者は、多数のリクエストに必要なリソースを減らせるため、高スループットを望む。ユーザーは、遅いエージェントを反応が鈍いと感じるため、低レイテンシーを望む。

より多くのリクエストをまとめてバッチ処理すれば、多くの場合スループットは向上する。しかし、個々のリクエストの待ち時間は長くなりうる。一方の指標だけを最適化すれば、もう一方を損なう可能性がある。

分離型推論は、個別のワーカープールを作ることでこの対立に対応する。Nvidiaのserving documentationでは、KV cacheを作成し、それを転送して、リクエストをdecodeエンジンへ渡すprefillエンジンを説明している。

独立したプールにより、運用者は各フェーズを実際のボトルネックに応じて拡張できる。長いコンテキストを扱うトラフィックには、decodeを同じ規模で増強することなく、より多くのprefill処理能力を割り当てられる。高同時実行の生成には、より多くのdecodeワーカーを割り当てられる。

AMDとCerebrasは、このソフトウェア上の考え方を異なるプロセッサアーキテクチャにまたがって拡張する。Heliosは、EPYC CPUとAMDネットワーキングに支えられた従来型のラックスケールGPUを使用する。Cerebrasは、ほぼ1枚のシリコンウェハー全体から構成されたプロセッサを使用する。

従来のチップメーカーは、ウェハーを多数の個別ダイに切り分ける。Cerebrasはウェハーサイズのコンピュートファブリックを接続したまま維持し、小型プロセッサのクラスター間で見られる一部の通信境界を減らしている。

WSEのアプローチは、モデル演算とメモリー通信を大きな計算面の近くに保つよう設計されている。そのため、データ移動の反復が応答性に影響する高速トークン生成において、Cerebrasは有力な候補となる。

Heliosは方程式のもう半分をもたらす。このプラットフォームには、72基のInstinct MI455X GPU、EPYCサーバープロセッサ、Pensandoネットワーキング、オープンラック設計が含まれる。

AMDは、HeliosラックについてピークMXFP4性能を最大2.9 exaFLOPSとしている。また、31テラバイトのHBM4メモリーと、合計で毎秒約1.67ペタバイトのメモリー帯域幅も示している。

これらの数値は、アプリケーションベンチマークではなく、理論上のプラットフォーム仕様だ。それでも、AMDがHeliosを大規模なプロンプト処理エンジンとして位置付けたい理由を示している。

ゆえに、この提携はその巨大なハードウェアが示唆するほど不可解ではない。各社は単独で行動する場合、明確な弱点を持つ。AMDにはCerebrasの特化型ウェハースケールdecode経路がなく、CerebrasにはHeliosの幅広いラック容量がない。

両者を結び付ければ、より適切なリソース割り当てが期待できる。一方で、新たなネットワーク境界、新たなオーケストレーション課題、新たなソフトウェア統合層も生じる。価値は、特化による時間短縮が調整に要する時間を上回るかどうかにかかっている。

真の相手はNvidiaの統合型AIファクトリー

AMDとCerebrasは、推論を1つの協調したプラットフォームとして提供するNvidiaの能力に挑んでいる。

直接の相手は単一のNvidia GPUではない。アクセラレータ、ネットワーキング、システム、推論ソフトウェアを統合したNvidiaの組み合わせである。

Nvidia Dynamoはすでに分離型サービングをサポートしている。prefillワーカーとdecodeワーカーを分離し、KV cacheの状態を転送し、専用インフラを通じてリクエストをルーティングする。

Nvidiaは、自社GPUとネットワーキングを中心に構築した環境内でこのアプローチを適用できる。アーキテクチャには依然として異なるワーカーの役割があるものの、顧客は共通のソフトウェアスタックと主たる単一サプライヤーを得る。

Tom's Hardwareの報道は、この提携をNvidiaの先行するCPX構想とも比較した。その提案では、コンテキスト処理に特化ハードウェアを割り当て、高帯域幅メモリーGPUが生成を担っていた。

AMDとCerebrasは、その特化の構図を反転させる。Helios GPUがプロンプトと大規模コンテキストの段階を担い、Cerebras WSEハードウェアがレイテンシー重視のdecode段階を担う。

その報道以降、Nvidiaの競争上の位置付けは再び変化した。Nvidiaは現在、Vera Rubinプラットフォーム内の低レイテンシー推論アクセラレータとしてGroq 3 LPXを提示している。

Nvidiaは2026年にGroqの買収を完了し、かつての専門特化型ライバルを、より広範なインフラ戦略の一部へ組み込んだ。同社のGroq 3 architectureは、Dynamoを通じて低レイテンシーのハードウェアをRubin GPUと連携させる。

このため、AMDとCerebrasの提携は、単なる興味深いエンジニアリング上の取り決めにとどまらない。特化型推論ハードウェアと確立済みのデータセンタースタックを組み合わせられる競合に対する、代替的な連合を形成する。

AMDはいくつかの戦略的資産を提供する。EPYC CPUはすでにサーバー市場で相当な存在感を持つ。ROCmは顧客にオープンソースのソフトウェア基盤を提供し、Heliosはアクセラレータとネットワーキングをラックスケールの設計図としてパッケージ化する。

Helios specificationsには、72基のMI455X GPUと、合計で毎秒260テラバイトのスケールアップ帯域幅が含まれる。AMDはまた、このプラットフォームをOCP、UALink、Ultra Ethernetの標準を中心に設計した。

Heliosは、AMDが単体のラック製品として直接販売するものではなく、リファレンス設計である。OEMメーカーや設計パートナーは、この設計図に基づいてシステムを構築できる。

このモデルはサプライヤーの選択肢を広げ得る。一方で、構成差が生じ、性能比較を複雑にする可能性もある。提携による5倍という推定値でも、システムメーカーによって構成が異なり得ると注記されている。

Cerebrasは独自の戦略的な強みも加える。同社のハードウェアは独自のアーキテクチャと既存のクラウドサービスを備えており、オンプレミス環境で広く利用可能になる前に、この提携の展開先を提供する。

同社の開示によれば、AMDはCerebrasの2026年の資金調達にも参加した。この投資により、技術提携はより緊密な戦略的関係の中に位置付けられる。

ただし、いずれの事実も顧客採用を保証するものではない。エンタープライズの買い手は、可用性、モデル対応、運用ツール、信頼性、導入全体の複雑さを比較する。ピーク性能だけでインフラ購入が決まることは、ほとんどない。

Nvidiaは、ソフトウェアへの習熟度と導入経験において大きな優位性を維持している。多くのエンジニアリングチームはすでに、CUDAベースのツール、ライブラリ、運用手法を利用している。

AMDはROCm対応を改善し、移植性を強調している。しかし、この統合サービスには、単一のアクセラレータ群ではなく、AMD GPUとCerebrasプロセッサの双方にまたがるソフトウェアが必要になる。

これは別の形のオープン性を生む。顧客は異種ハードウェアと、潜在的により多くのサプライヤー選択肢を得る。その一方で、リリース、デバッグ、キャパシティ、サービスコミットメントを2社が協調して進めることに依存する。

この提携は、特化型設計の有効性を示すことでNvidiaに圧力をかける。最高のプリフィルエンジンと最高のデコードエンジンは、同じベンダーやアーキテクチャを共有する必要がない、という主張だ。

NvidiaによるGroq統合は、これとは反対の答えを示す。特化型設計は、それを取り巻くプラットフォームを1社が管理する場合に最も機能する、という立場である。

ここが主要な競争軸だ。AMDとCerebrasは巨大企業間の協業を提示する。Nvidiaは、複数の内部エンジンを抱える統合型の巨大企業を提示する。

5倍の効率性という主張には、ネットワーク形状の穴がある

この提携が掲げる最大の改善は、AMDとCerebrasが最も説明していない接続部分に依存している。

両社は、WSEのみの構成と比べて、ワット当たりのトークン出力が最大5倍になるとモデル化した。しかし、システムトポロジー、トラフィックパターン、リクエスト単位の結果を含む完全なベンチマークレポートは公開していない。

この推定値が本番性能を反映するかどうかは、いくつかの測定値によって決まる。最初のトークンまでの時間は、出力が始まるまでユーザーが待つ時間を示す。トークン間レイテンシは、後続トークンの間に生じる遅延を測る。

総スループットは、多数のユーザーにわたって提供されるトークン数を数える。エネルギー効率は、その処理量を消費電力と比較する。あるシステムが一つの指標で優れていても、別の指標では劣ることがある。

比較には代表的なワークロードも必要だ。長いコンテキストを扱うコーディングエージェントは、短い会話リクエストとは異なる形でプリフィルに負荷をかける。1兆パラメータのモデルは、高い同時実行性を持つより小規模なモデルとは異なる挙動を示す。

公式テストでは、Kimi 2.6の1兆パラメータモデルを使用した。AMDとCerebrasは、同等の対話性を保つ条件で、キロワット当たりのトークン数を評価した。

これは大規模モデルにとって関連性のあるシナリオだが、すべてのワークロードを説明するものではない。顧客には、モデル規模、コンテキスト長、バッチレベル、出力長、サービスレベル目標をまたぐ結果が必要だ。

ベースラインも同じように精査に値する。両社は統合ソリューションをWSEのみの構成と比較した。WSEリソースがそれまでプリフィルを処理していたワークロードでは、Heliosのキャパシティを追加すれば改善するはずだ。

しかし、それだけでは混在プラットフォームがHeliosのみのシステム、Nvidiaの導入環境、あるいは別の分離構成を上回るかは分からない。モデル化されたエネルギー効率を超えた経済的優位性も示されていない。

最も重要な未公表変数は、KVキャッシュの移動だ。プリフィルはデコードに必要なキャッシュデータを生成する。それをラック間で移動させると、遅延が加わり、ネットワーク容量を消費する可能性がある。

Nvidia自身のガイダンスは、この感度を示している。同社の分離型通信に関するドキュメントは、本番導入には高速なリモートダイレクトメモリアクセスが必要だと警告している。

同じドキュメントでは、RDMAと比較して、あるTCPベース構成で最初のトークンまでの時間が大幅に悪化したと報告されている。これらの数値は、AMD-Cerebrasプラットフォームではなく、Nvidiaがテストした環境に適用されるものだ。

それでも、エンジニアリング上の教訓は当てはまる。分離型設計が機能するのは、データ移動が高速で予測可能であり、トポロジーを考慮している場合に限られる。転送が遅ければ、特化型プロセッサが互いを待つことになる。

AMDのPensandoネットワーキングとオープンEthernet戦略は、可能性のある構成要素を提供する。Cerebrasも、データセンター規模でWSEシステムを接続してきた経験を持つ。ただし、両社はいまだ共同インターコネクト設計を公開していない。

ソフトウェアのオーケストレーションも別のリスクを生む。このプラットフォームは、各プロンプトをどのHeliosキャパシティで処理し、どのWSEでデコードするかを決定しなければならない。

キャッシュ状態を移動し、失敗したリクエストを復旧し、利用率を均衡化し、ストリーミング動作を維持する必要がある。また、開発者がこの分割を手動管理しなくて済むよう、単一のサービスインターフェースも提供しなければならない。

モデル互換性も重要になる。対応モデルは、両方の環境で最適化された実行を必要とする。更新は、プリフィルとデコードの実装間で同期を保たなければならない。

量子化はさらに複雑さを加える。低精度フォーマットはメモリ使用量を減らし、スループットを高められるが、両段階で互換性のあるモデル動作を維持する必要がある。

さらにキャパシティ計画の問題もある。プリフィルとデコードの需要は同じ割合では増えない。長いプロンプトが殺到すれば、WSEキャパシティが十分に活用されないままHeliosが飽和する可能性がある。

長い応答では逆の不均衡が生じる。このサービスには、どちらのプールも高価な待機室にならないよう、十分に独立したスケーリング能力が必要だ。

信頼性も共有責任になる。リクエストが遅くなった場合、運用者は原因がHelios、インターコネクト、ルーティングソフトウェア、あるいはWSEシステムのどこにあるのかを特定しなければならない。

したがって顧客は、5倍という主張を検証可能な仮説として扱うべきだ。これは構成を設計した企業による推定であり、独立した確認を欠いている。

この慎重さは、アーキテクチャの重要性を損なうものではない。むしろ、提携が自らを証明すべき正確な場所を示している。

巨大なプロセッサはすでに存在する。Helios設計には、すでに詳細なハードウェア仕様がある。未回答の問いは、それらをつなぐ橋が、一台のマシンの一部のように動作するかどうかだ。

Cerebras Cloudが巨大企業同士の協調を左右する

次の3つのシグナルは、この提携が本番プラットフォームになるのか、それともアーキテクチャ上の約束にとどまるのかを示す。

最初のシグナルは、Cerebras Cloudの初回リリースだ。両社は2026年後半の提供開始を見込んでおり、7月の発表後に残された期間は比較的短い。

意味のあるローンチには、対応モデルの明示、明確なサービス提供リージョン、利用しやすい性能ドキュメントが含まれるべきだ。また、レイテンシと可用性に関するサービスレベル目標も提示される必要がある。

限定プレビューであっても、基本的な統合を検証することはできる。幅広い顧客アクセスが実現すれば、オーケストレーションとキャパシティモデルが混在トラフィックの下で動作できる、より強い証拠となる。

このローンチでは、開発者がアーキテクチャにどのように接するかも明らかになるはずだ。最も優れた体験は、単一のエンドポイントを提供し、安定したインターフェースの背後にハードウェア間の移行を隠すものになる。

ユーザーがプリフィルとデコードのリソースを別々に管理しなければならないなら、プラットフォームの価値の多くは再びエンジニアリングチーム側へ戻る。それでは、単一の統合ワークフローという主張は弱まる。

2つ目のシグナルは、ベンチマークの開示だ。AMDとCerebrasは、最初のトークンまでの時間、トークン間レイテンシ、スループット、消費電力、利用率をまとめて公開する必要がある。

結果は複数のコンテキスト長と同時実行レベルを対象にすべきだ。また、同一のサービス目標の下で、統合プラットフォームをHeliosのみ、およびWSEのみの構成と比較すべきである。

新たな企業予測よりも、独立したテストのほうが重要だ。買い手は、コーディング、検索、エージェント、科学技術アプリケーションに関わる顧客ワークロードも確認すべきだ。

AMDのMI455X platformは、プリフィルの主張に信頼性を与えるのに十分な理論上のキャパシティを備えている。本番データは、そのキャパシティが効率よく使われ続けるかを示さなければならない。

モデル化された効率改善を確認するベンチマークは、中心的な論旨を強化する。キャッシュ転送レイテンシの弱さや利用率の偏りは、協調コストが利益を食いつぶしていることを示唆するだろう。

3つ目のシグナルは、Rubin、Groq 3 LPX、Dynamoを通じたNvidiaの対応だ。Nvidiaは、AMD-Cerebrasの設計を完全に模倣する必要はない。

より緊密な統合、より幅広いモデル対応、より優れた運用ツールによって対抗できる。また、既存のソフトウェア基盤を利用して、導入時の摩擦を減らすこともできる。

Nvidiaの強力な対応は、特化型デコードが戦略的に重要になったことを裏付ける。それでも、買い手をNvidiaプラットフォーム内にとどめることで、この提携を商業面で弱める可能性はある。

エンタープライズでの採用は、最終的にはベンチマークの勝利以上の要素に左右される。調達チームは、供給、サービス範囲、開発者ツール、モデル対応、障害復旧を評価する。

開発者は、一般的なフレームワークがカスタムコードなしで統合システムをターゲットにできるかを注視すべきだ。インフラチームは、両ハードウェア領域にまたがる可観測性を検証すべきである。

AIプロダクトリーダーは、実際のワークロードにおけるユーザー向けレイテンシに注目すべきだ。コーディングエージェントが反復し、ロボットが応答し、研究システムが複数の依存関係を持つ呼び出しを実行する際には、高速なトークン生成が重要になる。

ナレッジワーカーも、このインフラ競争に利害を持つ。より高速なエージェントは、ユーザーを長い待ち時間に強いることなく、情報を検索、統合、修正できる。

こうしたシステムを構築するチームには、自らの技術的コンテキストへ確実にアクセスできる環境も必要だ。検索可能なengineering knowledge baseは、検索負荷の高いプロンプトが処理すべき文書を整理できる。

Tom's Hardwareの報道は、推論設計におけるより広範な転換を示している。データセンターは、単一の汎用アクセラレータプールから、異なる段階に最適化された協調エンジンへと移行している。

AMDとCerebrasは、その転換に向けた明確な仕組みを提示した。Heliosは長いプロンプトと高いリクエスト量を処理し、WSEシステムは低レイテンシでトークンを返す。

今、提携には接続を明らかにし、測定値を公表し、実際の顧客トラフィックに耐えることが求められている。クラウドのローンチ、完全なベンチマーク、Nvidiaの対応に注目したい。

これらのシグナルがそろえば、異種推論は実用的な購買選択肢になる。そろわなければ、巨大企業同士は出会ったものの、一体となって動く術を学べなかったことになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page