SK hynixのAIインフラ分析:アーキテクチャが性能の上限を決める時代に
SK hynixは、AIインフラ戦略を明確な対立軸に沿って再定義した。より高速なプロセッサが、より高速または効率的なAIサービスを必ずしも保証しなくなったという点だ。同社の10月2日付分析は、メモリの配置場所、インターコネクトの設計、データ移動が、アプリケーションが実際に活用できるアクセラレータ性能を左右するようになったと主張している。
この結論は、AIワークロードの変化を反映している。学習には依然として膨大な計算能力が求められる一方、本番環境への投資は、推論、長大なコンテキスト、推論ループ、常時稼働するAIエージェントへとますます向かっている。これらのワークロードでは、モデルの重み、中間結果、保存されたコンテキストが繰り返し取得される。
したがって、中心となる競争はもはや半導体メーカー同士の争いではない。プロセッサ中心の設計と、メモリ中心のアーキテクチャの対決である。NVIDIA、クラウドプロバイダー、メモリメーカー、システム構築企業はいずれも対応を進めているが、それぞれが制御するスタックの範囲は異なる。
SK hynixのAIインフラ分析がボトルネックを再定義
重要な変化はSK hynixの新チップではなく、何をAI性能と見なすかという定義の拡張にある。
同社の最新のインフラ分析は、計算を、はるかに大きなデータ経路の一段階として位置付けている。情報はストレージからメモリへ移動し、キャッシュやインターコネクトを通過して、最終的にアクセラレータへ向かう。その後、結果はこの階層の一部を経由して戻される。
転送のたびにレイテンシが加わり、エネルギーが消費される。GPUが高速化しても、データ待ちや他のアクセラレータとの情報交換に時間を費やしている限り、これらのコストをなくすことはできない。
この主張は、汎用コンピューティングを形作ってきたプロセッサ中心モデルに疑問を投げかける。このモデルでは、データを中央プロセッサへ移し、要求された処理を実行し、その結果を別の場所へ移動する。キャッシュ、プリフェッチ、マルチスレッディング、アウト・オブ・オーダー実行は遅延の隠蔽に役立つが、ハードウェアとソフトウェアの複雑さも増す。
SK hynixは、この不均衡が深刻になったとしている。同社は、DRAMへの1回のアクセスには単純な算術演算の150倍から2,000倍のエネルギーを要し得るとする研究を引用している。また、大規模な機械学習モデルでは、メモリアクセスとデータ移動がシステムエネルギーの90%超を消費したとする研究も引用している。
これらの数値が、あらゆるモデルや導入環境を表すわけではない。チップ、メモリ技術、精度フォーマット、ワークロードのパターンが異なれば、結果も異なる。それでも、演算スループットを追加してもシステム全体では期待外れの向上にとどまり得る理由を示している。
大規模言語モデルの推論では、この不均衡をより容易に確認できる。各トークンの生成では、モデルが重みを読み込み、以前のトークン処理中に作られた情報を参照する必要がある。より高度な推論能力が、この挙動をなくすわけではない。むしろ処理の連鎖を長くし、保持すべき状態の量を増やすことが多い。
キー・バリュー・キャッシュ、すなわちKVキャッシュは、モデルがコンテキスト全体を再計算しなくて済むよう、過去のトークンから得たアテンションデータを保存する。計算量を節約する一方でメモリを占有し、そのサイズはコンテキストの長期化や同時セッション数の増加に伴って大きくなる。
これは、モデル学習とは異なる容量上の問題を生む。学習クラスタでは、多くの場合、大規模で計画的なバッチを処理できる。一方、推論サービスでは、予測不能なリクエスト、異なるコンテキスト長、ユーザー向けのレイテンシ目標に対応しなければならない。
エージェント型アプリケーションは、さらに複雑さを加える。エージェントはテキストを生成し、ツールを呼び出し、結果を待ち、その結果をコンテキストに追加して、次の推論サイクルを開始できる。セッションデータの価値が維持されるなか、アクセラレータは高負荷の処理とアイドル状態を交互に繰り返す可能性がある。
NVIDIAも、自社のagentic inference資料で同じ圧力を説明している。KVキャッシュの増大、不規則なツール待ち、低いGPU利用率を、長時間実行されるエージェントにおけるインフラの問題として挙げている。
両社は異なる商業的立場からこの問題に取り組んでいる。NVIDIAはアクセラレーテッド・コンピューティング・プラットフォームを販売し、SK hynixはそれらのプラットフォームに供給されるメモリ製品を提供する。それでも両社の診断は重なる。有用な性能は、プロセッサ、メモリ、ストレージ、ネットワーク、ソフトウェアを協調させることに依存する。
SK hynixは同時に、戦略的な主張も進めている。メモリが第一級の設計要素になれば、メモリサプライヤーはシステムアーキテクチャに対する影響力を得る。その役割は、より大容量または高帯域幅の部品を提供することを超える。
この発表は、製品発表というより、競争の行方に関する宣言に近い。SK hynixは購入者に対し、単独のプロセッサ仕様ではなく、データ経路全体を評価してほしいと考えている。
この変化が、記事の中心的な緊張を生み出している。AIインフラは計算能力を軸に購入・販売されてきたが、推論の経済性は、ますますその計算能力に十分なデータを供給し続けられるかどうかに依存している。
推論がメモリを制約資源に変える
推論は最適化の目標を、最大規模の計算を完了することから、許容可能なシステムコストで応答性の高いトークンを提供することへと変える。
学習処理は大量の電力と計算能力を消費するが、開始と終了が明確に定義されている。推論は継続的なサービスである。ユーザーのプロンプトごとに、運用者が継続的に管理すべき期限、状態、データ移動が生じる。
チャットボットであっても、言語モデルは出力を一度に1トークンずつ生成するため、繰り返しメモリにアクセスする必要がある。推論システムは、最終回答を示す前に多くの内部トークンを生成することがある。エージェントは、そのプロセスを複数のツールや外部データソースにまたがって繰り返すことができる。
コンテキスト長は負担を増幅する。モデルは、アテンション層が後から使用する可能性のある情報を保持しなければならない。アテンション層は、利用可能なコンテキストのどの部分が次の計算に重要かを判断する。
KVキャッシュは以前のアテンション計算の繰り返しを避けるが、そのトレードオフにより圧力はメモリへ移る。容量は、アクティブな状態を維持できるセッション数を決める。帯域幅は、システムがそれらの状態をどれだけ迅速に取得できるかを決める。
High Bandwidth Memory、すなわちHBMは、この問題の一部に対応する。HBMはメモリダイを垂直に積層し、高帯域幅メモリをアクセラレータの近くに配置する。この構成は、プロセッサからより離れた場所にある従来のメモリよりも、はるかに高速にデータを供給する。
SK hynixはHBMの主要サプライヤーであるため、HBMを強調する明確な利害を持つ。ただし同社は、HBMだけでボトルネックが解消されるとは主張していない。その分析では、経路全体にストレージ、ネットワーク、メモリコントローラ、インターコネクトを含める必要があるとしている。
この留保は重要だ。高価なアクセラレータであっても、データがより低速な階層に置かれていたり、混雑したリンクを通過しなければならなかったりすれば、待機状態になり得る。アクセラレータの隣に高速メモリを追加しても、実際にそのメモリを使用する転送しか改善しない。
容量と速度が衝突する場合もある。最速のメモリ階層は希少であり、すべてのアクティブセッションに割り当てるには高コストとなる。低速なDRAMとストレージはより大きな容量を提供するが、キャッシュされたコンテキストを階層間で移動させると遅延を招く可能性がある。
そのため、本番システムには配置ポリシーが必要となる。頻繁に再利用される情報はアクセラレータの近くに保持すべきだ。非アクティブなコンテキストは別の階層へ移せるが、モデルが再び必要とする前にシステムが取得できなければならない。
NVIDIAのcache managementドキュメントは、キャッシュの再利用とルーティングを主要な最適化対象として説明している。不要な転送と計算の繰り返しを減らすため、リクエストは有用なコンテキストをすでに保持しているワーカーへ送るべきだとしている。
このことにより、サービングソフトウェアもアーキテクチャをめぐる議論の一部となる。ハードウェアは容量と転送経路を提供するが、モデルの状態をどこに置くかはソフトウェアが決める。また、その状態をいつ移動させるか、次のリクエストをどのプロセッサが処理するかも決定する。
その結果、運用上の単位も変わる。毎秒リクエスト数は依然として有用だが、多数の連続したモデル呼び出しを実行するエージェントを完全には表せない。運用者は、トークン、アクティブなコンテキスト、キャッシュ再利用、レイテンシ、ハードウェア占有率も理解する必要がある。
この圧力は、クラウドプロバイダーと企業インフラチームに及ぶ。アクセラレータ台数という見出しの数字ではなく、ワークロードの挙動に応じたプロビジョニングが求められる。バランスの悪いクラスタは、相当な計算能力を保有しながらも、低いトークンスループットしか提供できない可能性がある。
開発者も影響を受ける。すべての会話を無期限に保持するアプリケーションは、メモリ需要を膨らませかねない。大規模なプロンプトを繰り返したり、ワーカー間で無作為にリクエストを移動させたりするエージェント設計は、キャッシュ再利用の利点を損なう可能性がある。
これは、開発者がチップアーキテクトになる必要があるという意味ではない。アプリケーションの挙動が、インフラの効率により直接的な影響を与えるようになったという意味である。コンテキスト管理、リクエストルーティング、モデル選定は、アプリケーションの下層で移動するデータ量を変えられる。
エンジニアリングチームには、アプリケーション上の意思決定と観測されたインフラ挙動を結び付ける記録も必要になる。検索可能なエンジニアリング・ナレッジベースは、ベンチマークの前提、デプロイ変更、インシデントで得た知見をチーム横断で保存できる。
より大きな帰結は経済性にある。購入者は、ピーク時の毎秒演算数だけから推論効率を見積もることはできない。コンテキストが増大し、セッションが停止し、リクエストがメモリを奪い合うときに、システムがどのように振る舞うかを問わなければならない。
これが、SK hynixのAIインフラに関する主張が今重要である理由だ。推論はアーキテクチャを実装の詳細から、製品のコストと応答性を左右する要素へと変える。
真の競争はアーキテクチャ対コンポーネント速度
主な競争相手は別のメモリベンダーではない。個々のコンポーネントが高速化すれば、AIシステム全体も自動的に高速化するという考え方である。
コンポーネントの改善は依然として重要だ。高速なアクセラレータは演算をより早く完了し、帯域幅の広いメモリはより速くデータを供給し、優れたネットワークはノード間で情報を移動させる。しかし、購入者がこれらの仕様を独立した加算可能なものとして扱うと、問題が生じる。
システム性能は、重要な経路のなかで最も遅い部分に左右される。モデルの重みを待っている間、演算ユニットが使われていないプロセッサは価値を生まない。接続が必要な速度でデータを提供できなければ、メモリ容量を追加しても役に立たない。
プロセッサ中心のシステムは、ますます複雑な仕組みによって補おうとする。複数のキャッシュ階層は、頻繁に使われる情報を計算資源の近くに保持する。プリフェッチャは次に必要となるデータを予測する。並列スレッドは、停止中にプロセッサが別の作業を行えるようにする。
これらの手法は依然として有用だが、AIワークロードはその限界を露呈させる。モデルパラメータとコンテキストはローカルキャッシュを超えることがある。アクセスパターンも、プリフィル、トークン生成、検索、ツール実行、マルチエージェント協調の間で変化する。
メモリ中心コンピューティングは、異なる問いから始まる。データを中央プロセッサへどれほど速く到達させられるかではなく、データがすでにどこに存在するかをアーキテクトは問う。そして、その場所を中心に計算と転送経路を配置する。
このアプローチは、すべての処理をメモリ内で実行することを求めるものではない。一部のデータはGPUの隣にあるHBMに置くべきだ。別の情報は、デバイス間で共有されるプール型メモリに置くことができる。選択された処理は、メモリの近くに配置されたアクセラレータ上で実行できる。
最適な構成はワークロードによって異なる。モデルアーキテクチャ、バッチサイズ、コンテキスト長、レイテンシ要件、同時リクエスト数はいずれもバランスを左右する。ネットワークトポロジーやソフトウェアのスケジューリングによって、そのバランスはさらに変化し得る。
こうした変動性こそが、再構成可能なインフラが注目を集める理由である。固定的なサーバー構成では、プロセッサとメモリがあらかじめ決められた比率で組み合わされる。その比率によっては、あるリソースが枯渇する一方で、別のリソースが十分に活用されないことがある。
ディスアグリゲーテッドシステムでは、リソースをプールとして分離する。CPU、アクセラレータ、メモリ、ストレージ、ネットワークを、ワークロードの要件に応じて組み合わせられる。メモリを多く必要とするサービスは、他のすべてのコンポーネントを重複配備することなく、より大きなプールを利用できる。
ただし、プーリングにはコストが伴う。リモートアクセスは通常、レイテンシを増加させ、インターコネクトの帯域幅を消費する。共有リソースは新たな競合点にもなり得る。このアーキテクチャが成功するのは、柔軟性による節約が通信コストを上回る場合に限られる。
これがSK hynixの主張における核心的な転換である。より多くのデータをより高速に移動させることが、常に最善の答えとは限らない。より優れた設計とは、そもそもデータ移動を避ける設計かもしれない。
AIが推論へと軸足を移すにつれ、この原則の重要性は増している。学習では、高い計算密度を備えた大規模かつ同期的なクラスターが有利になる。一方、推論ではリクエスト形状が多様であり、応答時間への要求もより厳しい。
同じインフラが、短いプロンプト、文書分析、コード生成、長時間稼働するエージェントを処理する場合もある。各ワークロードは、メモリ容量、帯域幅、ストレージ、通信に異なる負荷をかける。
静的なクラスターは一つのプロファイルに最適化できても、別のプロファイルでは性能が大きく低下し得る。再構成可能なリソース配置は利用効率の改善を見込めるが、それには高度なオーケストレーションソフトウェアも必要となる。インテリジェントなスケジューリングを伴わないハードウェアの柔軟性は、ボトルネックを移し替えるだけになりかねない。
NVIDIA自身の設計も、アクセラレータベンダーがこの問題を認識していることを示している。同社の NVLink fabric は、専用の高帯域幅パスでGPUを接続し、一般的な周辺機器インターフェースの範囲を超えた協調を可能にする。
これはSK hynixの立場を否定するものではない。むしろ、プロセッサ性能がメモリと通信のアーキテクチャにますます依存していることを裏付ける。競争上の争点は、誰がそのアーキテクチャを制御し、その構成要素がどの程度オープンに相互運用できるかにある。
独自のスケールアップファブリックは、緊密に統合された性能を提供する。オープンなインターコネクト標準は、より幅広いデバイス選択肢とメモリ拡張を提供できる。どちらのアプローチも、すべてのワークロードで自動的に優位になるわけではない。
クラウドプロバイダーは両方を利用する可能性がある。密接に接続されたアクセラレータは通信集約型のモデル処理を担い、プールされたメモリはより長いコンテキストや利用頻度の低いデータを支える。ストレージは、取得時間が長くても許容される情報のための、別の容量階層となり得る。
したがって、プロセッサ中心型とメモリ中心型というラベルは、絶対的な分類として捉えるべきではない。現代のシステムは両方を組み合わせている。意味のある違いは、その設計がどのコストを根本的なものとして扱うかにある。
プロセッサ中心型の設計は、計算資源が希少であると見なし、データを計算資源へ移動させる。メモリ中心型の設計は、データ移動が希少な資源であると捉え、データの周辺により多くの計算を配置する。推論は後者の前提を強めている。
CXL、NVLink、ニアメモリ処理が担う役割の違い
メモリ拡張、GPU間通信、ローカル処理はそれぞれ異なる機能を果たすため、単一のインターコネクトやアクセラレータだけでデータ問題を解決することはできない。
Compute Express Link、すなわちCXLは、プロセッサ、アクセラレータ、メモリデバイスの間にキャッシュコヒーレントな接続を提供する。キャッシュコヒーレンスにより、コンポーネントは更新のたびにすべてを手作業でコピーすることなく、共有データについて一貫した状態を維持できる。
CXLはメモリ拡張とプーリングをサポートできる。システムは、単一のプロセッサに物理的に接続されたメモリを超える容量を公開できる。プラットフォームとソフトウェアが対応していれば、複数のデバイスが共有リソースを利用することも可能だ。
この柔軟性は、遊休化した容量を対象とする。あるサーバーやアクセラレータではメモリが不足する一方、別の装置には未使用の空き容量があるかもしれない。プーリングにより、現在のワークロードに基づいて容量を割り当てる機会が生まれる。
CXLは、メモリとローカル処理を組み合わせたデバイスも可能にする。完全なデータセットを中央のアクセラレータへ送る代わりに、ニアメモリデバイスが選択された処理をローカルで実行できる。その後、より小さな結果だけを返す。
NVLinkとNVSwitchは、システムの別の部分を対象とする。NVLinkはNVIDIAのプロセッサやアクセラレータ間に高帯域幅接続を提供する。NVSwitchはこれらの経路を拡張し、より大きなGPU群がスイッチングファブリックを通じて通信できるようにする。
大規模モデルでは、パラメータや中間値が複数のアクセラレータに分割されることが多い。これらのデバイスは、アクティベーション、部分的な結果、同期メッセージを交換しなければならない。通信が遅ければ、GPUを追加する利点は小さくなる。
したがってCXLは柔軟なメモリアクセスと拡張を重視し、NVLinkは緊密に協調するアクセラレータ間通信を重視する。両者は同一の役割を担うことなく、より広い共通目標を支援できる。
ニアメモリアクセラレーションは、この設計をさらに推し進める。計算をメモリデバイス内またはその近傍へ移し、システム全体を移動するデータ量を減らす。このアプローチは、限られた通信で処理をローカル実行できる場合に最も効果を発揮する。
Tesseractは、初期の研究例を示している。その設計者らは、3D積層メモリの近傍に処理ユニットを分散配置し、グラフデータをそれらの間で分割した。各ユニットはローカルデータを処理し、必要な場合にのみメッセージを交換した。
2015年の Tesseract study では、5種類のグラフワークロード全体で平均10倍の性能向上が報告された。また、評価対象となった従来システムと比べ、平均エネルギー消費量が87%低減したとも報告している。
これらの結果は、現代の本番言語モデルサービスではなく、グラフ処理から得られたものだ。それでもこの実験は、処理能力とメモリ帯域幅を同時に拡張すれば、性能も拡張できるというアーキテクチャ上の原則を示した。
より新しいプロジェクトは、同様の考え方を言語モデル推論に適用している。CXL-Enabled GPU-Free Systemの略であるCENTは、CXLによるメモリ拡張と、メモリバンク近傍に配置された処理ユニットを組み合わせる。
査読済みの CENT research は、同程度の平均電力において、選定したGPUベースラインよりスループットが2.3倍高く、エネルギー消費が2.3倍低いと報告している。また、ドル当たりトークン数は5.2倍だったとしている。
これらの数値は慎重に解釈する必要がある。これは著者らがモデル化・評価したアーキテクチャ、ワークロード、ベースライン、前提条件を説明するものだ。GPUを使わない推論が、主流のアクセラレータ導入を置き換える準備が整っていることを示すものではない。
それでもCENTは、支配的な設計に対するストレステストとなる。トークンを一つずつ生成する自己回帰型推論は、しばしば学習より演算強度が低い。演算強度とは、移動したデータの単位量あたりにどれだけの計算が行われるかを示す指標である。
演算強度の低いワークロードは、メモリ律速になり得る。メモリが十分な速度でデータを供給できない場合、計算ユニットを増やしても得られる利点は小さい。特化したニアメモリ設計は、この不整合を狙うことができる。
アーキテクチャ上の問いは、新たな協調コストを生まずに、どこまで処理を移動できるかである。アテンション、モデルレイヤー、分散通信は完全には分割できない。一部の処理では依然として、複数デバイスからの結果が必要になる。
プログラミング支援も別の障害となる。開発者はすでに成熟したGPUフレームワーク、最適化済みカーネル、デプロイメントツールに依存している。新たなニアメモリアーキテクチャは、それらのソフトウェアと統合するか、高コストな移行を正当化しなければならない。
可観測性も難しくなる。分散システムでは、計算がアクセラレータ、メモリコントローラ、ストレージ階層の間を移動し得る。運用者はその経路全体で、時間とエネルギーがどこに費やされているかを把握する必要がある。
セキュリティ境界にも注意が必要だ。共有メモリプールは、ワークロードとテナントを分離しなければならない。永続的なエージェントコンテキストには、機密性の高いプロンプト、取得文書、認証情報、ツールの結果が含まれ得る。
こうした懸念は設計を否定するものではない。アーキテクチャがベンチマーク速度以上のものを決定する理由を示している。信頼性、分離性、プログラム可能性、スケジューリングはいずれも本番環境での性能の一部である。
研究結果は本番導入の証明ではない
メモリ中心型設計には信頼できる根拠があるが、最も強い結果であってもワークロード固有であり、導入時の経済性を保証するものではない。
SK hynixの記事は、公表済みの研究と業界予測を組み合わせている。研究は、データ移動がエネルギーとレイテンシを支配し得るという主張を支持する。しかし、ある一つのアーキテクチャが標準になることを証明するものではない。
Tesseractはグラフワークロードでニアメモリ処理を実証した。CENTは、言語モデル推論向けの意欲的なCXLベース設計を評価した。どちらも技術的可能性を示す一助となるが、本番サービスには研究プロトタイプでは完全に再現できない制約がある。
実際の導入環境では、変化するモデル、精度フォーマット、コンテキストポリシー、レイテンシ目標をサポートする。また、障害、ソフトウェアアップグレード、ノイジーネイバー、トラフィック急増にも対処する。どのアーキテクチャも、こうした条件下で性能を発揮しなければならない。
比較結果は、選定されたベースラインに大きく左右される場合がある。バッチ処理やキャッシュ再利用が弱いGPUプラットフォームは、非効率に見えるかもしれない。高度に最適化されたサービングスタックは、基盤ハードウェアを変えずに利用効率を高められる。
モデル進化も別の不確実性を生む。KVキャッシュサイズを縮小する技術は、メモリ圧力を弱め得る。より少ないビットで値を表現する量子化は、モデルとキャッシュのフットプリントを減らせる。改善されたアテンション手法は、アクセスパターンを変え得る。
ソフトウェアによって不要な移動を回避することもできる。プレフィックスキャッシュは共有されるプロンプト部分を再利用する。キャッシュ認識型ルーティングは、関連する状態を保持するワーカーへ関連リクエストを送る。分離されたプリフィルとデコーディングは、異なるフェーズを特化したリソースプールへ割り当てる。
NVIDIAの multi-tier cache アプローチは、KVデータをGPU HBM、CPUメモリ、ローカルNVMeストレージ、リモートストレージにまたがって配置する。これはGPUインフラを基盤としたメモリ中心型の対応策である。
これは競争の構図において重要である。メモリ中心型コンピューティングは、必ずしもGPUを置き換えるわけではない。データ管理に費やす処理を減らすことで、GPUの実効利用率を高める可能性がある。
ニアメモリプロセッサは、製造と標準化に関する課題にも直面する。ロジックの追加は、面積、熱挙動、歩留まり、製品コストに影響を及ぼし得る。クラウド事業者が広く導入するには、新しいデバイスに安定したインターフェースが必要だ。
CXLは柔軟性をもたらすが、CXL接続はローカルHBMと同等ではない。容量、帯域幅、レイテンシはそれぞれ異なる位置づけにある。ワークロード配置では、こうした違いを考慮しなければならない。
ディスアグリゲーションは、通信を増やしながらリソース利用率を改善できる。あまりに多くのデバイスにサービスを提供するリモートプールは、輻輳する恐れがある。不適切に配置された処理は、固定サーバーの場合より遠くまで移動することになり得る。
したがって、SK hynixの主張を文字通り受け取るなら、その最も強い形は広すぎる。アーキテクチャはコンポーネント性能を代替しない。低速なプロセッサ、性能の弱いメモリ、制約のあるネットワークのいずれも、システムを制限し得る。
より擁護可能な結論は、コンポーネント性能のどれだけを実用に供せるかをアーキテクチャが決める、というものだ。より高速な部品には依然として価値があるが、その価値はデータ配置と協調に左右される。
商業的なインセンティブも、読み解く際に考慮すべきだ。顧客がメモリを戦略的なシステムリソースとして扱うほど、SK hynixには利益がある。顧客が緊密に統合されたアクセラレーテッドプラットフォームと独自ファブリックを採用するほど、NVIDIAには利益がある。
そのインセンティブが、どちらの主張も誤りにするわけではない。むしろ独立したベンチマークの重要性を高める。購入者には、自らのモデル、セッション長、リクエストパターン、信頼性要件を反映したテストが必要だ。
コスト比較では、ハードウェアの取得費だけでなく、電力、冷却、ラックスペース、稼働率、ソフトウェア開発、運用、移行も含めるべきである。特化型の設計は省エネルギー化につながる一方、より多くのエンジニアリング支援を必要とする可能性がある。
ベンチマークでは、応答時間分布の後半にある遅いリクエストを測るテールレイテンシーも報告すべきだ。平均スループットでは、ユーザーが直接体感する停止を見落としかねない。
永続的なエージェントは、さらに別の課題を提起する。コンテキストを近くに保持すれば応答性は向上するが、アイドル状態のセッションが貴重なメモリを占有する可能性がある。積極的な退避は容量を節約する一方、エージェントが再開した際に高コストな再読み込みを招く。
このトレードオフは、コンピューティングにおける他のキャッシュと似ているが、その規模はより大きい。1つのセッションでも、大量のコンテキストと中間状態を保持し得る。数千のエージェントが同時に動作すれば、配置ポリシーは主要な容量判断となり得る。
懐疑的な立場は、メモリ中心コンピューティングに価値がないというものではない。普遍的な構成はまだ確立されていない、ということだ。ワークロードの差異は大きく、技術スタックも変化を続けている。
SK hynixが示したのは方向性であり、現在のデータセンターを置き換える完成品ではない。次に必要な証拠は、導入可能な製品、相互運用可能なシステム、再現可能なワークロードレベルの測定から得られなければならない。
メモリ中心AIが勝つかを示す3つのシグナル
この仮説が強まるのは、新しいシステムがデータ移動の削減を、実際の推論ワークロード全体で測定可能な成果へと変えた場合に限られる。
第1のシグナルは、プール型・階層型コンテキストメモリを中心とする製品レベルの統合だ。アプリケーションにすべての転送を処理させることなく、HBM、DRAM、ストレージにまたがるKVキャッシュを管理できるシステムに注目したい。
重要な測定値は理論上の容量ではない。より多くの同時セッションを支えながらレイテンシーを維持できるかどうかである。高いキャッシュヒット率と予測可能なテールレイテンシーは、アーキテクチャ優先の仮説を裏付ける。
コンテキストの到着が頻繁に遅れるなら、この主張は弱まる。追加の容量が応答性を犠牲にして得られることになるためだ。運用者は、より多くのローカルメモリや、より単純な固定構成を好むかもしれない。
第2のシグナルは、CXLメモリプーリングとニアメモリ処理の導入拡大だ。発表だけでは結論は出ない。購入者には、相互運用可能なハードウェア、オペレーティングシステムのサポート、オーケストレーションツール、アプリケーションフレームワークが必要である。
導入が成功したといえるには、共有容量がインターコネクトを圧迫せずに稼働率を改善することを示すべきだ。また、分離、障害処理、混合ワークロード下での性能も文書化する必要がある。
CXLが限定的な拡張用途にとどまるなら、メモリ中心アーキテクチャは前進を続けるとしても、その再構成可能というビジョンの進展はより緩やかになる。独自のスケールアップファブリックが、高性能な導入環境に対する支配力をより多く維持する可能性がある。
第3のシグナルは、システム全体を測定する独立した推論ベンチマークだ。テストには長いコンテキスト、マルチターンのエージェント、ツール待機、キャッシュ退避、同時ユーザーを含めるべきである。
ピーク演算スループットは引き続き重要だが、トークンレイテンシー、トークン当たりのエネルギー、メモリ利用率、ネットワークトラフィックと並べて示されるべきだ。購入者には、慎重に選ばれた1つのモデルだけでなく、変化するワークロードでの結果も必要である。
複数のモデルファミリーにわたる証拠があれば、SK hynixのAIインフラに関する主張はより強固になる。結果が1つのアーキテクチャや合成トラフィックに限られる場合、不確実性はより大きく残る。
読者は、ベンダー間で責任がどう移るかにも注目すべきだ。メモリメーカーは、より多くのロジック、ファームウェア、リファレンスアーキテクチャを提供するようになる可能性がある。アクセラレータ企業は、ストレージとコンテキスト管理に対する支配を拡大するかもしれない。
クラウドプロバイダーは、おそらく両方のアプローチを組み合わせる。アクセラレータ、メモリプール、ストレージをまたぐ独自のオーケストレーション層を構築できるためだ。その規模により、配置を動的に最適化するのに十分なワークロードデータを得られる。
開発者と企業の購入者にとって、当面の教訓は実務的である。提供処理の各フェーズで、モデルの重みとコンテキストがどこに存在するのかを問うべきだ。それらがどれほど頻繁に移動し、どのリンクを通過し、輻輳時に何が起こるのかも確認する必要がある。
次に、そのシステムがそれらの経路を測定しているかを問う。GPU利用率だけでは、キャッシュ転送で停止するサービスを説明できない。メモリ容量だけでも、プールがデータを適時に供給できるかは分からない。
AIエージェントは、コンテキストを永続的なインフラ状態へと変えるため、こうした問いを切迫したものにする。各推論ループはその状態を拡大し得るうえ、ツール呼び出しのたびに予測可能な処理が中断され得る。
勝つアーキテクチャは、より多くのメモリをより多くの計算資源のそばに置くだけのものではない。通信オーバーヘッドを抑えながら、各ワークロードに適切なデータパスを対応させるものになる。
その実現には、チップ、インターコネクト、ストレージ、提供ソフトウェア、アプリケーション設計にまたがる協力が必要となる。単一の仕様で、最終的に得られる性能を説明することはできない。
したがって次回のインフラレビューで問うべきことは具体的だ。最新の投資は有用なデータ移動を減らしたのか、それとも単に高速なコンポーネントを1つ追加しただけなのか。この違いが、SK hynixのメモリ中心という仮説が本番環境の標準になるのか、それとも影響力のある設計上の主張にとどまるのかを決める。



