top of page

SemiAnalysis 4-hi HBM分析:より短いスタックがAI推論で優位になり得る理由

9月14日
読了時間: 23分

SemiAnalysisは、4-hi HBMならDRAMダイを3分の1しか使わずにフル帯域幅を実現できるとして、AIメモリ業界の高積層化競争に異を唱えている。

この主張が重要なのは、アクセラレータメーカーが長年にわたり、より高いメモリスタックを採用してきたからだ。層数の増加は容量を拡大し、より大規模なモデルを支え、高帯域幅メモリをAIコンピューティングに不可欠な要素として定着させた。

Semianalysisの4-hi HBM分析によると、推論はこの計算を変えつつある。ラックスケールのシステムは総容量を増やし、量子化やキャッシュのオフロードは各GPUが保持すべきデータ量を減らしている。

このレポートは、すべてのワークロードで必要メモリが減るとは述べていない。トレーニング、大規模バッチ、将来のモデルでは、より高いスタックが依然として有利になり得る。より鋭い論点は、容量が不足する前に帯域幅がトークン生成を制約しがちなインタラクティブ推論に関するものだ。

これにより、2つの設計優先事項が直接競合する。一方はアクセラレータ当たりの最大メモリ容量を重視する。もう一方は、制約のあるDRAMウェハー1枚から得られる最大トークン帯域幅を重視する。

Nvidiaによると報じられるRubin Ultraのメモリ削減は、直近のシグナルとなる。SemiAnalysisは、このアクセラレータが搭載するHBMは192GBで、標準版RubinおよびBlackwell Ultraの288GBから減少するとしている。

同社は4-hi Rubin Ultra構成を公表していない。ただし、8-hiスタックへの移行が報じられていることは、HBMのさらなる高積層化がもはや自動的な選択ではないことを示唆する。

この考え方が4-hi HBM4Eにも当てはまるなら、AIインフラは各スタックの外部帯域幅を犠牲にせず、より少ないDRAMダイで構成できる。これによりメモリコストを下げ、限られたウェハー供給からより多くの実用的なHBMパッケージを生産できる可能性がある。

Nvidiaのメモリロードマップはもはや一方向には進んでいない

重要な変化は、Nvidiaが突然わずかなメモリしか必要としなくなったことではない。追加容量が、どんなコストを払ってでも価値を持つとは見なされなくなったことだ。

Blackwell Ultraは、高容量化の方向性を明確に打ち出した。NvidiaはBlackwell Ultra GPU当たり288GBのHBM3Eと、GB300 NVL72ラック全体で20TBを掲げている。

同社のGB300仕様では、GPUメモリ帯域幅の合計が毎秒576TBに達することも示されている。これらの数値は、Nvidiaがこれまで容量と帯域幅の双方を重視してきた理由を示している。

SemiAnalysisは現在、Rubin Ultraがこの傾向の一部を反転させると報じている。GPU当たり192GBという予想値は、Blackwell Ultraおよび従来型Rubinの値から3分の1の減少に当たる。

この比較には注意が必要だ。Rubin Ultraのアーキテクチャは、4つのコンピュートダイから2つへ変更されたと報じられている。そのため、以前に想定されていたメモリ容量は異なるシステム設計に属していた。

この変更を補正しても、SemiAnalysisはメモリが従来のコンピュートダイ当たり256GBから96GBへ低下すると見積もっている。これは表面的な仕様調整ではなく、大幅なアーキテクチャの再設定だ。

レポートは、その一因として供給を挙げている。Nvidiaは高度なロジックおよびパッケージング能力を相当量確保していると報じられるが、利用可能なHBMウェハーは12-hiスタックを同等規模で支えられない。

12-hiスタックには、ベースダイの上に12個のコアDRAMダイが含まれる。8-hiスタックでは8個となるため、同じ量の処理済みDRAM供給で、より多くの完成スタックを支えられる。

これは、HBMが従来型DRAMよりビット当たりで多くの製造能力を消費するため重要だ。TSVとして知られるシリコン貫通電極は、メモリスタックを垂直方向に通じて信号と電力を運ぶ。

これらのTSVには追加の処理が必要となる。HBMダイには垂直接続用の面積も必要であり、同程度のプロセスで製造される通常のメモリと比べてビット密度が低下する。

SemiAnalysisは以前、HBMは汎用DRAMと比べてビット当たりおよそ3倍のウェハー製造能力を消費すると推定した。生産がHBM4へ移行するにつれ、その推定値は4倍近くに達する。

この数値は業界標準ではなく、アナリストによる推定だ。ただし、その根底にある製造負荷はメモリ各社で広く認識されている。

SK hynix、Samsung、Micronは、複数の良品ダイを処理、薄型化、接続、テスト、パッケージングしなければならない。層が1つ増えるごとに材料使用量が増え、パッケージは追加の歩留まりリスクにさらされる。

アクセラレータがその容量を必要としていたため、高積層スタックは歴史的にこの負担を正当化してきた。モデル重み、活性化、勾配、オプティマイザ状態、キー・バリューキャッシュは、ワークロードごとにいずれもメモリを奪い合う。

新たな判断は、一部の推論システムで容量が閾値を超えたことを示唆する。ラックが必要なワーキングセットを保持できるようになると、各GPUにメモリを追加しても得られる価値は小さくなる。

NvidiaはSemiAnalysisが示したRubin Ultraの正確な容量構成を公表して確認してはいない。したがって、この主張は確定した製品仕様ではなく、報じられたロードマップ変更として扱うべきだ。

それでも、サプライチェーンの準備は公表前に方向性を明らかにし得る。SemiAnalysisによると、業界が12-hiおよび16-hi製品へと押し上げた後、サプライヤーは8-hi構成が標準になる準備を進めている。

この変更により、4-hi HBMへの道が開かれる。8層で十分なら、設計者は4層で選定された推論導入をより経済的に支えられるかを問う必要がある。

最近の容量競争の最中であれば、この問いは逆行しているように聞こえただろう。厳しいDRAM制約の下では、これは業界で最も実践的なアーキテクチャ上の選択肢の1つとなる。

SemiAnalysisの4-hi HBMはダイを減らしながら帯域幅を維持する

より短いHBMスタックは容量を減らすが、パッケージの外部帯域幅を自動的に減らすわけではない。

HBMは、極端に高い信号速度だけに頼るのではなく、非常に広いインターフェースを通じてデータを転送する。HBM4はこのインターフェースを、スタック当たり2,048本のデータ接続へ拡張する。

HBM4規格は、2025年4月にJEDECが発表した。これはAIおよび高性能メモリの新世代を支える基盤を定義している。

SemiAnalysisによると、各HBM4 DRAMダイはスタックのデータ接続のうち最大512本にアクセスできる。そのため、4個のダイですべての2,048接続を利用できる。

5個目から12個目までのダイを追加すると容量は増える。しかし、外部インターフェースが2,048接続を超えて広がるわけではない。

高積層スタックでは、利用可能なピンがより多くのメモリ層に分割される。スタックは依然としてアクセラレータに対し、同じ総インターフェースを提供する。

これが短スタック論の中核となる仕組みだ。4-hi、8-hi、12-hiのパッケージは、同じ世代と信号速度を使う場合、同等の公称帯域幅を提供できる。

一方で容量は大きく異なる。SemiAnalysisは32ギガビットのHBM4Eコアダイをモデル化し、4-hiで16GB、8-hiで32GB、12-hiで48GBとなるとしている。

これらは一般に市販されている製品ではなく、将来の構成をモデル化したものだ。パッケージのインターフェースを維持したまま、層数が容量をどのように変えるかを示している。

経済的な違いは、サプライヤーが何を消費するかに由来する。DRAMの搭載量がHBMスタックのコストの大部分を左右する一方、推論顧客はアクセラレータに供給される帯域幅を重視することが多い。

4-hiの購入者が得るギガバイト数は少ない。それでも購入者は、コンピュートユニットへの供給を維持するために必要なデータパスを得られる。

これにより、重要な効率指標が変わる。容量重視の調達では、各アクセラレータの隣に何ギガバイトを収められるかを問う。帯域幅重視の調達では、そのメモリリンクが何トークンを支えられるかを問う。

推論では、後者の問いが優勢になり得る。自己回帰デコーディングは出力を順次生成するため、各ステップでモデルのアクティブな重みをメモリから読み取らなければならない。

この処理では、移動するバイトごとに行う演算量が比較的少ない場合が多い。そのためデコーディングはメモリ帯域幅制約を受けやすく、純粋な演算性能より先にデータ供給がスループットを制限する。

高積層スタックが役立つのは、ワークロードが追加容量を利用する場合に限られる。そうでなければ、追加ダイは、利用可能な帯域幅では十分な頻度で読み出せない情報を抱えることになる。

SemiAnalysisは例として、スタック当たり毎秒3,328GBのHBM4E帯域幅を示している。この数値は、毎秒13ギガビットで動作する2,048本のピンから導かれる。

毎秒100トークンを生成する場合、各トークン当たり理論上33.28GBの帯域幅に相当する。各トークンでワーキングセットを1回読み出す必要があるなら、その有用なワーキングセットはこの予算を超えられない。

48GBスタックには、1トークン当たり理論上の帯域幅で走査できる量を超えるデータが含まれることになる。その速度での特定ワークロードでは、一部の容量を利用できないままになる。

実際のシステムが公称帯域幅のすべてを持続することはない。プロトコルのオーバーヘッド、アクセスパターン、通信、ソフトウェアの挙動により、有効スループットは低下する。

この制約は短スタックの論拠を強める可能性がある。利用可能な帯域幅が低いほど、ワークロードは搭載容量すべてを活用する前に帯域幅の上限に達する。

この仕組みで説明される4-hi HBMは、単に安価なメモリではない。外部帯域幅と最大垂直密度を分離する構成である。

この違いは製造出力にも影響する。4層スタックに使うウェハーは、理論上、12層スタックに使う場合の3倍のパッケージを支えられる。

実際の増加幅は、歩留まり、ベースダイの供給、テスト、パッケージングのスループットに左右される。短いスタックは、追加層に伴う累積的な組み立て損失の一部も回避できるはずだ。

SemiAnalysisは、結果として得られるHBMウェハー当たりの帯域幅は、ワット当たりトークン数と同じくらい重要だと論じる。どちらの指標も、すぐには拡大できない資源に対する有用なAI出力を測るものだ。

推論が最大容量より帯域幅を重視する理由

インタラクティブ推論では、プロセッサへ迅速に供給できるメモリが評価され、未使用の容量はトークンスループットへの寄与が小さい。

トレーニングと推論ではHBMに異なる要求が課される。トレーニングでは、順伝播と逆伝播で大規模なバッチを処理する間、重み、活性化、勾配、オプティマイザデータを保存する。

このワークロードは膨大な容量を消費し得る。また、多くの演算で演算性能制約となるほどの計算も行う。

推論のデコードは異なる。システムはトークンを1つずつ生成する間、アクティブな重みと、ユーザーのキー・バリューキャッシュ、すなわちKVキャッシュを繰り返し読み出す。

KVキャッシュは、以前のトークンからのアテンション情報を保存する。これにより、別のトークンを生成するたびに会話全体を再計算する必要がなくなる。

ユーザー数の増加やコンテキストの長期化は、このキャッシュを拡大する。ただし、システムが許容可能なレイテンシ目標内でそれらのユーザーに応答できる場合に限り、大容量には価値がある。

バッチ処理は状況を複雑にする。複数のリクエストをまとめて処理することで、サーバーは1回のモデル重み読み出しを複数ユーザーに分配できる。

より大きなバッチは総スループットを改善するが、より多くのKVキャッシュ容量も必要とする。この点で、8-hiまたは12-hiスタックが再び優位性を得られる。

トレードオフはインタラクティビティだ。プロバイダーはより大きなバッチを形成するために長く待つことも、小規模バッチで迅速にトークンを返すこともできる。

SemiAnalysisは、将来のRubin Ultra NVL576構成上のKimi K3を用いて、この関係をモデル化している。必要なユーザー当たりの速度が高まるにつれ、高積層スタックによるスループット向上は逓減するという。

ユーザーごとにモデル上毎秒213トークンの場合、レポートは4-hiを超えるスループット上の利点がないとしている。追加のメモリ容量が有用になる前に、帯域幅の上限に達する。

曲線上の別の条件では、8-hiは最大スループットを8%引き上げる。12-hi構成では、4-hi比で10%向上する。

これらの改善はモデル内では実在する。問題は、追加のメモリおよびシステムコストを補えるかどうかだ。

SemiAnalysisは、モデル化した8-hi Rubin Ultraシステムのコストが、4-hiのベースラインより12.1%高いと推定している。12-hi構成では26.3%増となる。

これらは将来のコンポーネントと想定メモリ価格に基づくアナリスト推定である。ベンダーの見積もりでも、導入済みRubin Ultraシステムで測定された所有コストでもない。

こうした前提の下では、スループットの伸びはシステムコストより緩やかだ。その結果、どちらの高積層構成でもトークン当たりコストは高くなる。

これがSemiAnalysisによる4-hi HBMの主張の中核である。低積層化は単にハードウェア費用を抑えるだけでなく、支出単位当たりのモデル化された出力も改善する。

ラックスケール・コンピューティングは、この議論のもっともらしさを高める。従来のサーバーは8基のGPUを接続していたため、各デバイスのメモリはサービングシステム全体を強く制約していた。

H100 HGXシステムが提供するHBM総容量は640GBだった。大規模モデルの重みは、システムが十分なKVキャッシュを保持する前に、その容量の大部分を占有し得る。

H200は各GPUのメモリを増やすことで、この圧力を緩和した。その段階では、デバイス当たり容量の拡大には即時の運用上の価値があった。

GB300 NVL72は規模を変える。NvidiaはNVLinkを通じて72基のBlackwell Ultra GPUを接続し、はるかに大きな共有通信ドメインを構築している。

このラックは約20TBのGPUメモリを搭載する。その総容量は、8 GPUのHopperサーバーを大幅に上回る。

SemiAnalysisは、この拡大を2.8兆パラメータのMixture-of-ExpertsモデルであるKimi K3と比較している。この種のモデルは、各トークンで専門家群の一部だけを有効化する。

報告書は、量子化されたKimi K3の複製が1,561GBを占めると推定している。これは、およそ21TBのGB300 NVL72構成の8%未満に収まる。

量子化は数値をより少ないビット数で表現し、重みの格納容量とメモリトラフィックを削減する。数値精度の一部を犠牲にする代わりに、ハードウェア要件を大幅に引き下げる。

大規模なNVLinkドメインでは、専門家群をより多くのGPUに分散することもできる。この構成は通信需要を増やす一方、各デバイスが保持すべきモデル重みの量を減らす。

Rubin Ultraでは、ドメインがNVL72からNVL576へ拡大すると報じられている。接続GPU数が8倍になることで、アクセラレータ当たりのHBMが3分の1減少する影響を上回り得る。

したがって、容量は個々のGPUの問題から、ラックレベルの割り当て問題へと移る。導入環境は、より薄いローカルメモリスタックを使いながら大規模モデルを保持できる。

これはメモリ制約をなくすものではない。アーキテクトがどこで制約を解決するか、そしてどのリソースが最初に不足するかを変えるだけである。

キャッシュのオフロードは有効だが、4-hi HBMは万能ではない

低積層スタック戦略が機能するのは、ソフトウェア、二次メモリ、ワークロードの挙動によって、減少したHBM容量がボトルネック化しない場合に限られる。

SemiAnalysisは、Kimi K3と16基のGB300 GPUを使うInferenceXワークロードで、この前提の一部を検証した。8基のGPUがプリフィルを処理し、残りの8基がデコードを担当した。

プリフィルは、トークン生成の開始前にプロンプトを処理する。デコードから分離することで、運用者は各フェーズを異なるコンピュートおよびメモリ特性に合わせて調整できる。

実験では、許容HBM利用率を92%から85%に引き下げた。これは8-hiと4-hiスタック間の容量削減よりはるかに小さい。

しかし、この制限により利用可能なKVキャッシュ領域は大幅に縮小した。報告書によると、集約サービングにおけるKV容量はGPU当たり53GBから34GBに低下した。

分離されたペアでは、利用可能な予算が44GBから24GBへ減少した。これらはそれぞれ36%および44%の削減に相当する。

テストした大半の同時実行レベルで、スループットはほぼ同等に維持された。制限付き構成では、非アクティブなKVキャッシュデータを通常のサーバーDRAMへ移した。

この処理はKVキャッシュ・オフロードと呼ばれる。頻繁にアクセスされる情報をHBMに保持しつつ、より低温の会話状態を低速だが大容量のメモリへ移す。

エージェント型ワークロードは、この手法に適している場合がある。ツールの実行、CPUによるコード実行、外部サービスからの情報返却を待つ間に、しばしば停止するためだ。

こうした待機中、GPUはすべての会話のキャッシュを直ちに必要とするわけではない。低温データを移動すれば、高価なHBMをアクティブなリクエスト向けに解放できる。

制限付きテストでは明確な限界も確認された。同時実行数が70を超えると、高メモリ構成と比べてスループットは約30%低下した。

GPUのKV占有率が100%に達していた。その後、プリエンプション、繰り返される転送、キューイングが有効な処理量を減少させた。

制約付きの実行では、DRAMベースのKVキャッシュからの読み取り回数も10倍超に増えた。オフロードは容量圧力を緩和したが、より遅い階層を通るトラフィックを増加させた。

この結果は支持材料であると同時に警告でもある。ソフトウェアは意味のあるメモリ削減後も性能を維持できるが、それはワークロード依存の閾値を下回る場合に限られることを示している。

長いコンテキストを使う多数の同時ユーザーを抱える本番サービスでは、その閾値を超える可能性がある。その場合、高積層HBMスタックはより大きなバッチと高い総スループットを支えられる。

ネットワーク容量も重要だ。モデルの専門家群とキャッシュを数百基のアクセラレータに分散すると、集中的な全対全通信が発生する。

システムは、メモリ容量ではなくネットワークによって制約される状態に移行し得る。その結果でも余分なHBMは遊休化するが、システム全体の効率が保証されるわけではない。

二次DRAMも別の制約となる。AIシステムがCPU側の容量を増やすにつれて、サーバーメモリ自体も供給圧力に直面している。

オフロードは電力も消費し、運用の複雑さを増す。ソフトウェアは、何をホットな状態に保ち、何を移動し、いつデータを戻すかを判断しなければならない。

不適切な判断は、容量削減の効果をレイテンシ急増へと変えてしまう。アーキテクチャには、慎重なスケジューリング、キャッシュ管理、ワークロード分離が必要となる。

将来のモデル成長は、より大きな不確実性をもたらす。SemiAnalysisも、その分析が将来想定されるハードウェアに現在のワークロードを適用していることを認めている。

AIサーバーは5年以上運用されることが多い。その期間に、モデル、コンテキスト、ユーザー同時実行数、推論ワークロードは劇的に変化し得る。

報告書は、Kimi K3の3倍の規模で、ユーザー当たりキャッシュ要件も3倍のモデルをストレステストしている。この前提では、高積層スタックの有用性が増す。

8-hi構成の総トークン数は4-hiより36%多い。12-hi版は47%多いが、どちらもユーザー当たり速度は低い状態で動作する。

推定コストを含めると、ユーザー当たり毎秒180トークン未満では8-hiが有利になる。12-hiシステムは、モデル化されたコスト増をなお相殺できない。

これらの結果は、4-hi HBMが普遍的な処方箋になり得ない理由を示している。望ましいスタック高は、モデル規模、レイテンシ目標、バッチ処理、システム寿命に依存する。

トレーニングシステムは、積極的な容量削減には特に不向きだ。アクティベーション、勾配、オプティマイザ状態は、利用可能なメモリをすべて使い切る可能性がある。

多数の独立したモデルを提供する推論システムにも容量が必要となる。運用者は、単一の最適化済みワークロードにおける最低コストよりも柔軟性を重視する場合がある。

ハードウェア購入者は選択肢の問題に直面する。4-hiアクセラレータは今日のサービスには効率的でも、ワークロードの変化後には制約になり得る。

研究者は、導入済みハードウェアに合わせてモデルを適応させるかもしれない。ループ型計算、量子化、疎な専門家群、より小さなキャッシュは、保存パラメータへの依存を減らせる。

ただし、その適応は保証されない。モデル品質の改善が、再びパラメータ数の増加やメモリ集約型アーキテクチャから得られる可能性もある。

したがって、最も適切な読み方はより限定的である。4層HBMは、慎重に特性評価された推論向けの強力な構成であり、高積層メモリの自動的な代替ではない。

レイヤー削減はメモリ供給企業とシステム構築企業に圧力をかける

購入者がギガバイト数ではなく帯域幅を最適化するなら、経済的な圧力はDRAM生産からベースダイ、パッケージング、ネットワーキング、完全なシステム統合へと移る。

SK hynix、Samsung、Micronは長年にわたり、より高密度かつ高積層のHBMを開発してきた。各社のロードマップは、容量、信号速度、パッケージング歩留まり、熱制御を重視している。

SK hynixは2025年に12層HBM4のサンプル供給を開始した。同社のHBM4 announcementでは、毎秒2TB超の帯域幅を持つ36GBパッケージが説明されている。

この製品の方向性は、トレーニングおよび容量負荷の高い推論に引き続き有用である。4-hiへの意味のある移行は、まったく異なる購買優先順位をもたらすだろう。

顧客は、より少ないコアダイで完全なインターフェース帯域幅を求める可能性がある。サプライヤーはより多くのパッケージを出荷する一方、各パッケージに含まれるDRAMビット数は減る。

一見すると、これはHBM収益にとってマイナスに見える。ベンダーは、アクセラレータの世代ごとにより多くの専用DRAMコンテンツを販売することで恩恵を得てきた。

SemiAnalysisは、結果はより均衡したものになり得ると主張する。短いスタックは組み立て歩留まりを改善し、各ウェハーから販売可能なパッケージの生産数を増やす可能性がある。

サプライヤーは、HBMを主にギガバイト製品として扱うのではなく、帯域幅の価値に対して価格を設定することもできる。顧客がそのモデルを受け入れるかは依然として不透明だ。

供給面での利点はより明確である。12-hiから4-hiへの移行は理論上、一定量のDRAMから得られるスタックサイズのダイグループ数を3倍にする。

短いスタックがパッケージング歩留まりを高めれば、実際の増加は単純な比率を超え得る。他のコンポーネントが制約となれば、その比率を下回る。

各HBMパッケージには依然として、ベースダイ、テスト、積層、アクセラレータ横への実装が必要だ。パッケージ出力を増やすことは、これらすべての工程への需要を増やす。

HBM4では、より多くのロジックを含み先端ファウンドリプロセスを使用できるため、ベースダイの重要性が高まる。DRAMの節約は、同等のファウンドリ能力を生み出すわけではない。

より多くのメモリパッケージには、より多くのアクセラレータパッケージも必要となる。これらのパッケージには、インターポーザ、有機基板、電力供給、冷却、高密度組み立てが求められる。

したがって、ボトルネックは消えるのではなく移行し得る。ロジックウェハー、ベースダイ、基板、回路基板、システム統合は、いずれもより高い需要に直面する。

大規模なスケールアップドメインは、別の制約も強める。より多くのアクセラレータには、総メモリが実用的な共有リソースとして機能する前に、広範なスイッチングとネットワーキングが必要になる。

NvidiaのGB300 NVL72は、9台のNVSwitchトレイを用いて72基のGPUを接続する。第5世代NVLinkファブリックは、合計毎秒130TBの帯域幅を提供する。

将来のNVL576システムは、この規模を大幅に拡張しなければならない。その経済性は、分散した専門家群とキャッシュ移動を支えられるだけの高速性をネットワークが維持できるかに依存する。

電力は最後の境界であり続ける。帯域幅の豊富なHBMパッケージ数を倍増しても、それらが接続されるアクセラレータを運用者が導入できる場合にしか効果はない。

4-hi戦略は、新たな電力容量を生み出すことなくDRAM供給を引き延ばせる。データセンター建設、冷却、電力網へのアクセスは、依然として利用可能なコンピュートを決定する。

この圧力は、HBMウェハー当たりトークン数が有用な指標であっても完全ではない理由を説明する。運用者は、トークン当たりのワット数、ラック、ネットワークポート、設備投資予算を総合的に最適化する必要がある。

この変化は従来型メモリ市場にも影響する。HBM生産は、サーバー、PC、モバイル向けDRAMと製造リソースを競合する。

HBMコアダイの使用量を減らせば、その一部のウェハー能力をこれらの製品に戻すことができる。エージェント型AI導入とともにCPU側メモリが増加する中、この緩和は重要である。

ただし、その効果は実際の採用状況に左右される。4-hi設計がアクセラレータ出荷量を大幅に増やすなら、総ユニット数の増加によって節約分の一部が消費され得る。

メモリ供給企業も、ビット需要を弱める急速な移行には抵抗する可能性がある。その対応は、製品供給、認定スケジュール、容量配分に現れるだろう。

したがって主戦場は、Nvidiaとあるメモリベンダーの対決ではない。帯域幅重視の推論設計と、容量重視のHBM経済性の対決である。

この対立構図を見れば、業界への影響は明確になる。帯域幅が収益を生み、搭載ギガバイト数がそうでない場合には、低スタックが優位に立つ。

一方で、顧客が追加容量をより大きなバッチ、より多くのモデル、あるいはハードウェアの柔軟性を長く保つことへ転換できるなら、高スタックが勝つ。

4-hi HBMが本当に勝つかを示す3つのシグナル

低スタックという仮説が信頼に足るものとなるのは、製品ロードマップ、生産供給、実測された推論結果が一致したときだけだ。

第1のシグナルは、NvidiaによるRubin Ultraの最終構成である。公開資料で、メモリ容量、スタック高、帯域幅、NVL576システムアーキテクチャを確認する必要がある。

8-hi HBMを採用した192GB構成が確認されれば、この方向性を支持する材料となる。12-hiへの回帰は、容量要件が全般的に緩和したという主張を弱めるだろう。

商用の4-hi Rubin製品が登場すれば、はるかに強い証拠となる。それまでは、SemiAnalysisによる4-hi HBMの提案は、将来のASICやアクセラレータに関する情報に基づく予測にとどまる。

第2のシグナルは、高速4-hi HBM4またはHBM4Eに対するサプライヤーの認定である。ベンダーは、アクセラレータ設計者が求めるシグナリングレートでこれらのパッケージを提供しなければならない。

公称インターフェース幅だけでは不十分だ。製品には、完全なシステムにおける許容可能な歩留まり、熱特性、信頼性、持続性能が必要となる。

SK hynix、Samsung、Micronが、4-hi構成を公開ロードマップに追加するかを注視したい。顧客向けサンプル提供は、低スタックが社内のアーキテクチャ検討を超えたことを示す。

価格モデルにも目を向けるべきだ。4-hiのコストが主に低い容量に応じて決まるなら、その帯域幅経済性は魅力的になる。

サプライヤーが価値の大部分をベースダイとインターフェースに価格転嫁する場合、期待される節約幅は縮小する可能性がある。パッケージ不足によって、DRAM搭載量が少なくても高いプレミアムが維持されることもあり得る。

第3のシグナルは、多様なワークロードにおける独立した推論テストである。ベンチマークには、対話型アシスタント、エージェント型サービス、長文コンテキストのリクエスト、大規模バッチのデプロイメントを含めなければならない。

平均トークン処理量だけでは足りない。テストでは、ユーザーごとの速度、キューイング動作、キャッシュヒット率、オフロードトラフィック、テールレイテンシを測定する必要がある。

結果は、サイズやアーキテクチャが異なるモデル同士でも比較すべきだ。Kimi K3向けに最適化された構成が、将来のすべての最先端モデルにとって最良の選択であることを示すわけではない。

決定的な証拠となるのは、現実的なサービスレベル目標の下で安定したトークン当たりコスト優位性である。その優位性は、高い同時実行性や変化するワークロード構成の中でも維持されなければならない。

ハードウェアの制約はモデル設計を左右するため、開発者も注意を払うべきだ。利用可能なメモリは、量子化、エキスパート配置、コンテキスト処理、キャッシュ方針に影響する。

企業の購入担当者も、見出し上の容量が誤解を招き得る点を理解すべきである。帯域幅、ネットワーキング、またはレイテンシが制約となる場合、HBMを増やしても有用な推論性能が高まるとは限らない。

インフラチームは、ラックレベルでワーキングセットを評価すべきだ。単一のメモリプロファイルを選ぶ前に、トレーニング、プリフィル、デコード、エージェント型ワークロードを分けて考える必要がある。

また、運用上の余裕も確保すべきだ。需要がより大きなバッチや同時に稼働するモデルの増加へ移ると、4-hiに狭く最適化されたシステムは優位性を失う可能性がある。

より広い教訓は、メモリが少ないほど常に勝つということではない。メモリは、ワークロードが実際に消費するリソースに照らして購入すべきだということである。

対話型推論では、そのリソースはしばしば帯域幅となる。4層HBMは、希少なDRAMダイの使用数を減らしながら、完全な外部データパスを維持できる。

この点で、SemiAnalysisによる4-hi HBMの分析は、業界に根強い「最も高いスタック」という前提に対する重大な挑戦となる。次の製品情報開示が、ハードウェアチームがこの見方に同意しているかを示すだろう。

将来のアクセラレータ群への導入を決める前に、3つの問いを投げかけるべきだ。ワーキングセットはラック規模で収まるか、コールドキャッシュのデータは安全に移動できるか、追加容量は有用なスループットを高めるか。

答えが帯域幅を指し示すなら、短い王者はロードマップに位置を得るに値する。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page