top of page

NVIDIA Vera Rubin NVL72は性能対コスト比で67倍向上を主張、ただし動作条件が重要

9月16日
読了時間: 24分

NVIDIA Vera Rubin NVL72は、初期のエージェント型推論テストでGB300 NVL72に対して性能対コスト比67倍という優位性を記録したとされる。この数値は選定されたベンチマーク比較の範囲では実在するものの、普遍的な倍率ではない。より一般的なサービング速度では、測定された優位性ははるかに小さかった。

9月14日の結果は、インフラ購入担当者にとって、長大なコンテキストを伴うマルチターンのワークロードにおけるRubinを初めて独立して確認できる機会となった。また、NVIDIAのCEOであるJensen Huang氏による従来の性能予測が控えめだったことも示している。ただし、最大の倍率は、比較対象のBlackwell構成が性能限界に近づく厳しい動作条件に依存している。

したがって焦点となるのは、単純なRubin対Blackwellの比較ではない。見出しを飾る主張と、運用者がモデル、サービングエンジン、レイテンシ目標、本番トラフィック全体で再現できる性能との比較である。NVIDIAは性能曲線全体を押し上げたように見えるが、その差は曲線上の位置によって大きく異なる。

NVIDIA Vera Rubin NVL72、予測から実測のエージェント作業へ

重要な変化は、Rubinがアーキテクチャ仕様やNVIDIAの予測だけでなく、エージェント型推論の実測結果を持つようになったことだ。

SemiAnalysisは、長大なコンテキストを扱うコーディングエージェントのトラフィック向けベンチマークであるAgentXから、初のレビュー済みRubin結果を公表した。テストでは、蓄積されたコンテキスト、ツールの待機、プレフィックス再利用、並列サブエージェントの急増を含む、本番環境に近いセッションを使用した。

このトラフィックは、従来のチャットボットベンチマークとは異なる。基本的なチャット要求は、通常1つのプロンプトと1つの応答で構成される。エージェントはツールを呼び出し、サブエージェントに相談し、増大し続ける会話履歴を繰り返し送信しながら、数百ターンに及ぶ対話を行うことがある。

こうしたパターンは、推論システムに異なる要求を課す。長い履歴は、事前に計算されたアテンションデータを保存するkey-valueキャッシュ容量を消費する。再利用されるプレフィックスでは効率的なキャッシュが有利に働き、サブエージェントの急増はスケジューリングと並行処理能力を試す。

公開されているAgentX methodologyは、135,282件のリクエストを含む393件のオプトイン型コーディングセッションに基づく。復元されたリクエストの中央値は、入力トークン142,016、出力トークン444である。

AgentXはプロンプト、コード、ツール引数、ツール結果を除去する。その一方で、リクエストの長さ、タイミング、共有プレフィックスの関係、サブエージェント構造を保持し、決定論的な合成トークンに置き換える。

この設計により、元のコンテンツを公開せずに、より現実的なトラフィック形状を扱える。ただし、AgentXはモデルが正しいコードを生成するか、エージェントのタスクを成功裏に完了するかは検証しない。測定対象はモデルの知能ではなく、サービングシステムである。

新たな結果では、DeepSeek V4 Proと初期段階のTensorRT-LLMスタックを使用した。TensorRT-LLMは、NVIDIAのアクセラレータ上でのモデル実行を最適化するための推論ランタイムだ。

Rubin benchmark analysisによると、Vera Rubin NVL72は、毎秒170トークン時点で、モデル化された総保有コスト当たりの総スループットがGB300 NVL72の約67倍に達した。

この比較では、TensorRT-LLMと、低精度AI計算向けのNVIDIAの4ビット数値形式であるNVFP4を使用した。また、理論上のチップ仕様ではなく、ハードウェアとソフトウェアを含む構成全体を測定している。

同じ動作条件でRubinが際立った優位性を示したのは、選定されたGB300 TensorRT-LLM曲線が最速の測定終点付近にあったためだ。SemiAnalysisは、別のサービングフレームワークであるSGLang上で動作するGB300に対しては、Rubinの優位性がはるかに小さいと報告した。

それでも、この結果は重要である。Rubinは、ベンチマークが旧世代や基本的な単一GPUサーバーを選んだから勝利したわけではない。同じ大規模モデルをサーブし、応答速度の目標をそろえたうえで、NVIDIAのBlackwell Ultraラックスケールシステムを上回った。

ただし、67倍という数値は性能曲線上の1点を表す。すべてのRubin導入が、同じ総コストで67倍のトークンを生成することを意味するわけではない。

SemiAnalysisがこのワークロードを提供するプロバイダーにより代表的だとする毎秒60〜100トークンの範囲では、Rubinは総コスト当たりでおよそ1.4〜3倍のスループットを実現した。

これは67倍ほど劇的ではないが、商業的には大きな意味を持つ。電力、ネットワーク、冷却、利用可能なデータセンター空間がすでに拡張を制約している場合、持続的な2倍の向上は容量計画を一変させ得る。

結果は、最大インタラクティビティの向上も示している。RubinはP90で毎秒約276トークンに達し、選定されたTensorRT-LLM構成を用いるGB300の約172を上回った。

P90インタラクティビティは、応答の90%が到達するストリーミング速度を測定する。これにより運用者は、スループットの結果が許容できるユーザー体験も提供するかを判断できる。

Rubinの優位性は、ソフトウェアスタックによって一様ではなかった。SemiAnalysisは、SGLangを実行するGB300がRubinに近いインタラクティビティに到達できる一方、Rubinは依然として別のスループットおよびレイテンシ面で優位性を保っているとした。

このばらつきが、本稿の中心的な緊張関係を形作る。NVIDIA Vera Rubin NVL72は大幅に高速であるように見えるが、報告された最大の優位性は、特定のモデル、ランタイム、精度、サービスレベル目標の組み合わせから生じている。

エージェント型推論が電力を希少資源へ変える理由

Rubinにとって最も重要な向上は、演算性能のピーク値ではなく、固定された電力枠内で処理できる有用なエージェントトラフィックの量だ。

エージェントは、各ステップが次のステップのコンテキストになり得るため、単純なチャット対話より多くのトークンを消費する。調査、コーディング、サポートのエージェントは、回答前にデータベースを検索し、ツールを実行し、結果を調べ、作業を委任することがある。

NVIDIAはOpenRouterのデータに基づき、エージェント型リクエストは単純なチャットリクエストの約15倍のトークンを消費するとしている。この数値はアプリケーションごとに異なるが、根底にある方向性は明確だ。

コンテキストが拡大すると、システムは以前のターンの情報を繰り返し処理または取得する。複数のサブエージェントにより、短時間で激しい同時リクエストの急増が発生する場合もある。

こうした特性により、メモリ容量、メモリ帯域幅、インターコネクトのレイテンシ、キャッシュ管理、CPUの協調が最優先の制約となる。生のテンソル性能は依然として重要だが、それだけではサービング結果の全体を説明できない。

電力へのアクセスも別の制約を加える。運用者は追加のアクセラレータを購入できても、それらを稼働させる十分な系統容量を確保できない場合がある。新しい変電所、送電接続、冷却システム、データホールの建設には、サーバーより長い時間がかかる。

したがって、メガワット当たりのスループットは単なるエネルギー効率以上を測る。これは、運用者が希少な施設資源からどれほどの請求可能な作業を引き出せるかを概算する指標だ。

毎秒100トークン時点で、SemiAnalysisはRubinをユーティリティメガワット当たり総トークン毎秒約5,940万と測定した。最も高い測定値を記録したGB300構成は、同じ目標で2,850万に達した。

つまり、この実用的な動作条件において、Rubinは最も高性能なGB300エンジンより約2.09倍高速だった。TensorRT-LLMを実行するGB300は、メガワット当たり毎秒2,110万トークンに達した。

速度要件が高まるにつれて、優位性の大きさは変化した。毎秒150トークンでは、Rubinはメガワット当たり毎秒3,700万トークン近くを維持し、測定されたGB300 SGLangの結果のおよそ7.2倍だった。

毎秒170トークンでは、Rubinのメガワット当たりスループットはGB300 TensorRT-LLMを62.9倍上回った。ただしGB300 SGLangと比べると、その倍率は5.56倍だった。

この差こそ、大きな性能主張にはすべてエンジン名が必要な理由である。アクセラレータ名だけを比較する購入者は、ランタイムが結果をどれほど変えるかを見落とすことになる。

NVIDIAの従来の数値は、同じ傾向を別の角度から示していた。同社は、毎秒160トークン時点でGB300よりメガワット当たりスループットが最大30倍高いと報告した。

NVIDIAは、これらのテストがAgentX DeepSeek V4 Proワークロードを使用したと説明している。公開時点で同社は、結果がSemiAnalysisのレビュー待ちであり、ツール呼び出しにおけるVera CPU性能は含まれていないとも述べた。

その後のレビューはRubinの大幅な優位性を裏付けるが、固定された単一の倍率を裏付けるものではない。NVIDIAのagentic performance dataは、優位性が毎秒110トークンで約2倍から、毎秒160トークンで30倍へ上昇することを示している。

この曲線は、1枚の棒グラフより重要である。推論プロバイダーは、同時実行性、応答速度、最初のトークンまでの時間、総レイテンシ、コストの均衡を選択する。

総スループットの最大化に最適化した構成は、各ユーザーの待ち時間を長くし過ぎる可能性がある。極端なインタラクティビティに最適化したシステムは、高価な容量を十分に使い切れない可能性がある。

エージェント型製品には、もう1つの複雑さが加わる。ツール実行、コードコンパイル、検索、外部API呼び出しにより、GPUがCPUやリモートサービスを待つ状態になることがある。

Rubinは、各NVL72ラック内で72基のRubin GPUに36基のVera CPUを組み合わせることで、この問題に対処する。NVIDIAはこれらのCPUを、エージェントのオーケストレーション、ツール呼び出し、データ処理、サンドボックス化された実行を処理するために設計した。

これらの要素がワークフロー全体のアイドル時間を減らすなら、経済性の主張はより強くなる。外部ツール、ネットワーク呼び出し、アプリケーションロジックが依然として主なボトルネックであれば、その主張は弱まる。

クラウドプロバイダーやモデル研究所にとって、圧力は差し迫っている。Rubinの優位性が大きければ、電力制約下の新たな推論容量においてBlackwellの拡張を継続する正当化は難しくなる。

既存のBlackwell導入が突然不経済になるわけではない。ハードウェアはすでに設置され、ソフトウェアは成熟しており、多くのワークロードはRubinの最高インタラクティビティ帯を必要としない。

求められる対応は、より選択的なものになる。運用者は、どのワークロードを最初にRubinへ割り当てるべきか、どれをBlackwellに残すべきか、どれを競合アクセラレータへ移せるかを判断しなければならない。

Rubinの優位性を支える仕組みは極限的な協調設計

NVIDIAの成果は、単独で高速化した1つのチップではなく、GPU、CPU、メモリ、インターコネクト、ランタイム、施設を協調させたことによる。

NVIDIAはこの戦略を「極限的な協調設計」と呼ぶ。Vera Rubin NVL72は、1つのラックスケール領域内で、第6世代NVLinkを介して72基のRubin GPUと36基のVera CPUを統合する。

Rubin GPUは、288 GBのHBM4メモリと、毎秒22 TBのメモリ帯域幅を備える。高帯域幅メモリはプロセッサの近くに配置され、従来のサーバーメモリより高速にモデルデータを供給する。

NVLinkはGPUごとに毎秒3.6 TB、ラック全体では毎秒260 TBの帯域幅を提供する。このファブリックにより、72基のGPUは1つの大規模な計算リソースに近い形で動作できる。

このアーキテクチャは、mixture-of-expertsモデルに恩恵をもたらす。この種のモデルは、すべての演算で全パラメータを使うのではなく、トークンごとに選択された専門ネットワークを有効化する。

これらを効率的にサーブするには、プロセッサ間の高速なルーティングが必要となる。エキスパート間でアクティベーションを移動する遅延は、仕様表では印象的に見える演算能力を無駄にしかねない。

Rubinは、分散推論で使われる同期処理も改善する。通信オーバーヘッドが減れば、プロセッサは協調の待機に費やす時間を減らし、計算により多くの時間を使える。

NVIDIAのrack architectureは、Rubin、ConnectX-9ネットワーキング、BlueField-4データ処理ユニット、NVLinkスイッチ、Spectrum-6 Ethernetプラットフォームを組み合わせている。

同社はGroq 3 LPUの追加後、より広範なシステムを7チップ・アーキテクチャと説明している。LPUは、予測可能で低レイテンシな言語モデル実行向けに設計されたプロセッサだ。

Rubinは、prefillとも呼ばれる計算負荷の高いコンテキスト処理を担う。Groq 3プロセッサで構成されたLPXラックは、decodeと呼ばれるレイテンシに敏感なトークン生成に特化できる。

この分離は、ディスアグリゲーテッド・サービングとして知られる。これにより事業者は、両フェーズを同一ハードウェアで実行させるのではなく、prefillとdecodeのリソースを個別にスケールできる。

エージェントのワークロードでは、長い入力履歴を含む一方で、迅速な対話型出力を求めることがあるため、この分割は魅力的だ。prefillにはメモリ容量と並列計算能力が必要であり、decodeでは低レイテンシが有利になる。

次に、レートマッチングによって2つのプール間での作業の受け渡し速度を調整する。調整が不十分だと、一方のグループがアイドル状態になる一方、もう一方が過負荷になる可能性がある。

サービングソフトウェアがこれらのコンポーネントを結び付ける。TensorRT-LLMは最適化済みカーネルを提供し、NVIDIA Dynamoは分散リソース全体の推論を調整する。

AgentXの結果は、ソフトウェアを製品の一部として扱う必要がある理由を示している。あるエンドポイントでは、TensorRT-LLMを使用したGB300とSGLangを使用したGB300の差は数十倍に達した。

これは、あるエンジンがあらゆる場面で優れていることを意味しない。テストされた速度帯によって最強のGB300エンジンは変わり、ある目標値ではTensorRT-LLMが先行し、より高い目標値ではSGLangが優位に立った。

Rubinの初期結果は、ソフトウェアスタックが完全に成熟する前に得られた。これは改善の余地を生む一方、導入上の不確実性ももたらす。

NVIDIAは、このプラットフォームは本格量産段階にあり、2026年後半の出荷を予定していると述べている。同社は以前、このプラットフォームがBlackwellと比べてワット当たりの推論性能を最大10倍にできると主張していた。

SemiAnalysisは、Huangが以前のGTCで示した3倍という図解と比べ、稼働領域付近でメガワット当たりのスループットが最大7倍向上したと報告した。一部の条件を揃えたエンドポイントでは、測定された倍率はさらに大きくなった。

これは「控えめな見積もりだった」という解釈を支持するが、限定的な意味においてのみである。Huangのプレゼンテーションは広範なプラットフォームの見通しを扱ったのに対し、新しい結果は1つのエージェント型ワークロードと特定の構成を対象としている。

Rubinの設計は電力供給にも取り組んでいる。データセンターでは、推論ワークロードが最大消費電力を継続的に使うことがまれであっても、一般にラックが取り得る最大電力消費に合わせて電気設備を設計する。

NVIDIA DSX MaxLPSは、GPUやラック全体の未使用ヘッドルームを回収するために動的電力配分を利用する。施設の電力枠を超えずに、同じサイト上限内へより多くの計算能力を配置しようとするものだ。

MaxLPS documentationでは、400基のGPUを用いる1メガワットの推論導入例が示されている。その例では、動的管理によりトークンスループットが静的な最大電力ベースラインの1.35倍に向上する。

NVIDIAは、施設計画と電力制御を組み合わせることで、固定された電力枠内で最大40%多くのGPUをサポートできるとしている。これは計画上の主張であり、すべてのサイトで保証される結果ではない。

事業者は、自身のワークロードの実際の電力プロファイル、冷却能力、安全余裕、レイテンシへの影響を検証しなければならない。ピーク消費電力に頻繁に達するフリートでは、回収可能なヘッドルームは少なくなる。

したがって、この仕組みは乗算的である。高速なGPU、広いメモリ、低レイテンシなリンク、優れたスケジューリング、専用CPU、動的電力管理が、それぞれ異なるボトルネックを取り除く。

これらの層が連携すれば、Rubinは同じ建物からより多くの有用なトークンを生成できる。どれか1つの層がスケールしなければ、理論上の利得は顧客に届く前に縮小する。

67倍という主張は、選定された稼働点の外では縮小する

このベンチマークはRubinの優位性を裏付ける一方、最大性能単価の数値をフリート全体の計画前提にすべきでない理由も示している。

第1の制約は、選定されたエンドポイントにある。毎秒170トークンでは、比較対象のGB300 TensorRT-LLM構成は、測定された対話性の上限に近かった。

その境界付近では、速度目標をわずかに引き上げるだけで、システムが処理できるトラフィック量は大きく減少し得る。Rubinにはなお未使用の性能余地があり、これが異例に大きな比率を生んだ。

同じ目標値でRubinをGB300 SGLangと比較すると、メガワット当たりスループットの優位性は62.9倍から5.56倍へと低下した。それでも大きいが、購買判断としては異なる物語を示している。

第2の制約は総保有コストモデルである。SemiAnalysisは、ハードウェア、ネットワーキング、電力、資金調達、コロケーション、耐用年数、そして想定されるハイパースケーラーの購買条件を用いて所有コストを計算している。

より小規模な事業者は、異なる資金調達、稼働率、インフラ条件に直面する。クラウドの借り手にとっても、ハードウェア性能と契約容量の関係は異なる。

ドル当たり性能は、設備を高稼働で維持することに依存する。ピーク時の経済性に優れたアクセラレータでも、需要が不均一に到来したり、ソフトウェアが高い稼働率を妨げたりすれば、期待を下回る可能性がある。

第3の制約はワークロードの範囲だ。公開されたRubinの結果は、AgentXのコーディングエージェントのトラフィック形状におけるDeepSeek V4 Proに焦点を当てている。

より短いプロンプト、画像生成、検索、動画、高密度モデル、またはオフラインのバッチジョブを提供する顧客は、異なるボトルネックに直面する。SemiAnalysis自身も、オフラインのバッチ推論とトレーニングではRubinの相対的な利得が小さいと指摘している。

AgentXは合成ペイロードも使用する。長さ、共有プレフィックス、タイミング、分岐は保持するが、非公開セッションの意味的内容までは保持できない。

投機的デコーディングには特有の課題がある。この技術では、より小型または高速なドラフトモデルが複数の将来トークンを提案し、主モデルにそれらを受け入れるか拒否するかを判断させる。

合成テキストは非現実的な受理挙動を生み得る。AgentXは、別のコーディングデータセットで測定された受理長を使用し、それらの設定を記録することでこれに対処している。

この制御は比較可能性を高めるが、依然として近似にとどまる。このベンチマークでは、独自のプロバイダーテンプレート、隠れた推論、サーバー側ツール、画像、あるいはすべてのトークナイザー変換を再現できない。

クローズドループ実行は、もう1つのニュアンスをもたらす。高速なシステムはテスト時間内にサンプリングされたセッションをより先まで進行するため、やや異なるリクエスト構成に遭遇する可能性がある。

これらの問題はいずれも結果を無効にするものではない。結果が何を測定しているのか、そして購入者がどこで追加の根拠を求めるべきかを定義するものだ。

第4の制約は初期段階のソフトウェアである。SemiAnalysisはプレリリース版のTensorRT-LLMビルドを使用しており、今後のリリースではRubinの効率が向上するはずだ。

初期ソフトウェアには、制御されたベンチマークには現れない回帰、不完全な機能、運用上の挙動が含まれる可能性もある。成熟したBlackwellスタックには、本番環境での修正を吸収するためのより長い時間があった。

ラック規模では信頼性が重要になる。NVIDIAによると、完全なNVL72ラックには130万のコンポーネントと約1,300個のチップが含まれる。

データセンター事業者に必要なのは、障害、保守、再試行、利用不能なハードウェアを考慮した後の有用な出力、すなわち持続的なgoodputである。ピーク時のベンチマークスループットは、その運用実績全体を測定しない。

第5の制約は競合の対応だ。AMDは、ラックスケールのHeliosプラットフォーム向けに、Instinct MI455Xアクセラレータを2026年7月に投入した。

公式のMI455X specificationsには、ピークMXFP4性能40.3ペタフロップスとCDNA5アーキテクチャが記載されている。ピーク演算性能の数値をAgentXの結果と直接比較することはできない。

SemiAnalysisは新たな測定に従来のMI355Xを含めた。毎秒100トークンでは、テストされたMI355X構成のうち最も強力なものは、メガワット当たり毎秒約201万トークンに達した。

Rubinはその時点で5,940万に達し、報告上は29.5倍の優位性となった。SemiAnalysisによると、AMDは将来のMI455X AgentXテストで協力することを約束している。

この将来の比較は、RubinとMI355Xの比較よりはるかに重要になる。同じワークロード、モデル、トラフィック形状、サービスレベル目標で、現行の2つのラックスケール・プラットフォームを検証することになるからだ。

GoogleのTPU7x Ironwoodも、大規模な高密度モデルおよびMixture-of-Expertsモデルを対象としている。Google Cloudを通じた提供により、顧客にはカスタムシリコンと垂直統合型ソフトウェアプラットフォームを組み合わせる別の選択肢が生まれる。

NVIDIAはエコシステムの厚みで優位性を保っている。CUDA、TensorRT-LLM、Dynamo、NVLink、そしてパートナーネットワークにより、同社は導入経路のより多くを管理している。

その管理は最適化を改善し得る一方、顧客の単一ベンダーへの依存を深める可能性もある。極端な共同設計は、購入者がスタック全体を受け入れる場合に最も効果を発揮する。

信頼できる解釈は、Rubinがどこでも67倍優れているということではない。厳しい対話性要件を伴う大規模なエージェント型ワークロードにおいて、Rubinが利用可能な推論のフロンティアを拡張するということだ。

ギガワット当たりのトークン増加は、必ずしも利益増加を意味しない

Rubinはデータセンターの経済性を改善し得るが、利益はベンチマークでは立証できない稼働率、需要、信頼性、販売価格に左右される。

SemiAnalysisは、RubinがBlackwellのギガワット当たり年間利益の2倍超を生み出せると推定している。同社は、カーネルとサービングソフトウェアが成熟するにつれて、この差が拡大すると見込んでいる。

この推定には合理的な仕組みがある。1メガワットでより多くの請求可能なトークンを生成できれば、施設の送電網割当が固定されたままでも収益能力は高まる。

単位コストの低下は、利益率を拡大することも、より低い顧客料金を支えることもできる。プロバイダーは効率向上分を維持するか、それを利用してより多くの需要を獲得するかを選べる。

ただし、スループットは販売ではなく能力を表す。顧客がその追加能力を持続可能な料金で消費して初めて、プロバイダーの収益は増える。

需要プロファイルはハードウェアと一致しなければならない。Rubinの最も強い優位性は、あらゆるAI計算形態ではなく、長いコンテキストを扱う対話型エージェントワークロードに現れる。

これは配分上の問題を生む。プロバイダーは、他でより経済的に実行できるワークロードを移すことなく、新しいラックを稼働させ続けるだけのエージェント型トラフィックを確保する必要がある。

モデル効率も、タスク当たりのインフラ需要を減らし得る。より優れたアーキテクチャ、短い推論トレース、改善されたキャッシュ、小型の専用モデルにより、トークン消費量が低下する可能性がある。

逆の効果も同様にあり得る。トークンが安くなれば、開発者はより長時間稼働するエージェントを構築し、より多くのサブエージェントを使い、以前は採算が取れなかったタスクを自動化するようになるかもしれない。

これはコンピューティングでよく知られるリバウンド効果である。効率化によってある処理のコストが下がり、その後ソフトウェアが拡張して新たな能力を消費する。

NVIDIAはその結果に大きく賭けている。同社の枠組みでは、データセンターは従来型のコンピューティングサービスではなくトークンを出力するAIファクトリーとして扱われる。

この比喩には限界がある。トークンの価値は大きく異なる。完了したコーディングタスクに寄与するトークンは、失敗した推論ループ中に生成されたトークンより価値が高い。

エージェントのベンチマークは、インフラ効率と完了した作業を結び付けることに依然として苦戦している。AgentXは意図的にモデルの挙動を対象外とし、出力品質を採点していない。

完全な経済性テストでは、100万トークン当たりのコストだけでなく、成功したタスク当たりのコストを測定する必要がある。モデル精度、再試行、ツール障害、結果をレビューするために必要な人手も含めるべきだ。

レイテンシも間接的に収益へ影響する。より高速なエージェントは、より多くのタスクを完了し、ユーザーの関与を維持できるが、それはアプリケーションと外部ツールが同程度の速度で応答する場合に限られる。

Rubinの報告されたエンドツーエンドのレイテンシー結果は有望だ。所有効率を揃えたある比較点で、SemiAnalysisはRubinが約20秒、B200またはB300が60秒だったと測定した。

スループットあたりのコストがより高い比較点では、同社はRubinが約20秒、比較対象のBlackwellシステムが120秒だったと報告している。

これらの測定結果は、より高いスループットと短い完了時間を両立させており、Rubinの優位性を補強する。ただし、あくまで特定構成に依存するベンチマーク結果である。

収益性は導入速度にも左右される。予想される効率がどれほど高くても、導入が遅れたラックはトークンを一切生み出さない。

NVIDIAは設置と保守を容易にするため、第3世代MGXラック形式を軸にRubinを設計した。コンピュートトレイは、ケーブル、ホース、ファンを使用しない内部設計を採用している。

同社によれば、トレイの組み立てと保守にかかる時間は約2時間から5分へ短縮された。こうした設計変更がフリートの可用性を実際に高めるかどうかは、現場での運用実績を待つ必要がある。

冷却と電力密度は、依然として施設面での重大な検討事項だ。Rubinは大きな電力需要を1台のラックに集中させるため、対応する液冷方式と電力分配が求められる。

古い施設を運用する事業者は、サーバーを入れ替えるだけではこの利点を得られない。新たな電気設備、冷却液分配、ネットワーク、運用手順が必要になる可能性がある。

このためRubinは、すでに新しいAIキャンパスを構築しているハイパースケーラー、モデルラボ、専門クラウドプロバイダーにとって最も魅力的だ。小規模な購入者は、クラウドサービス経由で利用する方が効率的かもしれない。

「買えば買うほど、稼げる」は、NVIDIAの販売論を端的に表す印象的な要約だ。ただし、経済法則ではない。

より正確に言えば、これは条件付きの主張である。事業者が効率的なキャパシティを導入し、稼働率を満たし、電力を供給し、利用可能な状態を維持できるほど、その固定拠点が支えられる収益は増える。

NVIDIA Vera Rubin NVL72の結果後に購入者が注視すべき点

Rubinの初期ベンチマーク上の優位性が、持続的な本番環境での優位性へ変わるかどうかを決めるシグナルは3つある。

第1のシグナルは、複数のサービングエンジンで独立して再現可能なAgentXデータだ。Rubinには、同一モデルと同一のサービスレベル目標を用いたTensorRT-LLM、SGLang、vLLMの公開結果が必要である。

この比較により、現在の優位性のどれだけがRubinのハードウェアによるものか、どれだけが特に有利なソフトウェアの組み合わせによるものかが分かる。

ランタイムが改善しても、過去の結果は参照可能な状態に保つべきだ。そうでなければ、購入者は真のハードウェア向上と、旧世代システムにも恩恵をもたらすソフトウェア変更を区別できない。

クラウドプロバイダーによる再現も、さらに有力な裏付けとなる。彼らの導入環境には、制御されたテスト環境には存在しないスケジューリング、ネットワーク、監視、テナント分離、信頼性の制約が含まれる。

Rubinがエンジンや事業者をまたいで大きな優位性を維持すれば、67xという到達点は、より広範な変化の極端な一例として映るだろう。差が大きく縮小するなら、支配的な要因はソフトウェア選定だったことになる。

第2のシグナルは、同じAgentXワークロードにおけるMI455XとTPU7xの性能だ。現在の比較では、Rubinと異なる製品サイクルのアクセラレーター、あるいは異なるベンチマーク手法のアクセラレーターが混在している。

AMDのHeliosプラットフォームは、現行GPU、CPU、ネットワーク、ラックスケール統合を組み合わせるため、最も直接的な対抗馬となる。同条件のテストは、NVIDIAのソフトウェアスタックが依然として決定的な優位性であるかを明らかにする。

TPU7xは異なる競争経路を提供する。Googleはアクセラレーター、コンパイラ、クラウドサービス、そしてモデルスタックの一部を管理しており、独自の共同設計を実現している。

いずれかの競合が、実用的なインタラクティビティを維持しながらRubinのメガワット当たり性能に近づけば、購入者は交渉力とアーキテクチャ上の選択肢を得る。Rubinが大差を保てば、NVIDIAによるエージェント型インフラの支配力は強まる。

第3のシグナルは、稼働率と信頼性を踏まえた後の本番経済性だ。購入者は、持続的なグッドプット、最初のトークンまでの時間、エンドツーエンドのレイテンシー、消費電力、故障率、完了タスク当たりのコストを追跡すべきである。

また、ピーク時のインタラクティビティと、実際の顧客が利用する範囲を分けて考える必要がある。印象的な到達点よりも、毎秒60〜100トークンの領域の方が商業的には重要かもしれない。

DSX MaxLPSも同様に精査する価値がある。固定された電力枠内でより多くのGPUを稼働させることは、レイテンシーや機器寿命を損なわずにサイトの制約を守れる場合にのみ価値がある。

検証済みの40パーセントの密度向上は、Rubinのハードウェア優位性を増幅させる。現場での結果がより小さければ、予測されるギガワット当たり利益の改善幅は縮小する。

開発者にとっても重要だ。なぜなら、インフラの経済性は最終的に製品設計を左右するからである。エージェント提供コストの低下は、より長いセッション、より多くの検索、より多くの並列サブエージェントを支えられる。

ナレッジワーカーは、その変化を間接的に感じることになる。より高速かつ低コストなエージェントは、より大規模なプロジェクト履歴を処理できるが、価値ある出力は依然として信頼できるソース資料に依存する。

適切に維持された個人ナレッジベースは、より多く生成されたトークンをより良い根拠の代替として扱うことなく、その文脈を提供できる。

初期評価は明確だが、限定的でもある。NVIDIA Vera Rubin NVL72はエージェント型推論で大きな優位性を示しており、Jensen Huangによる以前の予測は保守的に見える。

67xという数値は曲線の端であり、平均値ではない。実用的な向上幅は一般的な運用領域ではおよそ2倍から3倍に近く、より厳しいインタラクティビティ目標の下ではさらに大きな優位性が得られる。

それでも、主要なAIインフラプロバイダーすべてに圧力をかけるには十分だ。次の問いは、ベンチマークが導入へ移行し、トークンが完了した仕事へ変わる段階でも、Rubinがこれらの経済性を維持できるかどうかである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page