top of page

NVIDIA Vera RubinのMLPerf初登場がペースを示す、ただしプレビュー段階である点は重要

36 分前
読了時間: 19分

NVIDIAはVera Rubin NVL72でMLPerf Inference v6.1に参入し、前世代のGB300 NVL72と比べて最大3.7倍のスループットを報告した。NVIDIA Vera RubinのMLPerf初登場により、インフラ購入者は同社の次世代ラックスケールAIプラットフォームについて、初めてピアレビュー済みの評価を得ることになる。同時に、見出しの数字には重要な制約も付随する。Vera Rubinは依然としてプレビューシステムである。

この区別が、真の競争を形作る。NVIDIAは単にあるGPU世代を別の世代と比較しているのではない。緊密に統合されたラックが、新しいシリコン、ネットワーキング、サービングソフトウェアをより優れた推論経済性へと転換できると主張している。

AMDによるこれまでで最も広範なMLPerf提出は、この主張が現在なぜ圧力を受けているのかを示している。AMDは利用可能なハードウェアで競争力のある結果を示し、ワークロードの対象範囲を広げ、512基のアクセラレータに達する導入事例を強調した。選定されたVera Rubinの比較ではNVIDIAが先行しているが、顧客はプレビュー段階での優位性が実際に導入可能な価値へと変わるかを判断しなければならない。

NVIDIA Vera RubinのMLPerf結果が早期の優位性を確立

この初登場は、要求の厳しい2つのモデルで世代間の大幅な性能向上を示した。ただし、まだ出荷済みの本番プラットフォームを表すものではない。

結果は、MLPerf v6.1 releaseの一環として2026年9月16日に発表された。MLPerf Inferenceは、標準化された精度およびレイテンシー条件の下で、システムが学習済みAIモデルをどのように提供するかを測定する。

MLCommonsによれば、今回のラウンドには過去最多となる30組織が参加した。AMDの利用可能なMI350PやIntelのArc Pro B70を含む、5つの新しいプロセッサまたはアクセラレータが登場した。NVIDIA RubinとVera Rubin NVL72はプレビューとして参加した。

NVIDIAはDeepSeek-R1とQwen3-VL-235BについてVera Rubinの結果を提出した。DeepSeek-R1は推論モデルのサービングをテストし、Qwen3-VLは製品分類などのタスクにおいて言語入力と視覚入力を組み合わせる。

同社のVera Rubin resultsでは、Qwen3-VLのインタラクティブシナリオで最大の相対的向上が示された。このシナリオでは、1基のVera Rubin NVL72が毎秒1,307クエリを処理した。比較可能なGB300 NVL72の結果は毎秒349クエリだった。

これは、およそ3.7倍という見出しの向上率につながる。インタラクティブシナリオでは1.5秒のレイテンシー上限も課されるため、応答性が必要なアプリケーションにおいては、制約のないバッチスループットよりも関連性の高い結果となる。

他のQwen3-VLシナリオでは優位性は小さかったものの、依然として大きかった。Vera Rubinはオフラインで毎秒2,393サンプルに達し、GB300の1,305を上回った。サーバーの結果は毎秒2,323クエリで、GB300は1,210だった。

これらの結果は、オフラインスループットが約1.8倍、サーバースループットが1.9倍高いことに相当する。この差は、単一の最大倍率だけではシステム全体を説明できない理由を示している。

DeepSeek-R1では、Vera Rubinはインタラクティブシナリオで毎秒652,750トークンを記録した。72 GPUのGB300 NVL72は、同じ公表済みのレイテンシー制約下で毎秒260,098トークンに達した。

この比較は、DeepSeek-R1のスループットが最大2.5倍高いというNVIDIAの主張を裏付ける。NVIDIAはこのワークロードにTensorRT-LLMを使用し、Qwen3-VLの提出ではNVIDIA DynamoとvLLMを使用した。

公開済みの性能表では、各結果に精度のしきい値も併記されている。Vera RubinのDeepSeek-R1エントリは、FP16精度の99パーセントを目標とし、完全一致スコアは81.9132パーセントだった。

Qwen3-VLでは、目標はBF16品質の99パーセントだった。ベンチマークはShopifyの製品カタログデータセットを使用し、カテゴリ階層F1スコアが少なくとも0.7824であることを求めた。

こうした基準は重要である。積極的な数値圧縮によってモデル出力が損なわれるなら、推論の高速化の価値は限られる。MLPerfでは、性能値が有効と認められる前に、提出内容が定義済みの品質しきい値を満たす必要がある。

とはいえ、この初登場はベンチマークモデル2件だけを対象としている。MLPerf Inference v6.1におけるすべての言語、推薦、動画、音声、検索ワークロードでの優位性を確立するものではない。

このような限定的な対象範囲は、プレビュー段階のハードウェアでは珍しくない。ただし購入者は、この結果を普遍的な判定ではなく、初期段階のシステムシグナルとして読むべきだという意味でもある。

より高いスループットがAI推論の経済性を変える理由

追加のスループットが、ハードウェア、電力、運用上の複雑さを比例して増やさずに、より多くの有用なリクエストを処理できる場合、推論性能は財務面で重要になる。

学習はモデルを生み出すが、推論はそのモデルがユーザーに応答するたびに実行される。消費者向けアシスタント、コーディングエージェント、検索サービス、文書システムでは、一つのタスクの間に多数の推論呼び出しが発生し得る。

推論エージェントはこのパターンを強める。中間トークンを生成し、ツールを呼び出し、結果を確認し、計画を修正する。インターフェース上で見える一つの回答の背後で、複数回のモデル処理が必要になる場合がある。

この挙動により、毎秒トークン数は経済的に重要になる。より高速なシステムは、より多くの同時リクエストを処理し、待ち行列を短縮し、同じ時間枠の中でより長い推論トレースを提供できる。

ただし、最大スループットは計算の一部にすぎない。購入者には、許容可能な応答レイテンシー、一貫した精度、高い稼働率、管理可能な電力需要、信頼できるソフトウェアも必要である。

MLPerfが複数のデプロイメントシナリオを分けているのはこのためだ。オフラインシナリオは一括処理を重視する。サーバーシナリオは変動する受信リクエストをモデル化し、インタラクティブシナリオはより厳しい応答性要件を課す。

Vera Rubinが最も強い相対的な成果を示したのは、このレイテンシーに敏感なインタラクティブ環境である。これは、システムが大規模バッチの背後に遅延を隠せない場合に、そのアーキテクチャ改善が特に価値を持つことを示唆している。

この結果は、アクセス、消費量、または完了した作業に対して課金する製品にとって重要である。1ラックで必要なサービス水準を保ちながらより多くのリクエストを処理できれば、運営者はそのインフラからより大きな容量を得られる。

しかし、スループットが自動的に収益になるわけではない。需要が存在し、ソフトウェアがアクセラレータを稼働させ続け、サービス全体がモデルサーバー以外のボトルネックを回避する必要がある。

ストレージ、ネットワークファブリック、データベース、安全フィルター、アプリケーションロジックはいずれも、実際に提供される性能を制限し得る。ベンチマークは、ほとんどの本番環境よりもクリーンにテスト対象システムを分離する。

トークン当たりのコストも、機器費用をピークスループットで割るより複雑である。電力、冷却、ネットワーキング、保守、資金調達、ソフトウェアエンジニアリング、停止時間、減価償却を含む。

NVIDIAはVera Rubinがトークンコストを下げるとしているが、v6.1のリリースでは完全な本番環境の総保有コスト比較は公開していない。ベンチマークが提供するのは性能の証拠であり、完全な購買モデルではない。

したがってインフラチームは、これらの結果を自らのトラフィックプロファイルに置き換えるべきである。視覚的な製品検索サービスではQwen3-VLのサーバースループットが重要かもしれず、推論プラットフォームではDeepSeek-R1のレイテンシーとトークン生成を優先するかもしれない。

ベンチマークが購入者のワークロードに似ているほど、その結果の価値は高まる。モデルアーキテクチャ、リクエスト長、バッチ処理の挙動、サービス制約が大きく異なる場合、その決定力は低下する。

これがNVIDIAの競合他社が直面する経済的圧力である。すべてのチャートで勝つ必要はないが、より良い総合的なビジネスケースを生み出すために、十分に導入可能な性能、ソフトウェアの成熟度、柔軟性を提供しなければならない。

ラックスケールの協調設計が性能を生む仕組み

Vera Rubinの優位性は、72基のGPU、CPU、メモリ、ネットワーキング、推論ソフトウェアを、一つの協調されたシステムとして扱うことから生まれる。

NVL72ラックは、72基のアクセラレータを高帯域幅のスケールアップドメイン内で接続する。スケールアップネットワーキングにより、これらのアクセラレータは分離されたサーバーとして動作するのではなく、一つの大規模システムの一部として協調できる。

NVIDIAによれば、第6世代NVLinkとNVLink Switchは、標準的なEthernetと比べて10倍高いパケットレートを提供する。同社は、該当する比較においてレイテンシーが3分の1になるとも主張している。

こうした相互接続に関する主張はNVIDIAによるものであり、独立したネットワークベンチマークとして扱うべきではない。それでも、提出されたシステムの設計選択の背景を説明している。

大規模な推論モデルや視覚言語モデルは、推論中に大量のデータを移動させる。モデルの重み、活性化、アテンション状態、ルーティング判断を、適切な計算リソースへ迅速に届ける必要がある。

Vera Rubinは、GPUに近接して配置される高帯域幅メモリ世代のHBM4を使用する。NVIDIAの公表済みアーキテクチャによれば、そのラック構成には72基のRubin GPUと36基のVera CPUが含まれる。

ソフトウェアはその後、これらのリソースに作業を分散する。分離型サービングはprefillとdecodeを分け、テキスト生成の異なるフェーズに対して異なるリソースを特化させる。

Prefillはユーザー入力を処理し、モデル内部のアテンション状態を構築する。Decodeはトークンを一つずつ生成し、多くの場合、異なるメモリおよびレイテンシー制約の下で動作する。

ソフトウェアが各フェーズを適切なリソースに割り当てれば、これらを分離することで稼働率を向上できる。一方で協調のオーバーヘッドも生じ得るため、高速な相互接続と効果的なスケジューリングが重要になる。

NVIDIAの提出では、Mixture-of-Expertsモデル向けに大規模なエキスパート並列処理が使用された。このモデル設計は、毎回ネットワーク全体を実行するのではなく、各トークンに対して選択されたエキスパート層のみを有効化する。

このアプローチは計算量を削減できるが、不規則な通信を生む。ネットワーク遅延によって節約分が失われないよう、トークンは正しいエキスパートにルーティングされ、処理され、返されなければならない。

低精度演算も、この仕組みのもう一つの要素である。NVIDIAは、メモリ使用量の削減と計算スループットの向上を目的とした4ビット数値形式、NVFP4を使用した。

このシステムは、重み、アテンション演算、キー・バリューキャッシュに低精度を適用した。キー・バリューキャッシュは過去のアテンション情報を保存し、モデルが新しいトークンごとに会話全体を再計算しなくて済むようにする。

低精度化により、より多くのデータをメモリに収められ、計算ユニット間のデータ移動も減らせる。MLPerfの精度しきい値は、許容できない品質低下を防ぐガードレールとなる。

したがって、最終的な性能値はRubinシリコンだけを純粋に測定したものではない。プロセッサ、メモリ、ネットワーキング、数値形式、カーネル、サービングフレームワーク、ベンチマーク固有のチューニングを反映している。

これはNVIDIAの戦略の中核である。同社は、競争優位が個々のアクセラレータ仕様を超えて広がっているため、顧客にプラットフォーム全体を評価してほしいと考えている。

この戦略は、単一のサポート対象スタックを求める運営者に利点をもたらし得る。一方で、NVIDIAの密接に結び付いたハードウェアおよびソフトウェア環境への依存を高める可能性もある。

購入者にとって、その依存が自動的に悪いわけではない。協調されたプラットフォームは統合作業を減らし、認定済みシステム全体で予測可能な性能を生み出せる。

顧客がより大きなハードウェアの選択肢、移植可能なソフトウェア、または個々のコンポーネントに対する独立した制御を求める場合に、トレードオフが現れる。そこでAMDの競合アプローチが重要になる。

AMDは利用可能なハードウェアからプラットフォームの物語に圧力をかける

AMDのv6.1での成果はVera Rubinの選定された優位性を消し去るものではないが、NVIDIAがより広範な推論の物語を無争点で支配することを防いでいる。

AMDはMLPerf Inference v6.0での3つのモデルファミリーから、v6.1では6つへと対象を拡大した。MI355X、MI350X、MI350Pアクセラレータ上で、言語、推論、レコメンデーション、テキスト動画生成の各ワークロードをカバーした。

同社のMLPerf submissionでは、GPT-OSS-120Bにおける競争力ある8 GPU性能が強調されている。AMDによれば、MI355Xはオフラインおよびサーバーのシナリオで、特定のNVIDIA B200およびB300エントリーを上回った。

AMDは、変更のないMI355Xハードウェア上でソフトウェア開発による性能向上も報告した。8 GPU構成のGPT-OSS-120Bサーバースループットは、前回ラウンド比で38%改善した。

オフラインスループットは28%向上し、Wan 2.2のシングルストリーム性能は70%改善した。これらはAMDが提出したv6.1とv6.0の結果に基づく比較である。

同じ傾向は、NVIDIAの中核的な主張の一つも裏付ける。ハードウェアだけでは推論システムのライフタイムバリューは決まらない。ソフトウェアの改善によって、導入後により多くの有用な処理を引き出せる。

AMDは、GPT-OSS-120Bで72基のMI355Xを用い、95%のスケーリング効率を達成した。スケーリング効率は、アクセラレータの追加に対してスループットの伸びがどの程度追随するかを示す。

Crusoeは続いて、512 GPUのAMDシステムを提出した。AMDによると、このシステムはGPT-OSS-120Bで毎秒575万オフライントークン、DeepSeek-R1で毎秒290万トークンを生成した。

これは当時、MLPerf Inferenceに提出された中で最大のアクセラレータ数だった。また、大規模クラスタとオープンなソフトウェア環境を基盤とする、別のスケール戦略も示している。

Vera Rubinとの比較は直接的ではない。提出内容によって、使用モデル、システム規模、シナリオ、認定済み最適化が異なり得るためだ。

512アクセラレータによる集計結果は、72 GPUのVera Rubinシステムよりラック当たりの経済性が優れていることを示すものではない。同様に、Vera RubinのQwen3-VLでの優位性も、GPT-OSS-120BにおけるAMDの競争力を決着させるものではない。

これはMLPerfを読む際によくある課題だ。各ベンダーは、自社に最も有利なワークロード、シナリオ、システム規模を強調できる。

MLCommonsは標準ルール、精度ゲート、結果レビュー、公開された構成詳細によって、その自由度を抑えている。ただし、異なるシステムを同一にすることはできない。

最も有用な比較では、モデル、シナリオ、レイテンシ目標、精度要件、アクセラレータ数、部門を一定に保つ。そうした変数以外の違いも可視化されるべきだ。

競争はNVIDIAとAMDの間だけにとどまらない。Googleはv6.1に参加し、IntelはArc Pro B70の結果を発表、複数のクラウドプロバイダーもパートナーシステムを提出した。

Lambdaのinference resultsは、同一世代のアクセラレータでもシステムビルダーがさらなる性能向上を実現できることを示している。同社の4 GPU Blackwell Ultraシステムは、v6.0比で約9%改善した。

Lambdaはまた、オープン部門の提出で、データセンターハードウェア上においてKimi K2.6を使ったエッジエージェント型ワークロードを実行した。Lambdaによれば、このモデルは1兆を超えるパラメータを持つ。

これらのエントリーは、より広い論点を補強する。競争の単位はプロセッサ単体から、モデル、フレームワーク、オーケストレーション、インフラを含む構成済みサービススタックへ移行しつつある。

NVIDIAは現在、このスタックの最も統合された形を提供している。AMDは、統合にはNVIDIA専用プラットフォームが必要だという前提を崩そうとしている。

したがってNVIDIAへの圧力は、単に最速であり続けることではない。その性能優位が、自社アーキテクチャへのコミットメントを正当化するだけの運用価値を生むことを示す必要がある。

プレビュー結果が立証しないこと

最も強い主張は検証済みベンチマークスループットであり、コスト、収益、提供可能性、幅広いワークロードでの優位性に関する主張には追加の証拠が必要である。

MLCommonsはVera RubinおよびVera Rubin NVL72をプレビューエントリーとして分類している。このラベルは、この結果ラウンドで提供可能なAMD MI350Pと同じようには、このプラットフォームが扱われていないことを読者に示す。

プレビューであることは、結果を無効にするものではない。MLPerfは依然として構成を公開し、ベンチマークプロセスを適用する。ただし、購入者が商用導入済みシステムについて推測できる範囲は限られる。

量産ハードウェアでは、エンジニアリング用の提出では表れない制約に直面する可能性がある。ファームウェアの成熟度、故障率、部品供給、冷却、設置時間、フリート管理はいずれも実際のキャパシティに影響する。

Vera Rubinの提出はNVIDIAとパートナーであるNebiusによるものでもあった。独立系システムビルダーによる、より広範な再現が得られれば、性能がさまざまな導入環境へ移転することを示す、より強い証拠となる。

NVIDIAの前世代エコシステムには有利な先例がある。v6.1では、マルチノードBlackwell NVL72システムを使用した8社を含め、19のパートナーがNVIDIAプラットフォームで参加した。

この広がりは、NVIDIAが最適化済み設計を広範なサプライヤーネットワークへ展開する方法を理解していることを示唆する。ただし、Vera Rubinのプレビュー構成が変更なく、あらゆる場所に予定通り提供されることを保証するものではない。

ワークロードのカバレッジも別の不確実性を生む。このプラットフォームは、ラックスケールの設計とソフトウェアスタックに適した2つのワークロード、DeepSeek-R1およびQwen3-VLでデビューした。

クローズド部門では、GPT-OSS-120B、レコメンデーション、音声、画像生成、RAG、Wan 2.2にわたるVera Rubinの結果は公表されていない。今後のラウンドで、この優位性が一般化するかが示されるはずだ。

NVIDIAは、GPT-OSS-120BとDLRMv3における締め切り後の性能改善も引き合いに出した。同社は、MLCommonsがその後の結果を検証していないと明示している。

これらの数値は、同じレビュー過程を通過するまで、直接的なベンチマーク結論の対象外にとどめるべきだ。ベンダーのテストは方向性を示し得るが、同一の証拠力を持つわけではない。

見出しの比較に欠けているもう一つの要素が電力データだ。ラック当たりのスループットは重要だが、運用者は床面積を使い切る前に固定された電力容量に直面することが多い。

より高速なラックであっても、より高密度な電力供給や、より厳しい液冷要件を必要とするなら、導入を複雑にし得る。施設の制約内にどれだけ有用な処理を収められるかは、ワット当たり性能によって決まる。

NVIDIAは、スループットの向上がトークン当たりコストを下げると主張する。他の要因が安定している場合にはもっともな結論だが、公開された結果は完全なコスト計算を示してはいない。

購入条件、稼働率、電力、保守、資金調達、ソフトウェア人員は最終的な数値を左右し得る。購入者には、自身のワークロードで計測された本番データが必要だ。

ベンチマークは、エンドユーザーの応答性も保証できない。モデルサービングが高速でも、検索、ツール呼び出し、データベース、外部APIが遅延の大半を生む場合がある。

MLPerf v6.1は、新たな検索拡張生成とエッジエージェント型テストにより、このギャップへの対応を始めている。提出者の半数超は、クライアント・サーバーアーキテクチャを適用するAPI中心のハーネスを利用した。

MLCommonsによれば、このハーネスはデータセンター試験をMLPerf Endpointsへ移行する取り組みを支援する。この変更により、測定は単独のモデルエンジンではなく、導入可能なサービスに近づくはずだ。

この進化はNVIDIAのプラットフォーム論を強める場合も弱める場合もある。密接に統合されたスタックはフルサービス測定の恩恵を受けるはずだが、外部依存関係は生のアクセラレータ優位性を薄め得る。

慎重な読み方は明確だ。Vera Rubinは、DeepSeek-R1とQwen3-VLにおいて、注目すべきレビュー済みのプレビュー初登場を果たした。しかし、普遍的な優位性や完全な本番経済性を確立したわけではない。

優位性が維持されるかを決める3つのシグナル

Vera Rubinの初期優位が戦略的に重要になるのは、出荷システムが、より多くのワークロードと測定可能な運用制約の下でその性能を再現した場合に限られる。

第1のシグナルは、幅広い本番提供可能性だ。顧客は、プレビュー提出と比較可能な構成詳細を公開するクラウドインスタンス、パートナーシステム、設置済みラックに注目すべきである。

展開の成功は、NVIDIAが最適化されたエンジニアリング結果を、再現性のあるインフラへ転換できることを示す。遅延や実質的に異なる構成は、その結論を弱める。

提供可能性には、出荷発表以上のものが含まれるべきだ。購入者には、安定したソフトウェアリリース、認定済みネットワーク、サービス手順、そしてシステムが長期運用期間を通じて性能を維持する証拠が必要である。

第2のシグナルは、次回の独立したベンチマークラウンドだ。Vera Rubinには、特に検索、レコメンデーション、動画、追加の言語モデルにおいて、DeepSeek-R1とQwen3-VLを超える結果が必要となる。

より広いカバレッジは、1つのプラットフォームで多様な推論ワークロードを扱えるというNVIDIAの主張を支える。カバレッジが狭ければ、特化型アクセラレータや競合クラスタの余地がより大きく残る。

今後のMLPerf Endpointsの結果は、特に示唆的となるだろう。企業が購入し運用するサービスにより近い、API対応システムを測定するはずだ。

リクエストのオーケストレーション、検索コンポーネント、現実的なサービス境界が加わった後も、Vera Rubinの生のスループットが維持されるかを注視したい。優位性が小さくなれば、ボトルネックが別の場所へ移ったことを示唆する。

第3のシグナルは、競合するソフトウェアの進歩だ。AMDのv6.1での改善は、導入済みアクセラレータでも新世代ハードウェアなしに大幅な性能向上を得られることを示している。

ROCm、オープンなサービングフレームワーク、パートナーシステムが急速な改善を続ければ、購入者は柔軟性や既存インフラとの互換性を得るために、ピーク性能の低さを受け入れるかもしれない。

NVIDIAのソフトウェアが同じペースで改善すれば、Vera Rubinの初期優位はさらに積み上がる可能性がある。同社はすでに、v6.0からv6.1の間にGB300でQwen3-VLが1.6倍向上したと報告している。

したがってソフトウェア速度は二重に重要だ。現在の性能を引き上げるだけでなく、顧客が高価なシステムの有用寿命をどう見積もるかも変える。

調達チームは、自社の正確なモデル、コンテキスト長、バッチパターン、レイテンシ目標に対する結果を求めるべきだ。障害、アップグレード、ワークロードの変化もテストすべきである。

開発者は、大規模なカスタム作業なしに、どの最適化が一般的なフレームワークへ到達するかを確認すべきだ。通常のチームが導入・保守できないベンチマーク最適化技術の価値は限定的である。

AIプロダクトリーダーは、インフラ指標をユーザー成果へ結び付けるべきだ。より高速な推論は、低レイテンシ、より多くの推論ステップ、高い同時実行性、より長いマルチモーダルリクエストを支えられる。

NVIDIA Vera RubinのMLPerf結果は、ラックスケールの共同設計にとって信頼できる出発点となる。その3.7倍のピーク比較は意味を持つが、定義されたシナリオに属するものだ。

次の判断は、プレビューベンチマークが高速に見えるかどうかではない。明らかに高速である。判断すべきなのは、電力、ソフトウェア、提供可能性、実際のワークロードが考慮に入った後も、出荷システムがその優位性を維持するかどうかだ。

プラットフォームを選ぶ前に、最も厳しいサービスレベル目標を再現するようベンダーへ求めるべきだ。そのうえで、持続的なスループット、レイテンシ、精度、稼働率、運用負荷をまとめて比較する。その評価により、Vera Rubinのベンチマーク優位が持続的な推論経済性へ変わるのか、それとも印象的なプレビュー結果にとどまるのかが明らかになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page