top of page

Nvidia LVNM、GPT-4oとの戦いにオープン・モデルを投入

Nvidiaは先週、LVNMモデルファミリーをリリースした。この動きは、チップメーカーがオープンウェイトの大規模言語モデルに直接参入した初めての事例となる。開発者は現在、LVNMをOpenAIやAnthropicのクローズドシステムと比較してテストしている。

Nvidia LVNMモデルは、現在GPT-4oクラスのシステムで実行されている推論タスクと同じものをターゲットにしている。初期ベンチマークでは、コーディングや数学のワークロードで競争力のある結果を示している。また、このリリースにはNvidiaの最新推論スタックとの緊密な統合もバンドルされている。

ハードウェア企業は長年、モデルのトレーニングや実行に使用されるチップを提供してきた。しかし、自社のモデルウェイトをオープンライセンスで提供した例はほとんどない。Nvidiaのこの一歩は、そのパターンを変えるものだ。

同社は決算発表に先駆けてこの発表のタイミングを計った。また、オープン対クローズドのAI開発に関する議論が再燃した時期とも重なった。

Nvidia LVNM モデルの重みは Hugging Face で利用可能です。推論コードは寛容なライセンスの下で提供されます。ユーザーは依然として Nvidia GPU が必要であり、記載されたパフォーマンス数値に到達するためです。

リリースの詳細とライセンス

Nvidia は LVNM を 3 つのサイズで公開しました。最大のものは GPT-4o のパラメータ数にほぼ一致します。3 つすべてにトレーニングデータカードと安全レポートが含まれています。

ライセンスは商用利用とファインチューニングを許可します。重みが再配布される際には帰属表示が必要です。この構造は完全にクローズドなモデルと無制限のオープンリリースの中間に位置します。

ハードウェア要件は厳格なままです。Nvidia は、ピークスループットが最新のドライバーブランチを搭載した Blackwell GPU 上でのみ達成されると述べています。古いカードでもモデルは動作しますが、速度は低下します。

開発者は提供された Docker イメージを通じて迅速なセットアップが可能であると報告しています。初期のテスターの一人は、ガイドに従った後、単一の H100 で 1 秒あたり 120 トークンを達成しました。

NvidiaはHugging Face上で重みとともに詳細なモデルカードを公開した。これらの文書には、フィルタリングされたウェブクロール、厳選された技術書、パーミッシブにライセンスされたコードリポジトリから抽出された2.4兆トークンを含む、正確な事前学習コーパスの構成が記載されている。中規模バリアントは720億パラメータを含み、最小規模はエッジ展開に適した130億パラメータオプションを提供する。安全性評価には、14の危害カテゴリにわたる自動化されたレッドチーミングと人間によるレビューが含まれる。商用ユーザーは追加料金なしでファインチューニング可能だが、再配布された派生モデルには元の帰属表示を保持しなければならない。ライセンスは明示的に、より小さな生徒モデルへの蒸留を許可しており、以前はクローズドプロバイダーによってブロックされていた学術研究への道を開く。Nvidia で完全なデータ出典の詳細を参照。

追加のライセンスのニュアンスは、再配布の境界を明確にしている。独自データ上での継続事前学習を通じて作成された派生モデルは、重み自体が公開されない場合でも、ドキュメントに元のNvidiaの帰属表示を記載しなければならない。この要件は、基盤モデルのサイレントな商業的吸収を防ぎつつ、大規模組織による広範な内部カスタマイズを依然として許可する。ライセンスはさらに、特定のハイリスクな軍事または監視アプリケーションでの使用を禁止しており、MetaやMistralが自らのリリースで既に採用している責任あるAIフレームワークに沿ったものとなっている。

アーリーアダプターはすでに、ドメイン固有の継続事前学習を適用した派生モデルをHugging Face上で公開し始めている。たとえば、あるヘルスケアスタートアップは、1800億トークンの匿名化された臨床ノートとPubMedアブストラクト上で医療推論バリアントを訓練し、必要な帰属ヘッダーを保持した。その結果のチェックポイントは、専門ベンダーが提供する独自の医療モデルに匹敵するレベルで、内部のHIPAA準拠レッドチーム監査に合格した。

技術アーキテクチャとトレーニング方法論

LVNMは、128kコンテキスト長にスケーリングされたグループ化クエリ注意機構とロータリー位置埋め込みを備えたデコーダーオンリーのトランスフォーマーアーキテクチャを採用している。トレーニング実行はNvidiaの内部クラスタである16,000台のBlackwell GPUを38日間にわたり活用し、推定920万GPU時間を消費した。最大規模のバリアントには16のエキスパートとトップ2ゲーティングを備えたMixture-of-Expertsルーティングが登場し、推論時のアクティブパラメータ数を密な同等モデルと比べて38%削減している。

モデルとともに公開された量子化レシピはFP8、INT4、AWQ形式をサポートしている。内部テストでは、FP8がGSM8Kで全精度の97%以上を維持しつつ、メモリフットプリントを半分に削減することを示している。開発者は提供されたvLLM統合で単一のフラグを通じてこれらの形式を有効化できる。トレーニングデータのフィルタリングは、パープレキシティベースの重複排除と、Nvidiaがキュレーションした安全コーパスで訓練された分類器駆動の毒性除去の組み合わせに依存していた。その結果のデータカードは、初期に収集されたトークンの14%が品質フィルタリング中に破棄されたことを明らかにしている。

さらなるアーキテクチャの洗練には、マルチGPU構成向けに特別に調整された動的テンソル並列処理が含まれており、最大32ノードまでのほぼ線形のスケーリングを可能にします。訓練後のアライメントでは、ハードウェアテレメトリ信号を報酬モデリング中に組み込む新しい強化学習の変種が採用され、指示の遵守とハードウェア利用率の両方を同時に改善しました。これらの選択は、Nvidiaのハードウェア設計者兼モデル開発者としての二重の役割を反映しており、純粋なソフトウェアラボでは利用できない最適化を可能にします。

ハードウェア企業が今モデルを出荷する理由

Nvidiaは他社が自社チップ上のソフトウェアレイヤーを支配する様子を注視してきた。MetaはLlamaを提供し、GoogleはGemmaを提供する。どちらもNvidiaハードウェア上で良好に動作するが、それらの企業に開発者のマインドシェアに対する影響力を与えている。

LVNMのリリースにより、Nvidiaは同じテーブルに着席する機会を得る。また、顧客がNvidiaのソフトウェアエコシステム内に留まるもう一つの理由を生み出す。

LVNMを採用するチームは、最適化されたカーネルとプロファイリングツールを受け取る。これらのツールは、フルスタックがNvidiaブランドのままである場合に最も効果を発揮する。このアプローチは、チップベンダーが以前にコンパイラやランタイムへ進出した動きを反映している。

シリコンと重みの両方を所有することで、NvidiaはBlackwellの第2世代トランスフォーマーエンジンを活用するアテンションカーネルを共同設計できる。初期採用者は、同じハードウェア上で同等のLlama-3.1-405Bチェックポイントを実行する場合と比較して、1.8倍高いtokens-per-secondを報告している。このパフォーマンス差は、一般的なCUDA実装では利用できないカスタム融合演算に起因する。この戦略はテレメトリも固定する。使用統計はNvidiaの管理された推論サービスを通じてフィードバックされ、将来のハードウェアロードマップに反映される。

類似の垂直統合は他の業界にも前例がある。スマートフォンメーカーがリファレンスニューラルネットワークアクセラレータの出荷を開始したとき、彼らはすぐに自社シリコンにチューニングされた軽量モデルをバンドルした。Nvidiaはデータセンター規模で同じプレイブックに従っているようで、純粋なモデルプロバイダーがハードウェアプラットフォーム間で中立性を維持できるかどうかという疑問を提起している。

エンタープライズ展開ワークフロー

本番展開は、CUDA 12.8、TensorRT-LLM、およびLVNM重みをバンドルした公式Dockerコンテナから始まる。1行のHelmチャートで、モデルを1〜8レプリカ間で自動スケーリングするKubernetes推論サービスとして展開する。観測可能性フックは、レイテンシ、スループット、GPU使用率のPrometheusメトリクスをエクスポートする。エアギャップ環境で運用する企業には、外部接続なしで署名を検証するオフラインライセンスキージェネレータが提供される。

追加のワークフローツールには、405Bチェックポイントを8つのGPUに最小限の手動設定で分割する自動モデルシャーディングスクリプトが含まれる。GitLabおよびJenkins向けの継続的インテグレーションテンプレートにより、チームはベースモデルに対して夜間プロンプト回帰テストを実行し、更新をステージングに昇格する前に検証できる。Nvidiaのクラウドコンソール内のコスト監視ダッシュボードは、トークンスループットとスポットインスタンス価格を相関させ、財務チームが最初の1週間のトラフィック後に月間推論支出を5%以内の精度で予測するのに役立つ。

性能主張のレビュー中

独立したラボが並行テストを開始している。初期数値では、LVNMはHumanEvalおよびMATHベンチマークでGPT-4oに近い位置にある。長いコンテキスト検索および多言語タスクで差が見られる。

Nvidiaは独自の評価スイートを公開した。外部グループはプロンプトの選択がランキングを変える可能性があると指摘している。今後1ヶ月以内に、より標準化されたテストが登場するだろう。

量子化レベルでもメモリ使用量は高いままである。最大のバリアントを4ビットで実行する場合でも48 GBが必要である。これにより、小規模なワークステーションへの展開が制限される。

サードパーティによる Open LLM Leaderboard での評価では、LVNM-405BがMMLUで87.4、HumanEvalで82.1を獲得し、GPT-4oから1.3ポイント以内に位置づけられている。しかし、LongBenchの複数文書QAタスクでは、LVNMは9ポイント遅れており、研究者らは注意パターンの違いを調査するきっかけとなっている。

他のオープンソースモデルとの比較分析

MetaのLlama-3.1-405Bに対して、LVNMはAlpacaEval 2.0においてより強力なコード生成を示すが、指示追従は弱い。Llamaはより広範なコミュニティファインチューンの恩恵を受けている一方、LVNMは現在公式の指示チェックポイントのみを提供している。Mistral Largeと比較して、LVNMはBlackwellハードウェア上でより高いスループットを達成するが、非Nvidiaアクセラレータ上でのmixture-of-experts展開に相当するツールが不足している。

さらなる直接比較テストにより、LVNMのmixture-of-expertsルーティングは、同等のアクティブパラメータ数を持つ密なモデルよりもバーストワークロード下で低いレイテンシ変動をもたらすことが明らかになった。一方、Llama-3.1の派生モデルは、サードパーティフレームワークが数ヶ月のコミュニティ反復で既に最適化している積極的な投機的デコーディング技術をユーザーが適用する場合に優位性を発揮する。これらの違いは、典型的なトレードオフを示している。ハードウェアに最適化されたモデルは即時のピークパフォーマンスを提供する一方、広く採用されたモデルは長期的なエコシステムの利点を蓄積する。

ソフトウェアのみの競合他社への圧力

純粋なソフトウェア企業は現在、ハードウェアも販売する新たなライバルに直面しています。オープンなモデルプロバイダーは、Nvidiaスタックに最適化するか、より広範な互換性を維持するかを決定する必要があります。

一部のチームはすでにAMD GPUのサポートを追加するためにLVNMリポジトリをフォークしています。これらのフォークは更新が遅く、公式アップデートがありません。メインブランチを選択する開発者は、Nvidiaツールチェーンにさらにロックインされます。

小規模なラボでは、クロスベンダー互換性の維持にエンジニアリング予算の30-40%を費やしていると報告しています。その結果、複数のラボがフラッグシップリリースでNvidiaのみの最適化を優先する計画を発表し、代替アクセラレータの分野で事実上譲歩しています。このダイナミクスは、オペレーティングシステムベンダーが独占アプリを活用して市場での地位を維持した以前のプラットフォーム戦争を想起させます。

開発者のオンボーディングとファインチューニングのプレイブック

新規ユーザーは、13BチェックポイントをINT4モードで5分以内にロードするNvidiaのワンクリックColabノートブックから始めます。そこから提供されるLoRAトレーニングスクリプトは、わずか2,000件のJSONLデータセットを受け入れ、単一のH100上で約90分で1エポックを完了します。上級ユーザーは、完全にシャーディングされたデータ並列手法を使用して405Bモデルを32 GPUに分散する分散トレーニングレシピを有効にでき、ドメイン適応の壁時計時間を数週間から3日に短縮できます。ドキュメントには、モデル自体が生成した合成データを使用した指示チューニング、選好最適化、および継続事前学習のための具体的なレシピが含まれています。

制限と潜在的なリスク

オンデバイス使用ケースを制限するメモリフットプリントの制約。INT4での13Bバリアントでさえ12 GB VRAMを必要とし、ほとんどのコンシューマーラップトップを除外します。最新世代のドライバーへの依存は、標準化されたフリートポリシーを持つ組織に摩擦を生み出します。安全レポートは、無害なクエリを有害な出力に連鎖させるマルチターンジェイルブレイクに対する残存脆弱性を示しています。データ出所ドキュメントは高レベルに留まっており、下流の開発者はトレーニングミックス内の特定のドキュメントを追跡できず、新興のEU AI Act要件の下でのコンプライアンス監査を複雑にしています。ベンダーロックインは戦略的リスクを表します:将来のオープンモデルが代替ハードウェアベンダーから同等のカーネルレベル最適化を受けると、パフォーマンス上の利点が損なわれる可能性があります。Huggingfaceの完全なセット。

開発者とビジネスへの実践的な影響

LVNMを評価するチームは、ハードウェアにコミットする前にタスク適合性を検証するためにホストされた推論プレイグラウンドから始めるべきです。コストモデリングは、Nvidia管理のクラウドから提供する場合のGPU時間料金と潜在的なegress料金の両方を考慮する必要があります。ファインチューニング予算は寛容なライセンスの恩恵を受けますが、トレーニング実行中に予約されたH100容量が必要です。監査可能性を優先する組織は、Nvidiaがより詳細なデータ系統アーティファクトをリリースするまで、特定のLlama派生に伴うものなどの完全にオープンなデータセットを好むかもしれません。

規制および倫理的考慮事項

米国と欧州の両方の規制当局は、ハードウェア tied モデルリリースに関する調査を開始しています。その結果は将来のライセンス条項に影響を与える可能性があります。

ハードウェアとソフトウェアのバンドリングは、以前のオペレーティングシステムのケースから馴染みのある独占禁止法上の問題を引き起こしています。欧州当局は、競合するアクセラレータから推論最適化がどのように差し控えられているかについて詳細な説明を求めています。倫理的懸念は、フロンティアモデルの能力が、基盤となるコンピュート市場も支配する単一の商業団体に集中することに集中しています。

FAQ

LVNMのライセンスはLlama 3.1とどのように異なりますか?

LVNMは再配布時に帰属表示を必要とし、特定の軍事用途を制限します;Llama 3.1はより制限のない商用利用を許可します。

LVNMはBlackwell以外のGPUで動作しますか?

はい、ただしピークパフォーマンスは最新のドライバスタックを備えたBlackwellでのみ達成されます。

次のリリース予定日はいつですか?

Nvidiaは2026年末までにカリキュラム学習のアップデートを予告しています。

次に注目すべき点

次の四半期に Hugging Face 上での採用メトリクスを監視してください。ダウンロード速度とファインチューニング回数が実際の使用状況を示すシグナルとなります。

主要なクラウドプロバイダーが LVNM をマネージドオファリングにリストするかどうかを追跡してください。含まれる場合、インフラストラクチャチームが本番環境対応として扱っていることを示します。

他のチップベンダーの反応を観察してください。AMD と Google は独自のオープンモデル取り組みを持っており、このリリース後にタイムラインを調整する可能性があります。

開発者は今日から Nvidia の推論プレイグラウンドを通じてモデルをテストできます。より広範なフィードバックが、2026 年末までに予定されている次のトレーニングランを形作るでしょう。

ドメイン固有の垂直市場をターゲットにしたコミュニティファインチューニングは、60 日以内に登場する可能性が高いです。独自 API に対する総所有コストを定量化するエンタープライズケーススタディに注目してください。Nvidia の今後の GTC 基調講演では、LVNM 自体が生成した合成データでトレーニングされたカリキュラム学習のアップデートが発表される予定で、長期コンテキスト推論における現在の能力ギャップを埋める可能性があります。

急速に変化する技術ストーリーを追うチームは、ソースノート、ミーティングコンテキスト、フォローアップ質問を一緒に保管する場所を必要とすることがよくあります。軽量な AI ナレッジベース は、ニュースサイクルが変わった後でもそれらの可動部分を再訪しやすくします。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page