NVIDIA Nemotron-3 Super: ハイブリッドMambaとLatent MoEがLLM推論を変える方法
- Aisha Washington

- 6月6日
- 読了時間: 7分
更新日:6月17日

NVIDIAは最近、120BパラメータのMixture-of-ExpertsであるNemotron-3 Superをリリースしました。モデルサイズと速度のトレードオフに関する考え方を根本的に変える (MoE) モデルです。推論中に 12B パラメータのみをアクティブにし、ハイブリッド Mamba-Transformer アーキテクチャを利用することで、このモデルは大規模言語モデルを悩ませてきた「メモリの壁」を解決しようとしています。開発者にとって最も直接的な成果は、前世代と比較してスループットが 5 倍になり、さらに 100 万トークンのコンテキストウィンドウが利用可能になることです。
ユーザーエクスペリエンス:効率向上 vs. 厳格な安全性フィルタリング

LocalLLaMAコミュニティの初期採用者は、特定の二分法を強調しています。NVIDIA Nemotron-3 Super 体験。 技術的な側面から見ると、その効率性は疑いようがありません。このモデルはハイブリッドMamba-Transformerアーキテクチャ(おおよそ75/25の分割)を使用しているため、KVキャッシュ、つまり会話の以前の部分を記憶するために必要なメモリが大幅に削減されます。これにより、ユーザーは、標準的なTransformerモデルでは処理しきれないようなハードウェアで、大規模なコンテキストウィンドウを実行できます。
しかし、「すぐに使える」状態での安全性チューニングに関しては批判に直面しています。多くのユーザーは、このモデルが積極的にRLHF(人間のフィードバックからの強化学習)でチューニングされており、頻繁な「拒否」につながると報告しています。たとえ無害な創作活動やコーディングタスクであっても、モデルはしばしばプロンプトをポリシー違反の可能性としてフラグ付けします。このモデルを検閲なしのローカル推論に使用したいと考えている人にとっては、「検閲解除」されたファインチューニング、またはより緩やかなシステムプロンプトが、120Bパラメータの潜在能力を最大限に引き出すためにほぼ必須となります。
もう一つの実用的な観察は、知識のカットオフに関するものです。事前学習データには2025年初頭までのトークンが含まれていますが、ユーザーは、10兆トークンという巨大なデータセットに重複する年代情報が含まれているためか、モデルが時折古いデータを「現在の」状態として幻覚を起こすことに気づいています。最近の出来事に関する正確な回答を得るために、ユーザーは一般的なニュースの質問よりも、ソフトウェアやOSリリースのバージョン番号を具体的に尋ねることで成功を収めています。
技術的ブレークスルー:NVIDIA Nemotron-3 SuperにおけるLatent MoEとハイブリッドアーキテクチャ

コアはNVIDIA Nemotron-3 Super パフォーマンスは、Latent MoE(Mixture of Experts)と呼ばれる新しいコンセプトにあります。 従来のMoEモデルでは、ルーターはトークンを特定の専門家セット(例:トップ1またはトップ2)に送信します。NVIDIAのアプローチでは、モデルは1つの計算コストで4つの専門家をアクティブにすることができます。この「潜在的」なアクティベーションは、通常必要とされる計算量の線形増加なしに、推論精度を大幅に向上させます。
ハイブリッドマンバ・トランスフォーマー層
標準的なトランスフォーマーは、アテンションメカニズムが二次的なメモリを必要とするため、コンテキストが大きくなるにつれてスケーリングが悪くなります。NVIDIA Nemotron-3 Superは、アーキテクチャの75%にマンバ層を使用することで、これを解決します。状態空間モデル(SSM)であるマンバは、線形スケーリングで長いシーケンスを処理します。層の25%を従来の注意メカニズムとして維持することで、モデルはトランスフォーマーの「より強力な」リコールおよび論理機能を維持しながら、長いコンテキストメモリの重い処理をマンバ層にオフロードします。
マルチトークン予測(MTP)
このモデルはマルチトークン予測も実装しています。次の単語を1つ予測するのではなく、複数の後続トークンを同時に予測します。これが、スループットが5倍になった主な要因です。NVIDIAのBlackwellハードウェアとNVFP4(4ビット浮動小数点)量子化と組み合わせると、速度の向上は指数関数的になります。NVFP4は、FP8の半分のメモリフットプリントで高精度推論を可能にし、120Bモデルを大規模なサーバークラスターだけでなく、プロフェッショナルワークステーションでも実行可能にします。
エージェンティックAIおよびロングコンテキストワークフローへの戦略的影響
NVIDIA は "remio" を設計しました。NVIDIA Nemotron-3 Super"Agentic AIを念頭に置いています。ほとんどのモデルは、20ステップのタスクを実行するように求められると集中力を失い、「目標ドリフト」が発生して最初の指示が忘れられます。1Mのコンテキストウィンドウとハイブリッドアーキテクチャによって提供される安定性は、エージェントを軌道に乗せ続けることを目的としています。
このリリースは、NVIDIAのオープンソース戦略における転換点でもあります。モデルの重みに加えて、10兆トークンのデータセット分布を含む完全なトレーニング「レシピ」も提供されています。この透明性は、「防御的AI」を構築する必要がある企業を対象としています。これは、完全に理解でき、内部セキュリティのために監査できるモデルです。開発者にとっては、モデルがどのように誘導されたかを正確に確認できるため、特定の動作をリバースエンジニアリングしたり、特殊なコードベースや法律文書分析のようなニッチな産業アプリケーション向けにモデルをファインチューニングしたりすることが容易になります。
ハードウェアの現実:コンシューマー vs プロフェッショナル要件

12Bのアクティブパラメータ数により、NVIDIA Nemotron-3 Superは軽量に聞こえますが、フル120Bパラメータは依然としてVRAMに格納する必要があります。これは、RTX 4090(24GB)のような単一のコンシューマーGPUではモデルを実行できないことを意味します。意味のあるコンテキストウィンドウでモデルを実行するには、最低でもデュアル48GBカードまたはプロフェッショナルRTX 6000 Adaが必要です。
モデルがNVFP4に最適化されていることは、NVIDIAがユーザーを最新のBlackwellアーキテクチャに誘導している明確なシグナルです。古いHopperチップでは、アーキテクチャのメリットは引き続き得られますが、新しい4ビット精度フォーマットによって約束されている4倍の速度向上は見られません。ローカルコミュニティにとって、これは重みは「オープン」であっても、真のパフォーマンスの天井はハイエンドハードウェアによって制限されることを意味します。
アダプティブFAQ
NVIDIA Nemotron-3 SuperのMamba-Transformerハイブリッドはどのように速度を向上させますか?
Mambaレイヤーはシーケンス処理を線形スケーリングで処理するため、従来のTransformerの二次スケーリングよりもはるかに高速でメモリ効率が高くなります。モデルの75%にMambaを使用することで、NVIDIAは計算負荷を軽減し、残りの25%のTransformerレイヤーは高度な推論を維持します。
NVIDIA Nemotron-3 Superを単一のRTX 4090で実行できますか?
完全な精度ではありません。120Bモデルは、量子化してもかなりのVRAMを必要とします。4ビット量子化(NVFP4)はメモリ要件を削減しますが、4090で利用可能な24GBを超えます。1Mのコンテキストウィンドウを利用するには、複数のGPUまたは少なくとも80GB〜100GBのVRAMを搭載したシステムが必要になるでしょう。
「Latent MoE」とは何ですか?そして、なぜ重要なのでしょうか?
Latent MoEは、モデルが4つのエキスパートがアクティブであるというインテリジェンスを獲得しながら、1つのエキスパートの計算「コスト」しか支払わないことを可能にする技術です。これにより、以前のバージョンと比較して、推論速度に対するモデルの精度が実質的に2倍になります。
NVIDIA Nemotron-3 Superデータセットの知識カットオフは何ですか?
事前学習データには2025年までの情報が含まれており、一部のファインチューニングデータは2026年まで拡張されています。ただし、ユーザーは、特に新しい技術データを要求しない限り、モデルが特定の一般的なクエリに対して2024年の知識にデフォルトする可能性があることに注意する必要があります。
モデルが特定のクリエイティブなプロンプトを拒否するのはなぜですか?
モデルは、安全性と企業への適合性に関して大幅に調整されています。厳格な拒否メカニズムを備えており、クリエイティブライティングやロールプレイング中に「誤検知」としてトリガーされることがあります。システムプロンプトを調整するか、コミュニティ主導の「unslop」ファインチューンを使用するのが一般的な解決策です。
NVIDIA Nemotron-3 Superは、コーディングにおいてGPT-4よりも優れていますか?
「エージェンティック」コーディングの観点から—モデルがリポジトリ全体を分析する必要がある場合—1Mのコンテキストウィンドウは明確な利点をもたらします。アーキテクチャのコンテキストを失うことなく、一度に多くのコードを「読み取る」ことができますが、GPT-4は小さな独立したスニペットに対するゼロショットロジックでは依然として優位性を持つ可能性があります。
NVFP4量子化は精度の低下を引き起こしますか?
NVIDIAのBlackwellハードウェアでのテストによると、NVFP4フォーマットはFP8と同等のパフォーマンスを、精度の測定可能な低下なしに提供します。これにより、従来の4ビット手法で見られる典型的な「量子化ペナルティ」なしに、大幅なメモリ節約と速度向上が可能になります。


