NVIDIAがNemotron 3 Embedをリリース、8BモデルがRTEBで首位を獲得
- Sophie Larsen

- 5 日前
- 読了時間: 21分
更新日:3 日前
NVIDIAは3つのオープンなチェックポイントを備えたNemotron 3 Embedをリリースし、その8Bモデルは平均NDCG@10スコア78.46でRTEBの首位に立ちました。この結果によりNVIDIAは、現実的な文書から関連する文章を見つけ出すことを目的に設計された検索ベンチマークの最前線に立ちました。
より重要なのは、また新たなリーダーボードでの勝利という点ではありません。NVIDIA Nemotron 3 Embedは、AI開発者がエージェント型システムにおいて、精度、レイテンシー、インフラコストをどこで考慮すべきかを見直すなかで登場しました。検索性能が向上すれば、言語モデルが回答の生成を開始する前に、無関係なコンテキストを減らせます。
NVIDIAはまた、開発者にこの方程式の一方だけを選ばせることも拒んでいます。このコレクションには、高精度な8Bチェックポイント、小規模な1Bモデル、そしてBlackwell GPU向けに最適化されたNVFP4バージョンが含まれます。NVIDIAによると、この量子化モデルは、BF16版のRTEBスコアの99.5パーセントを維持しながら、スループットを2倍にします。
この組み合わせが、今回のリリースを巡る中心的な緊張関係を生み出しています。見出しを飾るのは8Bチェックポイントですが、Nemotron 3 Embedが本番環境に普及するかどうかを決めるのは、より小規模なモデルかもしれません。エンタープライズチームが、単一のベンチマーク項目だけを見て検索システムを選ぶことはほとんどありません。
チームは、コーパスの構造、対応言語、ハードウェアの可用性、インデックス作成時間、レイテンシー、そして検索リクエストごとの運用コストを検討します。また、公開データセットで優れた性能を示すだけでなく、適切な社内証拠を検索できるかどうかも検証します。
直接的な圧力を受けるのは、他のオープンな埋め込みモデル提供者と、汎用埋め込みAPIを利用しているチームです。NVIDIAは、ダウンロード可能な重み、商用利用ライセンス、複数の精度オプション、一般的な推論フレームワークとの互換性を提供しています。
同時に、これらの選択肢をNVIDIAのハードウェアと密接に結び付けています。この関係性により、Nemotron 3 Embedはモデルのリリースであると同時に、プラットフォーム戦略にもなっています。
NVIDIA Nemotron 3 Embedが3つの導入オプションを提示
NVIDIAは、最高精度、低いサービングコスト、Blackwell向けに最適化されたスループットという、3つの異なる本番環境の優先事項に対応する単一の埋め込みモデルファミリーをリリースしました。
埋め込みモデルは、テキストを数値ベクトルに変換し、意味的に関連する文章を互いに近い位置へ配置します。検索システムはそれらのベクトルを比較し、検索、質問応答、コード探索、検索拡張生成に必要な証拠を見つけ出します。
NVIDIAは、埋め込みモデルコレクションを通じてモデルを公開しました。このコレクションでは、エンタープライズRAG、エージェント型検索、コード検索、エージェントメモリが主な用途として挙げられています。
最初のチェックポイントであるNemotron-3-Embed-8B-BF16は、約80億個のパラメーターを備えています。BF16は16ビットの数値形式であり、従来の32ビット演算と比べてメモリ使用量を抑えながら、広いダイナミックレンジを維持します。
このモデルは4,096次元の埋め込みを生成します。そのアーキテクチャには双方向アテンションを備えたTransformerエンコーダーが使用されており、各入力トークンは、その前後に現れるトークンを考慮できます。
NVIDIAは、トークンレベルの表現全体に平均プーリングを適用して最終ベクトルを生成します。モデルカードによると、ストレージ容量や検索速度を重視する場合、開発者は出力を2,048次元または1,024次元に短縮したうえで正規化することもできます。
1B BF16チェックポイントは、モデルを約11億4,000万パラメーターまで縮小し、2,048次元のベクトルを生成します。NVIDIAはこのバージョンを、8Bチェックポイントのインフラ要件を正当化することが難しい用途向けと位置付けています。
3つ目のチェックポイントは、NVIDIAの4ビット浮動小数点形式であるNVFP4を1Bモデルに適用しています。量子化は、モデルの重みを表現する際の数値精度を下げ、精度低下のリスクと引き換えにメモリおよび計算要件を削減します。
3つのチェックポイントはいずれも、最大32,768トークンのシーケンスを受け付けます。この上限により、システムはあらゆる内容を即座に小さな断片へ分割することなく、長いセクション、ドキュメントページ、完全なレコードを埋め込みに変換できます。
ただし、長いコンテキストウィンドウがあっても、慎重なチャンキングが不要になるわけではありません。長大な文章には複数の無関係なアイデアが含まれる可能性があり、そのどれも十分な精度で表現しないベクトルが生成されることがあります。
NVIDIAのドキュメントによると、モデルは34言語に対応しています。対象には、英語、中国語、スペイン語、アラビア語、ヒンディー語、日本語、韓国語、ベトナム語、ウクライナ語のほか、複数のヨーロッパ言語および南アジア言語が含まれます。
8Bチェックポイントは、Mistral AIのMinistral-3-8B-Instruct-2512をベースにしています。小規模なバージョンもMinistralファミリーに由来しており、NVIDIAが別のモデル提供者の基盤上に検索レイヤーを構築していることを示しています。
NVIDIAはOpenMDW 1.1に基づいてチェックポイントをライセンスし、商用利用可能と説明しています。それでも組織は、この契約、その通知要件、および同梱ソフトウェアに付随するライセンスを確認する必要があります。
したがって、このリリースは大きな制御力を提供しますが、「オープン」を無制限という意味で使うべきではありません。ダウンロード可能な重み、検査可能な設定ファイル、商用利用の許可は、正式なオープンソースの定義とはそれぞれ別の問題です。
変化した点は明快です。開発者は、無関係なモデルファミリー間を移動することなく、関連する3つのチェックポイントから選択できるようになりました。より難しい問いは、ベンチマーク首位のモデルが、その大きな運用負荷を相殺できるほど実際の検索性能を向上させるかどうかです。
NVIDIA Nemotron 3 EmbedはRTEBで首位に立つが、スコアには文脈が必要
78.46という結果は強力な公開ベースラインを確立していますが、特定の企業内でNemotron 3 Embedがどのような性能を示すかを決定付けるものではありません。
NVIDIAによると、Nemotron-3-Embed-8B-BF16は、16の公開RTEBタスク全体で平均NDCG@10スコア78.46を達成しました。NDCG@10は、取得された上位10件の結果の先頭付近に関連性の高い項目を配置したシステムを高く評価します。
この指標が重要なのは、ユーザーやエージェントが何百件もの検索結果を確認することはほとんどないためです。有用な検索システムは、後続の処理ステップで利用できるよう、最良の証拠を十分に早い順位へ配置しなければなりません。
NVIDIAによると、2026年7月16日時点で、8Bチェックポイントは多言語対応のRTEBリーダーボードで首位を維持していました。メンテナーによるモデルの追加、評価の更新、提出内容の修正に伴い、リーダーボードの順位は変動する可能性があります。
詳細な8Bモデルカードには、さらに2つの検索結果が記載されています。ViDoRe V3のテキスト部分では平均NDCG@10が60.60、MMTEB Retrievalでは75.45と報告されています。
ViDoReは視覚情報が豊富な文書からの検索に重点を置いていますが、ここで報告されている比較は、完全な視覚理解ではなく、抽出されたテキストを対象としています。MMTEBは、複数の言語とタスクにわたってテキスト埋め込みを評価します。
1B BF16モデルのスコアは、RTEBで72.38、ViDoRe V3のテキスト部分で57.74、MMTEB Retrievalで71.04でした。これらの数値は8Bバージョンを下回りますが、実際の導入判断を生むには十分に近い水準です。
また、NVIDIAが記載した前世代の基準モデルからも大幅に改善しています。モデルカードには、llama-nemotron-embed-vl-1b-v2のRTEBスコアが61.98、llama-nemotron-embed-1b-v2が60.47と記載されています。
この比較は、パラメーター数だけでなく、トレーニング上の選択が大きく貢献したことを示唆しています。NVIDIAによると、新モデルは、公開データ、商用利用可能なデータ、合成生成されたデータを合わせた5,000万件以上の事例でトレーニングされました。
同社はモデルカードで完全なデータセット一覧を提供していません。この情報の欠如により、対象ドメインの範囲、データ汚染のリスク、専門的な企業資料に対するモデルの予想される挙動を外部から分析することが困難になっています。
RTEBは、定義されたベンチマーク条件下で検索性能を測定するものでもあります。本番システムには、文書解析、チャンク境界、メタデータフィルター、ベクトルデータベースの設定、クエリ書き換え、再ランキング、アクセス制御が加わります。
各コンポーネントは、モデルレベルの改善を打ち消すことも、増幅することもあります。最高クラスの埋め込みモデルであっても、スキャンされたPDFが正しく解析されていなかったり、システムがマニュアル全体を単一レコードとして埋め込んでいたりすれば、質の低い証拠を返す可能性があります。
反対に、データが整理され、用語の範囲が限定され、信頼できるメタデータがあり、ドメインに合わせて調整されたリランカーを備えている企業では、順位の低いモデルでも良好な性能を示せます。公開ランキングは出発点であり、調達の最終判断ではありません。
同じ注意は、対応言語にも当てはまります。34言語にわたる評価には価値がありますが、その平均値は、すべての言語ペア、方言、文体、混在言語の文書で同等の性能を保証するものではありません。
したがって、NVIDIAの主張は、明示された範囲内では具体的で信頼できるものです。8Bチェックポイントは、記載された時点で、参照されたRTEBリーダーボードの首位に立っていました。
この記述を「すべての用途において最高の埋め込みモデル」と言い換えるのは不正確です。このベンチマークは、あらゆるワークロード、コスト制約、ハードウェア構成、非公開データセットを測定するものではありません。
本当の競争は検索品質とサービングコストの間にある
Nemotron 3 Embedは、おなじみのモデルサイズのトレードオフを、互換性のある単一ファミリー内での製品選択へと変えます。
8Bチェックポイントは、NVIDIAにとって最も強力な精度面での訴求材料となります。そのRTEBスコア78.46は1B BF16モデルを6.08ポイント上回り、MMTEB Retrievalスコアも4.41ポイント高くなっています。
システムが、互いに酷似したポリシー、コード関数、サポート事例、研究結果を区別しなければならない場合、こうした改善が重要になることがあります。文書を1件見落とすだけでも、言語モデルが裏付けのない回答へ向かう可能性があります。
しかし、8Bモデルには、より大きなメモリと計算リソースも必要です。デフォルトでは4,096次元のベクトルを出力し、1Bモデルの2,048次元の2倍です。
ベクトルの次元数は、ストレージ、インデックス作成、ネットワーク転送、類似度検索の処理量に影響します。数百万件の文章を埋め込みに変換する企業は、検索スタック全体でその違いを実感することになります。
NVIDIAは、次元スライシングによってこの問題に部分的に対応しています。開発者は8Bモデルの出力から先頭の2,048次元または1,024次元を保持し、短縮したベクトルを正規化できます。
この機能により、チームはモデルを再トレーニングすることなく、ストレージと精度のさまざまなバランスをテストできます。8Bエンコーダーの推論コストはなくなりませんが、下流のデータベース要件を削減できます。
1B BF16チェックポイントは、より明確な代替案を提供します。最大32,768トークンという同じ上限と多言語対応範囲を維持しながら、パラメーター数とベクトルサイズを削減しています。
RTEBスコア72.38は、この小規模モデルが8Bチェックポイントの絶対スコアの約92パーセントを維持していることを意味します。絶対スコアの維持率がタスクレベルでの有用性と直接一致するわけではありませんが、精度差が一定の範囲内に収まっていることを示しています。
そのため、1Bモデルは特にインタラクティブな用途に適しています。検索ボックス、コーディングアシスタント、ツール選択エージェントでは、生成前に検索が行われるため、短い応答時間が求められます。
エージェントが1つのタスク中に複数回の検索を実行すると、レイテンシーは積み重なる可能性があります。計画、証拠収集、検証、修正の各段階で小さな遅延が繰り返されると、ユーザーにも認識できるようになります。
トラフィック量によってもコストの方程式は変わります。8Bモデルは、件数が限られた高価値の調査リクエストには妥当でも、継続的なバックグラウンドでのインデックス作成には正当化しにくい場合があります。
企業は、単一のチェックポイントに統一する代わりに、ワークロードを分割できます。1Bモデルで日常的なクエリを処理し、8Bモデルで曖昧なリクエストやリスクの高い判断を処理することが可能です。
リランカーは、もう1つの選択肢を提供します。チームは、より小規模な埋め込みモデルを使って候補セットを取得し、その結果だけを、より高コストなモデルで並べ替えることができます。
Nemotron 3 Embedによって、こうしたアーキテクチャ上の判断が不要になるわけではありません。各チェックポイントが同じ製品系統と想定用途を共有しているため、組織はそれらをより一貫した基準で検証できるようになります。
したがって、最大の競争相手は特定の名指しされたライバルではありません。それは、より大規模なベンチマークリーダーよりも、小型で低コストな検索モデルを優先する本番環境での選好です。
NVIDIAがこの議論で勝てるのは、8Bチェックポイントが、その運用負荷を正当化できるだけの追加の関連エビデンスを生み出す場合に限られます。1B版でほぼ同等のビジネス成果が得られるなら、実用上は小型モデルが勝者となります。
NVFP4がBlackwellをモデル戦略の一部にする
NVFP4チェックポイントは検索効率をNVIDIAの最新GPUアーキテクチャと結び付け、モデル圧縮をハードウェア上の優位性へと変えます。
NVIDIAによると、Nemotron-3-Embed-1B-NVFP4はBlackwell GPU上でBF16版の2倍のスループットを実現します。また、RTEBスコアは72.00で、1B BF16の72.38と比較されています。
この0.38ポイントの差は、NVIDIAの計算では99.5パーセントのスコア維持率に相当します。精度の変動が小さい一方、主張されているスループット向上は大きいため、このトレードオフは魅力的に見えます。
NVFP4モデルカードでは、NVIDIA Model Optimizerで最適化されたチェックポイントとして説明されています。想定されるデプロイ経路は、NVIDIAのソフトウェアとBlackwellハードウェアにより直接的に依存しています。
ここで、このリリースは通常のモデル公開の枠を超えます。NVIDIAは、チェックポイント、量子化形式、ランタイム、アクセラレータを、ひとつのスタックを構成する相互に関連した要素として設計できます。
この連携により、すでにBlackwellシステムを運用している顧客にとってデプロイが簡素化される可能性があります。一方で、NVIDIAのインフラ戦略から切り離してモデルを評価するコストも増大します。
スループットに関する主張は慎重に解釈する必要があります。ハードウェアベンチマークは、バッチサイズ、シーケンス長、ランタイムのバージョン、メモリ制限、リクエストパターン、そしてテスト対象となった具体的なBlackwell GPUに左右されます。
NVIDIAのテスト構成で2倍の向上が見られたとしても、すべての本番サービスで同じ結果が得られるとは限りません。チームは、実際の運用を代表する文書長と同時実行数を用いて比較を再現する必要があります。
短いサポート問い合わせは、長い法務文書とは異なる挙動を示します。オフラインのインデックス作成では大きなバッチを使用できますが、インタラクティブ検索では個々のリクエストのレイテンシを最適化する必要があります。
それでもNVFP4の結果が重要なのは、埋め込みワークロードが最適化にとりわけ適しているためです。企業は多くの場合、大規模な文書コレクションをバッチでエンコードし、安定したモデルを通じて繰り返しクエリを処理します。
高速なエンコーダーはインデックス作成時間を短縮し、固定されたインフラ上でより多くの検索を処理できるようにします。また、文書が継続的に変更される環境では、頻繁な再インデックス作成をより現実的なものにできます。
ただし、量子化によって、平均スコアには表れない偏った障害が生じる可能性があります。0.38ポイントのベンチマーク低下が、特定の言語、ドメイン、または判別の難しいケースに集中している可能性があります。
たとえば医療検索システムでは、圧縮された埋め込みが、類似する治療法、症状、禁忌の違いを維持できるかを確認する必要があります。コード検索システムでは、名前が似ていても副作用が異なる関数をテストすべきです。
このため、タスクごとの評価は全体的なスコア維持率よりも重要です。チームは自社のコーパス上で、再現率、ランキング品質、レイテンシ、メモリ使用量、失敗事例を比較する必要があります。
ハードウェアへの依存は、Blackwellの処理能力を持たない購入者にも影響します。モデルのドキュメントによると、1B BF16チェックポイントはAmpere、Hopper、Blackwellを含む、より幅広いNVIDIAアーキテクチャをサポートしています。
他のアクセラレータを使用する組織には、追加の検証が必要です。モデルの重みは利用できるとしても、最適化されたNVFP4経路はNVIDIA固有の価値提案の一部です。
これは偶発的な制約ではありません。オープンモデルによって自社アクセラレータの優位性を測定し、導入しやすくなれば、NVIDIAには利益があります。
したがって、Nemotron 3 Embedは2つの方向から埋め込みプロバイダーに圧力をかけます。8Bモデルは検索品質で競争し、NVFP4モデルはハードウェアに最適化された効率性で競争します。
RTEBランキングでは答えられないこと
Nemotron 3 Embedは優れたベンチマーク実績を持っていますが、非公開データ、混在形式、完全なRAGパイプラインにわたる本番環境での信頼性は、まだ検証されていません。
最も重要な不確実性は、評価結果の転用可能性に関するものです。RTEB、MMTEB、ViDoReは標準化された比較を提供しますが、企業のコーパスがベンチマーク用コレクションに似ていることはほとんどありません。
内部データには、重複文書、古いポリシー、略語、アクセス制限、崩れた書式、公開トレーニング資料には一度も登場しない語彙が含まれています。これらの条件が相互に作用すると、検索品質は急激に低下する可能性があります。
NVIDIAは、デプロイ前にアプリケーション固有のテストを実施するようユーザーに推奨しています。埋め込みのエラーは気付かれないまま連鎖するため、この警告は首位というラベル以上に注目されるべきです。
生成モデルは、誤った文章からでも流暢な回答を生成できます。出典を確認しなければ、元の誤りが検索によって引き起こされたにもかかわらず、ユーザーは言語モデルを非難する可能性があります。
長いコンテキストは、もうひとつの未解決のトレードオフを生み出します。32,768トークンの上限により大きな入力を扱えますが、長い文書をひとつのベクトルに埋め込むと、多数のトピックが単一の表現に圧縮されます。
チャンクを小さくすると特異性は向上しますが、インデックスが拡大し、事実がその文脈から切り離される可能性があります。理想的なチャンクサイズは、文書構造、クエリの種類、生成モデルが処理できるテキスト量によって異なります。
開発者は、密検索だけで十分かどうかも判断しなければなりません。完全一致する名前、識別子、エラーコード、まれな専門用語については、キーワード検索のほうがセマンティックベクトルより適切に処理できる場合が多くあります。
多くの本番システムは、密ベクトル検索と字句検索、メタデータフィルタリング、再ランキングを組み合わせています。Nemotron 3 Embedはパイプライン全体を置き換えるのではなく、その一段階を改善します。
多言語対応に関する主張にも、同様に詳細なテストが必要です。多言語の平均スコアが高いモデルでも、企業にとって最も重要な言語ペアや地域固有の専門語彙では苦戦する可能性があります。
言語横断検索には、さらに別の課題があります。ユーザーが日本語で書かれたポリシーについて英語で質問し、その後、適用される正確な一節が返されることを期待する場合があります。
トレーニングの透明性にも限界があります。NVIDIAは、公開されたもの、商用利用が許可されたもの、合成されたものを含む5,000万件超のサンプルを使用したと述べていますが、公開されたモデルカードではそのすべてが詳しく列挙されていません。
そのため、表現上の欠落を調査したり、ベンチマークに類似した素材がトレーニングに影響したかどうかを判断したりすることが困難です。そのような汚染が発生したという証拠はここにはありませんが、外部の研究者がその可能性を排除するには詳細が不足しています。
ライセンスは別途検討する必要があります。OpenMDW 1.1は商用利用を許可していますが、その義務がApache 2.0や他の一般的なソフトウェアライセンスと同じだと企業が想定すべきではありません。
基盤となるMinistralモデルと関連ソフトウェアには、それぞれ独自の条件が適用される可能性があります。法務チームは、チェックポイントを配布製品に組み込む前に、依存関係全体を評価する必要があります。
セキュリティもモデルだけにとどまりません。埋め込みサービスは機密性の高い可能性がある企業文書やユーザークエリを処理し、そのベクトルデータベースはデータ内の意味的な関係を明らかにする可能性があります。
組織には、暗号化、アクセス権限を考慮した検索、削除手順、プロンプトを利用したデータ抽出に対するテストが必要です。より強力なモデルでも、こうした制御が自動的に実施されるわけではありません。
ベンチマークの変動性にも最後の注意が必要です。首位とは特定時点のリーダーボード上の順位を表すものであり、恒久的な地位ではありません。
新たな提出、評価コードの修正、競合モデルの改善によって、結果の順位はすぐに変わる可能性があります。チームが内部判断にランキングを使用する際は、ベンチマークのバージョンと日付を記録すべきです。
適切な結論は、否定でも自動的な採用でもありません。NVIDIAは本格的な評価に値する十分な証拠を提示しましたが、評価を省略できるほどではありません。
NVIDIAの優位性が重要かどうかを示す3つのシグナル
次の段階は、さらなる目を引くスコアではなく、独立した再現、実運用での採用、競合他社の対応に左右されます。
第1のシグナルは、タスク単位での再現です。独立した評価者が78.46というRTEBの結果を再現し、16の全タスクにわたる内訳を公開する必要があります。
詳細な内訳があれば、Nemotron 3 Embedが一貫して勝っているのか、それとも少数のデータセットによって平均値の大部分を押し上げているのかが明らかになります。また、言語やドメイン固有の弱点も浮き彫りになるでしょう。
同じ精査をNVFP4にも適用すべきです。独立したテストでは、同一のBlackwellハードウェア、ソフトウェアバージョン、シーケンス長、バッチサイズを使用してBF16とNVFP4を比較する必要があります。
そうしたテストで、検索品質の低下を最小限に抑えながら約2倍のスループットが確認されれば、NVIDIAのコストパフォーマンスに関する主張ははるかに強固になります。テスト条件と本番環境の結果に大きな隔たりがあれば、その主張は弱まります。
第2のシグナルは、実際の採用です。ダウンロード数やリーダーボードへの注目は関心の高さを示しますが、企業がライブ検索、コード、エージェントメモリをモデルに任せていることの証明にはなりません。
有用な証拠となるのは、レイテンシ、インデックスサイズ、検索精度、障害率を報告する本番環境のケーススタディです。比較には、公開ベンチマークのサブセットではなく、非公開またはドメイン固有のデータセットを使用すべきです。
エージェント型アプリケーションは、とりわけ示唆に富むテストになります。エージェントは検索を繰り返す可能性があるため、検索性能のわずかな向上でも、成果につながらないツール呼び出しや不要な生成を減らせます。
その効果は、ワークフロー全体の指標に表れるはずです。チームは、タスクの完了率、生成された総トークン数、検索試行回数、ユーザーによる修正、検証済みの回答を得るまでの時間を測定すべきです。
社内ナレッジシステムを構築する人々も、同様の問題に直面します。検索レイヤーが後から適切なエビデンスを提示できなければ、文書を取り込むだけでは十分ではありません。
構造化されたAIナレッジベースも、データ品質、権限、検索設計に依存します。より優れたエンコーダーはそのシステムを強化しますが、こうした基盤を置き換えるものではありません。
第3のシグナルは、競合する埋め込みプロバイダーの対応です。競合他社は、より高いベンチマークスコア、より低いハードウェア要件、より透明性の高いトレーニングデータ、またはより強力なドメイン特化モデルによってNVIDIAに対抗できます。
競合モデルは、あらゆる場面で78.46を上回る必要はありません。一般的なハードウェアでより低いレイテンシを実現するか、金融、医療、法務、ソフトウェア開発で優れた検索性能を提供すれば、勝つことができます。
NVIDIA自身のチェックポイント構成も、その現実を認めています。単一のスコアだけでは本番環境への適合性を判断できないため、同社は3つのバージョンを公開しました。
8Bモデルは精度重視の物語を支えます。1B BF16チェックポイントはチームに低コストな選択肢を提供し、NVFP4はBlackwellの効率性を測定可能なセールスポイントへと変えます。
この組み合わせにより、NVIDIA Nemotron 3 Embedは、単独のリーダーボード提出よりも重要な存在となります。開発者は、ひとつのモデルファミリー内で品質と効率を統制された形で比較できます。
現時点での推奨事項は、同じ非公開の評価セットを用いて3つすべてのチェックポイントをテストすることです。完全一致クエリ、意味的な質問、長い文書、複数言語の混在、意図的に混乱を招く文章を含めてください。
生成モデルに接続する前に検索性能を測定してください。その後、レイテンシ、トークン使用量、根拠のない回答、ユーザーによる修正を含め、RAGまたはエージェントのワークフロー全体を評価します。
現在、NVIDIA Nemotron 3 EmbedはRTEBの話題の中心にいますが、その優位性が持続するかどうかは本番環境での証拠によって決まります。実際のコーパスで最も優れた性能を示すのはどのチェックポイントでしょうか。そして、その検索性能の向上は、それを支えるインフラに見合うものでしょうか?


