NVIDIA 发布 Nemotron 3 Embed,其 8B 模型在 RTEB 上夺得第一
- Martin Chen

- 5天前
- 讀畢需時 14 分鐘
已更新:3天前
NVIDIA 发布了包含三个开放检查点的 Nemotron 3 Embed,其 8B 模型以 78.46 的平均 NDCG@10 分数位列 RTEB 第一。这一结果使 NVIDIA 在一项旨在从真实文档中查找相关段落的检索基准测试中处于领先地位。
更重要的故事并非又一次排行榜胜利。随着 AI 开发者重新思考准确率、延迟和基础设施成本在智能体系统中的作用,NVIDIA Nemotron 3 Embed 应运而生。更好的检索可以在语言模型开始生成答案之前减少无关上下文。
NVIDIA 也没有迫使开发者只能在这一权衡的某一端做出选择。该系列包括高准确率的 8B 检查点、更小的 1B 模型,以及针对 Blackwell GPU 优化的 NVFP4 版本。NVIDIA 表示,量化模型在保留其 BF16 对应模型 99.5% RTEB 分数的同时,将吞吐量提升了一倍。
这种组合形成了此次发布的核心张力。8B 检查点占据了头条,但更小的模型可能决定 Nemotron 3 Embed 能否真正投入生产。企业团队很少仅凭基准测试中的单项数据选择检索系统。
他们会考虑语料库结构、语言覆盖范围、硬件可用性、索引时间、延迟,以及处理每次搜索请求的运营成本。他们还会测试模型能否检索到正确的内部证据,而不仅仅是在公共数据集上表现出色。
其他开放嵌入模型提供商以及使用通用嵌入 API 的团队将率先感受到压力。NVIDIA 提供了可下载的权重、商用许可、多种精度选项,以及与常见推理框架的兼容性。
同时,它也将这些选择与 NVIDIA 硬件紧密绑定。这种关系使 Nemotron 3 Embed 既是一次模型发布,也是一项平台战略。
NVIDIA Nemotron 3 Embed 提供三种部署选择
NVIDIA 发布了一个嵌入模型系列,以满足三种不同的生产优先级:最高准确率、更低的服务成本,以及针对 Blackwell 优化的吞吐量。
嵌入模型将文本转换为数值向量,使语义相关的段落彼此接近。检索系统通过比较这些向量,为搜索、问答、代码发现或检索增强生成定位证据。
NVIDIA 通过其嵌入模型合集发布了这些模型。该合集将企业级 RAG、智能体检索、代码搜索和智能体记忆列为主要应用。
第一个检查点 Nemotron-3-Embed-8B-BF16 包含约 80 亿个参数。BF16 是一种 16 位数值格式,与传统的 32 位计算相比,它在减少内存使用的同时保留了较大的动态范围。
该模型生成 4,096 维的嵌入向量。其架构采用具有双向注意力机制的 Transformer 编码器,这意味着每个输入 token 都可以关注出现在其之前和之后的 token。
NVIDIA 通过对 token 级表示进行平均池化来获得最终向量。模型卡还表示,当存储空间或搜索速度更为重要时,开发者可以将输出缩短为 2,048 维或 1,024 维,然后进行归一化。
1B BF16 检查点将模型缩减至约 11.4 亿个参数,并生成 2,048 维向量。NVIDIA 将该版本定位于难以证明 8B 检查点基础设施需求合理性的应用场景。
第三个检查点将 NVIDIA 的四位浮点格式 NVFP4 应用于 1B 模型。量化会降低表示模型权重所使用的数值精度,在可能降低准确率的同时减少内存和计算需求。
三个检查点均支持最长 32,768 个 token 的序列。这一限制使系统能够嵌入较长的章节、文档页面或完整记录,而不必立即将所有内容拆分成小片段。
然而,较长的上下文窗口并不能消除对合理分块的需求。较大的段落可能包含多个彼此无关的观点,从而生成无法足够精确地表示其中任何一个观点的向量。
根据 NVIDIA 的文档,这些模型覆盖 34 种语言,其中包括英语、中文、西班牙语、阿拉伯语、印地语、日语、韩语、越南语、乌克兰语,以及多种欧洲和南亚语言。
8B 检查点基于 Mistral AI 的 Ministral-3-8B-Instruct-2512。较小的版本同样源自 Ministral 系列,这表明 NVIDIA 正在另一家模型提供商的基础之上构建检索层。
NVIDIA 根据 OpenMDW 1.1 为这些检查点授予许可,并称其已可用于商业用途。组织仍需审查该协议、其中的通知要求,以及所含软件附带的许可证。
因此,此次发布提供了相当大的控制权,但不应将“开放”当作“不受限制”的简称。可下载的权重、可检查的配置文件和商业使用许可,与正式的开源定义是彼此独立的问题。
变化非常直观:开发者现在可以在三个相关检查点之间进行选择,而不必切换到互不相关的模型系列。更难回答的问题是,这个基准测试领先者带来的实际检索改进,是否足以抵消其更大的运营负担。
NVIDIA Nemotron 3 Embed 领跑 RTEB,但该分数需要结合背景解读
78.46 的结果确立了一个强有力的公共基线,但并不能决定 Nemotron 3 Embed 在特定公司内部的表现。
NVIDIA 报告称,Nemotron-3-Embed-8B-BF16 在 16 项公开 RTEB 任务中取得了 78.46 的平均 NDCG@10 分数。NDCG@10 会奖励将相关结果排在前十个检索项目靠前位置的系统。
这项指标非常重要,因为用户和智能体很少查看数百条搜索结果。实用的检索系统必须尽早将最佳证据排在前面,以便下一个处理步骤使用。
NVIDIA 表示,截至 2026 年 7 月 16 日,8B 检查点在多语言 RTEB 排行榜上位列第一。随着维护者添加模型、更新评估或更正提交结果,排行榜名次可能发生变化。
详细的 8B 模型卡还报告了另外两项检索结果。其中列出的 ViDoRe V3 文本部分平均 NDCG@10 为 60.60,MMTEB Retrieval 分数为 75.45。
ViDoRe 专注于从视觉内容丰富的文档中进行检索,不过这里报告的比较针对的是提取后的文本,而非完整的视觉理解。MMTEB 用于跨语言、跨任务评估文本嵌入。
1B BF16 模型在 RTEB 上得分 72.38,在 ViDoRe V3 文本部分得分 57.74,在 MMTEB Retrieval 上得分 71.04。这些数据落后于 8B 版本,但差距足够小,因而形成了真正的部署选择。
与 NVIDIA 列出的上一代参考模型相比,它们也取得了显著提升。模型卡报告称,llama-nemotron-embed-vl-1b-v2 的 RTEB 分数为 61.98,llama-nemotron-embed-1b-v2 为 60.47。
这一比较表明,训练选择带来的贡献超过了单纯的参数规模。NVIDIA 表示,新模型使用了超过 5,000 万条公开、允许商业使用及合成生成的样本进行训练。
该公司没有在模型卡中提供完整的数据集清单。这一缺失限制了外界对领域覆盖范围、数据污染风险,以及模型在专业企业材料上可能表现的分析。
RTEB 还在特定的基准测试条件下衡量检索能力。生产系统则会引入文档解析、分块边界、元数据过滤、向量数据库设置、查询重写、重排序和访问控制等因素。
每个组件都可能抵消或放大模型层面的优势。即使是顶尖的嵌入模型,如果扫描版 PDF 解析错误,或系统将整本手册作为单条记录进行嵌入,仍然可能返回糟糕的证据。
相反,如果一家公司拥有干净的数据、范围明确的术语、可靠的元数据,以及针对其领域调优的重排序器,那么排名较低的模型也可能表现良好。公开排名只是起点,而非采购结论。
同样的谨慎态度也适用于语言覆盖范围。对 34 种语言进行评估很有价值,但平均分并不能保证模型在每种语言组合、方言、写作风格或混合语言文档上都有同等表现。
因此,NVIDIA 的说法在其声明的边界内具体且可信。8B 检查点在所述时间位列所引用的 RTEB 排行榜第一。
将这一说法转化为“适合所有应用的最佳嵌入模型”并不准确。该基准测试并未衡量所有工作负载、成本限制、硬件配置或私有数据集。
真正的竞争在于检索质量与服务成本之间的权衡
Nemotron 3 Embed 将常见的模型规模权衡转化为同一个兼容系列内的产品选择。
8B 检查点为 NVIDIA 提供了最有力的准确率叙事。其 78.46 的 RTEB 分数比 1B BF16 模型高出 6.08 分,而 MMTEB Retrieval 分数则高出 4.41 分。
当系统必须区分高度相似的政策、代码函数、支持案例或研究结果时,这些提升可能非常重要。遗漏一份文档就可能导致语言模型生成缺乏依据的答案。
然而,8B 模型也带来了更高的内存和计算需求。默认情况下,它会生成 4,096 维向量,是 1B 模型 2,048 维向量的两倍。
向量维度会影响存储、索引、网络传输和相似度搜索的工作量。对于需要嵌入数百万个段落的公司来说,这种差异会贯穿整个检索技术栈。
NVIDIA 通过维度切片在一定程度上解决了这一问题。开发者可以保留 8B 输出的前 2,048 维或 1,024 维,然后对缩短后的向量进行归一化。
这一功能使团队无需重新训练模型,即可测试不同的存储与准确率平衡点。它无法消除 8B 编码器的推理成本,但可以降低下游数据库的需求。
1B BF16 检查点提供了更明确的替代方案。它在减少参数量和向量维度的同时,保留了相同的 32,768 token 上限和多语言覆盖范围。
其 72.38 的 RTEB 分数意味着,这个较小的模型保留了 8B 检查点绝对分数的约 92%。绝对分数保留比例并不直接等同于任务层面的实用性,但它表明准确率差距是有限的。
这使 1B 模型尤其适合交互式应用。搜索框、编程助手和工具选择智能体都依赖较短的响应时间,因为检索发生在生成之前。
当智能体在一项任务中执行多次搜索时,延迟可能会不断累积。在规划、证据收集、验证和修订过程中反复出现的小幅延迟,最终会被用户明显感知。
成本计算也会随着流量而变化。8B 模型对于数量有限的高价值研究请求而言可能是合理的,但用于持续的后台索引则更难证明其成本合理性。
企业可以划分工作负载,而不是统一采用一个检查点。1B 模型可以处理常规查询,而 8B 模型则处理模糊请求或高风险决策。
重排序器提供了另一条路径。团队可以使用较小的嵌入模型检索候选集合,然后应用成本更高的模型,仅对这些结果重新排序。
Nemotron 3 Embed 并没有让这些架构决策消失。它为组织测试这些决策提供了更加一致的基础,因为这些检查点拥有相同的产品血统和预期用途。
因此,它的主要对手并非某个具体的竞争产品,而是生产环境中相较于更大的基准测试领先模型,更倾向于采用更小、更便宜检索模型的偏好。
只有当 8B 检查点能够提供足够多的额外相关证据,从而证明其服务负担合理时,NVIDIA 才能赢得这场争论。如果 1B 版本带来的业务结果几乎相同,那么更小的模型就会成为实际赢家。
NVFP4 让 Blackwell 成为模型叙事的一部分
NVFP4 检查点将检索效率与 NVIDIA 最新的 GPU 架构连接起来,把模型压缩转化为硬件优势。
NVIDIA 表示,在 Blackwell GPU 上,Nemotron-3-Embed-1B-NVFP4 的吞吐量是 BF16 版本的两倍。其公布的 RTEB 得分为 72.00,而 1B BF16 的得分为 72.38。
按照 NVIDIA 的计算,这 0.38 分的差距相当于保留了 99.5% 的得分。由于准确率变化很小,而其声称的吞吐量提升显著,因此这一权衡看起来颇具吸引力。
NVFP4 模型卡介绍了一个使用 NVIDIA Model Optimizer 优化的检查点。其预期部署路径更直接地依赖于 NVIDIA 的软件和 Blackwell 硬件。
正是在这里,这次发布超越了普通的模型发布。NVIDIA 可以将检查点、量化格式、运行时和加速器设计为同一技术栈中相互关联的组成部分。
对于已经在运行 Blackwell 系统的客户而言,这种协同可以简化部署。与此同时,它也提高了脱离 NVIDIA 基础设施战略对该模型进行独立评估的成本。
对吞吐量声明需要谨慎解读。硬件基准测试取决于批次大小、序列长度、运行时版本、内存限制、请求模式以及接受测试的具体 Blackwell GPU。
在 NVIDIA 测试配置下实现两倍提升,并不保证每项生产服务都能取得相同结果。团队应使用具有代表性的文档长度和并发量复现这一对比。
简短的支持查询与冗长的法律文档表现不同。离线索引可以使用大批次,而交互式搜索则必须优化单次请求延迟。
NVFP4 的结果仍然很重要,因为嵌入工作负载尤其适合优化。企业通常会批量编码大规模文档集合,并通过稳定的模型处理重复查询。
更快的编码器可以缩短索引时间,并在固定基础设施上支持更多搜索。当文档持续变化时,它还可以让频繁重建索引变得更加可行。
然而,量化可能引入平均得分无法反映的不均衡故障。0.38 分的基准测试降幅可能集中出现在特定语言、领域或难以区分的内容上。
例如,医疗搜索系统应检查压缩后的嵌入是否仍能保留相似治疗方法、症状和禁忌症之间的差异。代码搜索系统则应测试名称相近但副作用不同的函数。
因此,逐项任务评估比整体得分保留率更重要。团队应在自己的语料库上比较召回率、排序质量、延迟、内存占用和故障案例。
硬件依赖性也会影响不具备 Blackwell 算力的买家。根据模型文档,1B BF16 检查点支持范围更广的 NVIDIA 架构,包括 Ampere、Hopper 和 Blackwell。
使用其他加速器的组织需要进行额外验证。模型权重或许可用,但经过优化的 NVFP4 路径是 NVIDIA 特定价值主张的一部分。
这并非偶然的限制。当开放模型使 NVIDIA 的加速器优势更容易衡量和采用时,NVIDIA 将从中受益。
因此,Nemotron 3 Embed 从两个方向向嵌入提供商施压。8B 模型在检索质量上竞争,而 NVFP4 模型则在与硬件协同的效率上竞争。
RTEB 排名没有回答的问题
Nemotron 3 Embed 拥有出色的基准测试记录,但其在私有数据、混合格式和完整 RAG 流程中的生产可靠性仍未得到验证。
最重要的不确定性涉及评估结果的迁移能力。RTEB、MMTEB 和 ViDoRe 提供了标准化比较,但企业语料库很少与基准测试集合相似。
内部数据包含重复文档、过时政策、缩写、访问限制、损坏的格式,以及从未出现在公开训练材料中的词汇。当这些情况相互作用时,检索质量可能急剧下降。
NVIDIA 建议用户在部署前进行针对具体应用的测试。这一警告比第一名的标签更值得关注,因为嵌入错误会悄无声息地层层传递。
生成模型可能会基于错误的段落给出流畅的回答。如果不检查来源,用户可能会责怪语言模型,尽管最初的错误其实是由检索引入的。
长上下文带来了另一个尚未解决的权衡。32,768 token 的限制允许输入大量内容,但将一篇长文档嵌入为一个向量,会把许多主题压缩到单一表示中。
较小的分块可以提升精确性,但会扩大索引,并可能让事实与其上下文分离。理想的分块大小取决于文档结构、查询类型,以及生成器能够处理多少文本。
开发者还必须决定仅使用稠密检索是否足够。对于精确名称、标识符、错误代码和罕见技术术语,关键词搜索通常比语义向量处理得更好。
许多生产系统会结合稠密向量、词法搜索、元数据过滤和重排序。Nemotron 3 Embed 改进的是该流程中的一个阶段,而非取代整个系统。
它的多语言能力声明同样需要细粒度测试。一个模型可能取得很高的多语言平均得分,却难以处理对某家公司最重要的语言对或特定地区的专业词汇。
跨语言检索还带来了另一项挑战。用户可能用英语查询一项用日语编写的政策,并期望系统返回确切的适用条款。
训练透明度同样有限。NVIDIA 表示其使用了超过 5000 万条公开、允许商业使用及合成的样本,但已发布的模型卡并未完整列举这些样本。
这使人们难以审查表征缺口,或确定类似基准测试的材料是否影响了训练。这里没有证据表明发生过此类污染,但外部研究人员缺乏足够细节来排除这种可能性。
许可问题值得单独审查。OpenMDW 1.1 允许商业使用,但企业不应假设其义务与 Apache 2.0 或其他熟悉的软件许可证相同。
底层 Ministral 模型及相关软件可能各自附带条款。在将检查点整合进分发产品之前,法务团队应评估完整的依赖链。
安全问题也不只涉及模型。嵌入服务会处理可能包含敏感信息的企业文档和用户查询,而其向量数据库可能暴露这些数据内部的语义关系。
组织需要实施加密、感知访问权限的检索、删除流程,以及针对提示驱动型数据提取的测试。更强的模型不会自动落实这些控制措施。
基准测试的波动性是最后一项警示。第一名描述的是特定时刻的排行榜位置,而非永久地位。
新的提交、修正后的评估代码或更强的竞争对手都可能迅速改变排名。团队在内部决策中引用这一排名时,应记录基准测试的版本和日期。
正确的结论既不是忽视它,也不是自动采用它。NVIDIA 提供的证据足以证明值得认真评估,但尚不足以跳过评估环节。
三个信号将表明 NVIDIA 的领先是否重要
下一阶段取决于独立复现、生产采用和竞争对手的回应,而非又一个醒目的得分。
第一个信号是任务级复现。独立评估者需要复现 78.46 的 RTEB 结果,并发布全部 16 项任务的详细得分。
详细结果将揭示 Nemotron 3 Embed 是全面稳定胜出,还是其平均优势主要来自较少的几个数据集。它还会暴露特定语言和领域的弱点。
NVFP4 也应接受同样的审查。独立测试应在相同的 Blackwell 硬件、软件版本、序列长度和批次大小下比较 BF16 与 NVFP4。
如果这些测试证实吞吐量大约提升两倍,同时检索性能损失极小,NVIDIA 的性价比论点将更有说服力。如果测试条件下的结果与生产环境结果存在巨大差距,其说服力就会减弱。
第二个信号是真实采用情况。下载量和排行榜关注度体现的是好奇心,但并不能证明企业愿意将实时搜索、代码或智能体记忆托付给这些模型。
有价值的证据包括报告延迟、索引大小、检索准确率和故障率的生产案例研究。比较应使用私有或特定领域的数据集,而非公开基准测试的子集。
智能体应用是尤其具有揭示性的测试场景。智能体可能反复搜索,因此检索能力的小幅提升也能减少无效工具调用和不必要的生成。
这种效果应体现在完整的工作流指标中。团队应衡量任务完成情况、生成的 token 总数、检索尝试次数、用户纠正次数,以及获得经验证答案所需的时间。
构建内部知识系统的人员面临类似问题。如果检索层之后无法呈现正确证据,仅仅收集文档是不够的。
结构化的 AI 知识库仍然依赖数据质量、权限和检索设计。更好的编码器可以增强该系统,但无法取代这些基础。
第三个信号是其他嵌入提供商如何回应。竞争对手可以凭借更高的基准测试得分、更低的硬件要求、更透明的训练数据或更强的领域专用模型来挑战 NVIDIA。
竞争对手不必在所有方面都超过 78.46。它可以通过在常见硬件上提供更低延迟,或者在金融、医疗、法律工作或软件开发领域提供更出色的检索能力来取胜。
NVIDIA 自己的检查点组合也承认了这一现实。该公司发布了三个版本,因为没有任何一个单独得分能够决定生产适配性。
8B 模型支撑了准确率叙事。1B BF16 检查点为团队提供了成本更低的选择,而 NVFP4 则将 Blackwell 的效率转化为可衡量的卖点。
这种组合让 NVIDIA Nemotron 3 Embed 比单独提交一项排行榜成绩更具影响力。它为开发者提供了一种受控方式,用于比较同一模型系列中的质量与效率。
当前的建议是使用同一套私有评估集测试全部三个检查点。测试内容应包括精确匹配查询、语义问题、长文档、混合语言和刻意设计的易混淆段落。
在连接生成器之前,先衡量检索性能。然后评估完整的 RAG 或智能体工作流,包括延迟、token 使用量、缺乏依据的回答和用户纠正情况。
NVIDIA Nemotron 3 Embed 目前占据 RTEB 的头条位置,但生产证据将决定这一领先能否持续。哪个检查点在你的实际语料库上表现最好,它带来的检索提升是否足以证明其背后的基础设施投入合理?


