top of page

Nvidia 的万亿参数 Nemotron 4 布局瞄准开放模型领军者

8月12日
讀畢需時 13 分鐘

据报道,Nvidia 正在开发一款至少拥有一万亿参数的 Nemotron 4 模型,加大对领先开放模型开发者的挑战力度。

这一说法来自新闻报道,而非技术论文或已完成的模型发布。Nvidia 已确认 Nemotron 4 系列即将推出,但尚未公开证实万亿参数这一规格。这个区别很重要,因为参数量几乎无法说明模型的效率、活跃计算量、训练质量或性能。

更重要的是 Nvidia 在市场中的位置。Meta、DeepSeek、Mistral、Moonshot AI 及其他开发者通过开放模型吸引用户,并塑造软件标准。Nvidia 也可以追求同样的影响力,同时销售训练和运行这些模型所需的处理器、网络设备、系统与软件。

这使得 Nemotron 4 不只是基准测试图表上的又一个条目。它是一项平台战略,旨在增加基于围绕 Nvidia 技术优化的基础设施构建 AI 的组织数量。

Nvidia 已确认的 Nemotron 4 信息

Nvidia 已确认该模型系列及其协作基础,但尚未确认报道所称的万亿参数配置。

8 月 12 日发布的一则中国新闻简讯报道称,Nvidia 正在开发一款至少拥有一万亿参数的新开放 AI 模型。该原始报道将该项目描述为旨在与全球领先开放模型竞争的尝试。

该报道出现时,尚未有配套的模型卡、技术报告、基准测试包或权重仓库。Nvidia 也尚未公布所报道配置的发布日期。因此,读者应将其规模视为报道信息,而非已确定的产品规格。

Nvidia 对更广泛的项目提供了更有力的确认。2026 年 3 月的 GTC 大会上,该公司宣布成立 Nemotron Coalition,这是一个专注于开发开放前沿模型的合作组织。Nvidia 表示,该联盟的首个模型将为即将推出的 Nemotron 4 系列奠定基础。

这份联盟公告列出了来自多家机构的研究人员和模型开发者。参与者预计将贡献研究、数据、专业知识和计算资源。

这种安排让 Nvidia 的角色不同于完全在封闭环境中开发旗舰模型的实验室。Nvidia 可以协调开放开发网络,同时提供其底层的计算平台。

首席执行官 Jensen Huang 也在 Nvidia 2026 年 5 月的 Computex 演讲中表示,公司正在开发 Nemotron 4。这一公开表态证实了项目的存在,尽管并未验证报道所称的参数量。

所报道的规模还需要更多背景说明。一万亿参数可以指稠密模型,即每个参数都会在每一步推理中参与计算;也可以指混合专家模型,即 MoE,由路由系统为每个 token 只激活部分参数组。

这些设计带来的计算需求差异极大。一万亿参数的 MoE 模型在推理时可能只激活更小的参数子集,从而降低生成每个 token 所需的内存带宽和算力。

Nvidia 已经采用了这一方法。Nemotron 3 Ultra 的总参数量为 5500 亿,但每个 token 仅激活约 550 亿参数。其混合架构结合了注意力层和 Mamba,后者是一种旨在更高效处理长序列的状态空间设计。

未来的 Nemotron 4 模型可能延续这一模式,但 Nvidia 尚未披露其架构。它也没有说明一万亿指的是总参数、活跃参数,还是更大模型系列中的某个具体成员。

这些缺失的信息使得有意义的硬件估算无法进行,也让它与稠密模型或采用不同路由方式的 MoE 系统进行直接比较变得不可靠。

不过,这一动向仍释放出明确的竞争信号。Nvidia 正准备加大开放模型布局,并希望开发者将 Nemotron 视为基础,而非孤立的展示项目。

为什么万亿参数模型服务于 Nvidia 的硬件业务

Nvidia 并不需要 Nemotron 4 在模型营收方面占据主导地位,因为开放模型可以刺激其整个计算技术栈的需求。

每个可下载的模型都会带来后续工作。开发者会测试、微调、蒸馏、量化、评估和部署它。即便模型权重不收取传统的软件许可费用,每项活动仍会消耗计算能力。

Nvidia 为整个工作流程提供产品。其 GPU 用于训练和推理,NVLink 连接处理器,网络硬件则连接跨数据中心的系统。CUDA 为 AI 行业的大部分应用提供编程基础。

公司还提供用于模型开发的 NeMo、用于推理优化的 TensorRT-LLM,以及用于打包部署的 NIM 微服务。开放发布 Nemotron 能为这些产品提供由 Nvidia 自家工程师设计的参考工作负载。

这会形成经济飞轮。更易获取的模型会鼓励更多实验;更多实验会创造训练、定制、评估和推理需求。无论最终应用是否沿用 Nemotron 名称,或采用由其衍生的较小模型,Nvidia 都可从中受益。

早期的 Nemotron-4 340B 系列展示了这种方法。该系列于 2024 年 6 月发布,包含基础模型、指令微调模型和奖励模型。奖励模型会为候选回答评分,帮助对齐系统选择更优输出。

Nvidia 将该系列主要定位为合成数据引擎。合成数据是由另一模型生成的训练样例,而非完全由人工收集或标注。

根据 Nvidia 的技术概述,Nemotron-4 340B 所使用的对齐数据中,超过 98% 为合成生成。公司还发布了相关数据生成流程的部分内容。

这种方法将可服务工作负载扩展到聊天机器人服务之外。企业可以使用大型 Nemotron 模型生成专业样例、为这些样例评分,并训练更小的生产模型。

银行可以根据获批的政策文件生成问答对。制造商可以根据设备手册创建维护场景。软件团队可以根据内部代码文档生成测试用例和调试对话。

由于生成的样例可能包含错误或复制隐藏偏见,这类部署需要采取防护措施。不过,这一工作流程说明了为何即使客户最终部署较小系统,Nvidia 仍能从模型可用性中受益。

此前拥有 3400 亿参数的基础模型已经颇具挑战性。Nvidia 表示,FP8 部署可装入一台配备八块 GPU 的 DGX H100 系统,而其他受支持的精度格式则需要更多内存。

除非稀疏化、更低精度格式或激进压缩抵消了总规模的扩大,否则万亿参数继任者将提高基础设施门槛。Nvidia 在这三方面都处于尤其有利的位置。

Nemotron 3 Ultra 提供了一个线索。Nvidia 使用 NVFP4 训练该模型,这是一种旨在降低内存和计算需求的四位浮点格式。其技术报告描述了 5500 亿总参数、550 亿活跃参数,以及基于 20 万亿个文本 token 的预训练。

这些数字并不能确定 Nemotron 4 的设计。它们表明,Nvidia 已经将极大的参数量与稀疏激活和低精度训练相结合。

如果 Nemotron 4 沿用这一路线,其醒目的规模将服务于两个目的:彰显前沿雄心,同时由其活跃参数量决定开发者能否以经济方式运行它。

第二个数字对买家更为重要。一款性能优异但每次部署都需要昂贵集群的模型,仍将停留在研究或云托管产品层面。拥有高效内核的稀疏模型则能触达更广泛的企业市场。

Nvidia 的商业优势在于优化完整路径。它可以将模型与运行模型所需的数值格式、内核、互连技术和部署软件协同设计。

Nemotron 4 将 Nvidia 推向开放模型领军者的对立面

主要竞争并非 Nvidia 与某一家实验室之间的对决,而是 Nvidia 的一体化计算技术栈与由独立开发者构建的模型生态系统之间的较量。

Meta 通过 Llama 建立了一个具有影响力的模板。它发布了企业可下载、自定义并在自身环境中托管的模型权重。这让企业比使用封闭的应用程序编程接口拥有更多控制权,尽管 Meta 的许可证并不符合所有关于开源的正式定义。

Mistral 随后推出了围绕可移植性和高效部署设计的模型。中国实验室则通过大型 MoE 系统、宽松的发布方式、更低的运行成本和快速迭代,加剧了竞争。

DeepSeek 展示了开放权重发布如何在性能和价格两方面向规模更大的美国实验室施压。Moonshot AI 和其他中国开发者也不断推高总参数量,同时在推理中激活较小的参数子集。

这些项目以间接方式对 Nvidia 施压。它们增加了 GPU 需求,令这家芯片制造商受益;但同时也让其他组织得以定义模型层。最广泛采用的模型系列能够影响微调工具、评估实践、服务格式和开发者预期。

Nemotron 4 为 Nvidia 提供了参与这些决策的途径。其模型可以成为 Nvidia 偏好训练方法和部署技术栈的参考实现。

联盟结构扩大了这一努力。Nvidia 将该组织描述为一个共享研究、数据、算力和专业知识的网络。它将开放模型定位为企业和国家能够检查、适配并在自身控制下运行的基础设施。

这种表述直指企业的一项现实关切。许多组织希望部署 AI,而不必将敏感数据发送给外部模型提供商。各国政府也希望模型支持本地语言、法规和计算环境。

开放权重可以有所帮助,但并不会自动带来独立性。模型可以被下载,却仍可能需要专用硬件、专有优化库,或只有少数组织能够获得的训练资源。

Nvidia 的战略正处于这种张力之中。Nemotron 在模型层面提供了更大的控制权,而其规模可能强化对 Nvidia 基础设施的依赖。

这并不意味着该模型无关紧要,或开放性没有意义。这意味着用户应从多个层面评估开放性。

他们需要审查模型权重的获取方式、许可权利、训练数据披露、模型架构、优化代码、评估方法和硬件可移植性。仅有宽松许可证并不能回答所有问题。

Nvidia 在某些领域的推进程度已超过许多商业实验室。该公司已为 Nemotron 项目的部分内容发布了模型权重、技术报告、数据集和训练方案。其 2024 年模型许可证允许商业使用、修改及衍生模型分发。

该公司较新的表述进一步延续了这一立场。2026 年 7 月的一份 开放模型声明认为,企业和国家需要能够检查、定制和控制的模型。

这一论点使 Nvidia 与寻求 OpenAI、Anthropic 和 Google 闭源系统替代方案的开发者站在同一阵线。不过,Nvidia 的动机不同于非营利研究组织。

当 AI 工作负载消耗更多加速计算资源时,该公司便能获得收入。开放模型将模型开发分散至更多组织,从而增加潜在基础设施买家的数量。

这使 Nvidia 同时扮演供应商和竞争者的角色。它可以将 Meta、Mistral、DeepSeek 和云服务商视为客户并为其提供支持,同时又向同一开发者社区提供自己的模型。

这种安排类似于 Nvidia 更广泛的软件战略。CUDA 降低了为其处理器编程的难度,使硬件更具实用性,也更难被替代。Nemotron 可以在技术栈更高层发挥类似作用,提供针对 Nvidia 系统优化的模型、数据集和方案。

竞争对手仍保有重要优势。Meta 拥有广泛的知名度和庞大的开发者社区。Mistral 强调灵活部署。中国开发者则展现出快速发布周期和积极的效率优化能力。

因此,Nvidia 必须凭借规模以外的因素取胜。Nemotron 4 需要可信的结果、可用的检查点、清晰的许可条款、可复现的评估,以及不局限于最大规模 GPU 集群的部署选项。

参数数量并不能决定竞争结果

一万亿参数的标签会吸引关注,但模型是否重要取决于架构、数据质量、活跃计算量和评估透明度。

参数数量曾是衡量模型能力的粗略信号。随着开发者采用稀疏架构、蒸馏、更长的训练周期、改进的数据筛选和更强的后训练方法,这种关系变得不再那么有参考价值。

总参数数量相同的两款模型,成本可能大不相同。其中一款可能在处理每个 token 时激活所有参数,另一款则可能仅将每个 token 路由至少量专家。

性能还取决于训练数据的构成。在经过严格筛选的代码、数学、多语言文本和工具使用轨迹上训练的模型,可能优于在质量较弱材料上训练的更大模型。

后训练会带来另一项重大差异。监督微调用于教授响应模式,而强化学习可以改善推理能力或指令遵循能力。蒸馏则将一个或多个教师模型的行为迁移至不同架构中。

Nvidia 为 Nemotron 3 Ultra 采用了多教师蒸馏方法。该模型的报告还描述了预训练后的监督微调和强化学习。外部研究人员需要获得类似披露,才能理解 Nemotron 4 的结果。

基准测试也存在自身的问题。模型开发者会选择测试套件、提示词、采样设置、评判系统和对比模型。方法上的微小变化就可能改变排名。

一次可信的发布应提供评估代码和详细设置。随后,独立机构需要在推理、编程、工具使用、多语言任务、安全性和真实部署工作负载等方面复现结果。

所宣称的一万亿参数规模也带来了实际问题。Nvidia 尚未披露与 Nemotron 4 相关的训练计算量、能源使用情况、数据规模或硬件配置。

它尚未说明所有权重是否都可供下载。该公司也未详细说明许可证、发布时间表,或将随模型一同发布哪些训练数据集和方案。

这些并非无关紧要的遗漏。它们决定了 Nemotron 4 会成为广泛可用的基础,还是主要通过 Nvidia 控制服务运行的展示品。

“开放”一词需要格外谨慎对待。开放权重模型提供对已学习参数的访问。开源系统通常意味着更广泛的访问与许可,涵盖代码、数据和开发方法。

许多被笼统称为开源的 AI 发布内容,并不包含完整训练数据。有些还施加可接受使用限制,或限制特定商业活动。

Nvidia 先前的许可证允许修改和商业使用,给予开发者有意义的灵活性。Nemotron 4 的最终条款仍需接受独立审查。

安全性将是另一项考验。更大的模型可以扩展有用能力,但也可能提升生成有害指令、说服性操纵内容或不安全代码的能力。

开放权重限制了开发者在发布后撤销访问权限的能力。因此,发布前评估、模型文档和可选防护措施变得更加重要。

Nvidia 已围绕 Nemotron 开发内容安全模型和评估工具。这些组件可以帮助企业建立控制机制,但没有任何防护模型能够消除滥用或意外行为。

数据来源同样至关重要。训练一万亿参数模型需要大量文本、代码,以及可能的多模态数据。发布内容应说明收集实践、许可考量、移除流程和污染控制措施。

缺少这些细节,用户便无法全面评估法律风险或基准测试的可靠性。受监管行业中的企业还需要支持自身治理审查的文档。

硬件可移植性构成最后一项不确定性。Nvidia 自然会为其处理器优化 Nemotron 4。开发者应测试标准格式和社区运行时能否支持该模型,而不完全依赖专有服务。

当某一硬件平台最适合运行模型时,该模型仍然可以有价值。不过,广泛的可移植性会让 Nvidia 关于用户控制权的主张更具说服力。

目前,报道中的参数数量应被视为一种意图声明。Nvidia 希望在开放模型前沿展开竞争。实际发布将决定这一雄心能否形成有用的开发平台。

在评判 Nemotron 4 前应关注什么

三个信号将表明 Nemotron 4 会成为具有影响力的开放基础模型,还是仍停留在对 Nvidia 具有战略价值的演示层面。

第一个信号是发布包。Nvidia 需要发布模型权重、架构细节、推理要求、许可条款和技术报告。

完整的发布包将强化一种判断:Nvidia 希望独立开发者基于 Nemotron 4 开展构建。有限的云端预览或受限检查点则会削弱这种解读。

总参数与活跃参数之间的区别,必须出现在任何模型卡的显著位置。如果 Nemotron 4 使用 MoE 设计,Nvidia 应披露专家数量、路由策略和活跃参数数量。

开发者还会寻找量化检查点。量化会减少用于表示权重的位数,从而降低内存使用量,并通常提升推理速度。

支持 Nvidia 的低精度格式是预期之内的。支持社区兼容格式,则表明其对在严格管理的企业环境之外部署有更广泛的承诺。

第二个信号是独立技术表现。Nvidia 很可能会发布内部对比,但模型的市场地位将由外部评估决定。

最有价值的测试将衡量编程、推理、智能体工具使用、长上下文可靠性、多语言表现和安全性。除准确性外,每个生成 token 的成本和延迟也很重要。

智能体工作负载值得特别关注,因为 Nvidia 已将近期 Nemotron 模型定位为服务于能够规划、调用工具并执行多步骤任务的系统。这些系统在反复与外部软件交互时,可能消耗大量 token。

一款得分很高但运行缓慢的模型,在这些循环中可能变得昂贵。稀疏激活和优化推理可以改变这一计算结果,前提是路由在复杂任务中保持稳定。

开发者还应比较微调行为。企业基础模型需要吸收专业知识,同时不丧失通用能力,也不形成脆弱的响应模式。

真实部署将揭示 Nvidia 的训练方案能否顺利迁移至法律、医疗保健、工程、金融和客户支持场景。构建这些系统的组织同样需要严谨的知识工作流。

团队可以使用 AI knowledge base,在检索或微调前组织源材料。这一准备工作很重要,因为更大的基础模型无法纠正不准确的内部文档。

第三个信号是生态系统采用情况。Nvidia 需要开发者、云服务商、企业和联盟成员发布应用、适配器、数据集或衍生模型。

下载量本身无法证明持续采用。更有价值的指标包括被接受的框架集成、独立维护的推理支持、生产案例研究和活跃的衍生项目。

联盟参与情况也将显示,Nemotron 4 是代表共同开发,还是主要反映 Nvidia 的内部路线图。知名模型构建者的贡献将强化其协作主张。

竞争对手的反应将提供另一条线索。Meta、Mistral、DeepSeek 或其他开放模型团队更快的发布周期,将证实 Nemotron 4 正在影响市场。

沉默并不一定意味着失败。如果 Nemotron 扩大企业试验范围并增加其软件和硬件的使用,Nvidia 仍可实现商业目标。

这使最终判断不同于传统的模型竞赛。Nvidia 不需要每位开发者都选择 Nemotron 4 作为最佳通用模型。

它需要这次发布让基于 Nvidia 基础设施进行开放 AI 开发变得更容易。可信的模型可以吸引工作负载、验证新的数值格式、展示系统级优化,并支持整个数据中心业务的销售。

在 Nvidia 提供检验所需证据之前,报道中的一万亿参数配置已经提高了预期。下一份模型卡、技术报告和独立基准测试结果,将比醒目的参数数字更重要。

开发者和企业买家现在就应准备一份简单的评估计划。将活跃计算量、内存需求、延迟、任务准确性、许可条款和可移植性,与已投入生产的模型进行比较。随后,将提示词、文档和测试结果保存在可检索的 engineering knowledge base 中。当 Nvidia 发布 Nemotron 4 时,这份记录将支持真实工作负载对比,而非受基准测试驱动的反应。决定性问题不在于 Nvidia 能否构建一款一万亿参数模型,而在于开发者能否充分检查、适配和运营该模型,以证明将应用迁移至 Nvidia 不断扩展的 AI 技术栈是合理的。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page