top of page

据称 NVIDIA 的万亿参数模型仍未获证实,其已确认模型规模更小

NVIDIA 出现在一则 Google News 标题中,其中提出了一项引人注目的说法:该公司正在开发一个拥有一万亿参数的开放式 AI 模型,以挑战领先系统。然而,NVIDIA 已发布的材料并未证实这一描述。其经核实的旗舰模型 Nemotron 3 Ultra 拥有 5500 亿个总参数,每个 token 激活 550 亿个参数。

这一差异不仅仅是数字上的更正。它揭示了总参数、激活参数、训练 token 和开发计划多么容易被压缩成一则误导性的标题。每个数字描述的都是 AI 系统的不同部分。

这背后的故事依然重要。NVIDIA 正在超越仅销售处理器和软件基础设施的定位。它正发布开放模型权重、训练资源、部署工具,以及面向下一代 Nemotron 的行业协作计划。

真正的竞争并不只是 NVIDIA 对阵 OpenAI、Anthropic 或 Google,而是 NVIDIA 以开放模型和基础设施为核心的战略,与当前定义了商业前沿大部分格局的封闭模型服务之间的竞争。

Google News 标题未能证实的内容

目前没有任何公开的 NVIDIA 发布信息证实,一款万亿参数的 Nemotron 模型正在开发中。

通过 Google News 分发的这则标题可追溯至一家出版商的条目,而非 NVIDIA 技术报告或产品公告。它没有提供可访问的模型卡、具名架构、基准测试包、发布日期或公司声明来确认这一数字。

这并不能证明 NVIDIA 没有更大的内部模型。公司通常会在公布前测试系统。但这意味着,万亿参数的描述应仍被视为未经证实的报道,而非既定的产品事实。

最接近的已验证参考是 Nemotron 3 Ultra。NVIDIA 于 2026 年 6 月 4 日发布了该模型,并将其描述为能力最强的 Nemotron 版本。官方模型概述明确指出,它拥有 5500 亿个总参数和 550 亿个激活参数。

Nemotron 3 Ultra 采用混合专家架构。这种设计将模型划分为专门的群组,并且每个 token 仅激活网络的一部分。该方法可以在不让每次响应都调用全部参数的情况下提升总容量。

它的全名 Nemotron 3 Ultra 550B-A55B 同时体现了这两个数字。“550B”代表总参数,而“A55B”表示每个 token 大约会激活 550 亿个参数。

这一差异改变了部署经济性。稠密的 5500 亿参数模型会在推理过程中调用整个网络。稀疏模型则可将每个 token 路由至选定的专家,从而减少生成答案所需的计算工作量。

另一个可能造成混淆的来源是训练语料。NVIDIA 表示,它在 20 万亿个文本 token 上对 Ultra 进行了预训练。Token 是训练数据的片段,而不是模型学得的参数。在数万亿 token 上训练的模型,并不会自动成为万亿参数模型。

NVIDIA 多年来一直在讨论万亿级训练。2021 年,其工程师介绍了一项训练演示,其中涉及一个万亿参数模型和 3,072 张 A100 GPU。这项工作展示的是分布式训练软件,而非宣布一款面向公众的对话模型。

这些数字很容易脱离原始语境。一项历史上的扩展实验、一个 20 万亿 token 的数据集,以及一次 5500 亿参数模型发布,描述的是三项彼此独立的事实。

标题还使用了“开放式 AI 模型”这一表述,这可能带来另一层歧义。在这里,“开放”描述的是模型的访问方式,并不表示它与 ChatGPT 背后的 OpenAI 公司存在关联。

Google News 的聚合可以扩大报道的传播范围,但聚合并不能验证其核心主张。验证仍取决于第一手文档、具名消息来源、技术工件和可复现的评估。

目前,站得住脚的结论很明确:NVIDIA 已发布一款 5500 亿参数的开放权重模型,而具体的万亿参数后继模型仍未得到确认。

NVIDIA 已确认的开放模型是 Nemotron 3 Ultra

已确认发布的模型本身已经是大型模型,但 NVIDIA 的设计重点是选择性计算,而非仅追求参数数量。

Nemotron 3 Ultra 是 Nemotron 3 系列中最大的模型。它继 Nano 和 Super 之后推出,后两者面向更小的部署规模和不同的性能要求。

Ultra 将混合专家路由与 Mamba 和注意力层结合。Mamba 是一种序列处理架构,旨在以不同于标准注意力机制的计算特性处理长输入。

该模型还使用了潜在专家和多 token 预测。潜在专家在网络内部提供额外的专业化能力,而多 token 预测让系统能够在生成过程中预判不止一个未来 token。

NVIDIA 表示,Ultra 支持最长一百万 token 的上下文长度。上下文窗口是指模型在一次交互中能够考虑的输入和生成内容总量。

这一能力面向的是长时间运行的智能体,而非简短的聊天机器人对话。可能的工作负载包括软件代码库分析、长周期研究、多阶段规划,以及累积大量工作上下文的企业流程。

该公司的技术报告称,预训练使用了 20 万亿个文本 token。随后,NVIDIA 扩展了上下文长度,并应用了监督微调、强化学习和教师模型蒸馏。

教师模型蒸馏是指将其他模型的行为迁移到目标模型中。NVIDIA 表示,在 Ultra 的后训练过程中,超过十个聚焦不同领域的教师模型提供了指导。

此次发布包含基础版、后训练版和量化检查点。量化以更少的位数表示模型数值,在尽力保留有效准确性的同时降低内存和计算需求。

NVIDIA 使用其四位浮点格式 NVFP4 预训练了一个 Ultra 版本。该公司将这一格式定位为在 Blackwell 硬件上提升吞吐量的途径。

这种与硬件的关联至关重要。NVIDIA 并不需要 Nemotron 成为企业唯一使用的模型。当开发者使用 NVIDIA 处理器和软件训练、适配并提供众多模型时,它同样能从中受益。

因此,Ultra 既是一个可用模型,也是一个参考实现。它可以展示大型稀疏模型如何在 NVIDIA 的训练、优化和推理技术栈中运行。

NVIDIA 表示,与可比的开放模型相比,Nemotron 3 Ultra 的推理速度最高可提升五倍,成本最高可降低 30%。这些是公司的对比结果,取决于所选硬件、精度、软件、提示词和输出长度。

其研究页面提供了更具体的吞吐量主张。NVIDIA 报告称,Ultra 的吞吐量是 GLM-5.1 的 5.9 倍、Kimi K2.6 的 4.8 倍,以及 Qwen 3.5 的 1.6 倍。

这些测试在 GB200 系统上使用了 8,000-token 输入和 64,000-token 输出。NVIDIA 为 Ultra 使用 TensorRT-LLM,而对比模型使用 vLLM,并为每种模型选择当时可用的最强配置。

这种方法并不意味着结果没有意义。但它确实意味着,读者应将其解读为系统级部署结果,而不是仅比较架构本身。

模型、运行时、数值格式和加速器是协同工作的。NVIDIA 正有意在这一组合层面展开竞争。

NVIDIA 为何挑战封闭 AI 系统

NVIDIA 的战略优势来自为众多模型提供底层平台,而非凭借单一助手赢得每一项基准测试。

OpenAI、Anthropic 和 Google 大多通过托管服务交付其领先的通用系统。客户向托管端点发送请求,而模型权重和核心训练方法仍不可获取。

NVIDIA 则通过 Nemotron 采取不同路线。它发布权重及更多相关开发材料,使组织能够在自己选择的环境中检查、适配和部署模型。

开放权重并不自动意味着开发过程完全开放。训练数据可能存在限制,许可证可能附带条件,而且复现大型模型的成本仍然高昂。

尽管如此,获取权重改变了企业能够控制的范围。团队可以微调模型,在私有工作负载上评估它,修改其行为,并在不将每个请求都路由至外部模型提供商的情况下运行它。

这一选项在受监管或数据敏感的环境中尤为重要。银行、医疗机构、政府和工业企业通常需要更明确地掌控数据位置、访问策略和系统行为。

Nemotron 3 Ultra 也面向智能体工作负载。智能体系统将模型与工具、记忆和执行循环相结合,从而完成多步骤任务。

长时间运行的智能体会产生大量推理需求。它们会反复检查状态、调用工具、读取结果、重新评估计划,并产生新的行动。一次用户请求就可能触发多次模型调用。

这种模式有利于 NVIDIA 的业务。即使底层模型权重可以免费获取,更多的智能体活动也意味着更多计算。

NVIDIA 还销售围绕这些工作负载的组件。其产品组合包括加速器、网络设备、DGX 系统、CUDA 库、推理引擎、模型服务软件和云计算容量。

因此,成功的开放模型可以扩大 NVIDIA 的市场,而无需让该公司对每一次模型响应收费。模型会带动训练和服务该模型所需基础设施的需求。

封闭提供商面临的是不同的考量。它们的优势在于交付集成系统,提供强大性能、简便访问、安全控制和频繁更新。

许多客户偏好这种安排。运行一个 5500 亿参数模型需要专用硬件、运维专业知识、监控,以及持续的评估流程。

因此,竞争压力是有选择性的。Nemotron 不需要替代每一个托管助手。它需要让重视控制权或定制能力的组织相信,自主管理部署是可信的选择。

NVIDIA 的规模也使其努力区别于较小的开放模型项目。该公司可以将模型研究直接连接到用于生产推理的硬件和软件。

这形成了一个强化循环。NVIDIA 可以为其数值格式设计模型,为这些模型优化运行时,并利用结果展示其最新计算平台。

NVIDIA 万亿参数模型的标题夸大了已获验证的内容。不过,其背后的战略挑战是真实存在的。NVIDIA 希望开放模型成为对 NVIDIA 运营计算资源的主要需求来源。

真正的竞争是效率,而非一万亿参数

更大的参数总量并不保证模型更好,尤其是在每个 token 处理过程中大多数参数都处于非激活状态时。

参数数量曾是衡量模型规模的一个便捷指标。随着开发者采用稀疏架构、蒸馏、合成数据、更长的推理过程和专门的后训练方法,这一信号已变得不那么有用。

Kimi K2.6 是 NVIDIA 的对比对象之一,拥有一万亿总参数,但每个 token 仅激活 320 亿参数。Nemotron 3 Ultra 拥有 5500 亿总参数,每个 token 激活 550 亿参数。

第一个模型按总参数量计算更大。第二个模型在处理每个 token 时激活的参数更多。单凭任何一项都无法判断哪个模型在特定任务上表现更好。

架构、训练数据、优化方式和推理设置的重要性,可能不亚于醒目的规模数字。后训练更强的小型模型,可能会在某些评测中胜过更大的模型。

NVIDIA 的论点正建立在这一差异之上。Ultra 的目标是在 NVIDIA 当前系统上以更快的输出速度提供有竞争力的准确性。

独立测试为厂商结果提供了有益的制衡。Artificial Analysis 对该预发布模型进行了评估,并称其在发布时是领先的美国开放权重模型。

独立评估给 Ultra 的 Intelligence Index 评分为 48。同一评估中,Kimi K2.6 获得 54 分,意味着 NVIDIA 落后于该评测中表现最强的中国开放权重模型。

这一结果只支持了 NVIDIA 定位的一部分。Ultra 在美国开放权重发布中看起来具有竞争力,并实现了较高的实测服务速度;但在智能水平上,它并未领跑整个开放权重领域。

基准测试版本也会变化。Artificial Analysis 的实时模型页面后来在更新后的评测套件下显示了不同分数。因此,排名应被视为带有时效性的测量结果,而非永久排名。

这正是原始 Google News 说法变得干扰判断的地方。一个一万亿参数的标签,暗示达到某一规模就能让 NVIDIA 与顶级闭源系统并驾齐驱。

这一假设忽略了评估问题。OpenAI、Anthropic 和 Google 提供的能力、工具、界面和安全层各不相同。由于这些公司通常不会披露可对照的同类数据,其模型无法仅通过参数量进行直接比较。

实际的企业表现还取决于完整应用。检索质量、工具可靠性、权限、记忆设计和人工审核,都可能决定一个智能体能否完成有价值的工作。

即使基准评分看起来很强,模型仍可能失败。长上下文并不保证准确回忆,出色的编程成绩也不保证代码改动安全。

运营效率也有其局限。NVIDIA 的最快结果依赖 NVIDIA 硬件、低精度格式和经过调优的服务软件。使用其他环境的组织可能无法复现同样的吞吐量。

稀疏模型还会带来路由复杂性。系统必须选择合适的专家、平衡工作负载,并在加速器之间高效移动模型数据。

一个激活 550 亿参数的模型仍然规模庞大。要以生产规模自行托管它,所需基础设施远多于下载一个小型本地模型。

因此,重要的比较不是“5500 亿对一万亿”。而是在可比的服务条件下,以真实工作负载衡量每单位计算资源所获得的有效准确性。

NVIDIA 似乎理解了这一转变。其技术资料更强调吞吐量、激活参数、长上下文行为和部署效率,而不是向尽可能大的总参数规模竞逐。

Nemotron 4 将模型打造为联盟项目

NVIDIA 的下一步开放模型行动是一项联合开发计划,但该公司尚未为其披露经验证的一万亿参数规格。

在 2026 年 3 月 16 日的 GTC 大会上,NVIDIA 宣布成立 Nemotron Coalition。其创始成员包括 Mistral AI、Black Forest Labs、Cursor、LangChain、Perplexity、Reflection AI、Sarvam 和 Thinking Machines Lab。

该联盟的首个基础模型由 NVIDIA 与 Mistral AI 联合开发。预计其他参与方将在后续开发阶段贡献数据、评估和领域知识。

NVIDIA 表示,最终模型将在 DGX Cloud 上训练,并向开放生态系统发布。它还将成为即将推出的 Nemotron 4 系列的基础。

官方联盟公告并未披露 Nemotron 4 的参数量,也没有提供一万亿参数目标、检查点规格或发布日期。

这一缺失很重要,因为 Nemotron 4 是有关 NVIDIA 尚未公布的更大模型报道背后最可能的项目。它已公开、仍在开发中,并旨在推进开放前沿系统。

但可能性不等于确认。该项目可能推出多个规模的模型,采用稀疏架构,或优先发展专业能力而非总体规模。

联盟结构也揭示了 NVIDIA 更广泛的目标。NVIDIA 并未让一个内部研究团队定义所有目标,而是在招募代表不同应用需求的公司。

Cursor 可以贡献编程用例。LangChain 可以为工具使用和长时间运行的智能体提供参考。Perplexity 带来以搜索为中心的应用经验,而 Mistral 则贡献模型开发专长。

这种安排让 NVIDIA 在模型发布前就能获得工作负载反馈,也鼓励联盟成员围绕最终形成的开放基础模型优化其产品。

其中存在明显的商业协同。一个在 DGX Cloud 上训练、并针对 NVIDIA 系统优化的协作开发模型,能够提升对 NVIDIA 基础设施的需求。

这并不抹去它对开发者的潜在价值。与只能通过单一厂商 API 使用的模型相比,共享评估和可访问的权重可以扩大参与范围。

模型实际有多开放,将取决于发布方式。开发者应审查许可证、允许用途、训练数据披露、检查点、训练配方、安全文档和硬件要求。

他们还应区分开放权重与可复现性。发布检查点允许部署和修改,但几乎没有组织能够独立重复前沿规模的预训练。

只有当联盟产出具有竞争力的性能和实用部署选项时,Nemotron 4 才会对闭源供应商形成压力。没有这些特质的大参数数字只能带来关注,而非持久采用。

该联盟也带来了协调风险。参与方拥有不同的产品、激励机制、数据政策和客户群。共同开发模型需要就架构、评估、发布时机和治理作出决策。

由于 NVIDIA 提供训练平台,它保有强势的组织地位。然而,该项目的可信度将取决于各方贡献是否超越宣传合作关系。

公开的基础检查点将提供最清晰的证据。详细技术报告、可复现评估和可用的后训练资源,将进一步增强这一论点。

在这些产物出现之前,Nemotron 4 应被描述为一项已宣布的开放模型计划,而不应被视为已确认的 NVIDIA 万亿参数模型。

开发者和企业采购方接下来应关注什么

三个具体信号将显示,NVIDIA 是在打造持久的开放模型平台,还是仅仅从被夸大的标题中获益。

第一个信号是 Nemotron 4 的模型卡或技术报告。该文档应通过列出总参数、激活参数、架构、训练 token 数、上下文长度和数值格式,解决规模问题。

如果 NVIDIA 确认一项万亿规模设计,Google News 的标题将获得事后支持。如果 Nemotron 4 采用更小或结构不同的网络,原始说法就会显得混淆了模型指标。

第二个信号是在可比条件下的独立性能。测试应在多种服务配置下评估推理、编程、工具使用、长上下文可靠性和吞吐量。

公司基准测试有助于理解其预期优势。独立评估则能揭示这些优势能否在不同提示词、运行时和硬件假设下成立。

应像关注总参数一样密切关注激活参数。同时还要考察输出长度、延迟、内存需求、失败率和每单位计算资源的准确性。

第三个信号是实际的企业采用。NVIDIA 已点名智能体框架和软件合作伙伴,但被点名的兼容性并不能证明持续的生产使用。

有价值的证据包括有文档记录的部署、可重复的工作负载改进、稳定的服务工具,以及选择 Nemotron 而非托管闭源模型的组织。

开发者不应将开放性视为自动推荐。模型访问只是生产系统的一部分。安全审查、数据治理、可观测性、评估和回退流程仍不可或缺。

企业采购方应比较完整的运营模式。托管服务能减少基础设施工作,而自行管理的模型则提供更强的控制力和定制能力。

知识工作者将通过构建在这些系统之上的产品感受竞争。更快的开放模型可以减少延迟,并让软件供应商提供更多私有化部署选择。

已验证的事实已经支持一个影响深远的故事:NVIDIA 发布了一个 5500 亿参数的稀疏模型,开放了多项开发产物,并围绕未来模型系列组织了合作伙伴。

但这些事实并不支持对一款万亿参数产品的确定结论。这个数字仍然只是缺乏相应一手文档支持的说法。

下一次在 Google News 中看到吸引眼球的模型数字时,请查看激活参数量、模型卡、技术报告和独立测试。这些细节将显示 NVIDIA 是否真正拓展了前沿,还是仅仅制造了一个更大的标题。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page