top of page

$26B Nvidia 开源权重模型投资瞄准定制云端硅

$26B Nvidia Open-Weight Models Investment Targets Custom Cloud Silicon

生成计算市场的底层数学正在发生转变。主要云超大规模提供商——Google、Microsoft 以及通过合作伙伴关系加入的 Anthropic——正在积极开发定制 ASIC 芯片。他们希望摆脱与企业级 GPU 相关的大规模资本支出。这家硬件巨头的反制措施是在未来五年内投入高达 260 亿美元,用于构建 Nvidia open-weight models。通过资助大规模基础架构,该公司确保主导未来十年的软件管道在结构上依赖其专有硬件。

这一财务转变立即产生了技术资产,主要是 1200 亿参数的 Nemotron 3 Super 模型。开发者看到这一发布后,立即意识到下游影响。代码和架构决定了计算资源的消耗方式。

Nvidia Open-Weight Models 的实际部署与开发者体验

Practical Deployment of Nvidia Open-Weight Models and Developer Experiences

硬件可用性仍然是开发者尝试运行本地推理时的主要摩擦点。消费级 GPU 为普通用户提供了最高的每秒 token 产量,但定价和物理安全仍是持续障碍。依赖消费级显卡运行这些早期代理系统的用户,经常抱怨企业级 RTX 6000 与即将推出的 RTX 5090 之间的定价差距。雪上加霜的是已记录的机械缺陷,特别是在持续高计算负载下,电源连接器过热和熔化。

尽管存在硬件限制,工程师们仍在迅速从 NVIDIA-NeMo GitHub 仓库下载 Nemotron 权重。120B 模型采用 Mixture-of-Experts (MoE) 架构。单次前向传递仅激活 120 亿参数。这种稀疏性正是让本地部署保持一定可行性的关键。开发者正将权重导入 llama.cpp 等框架,以便在受限的桌面硬件上运行模型,或利用 Cloudflare Workers AI 进行边缘网络 API 访问。

开发者如何在本地优化 Nvidia Open-Weight Models

此次发布包含一份详尽的技术手册,正在改变AI 工程师在本地设备上进行微调的方式。从业者不再通过反复试错提示,而是采用发布中概述的两阶段 Supervised Fine-Tuning (SFT) 方法。第一阶段使用 token 级平均损失来稳定基础。第二阶段完全转向样本级平均损失。应用此方法的工程师特别指出,它能防止在处理极长上下文窗口时出现性能下降,保持输出简洁且严格。

我们还看到孤立环境反馈循环的直接采用。公司详细介绍的 SWE-RL (Software Engineering Reinforcement Learning) 技术将模型置于沙箱容器中,由实际代码执行决定反馈逻辑。无需人工评分,代码要么编译并通过测试,要么失败,从而自动纠正模型的逻辑树。

在处理需要顺序操作的代理工作流时,开发者正在集成 PivotRL。多步推理通常会因漂移而受影响,即代理在复杂任务中途陷入混乱。PivotRL 识别逻辑树中高不确定性的决策节点,并在这些特定节点应用针对性强化。这能防止工作流级联失败,并被那些为网络安全和金融数据检索调整模型的人大量使用。

Nvidia Open-Weight Models 背后的策略

The Strategy Behind Nvidia Open-Weight Models

投入 260 亿美元用于模型训练并非为了民主化计算的慈善行为。每种模型架构都对运行它的硅片做出了固有假设。通过发布高度优化的 Nvidia open-weight models,该公司迫使生态系统围绕其原生格式进行标准化。

Nemotron 3 Super 使用原生多 token 预测在 25 万亿 token 上进行预训练。更关键的是,预训练大量利用了 Blackwell 架构原生的 NVFP4 低精度数据格式。当工程师下载此模型并将其集成到企业应用中时,他们无意中将生产管道绑定到 Blackwell 的规格上。尝试在 Google TPU 或 Microsoft Maia 芯片上高效运行经过 NVFP4 优化的 120B MoE 模型,会引入翻译层并导致效率下降。

在 B200 硬件上,Nemotron 的推理速度是上一代 H100 阵列的四倍。硬件和软件在紧密的反馈循环中共同开发。数据中心对这些巨型架构进行压力测试所产生的遥测数据,会直接反馈给设计下一代 NVLink 网络和存储路由的工程团队。模型制造了数据瓶颈;硬件团队设计了精确的定制互连来绕过它。

塑造 Nvidia Open-Weight Models 的性能指标

企业市场需要可验证的基准来证明淘汰旧逻辑框架的合理性。Nemotron 3 Super 的构建旨在拆解竞争对手的代理架构。在 PinchBench(专门衡量代理控制环境和执行终端命令能力的评估套件)上,该模型得分为 85.6%。

更广泛的 AI Index 评估给它 37 分,直接领先于 GPT-OSS 的 33 分。原始能力解释了为什么开发者愿意忍受硬件瓶颈。他们获得了一个高度专业化的系统,能够进行金融建模和网络安全渗透测试,而无需支付 API 守门人费用。但大规模部署仍需要从服务器场购买 GPU 时间。模型是免费的,但用企业数据对其进行微调所需的计算资源却不是。

硬件垄断与真正的开源期望

Hardware Monopoly vs True Open Source Expectations

“开放”一词在开发者和知识产权律师中引发激烈辩论。开放权重分发与完全开源项目之间存在明显界限。

用户经常抱怨云模型中的版权模糊性和隐私问题。他们希望完全在自己的私有公司数据上训练本地实例,而不将遥测数据广播回集中式服务器。Nvidia open-weight models 通过允许离线部署,恰好满足了这种本地化需求。

底层训练数据和专有训练代码库仍保持封闭。权重——经过数月数据消化后生成的最终数值表示——已发布。你可以运行模型,也可以进行表面微调。你无法审计用于构建原始智能的数据集,也无法在没有原始数据的情况下轻松从头复制初始训练运行。这种刻意保留既保护了创建者免于版权责任,又确保实际专有训练方法不落入竞争对手手中。

硬件消费者清楚地意识到,AI 进步正在将标准买家挤出市场。对专为本地 AI 推理构建的高端消费硬件的持续需求,与优先分配给超大规模数据中心生产的冲突日益加剧。RTX 5090 预计会提供一座桥梁,但功耗限制和基本材料物理正在限制桌面下能合理容纳多少计算。

转向 Nvidia Open-Weight Models 对云基础设施意味着什么

What the Pivot to Nvidia Open-Weight Models Means for Cloud Infrastructure

超大规模提供商过去三年一直在尝试通过设计自己的硅片来降低计算开销。训练基础系统需要数千个 GPU,但推理——对最终产品进行持续、高频查询——通常可以转移到更便宜的专用芯片上。

通过直接向开发者推送高度复杂的 MoE-based Nvidia open-weight models,该公司打破了这种逃逸路线。将 Nemotron 重新训练或大幅修改以用于专有企业应用,需要大量矩阵乘法,而 ASIC 难以泛化。如果数千家软件初创公司围绕 Nemotron 构建基础设施,那么托管这些初创公司的云提供商就必须维护大量 Blackwell 芯片集群来满足客户需求。

软件正在吞噬硬件优化路径。发布顶级模型剥夺了 OpenAI、Anthropic 和 DeepSeek 对最先进输出的独家控制权。它将生成逻辑转变为商品化工具。当模型本身免费时,唯一剩下的稀缺资源就是能够以企业速度运行它的硬件。构建旨在饱和数据中心链路的庞大软件框架,保证了全球服务器机架都需要熟悉的绿色品牌硅片才能高效运行。

常见问题

什么是 Nvidia open-weight models?

它们是完全训练好的 AI 模型,其最终神经网络参数(权重)已发布供公众进行本地部署。与完全开源项目不同,原始训练数据和基础训练阶段使用的底层源代码仍保持私有。

该公司在 Nvidia open-weight models 上投资了多少?

财务文件概述了五年内计划支出 260 亿美元。这些资金用于训练大规模基础架构,专门针对该公司专有硅片优化性能。

Nemotron 3 Super 的规格是什么?

Nemotron 3 Super 是一个 1200 亿参数的 Mixture-of-Experts (MoE) 模型,每次查询仅激活 120 亿参数。它使用 Blackwell 原生的 NVFP4 低精度数据格式在 25 万亿 token 上进行预训练,目标是多代理逻辑、编码和金融领域。

SWE-RL 如何帮助开发者微调本地模型?

Software Engineering Reinforcement Learning (SWE-RL) 将编码模型置于隔离容器环境中。它使用实际编译代码执行的直接成功或失败作为反馈,自动优化和纠正模型的内部逻辑路径,无需人工干预。

PivotRL 在代理工作流中用于什么?

PivotRL 解决模型执行复杂多步操作时的推理漂移问题。它识别任务期间具有高不确定性的特定决策点,并应用针对性强化,使代理在长命令链中保持稳定。

为什么发布开放权重而不是收取 API 访问费用?

赠送模型架构可确保开发者构建需要大量 GPU 计算的应用。它迫使云提供商购买 Blackwell 等原生硬件架构来有效服务其软件客户,从而维持硬件垄断。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page