top of page

Nvidia LVNM 将开源模型推向 GPT-4o 之战

Nvidia 上周发布了 LVNM 模型系列。此举标志着这家芯片制造商首次直接进入开源权重的大语言模型领域。开发者现在将 LVNM 与 OpenAI 和 Anthropic 的闭源系统进行测试。

Nvidia LVNM 模型针对当前在 GPT-4o 级别系统上运行的相同推理任务。早期基准测试显示,在编码和数学工作负载上具有竞争力。该发布还捆绑了与 Nvidia 最新推理栈的紧密集成。

硬件公司长期以来一直提供训练和运行模型的芯片。很少有公司以开源许可发布自己的模型权重。Nvidia 的这一步改变了这一模式。

该公司选择在财报发布前宣布这一消息。它还恰逢关于开源与闭源 AI 开发的重新辩论。

Nvidia LVNM 模型权重可在 Hugging Face 上获取。推理代码以宽松许可发布。用户仍需 Nvidia GPU 才能达到所述性能指标。

Release details and licensing

Nvidia 发布了三种尺寸的 LVNM。最大尺寸的参数量大致与 GPT-4o 相当。三者均包含训练数据卡和安全报告。

该许可允许商业使用和微调。重新分发权重时需要注明出处。这种结构介于完全闭源模型和无限制开源发布之间。

硬件要求仍然严格。Nvidia 表示,峰值吞吐量仅在配备最新驱动分支的 Blackwell GPU 上出现。旧卡可以运行该模型,但速度较低。

开发者报告通过提供的 Docker 镜像可以快速设置。一位早期测试者在遵循指南后,在单张 H100 上实现了每秒 120 个 token。

Nvidia 在 Hugging Face 上发布了详细的模型卡片以及权重。这些文档列出了精确的预训练语料库组成,包括从过滤的网络爬取、精选的技术书籍和许可代码库中提取的 2.4 万亿个 token。中等规模的变体包含 720 亿个参数,而最小的提供了适合边缘部署的 130 亿参数选项。安全评估包括自动化红队测试和跨 14 个危害类别的人工审查。商业用户可以免费微调,但必须在任何重新分发的衍生品中保留原始归属声明。许可证明确允许蒸馏成更小的学生模型,为以前被封闭提供商阻止的学术研究开辟了途径。有关完整数据来源详情,请参阅 Nvidia

额外的许可细则明确了再分发边界。通过在专有数据上继续预训练创建的衍生模型,即使权重本身从未公开共享,也必须在其文档中保留原始 Nvidia 归属声明。此要求防止基础模型被悄无声息地商业吸收,同时仍允许大型组织进行广泛的内部定制。许可证进一步禁止在某些高风险军事或监控应用中使用,这与 Meta 和 Mistral 在其自身发布中已采用的新兴负责任 AI 框架保持一致。

早期采用者已经开始在 Hugging Face 上发布应用领域特定继续预训练的衍生模型。例如,一家医疗初创公司在一个包含 1800 亿个去标识化临床笔记和 PubMed 摘要的语料库上训练了一个医学推理变体,同时保留了所需的归属标头。生成的检查点通过了内部与 HIPAA 对齐的红队审计,其水平与专业供应商提供的专有医疗模型相当。

技术架构与训练方法

LVNM 采用仅解码器 transformer 架构,配备分组查询注意力和旋转位置嵌入,上下文长度扩展至 128k。训练运行利用 Nvidia 内部由 16,000 个 Blackwell GPU 组成的集群,历时 38 天,消耗约 920 万 GPU 小时。最大变体中出现了混合专家路由,包含 16 个专家和 top-2 门控,与密集等效模型相比,推理期间的活跃参数数量减少了 38%。

随模型发布的量化方案支持 FP8、INT4 和 AWQ 格式。内部测试表明,FP8 在 GSM8K 上保持了超过 97% 的全精度准确率,同时将内存占用减半。开发者可通过所提供 vLLM 集成中的单一标志激活这些格式。训练数据过滤依赖于基于困惑度的去重和在 Nvidia 精选安全语料库上训练的分类器驱动毒性移除相结合。最终的数据卡显示,初始收集的 token 中有 14% 在质量过滤期间被丢弃。

进一步的架构改进包括专为多 GPU 配置优化的动态张量并行,允许近线性扩展至 32 个节点。后训练对齐采用了一种新颖的强化学习变体,在奖励建模期间融入硬件遥测信号,同时改善指令遵循和硬件利用率。这些选择反映了 Nvidia 作为硬件设计者和模型开发者的双重角色,使其能够实现纯软件实验室无法获得的优化。

为什么硬件公司现在发布模型

Nvidia 眼看着其他公司掌控其芯片之上的软件层。Meta 提供 Llama,Google 提供 Gemma。两者在 Nvidia 硬件上运行良好,却让这些公司影响开发者心智份额。

LVNM 的发布让 Nvidia 获得了同一张桌子的席位。它还为客户留在 Nvidia 软件生态系统内创造了另一个理由。

采用 LVNM 的团队将获得优化内核和分析工具。当完整堆栈保持 Nvidia 品牌时,这些工具效果最佳。该方法与芯片供应商早期进入编译器和运行时的举措如出一辙。

通过同时拥有硅和权重,Nvidia 可以共同设计利用 Blackwell 第二代 transformer 引擎的注意力内核。早期采用者报告,与在相同硬件上运行等效 Llama-3.1-405B 检查点相比,每秒 token 数提高了 1.8 倍。这一性能差异源于通用 CUDA 实现中无法获得的自定义融合操作。该策略还锁定了遥测数据:使用统计信息通过 Nvidia 的托管推理服务回流, informing 未来的硬件路线图。

类似垂直整合在其他行业已有先例。当智能手机制造商开始出货参考神经网络加速器时,他们迅速捆绑了针对其硅片优化的轻量级模型。Nvidia 似乎正在数据中心规模上沿用同一策略,这引发了纯模型提供商能否在不同硬件平台上保持中立性的疑问。

企业部署工作流

生产部署从官方 Docker 容器开始,该容器捆绑了 CUDA 12.8、TensorRT-LLM 和 LVNM 权重。一行 Helm Chart 即可将模型部署为 Kubernetes 推理服务,支持 1 到 8 个副本的自动扩缩容。可观测性钩子导出 Prometheus 指标,包括延迟、吞吐量和 GPU 利用率。在空气隔离环境中运行的企业将收到离线许可证密钥生成器,可在不联网的情况下验证签名。

其他工作流工具包括自动化模型分片脚本,可将 405B 检查点分割到八张 GPU 上,且几乎无需手动配置。GitLab 和 Jenkins 的持续集成模板允许团队在将更新提升到暂存环境前,针对基础模型运行每夜提示回归测试。Nvidia 云控制台内的成本监控仪表板将 token 吞吐量与竞价实例定价关联,帮助财务团队在流量运行第一周后,以 5% 以内的准确率预测每月推理支出。

性能声明待审

独立实验室已开始并行测试。初步数据表明 LVNM 在 HumanEval 和 MATH 基准上接近 GPT-4o,但在长上下文检索和多语言任务上存在差距。

Nvidia 发布了自有评估套件。外部团体指出提示词的选择可能改变排名。更标准的测试将在未来一个月内出现。

即使在量化级别下,内存占用仍较高。以 4 位运行最大变体仍需 48 GB,这限制了在较小工作站上的部署。

第三方在 Open LLM Leaderboard 上的评估显示,LVNM-405B 在 MMLU 上得分为 87.4,在 HumanEval 上为 82.1,与 GPT-4o 相差 1.3 分以内。但在 LongBench 多文档问答任务上,LVNM 落后 9 分,促使研究人员调查注意力模式差异。

与其他开放模型的对比分析

与 Meta 的 Llama-3.1-405B 相比,LVNM 在代码生成上更强,但在 AlpacaEval 2.0 的指令遵循上较弱。Llama 受益于更广泛的社区微调,而 LVNM 目前仅提供官方指令检查点。与 Mistral Large 相比,LVNM 在 Blackwell 硬件上实现更高吞吐量,但缺乏在非 Nvidia 加速器上部署 mixture-of-experts 的同等工具。

进一步的头对头测试显示,LVNM 的 mixture-of-experts 路由在突发工作负载下产生的延迟方差低于同等活跃参数数量的稠密模型。相比之下,当用户应用第三方框架已优化数月的激进推测解码技术时,Llama-3.1 衍生模型表现更优。这些差异体现了经典权衡:硬件调优模型可立即提供峰值性能,而广泛采用的模型则积累长期生态系统优势。

纯软件竞争对手的压力

纯软件公司现在面临一个同时销售硬件的新竞争对手。开放模型提供商必须决定是优化 Nvidia 堆栈还是保持更广泛的兼容性。

一些团队已经分叉了 LVNM 仓库以添加对 AMD GPU 的支持。这些分叉进展较慢且缺乏官方更新。选择主分支的开发者进一步锁定在 Nvidia 工具链中。

较小的实验室报告称,维护跨供应商一致性现在消耗了他们 30-40% 的工程预算。因此,几家已宣布计划为其旗舰版本优先进行 Nvidia-only 优化,实际上在替代加速器上让步。这种动态类似于早期平台战争,其中操作系统供应商利用独家应用来维持市场地位。

开发者入门和微调指南

新用户从 Nvidia 的一键式 Colab notebook 开始,可在五分钟内以 INT4 模式加载 13B 检查点。随后提供的 LoRA 训练脚本接受仅 2,000 个示例的 JSONL 数据集,并在大约九十分钟内在一块 H100 上完成完整 epoch。高级用户可激活分布式训练配方,使用完全分片数据并行技术将 405B 模型分片到 32 个 GPU 上,将领域适应的实际时间从数周缩短至三天。文档包含指令微调、偏好优化以及使用模型自身生成的合成数据进行持续预训练的具体配方。

局限性和潜在风险

内存占用限制了设备端用例。即使是 INT4 模式的 13B 变体也需要 12 GB VRAM,排除了大多数消费级笔记本电脑。对最新一代驱动程序的依赖给采用标准化机群策略的组织带来摩擦。安全报告显示,模型仍易受多轮越狱攻击,这些攻击可将良性查询串联成有害输出。数据来源文档仍停留在高层次;下游开发者无法追踪训练混合中的具体文档,这使新兴的欧盟 AI 法案合规审计变得复杂。供应商锁定构成战略风险:如果未来开放模型从替代硬件供应商获得同等的内核级优化,性能优势可能会减弱。完整集合见 Huggingface

对开发者和企业的实际影响

评估 LVNM 的团队应先使用托管推理 playground 验证任务匹配度,再投入硬件。成本建模必须同时考虑 GPU 小时定价以及从 Nvidia 托管云服务时的潜在出口费用。微调预算受益于宽松许可,但训练运行期间需要预留 H100 容量。优先考虑可审计性的组织可能更倾向于完全开放的数据集,例如某些 Llama 衍生版本附带的数据集,直到 Nvidia 发布更细粒度的数据血缘信息。

监管和伦理考量

美国和欧洲的监管机构已开始对硬件绑定模型发布进行调查。其结果可能会影响未来的许可条款。

硬件-软件捆绑引发了反垄断问题,这些问题在早期的操作系统案例中已经很熟悉。欧洲当局已要求详细解释如何对竞争加速器保留推理优化。伦理问题集中在单一商业实体集中前沿模型能力,该实体还主导底层计算市场。

常见问题

LVNM 许可与 Llama 3.1 有何不同?

LVNM 要求在再分发时注明出处,并限制某些军事应用;Llama 3.1 允许更无限制的商业使用。

LVNM 能否在非 Blackwell GPU 上运行?

可以,但峰值性能数据仅在配备最新驱动堆栈的 Blackwell 上实现。

预计下一次发布日期是什么时候?

Nvidia 已表示将在 2026 年底前推出课程学习更新。

接下来值得关注

关注 Hugging Face 未来一个季度的采用指标。下载速度和微调次数将反映真实使用情况。

跟踪主要云提供商是否将 LVNM 列入其托管产品。纳入其中将表明基础设施团队将其视为生产就绪。

观察其他芯片厂商的反应。AMD 和 Google 也有自己的开放模型计划,可能会在本次发布后调整时间表。

开发者可立即通过 Nvidia 的推理游乐场测试该模型。更广泛的反馈将影响 2026 年底前进行的下一次训练。

针对特定垂直领域的社区微调版本很可能在 60 天内出现。请留意量化与专有 API 相比总拥有成本的企业案例研究。Nvidia 即将举行的 GTC 主题演讲预计将公布使用 LVNM 自身生成的合成数据训练的课程学习更新,这可能会缩小当前长上下文推理方面的能力差距。

关注快速发展的技术故事的团队通常需要一个地方来集中保存源笔记、会议上下文和后续问题。一个轻量级的 AI 知识库 可以让这些变动部分在新闻周期变化后更容易回顾。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page