top of page

NVIDIA Vera Rubin MLPerf 首秀领跑,但预览版状态仍需重视

45分钟前
讀畢需時 13 分鐘

NVIDIA 携 Vera Rubin NVL72 参加 MLPerf Inference v6.1,报告称其吞吐量最高达到前代 GB300 NVL72 的 3.7 倍。NVIDIA Vera Rubin 的 MLPerf 首秀,让基础设施采购方首次得以通过同行评审的结果了解该公司下一代机架级 AI 平台。但这一亮眼标题旁也有一项重要限制:Vera Rubin 仍是预览系统。

这一差异界定了真正的竞争。NVIDIA 并非只是比较两代 GPU,而是在主张,高度整合的机架能够将新芯片、网络和推理服务软件转化为更优的推理经济性。

AMD 迄今覆盖范围最广的 MLPerf 提交结果表明,这一主张如今正面临压力。AMD 在已上市硬件上交出了有竞争力的成绩,扩大了工作负载覆盖范围,并重点展示了规模可达 512 个加速器的部署。NVIDIA 在选定的 Vera Rubin 对比中领先,但客户仍须判断预览版的领先是否能转化为可部署的价值。

NVIDIA Vera Rubin MLPerf 结果确立早期领先地位

这次首秀在两个高要求模型上展现出显著的代际性能提升,但尚不代表已经出货的生产级平台。

这些结果于 2026 年 9 月 16 日随 MLPerf v6.1 发布一同公布。MLPerf Inference 用标准化的准确率和延迟条件,衡量系统为已训练 AI 模型提供推理服务的能力。

MLCommons 报告称,本轮共有创纪录的 30 家机构参与。包括 AMD 已上市的 MI350P 和 Intel Arc Pro B70 在内,共有五款新处理器或加速器亮相。NVIDIA Rubin 和 Vera Rubin NVL72 则以预览状态参测。

NVIDIA 为 DeepSeek-R1 和 Qwen3-VL-235B 提交了 Vera Rubin 成绩。DeepSeek-R1 测试推理模型服务能力,而 Qwen3-VL 则结合语言与视觉输入,用于产品分类等任务。

该公司的 Vera Rubin 成绩显示,Qwen3-VL 的交互式场景带来了最大的相对增幅。在该场景中,一套 Vera Rubin NVL72 达到每秒 1,307 次查询;可比的 GB300 NVL72 成绩为每秒 349 次查询。

这构成了约 3.7 倍的标题性增长。交互式场景还设定了 1.5 秒的延迟上限,因此对于响应式应用而言,它比不受约束的批处理吞吐量更具参考价值。

在其他 Qwen3-VL 场景中,优势较小但依然显著。Vera Rubin 的离线场景达到每秒 2,393 个样本,而 GB300 为每秒 1,305 个样本;其服务器场景达到每秒 2,323 次查询,而 GB300 为每秒 1,210 次查询。

这些结果相当于离线吞吐量提升约 1.8 倍、服务器吞吐量提升约 1.9 倍。这种差异表明,单一的最高倍数无法描述整个系统。

在 DeepSeek-R1 上,Vera Rubin 在交互式场景中记录到每秒 652,750 个 token。在相同的公开延迟限制下,72-GPU GB300 NVL72 的成绩为每秒 260,098 个 token。

这一对比支持 NVIDIA 所称 DeepSeek-R1 吞吐量最高提升 2.5 倍的说法。NVIDIA 在该工作负载中使用 TensorRT-LLM,而其 Qwen3-VL 提交则采用搭配 NVIDIA Dynamo 的 vLLM。

公开性能表还在每项结果旁列出了准确率门槛。Vera Rubin 的 DeepSeek-R1 条目目标为达到 FP16 准确率的 99%,精确匹配得分为 81.9132%。

对于 Qwen3-VL,目标是达到 BF16 质量的 99%。该基准要求使用 Shopify 产品目录数据集时,类别层级 F1 分数至少达到 0.7824。

这些门槛很重要,因为如果激进的数值压缩损害模型输出,更快的推理价值有限。MLPerf 要求提交结果先达到既定质量阈值,其性能数字才会被计入。

不过,这次首秀仅覆盖两个基准模型。它并未确立在 MLPerf Inference v6.1 中所有语言、推荐、视频、语音或检索工作负载上的领先地位。

对于预览硬件而言,这种较窄的覆盖范围并不罕见。但这意味着采购方应将其视为早期系统信号,而非普适性的结论。

更高吞吐量为何会改变 AI 推理经济性

当额外吞吐量能够在不成比例增加硬件、能耗或运营复杂度的情况下处理更多有价值请求时,推理性能才会在财务层面产生意义。

训练产出模型,而每当模型回答用户时,推理便会运行。消费者助手、编程智能体、搜索服务或文档系统,都可能在一项任务中触发多次推理调用。

推理智能体强化了这一模式。它们生成中间 token、调用工具、检查结果并修订计划。一个用户可见的回答,背后可能需要多次模型运行。

这种行为使每秒 token 数具有经济意义。更快的系统可以服务更多并发请求、缩短排队时间,或在相同时间窗口内提供更长的推理轨迹。

然而,最高吞吐量只是计算的一部分。采购方还需要可接受的响应延迟、稳定的准确性、高利用率、可控的能耗需求和可靠的软件。

MLPerf 正是因此区分了多个部署场景。离线场景强调批量处理;服务器场景模拟变化的入站请求,而交互式场景则提出更严格的响应速度要求。

Vera Rubin 最强的相对表现出现在这一对延迟敏感的交互式环境中。这表明,当系统无法借助大批量处理掩盖延迟时,其架构改进尤具价值。

这对按访问权限、使用量或完成工作收费的产品很重要。如果一个机架能够在达到所需服务水平的前提下处理更多请求,运营方就能从该基础设施中获得更多容量。

但吞吐量并不自动等于收入。必须存在需求,软件必须让加速器保持忙碌,完整服务还必须避免模型服务器之外的瓶颈。

存储、网络架构、数据库、安全过滤器和应用逻辑,都可能限制实际交付的性能。基准测试对受测系统的隔离程度,通常高于大多数生产环境。

每 token 成本也远不只是将设备成本除以峰值吞吐量。它还包括电力、散热、网络、维护、融资、软件工程、停机时间和折旧。

NVIDIA 表示 Vera Rubin 可降低 token 成本,但 v6.1 发布内容并未给出完整的生产环境总拥有成本对比。该基准提供的是性能证据,而非完整采购模型。

因此,基础设施团队应将这些结果映射到自身的流量特征中。视觉产品搜索服务可能更关注 Qwen3-VL 的服务器吞吐量;推理平台则可能优先考虑 DeepSeek-R1 的延迟和 token 生成能力。

当基准测试与采购方的工作负载相似时,结果就更有价值;当模型架构、请求长度、批处理行为或服务约束存在显著差异时,其决定性就会降低。

这正是 NVIDIA 竞争对手面临的经济压力。它们不必赢下每一张图表,但必须提供足够的可部署性能、软件成熟度和灵活性,以形成更好的整体商业案例。

机架级协同设计是性能机制

Vera Rubin 的优势来自将 72 个 GPU、CPU、内存、网络和推理软件视为一个协调一致的系统。

一套 NVL72 机架在高带宽纵向扩展域内连接 72 个加速器。纵向扩展网络让这些加速器能够作为一个大型系统协作,而不是像彼此孤立的服务器那样运行。

NVIDIA 表示,第六代 NVLink 和 NVLink Switch 的数据包速率是标准 Ethernet 的 10 倍。该公司还称,在相关对比中,其延迟低 3 倍。

这些互连主张来自 NVIDIA,不应视为独立的网络基准测试。不过,它们仍解释了提交系统背后的设计选择。

大型推理和视觉语言模型会在推理期间移动大量数据。模型权重、激活值、注意力状态和路由决策必须迅速抵达正确的计算资源。

Vera Rubin 使用 HBM4,这是一种部署在 GPU 附近的高带宽内存世代。根据 NVIDIA 公开的架构资料,其机架配置包含 72 个 Rubin GPU 和 36 个 Vera CPU。

随后,软件会在这些资源间分配工作。解耦式服务将预填充与解码分开,使不同资源能够专注于文本生成的不同阶段。

预填充处理用户输入,并构建模型内部的注意力状态。解码则逐 token 生成回答,通常面临不同的内存和延迟约束。

当软件将每个阶段分配给合适资源时,分离这些阶段可以提升利用率。但它也会带来协调开销,因此快速互连和有效调度变得至关重要。

NVIDIA 的提交结果为混合专家模型采用了大规模专家并行。这种模型设计会针对每个 token 只激活选定的专家层,而不是每次运行整个网络。

这种方法可以减少计算量,但会产生不规则通信。token 必须被路由至正确的专家、完成处理并返回,且网络延迟不能吞噬由此节省的资源。

低精度算术是该机制的另一部分。NVIDIA 使用了 NVFP4,这是一种旨在降低内存占用并提高计算吞吐量的四位数值格式。

该系统将降精度应用于权重、注意力运算和键值缓存。键值缓存存储先前的注意力信息,使模型无需为每个新 token 重新计算完整对话。

较低精度可让更多数据存入内存,并减少计算单元之间的数据移动。MLPerf 的准确率门槛则为不可接受的质量损失提供了护栏。

因此,最终性能数字并非对 Rubin 芯片的纯粹测量。它反映了处理器、内存、网络、数值格式、内核、服务框架以及针对基准的调优。

这正是 NVIDIA 战略的核心。该公司希望客户评估整个平台,因为其竞争优势延伸至单个加速器规格之外。

对于寻求一套受支持技术栈的运营方而言,这一策略可以带来益处。它也可能增加对 NVIDIA 紧密连接的硬件和软件环境的依赖。

对于采购方而言,这种依赖并不必然是负面的。协调一致的平台可以减少集成工作,并在经过认证的系统中提供可预测的性能。

当客户希望获得更大的硬件选择空间、可移植的软件或对单个组件的独立控制时,取舍便会显现。这正是 AMD 的竞争路径变得相关之处。

AMD 以已上市硬件向平台叙事施压

AMD 在 v6.1 中的表现并未抹去 Vera Rubin 在选定项目上的领先优势,但它阻止 NVIDIA 毫无争议地占据更广泛的推理叙事。

AMD 在 MLPerf Inference v6.0 中提交了三个模型家族,而在 v6.1 中扩展至六个。其结果覆盖了在 MI355X、MI350X 和 MI350P 加速器上运行的语言、推理、推荐和文生视频工作负载。

该公司的 MLPerf 提交结果突出展示了 GPT-OSS-120B 在八 GPU 配置下的竞争力。AMD 表示,在离线和服务器场景中,MI355X 领先于部分 NVIDIA B200 和 B300 的提交结果。

AMD 还报告称,在硬件保持 MI355X 不变的情况下,软件优化带来了性能提升。与上一轮相比,其八 GPU GPT-OSS-120B 服务器吞吐量提高了 38%。

离线吞吐量提高了 28%,Wan 2.2 单流性能则提升了 70%。这些是 AMD 对其已提交的 v6.1 与 v6.0 结果的比较。

这一模式同样支持 NVIDIA 的核心观点之一:硬件本身并不能决定推理系统整个生命周期的价值。软件改进能够在系统部署后释放更多实际可用的算力。

AMD 在 GPT-OSS-120B 上使用 72 块 MI355X GPU 时实现了 95% 的扩展效率。扩展效率衡量的是吞吐量增长与新增加速器数量之间的匹配程度。

随后,Crusoe 提交了一套配备 512 块 AMD GPU 的系统。据 AMD 称,该系统在 GPT-OSS-120B 上实现了每秒 575 万个离线 token,在 DeepSeek-R1 上则达到每秒 290 万个。

这在当时是提交至 MLPerf Inference 的最大加速器数量。它也展示了另一种扩展路径:基于大规模集群和开放软件环境实现规模化。

与 Vera Rubin 的比较并非直接对比。不同提交结果可以采用不同模型、系统规模、测试场景和获批优化方案。

一项由 512 个加速器组成的聚合结果,并不能证明其每机架经济性优于一套 72 GPU 的 Vera Rubin 系统。同样,Vera Rubin 在 Qwen3-VL 上的领先,也无法完全判定 AMD 在 GPT-OSS-120B 上的竞争力。

这正是解读 MLPerf 时的常见挑战。每家厂商都可以强调最能体现自身优势的工作负载、场景和系统规模。

MLCommons 通过标准规则、准确率门槛、结果审查和公开的配置细节来限制这种自由度,但它无法让不同系统变得完全一致。

最有价值的比较,应保持模型、场景、延迟目标、准确率要求、加速器数量和组别不变。除此之外的差异应始终清晰可见。

竞争也不止于 NVIDIA 和 AMD。Google 参与了 v6.1,Intel 发布了 Arc Pro B70 结果,多家云服务商也提交了合作伙伴系统。

Lambda 的 推理结果展示了系统构建商如何利用同一代加速器进一步提升性能。其四 GPU Blackwell Ultra 系统较 v6.0 提升近 9%。

Lambda 还通过开放组提交,在数据中心硬件上使用 Kimi K2.6 运行了一项边缘智能体工作负载。据 Lambda 称,该模型包含超过一万亿个参数。

这些结果强化了一个更广泛的观点:竞争单元正从单一处理器转向经过配置的服务栈,其中包括模型、框架、编排和基础设施。

NVIDIA 目前提供了这一服务栈中整合程度最高的版本。AMD 正试图削弱这样一种假设:高度整合必然要求采用仅限 NVIDIA 的平台。

因此,NVIDIA 面临的压力不只是保持最快。它必须证明,其性能领先能够带来足以支撑用户投入其架构的运营价值。

预览结果尚未证明什么

最有力的结论是经过验证的基准吞吐量;而关于成本、收入、可用性和广泛工作负载领先地位的说法,仍需要更多证据。

MLCommons 将 Vera Rubin 和 Vera Rubin NVL72 标记为预览条目。这一标签表明,在本轮结果中,该平台并未像已可用的 AMD MI350P 那样被呈现。

预览状态并不意味着结果无效。MLPerf 仍会公布配置并执行其基准测试流程。但这确实限制了买家能从中推断出多少关于商业部署系统的信息。

量产硬件可能面临工程提交中未体现的限制。固件成熟度、故障率、组件供应、冷却、安装时间和集群管理,都会影响实际容量。

Vera Rubin 的提交还来自 NVIDIA 及其合作伙伴 Nebius。若更多独立系统构建商能够复现结果,将更有力地证明该性能可在不同部署中迁移。

NVIDIA 上一代生态系统提供了有利的先例。在 v6.1 中,19 家合作伙伴使用 NVIDIA 平台参与提交,其中包括 8 家使用多节点 Blackwell NVL72 系统。

这一广度表明,NVIDIA 知道如何通过庞大的供应商网络推广优化设计。但这并不能保证 Vera Rubin 的预览配置将在各地按原样、按期交付。

工作负载覆盖范围带来了另一项不确定性。该平台首次亮相时采用了 DeepSeek-R1 和 Qwen3-VL,这两类工作负载适合其机架级设计和软件栈。

它并未在封闭组中公布 Vera Rubin 在 GPT-OSS-120B、推荐、语音、图像生成、RAG 或 Wan 2.2 上的结果。未来几轮测试将显示这种领先是否具有普适性。

NVIDIA 还提及了截止日期后的 GPT-OSS-120B 和 DLRMv3 性能改进。该公司明确表示,MLCommons 尚未验证这些后续结果。

在通过同样的审查流程之前,这些数字不应纳入直接的基准结论。厂商测试能够显示方向,但其证据权重并不相同。

功耗数据是头条比较中另一个缺失环节。每机架吞吐量很重要,但运营商往往会在耗尽机房空间之前就达到固定的供电容量上限。

更快的机架如果需要更高密度的供电或更严苛的液冷,仍可能增加部署难度。每瓦性能将决定一座设施在其容量限制内能容纳多少有效工作量。

NVIDIA 认为,更高的吞吐量会降低每 token 成本。当其他因素保持稳定时,这一结论是合理的,但已公布的结果并未提供完整的成本核算。

采购条款、利用率、电力、维护、融资和软件人力都会影响最终数字。买家需要从自身工作负载中获得实测的生产数据。

该基准测试也无法保证终端用户响应速度。模型服务可能运行得很快,但检索、工具调用、数据库或外部 API 可能造成大部分延迟。

MLPerf v6.1 通过新增的检索增强生成和边缘智能体测试,开始弥补这一差距。超过半数提交者采用了其以 API 为中心的测试框架,该框架使用客户端—服务器架构。

MLCommons 表示,该框架将支持数据中心测试向 MLPerf Endpoints 过渡。这一变化应使测量更接近可部署服务,而不是孤立的模型引擎。

这种演进可能强化,也可能削弱 NVIDIA 的平台优势。高度整合的服务栈应受益于全服务测量,但外部依赖可能稀释原始加速器优势。

谨慎的解读应当具体:Vera Rubin 在 DeepSeek-R1 和 Qwen3-VL 上取得了显著、经过审查的预览首秀。它尚未确立全面领先地位,也尚未证明完整的量产经济性。

三个信号将决定领先能否维持

只有当出货系统能在更多工作负载上、并在可测量的运营约束下复现这一优势时,Vera Rubin 的早期优势才具有战略意义。

第一个信号是广泛的量产可用性。客户应关注云实例、合作伙伴系统和已安装机架,并确认其公开的配置细节可与预览提交结果相比较。

成功的推广将表明,NVIDIA 能够将优化的工程结果转化为可重复部署的基础设施。延期或配置出现重大差异,则会削弱这一结论。

可用性不应仅包括出货公告。买家需要稳定的软件版本、经过认证的网络、服务流程,以及系统能在长期运行中维持性能的证据。

第二个信号是下一轮独立基准测试。Vera Rubin 需要在 DeepSeek-R1 和 Qwen3-VL 之外取得结果,尤其是在检索、推荐、视频和更多语言模型上的表现。

更广泛的覆盖将支持 NVIDIA 的主张,即一个平台能够处理多样化的推理工作负载。覆盖范围狭窄,则会为专用加速器和竞争性集群留下更多空间。

未来的 MLPerf Endpoints 结果将尤其具有启示意义。它们应测量更接近企业采购和运营服务的面向 API 系统。

应关注 Vera Rubin 的原始吞吐量在加入请求编排、检索组件和真实服务边界后是否仍能保持。若领先幅度缩小,则意味着瓶颈已转移至其他环节。

第三个信号是竞争性软件进展。AMD 在 v6.1 中的提升表明,已部署的加速器无需新一代硬件,也能获得显著性能增长。

如果 ROCm、开放服务框架和合作伙伴系统继续快速改进,买家可能会以较低峰值性能换取灵活性或与现有基础设施的兼容性。

如果 NVIDIA 的软件以同样速度改进,Vera Rubin 的初始领先优势可能进一步扩大。该公司已报告,GB300 在 v6.0 至 v6.1 期间的 Qwen3-VL 性能提升了 1.6 倍。

因此,软件迭代速度具有双重重要性。它既能提高当前性能,也会改变客户对昂贵系统使用寿命的评估。

采购团队应要求厂商针对其确切模型、上下文长度、批处理模式和延迟目标提供结果,也应测试故障、升级和工作负载变化情形。

开发者应关注哪些优化能够在无需大量定制工作的情况下进入常见框架。如果普通团队无法部署或维护,针对基准调优的技术价值将十分有限。

AI 产品负责人应将基础设施指标与用户结果联系起来。更快的推理可支持更低延迟、更多推理步骤、更高并发,或更长的多模态请求。

NVIDIA Vera Rubin 的 MLPerf 结果为机架级协同设计提出了可信的开篇论据。其 3.7 倍的峰值比较具有意义,但它属于一个特定场景。

接下来的决策并不是预览基准看起来是否足够快——显然是的。关键在于,当功耗、软件、可用性和真实工作负载都纳入考量后,出货系统能否保持这一优势。

在选择平台前,应要求厂商复现您要求最高的服务级别目标。随后综合比较持续吞吐量、延迟、准确率、利用率和运营投入。这样的评估将揭示 Vera Rubin 的基准领先能否转化为持久的推理经济性,还是仍只是一项令人印象深刻的预览结果。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page