NVIDIA Vera Rubin NVL72 宣称每美元性能提升 67 倍,但运行点至关重要
NVIDIA Vera Rubin NVL72 在一项早期智能体推理测试中,宣称相较 GB300 NVL72 具备 67 倍的每美元性能优势。这个数字在所选基准测试对比范围内成立,但并非普适倍数。在更常见的服务速度下,测得的优势要小得多。
9 月 14 日公布的结果,让基础设施采购方首次独立了解 Rubin 在长上下文、多轮工作负载下的表现。它们也让 NVIDIA CEO Jensen Huang 此前的性能预测显得保守。然而,最大的倍数取决于一个高要求的运行点:在该点位中,被比较的 Blackwell 配置接近其性能极限。
因此,核心较量并不只是 Rubin 对阵 Blackwell,而是标题中的宣称与运营方能在不同模型、服务引擎、延迟目标和生产流量中复现的性能之间的较量。NVIDIA 似乎整体移动了这条性能曲线,但曲线上不同位置的差距变化显著。
NVIDIA Vera Rubin NVL72 从预测走向实测智能体工作负载
重要变化在于,Rubin 现在已有实测的智能体推理结果,而不再只是架构规格或 NVIDIA 的预测。
SemiAnalysis 发布了来自 AgentX 的首批经审查 Rubin 测试结果。AgentX 是其针对长上下文编程智能体流量的基准测试。测试采用接近生产环境的会话,其中包括累积上下文、工具暂停、前缀复用以及并行子智能体的突发请求。
这类流量不同于传统聊天机器人基准测试。一次基础聊天请求通常包含一个提示词和一个回复;而智能体可以进行数百轮交互,同时调用工具、咨询子智能体,并反复发送不断扩展的对话历史。
这些模式会对推理系统提出不同要求。长历史记录会占用键值缓存容量,后者用于存储此前已计算的注意力数据。复用前缀会奖励高效缓存,而子智能体突发请求则考验调度和并发能力。
公开的 AgentX methodology 基于 393 个自愿参与的编程会话,共包含 135,282 个请求。其重建请求的中位数包含 142,016 个输入 token 和 444 个输出 token。
AgentX 会移除提示词、代码、工具参数和工具结果。它保留请求长度、时间安排、共享前缀关系和子智能体结构,随后以确定性的合成 token 进行替换。
这种设计在不暴露原始内容的前提下,提供了更贴近真实场景的流量形态。不过,AgentX 不测试模型能否生成正确代码,或能否成功完成智能体任务。它衡量的是服务系统,而非模型智能水平。
新结果采用 DeepSeek V4 Pro 和早期 TensorRT-LLM 软件栈。TensorRT-LLM 是 NVIDIA 用于优化其加速器上模型执行的推理运行时。
根据 Rubin benchmark analysis,在每秒 170 个 token 的条件下,Vera Rubin NVL72 的每单位建模总拥有成本总吞吐量约为 GB300 NVL72 的 67 倍。
该对比采用 TensorRT-LLM 和 NVFP4,即 NVIDIA 面向低精度 AI 计算的四位数值格式。它还衡量了完整的软硬件配置,而非比较理论芯片规格。
在相同运行点下,Rubin 实现了显著优势,因为所选 GB300 TensorRT-LLM 曲线接近其最快实测端点。SemiAnalysis 报告称,Rubin 相对于运行 SGLang——另一种服务框架——的 GB300,优势要小得多。
这一结果仍然重要。Rubin 的胜利并非仅仅因为基准测试选择了过时的一代产品,或基础的单 GPU 服务器。它在服务同一大型模型、并维持匹配的响应速度目标时,击败了 NVIDIA 的 Blackwell Ultra 机架级系统。
不过,67 倍这一数字描述的是性能曲线上的一个点。它并不意味着每个 Rubin 部署都能以相同总成本产出 67 倍 token。
在每秒 60 至 100 个 token 的区间内——SemiAnalysis 认为这更能代表服务此类工作负载的供应商——Rubin 的单位总成本吞吐量约为 1.4 至 3 倍。
这不如 67 倍那样戏剧性,但具有显著商业意义。当电力、网络、冷却和可用数据中心空间已限制扩张时,持续两倍的提升足以重塑容量规划。
结果还显示出更高的最大交互性。Rubin 的 P90 达到约每秒 276 个 token,而采用所选 TensorRT-LLM 配置的 GB300 约为 172。
P90 交互性衡量 90% 响应可达到的流式输出速度。它有助于运营方判断吞吐量结果是否也能提供可接受的用户体验。
Rubin 在不同软件栈中的优势并不相同。SemiAnalysis 发现,运行 SGLang 的 GB300 可实现与 Rubin 相近的交互性,尽管 Rubin 仍保有其他吞吐量和延迟优势。
这种差异构成了本文的核心张力。NVIDIA Vera Rubin NVL72 看起来显著更快,但其报告中最大的优势来自模型、运行时、精度和服务等级目标的特定组合。
为什么智能体推理让电力成为稀缺资源
Rubin 最具影响力的提升并非峰值算力,而是在固定电力预算内可服务的有效智能体流量规模。
智能体消耗的 token 多于简单聊天交互,因为每一步都可能成为下一步的上下文。研究、编程和支持类智能体可能在回答前搜索数据库、运行工具、检查结果并委派工作。
NVIDIA 表示,基于 OpenRouter 数据,智能体请求消耗的 token 约为简单聊天请求的 15 倍。这一数字会因应用而异,但整体趋势很明确。
随着上下文增长,系统会反复处理或检索早期轮次中的信息。多个子智能体还可能形成短暂而密集的并发请求突发。
这些特征使内存容量、内存带宽、互连延迟、缓存管理和 CPU 协调成为首要约束。原始张量性能仍然重要,但已无法完整解释服务结果。
电力接入又增加了一层限制。运营方或许能够采购更多加速器,却缺乏足够的电网容量为它们供电。新建变电站、输电连接、冷却系统和数据机房所需时间比部署服务器更长。
因此,每兆瓦吞吐量衡量的不只是能效。它近似反映运营方能从稀缺的设施资源中提取多少可计费工作量。
在每秒 100 个 token 时,SemiAnalysis 测得 Rubin 每公用事业兆瓦的总吞吐量约为每秒 5,940 万个 token。最强的 GB300 实测配置在相同目标下达到 2,850 万。
这使 Rubin 在这个实用运行点下,比最强 GB300 引擎快约 2.09 倍。运行 TensorRT-LLM 的 GB300 达到每兆瓦每秒 2,110 万个 token。
随着速度要求提高,领先幅度也发生变化。在每秒 150 个 token 时,Rubin 仍保持接近每兆瓦每秒 3,700 万个 token,约为 GB300 SGLang 实测结果的 7.2 倍。
在每秒 170 个 token 时,Rubin 相对于 GB300 TensorRT-LLM 的每兆瓦吞吐量领先达到 62.9 倍。不过,相对于 GB300 SGLang,这一倍数为 5.56 倍。
这种差异正是每项大型性能宣称都需要标明所用引擎的原因。只比较加速器名称的采购方,会忽视运行时对结果造成的巨大影响。
NVIDIA 此前的数据展示了同一趋势的另一种视角。该公司报告称,在每秒 160 个 token 时,其每兆瓦吞吐量最高可达 GB300 的 30 倍。
NVIDIA 表示,这些测试采用 AgentX DeepSeek V4 Pro 工作负载。该公司在发布时还称,结果尚待 SemiAnalysis 审查,且未纳入 Vera CPU 在工具调用中的性能。
随后的审查支持 Rubin 具有显著优势,但并不支持一个固定倍数。NVIDIA 的 agentic performance data 显示,优势从每秒 110 个 token 时的约两倍,上升至每秒 160 个 token 时的 30 倍。
这条曲线比单张柱状图更重要。推理服务提供商需要在并发性、响应速度、首 token 时间、总延迟和成本之间取得平衡。
针对最大聚合吞吐量优化的配置,可能让每位用户等待过久;针对极致交互性优化的系统,则可能使昂贵的容量未被充分利用。
智能体产品还带来另一项复杂性。工具执行、代码编译、检索和外部 API 调用,可能使 GPU 等待 CPU 或远程服务。
Rubin 通过每个 NVL72 机架中配备的 36 个 Vera CPU 和 72 个 Rubin GPU 来应对这一问题。NVIDIA 将这些 CPU 设计用于处理智能体编排、工具调用、数据处理和沙盒执行。
如果这些组件能够减少整个工作流中的闲置时间,经济性论点便会更强;若外部工具、网络调用或应用逻辑仍是主导瓶颈,这一论点则会削弱。
对于云服务商和模型实验室而言,压力是即时的。Rubin 的大幅优势,将使在受电力约束的新推理容量中继续扩张 Blackwell 更难以合理化。
现有 Blackwell 部署不会突然失去经济性。它们的硬件已安装就绪,软件已趋成熟,而且许多工作负载并不需要 Rubin 的最高交互性区间。
被迫作出的回应会更具选择性。运营方必须决定哪些工作负载应优先使用 Rubin,哪些应留在 Blackwell,以及哪些可迁移至竞争对手的加速器。
极致协同设计是 Rubin 性能提升背后的机制
NVIDIA 的结果来自 GPU、CPU、内存、互连、运行时和设施之间的协同,而非单颗更快芯片独自发挥作用。
NVIDIA 将这一策略称为极致协同设计。Vera Rubin NVL72 通过第六代 NVLink,在单一机架级域中整合 72 个 Rubin GPU 和 36 个 Vera CPU。
Rubin GPU 配备 288 GB HBM4 内存,内存带宽为每秒 22 TB。高带宽内存紧邻处理器,可比传统服务器内存更快地提供模型数据。
NVLink 为每个 GPU 提供每秒 3.6 TB 带宽,并在整个机架上提供每秒 260 TB 带宽。该互连结构让 72 个 GPU 的行为更像一个大型计算资源。
这种架构有利于混合专家模型。这类模型会为每个 token 激活选定的专家网络,而不是让每个操作都使用全部参数。
高效服务此类模型需要在处理器之间快速路由。专家之间转移激活值的延迟,可能会浪费规格表上看似出色的算力容量。
Rubin 还改进了分布式推理中使用的同步操作。更低的通信开销意味着处理器可将更多时间用于计算、更少时间用于等待协调。
NVIDIA 的 机架架构将 Rubin 与 ConnectX-9 网络、BlueField-4 数据处理单元、NVLink 交换机及 Spectrum-6 以太网平台结合在一起。
该公司在加入 Groq 3 LPU 后,现将这一更广泛的系统描述为七芯片架构。LPU 是一种专为可预测、低延迟语言模型执行而设计的处理器。
Rubin 负责计算密集型的上下文处理,也称为预填充(prefill)。采用 Groq 3 处理器构建的 LPX 机架则可专注于对延迟敏感的 token 生成,即解码(decode)。
这种分离被称为解耦式服务。它让运营商能够独立扩展预填充和解码资源,而不必强迫两个阶段使用完全相同的硬件。
Agent 工作负载使这种拆分颇具吸引力,因为其请求包含很长的输入历史,却可能要求快速的交互式输出。预填充需要内存容量和并行计算,而解码则更受益于低延迟。
随后,速率匹配会平衡两个资源池之间交换工作的速度。匹配不佳可能导致其中一组闲置,而另一组过载。
服务软件将这些组件连接起来。TensorRT-LLM 提供优化内核,而 NVIDIA Dynamo 则协调分布式资源上的推理。
AgentX 的结果表明,为何必须将软件视为产品的一部分。在某个测试端点上,使用 TensorRT-LLM 的 GB300 与使用 SGLang 的 GB300 之间的差距达到数十倍。
这并不意味着某一种引擎在所有情况下都更优。在所测试的速度区间内,GB300 表现最强的引擎有所变化:TensorRT-LLM 在一个目标下领先,而 SGLang 则在更高目标下领先。
Rubin 的早期结果出现在其软件栈尚未完全成熟之前。这带来了改进空间,但也引入了部署不确定性。
NVIDIA 表示,该平台已全面投产,计划于 2026 年下半年出货。该公司此前宣称,该平台每瓦推理性能最高可达 Blackwell 的十倍。
SemiAnalysis 发现,在运行区间附近,相比黄仁勋此前在 GTC 上展示的三倍示意,单位兆瓦吞吐量最高可提升至七倍。在某些匹配端点上,实测倍数还要高得多。
这在狭义上支持了“刻意保守”这一解读。黄仁勋的演示涵盖的是广泛的平台预期,而新结果则覆盖一种 Agent 工作负载和特定配置。
Rubin 的设计还着力应对供电配置问题。数据中心通常按机架可能达到的最大功耗来设计电力系统,即使推理工作负载很少持续消耗这一最大值。
NVIDIA DSX MaxLPS 通过动态功率分配,回收 GPU 和机架之间未被使用的余量。它试图在不超出设施功率上限的前提下,在同一站点容量内配置更多计算资源。
MaxLPS 文档描述了一个包含 400 块 GPU、功率为一兆瓦的推理部署示例。在该示例中,动态管理将 token 吞吐量提升至静态最大功率基线的 1.35 倍。
NVIDIA 表示,结合设施规划与功率控制,可在固定功率预算内支持最多 40% 更多 GPU。这是一项规划层面的主张,并非对每个站点的保证结果。
运营商必须验证其工作负载的实际功耗曲线、冷却能力、安全裕量及延迟影响。经常达到峰值功耗的集群,可回收的余量会更少。
因此,这一机制具有乘数效应。更快的 GPU、更宽的内存、更低延迟的互连、更好的调度、专用 CPU 以及动态功耗管理,分别消除了不同的瓶颈。
若这些层面协同运作,Rubin 就能让同一栋建筑产出更多有用 token。若其中一层无法随之扩展,理论增益会在到达客户之前缩水。
离开选定运行点后,67 倍主张便会缩水
该基准测试支持 Rubin 的领先地位,但也表明,为何最高性价比数字不应成为全机群规划的假设。
第一个限制在于选定的端点。在每秒 170 个 token 时,参与比较的 GB300 TensorRT-LLM 配置已接近其测得的交互性上限。
在接近这一边界时,速度目标的小幅提高就可能显著减少系统能够处理的流量。Rubin 仍保有未被利用的性能区间,因此形成了异常巨大的比率。
在同一目标下比较 Rubin 与 GB300 SGLang,单位兆瓦吞吐量优势从 62.9 倍降至 5.56 倍。这仍然很大,但讲述的是一个不同的采购故事。
第二个限制是总成本模型。SemiAnalysis 使用硬件、网络、电力、融资、托管、使用寿命及假设的超大规模云服务商采购条款来计算拥有成本。
规模较小的服务商将面临不同的融资、利用率和基础设施条件。云租户也会看到硬件性能与合约容量之间不同的关系。
每美元性能取决于设备保持繁忙。即使一款加速器拥有出色的峰值经济性,若需求到达并不均匀,或软件阻碍高利用率,其表现也可能令人失望。
第三个限制是工作负载范围。公开的 Rubin 结果聚焦于 DeepSeek V4 Pro 在 AgentX 编程 Agent 流量形态下的表现。
为更短提示词、图像生成、检索、视频、稠密模型或离线批处理任务提供服务的客户,将遇到不同的瓶颈。SemiAnalysis 自身也指出,Rubin 在离线批量推理和训练中的相对增益更小。
AgentX 同样使用合成负载。它保留长度、共享前缀、时序和分支结构,但无法保留私有会话的语义内容。
投机解码带来了一项特殊挑战。这项技术利用较小或更快的草稿模型来建议多个未来 token,再让主模型接受或拒绝它们。
合成文本可能产生不现实的接受行为。AgentX 通过使用从独立编程数据集中测得的接受长度,并记录这些设置来应对这一问题。
这种控制提高了可比性,但仍只是近似。该基准无法复现专有服务商模板、隐藏推理、服务端工具、图像或每一种分词器转换。
闭环执行又带来了另一层细微差别。更快的系统会在测试窗口内推进更多采样会话,因此可能遇到略有不同的请求组合。
这些问题都不会使结果失效。它们界定了结果所衡量的内容,以及买方应在哪些方面要求更多证据。
第四个限制是早期软件。SemiAnalysis 使用了预发布版本的 TensorRT-LLM,后续版本应会提升 Rubin 的效率。
早期软件也可能包含回归、不完整功能,以及不会在受控基准中出现的运行行为。成熟的 Blackwell 软件栈有更多时间吸收生产环境修复。
在机架规模下,可靠性至关重要。NVIDIA 表示,一套完整的 NVL72 机架包含 130 万个组件和近 1,300 颗芯片。
数据中心运营商需要持续的有效吞吐量,即扣除故障、维护、重试和不可用硬件后的有用输出。峰值基准吞吐量无法衡量完整的运营记录。
第五个限制是竞争对手的回应。AMD 于 2026 年 7 月为 Helios 机架级平台推出了 Instinct MI455X 加速器。
官方 MI455X 规格列出了 40.3 petaflops 的峰值 MXFP4 性能及 CDNA5 架构。峰值算术性能数据无法与 AgentX 结果直接比较。
SemiAnalysis 在新测量中纳入了上一代 MI355X。在每秒 100 个 token 时,测试中最强的 MI355X 配置达到每兆瓦约 201 万 token/秒。
Rubin 在该点达到 5,940 万,形成了报告中的 29.5 倍领先。SemiAnalysis 表示,AMD 已承诺合作开展未来的 MI455X AgentX 测试。
这一未来比较将远比 Rubin 对阵 MI355X 更具参考意义。它将以相同的工作负载、模型、流量形态和服务等级目标,测试两个当前的机架级平台。
Google 的 TPU7x Ironwood 同样面向大型稠密模型和混合专家模型。它通过 Google Cloud 提供服务,为客户提供了另一条将定制芯片与垂直整合软件平台结合的路径。
NVIDIA 在生态系统深度方面仍具优势。CUDA、TensorRT-LLM、Dynamo、NVLink 及其合作伙伴网络,让该公司掌控了更多部署路径。
这种控制有助于改善优化,但也可能加深客户对单一供应商的依赖。极致协同设计在买方接受整套技术栈时效果最佳。
可信的解读并非 Rubin 在任何地方都强 67 倍,而是 Rubin 扩展了可用的推理前沿,尤其适用于对交互性有严格要求的大型 Agent 工作负载。
每吉瓦更多 token 并不自动意味着更高利润
Rubin 可以改善数据中心经济性,但利润取决于利用率、需求、可靠性和基准测试无法确定的售价。
SemiAnalysis 估计,Rubin 每吉瓦的年利润可超过 Blackwell 的两倍。该机构预计,随着内核和服务软件逐步成熟,这一差距将进一步扩大。
这一估计遵循合理的机制。如果一兆瓦能够产出更多可计费 token,收入容量就会上升,而设施的电网配额保持不变。
更低的单位成本也可以扩大利润率,或支持更低的客户价格。服务商可以选择保留效率收益,也可以用它赢得更多需求。
不过,吞吐量代表的是产能,而非销售额。只有当客户以可持续的价格消费这些额外产能时,服务商才能获得更多收入。
需求曲线必须与硬件相匹配。Rubin 最显著的优势体现在长上下文、交互式 Agent 工作负载,而非所有形式的 AI 计算。
这带来了资源分配问题。服务商需要足够的 Agent 流量来保持新机架繁忙,同时避免转移那些在其他环境中运行更具经济性的工作负载。
模型效率同样可能降低每项任务的基础设施需求。更好的架构、更短的推理轨迹、改进的缓存和更小的专用模型,都可能减少 token 消耗。
相反的效果同样合理。更便宜的 token 可能鼓励开发者构建运行时间更长的 Agent、使用更多子 Agent,并自动化过去不具经济性的任务。
这正是计算领域常见的反弹效应。效率降低了一项操作的成本,随后软件扩张以消耗新增容量。
NVIDIA 正在大力押注这一结果。其叙事将数据中心视为 AI 工厂,产出的是 token,而非传统计算服务。
这一比喻也有局限。token 的价值差异很大。一个有助于完成编程任务的 token,比在失败推理循环中生成的 token 更有价值。
Agent 基准测试仍难以将基础设施效率与已完成的工作联系起来。AgentX 有意将模型行为排除在范围之外,也不评估输出质量。
完整的经济性测试应衡量每项成功任务的成本,而不仅仅是每百万 token 的成本。它还应包括模型准确性、重试、工具故障以及人工审查结果所需的投入。
延迟也会间接影响收入。更快的 Agent 可以完成更多任务并保持用户参与度,但前提是应用程序和外部工具能以相近速度响应。
据报道,Rubin 的端到端延迟结果令人鼓舞。在一个所有权效率相当的对比点上,SemiAnalysis 测得 Rubin 约为 20 秒,而 B200 或 B300 约为 60 秒。
在更高吞吐量成本效率的对比点上,该机构报告 Rubin 约为 20 秒,而参与比较的 Blackwell 系统约为 120 秒。
这些测量结果强化了 Rubin 的竞争力,因为它同时实现了更高吞吐量和更短完成时间。不过,它们仍是特定配置下的基准测试结果。
盈利能力也取决于部署速度。无论预期效率有多高,延迟交付的机架都不会产出任何 token。
NVIDIA 围绕第三代 MGX 机架规格设计了 Rubin,以简化安装和维护。计算托盘采用无缆、无软管、无风扇的内部设计。
该公司称,托盘组装和维护时间已从接近两小时缩短至五分钟。实际现场经验仍需证明,这些设计变化是否能提高整套设备的可用性。
散热和功率密度仍是设施层面的重要考量。Rubin 将大量电力需求集中于单个机架,因此需要兼容的液冷和配电系统。
使用老旧设施的运营商无法仅通过更换服务器获得这一收益。他们可能还需要新的电气设备、冷却液分配系统、网络设备和运营流程。
这使 Rubin 对已经在建设新 AI 园区的超大规模云服务商、模型实验室和专业云服务提供商最具吸引力。较小规模的买家或许能通过云服务更高效地使用它。
“买得越多,赚得越多”是对 NVIDIA 销售论点的一个好记概括,但它并非经济规律。
更准确的说法是有条件的:运营商部署、填满、供电并持续保持可用的高效算力越多,这一固定站点所能支撑的收入就越高。
NVIDIA Vera Rubin NVL72 结果公布后,买家应关注什么
三个信号将决定 Rubin 早期的基准领先是否会转化为持久的生产优势。
第一个信号,是在不同推理服务引擎上可由独立方复现的 AgentX 数据。Rubin 需要公布基于相同模型和服务等级目标、使用 TensorRT-LLM、SGLang 和 vLLM 的结果。
这一比较将表明,当前领先优势中有多少来自 Rubin 硬件,又有多少来自异常有利的软件组合。
随着运行时环境不断改进,历史结果也应继续保持可见。否则,买家无法区分真正的硬件增益,与同样会让旧系统受益的软件变化。
由云服务提供商进行复现将进一步增强说服力。他们的部署包含调度、网络、监控、多租户和可靠性约束,而这些因素在受控测试环境中并不存在。
如果 Rubin 在不同引擎和运营商之间都保持显著优势,67x 这一端点就会显得是更广泛变革中的一个极端案例。如果差距大幅收窄,软件选择将是主导因素。
第二个信号,是 MI455X 和 TPU7x 在相同 AgentX 工作负载上的表现。当前比较将 Rubin 与处于不同产品周期、或采用不同基准方法的加速器混在一起。
AMD 的 Helios 平台是最直接的挑战者,因为它整合了当代 GPU、CPU、网络和机架级系统集成。一次条件匹配的测试将揭示,NVIDIA 的软件栈是否仍是其决定性优势。
TPU7x 提供了另一条竞争路径。Google 控制加速器、编译器、云服务以及部分模型栈,因此拥有自身形式的协同设计能力。
如果任一竞争对手在具备实用交互性的前提下接近 Rubin 的每兆瓦性能,买家将获得更强的议价能力和更多架构选择。若 Rubin 保持显著领先,则将进一步巩固 NVIDIA 对智能体基础设施的控制力。
第三个信号,是计入利用率和可靠性后的生产经济性。买家应追踪持续有效吞吐量、首 token 时间、端到端延迟、功耗、故障率以及每项完成任务的成本。
他们还应将峰值交互性能与真实客户使用的区间区分开来。每秒 60 至 100 token 的区间,其商业意义可能大于一个令人印象深刻的端点数据。
DSX MaxLPS 也值得接受类似审视。只有当系统在不损害延迟或设备寿命的情况下遵守场地限制时,在固定功率范围内运行更多 GPU 才有价值。
经过验证的 40% 密度提升将放大 Rubin 的硬件优势。较低的现场结果则会削弱预期中的每吉瓦利润提升。
开发者应当关注,因为基础设施经济性最终会塑造产品设计。更低的智能体服务成本可以支持更长的会话、更多检索,以及更多并行子智能体。
知识工作者会间接感受到这种变化。更快、更便宜的智能体能够处理更庞大的项目历史,但有价值的输出仍取决于可信的源材料。
维护良好的个人知识库可以提供这种上下文,而不是将更多生成 token 视为更好证据的替代品。
早期结论已经明确,但仍有边界:NVIDIA Vera Rubin NVL72 已展现出显著的智能体推理领先优势,而 Jensen Huang 先前的预测似乎偏于保守。
67x 这一数字位于曲线边缘,并非其平均水平。在常见运行区间内,实际收益更接近两倍或三倍;在更严格的交互性目标下,优势会更大。
这依然足以给所有主要 AI 基础设施提供商带来压力。下一个问题是,当基准测试变成实际部署、token 必须转化为已完成工作时,Rubin 能否保持这些经济优势。



