随着官方 EPYC 成绩挑战 Vera 领先地位,AMD 与 Nvidia 的基准测试之争收窄
NVIDIA 在部分比较中将 Vera 描绘为快出多达 50%,但当官方 EPYC Turin 成绩被纳入计算后,AMD 与 Nvidia 的基准测试之争出现了变化。
在 NVIDIA 2026 年 7 月发布的 Vera CPU 资料中,这家公司将其新的 88 核处理器与 AMD 的 128 核 EPYC 9755 进行比较。不过,NVIDIA 对 Vera 使用了内部测试数据,对 AMD 系统则采用预估成绩。ServeTheHome 以公开发布的 SPEC CPU 2026 数据替换了 AMD 的预估值,发现双方差距要小得多。
这种校准并不意味着 Vera 是一款性能较弱的处理器。它改变了买家应当提出的问题。Vera 在部分每核性能比较中似乎仍占优,而 AMD 在单插槽总吞吐量方面仍保有更强选择。真正的分歧在于厂商所选择的叙事框架,与依据实际工作负载作出的采购决策之间。
纳入官方 AMD 成绩后,NVIDIA 的 Vera 数据呈现出不同面貌
最重要的变化并非出现了一项新的处理器成绩,而是获得了一个更可靠的基准,以解读 NVIDIA 现有的主张。
NVIDIA 于 7 月 21 日发布了 Vera 的新架构细节和内部 SPEC CPU 2026 测试数据。SPEC CPU 2026 是一组标准化处理器工作负载,用于比较不同系统的计算性能。该公司围绕 agentic AI 定位这些结果;在此类场景中,CPU 负责代码执行、检索、编排、数据库及 GPU 推理周边的其他任务。
Vera 采用 88 个定制 Olympus 核心,并通过 NVIDIA Spatial Multithreading 支持 176 个硬件线程。NVIDIA 报告了双路 SPECrate 2026 整数基础分数 925。SPECrate 通过运行多个工作负载副本来衡量吞吐量,因此对核心数量、内存行为、编译器选择和系统配置较为敏感。
NVIDIA 白皮书中的比较对象是 AMD 的 EPYC 9755,这是一款于 2024 年推出的 128 核 Turin 处理器。NVIDIA 对竞争 AMD 系统的性能进行了预估,而没有采用这款处理器最强的已公开、经评审的 SPEC 提交结果。
这一选择很重要。根据后续的基准校准分析,一套公开发布的双路 EPYC 9755 系统在官方 SPEC 成绩中录得 1,070 的 SPECrate 2026 整数基础分数。NVIDIA 的预估值比这一经评审的成绩低约 16%。
官方分数也让比较呈现出一个出人意料的位置。Vera 报告的 925 分,在总整数吞吐量上落后于双路 EPYC 9755 系统的 1,070 分。NVIDIA 的核心数量仍较少,因此这一结果支持其每核性能论点。但它并不支持“Vera 在所有重要意义上都是更快处理器”这样简单的结论。
NVIDIA 的图表强调了相对于预估 AMD 基线的比率。一旦以官方成绩取代该预估,处理器之间表面上的差距便会缩小。ServeTheHome 计算认为,在这一比较中,Vera 每核约可达到 5.3 分。AMD 面向性能的 EPYC 9575F 每核约为 4.8 至 5.0 分。
这意味着,与 AMD 的高频 Turin 选项相比,Vera 预估的每核优势约为 6% 至 10%。这与暗示其优势达到 50% 或更高的比较存在显著差异。
这种区别是 AMD 与 Nvidia 讨论的核心。一款处理器可以在每核性能上领先,同时在每插槽性能上落后。它也可以在特定的延迟敏感型任务中领先,却为并行服务提供更低吞吐量。每一种表述都可能准确,但没有一种能够完整描述采购决策。
NVIDIA 尚未将 Vera 的数据作为独立评审的 SPEC 成绩提交。其 7 月测试数据仍属于公司内部数据。这并不意味着该数字无效,但它与已公开的 SPEC 提交结果属于不同的证据类别。
因此,经校准的结果构成了本文的核心张力。NVIDIA 看起来打造了一款具有强大单核性能、颇具竞争力的 Arm 服务器 CPU。但其营销比较让这一优势显得比现有经评审数据所支持的范围更广。
AMD 与 Nvidia 的比较取决于买家看重哪种单位
当比较单位是活跃核心时,Vera 的表现最强;而当比较单位是面向吞吐量的完整插槽时,EPYC 看起来更具优势。
NVIDIA 围绕一种特定的 agentic computing 理念设计 Vera。一个 AI agent 做的不只是生成 token。它可能检索上下文、执行 Python 代码、查询数据库、调用外部服务、检查结果,然后重复这一循环。
其中许多步骤是串行的。即使系统其他位置还有数百项任务在运行,一次缓慢的工具调用也可能拖住整个响应。NVIDIA 认为,满载时的强单线程性能——即插槽繁忙时每个线程的速度——因此应获得更高权重。
该公司的 Vera architecture details 描述了一种宽发射、乱序执行的 Olympus 核心。乱序执行允许处理器重排彼此独立的操作,而不是等待每条指令按顺序完成。
Olympus 包含 10 宽解码引擎、先进的分支预测,以及用于处理复杂分支模式的神经预测器。这些特性面向解释器、编译器、agent 运行时、图软件,以及其他控制流不规则的代码。
这是一个连贯的设计目标,也解释了 NVIDIA 为何偏好每核或每线程的观察视角。如果一个 agent 的进展取决于一条分支密集的执行路径,增加更多速度较慢的核心未必能降低该路径的延迟。
AMD 的 Turin 产品组合面向更广泛的服务器角色而设计,包含针对高频率、均衡性能和最大核心密度优化的型号。仅以一款 EPYC 型号与 Vera 比较,掩盖了 AMD 自身产品线内部的这些差异。
EPYC 9575F 是一个尤为重要的对照项。它拥有 64 个 Zen 5 核心,最高加速频率为 5.0 GHz,默认热设计功耗为 400 瓦。AMD 将其定位于重视高每核速度的工作负载,包括加速器旁的主机处理。
EPYC 9755 则采取另一条路线。其 128 个核心提升了总体并行吞吐量,但每个核心获得的插槽功耗和内存资源份额更少。这使其并非围绕单线程性能主张的完美参照对象。
EPYC 9965 则更进一步地偏向密度。AMD 的 EPYC specifications 列出其拥有 192 个核心、384 个线程、384 MB L3 缓存,以及 500 瓦默认热设计功耗。一套采用该处理器的公开双路系统已达到 1,230 的 SPECrate 2026 整数基础分数。
这一系统级成绩超过了 Vera 报告的 925 分和 EPYC 9755 的成绩。它并不意味着每个 9965 核心都更快,而是说明单一比率无法决定整个产品组合的比较结果。
运行数千项小型 Web 服务的云服务商,可能看重每个机架完成的请求数量。提供交互式 agents 的平台,可能看重每个沙箱的稳定延迟。数据库买家可能在意按核心计费的软件授权。AI 系统构建者则可能更在意让昂贵 GPU 持续获得工作负载。
每个买家衡量的经济单位都不同。处理器、插槽、节点、机架、已授权核心和已完成的 agent 任务并不能相互替代。
这给两家公司都带来了压力。NVIDIA 必须证明,其每核性能提升改善的是完整的 agent 工作负载,而不只是经过选择的 CPU 基准测试。AMD 则必须证明,其更高的核心密度不会在 NVIDIA 所强调的不规则工作负载下引入延迟或内存瓶颈。
这一结果比宣称某家厂商获胜更有价值。它指出了架构如何转化为运营经济效益。买家需要先选择与其服务相匹配的衡量单位,再选择基准测试。
内存带宽让 Vera 的领先真实存在,但也具有条件性
Vera 的内存系统是一项显著的架构优势,但其中一部分优势来自更新一代的内存技术和较少的核心数量。
Vera 将 88 个 Olympus 核心与最高每秒 1.2 TB 的 LPDDR5X 内存带宽结合。根据其架构资料,NVIDIA 使用运行在 9,600 MT/s 的 SOCAMM2 模块。这种带宽有助于处理解释器、数据库、检索系统和并发 agent 沙箱所产生的大量内存访问。
AMD EPYC Turin 支持 12 个 DDR5 内存通道。EPYC 9965 产品页面列出的内存速度最高为 6,400 MT/s,插槽带宽为每秒 614 GB。EPYC 9755 使用同一代内存接口。
因此,在插槽层面,Vera 提供的峰值内存带宽接近 Turin 的两倍。在核心层面,这一差异更大,因为 Vera 将带宽分配给 88 个核心,而 128 核或 192 核的 EPYC 处理器则将较少的总带宽分给更多核心。
NVIDIA 表示,在其选定的比较中,Vera 提供了传统 x86 服务器处理器三倍以上的每核内存带宽。当 Vera 与高核心数 Turin 型号进行比较时,这种表述在数学上是合理的。不过,这一结果混合了架构、内存速度、通道设计和核心数量等因素。
ServeTheHome 指出,插槽带宽比较中相当大的一部分反映了内存代际差异。Turin 于 2024 年 10 月上市,支持 DDR5-6400。Vera 系统计划在 2026 年下半年推出,并采用更快的 LPDDR5X 内存。
这并不会抹去 Vera 的优势。NVIDIA 有意作出了一项架构选择:将更多内存带宽配给数量较少、性能更强的核心。但这意味着,该比较不应被解读为对核心设计的纯粹衡量。
内存容量带来了另一项取舍。NVIDIA 早期的 Vera 测试系统包含 8 个 96 GB 模块,提供 768 GB 容量。EPYC 平台可以支持大得多的内存容量,这对于数据库、分析、虚拟化以及大型 GPU 集群周边由 CPU 承载的数据而言可能很重要。
延迟也不只取决于原始带宽。Vera 使用单片计算 die、统一缓存和 NVIDIA 的 Scalable Coherency Fabric。NVIDIA 表示,该互连可提供每秒 3.4 TB 的 die 内带宽,并在双路系统中支持单一 NUMA 域。
NUMA,即非统一内存访问,描述的是内存访问时间取决于数据归属于哪个处理器或 chiplet 的系统。如果软件未能妥善地在 NUMA 域之间放置内存,便可能遭遇不可预测的延迟。
AMD 的高核心数 EPYC 处理器采用 chiplet。chiplet 让 AMD 能够以较低成本组装大量核心,但计算 die 之间的通信需要经过 I/O die 和互连。这种设计可能会对某些跨 die 访问模式施加延迟惩罚。
NVIDIA 正利用这一对比论证 Vera 能在并发负载下提供可预测的延迟。对于 agent 工作负载而言,可预测性可能与平均速度同样重要。一次延迟的工具执行,就可能拉长用户实际感受到的响应时间。
尽管如此,相关测试并非只看峰值带宽。工作负载必须产生足够多的有效内存流量,才能从中受益。软件还需要具备足够的并行度,以及能够对内存子系统形成压力的工作集。
一些编译、加密和分支密集型工作负载仍受限于核心执行能力。其他数据库和分析类工作负载则可能对容量、缓存行为或存储访问更为敏感。峰值带宽无法预测所有结果。
编译器同样可能改变结果。NVIDIA 的内部 SPEC 测试在多项对比中使用了 LLVM 和 Clang,而 AMD 公布的结果通常使用 GCC。编译器优化会影响调度、向量化、代码布局和库的选择。
因此,有效的采购对比应尽可能保持编译器和软件栈一致。如果买方计划部署由 GCC 构建的软件,Clang 的优势可能根本不会显现。如果软件能够在不产生兼容性问题的前提下迁移到更快的编译器,那么排除这一选项同样会扭曲结果。
Vera 的内存系统增强了 NVIDIA 针对 agentic 工作负载的论据。但这并不自动意味着它会在所有服务中形成固定优势。实际收益必须经受应用代码、编译器选择、数据放置以及完整系统测试的检验。
NVIDIA Vera 基准测试仍未证明什么
现有证据表明 Vera 具备竞争力,但尚不足以证明它在 AMD EPYC Turin 面前拥有普遍领先优势。
第一个限制在于验证。NVIDIA 对 2026 年 7 月 SPEC CPU 结果进行了内部测量。该公司在白皮书中披露了配置,但该结果尚未像 SPEC 数据库中已提交的 AMD 分数那样接受公开审查。
这一差别尤为重要,因为 NVIDIA 同时选择了对比处理器和归一化方法。供应商可以遵守基准测试规则,同时仍采用有利于自身产品的呈现方式。
第二个限制在于工作负载选择。SPEC CPU 提供了一种受控的处理器行为对比方式,但它并不是一个 agent 平台。它并不衡量包含检索、代码执行、网络、数据库、模型推理和 GPU 调度在内的完整流程。
NVIDIA 的主张最终指向 AI 工厂。该公司认为,更快的 CPU 端处理能够让 GPU 保持忙碌,并改善端到端的 agent 响应速度。CPU 吞吐量分数是这一主张的支持性证据,而非对其的直接衡量。
第三个限制在于平台访问。Phoronix 在 Vera 系统广泛上市前,于 NVIDIA 位于 Santa Clara 的设施中测试了 Vera。其独立 Linux 测试涵盖 Vera、Grace、多种 AMD EPYC 配置及 Intel Xeon 系统。
这些结果对 NVIDIA 而言颇具鼓舞性。Vera 在部分编译、代码和服务器工作负载中展现出强劲性能。在所选测试中,它与多款 x86 处理器竞争激烈,或超过其中一些产品。
不过,NVIDIA 控制了允许使用的基准测试集,并且仅提供了有限的测试时间。Phoronix 明确将该套件描述为本次测试期间获准运行的工作负载。独立测试人员尚无法运行所有应用、大幅调整固件,或在自己的实验室中复现该平台。
第四个限制在于功耗测量。Vera 的测试配置峰值处理器功耗目标为 450 瓦。参与对比的 AMD 处理器范围为 300 瓦至 500 瓦。处理器热设计功耗并不等于整机节点功耗,不同的内存技术也会改变平台的平衡。
公平的能效对比需要在相同工作负载下测量完整系统的墙插功耗。它还需要同时衡量吞吐量、延迟和能耗。将标题分数除以标称处理器功耗,仍会留下过多尚未厘清的平台变量。
第五个限制在于软件兼容性。Vera 使用 Arm 指令集,而 AMD EPYC 使用 x86-64。Linux 和许多云端应用支持两者,但企业仍在运行面向 x86 编译的原生扩展、专有 agent、安全软件和运维工具。
迁移阻力会有所不同。容器化的开源服务可能较易迁移。较老的商业软件则可能需要供应商认证或代码改动。处理器可以赢得基准测试,却仍可能因软件支持延迟上线而输掉部署机会。
第六个限制在于对比时点。Vera 的推出时间比 Turin 晚约两年。NVIDIA 的白皮书发布时,AMD 正准备讨论下一代 EPYC Venice 产品线,因此 Turin 是即将退出的对比对象,而非同期架构。
与已上市处理器进行比较是合理的。买方现在可以购买 Turin 系统,而 Vera 计划于 2026 年下半年上市。然而,长期架构主张也应与将在 Vera 主要部署窗口期间参与竞争的硬件进行测试。
AMD 已表示,Venice 将扩展至 16 个内存通道并提高插槽带宽。该公司早期预测还强调了更高的机架密度和吞吐量。这些主张同样需要像 NVIDIA 的内部 Vera 数据一样谨慎看待。
AMD 公布的机架方法论估算了在 100 kW 机架限制下的性能。它预测 EPYC 9965 在六项工作负载中相较 Vera 具有优势,Venice 则会拥有更大的领先幅度。
不过,AMD 是通过按 Grace 的结果缩放来估算 Vera 性能,同时还估算了未来 Venice 对比中的部分数据。这种方法是以 AMD 有利的呈现方式回应 NVIDIA 有利的呈现方式。两家厂商的模型都无法替代在已上市系统上的匹配测试。
正确的怀疑立场应当是对称的。NVIDIA 的图表不应被视为广泛领先的证明。AMD 的机架预测也不应被视为 Vera 会在已部署 AI 基础设施中全面落败的证明。
两家公司都在选择最能凸显自身设计优势的层级。NVIDIA 强调单核进步、内存带宽和延迟。AMD 强调在机架功耗限制下可获得的总吞吐量、密度和核心数量。
买方应将这些叙事视为可检验的假设。决定性数据必须来自可复现的系统,并运行接近目标服务的软件。
真正的竞争是 Agent 延迟与机架吞吐量之争
AMD 与 NVIDIA 的竞争正演变为:究竟哪种性能单位定义 AI 数据中心的经济性。
NVIDIA 的战略以 GPU 为起点。Vera 是 Vera Rubin 平台的一部分,在这个平台中,CPU、GPU、互连、网络和软件栈均经过协同设计。CPU 的职责是消除昂贵加速器周围的延迟。
这使得单线程进展具有战略价值。如果更快的 CPU 步骤能减少 GPU 空闲时间,Vera 创造的价值就可能超出其自身基准分数。NVIDIA 还可以利用 NVLink-C2C 一致性,将 CPU 与平台其余部分紧密连接。
AMD 则从更广泛的服务器基础出发。EPYC 服务于云实例、数据库、分析、虚拟化、存储、高性能计算和 GPU 主机。其高核心数量让运营商能够将更多工作负载整合到每个插槽或机架中。
对许多服务而言,聚合吞吐量仍占主导地位。Web 服务器、键值存储、批处理分析、虚拟机和容器平台可以将工作分散到数百个核心上。每个机架完成更多任务,可能比单个核心性能略低更重要。
这两种战略在 agentic AI 中有所交汇,因为 agent 平台同时需要这两种特质。它们需要快速的串行步骤来保证面向用户的响应速度,也需要在大量用户、工具和环境同时运行时具备海量并发能力。
小型交互式部署可能更青睐 Vera 的设计。设想一个 agent:它编辑代码、启动沙箱、编译项目、读取错误信息,然后再次尝试。更快的分支密集型处理和编译能够缩短每一个循环。
大型云平台则可能得出不同结论。它可能同时运行数千个 agent,以及数据库、检索服务、安全过滤器和不相关的客户工作负载。更高的插槽吞吐量和内存容量可以提升整个集群的利用率。
许可模式也可能再次逆转经济性。一些企业软件按处理器核心授权。以更少核心获得更强性能,可能减少所需许可数量。没有按核心收费的开源服务,则可能更看重最大核心密度。
架构只是决策的一部分。采购关系、系统可用性、固件成熟度、虚拟化支持和运维熟悉程度也会影响部署。AMD 拥有成熟的 x86 服务器基础,而 Vera 则以较新的 Arm 平台进入市场。
NVIDIA 还通过平台整合拥有另一项优势。已经在采购 Rubin 系统的组织,可能更倾向于选择为该机架设计的 CPU,尤其是在管理工具和性能调优能够以一体化方案交付时。即使单独的 CPU 基准测试仍然接近,也可能做出这一决策。
AMD 则可以通过灵活性应对。EPYC 系统支持来自多家供应商的加速器,并适配成熟的服务器配置。担心平台集中化的买方,可能会独立于基准测试领先优势之外看重这一选择。
这正是归一化结果的重要性所在。所谓 50% 的处理器优势,可能会让讨论尚未开始便告结束。6% 至 10% 的单核领先则会带来更现实的评估。
在这一较小差距下,内存容量、总吞吐量、软件兼容性、机架功耗和平台整合都可能决定结果。比较会从胜利图表变成采购问题。
Vera 仍值得关注。NVIDIA 围绕一种新兴工作负载设计了其首个自研 Arm 核心,并且似乎实现了具有竞争力的服务器性能。在成熟 x86 架构受益于数十年优化的市场中,这一点意义重大。
AMD 也拥有可信的回应。Turin 经审查的结果表明,其当前处理器仍具竞争力,同时产品组合提供不同的核心数量和频率选择。买方并不局限于 NVIDIA 白皮书所选的那一款 EPYC SKU。
市场压力不止波及这两家公司。Intel 必须在 AMD 的密度优势和 NVIDIA 垂直整合的 AI 平台面前捍卫 Xeon。Arm 服务器供应商如今也必须与由主导加速器供应商支持的 NVIDIA 自研核心竞争。
不过,核心竞争仍是 NVIDIA 的单核 agent 战略与 AMD 的插槽和机架吞吐量战略之争。其他供应商提供了背景,但并未定义这些结果所带来的核心决策。
三个信号将决定 Vera 的领先地位能否保持
下一阶段需要可复现的平台证据、匹配的应用测试,以及与 AMD 当前一代产品的直接竞争。
第一个信号是向 SPEC CPU 2026 数据库提交经过审查的 Vera 成绩。NVIDIA 报告的 925 分提供了一个有用起点,但独立审查将确认基准测试配置,并在 AMD 公布结果旁建立一致的记录。
若经审查的结果接近 925 分,将强化归一化后的结论。它将确认 Vera 能够提供出色的单核性能,同时在总吞吐量上落后于核心数更高的 Turin 系统。若分数存在实质差异,则需要重新计算对比结果。
第二个信号是可在普遍可用的 Vera 系统上进行不受限制的测试。评测者需要获得足够访问权限,以修改编译器、固件设置、内存放置、线程数量和软件版本。他们还需要在墙插端测量功耗。
最有价值的测试将覆盖完整的智能体循环,包括检索、沙箱创建、代码执行、编译、数据库访问、网络调用和 GPU 协调。结果应报告中位延迟、尾延迟、吞吐量、能耗以及加速器利用率。
如果 Vera 在这些工作流中仍能保持优势,NVIDIA 的架构论点将更具说服力。若这一领先优势在特定基准测试之外消失,这份白皮书就更像是狭窄的产品定位宣传。
第三个信号是将 Vera 与 AMD EPYC Venice 进行条件一致的对比。Turin 目前已可用,但 Venice 将在 Vera 商业生命周期的大部分时间里与其竞争。对比应采用相同的编译器、操作系统、工作负载版本、功耗限制和节点配置。
该测试必须区分每核、每插槽和每机架的结果。将它们合并为一个数字,会重演引发此次争论的表述问题。
如果 Venice 在每核智能体工作负载中获胜,将削弱 NVIDIA 的核心论点。如果 Vera 在端到端延迟方面胜出,尤其是在更低节点功耗下,则将验证 NVIDIA 优先采用更少但更强的核心和更高带宽的决定。
对基础设施采购方而言,实际行动很直接。在双方运行相同工作负载之前,应将 NVIDIA 对 Vera 的主张与 AMD 的回应分列记录。注明每个数字是实测、估算、提交结果,还是经过独立审查。
然后选择与服务相对应的衡量单位。交互式智能体平台应衡量已完成的智能体步骤数和尾延迟。云端集群应衡量每机架的有效吞吐量。采用授权模式的数据库应衡量每个付费核心的性能。
AMD 与 NVIDIA 的基准测试之争,已经提出了比原始图表更好的问题。Vera 的每核领先优势能否经受独立审查?这一领先能否缩短完整智能体的响应时间?AMD 更高的密度能否在相同功耗范围内完成更多有效工作?
这三个答案,而非厂商自行挑选的比率,才应决定下一次服务器采购。



