AMD EPYC Venice 基准测试挑战 Nvidia,但脚注值得关注
AMD 发布了详细的 AMD EPYC Venice 基准测试,声称其 256 核服务器 CPU 的整数吞吐量超过 Nvidia Vera 的两倍。
该公司还表示,一款 96 核高频 Venice 处理器的单核性能比 Nvidia 的 88 核 CPU 高约 20%。这些说法进一步强化了 AMD 在 2026 年 7 月发布第六代 EPYC 产品家族时提出的竞争论点。
这些亮眼数字为 AMD 回应 Nvidia 围绕智能体 AI 重塑数据中心 CPU 的尝试提供了有力依据。不过,AMD 将相关 SPEC CPU 2026 数据标注为内部预估,而非独立发布的结果。
这一差异决定了事件的真正重点。AMD 正在从总吞吐量、单核速度、内存带宽和 AI 基础设施设计等方面挑战 Nvidia。与此同时,Nvidia 认为,相比核心数量或汇总基准测试分数,完成的 AI 会话更具意义。
AMD 新基准测试数据究竟声称了什么
AMD 最新披露的信息,将一项宽泛的性能承诺转化为多项具体且可验证的说法。
核心比较采用 SPECrate 2026 Integer Base。该基准测试通过在系统中运行多个整数工作负载实例来衡量吞吐量。
AMD 预估,双路 EPYC 9996 系统的分数为 2,070。该处理器每个插槽配备 256 个 Zen 6c 核心,因此受测服务器拥有 512 个物理核心。
对于双路 Nvidia Vera 系统,AMD 列出的预估分数为 925。每颗 Vera 处理器包含 88 个定制 Arm 核心,构成一台拥有 176 核的服务器配置。
这些数字使 EPYC 9996 的预估整数吞吐量达到 Vera 的约 2.24 倍。AMD 将这一结果描述为性能约高出 2.2 倍。
这一比较有利于 AMD 核心密度最高的设计,但并非逐核心对决。双路 EPYC 9996 机器的物理核心数量接近 Vera 系统的三倍。
因此,AMD 还公布了另一项涉及其 96 核高频 Venice 处理器的比较。其预估显示,该双路系统的分数为 1,210,而 Vera 为 925。
由此计算出的单核分数,Venice 为 6.3,Vera 为 5.3。AMD 将其表述为 Venice 的单核性能约为 Vera 的 1.2 倍。
根据 AMD 的披露,这项特定比较中的两款处理器均使用 GCC 15.2。这个细节很重要,因为编译器版本和优化设置可能会对 CPU 基准测试结果产生实质影响。
最新数据也进一步明确了 AMD 的代际叙事。据称,在同一吞吐量比较中,256 核 EPYC 9996 的得分比 192 核 EPYC 9965 高约 78%。
这一提升并非仅来自架构。Venice 在从 Zen 5 过渡至 Zen 6 的同时,也提高了核心密度、内存能力和平台功耗。
AMD 的服务器 CPU 概览将所有 SPEC CPU 2026 数字标注为初步工程预测。该公司表示,这些预估结果仍可能发生变化。
预估值与已提交结果之间的区别至关重要。SPEC 允许使用预估性能指标,但要求厂商将其明确标注为预估值。
目前,没有经独立审查的 SPEC 提交结果能够确定 AMD 与 Nvidia 之间的胜负。新数据比 AMD 先前的说法更详细,但仍属于厂商预测。
因此,这些 AMD EPYC Venice 基准测试作为竞争意图的表态具有参考价值,但并不能构成对已交付系统的最终裁决。
为什么 AMD EPYC Venice 基准测试让 Nvidia 承压
AMD 正在挑战这样一种理念:Nvidia 应同时掌控 AI 服务器的加速器和主机处理器层。
Nvidia 围绕 GPU、网络和日益集成的软件栈建立了其数据中心地位。Vera 将这一战略延伸至通用 CPU 市场。
这款 88 核 Arm 处理器旨在配合 Nvidia Rubin 一代加速器使用。它也让 Nvidia 能够更好地控制内存行为、数据移动和系统级优化。
AMD 的商业利益则不同。它希望云服务商和企业继续将主机 CPU 视为独立的采购决策。
一项可信的 Venice 优势将有助于保留这种选择。它还能让 AMD 将 EPYC 处理器销售至采用多家厂商加速器构建的服务器中。
这正是 AMD 强调模型训练和推理以外工作负载的原因。AI 系统还需要路由请求、检索文档、查询数据库、执行代码、调用 API 并管理存储。
这些环节通常运行在 CPU 上。即使 GPU 执行模型的主要推理步骤,它们也可能决定总体响应时间。
AMD 将智能体 AI 描述为需求快速变化的系统级工作负载。其测试涵盖 Web 服务、检索、数据库、工具执行和响应处理。
该公司的 256 核战略瞄准了这些服务之间的并行工作。更多核心可以支持更多请求、隔离运行时环境、数据库事务或同时进行的工具调用。
高频 96 核设计则回应了另一项顾虑。它试图为无法高效分布到数百个核心上的任务保留单核速度。
因此,AMD 的产品组合从两个方向挑战 Nvidia。EPYC 9996 强调吞吐量,而高频型号则面向对延迟敏感的执行任务。
平台规格进一步强化了这一主张。根据 AMD 的Zen 6 平台详情,EPYC 9006 每个插槽最多支持 256 核和 512 线程。
它还支持 16 个 DDR5 内存通道、速率为每秒 12,800 兆传输的 MRDIMMs,以及 PCIe 6 连接。AMD 声称每个插槽的内存带宽最高可达每秒 1.6 TB。
Vera 通过 SOCAMM2 模块采用八通道 LPDDR5X 内存。Nvidia 标注的带宽约为每秒 1.2 TB。
内存容量、延迟、功耗和带宽并不能归结为单一规格。不过,AMD 的带宽主张削弱了这样一种观点:传统服务器 CPU 必须在这一类别中向 Nvidia 让步。
AMD 还拥有基于熟悉度的部署优势。EPYC 使用的 x86 软件环境,已广泛存在于企业和云基础设施中。
Vera 将 Arm 平台带入以 x86 为中心的软件验证、监控、虚拟化和采购流程环境。Arm 的采用规模可观,但迁移成本因工作负载而异。
Nvidia 可以通过高度集成的机架系统抵消这种阻力。购买完整 Nvidia AI 平台的客户,可能更看重统一的软硬件,而非 CPU 的可互换性。
AMD 押注许多买家会抵制这种整合。EPYC Venice 的性能叙事为他们保持 CPU 层开放提供了技术理由。
核心密度与 Nvidia 的关键路径论点相遇
核心分歧并不只是 AMD 与 Nvidia 之争;它关乎哪种 CPU 行为决定 AI 基础设施的实际效用性能。
AMD 将并发性视为智能体系统的决定性需求。一次用户请求可能会生成检索操作、数据库查找、策略检查、代码执行和独立子智能体。
这些操作会造成并行工作的突发高峰。高核心数 CPU 可以吸收更多此类工作,而无需将每项服务都部署到单独的机器上。
Nvidia 则关注这些高峰之间的顺序依赖关系。在所需工具调用或子任务返回之前,智能体无法进入下一步。
这条等待链就是关键路径,即决定总体完成时间的执行序列。即便系统仍有闲置的并行能力,更快的单线程也能缩短这条路径。
Nvidia 自己的Vera 性能论证声称,在四项选定的面向智能体测试中,该处理器的单核性能达到 Venice 的 1.5 倍。
这些测试包括编译器、静态分析、Python 和对内存敏感的工作负载。Nvidia 将 Vera 与 AMD 的高密度 256 核 EPYC 9996 进行比较,而非 96 核高频 Venice 型号。
AMD 选择了不同的比较方式。其最有力的单核性能主张,是在完整 SPECrate Integer 套件中将高频 96 核 Venice 配置与 Vera 对比。
两家厂商都选择了支持自身架构叙事的工作负载和竞争处理器。Nvidia 针对 AMD 的高密度旗舰产品,而 AMD 则以频率优化型号回应。
这并不会自动否定任何一方的分析。服务器处理器针对不同运行点设计,客户也经常在同一产品家族内比较多个型号。
不过,这些选择使得“某一 CPU 的单核性能普遍更好”无法得到简单结论。答案会随 Venice 型号和工作负载集合而变化。
总吞吐量也存在类似复杂性。EPYC 9996 在 AMD 的预估中胜出,部分原因在于它在每个插槽中配置了 256 个核心。
当软件能够让这些核心持续繁忙时,这种密度具有实际价值。当应用依赖于少量快速线程时,其意义则较小。
数据库集群、Web 服务集群或沙箱服务通常可以利用广泛的并行能力。串行编排阶段则可能对每线程延迟更敏感。
许多生产系统同时包含这两种模式。请求会并发到达,但每个请求也包含必须按顺序运行的步骤。
这种混合行为使集群经济性比单一峰值分数更重要。买家必须考虑已完成作业、尾延迟、内存使用、软件许可、机架功耗和利用率。
当工作负载能够扩展至大量核心时,AMD 的 EPYC Venice 性能论证最具说服力。当顺序延迟主导用户体验时,Nvidia 的论证则更具优势。
两家厂商目前均未提供覆盖可比已交付系统、代表性智能体会话的中立端到端测试。在此类测试出现前,特定架构的基准测试只能展示方向,而非普遍优势。
竞争也延伸至单个节点之外。AMD 预估,在固定功耗预算下,Venice 能够提供更高的机架级性能。
其早期方法论模拟了一台 100 千瓦机架,并为反映更高的节点功耗而减少了 Venice 节点数量。该公司仍计算出更高的总吞吐量。
这一分析依赖于性能预测和建模的系统功耗。真实机架还包含散热、网络、存储、加速器、电源转换和利用率影响。
因此,最有用的问题并非哪家厂商在标准化柱状图中胜出,而是哪套系统能够在买家的延迟、功耗和软件约束内完成所需工作。
基准测试脚注改变了什么
AMD 与 Nvidia Vera 的比较仍属初步结论,因为多项结果结合了预估值、厂商测试和并不相同的配置。
SPEC CPU 提供了一套受控工作负载,但有效解读仍需要配置细节。处理器数量、编译器、内存、线程、固件和优化标志都会影响得分。
SPEC 报告规则允许使用预估性能结果。但规则要求每项预估都应有清晰标注,而不能将这一状态隐藏在笼统的免责声明中。
AMD 在详细脚注中遵循了这一原则。其 2,070、1,210 和 925 的数据均为预估值。
缺少已提交的结果意味着,读者目前尚无法针对每种配置查看标准 SPEC 结果页面。这限制了独立复现。
AMD 的白皮书还包含使用不同编译器版本的对比。一些 Venice 系统采用 AMD 的 AOCC 5.1 编译器,而部分竞品系统则使用 GCC 13 或 Intel OneAPI。
编译器选择是实际平台性能的一部分。供应商通常会为自家处理器优化软件,客户也可能部署这些经过优化的工具链。
不过,混用编译器会使架构层面的结论不那么直接。得分可能反映处理器、编译器成熟度、编译选项、库,或这四者之间的相互作用。
内存配置也存在差异。AMD 的新系统可使用 16 个通道的高速 MRDIMM,而被比较的 Vera 系统使用 8 个 SOCAMM2 通道。
这些是平台层面的选择,并非偶然偏差。但这意味着该基准测试评估的是完整系统配置,而非孤立的 CPU 核心。
在 AMD 披露的 Redis 测试中,EPYC 9996 还采用了 600 瓦的默认 CPU 功耗规格。这高于许多早期服务器处理器所对应的功耗水平。
更高功耗并不意味着性能结果没有意义。当整机柜吞吐量提升带来整合效益时,数据中心运营商通常愿意接受更高的插槽功耗。
但这需要进行更全面的计算。冷却密度、供电配置、空闲状态表现和加速器功耗,都可能决定整合收益能否在实际部署中得以保留。
AMD 的智能体工作负载测试也带来了另一项限制。该公司使用了 NGINX、FAISS、数据库工作负载以及重放的多角色智能体等常见组件。
部分测试的工作负载源自 TPC-H 或 TPC-C。AMD 指出,这些衍生结果不能与这些基准测试系列正式发布的分数进行比较。
这种方法仍可揭示 AMD 自身受控系统之间的有用表现。但不应将其视为标准化的行业排名。
与 AWS Graviton5 的比较增加了云端变量。AMD 通过公开可用的裸金属实例测试 Graviton5,而非使用同等的本地参考系统。
云端固件、存储、网络和平台服务都可能影响结果。AMD 已披露这些因素可能会影响该比较。
独立报道也强调了这些注意事项。原始的基准测试分析指出,AMD 混合使用了数据来源,有时还采用不同代际的 GCC。
最稳妥的解读应保持在较窄范围内。AMD 估计,在其所述工作负载和假设条件下,特定 Venice 配置领先于对比系统。
这比缺乏支撑的营销口号更有意义,但其结论性仍不及基于普遍可获得硬件进行的独立复现测试。
为什么 AI 数据中心关注的不只是 CPU 图表
Venice 的战略价值取决于其密度能否改善真实基础设施经济性,而非能否赢得每一项孤立的基准测试。
AI 集群将大部分关注和资本投入加速器。CPU 仍负责协调周边工作,以确保这些加速器保持高效运行。
检索增强型应用必须在推理开始前查找文档、筛选权限、转换数据并组装上下文。这些步骤都会给内存、存储、网络和通用计算带来压力。
智能体还可能创建临时代码环境或浏览器会话。模型等待结果期间,每个隔离任务都会消耗 CPU 时间和内存。
高核心密度可以整合这些支撑服务。当工作负载能够高效扩展时,更少的服务器或可提供相同的总容量。
整合可减少机柜空间、网络端口、操作系统实例和管理开销,但也可能集中故障风险并提高冷却需求。
软件层决定硬件密度能在多大程度上转化为可用容量。调度器必须有效部署工作,应用程序则必须避免锁竞争、内存瓶颈和共享服务过载。
随着更多核心同时请求数据,内存带宽变得尤为重要。AMD 的 16 通道设计旨在为显著增加的核心数量提供数据,而不按比例增加停顿。
缓存容量同样支撑了高密度的论点。EPYC 9996 配备 1GB L3 缓存,分布在其芯粒架构之中。
对于合适的工作负载,大容量聚合缓存可以减少内存流量。但这并不保证每个核心和数据位置都具备较低访问延迟。
Nvidia 的单芯片设计强调一致的访问表现和强劲的满载单核性能。该公司认为,这种平衡可降低不同智能体工作流之间的波动。
这些相互竞争的理念带来了实际采购选择。云服务提供商可能优先考虑最大租户密度,而企业可能更重视可预测的应用延迟。
软件授权也会再次改变计算结果。按核心授权的产品可能会增加 256 核部署的成本,即便其总吞吐量更高。
其他应用则按服务器、用户或用量授权。这类模式可能会奖励整合。
兼容性同样重要。Venice 延续了此前 EPYC 系统所使用的 x86 环境,但其新插槽、内存设计和功耗特征仍需要经过认证的平台支持。
对于购买完整 Rubin 系统的客户,Nvidia 可以简化部署。其 CPU、加速器、网络和软件作为统一路线图的一部分交付。
这一优势也带来集中风险。买家会更加依赖单一供应商的定价、供货能力、发布节奏和软件方向。
AMD 则提供了以 CPU 选择和标准化基础设施为核心的替代方案。其制造进展支撑着这一战略。
该公司表示,Venice 于 2026 年 5 月进入基于 TSMC 2 纳米工艺的量产爬坡阶段。AMD 称其为首款在该工艺上达到这一阶段的高性能计算产品。
量产爬坡并不等同于广泛供应。OEM 认证、固件成熟度、内存验证和批量出货决定了企业何时能够部署系统。
AMD 表示,主要 OEM 平台正按计划推出,领先的云服务提供商将于 2026 年晚些时候开始部署。这些部署将提供比工程预测更有意义的证据。
三个信号将决定 AMD 与 Nvidia Vera 的竞争走向
独立结果、量产供应和真实智能体吞吐量,将决定 AMD 的基准领先地位能否在其白皮书之外延续。
第一个信号是完整发布的一组 SPEC CPU 2026 结果。可比较的提交结果应披露编译器、编译选项、内存、固件、功耗设置和系统拓扑。
经验证的 2.2 倍吞吐量优势将强化 AMD 的高密度论点。更小的差距则会表明初步预估夸大了 Venice 的领先幅度。
每核心提交结果同样重要。最具参考价值的比较应在对齐的软件条件下纳入 EPYC 9996、96 核高频型号和 Vera。
第二个信号是系统能否以有意义的规模供应。AMD 已开始量产,但客户仍需要经过认证的服务器、稳定的固件、受支持的内存和持续稳定的供应。
云实例将使客户无需进行大规模硬件采购即可更容易测试 Venice。其上线时间和可用配置将揭示哪些型号最先交付给客户。
Nvidia 的 Vera 也面临同样的考验。在客户能够获得系统并测量持续运行表现之前,产品宣称的实际运营价值有限。
广泛供应将增强最先将规格转化为可靠容量的供应商优势。延迟则会给竞争对手更多时间改进硬件、编译器和定价。
第三个信号是在固定约束条件下完成的智能体任务。测试应同时衡量成功的用户会话、尾延迟、吞吐量、功耗和加速器利用率。
这些结果必须同时涵盖狭窄的关键路径和大规模并行工具突发负载。否则,测试只是在重复某一家供应商偏好的架构叙事。
应关注当检索、数据库、API、代码沙箱和模型推理同时运行时,系统如何表现。这种组合比单一 CPU 测试套件更能代表生产环境中的智能体服务。
对于基础设施团队而言,下一步不应是接受任一公司的标准化图表。应先定义工作负载、延迟目标、软件栈、机柜限制和授权模式。
随后,在相同的数据和服务级别目标下比较已出货的系统。AMD EPYC Venice 基准测试为买家提供了将 AMD 纳入评估的充分理由。
它们也为 Nvidia 提供了明确目标。如果 Vera 虽然核心更少,却能在完成的 AI 会话中击败 Venice,那么 Nvidia 关于关键路径的论点将更具可信度。
如果 Venice 能将其预测吞吐量转化为更低的基础设施成本和出色的延迟表现,AMD 挑战的将不止是一款 CPU,还将是 Nvidia 主导整个 AI 服务器平台的计划。



