top of page

HPE Vultr AMD 订单将云端胜利转化为对 Nvidia AI 机架领先地位的考验

10月1日
讀畢需時 14 分鐘

据报道,HPE 已获得 Vultr 一笔价值 12 亿美元的订单,内容包括 AMD 服务器机架及 HPE 网络设备。这笔 HPE Vultr AMD 订单不只是又一份大型硬件合同。它将一套替代性 AI 计算栈带入了一个仍由 Nvidia 高度整合系统塑造的市场。

根据这笔 HPE Vultr 订单,Hewlett Packard Enterprise 将提供基于 AMD 的服务器机架,以及其自有网络技术。客户为私营云服务商 Vultr。初始报道未披露详细交付日期、机架数量和收入确认条款。

相比这些缺失的细节,战略层面的张力更为清晰。HPE 希望成为多个加速器平台的集成商,而 AMD 则需要愿意以完整机架级系统部署其技术的云运营商。Vultr 正押注于,客户将希望获得比围绕单一芯片供应商构建的 AI 云更多的选择。

这使 Nvidia 已成熟的机架、网络和软件模式成为比较的核心。Nvidia 仍深度嵌入 AI 基础设施,包括 Vultr 自身的扩张计划。问题在于,AMD、HPE 和开放以太网能否成为生产级 AI 工作负载可信的第二条路径。

这笔 12 亿美元 HPE Vultr AMD 订单改变了什么

这份据报道的合同,将 HPE 的 AMD 机架战略从产品计划推进为大规模商业部署。

HPE 于 2025 年 12 月发布了其基于 AMD 的“Helios”机架级系统。该设计将 AMD 加速器、CPU、网络组件和软件,与 HPE Juniper Networking 交换机结合起来。HPE 还提供系统集成、散热专业能力、部署服务和持续支持。

机架级系统将整个机架视为一台协调运作的计算单元,而非一组彼此独立的服务器。加速器必须以极低延迟交换数据,因此机架内部及机架之间的网络成为计算架构的一部分。这使交换机和网络软件供应商具有战略重要性。

新近报道的订单表明,Vultr 正以具备实质意义的规模采购这套整合架构。这也表明,HPE 能销售的不只是围绕其他公司处理器配置的服务器。网络、散热、部署和全生命周期服务都可能成为合同的一部分。

这种区别至关重要,因为 AI 基础设施的经济效益并不止于加速器出货。云运营商还需要内存、配电、高速连接、存储、软件,以及能够承载高密度硬件的设施。因此,一笔有价值的订单取决于 HPE 提供了多少周边系统。

HPE 表示,其Helios 架构采用基于标准的以太网进行加速器之间的通信。该公司与 Broadcom 共同开发了其 scale-up 交换机,并计划在 2026 年期间向全球提供该机架。

Scale-up 网络连接紧密耦合计算域内的处理器。Scale-out 网络则将多个系统或机架连接为更大的集群。AI 训练和高吞吐量推理都需要这两层网络,以便让加速器持续工作,而不是等待数据。

HPE 声称,单机架配置可支持万亿参数模型训练和高吞吐量推理。其公布的规格包括每秒 260 太字节的总 scale-up 带宽,以及 2.9 exaflops 的 FP4 性能。这些数据属于供应商规格,并非来自 Vultr 部署的独立结果。

据报道的合同金额并未说明总额如何在 AMD 组件、HPE 硬件、网络和服务之间分配。它也没有显示订单是否在整个期限内具有约束力,或是否与部署里程碑挂钩。这些细节将决定其最终财务影响。

不过,这一规模赋予了该消息相当的分量。这并非涉及少量加速器的有限概念验证,而是一项规模足以同时检验制造、安装、软件就绪度和客户需求的基础设施承诺。

对 HPE 而言,这使 AMD Helios 从产品组合扩张变成了一项执行挑战。对 AMD 而言,这为其进入商业云创造了一条路径,外部客户可以在那里评估性能和可用性。对 Vultr 而言,这同时带来了差异化和运营风险。

Vultr 为何构建多供应商 AI 云

Vultr 的 AMD 采购符合其更广泛的努力:提供多种加速器选择,而不是仅围绕 Nvidia 实现其 AI 云标准化。

Vultr 已通过其云平台提供 AMD 加速器。其当前资料介绍了采用 AMD Instinct MI355X GPU 和 ROCm 软件栈的实例。ROCm 是 AMD 用于编程和运行其加速器的开放软件平台。

该公司还宣布,计划部署采用 MI455X GPU 的 AMD Helios 机架级系统。Vultr 将此部署描述为面向 AI 训练和推理的可组合云基础设施的一部分。可组合基础设施让运营商能够围绕每个工作负载配置计算、网络和存储资源。

这种既有关系让报道中的订单不那么令人意外,但意义更为重大。Vultr 并非只是新增一种孤立的 AMD 实例类型。它似乎正承诺以更大规模部署配备专用网络的整合式 HPE AMD Helios 系统。

这种做法可为 Vultr 带来几项潜在优势。它可以为客户提供第二种加速器环境,减少对单一供应商的依赖,并瞄准可从 AMD 内存容量或 ROCm 支持中受益的工作负载。它还可以从更广泛的供应商基础中谈判基础设施采购。

然而,多供应商容量也会带来复杂性。每个加速器系列都有不同的系统配置、库、诊断工具和性能特征。Vultr 必须让这种复杂性变得可控,因为客户更关心运行模型,而不是选择网络拓扑。

该公司的AMD 部署强调通过 AMD Instinct 硬件和 ROCm 实现生产级训练与推理。这种表述至关重要,因为仅有可用性并不会创造需求。客户需要稳定的框架、经过测试的模型路径、监控工具和可预测的性能。

Vultr 的战略同样包括 Nvidia。2026 年 6 月,它选择 HPE 和 Nvidia,采用 GB300 NVL72 系统及 Spectrum-X 网络进行大型 AI 数据中心部署。HPE 表示,这些环境将支持模型训练、推理和私有云工作负载。

这套Nvidia 基础设施包括 400GbE 和 800GbE 连接、液冷和 HPE 部署服务。这表明 Vultr 并非在整个平台上以 AMD 取代 Nvidia。相反,它正在围绕两个生态系统构建并行容量。

这一区别避免了简单的赢家与输家式解读。眼前的压力并不在于 Vultr 已放弃 Nvidia。压力来自 Vultr 将 AMD 视为值得进行重大机架级部署的选择,而非次要实验。

Vultr 可以利用这两种环境满足不同的客户需求。一些买家将优先考虑 Nvidia 成熟的软件平台和广泛的开发者支持。另一些买家则会更在意加速器可用性、内存、基础设施灵活性,或避免完全依赖单一供应商。

商业考验将来自利用率。云运营商可以安装替代性加速器,但只有在客户持续租用时,这项投资才能发挥作用。Vultr 必须将硬件选择转化为可用服务、有竞争力的性能和持续需求。

这正是 Vultr AI 基础设施的重要性超出单笔订单的原因。它创造了一个真实运行的环境,可将 AMD 硬件、HPE 集成和开放网络,与成熟的 Nvidia 技术栈进行比较。决定替代方案能否取得进展的,将是客户而不只是规格参数。

HPE 作为机架集成商竞争,而非芯片设计商

HPE 的机会在于掌控昂贵加速器周围的集成层,无论特定部署最终由哪家芯片公司胜出。

HPE 不需要 AMD 在整个市场取代 Nvidia。它需要云服务商和企业信任 HPE,负责两种平台周围的服务器、网络、散热、服务和运营支持。这使 HPE 的多供应商定位成为这笔交易的核心。

该公司已经销售基于 Nvidia 的 AI 基础设施。它与 Vultr 在 GB300 系统上的合作表明,当客户选择 Nvidia 的整合技术栈时,HPE 同样能够参与。AMD 订单则将这一角色拓展至围绕开放以太网和 ROCm 构建的架构。

这与芯片层面的 AMD 对 Nvidia 竞争有所不同。HPE 正与 Dell、Supermicro、原始设计制造商,以及云运营商的内部工程团队竞争,以掌控完整部署。它的论点是,机架级 AI 所需的集成程度,高于购买加速器并将其安装到传统服务器中。

HPE 对 Juniper Networks 的收购强化了这一地位。AI 集群需要专用网络,以在处理器之间传输数据而不造成高成本的闲置时间。拥有更大的网络产品组合,使 HPE 能够在服务器机会中附加交换机、软件和运营工具。

据报道,Vultr 订单包括 HPE 网络设备,这具有战略重要性。服务器硬件通常面临激烈的价格竞争,而网络和服务可以深化客户关系。它们也使 HPE 对集群的实际性能承担更多责任。

这种责任具有双面性。当供应商集成整个机架时,它会获得更多收入机会,但也会承担更多部署问题。散热故障、网络拥塞、固件问题或软件不兼容,都不能再被视为其他公司的组件问题。

更广泛的市场规模足以吸引激烈竞争。一份服务器市场展望估计,AI 服务器市场将在 2025 年增长 55%,达到 2520 亿美元。这一预测早于本次订单,但有助于解释为何成熟硬件厂商正争夺机架级项目。

这些醒目的数字同样掩盖了艰难的经济性。AI 系统包含由其他公司供应的昂贵加速器,因此大型服务器订单并不自动带来异常高的利润率。收入可以快速增长,而组件成本会消耗合同价值中的很大部分。

因此,HPE 的网络贡献不只是技术层面的附注。它是该公司力图获取每次部署中更大份额的一部分。Juniper 技术也让 HPE 相对于销售类似 AMD 组件的供应商具备更清晰的差异化优势。

HPE AMD Helios 设计采用了与 Broadcom 联合开发的基于以太网的纵向扩展网络。数据中心运营商已熟悉以太网,但将其用于紧密耦合的加速器通信,需要专门的硬件和软件。HPE 认为,基于标准的方法能够保留灵活性并减少厂商锁定。

Nvidia 的对策是集成。其加速器、NVLink 连接、网络硬件和软件被设计为协同运行的系统。客户可能会接受更具封闭性的环境,因为该技术栈拥有广泛支持和熟悉的开发流程。

HPE 押注云服务提供商会需要一家能够同时支持两种模式的集成商。这使该公司不那么依赖单一加速器供应商,也让 HPE 能够将自身定位为异构 AI 基础设施的中立运营方。

据报道,HPE、Vultr 与 AMD 的订单仅在采购阶段验证了这一战略。HPE 仍需交付机架,将其连接至 Vultr 的设施,并帮助打造可靠的云服务。最有力的证据将来自系统投入客户使用之后。

开放以太网挑战 Nvidia 的集成式 AI 技术栈

核心竞争在于更开放的多供应商架构,与 Nvidia 成熟且高度集成的计算平台之间的较量。

AMD 面临的挑战从来不只是打造一款有竞争力的加速器。大型 AI 客户购买的是一套系统,其价值取决于软件、内存、网络和运营可靠性。再快的芯片,也无法弥补停滞的数据传输或脆弱的部署工具。

Helios 在机架规模上解决了这一问题。该设计整合了 72 个 AMD Instinct 加速器、AMD EPYC 处理器、Pensando 网络、ROCm 软件以及 HPE Juniper 交换设备。HPE 的实施方案基于 Open Compute Project 的 Open Rack Wide 规范。

AMD 的方案为供应商在不同层级参与提供了空间。Broadcom 为 HPE 的纵向扩展网络提供交换芯片,而 HPE 则负责集成和支持完整机架。云运营商无需依赖 AMD 制造每一项配套组件,便可采用完整系统。

其吸引力在于选择权。基于标准的网络可让客户更容易从多个供应商采购组件,并纳入未来升级。它还可降低单一供应商同时控制加速器、互连、交换机和软件的风险。

但开放性并不天然等同于性能优势。标准允许互操作性,但客户仍需要能在持续生产负载下稳定工作的实施方案。拥塞控制、集合通信、故障恢复和软件调优,都会影响集群的实际可用性能。

Nvidia 多年来一直在协同优化这些层级。其用于加速计算的软件平台 CUDA,已在机器学习框架和研究工具中获得广泛采用。NVLink 和 Nvidia 网络产品让该公司对数据如何在其系统中流动拥有更强控制力。

这种集成减少了客户需要做出的部分决策。开发者面对的是熟悉的软件环境,基础设施团队则可利用成熟工具部署参考架构。代价是对 Nvidia 技术和商业路线图的依赖更深。

AMD 和 HPE 提供的是另一种取舍。Vultr 获得了另一条供应商路径和基于以太网的设计,但也要承担更多责任,证明组合技术栈能像单一产品一样运行。HPE 的集成工作旨在弥合这一差距。

首批工作负载至关重要。推理,即运行已训练模型以生成答案或预测的过程,有时能容忍比前沿规模训练更广泛的硬件配置。训练对同步要求极高,因为众多加速器必须反复交换模型数据。

Vultr 已讨论过其 AMD 基础设施将用于训练和推理。实际使用情况将揭示该平台首先在哪些领域吸引客户。即便最大规模的训练任务仍集中在 Nvidia 系统上,强大的推理产品也足以证明大规模部署的合理性。

内存容量也可能影响采用。大模型和长上下文推理需要大量紧邻加速器的高带宽内存。HPE 材料称,Helios 中每个 MI450 系列加速器最多提供 432 GB HBM4 内存,但最终量产表现仍需客户验证。

软件可移植性仍是更大的不确定性。框架支持可以让代码在多种加速器上从技术上运行,但生产迁移还涉及性能分析、内核优化、监控以及运营团队再培训。这些成本可能超过诱人的硬件规格所带来的优势。

Vultr 可以通过提供经过测试的镜像和部署模式来降低这种摩擦。其文档已包含在 AMD Instinct 系统上运行模型的指南。下一步是证明团队能够从演示顺利过渡到稳定、可重复的生产环境。

因此,HPE、Vultr 与 AMD 的订单会对 Nvidia 形成压力,但并未证明双方已经对等。它为 AMD 提供了重要的分销渠道,也为 HPE 带来了重大集成机会。Nvidia 仍拥有规模更大的软件社区,以及在众多知名集群中得到验证的技术栈这一优势。

当客户能够选择不同方案而无需承担不合理的迁移成本时,竞争才具有实质意义。如果 Vultr 能让 AMD 算力易于使用,这笔订单将提升买方的议价能力。若客户在软件或可用性方面遇到困难,这些机架可能仍只是一个专业化选项。

合同金额无法消除交付与需求风险

大额订单证明了采购意向,但并不能证明能够及时交付、实现盈利性收入,或持续获得客户使用。

第一个不确定性来自合同结构。据报道的 12 亿美元可能涵盖硬件、网络、服务以及跨越较长时间的部署。在未披露里程碑的情况下,无法判断 HPE 能以多快速度确认相关收入。

第二个不确定性是组件供应情况。机架级 AI 系统依赖加速器、高带宽内存、网络芯片、光学组件、电力设备和冷却系统按顺序到位。其中任何一类的延迟,都可能拖慢整个集群。

HPE 还必须协调新技术。其 AMD Helios 系统已宣布将于 2026 年在全球上市,该公司此前表示其专用纵向扩展交换机仍在开发中。Vultr 的部署将检验这些组件能否从已公布的架构走向可重复安装。

第三,HPE 必须保障盈利能力。合同总金额包含 HPE 并不生产的昂贵 AMD 组件。HPE 可通过网络、软件、服务和支持改善经济结构,但仅凭公开订单金额无法看出利润率。

第四,Vultr 需要客户。只有当出租的加速器持续被付费工作负载占用,基础设施支出才能产生经济效益。低利用率可能让一支令人瞩目的硬件舰队变成一批成本高昂且不断折旧的资产。

Neocloud 提供商面临严苛的平衡。它们必须足够早地预订硬件以确保产能,而客户承诺会随模型效率、融资条件和新一代加速器而变化。因此,大额采购中包含了对未来需求的预测。

与仅专注于 GPU 租赁的公司相比,Vultr 运营着更加多元化的云平台。这可能有助于其服务同时需要计算、存储、网络和 AI 加速能力的客户。但这并不能消除在实际使用之前就建设产能的风险。

第五个不确定性是软件采用。AMD 已对 ROCm 进行了大量投资,主流框架也支持其加速器。然而,功能列表上的支持与数千项生产任务中的顺畅运行并不相同。

客户将评估部署时间、模型兼容性、性能稳定性和调试工作量。他们还会将这些结果与其团队可能已熟悉的 Nvidia 环境进行比较。HPE 和 Vultr 必须让这一替代方案在运营层面显得足够寻常。

还存在客户集中度问题。大型基础设施订单可以改善供应商的积压订单,但也会增加其对少数客户的依赖。若某项部署改变范围或时间安排,影响可能迅速传导至生产计划和财务预期。

这些风险都不会否定据报道的订单。它们解释了为何应将该合同视作一场检验的开端,而非最终结果。硬件必须发货,服务必须上线,客户也必须选择这些算力。

最重要的限制在于证据。最初报道确认了相关方、订单金额、AMD 机架和 HPE 网络,但没有提供详细合同条款。HPE、AMD 和 Vultr 当时也未就该报道发布完整的联合技术公告。

因此,读者不应假设每套系统都会立即到货,或全部金额都会成为 HPE 的近期收入。现在推断 Vultr 正在将支出从 Nvidia 转移出去也为时过早。其此前宣布的 Nvidia 部署表明,这更像是多供应商扩张。

更稳妥的结论较为有限。据报道,Vultr 已对由 HPE 组装的 AMD AI 基础设施进行了重大押注。这足以形成竞争压力,但交付和利用率将决定这种压力能否持续。

三项信号将显示这一押注是否奏效

出货、客户可用性和披露的财务业绩,将决定这笔订单是否改变 AI 基础设施市场。

第一个信号是生产部署公告。HPE 或 Vultr 最终应披露 Helios 机架何时安装、算力在哪些地点可用,以及客户可访问哪些服务。若有明确署名的发布,将更有力地表明据报道的订单已超越采购阶段。

技术细节会让这一信号更有价值。机架数量、加速器配置、网络拓扑和支持区域将说明项目规模。即使不披露所有商业条款,这些信息也能展示 Vultr 计划如何将硬件转化为可销售算力。

第二个信号是实际客户采用。Vultr 可通过正式可用的实例、已记录的模型部署、客户案例研究或产能扩张来证明这一点。持续需求将验证围绕 AMD 构建的 Vultr AI 基础设施的实际价值。

性能证据应反映真实工作负载,而不仅是峰值规格。买家需要吞吐量、延迟、集群效率、故障恢复和软件兼容性方面的数据。独立或由客户生成的结果,比供应商预测更具说服力。

第三个信号是 HPE 的财务报告。投资者应关注 AI 系统收入、服务器积压订单、网络需求、利润率以及管理层对出货时间的评论。这些数据可以显示该合同是带来盈利增长,还是主要增加低利润率硬件销量。

HPE 的网络业务表现尤其值得关注。若该公司将 Juniper 交换机和服务附加到大型加速器订单中,就能获取系统更多价值。若客户主要购买的是转售型计算设备,收入标题看起来会比实际经济效益更强劲。

竞争对手的回应将提供补充背景。Dell 和 Supermicro 可以争取类似的 AMD 机会,而 Nvidia 则可强调其集成平台的运营优势。云服务提供商也可能在寻求供应灵活性时,宣布更多加速器选择。

AMD 接下来的软件和硬件更新将影响最终结果,但它们不能替代这次部署。新的规格能够改善路线图,却也可能分散对当前执行情况的注意力。Vultr 已安装的系统必须先提供有价值的服务,才能避免下一轮产品周期重新设定比较基准。

对开发者和企业采购方而言,结果影响的不只是供应商的市场份额。一个可信的第二套机架级平台能够改善算力供应的可获得性、增强采购议价能力,并提升工作负载的可移植性。它也会带来更多需要团队评估的工程选择。

正确的应对方式,不是想当然地认为开放基础设施必然胜出,也不是认定 Nvidia 的领先地位无法撼动。买方应比较完整环境,包括模型支持、网络、部署工具、可靠性以及迁移工作量。加速器基准测试只涵盖这项决策的一部分。

未来数月,应关注具名服务的发布、客户实际使用的证据,以及 HPE 报告的收入和利润率贡献。这些信号结合起来,将表明 HPE、Vultr 与 AMD 的订单究竟打造出了一个可运行的替代方案,还是仅仅形成了一笔规模庞大的积压订单。

正在规划 AI 算力的组织应利用这段时期,识别哪些工作负载确实需要某一家供应商的技术栈,以及哪些能够在不同平台之间迁移。如果 Vultr 将其 AMD 部署转化为广泛可用的算力资源,这份清单将十分重要。该订单开启了一场竞争性测试,但客户将通过他们实际租用和运营的系统决定其结果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page