Vultr 的 AMD Helios 订单为 HPE 打开了价值 12 亿美元、对抗 Nvidia 的机会
Vultr 向 HPE 下达了一份价值 12 亿美元的 AMD Helios 系统订单,为这一 72-GPU 平台带来了首个 HPE 客户。Vultr 的 AMD Helios 订单推动该架构从公开路线图走向在美国数据中心的商业部署。
这笔交易并不只是又一次采购 AI 加速器。HPE 将提供一套集成式机架,结合 AMD 计算能力、开放软件、基于以太网的纵向扩展网络、液冷和部署服务。这项合作将检验替代性供应商阵营能否在完整系统层面与 Nvidia 竞争。
Nvidia 仍是参照标准,因为 Vera Rubin NVL72 同样将 72 枚 GPU 连接为一个机架级计算域。不过,Nvidia 通过 NVLink 等专有技术控制了其技术栈中更多环节。AMD、HPE、Juniper 和 Broadcom 则将基于标准的以太网定位为一条更开放的路径。
这种差异比任何单项峰值性能宣称都更重要。机架级 AI 系统必须在加速器、内存、网络、散热、编排和软件之间提供稳定一致的结果。Vultr 目前正投入大量资金,以证明这种开放方式能够在生产云环境中运行。
Vultr 的 AMD Helios 订单推动 HPE 进入生产阶段
这份订单为 HPE 带来了首个商业验证,此前该系统主要由规格参数和合作公告定义。
HPE 于 2026 年 9 月 30 日宣布该协议。根据其订单公告,Vultr 将在其美国云数据中心部署 AMD Helios AI Rack by HPE 系统。
该公司将这笔交易描述为其首个集成式 Helios 平台订单。HPE 还通过一份 9 月 30 日的 SEC 文件披露了这一进展,将该公告纳入其正式投资者信息披露范围。
每个机架将配备 72 枚 AMD Instinct MI455X GPU,同时包括代号为 Venice 的 AMD EPYC 处理器,以及 AMD Pensando Vulcano AI 网络接口卡。
ROCm 是 AMD 面向 GPU 计算的开放软件平台,提供编程环境。HPE 则提供机架工程设计、直接液冷、部署服务,以及每个机架六个 Juniper QFX5252 纵向扩展交换机托盘。
纵向扩展网络将加速器连接在同一个计算域内。它必须足够快速地传输数据,才能让大量 GPU 在共享模型上运行,而不会因相互等待而耗费过多时间。
HPE 的交换机通过以太网使用 UALink,通常简称为 UALoE。该架构通过基于以太网的网络传输 UALink 流量,而不是依赖垂直整合式互连。
HPE 表示,六个交换机托盘通过高带宽、低延迟连接每一枚 GPU。由于网络性能会随工作负载结构、通信模式和软件配置而变化,这一说法仍需要生产环境证据验证。
两家公司未披露 Vultr 订购了多少个机架,也未提供完整交付时间表,或分别说明订单中的计算、网络、散热、软件和服务构成。
这些缺失的信息限制了对每枚 GPU 或每个机架成本的简单计算,也使外部观察者无法估算合同中硬件与长期运营支持各自所占的比例。
不过,这笔交易确立了一个真实客户和具有实质意义的部署目标。这正是核心变化。HPE 不再需要论证 Helios 最终是否会吸引买家。
Vultr 已为企业和 AI 工作负载运营云基础设施。它可以将该系统提供给关注模型训练、微调和高吞吐量推理、但并不拥有专用数据中心的客户。
HPE 还获得了一家熟悉 AMD 加速器的客户。Vultr 此前已采用 AMD Instinct 系统,从而降低了引入新一代 AMD 产品时的组织摩擦。
因此,这份订单的分量超过实验室基准测试或参考设计。它将 Helios 置于商业云环境中,届时利用率、正常运行时间和客户需求将决定该平台是否成功。
为什么 HPE 需要的不只是一次 GPU 销售
HPE 正借助 AMD Helios AI 机架争夺加速器周边的基础设施业务,而不只是服务器机箱。
AI 基础设施市场越来越倾向于奖励能够交付可运行机架、而非一组零部件的供应商。高密度加速器集群需要协同的供电、散热、网络、固件、软件、监控和维护。
客户即使购买了高性能芯片,仍可能遭遇较低的集群利用率。延迟往往源于网络拥塞、软件不稳定、散热限制,或故障诊断耗时过长。
HPE 的角色是将这些要素打包为 Vultr 可重复部署的系统。这使公司有机会获取原本会流向独立服务器、交换机、散热和集成供应商的支出。
网络组件尤其重要。HPE 于 2025 年完成对 Juniper Networks 的收购,将交换技术和工程人才纳入其基础设施产品组合。
Helios 为这一整合战略提供了早期检验。六个 Juniper 交换机托盘位于每套 HPE 系统中,使网络成为机架核心设计的一部分。
HPE 投资者活动的报道将该交易描述为基于标准的以太网进入纵向扩展层的案例。同一篇网络分析指出,HPE 未披露合同中的网络业务占比。
HPE 向投资者表示,预计未来两年与 Helios 相关的网络业务机会将超过 10 亿美元。该公司还表示,网络托盘订单已超过 2 亿美元。
这些数字是公司预测,并非已完成客户部署的证据。即便如此,它们也说明了 HPE 为何将 Helios 视为不止一款新增服务器产品。
该公司希望其网络设备能够处理机架内加速器之间的流量。这是一项要求很高的工作负载,因为分布式 AI 任务需要在众多设备间交换大型张量。
该层的延迟或拥塞可能令昂贵的加速器闲置。薄弱的网络架构可能抹去更快 GPU 或更大内存池所承诺的优势。
因此,Vultr 的部署将检验 HPE 的集成能力,其程度不亚于对 AMD 芯片的检验。HPE 必须证明其交换机、散热系统、服务和机架设计能够作为一个可靠产品协同运行。
它还必须让该系统能够在多个云设施中得到管理。在大规模条件下重复部署一种配置,需要保持安装、遥测、故障处理和备件流程的一致性。
直接液冷带来了另一项运营要求。这项技术通过高功率组件附近的冷却液传递热量,从而实现传统风冷难以支持的密度。
不过,液冷也会影响设施设计与维护。运营商需要兼容的管路、热量排放、泄漏管理、受训技术人员以及更换组件的流程。
HPE 表示,其服务组织将降低这些部署与运营风险。Vultr 的实际落地将显示,这一承诺能否经受不同设施和生产进度的考验。
对于 HPE 而言,成功将验证整合计算与 Juniper 网络的逻辑。失败则意味着,收购网络资产并不会自动打造出具有竞争力的机架级 AI 平台。
开放以太网才是对抗 Nvidia 的真正赌注
核心竞争是开放、多供应商的以太网技术栈,对阵 Nvidia 高度整合的机架级架构。
Nvidia 的 AI 基础设施地位并非仅靠加速器性能建立。CUDA 软件、NVLink 互连、网络产品、参考设计和开发者熟悉度相互强化。
Vera Rubin NVL72 将这一模式扩展至 72-GPU 机架。Nvidia 发布的 NVL72 规格将 72 枚 Rubin GPU、36 个 Vera CPU 和第六代 NVLink 结合在一起。
AMD Helios 瞄准相同的机架级类别,但采用不同的供应商结构。AMD 提供加速器、主机处理器、网络接口技术和 ROCm;HPE 则提供集成、服务、散热和 Juniper 交换设备。
Broadcom 提供了 HPE 纵向扩展设计所采用的交换技术。Open Compute Project 机架规范、UALink 和以太网标准则构成了可供其他供应商采用的接口。
由此形成的论点并不是 Helios 缺乏集成,而是集成并不要求一家供应商控制每一个关键层面。
AMD 发布的 Helios 规格列出了 72 枚 MI455X GPU、31 TB HBM4 内存以及每秒 260 TB 的聚合纵向扩展带宽。HBM4 是一种部署在 GPU 附近的高带宽内存,用于快速访问模型数据。
AMD 还列出了 2.9 exaflops 的峰值 FP4 计算能力,以及 1.4 exaflops 的 FP8 计算能力。FP4 和 FP8 是低精度数值格式,旨在以更少内存和能耗提升 AI 吞吐量。
峰值数据并不能直接转化为应用性能。不同供应商可能采用不同的数据格式、稀疏性假设、软件设置和工作负载条件。
因此,MI455X 与 Vera Rubin 的比较并不像对照两个数字那样直接。买家需要看到来自实际模型、批量大小、上下文长度、网络模式和服务级别要求的结果。
内存容量为 AMD 提供了明确的营销切入点。Helios 配备 31 TB 机架级 HBM4,可支持大型模型和长上下文推理,无需过于激进地拆分数据。
Nvidia 则以其软件成熟度和集成式网络应对竞争。其 CUDA 生态系统仍深度嵌入 AI 框架、优化库、部署系统和工程实践之中。
ROCm 已有显著改进,但采用它不只是编译一个模型。生产团队需要稳定内核、监控、编排、安全控制,以及在频繁框架更新中可预测的性能。
这正是 Vultr 在战略上有价值之处。云服务商可以吸收一部分集成复杂性,向客户提供托管基础设施,而不是原始组件。
如果 Vultr 能够提供可靠的实例或预留集群,客户可能不太在意底层网络架构。该方法可以让缺乏 ROCm 和分布式系统专家的团队也能使用 AMD 硬件。
不过,仅有云端可用性无法消除软件差异。客户仍会比较模型兼容性、开发投入、每美元性能,以及实现稳定生产所需的时间。
Vultr 的 AMD Helios 订单为评估这种开放方式提供了一个严肃的场景。在系统完成部署和测量前,它并不能预先确定胜者。
规格参数无法判定 MI455X 与 Vera Rubin 的胜负
两家厂商都公布了令人瞩目的峰值数据,但云服务买家最终付费购买的是已完成的工作负载、可用容量和可预测的运营表现。
AMD 表示,Helios 支持万亿参数训练和高吞吐量推理。其设计强调内存容量、开放标准,以及机架内和机架间基于以太网的连接。
Nvidia 将 Vera Rubin 定位于智能体推理、训练效率和 token 吞吐量。该公司表示,其平台将 CPU、GPU、DPU、网络接口和交换设备整合为一个协同设计的系统。
这些说法采用了厂商自行选择的工作负载和方法论。它们有助于理解产品优先级,但不能替代独立基准测试。
一篇独立技术评测称,MI455X 是 AMD 针对 Nvidia 最具可信度的机架级应对方案。该评测还强调了 Helios 将 72 块 GPU 整合为一个统一域的重要性。
这项比较仍存在重大未知因素。其中之一是实际利用率,即应用程序对系统理论计算能力的持续使用程度。
另一个是集体通信性能。训练任务经常需要在 GPU 之间交换部分结果,而同步速度缓慢会降低整个集群的产出。
推理带来了不同的压力。长上下文、大型混合专家模型,以及大量并发请求,都会考验内存容量、内存带宽、路由和调度能力。
第三个未知因素是软件迁移成本。在 Nvidia 系统上开发的模型可能依赖 CUDA 专用库、内核或运维工具。
ROCm 支持包括 PyTorch、TensorFlow 和 JAX 在内的主流框架。但框架层面的兼容性并不保证每一条经过优化的生产流水线都具有完全相同的行为。
开发者可能需要修改内核、调整通信设置或替换依赖项。当团队面临紧迫的部署期限时,这些成本可能超过硬件节省的费用。
Vultr 可以通过发布经过验证的配置、优化容器、模型方案和实测性能来减轻这一负担。它还可以基于对这些机架的直接运营提供技术支持。
这家云服务提供商有动力完成这项工作。扩大可行的加速器供应可降低对单一厂商的依赖,并为客户提供更多容量选择。
但容量必须按计划交付。HPE 和 Vultr 没有披露详细的部署日程,而 AMD 表示 Helios 的出货量将在 2026 年末至 2027 年期间逐步提升。
一笔大型订单可能涵盖采购承诺、交付窗口、服务和未来容量。标题中的订单金额并不能证明所有硬件已经安装完毕或可供客户使用。
制造和部署风险依然显著。MI455X 加速器需要先进封装和 HBM4。Helios 机架还依赖新 CPU、网络组件、交换托盘、冷却设备和设施准备工作。
任何关键组件的延迟都可能拖慢完整系统的交付。机架级产品集中了各种依赖,因为买家需要的是集成配置,而不是可替代的单个零件。
电力供应构成另一项限制。高密度 AI 机架需要大量供电和冷却基础设施,而这些设施未必能迅速添加到现有数据中心中。
因此,MI455X 与 Vera Rubin 的真正较量将通过实际部署而非发布幻灯片见分晓。有价值的比较必须在等效条件下报告正常运行时间、功耗、模型吞吐量、延迟和总运营成本。
Vultr 购买的不只是容量,还有议价能力
Vultr 的承诺为其带来另一种加速器平台,同时增强了它在芯片厂商与企业 AI 客户之间的地位。
云服务提供商面临艰难的平衡:它们必须及早锁定稀缺硬件,但也面临在客户需求尚未变得可预测之前,将资本绑定于系统的风险。
Vultr 的订单表明,该公司相信客户将使用 AMD 容量进行训练和推理。该公司称,高性能 AI 基础设施的需求仍持续超过可用供应。
这一说法反映了 Vultr 的商业判断,尚未通过公开的利用率数据得到独立验证。该公司并未公布足够细节,无法按客户或工作负载衡量未来 Helios 需求。
不过,其战略逻辑很清楚。支持 Nvidia 和 AMD,使 Vultr 能够提供比围绕单一加速器系列构建的云平台更多的选择。
这种灵活性可能吸引担心硬件可得性、供应商集中度或软件可移植性的企业。它也可能吸引那些受益于更大内存池的工作负载团队。
当多个加速器平台都能满足客户需求时,Vultr 将获得更强的谈判筹码。该公司对任何单一供应商的生产进度和商业条款都不会过度暴露。
AMD 获得了 MI455X 的一个显著云服务渠道。HPE 获得了首个集成式 Helios 客户。Juniper 设备则在加速器级网络中获得了一席之地。
这项安排也为 Vultr 带来差异化产品。大型超大规模云服务商提供广泛的产品组合,但独立 AI 云可以通过早期硬件获取、专注支持和地域选项展开竞争。
这一机会伴随着集中风险。相对于许多私有云基础设施交易,这笔订单规模很大,Vultr 必须将已安装硬件转化为持续的客户使用量。
预留容量承诺将增强这一论点。公开案例若能显示客户无需长期重构,便可将重要模型从 Nvidia 系统迁移至 Helios,同样会有所帮助。
低利用率则会导致相反结果。即使客户任务无法让昂贵的机架持续运转,它们仍会占用资本。
Vultr 还必须管理客户对性能可移植性的预期。一个在两个平台上都能正确运行的模型,仍可能呈现不同的吞吐量、延迟和成本特征。
云服务提供商可以通过展示面向特定工作负载的证据来提供帮助。通用的加速器对比,不如针对模型训练、长上下文推理、微调和智能体工作负载的测量结果有用。
客户还应关注服务可用性。仅在选定设施部署少量专业集群,其竞争意义将低于在 Vultr 云中广泛提供标准化 Helios 容量。
地域部署很重要,因为企业买家会考虑延迟、数据驻留、灾难恢复,以及与已存储数据集的距离。HPE 仅表示这些系统将进入美国境内的地点。
该公告也没有说明合同结构。两家公司均未披露交付里程碑、取消条款、最低采购额,或与服务挂钩的部分。
这些细节会影响各方承担的风险程度。确定的硬件采购与取决于未来容量需求的多年期框架协议有所不同。
因此,Vultr 的 AMD Helios 订单是一个强劲的需求信号,但不等同于已完成部署。在客户能够大规模访问这些系统之前,这一区别应始终保持明确。
三个信号将显示 Helios 能否实现突破
交付时间、生产工作负载结果和更广泛的客户采用,将决定这笔订单是否改变竞争格局。
第一个信号是实体部署。HPE 和 Vultr 需要明确 Helios 容量何时投入运营,以及客户可在何处访问。
经确认的生产上线将加强这样一种判断:AMD 和 HPE 能够按计划制造、集成并安装一个新的机架级平台。反复延迟则会削弱这一判断。
可用性不应仅限于新闻稿。Vultr 应公布服务区域、预留选项、配置细节,以及面向符合条件客户的预期容量。
第二个信号是工作负载证据。独立基准测试或经客户验证的基准测试,应在匹配条件下将 Helios 与相关 Nvidia 系统进行比较。
有价值的结果应包括每秒 token 数、训练完成时间、功耗、模型规模、上下文长度、批处理大小和软件版本,同时也应报告调优工作量。
这些证据需要同时覆盖训练和推理。一个平台可能在某一类别中表现良好,却在另一类别的通信、延迟或软件支持方面面临困难。
运营数据同样重要。客户需要了解正常运行时间、组件故障后的恢复、集群调度,以及维护对性能的影响。
强劲的结果将支持 AMD 的观点,即开放标准能够实现具有竞争力的机架级性能。疲弱或经过狭窄挑选的结果,则会保留 Nvidia 的集成优势。
第三个信号是后续采用。HPE 需要获得更多 Helios 客户,而 AMD 需要推动超越既有承诺合作伙伴的部署。
来自其他云服务提供商、企业、研究机构或国家级计算计划的订单,将表明该架构对多种买家类型具有吸引力。
Vultr 的重复采购将更具说明意义。在投入生产使用后进行第二次扩张,将表明客户需求和运营经济性达到了预期。
Nvidia 的回应也值得关注。该公司可通过更快的 Rubin 部署、改进的软件、积极的云合作关系,以及更强的以太网产品来捍卫其地位。
HPE 和 AMD 无需在整个市场中取代 Nvidia,便能验证 Helios。它们需要为那些重视开放性、内存、可用性或供应商多样性的工作负载,建立一个可靠的替代方案。
对开发者和企业买家而言,眼下应避免将峰值规格视为采购结论。应要求服务提供商提供与预期模型和运营环境相匹配的测量数据。
要求了解软件迁移、已验证框架、集群可用性、服务承诺和故障恢复的细节。比较实现生产部署所需的工程投入,而不仅仅是加速器吞吐量。
Vultr 的 AMD Helios 订单已形成一项可信的商业检验。现在,行业需要部署证据,以区分雄心勃勃的架构与可靠的云平台。



