top of page

AMD Helios 将 72 块 GPU 集于一体,但 Nvidia 设定了考验标准

8月12日
讀畢需時 15 分鐘

AMD 推出了 Helios,将其打造为一个包含 72 块 GPU 的统一系统,而非一组置于机柜内、彼此连接的松散加速器服务器。AMD 在 ServeTheHome 上披露的架构信息之所以重要,在于该公司如今几乎掌控了其 AI 机架的每一个主要层面。

Helios 集成了 Instinct MI455X 加速器、EPYC Venice 处理器、Pensando 网络产品、ROCm 软件,以及液冷供电基础设施。Broadcom 则提供商用 Ethernet 交换芯片,用于通过单一 scale-up fabric 连接这些 GPU。

这一组合构成了真正的竞争焦点。AMD 不再仅凭一张加速器卡挑战 Nvidia,而是在挑战 Nvidia 的机架级模式,同时拒绝采用曾使 Nvidia 系统难以复制的封闭式网络方案。

从纸面参数看,Helios 颇具竞争力。不过,峰值规格并不能证明实际应用性能、软件成熟度、供货规模或运营经济性。那些尚未解答的问题将决定开放性会成为采购优势,还是仅仅是一种架构偏好。

AMD ServeTheHome 报道揭示的 Helios 内部架构

Helios 将 AMD 的竞争单位从单块 GPU 转变为集成式 AI 机架。

该系统由 18 个液冷计算托盘构成,内含 72 个 Instinct MI455X 加速器。每个托盘配备四块 GPU,以及一个用于第六代 EPYC 9006 处理器——代号 Venice——的插槽。

AMD 为每块 MI455X 配备 432 GB HBM4 内存。整个机架合计可在 scale-up 域内提供约 31 TB 高带宽内存。

高带宽内存,即 HBM,紧贴 GPU 布置,其数据供给速率远高于传统服务器内存。这一容量对于大模型、长上下文、推理缓存,以及原本需要进行更多分区的工作负载都十分重要。

AMD 在其 CDNA 5 architecture 文档中列出,每块 MI455X 的内存带宽最高可达 23.3 TB/s。该机架将这些设备汇聚为一个理论带宽超过每秒 1 PB 的内存系统。

物理布局与加速器数量同样重要。Helios 采用 Open Compute Project Open Rack Wide 机架框架,比传统机架更宽。该设计为高密度计算托盘、布线、电源设备和液冷硬件提供了空间。

该机架包含六个 scale-up 交换托盘。每个托盘搭载两颗 Broadcom Tomahawk 6 交换芯片,使 Helios 全系统共有 12 颗交换芯片。

每颗 Tomahawk 6 可提供 102.4 Tbps 的交换容量。其 Ethernet 通道构成内部网络,使每个加速器都能通过一次交换跳转与其他任意加速器通信。

这一网络承载运行于 Ethernet 之上的 UALink,通常缩写为 UALoE。UALink 为加速器定义 scale-up 连接,而 Ethernet 则提供底层传输与商用交换硬件。

AMD 表示,每块 MI455X 可获得 3.6 TB/s 的双向 scale-up 带宽。72 个设备合计,带宽约达 260 TB/s。

这正是 AMD 宣称 Helios 像一个统一的 72-GPU 系统那样运行的机制。传统集群通常将内存所有权分散在多台独立服务器之间,再让数据经过多个网络阶段传输。

Helios 降低了机架内部这些边界的影响。它仍包含彼此独立的处理器和内存设备,但其单跳网络为软件提供了连接更紧密的加速器域。

AMD 的 MI455X specifications 还显示,网络功能在多大程度上被移入 GPU 封装。每个加速器模块包含两个增强型 I/O die 和 36 条双向 UALoE 链路。

这一变化使网络成为加速器架构的一部分。它不再是在计算平台设计完成后才选配的附属组件。

Helios 还通过 Pensando 硬件处理 scale-up 域之外的通信。每块 GPU 可连接三张 800 Gbps Vulcano 网络接口卡,为每个加速器提供最高 2.4 Tbps 的 scale-out 带宽。

Scale-out 网络将多个机架连接为更大规模的部署。Pensando Salina 数据处理单元负责前端流量,包括管理、存储访问和应用请求。

因此,该机架包含两个不同的网络层。Broadcom 芯片负责连接 Helios 内部的加速器,而 AMD Pensando 设备则将 Helios 连接至存储、服务和其他机架。

供电系统则补全了这一方案。后置 50 伏直流母排为机架供电,液冷系统为高密度组件散热。

AMD Advancing AI 活动的报道显示,该机架负载介于 225 kW 至 245 kW。这一要求使 Helios 不适合缺乏高密度供电与液冷支持的数据中心机房。

根据已发布的平台细节,该机架重量也可能接近 5,000 磅。采购方必须将部署视为一项设施工程,而非常规服务器更新。

因此,ServeTheHome 对架构的关注是合理的。核心产品正是这种集成能力,包括计算、内存、网络、供电、冷却、机械结构和软件。

AMD 为何必须现在构建完整机架

Nvidia 迫使每一家严肃的加速器供应商都必须在系统规模上竞争。

现代 AI 工作负载会花费大量时间在加速器之间移动数据。只有在模型、激活值和中间结果能够抵达计算引擎而不造成长时间停滞时,更快的算术性能才有意义。

这一现实有利于作为协调整体设计的系统。Nvidia 通过其 NVL72 平台确立了这一模式,该平台集成了 72 块 GPU、CPU、NVLink 交换、网络、冷却和软件。

此前,AMD 销售的是由系统厂商组装为服务器和集群的竞争性加速器。这种模式赋予客户选择权,但也让更多集成工作处于 AMD 的直接控制之外。

该公司即使提升了 GPU 性能,仍可能在系统层面落败。网络拓扑、集体通信、冷却限制、软件调优和服务器设计,都可能抹去在单个加速器上衡量出的优势。

Helios 通过提供完整参考架构来解决这一弱点。AMD 对计算托盘、scale-up 拓扑、scale-out 网络、机架形态、供电、冷却方案和相关软件进行定义。

这一时机也反映出 CDNA 5 的到来,这是 AMD 最新的专用数据中心计算架构。MI455X 采用八个以 2 nm 工艺制造的计算 chiplet,并将其置于两个 3 nm fabric-and-cache die 之上。

另有两个 I/O die 负责管理外部通信。12 层 HBM4 堆叠环绕逻辑组件,高级封装技术则将这些组件连接为单个加速器模块。

这种 chiplet 设计使 AMD 能够使用不同制造工艺优化不同功能。计算密度、内存接口、缓存和网络并不都需要相同的硅特性。

MI455X 包含 3,200 亿个晶体管和 256 个 work group processor。一个 work group processor 用于组织处理 AI 与科学计算操作组的执行资源。

AMD 面向低精度 AI 计算支持 MXFP4、MXFP6、MXFP8 和 FP8 等格式。这些格式以更少位数表示模型数值,在应用可保持可接受精度时提升吞吐量。

该加速器的 MXFP4 运算标称峰值可达 40.3 petaflops。整个机架方面,AMD 宣称其峰值 FP4 性能最高为 2.9 exaflops,FP8 性能则为 1.4 exaflops。

这些数字是理论峰值,而非完整模型的实测结果。不过,它们解释了为何机架级集成会与 MI455X 同步推出。

如今,单个加速器传输的数据量和消耗的功率已经足够大,以至于其周边系统决定了应用能否利用可用算力。AMD 需要 Helios,才能在有意义的规模上展现 CDNA 5 的能力。

该公司还在 2025 年收购了 ZT Systems,获得了超大规模机架设计方面的工程经验。AMD 后来剥离了制造业务,从而限制了与既有服务器合作伙伴的直接竞争。

这笔交易为 AMD 带来了更深入的系统专业能力,同时无需让其成为 Helios 的唯一供应商。HPE、Supermicro、云服务商和其他合作伙伴均可基于该参考设计构建产品。

Microsoft 已宣布计划在其数据中心部署 Helios。HPE 此前也承诺采用该架构,为 AMD 进入超大规模与企业基础设施开辟了路径。

AMD 在 CES 上表示,Helios 将成为规模更大 AI 系统的蓝图。其 rack-scale preview 将这一设计与训练、推理及未来多机架部署联系起来。

因此,压力并不只来自 Nvidia。服务器制造商必须决定采用多少 AMD 工程设计,而云服务商则必须判断开放参考平台能否降低集成风险。

芯片供应商也面临新的采购模式。客户日益将加速器视为完整系统的组成部分,而不是具有孤立基准分数、可以互换的卡。

开放式 Ethernet 是 AMD 对 Nvidia 的主要挑战

核心较量是 AMD 的开放式 Ethernet 机架与 Nvidia 垂直控制的 NVLink 平台之间的竞争。

Helios 在若干重要方面与 Nvidia Vera Rubin NVL72 相似。两者均将 72 个加速器布置在 18 个液冷计算托盘中,并且都使用专用交换托盘进行高带宽通信。

差异在于对 scale-up 网络的控制。Nvidia 将 NVLink 和 NVLink 交换集成至其平台,使公司能够直接掌控协议、芯片、拓扑和软件集成。

AMD 则采用通过 Ethernet 承载的开放式加速器互连。Broadcom 提供 Tomahawk 6 交换芯片,UALink 则定义加速器如何通过该网络进行通信。

这一选择使 AMD 能够采用商用网络技术,而不是专有交换架构。系统厂商和超大规模运营商可利用熟悉的 Ethernet 工具、供应商与运营实践。

开放并不意味着无需工程工作即可替换每一个组件。Scale-up 网络对延迟、拥塞、可靠性、同步和软件均有严格要求。

不过,已发布的接口为合作伙伴提供了更多定制机架的空间。云服务商可以调整网络、管理或部署选择,而不必在每一层都依赖单一供应商。

Broadcom 的作用让这一主张更加具体。Tomahawk 6 提供 512 条 200 Gbps 通道,容量足以按 AMD 所称的 scale-up 速率为 72 块 GPU 提供连接。

Helios architecture report 显示了这一合作关系的重要性。AMD 的硬件产品组合覆盖广泛,但该公司无需制造每一个组件,也能掌控系统设计。

这形成了一种基于联盟的 Nvidia 替代方案。AMD 提供 GPU、CPU、Pensando 网络设备、软件和平台工程;Broadcom 提供核心 scale-up 交换芯片。

随后,HPE 和其他制造商可将这一蓝图转化为系统。云运营商则能部署这些系统,同时对网络与软件选择保留更多影响力。

Nvidia 提出了相反的主张。其更紧密的集成减少了外部变量数量,并为客户提供由单一供应商优化的平台。

这种控制可以简化性能调优。Nvidia 可以通过一条统一路线图协调 GPU 行为、交换芯片、通信库、驱动程序、网络和应用框架。

AMD 押注于开放标准能够在不要求一家公司掌控每个环节的前提下实现相近效率。这一主张必须经受真实工作负载的检验,而不只是拓扑图。

两套系统在机架之外也有所不同。Helios 为每个加速器配备三个 800 Gbps Vulcano 接口,使每块 GPU 的横向扩展带宽达到 2.4 Tbps。

已公布的 Vera Rubin 配置则为每块 GPU 配备一个 1.6 Tbps ConnectX-9 接口。因此,AMD 宣称其每个加速器的横向扩展带宽高出 50%。

在假设软件能够高效利用这些链路的情况下,这一对比有利于跨多个机架运行的工作负载。当单个机架无法容纳整个工作负载时,大型训练任务和分布式推理服务都依赖这一层。

AMD 还宣称拥有更大的内存容量和带宽。Helios 在整个机架中提供 31 TB HBM4,而 AMD 表示,这比竞争的 Nvidia 平台高出 50% 的容量。

内存容量可以减少模型切分,并为键值缓存留出更多空间。键值缓存会存储注意力数据,使推理系统能够生成后续 token,而无需重新计算此前的上下文。

这一优势尤其适用于长上下文推理和同时服务大量并发请求的模型。然而,容量本身并不能决定延迟或吞吐量。

软件调度、内核质量、通信效率和工作负载形态,仍决定了有多少有效性能能真正交付给客户。对于许多 AI 团队而言,Nvidia 的 CUDA 环境仍是成熟的参考标准。

ROCm 在近几代 Instinct 产品中已有改进,主流框架如今也支持 AMD 硬件。但 Helios 对 AMD 提出了更高要求:必须让 72 个加速器作为一个平台稳定、可预测地运行。

因此,开放与受控之争并非哲学问题。它是一个可量化的问题:基于合作伙伴的架构能否匹配一体化平台实际交付的性能和可靠性。

规格参数无法决定性能

在独立的机架级测试加以确认之前,AMD 最强劲的数据仍属于厂商主张。

AMD 宣称,Helios 的每个加速器峰值 FP4 性能比领先的竞争系统高出 15%。该公司还预计,其 token 经济性最高可提升 30%。

这些主张需要谨慎解读。峰值 FP4 算力描述的是理想条件下支持的最快低精度运算,而非已部署模型的持续运行速度。

每美元 token 数的比较则需要更多假设。硬件利用率、电力、冷却、软件许可、人力、模型准确率、批量大小和系统可用性都会影响结果。

AMD 尚未以足以支持中立总体拥有成本比较的形式披露公开定价。买家也会根据不同规模协商硬件、支持、网络和部署协议。

机架级数据让性能叙事更加复杂。AMD 列出的 Helios 峰值 FP4 性能为 2.9 exaflops,而 Nvidia 已公布 Vera Rubin NVL72 的机架级数据更高,达到 3.6 exaflops。

这些数字背后的定义可能不同。Nvidia 的结果可能纳入了适合某些推理任务的压缩行为,而 AMD 强调的是原始支持精度下的速率。

The Register 的机架对比指出了这一差异。一些工作负载可从 Nvidia 的自适应压缩中受益,而另一些则需要与 AMD 未压缩数据更为接近的计算方式。

两种比较都不能代表普遍适用的赢家。训练、微调、稠密推理、混合专家模型和长上下文服务会以不同方式对硬件施加压力。

混合专家模型会为每个 token 仅激活部分参数组。它可以减少计算量,但也会在 GPU 之间产生高要求的通信模式。

当内存容量或横向扩展带宽限制应用时,Helios 可能表现出色。当 Nvidia 的软件栈能够从较低的名义资源中提取更多工作量时,Nvidia 可能仍保有优势。

同样的谨慎也适用于 AMD 对单跳内存的表述。Helios 提供了紧密互联的 HBM 域,但并不会把 72 个物理内存池变成一个传统的统一内存设备。

软件仍必须理解数据放置、加速器归属、同步和通信成本。经由交换芯片进行的远程 HBM 访问,其行为并不像单个 GPU 封装内部的本地访问。

除带宽外,延迟也很重要。AMD 公布了令人印象深刻的总吞吐量,但详细的应用结果将揭示该互连网络在争用和不规则流量下的表现。

可靠性带来了另一项挑战。一个 72 GPU 机架将加速器、处理器、交换机、网络接口、冷却连接、电力组件、线缆和软件组合成一个运行域。

当工作负载将机架视为一个系统时,故障的代价会变得更高。运营方需要故障隔离、遥测、检查点、可维护性以及可预测的恢复流程。

双宽机架也带来了设施限制。其 225 kW 至 245 kW 的功耗范围超过了许多现有企业数据中心机房的容量。

在这种密度下,液冷是强制要求。买家需要合适的冷却液分配系统、电力转换、地板承重、维护通道和训练有素的运维团队。

这些要求并不会使 Helios 相比所有竞争对手处于劣势。Nvidia 的机架级系统也有类似的基础设施需求。

但它们确实限制了可触达市场。Helios 初期适合超大规模数据中心、专业 AI 设施、国家实验室,以及为高密度液冷设备设计的场所。

软件仍是最大的不确定变量。ROCm 必须支持该机架的拓扑,同时达到开发者对成熟 Nvidia 部署所期待的易用性和性能。

客户将需要稳定的集体通信、优化的内核、框架集成、可观测性、编排能力,以及对新模型架构的快速支持。

AMD 对这一路径的控制力比过去更强。拥有处理器、加速器、网络接口和参考系统,使其工程师有更多机会消除跨供应商问题。

但控制力不会立即带来成熟度。首批生产部署将暴露出展示基准测试和参考设计无法预见的问题。

Helios 对买家的压力不亚于 Nvidia

Helios 为基础设施买家提供了第二条机架级路径,但也使其评估工作更具挑战。

可信的替代方案能够提升议价能力。超大规模云厂商不再只能把一套一体化 Nvidia 机架与一组独立组装的 AMD 服务器进行比较。

它们可以比较两种具有相近物理雄心的 72 GPU 机架架构。二者都是面向数据中心规模训练和推理的协同平台。

这使采购比较更具意义。买家可以考察每机架内存、纵向扩展带宽、横向扩展带宽、功耗、冷却、软件成熟度、可维护性和工作负载结果。

AMD ServeTheHome 的深度分析也凸显了供应链选择的重要性。Broadcom 交换芯片和开放机架标准为制造商留出了更大空间,以差异化其实现方案。

HPE 可以将 Helios 与自身的系统工程能力和 Juniper 网络专业知识结合。Supermicro 则可以面向已经运行其液冷平台的客户。

云服务商可以通过托管服务提供 MI455X 容量,减少较小客户自行安装实体机架的需求。

AMD 从这一模式中获得了更广的覆盖范围,但也依赖合作伙伴稳定执行。一家制造商的整合不佳,可能损害外界对整个广泛平台的认知。

Nvidia 的受控设计限制了这种差异。客户的架构选择更少,但也能获得更统一的应用调优和支持目标。

因此,企业买家不应将开放性视为自动降低成本。只有当组织具备利用定制化的工程能力时,定制化才会创造价值。

一家通过托管云服务运行标准模型的公司,可能比起底层交换机供应商,更关心实际交付的 token 数量和可用性。

一家构建定制网络与调度软件的超大规模云厂商,则可能更看重已公开的接口和商用芯片。

使用内存超过单台服务器容量的模型的研究人员,可以受益于 Helios 的 31 TB HBM 域。同样的容量也能支持更大的推理缓存和更多并发请求。

开发者应当关注,因为硬件多样性会影响软件可移植性。第二种可行的机架架构,会让框架项目和模型供应商有更强理由在 CUDA 之外进行优化。

这一过程不会自动发生。应用团队必须验证内核、数值行为、通信库、容器镜像、监控工具和部署工作流。

更广泛的行业也将从标准之争中受益。UALink 和 Ultra Ethernet 现在拥有一个备受瞩目的系统,可在高要求 AI 工作负载下衡量其性能。

成功将鼓励更多交换机供应商、加速器设计商和系统构建商参与。结果不佳则会强化专有集成的理由。

AMD 也在给自身施压。每年推出加速器意味着机架设计、网络、软件和制造链必须按同一进度推进。

一个组件延迟就可能拖慢整个系统。只有当加速器、CPU、交换机、网络接口、冷却、固件、驱动程序和框架协同工作时,平台才算准备就绪。

该公司表示 Helios 已进入生产阶段,预计将在 2026 年第三季度末前出货。这一时间表使其更接近 Nvidia Vera Rubin 的推出时间,而非落后一整代。

时间缩小了 AMD 的传统劣势。但如果软件或供应无法达到客户预期,它也消除了借口。

这份量产公告报道了主要合作伙伴计划中的部署。下一项考验是,这些承诺能否转化为可获得的生产容量。

为评估而安装的机架,并不等同于服务营收型工作负载的设备集群。买家应要求提供持续数周的可重复结果,而不是受控条件下的短暂演示。

三项信号将决定 Helios 是否成功

出货量、独立工作负载结果和多机架可靠性,将决定 Helios 是否改变市场。

第一个信号是量产交付。AMD 预计在第三季度末前交付 Helios,因此客户应关注在 9 月结束前有哪些系统到货。

具名安装很重要,但数量更重要。多个已运行的设备集群将表明 AMD 及其合作伙伴能够获得 HBM4、封装 MI455X 设备、组装机架,并完成液冷站点的部署调试。

延误将削弱 AMD 的时间优势论点。Helios 每多一个季度保持稀缺,Nvidia 的装机基础和量产经验就会变得更有价值。

第二个信号是独立应用基准测试。评测机构需要获得当前语言模型、混合专家(MoE)工作负载、微调任务和长上下文推理的完整机架测试结果。

有价值的测试应报告延迟、吞吐量、功耗、利用率、准确性和故障表现。仅凭峰值算力无法说明,在真实工作负载中,72 块 GPU 是否能够持续保持忙碌。

基准测试还应比较软件投入。一套需要数周定制内核开发的平台,或许能交出亮眼的硬件成绩,却会增加项目风险。

最有参考价值的比较将采用相匹配的模型、批量大小、数值格式和服务等级目标。否则,供应商可以挑选有利于自身架构的设置。

结果应涵盖内存密集型和计算密集型工作负载。如果应用能够同时利用这两项能力,且不会产生过高的通信开销,Helios 的容量和带宽主张将更具说服力。

第三个信号是可靠的多机架扩展能力。单个 Helios 机架测试的是基于以太网的 UALink;而更大规模的部署还将测试 Pensando Vulcano 接口及其周边的 Ultra Ethernet 网络。

AMD 必须证明,当任务跨越机架边界时,性能依然可预测。在这一规模下,拥塞、集合通信、任务调度和组件故障都会变得更加棘手。

大型客户将关注故障加速器或网络链路能够多快被隔离。他们还会衡量任务能否继续运行、重启,或从最近的检查点恢复。

强劲的多机架测试结果将支持 AMD 的开放网络理念。这将表明,商用交换设备、开放规范和合作伙伴工程能力能够交付一个协调统一的 AI 系统。

扩展能力疲弱则会有利于 Nvidia 更紧密的整合模式。这将意味着,对整个网络架构的控制仍能带来规范本身无法体现的运营优势。

这些信号应影响读者对未来 AMD ServeTheHome 报道的解读。新的架构图和峰值数据会很有用,但生产环境证据如今比架构意图更有分量。

Helios 不只是另一台 Instinct 服务器。它是 AMD 试图将其长期积累的数据中心资产整合为一款具有竞争力产品的尝试。

MI455X 提供低精度计算能力和 432 GB HBM4。Venice 负责主机处理,Pensando 提供横向扩展网络,ROCm 则将系统连接到 AI 框架。

Broadcom 的 Tomahawk 6 芯片为 72 个加速器提供核心互连。Open Rack Wide 硬件则为制造商提供共同的物理基础。

这一组合使 Helios 成为 AMD 对 Nvidia AI 基础设施战略最完整的挑战。它也让 AMD 面临更严苛的评判标准。

客户将不再只根据加速器规格评判这家公司。他们会将机架可用性、应用性能、软件质量、设施要求、可靠性和支持服务视为一个整体来评估。

下一个问题很实际:当 Helios 进入生产数据中心后,独立运营商能否复现 AMD 的主张?请关注首批大型部署,比较完整工作负载的测试结果,并观察开放以太网在超出单机架规模后是否仍能保持效率。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page