top of page

AMD 与 Google Cloud 的竞争加剧,Helios 挑战 Nvidia

8月2日
讀畢需時 14 分鐘

AMD 已推出首个完整的机架级 AI 平台,使 AMD Google 相关讨论转向一场围绕谁将主导数据中心架构的直接竞争。

Helios 系统结合了 72 个 Instinct MI455X 加速器、18 个 EPYC 处理器、Pensando 网络以及 AMD 的 ROCm 软件环境。AMD 于 2026 年 7 月 23 日的 Advancing AI 活动上展示了这一量产设计。

此次发布改变了 AMD 在市场中的定位。它不再只是向超大规模云厂商提供一组组件,由客户围绕其他公司的网络和软件自行集成。Helios 为 AMD 提供了一个协同设计的机架,可与 Nvidia 的 NVL72 系统以及支撑 Google 张量处理单元的垂直整合基础设施竞争。

其核心规格颇为可观。一台 Helios 机架的加速器合计配备约 31 TB HBM4,即第四代高带宽内存。AMD 标称其峰值 FP4 算力为 2.9 exaflops;FP4 是一种常用于 AI 推理的低精度格式。

不过,这些数据并不能决定竞争胜负。Nvidia 仍拥有更强的开发者环境、更庞大的装机基础,以及成熟的机架级部署模式。Google 则掌控自己的模型、云平台、网络和定制 TPU 路线图。

AMD 的转变更具针对性。该公司已从销售替代型加速器,转向提出一种替代性的数据中心设计。客户如今必须判断:开放的多厂商机架能否抵消高度受控平台在运营上的优势。

AMD 与 Google Cloud 的竞争正超越单颗芯片

Helios 的发布意味着,完整机架而非单个加速器,成为 AMD 的主要竞争单元。

现代 AI 集群无法仅靠将高速 GPU 装入传统服务器来获得实用性能。数百乃至数千个加速器必须以持续的低延迟交换模型参数、激活值和缓存数据。

机架级架构将整台机柜视为一个协同工作的计算系统。计算托盘、主机处理器、内存、散热、供电、交换机和软件均被一体化设计。

AMD 的 Helios platform 使用通过以太网连接的 UALink,将 72 个 Instinct MI455X GPU 互连起来。UALink 是一种获得行业支持的互连技术,旨在为来自多家厂商的加速器提供高速通信。

根据 AMD 公布的规格,每个 MI455X 配备 432 GB HBM4,内存带宽最高可达每秒 23.3 TB。HBM 将堆叠内存置于靠近处理器的位置,从而减少移动模型数据带来的延迟。

该机架还包括 18 个 EPYC “Venice” CPU 和 Pensando Vulcano 网络接口。其外部横向扩展网络采用 Ultra Ethernet,这是一项面向大型 AI 和高性能计算集群的开放规范。

这些细节之所以重要,是因为数据移动正日益决定 AI 可用性能。处理器可以宣称极高的峰值吞吐量,却可能在部分运行时间里等待内存或另一颗加速器。

更大的内存池也让系统能够在靠近处理器的位置保留更多模型权重和键值缓存数据。键值缓存会存储推理过程中生成的信息,使模型不必为每个 token 重新计算整段对话。

这一能力对于长提示词、编程代理、研究系统,以及在返回答案前生成多个备选结果的模型尤为重要。即使底层模型不变,这些工作负载也可能迅速消耗内存。

因此,AMD 与 Google 的比较远不止于 GPU 性能。Google 的 TPU 系统采用定制加速器、专有互连和针对 Google 云及模型开发环境优化的软件。

由于 Google 掌控这些层级,因此可以协同调优。AMD 则主张,客户可以在保留服务器制造商、网络供应商、云平台和软件框架选择权的同时,获得相近的系统协同性。

Google Cloud 尚未宣布将 Helios 作为核心加速器平台。其 2026 infrastructure roadmap 强调 Google TPU、Nvidia 系统,以及采用 AMD 和 Intel CPU 的通用虚拟机。

这一区别应当保持明确。Google 参与 AMD 更广泛的基础设施生态,但 Helios 目前并非 Google Cloud AI 加速器战略的基础。

相关压力来自客户预期。如果 AMD 证明开放式机架级系统能够高效运行,采购方可能会向每一家云服务商要求类似的灵活性。

对于搜索 AMD Helios 详解的开发者而言,最简单的答案是:AMD 已将机柜、网络、处理器和软件整合为一个可部署的设计。更难的问题在于,运营方能否在经过精心筛选的演示之外实现其承诺的性能。

Helios 让 AMD 成为系统级竞争者

AMD 最重要的变化在于组织层面:该公司现在必须交付一套完整的 AI 基础设施操作体系,而不只是具备竞争力的芯片。

AMD 主要通过 EPYC 服务器处理器建立其数据中心地位。之后,其 Instinct 加速器为云服务商提供了第二个 AI 算力来源,尤其是在 Nvidia 产能无法满足需求时。

Helios 让该公司进一步向技术栈上层延伸。AMD 必须协调处理器设计、加速器封装、网络、固件、编译器、库、集群管理、散热和可维护性。

这一模式类似于 Nvidia 通过 DGX 及其 NVL 机架系统采取的路径。Nvidia 将 GPU 与 NVLink、网络、CUDA 库、参考系统和部署指导相结合,从芯片供应商转型为数据中心平台公司。

AMD 通过不同的治理方式追求同样的结果。它将 ROCm 推广为开放软件环境,并使 Helios 基于 Open Compute Project 硬件规范。

Open Compute Project 发布可供制造商和运营商适配的数据中心设计。这种方式可以降低对单一供应商的依赖,但“开放”并不自动意味着可互换或易于运维。

AMD 还采用了其他芯片和设备公司支持的网络标准。这让原始设备制造商能够整合商用交换机及其自有管理工具。

实际好处在于议价能力。云服务商可以采用 AMD 加速器,而不必将周边所有层级都交给 AMD。

相应的负担则是集成。当专有系统出现故障时,平台所有者对诊断问题负有更明确的责任。开放系统则可能将这一责任分散给加速器供应商、交换机供应商、服务器制造商、软件团队和云运营商。

AMD 正通过超越试用阶段的客户承诺来回应这一担忧。Meta 已同意在多个硬件世代中部署最高达 6 GW 的 AMD Instinct 容量。

根据 Meta deployment,支持 Meta 首个 1 GW 部署的出货原计划于 2026 年下半年开始。初始部署采用定制的 MI450 系列加速器、Venice CPU、Helios 架构和 ROCm 软件。

Anthropic 另行承诺将在 Helios 系统中部署最高达 2 GW 的 MI450 系列 GPU。其首个 1 GW 部署计划于 2027 年上半年启动。

这项 Anthropic agreement 尤其具有意义,因为 Anthropic 训练并提供前沿模型服务。其工作负载应能暴露内存管理、集合通信、编译器行为和大规模集群可靠性方面的弱点。

Microsoft 也表示将通过 Azure 部署 Helios。Cerebras 计划在其数据中心部署 Helios 系统,并将其与晶圆级推理技术结合。

这些承诺回答了围绕 AMD Helios 详解报道的一个问题。Helios 并非只是等待客户采用的参考架构图。多家大型运营商已为其制定部署计划。

但它们并未回答这些安装项目能否按预期时间表、利用率或经济效益达成目标。GW 级承诺描述的是潜在基础设施规模,而非已交付的计算能力。

建设大型 AI 集群需要电力接入、散热设备、施工、网络、内存供应以及可正常运行的软件。任何一个组件延迟,都可能阻止名义上可用的加速器产出可计费的 token。

因此,AMD 已进入一项要求更高的业务。其成功将取决于完整集群的交付和工作负载性能,而非单个芯片的出货量。

AMD 与 Nvidia 的 AI 之争如今是机架级对抗

Nvidia 仍是主要对手,因为 Helios 直接挑战了该公司最强的优势:对完整加速计算技术栈的控制。

Nvidia 的优势始于 CUDA——其 GPU 计算编程平台。CUDA 包括编译器、库、调试工具和开发者多年来一直使用的优化内核。

由此形成的软件基础带来了转换成本。一个以通用框架编写的模型在技术上或许可以运行于不同加速器上,但其定制操作和部署工具仍可能依赖 Nvidia 软件。

ROCm 支持主流 AI 框架,并在连续版本中不断改进。AMD 还发布了用于训练、推理、通信和模型服务的迁移工具与优化库。

软件对等性仍取决于具体工作负载。标准基准测试可能表现良好,但内部生产模型仍可能遇到不受支持的操作、不稳定的内核或更慢的编译速度。

这正是为何 AMD 与 Nvidia 的 AI 之争无法通过单一峰值性能数字定论。采购方需要涵盖模型准确性、token 吞吐量、延迟、功耗、运维人员时间和集群可用性的测量结果。

Helios 在若干物理维度上看起来具有竞争力。其 72 个 MI455X 加速器提供约 31 TB HBM4,使该机架拥有庞大的本地内存池。

AMD 声称,MI455X 每个设备可提供 40.3 petaflops 的峰值 FP4 性能。将这一数字乘以 72 个加速器,即得到 Helios 宣传的 2.9 exaflops。

Nvidia 为其搭载 72 个 GPU 的 Vera Rubin NVL72 配置公布了更高的机架级 FP4 数字。对这些说法的独立审查发现,在厂商公布的测量口径下,AMD 的单 GPU 优势并未转化为更高的机架总性能。

这项 rack comparison 说明了一个反复出现的基准测试问题。供应商可以选择设备级或系统级分母、不同的数值格式,以及有利的工作负载假设。

峰值理论运算能力同样未计入通信停顿和软件开销。即使标称算力较低,只要软件和网络能让更多处理器保持忙碌,系统也可能更快完成一次模型运行。

因此,Nvidia 的优势不止于原始吞吐量。其系统具备成熟明确的部署模式、经验丰富的运维人员,以及对商业 AI 软件的广泛支持。

AMD 的反驳重点在于内存、标准和客户自主权。Helios 为买家提供集成化系统,同时避免让每个接口都依赖单一专有供应商。

这是一个可信的差异点,但并非毫无代价的优势。开放标准往往要求多家供应商在同步的时间表上推出兼容产品。

Nvidia 可以在同一份路线图中同步调整处理器、互连、交换机和软件库。AMD 则必须协调 UALink、Ultra Ethernet、服务器制造商、交换机供应商、内存供应商和云运营商。

AMD 与 Nvidia 的 AI 竞争,部分将由执行纪律决定。AMD 需要合作伙伴把规格转化为可重复部署的安装方案;而 Nvidia 则必须证明,其集成化方式值得以更严格的平台控制为代价。

Google 则提供了另一条竞争路径。其 TPU 基础设施并不试图打造一个可由所有云厂商部署的商用 GPU 平台。Google 构建定制系统,主要服务于自家云服务和内部 AI 工作负载。

这让 Google 在模型研究人员、编译器团队、芯片设计师和数据中心工程师之间形成了异常直接的反馈闭环。它可以围绕预期服务的工作负载模式优化硬件。

不过,选择 TPU 的客户也接受了与 Google Cloud 更紧密的绑定关系。将相同工作负载迁移到其他平台,可能需要不同的硬件假设、软件调优和运维方式。

因此,AMD 与 Google 的问题并不只是哪个处理器更快,而是买家是否更偏好云厂商专属的垂直技术栈,还是围绕开放接口构建的可移植基础设施。

Nvidia 占据第三种位置。它向多个云平台销售高度集成的平台,使 CUDA 能在不同服务商之间移植,同时让加速器环境仍与 Nvidia 紧密绑定。

AMD 必须破解这一三重难题:既要提供足够的集成度以实现类似 Nvidia 的运行体验,也要保持足够开放以区别于 Nvidia,还要具备足够的云端可用性来与 Google 的基础设施覆盖范围竞争。

这些规格仍需生产环境验证

Helios 是 AMD 迄今最强的数据中心设计,但其大多数关键主张仍属于工程预测,而非持续的生产环境成果。

AMD 的产品页面使用峰值理论吞吐量和内部工程估算来描述 MI455X。这些数字提供了有价值的上限参考,但客户很少能让大型模型以该上限运行。

生产系统会遭遇功率限制、网络拥塞、组件故障、检查点保存、软件更新以及不均衡的请求模式。这些因素决定了购买的算力中有多少能转化为有效工作。

Helios 还依赖直连液冷。液冷比传统风冷系统更高效地散热,但需要兼容的场地、分配单元、监控和维护流程。

许多大型运营商已经为高密度 AI 集群采用液冷。使用传统服务器机房的企业,可能需要进行更大规模的基础设施改造。

可维护性是另一项考验。Helios 设计将 72 个加速器分布在可重复配置的四 GPU 托盘中,理论上可让技术人员无需重建整个机架即可更换组件。

实际维修时间取决于故障隔离能力和备件供应情况。运营商需要遥测能力,以判断性能下降究竟源于 GPU、线缆、交换机、固件层,还是集合通信库。

内存供应带来了另一层不确定性。每个 Helios 机架包含 31 TB HBM4,而超大规模客户的承诺意味着对大量先进内存和封装产能的需求。

AMD 依赖外部制造和内存合作伙伴。如果封装良率或 HBM 出货量限制了完整系统的交付,再强的加速器设计也无法达到部署目标。

该公司的主要客户协议也包含面向未来的时间表。Meta 的首次部署将于 2026 年下半年启动,而 Anthropic 的部署则将在 2027 年上半年开始。

这些时间表意味着,目前公开的生产环境证据仍有限。客户应区分已宣布产能、已安装产能、已验收系统,以及实际承载真实流量的加速器。

基准测试披露同样至关重要。AMD 参与了 MLPerf,这是一套在明确条件下衡量训练和推理性能的行业基准测试套件。

未来的 MI455X 结果应包括服务器配置、软件版本、功率设置、精度目标和可用性等级。可比较的提交结果比孤立的公司图表更有意义。

即使标准化基准也无法复现所有生产工作负载。长上下文推理、稀疏混合专家模型、强化学习和智能体系统会产生不同的通信与内存模式。

混合专家模型会针对每个输入激活选定的参数组,而不是使用所有参数。这可以降低计算需求,却会提高路由和通信的复杂性。

AMD 此前曾预测,MI400 系列系统在这类模型上可实现大幅提升。在独立测试复现这些结果之前,买家应将此类提升视为工作负载相关的结果。

ROCm 是另一项核心不确定因素。软件成熟度不能仅凭支持的框架数量来概括,因为企业往往维护自定义内核和内部部署系统。

迁移成本包括代码修改、验证、监控更新、人员培训,以及过渡期间所需的并行容量。如果工程团队花费数月修复生产流水线,较低的硬件成本优势可能会消失。

因此,评估 AMD Helios 的开发者应审查软件物料清单,而不只是加速器规格。他们需要了解受支持的框架版本、内核覆盖范围、通信库、可观测性工具和升级处理流程。

Google 和 Nvidia 都受益于成熟的运营闭环。Google 根据内部服务调优其基础设施,而 Nvidia 则从庞大的开发者和云合作伙伴群体中获得反馈。

AMD 现在已拥有建立类似闭环所需的客户。Meta、Microsoft、Anthropic、Oracle 和 Cerebras 代表着不同的工作负载,可暴露平台的不同弱点。

最强的信号不会是又一则合作公告,而是这些客户在运行首批系统后扩大部署的证据。

这种区分使分析保持务实。Helios 证明 AMD 有能力设计出严肃的机架级竞争产品,但尚未证明该公司能够以相当的生产效率交付并支持这些机架。

AMD 与 Google 的竞争接下来将揭示什么

三个近期信号将决定 Helios 是成为持久的平台,还是仅作为部分客户可用的第二供应来源。

第一个信号是 2026 年下半年的初始量产爬坡。AMD 及其合作伙伴需要交付完整系统、将其安装在已准备好的设施中,并推动客户工作负载走出测试阶段。

出货量固然重要,但验收更重要。停放在暂存环境中的机架,无法验证性能、可靠性或运维准备程度。

Meta 和 Microsoft 运行持续性生产工作负载的证据,将增强 AMD 的论点。硬件交付与有效部署之间的延迟,则会暴露集成或设施方面的限制。

投资者和买家应仔细关注 AMD 的表述。产品出货、客户验收、收入确认、已安装产能和活跃工作负载,描述的是不同阶段。

第二个信号是可由独立方进行比较的 MI455X 性能。公开结果应覆盖多种模型类型下的训练和推理测试。

有价值的比较应在系统层面报告吞吐量、延迟、能耗和内存表现。单设备主张不应替代对 72 加速器机架的测量。

这一信号可迅速增强或削弱 AMD 与 Nvidia 的 AI 竞争论点。具有竞争力的工作负载结果将表明,Helios 能将其内存和互连设计转化为可用性能。

若峰值主张与实测输出之间存在明显差距,则会强化 Nvidia 在软件和集成方面的优势。不同框架之间结果不一致,则可能指向 ROCm 的优化缺口。

第三个信号是重复采购。Meta、Anthropic、Microsoft 及其他早期客户已经作出了可观的需求承诺。

第二阶段部署将表明该平台达到了运维和经济性目标。若计划产能被低调削减,则意味着相反的结果。

Google Cloud 的回应同样值得关注。Google 无需采用 Helios,也能影响 AMD 的前景。

它可以扩大 TPU 的可用性、提升与常用 AI 框架的兼容性,或提供更灵活的 Nvidia 及其他处理器访问方式。这些举措将使 Google Cloud 成为寻求替代方案、但不希望自行管理机架基础设施的客户更强有力的选择。

反过来,Google 对 AMD 加速器提供更广泛的支持,将提升云端可移植性,并降低投入 ROCm 的风险。在两家公司宣布之前,不应假定存在任何此类 Helios 部署。

因此,AMD 与 Google 的竞争揭示了基础设施采购中的更大转变。客户不再只是比较孤立的加速器规格,而是在不同的算力治理模式之间作出选择。

Google 提供垂直整合的云和定制加速器路径。Nvidia 提供可通过众多云服务商和系统供应商获得的集成化商用平台。AMD 则提出可由合作伙伴调整的开放机架架构。

每种模式都以一种控制形式交换另一种控制形式。垂直整合可以简化优化,但会增加平台依赖;开放接口可以保留选择权,但会提高协调成本。

对开发者而言,直接影响很实际。硬件多样化将使可移植性、性能剖析和针对工作负载的基准测试变得更有价值。

在可行的情况下,团队应将模型逻辑与特定供应商的内核分离。同时,还应保留可复现的评估集,以便依据准确率和服务等级要求衡量迁移效果。

基础设施买家应在完整集群层面要求提供生产环境证据。处理器基准无法揭示网络超额订阅、冷却限制、恢复行为或运维工作量。

他们还应明确由哪一方负责处理系统级问题。开放架构只有在支持合同和诊断责任清晰的情况下才真正有帮助。

知识工作者将间接受到这场竞争的影响。更多基础设施选择可以扩大模型可用性,并减少对单一算力供应商的依赖。

不过,结果并不会自动带来更低延迟或更广泛的访问。服务商必须将硬件产能转化为可靠服务,应用也必须高效利用这些产能。

持续追踪不断增加的规格信息、基准测试资质和部署公告可能颇为困难。一个可搜索的技术知识库可以帮助工程团队保留基础设施决策背后的证据。

Helios 已经改变了竞争格局。AMD 现在可以拿出一套完整的机架方案,与 Nvidia 的机架系统以及 Google 垂直整合的 AI 基础设施抗衡。

下一阶段则没那么引人注目。客户必须安装设备、迁移软件、运行模型、修复故障,并决定是否继续追加订单。

这才是读者应持续关注的检验标准。观察已被接受的生产能力、可比的系统基准测试,以及重复部署情况。这些信号结合起来,将表明 AMD 只是打造了又一种加速器选择,还是形成了持久的数据中心平台替代方案。

随着 AMD 与 Google 的竞争持续发展,每当出现新的说法时,不妨问一个简单的问题:它描述的是一项规格、一次出货,还是一项生产工作负载?这种区别将揭示究竟是谁在真正扩大优势。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page