Amazon 与 Google Cloud 竞争加剧,Nvidia 交易令 AWS GPU 计划增至三倍
尽管 AWS 正在开发与之竞争的芯片,Amazon 仍将对 Nvidia 的承诺扩大至额外 200 万颗 GPU,令 Amazon 与 Google Cloud 的竞争进一步升温。这些新增处理器将在 2027 年和 2028 年部署至 AWS 基础设施,叠加在五个月前公布的逾 100 万颗 Nvidia GPU 之上。
这不仅是一笔规模大得多的硬件订单。Amazon 与 Nvidia 正在连接 CPU、内存、网络、开放模型、数据处理、政府系统和仓储机器人。该协议推动双方关系从组件供应迈向联合平台工程。
Google Cloud 和 Microsoft Azure 已在自身基础设施中提供 Nvidia 系统。Amazon 现在必须证明,更深度的 Nvidia 集成能够形成优势,同时又不会削弱其定制芯片战略。Google 也面临压力,因为其正采取类似组合:同时使用 Nvidia 加速器和自主设计芯片。
Amazon 与 Nvidia 的合作超越芯片订单
这 200 万颗 GPU 很重要,但更广泛的集成使这项合作具有战略意义。
AWS 和 Nvidia 于 2026 年 8 月 26 日宣布扩大合作。根据双方的 GPU 部署计划,AWS 将在 2027 年和 2028 年引入 Blackwell Ultra、Rubin 和 Rubin Ultra 处理器。
该计划延续了 3 月份覆盖逾 100 万颗 GPU 的承诺。这些处理器包括自 2026 年起进入 AWS 区域的 Blackwell 和 Rubin 架构。综合两次公告,计划部署的 Nvidia GPU 总数超过 300 万颗。
将其称为三倍订单需要一项限定。Amazon 并未以 300 万颗的新订单替代最初的 100 万颗承诺,而是新增了 200 万颗,实际上使已披露的部署计划扩大至三倍。
两家公司均未披露财务条款。巨大的数量并不能确定准确的合同金额,因为配置、交付时间表、网络和服务协议仍不清楚。
合作现已涵盖 Nvidia Vera CPU,这是一类面向 AI 服务器设计的通用处理器。AWS 计划在现有 CPU 和加速器选项之外提供基于 Vera 的基础设施。
Amazon 的 Annapurna Labs 还将与 Nvidia 的 NVLink Fusion 架构及定制高带宽内存展开合作。NVLink Fusion 可连接大型 AI 系统内的处理器与加速器,减少芯片间通信瓶颈。
这一集成尤其值得关注,因为 Annapurna 开发的是 Amazon 自有的 Trainium 加速器。AWS 实际上正利用 Nvidia 系统架构的一部分,让其内部芯片在机架规模上更具竞争力。
双方还在将 Nvidia 软件与 AWS 服务连接起来。Nemotron 开放模型将继续通过 Amazon Bedrock 和 SageMaker 提供。Nvidia 数据处理库将支持 Amazon EMR 和 OpenSearch 工作负载。
Amazon Robotics 提供了最具体的实体应用场景。它将使用 Nvidia Jetson 硬件、Omniverse 仿真库和 Isaac 机器人软件,实现仓储自动化。
相关工作包括合成数据生成、机器人训练、路径优化和安全验证。这些系统将运行在 GPU 加速的 Amazon EC2 基础设施上。
AWS 和 Nvidia 还计划为美国政府建设安全 AI 工厂。双方公布的目标包括,在 AWS 基础设施上为联邦和国家安全工作负载部署 10 万颗 GPU。
这些承诺让 Nvidia 更深入地进入 Amazon 的运营环境。这家供应商将影响 AWS 如何连接处理器、处理数据、提供模型以及开发机器人。
Amazon 获得了对 Nvidia 广泛路线图的早期访问权。Nvidia 则获得了一个显著的硬件和软件分发渠道,其覆盖范围远超租用 GPU 实例。
双方关系可追溯至 2010 年,当时 AWS 成为首家提供 Nvidia GPU 的大型云服务提供商。16 年后,这一狭义的基础设施关系已演变为共同的产品战略。
这种转变带来了核心张力。Amazon 希望成为 Nvidia 工作负载的首选云平台,同时也向客户销售围绕 Amazon 芯片构建的替代方案。
为什么 Amazon 与 Google 的竞争正变得更激烈
Amazon 和 Google 正在趋向同一战略:将专有芯片与 Nvidia 系统结合,再围绕整体云架构展开竞争。
Google 多年来一直在为机器学习开发 Tensor Processing Units,即 TPU。Amazon 则沿着自己的路径,推出用于 AI 的 Trainium 和面向通用服务器计算的 Graviton。
两家公司都无法只依赖内部芯片。许多开发者围绕 Nvidia 的 CUDA 软件环境进行开发,因此,GPU 可用性已成为竞争性云平台的基本要求。
这一要求赋予 Nvidia 非同寻常的影响力。AWS、Google Cloud、Microsoft Azure、Oracle 和专业 AI 云服务商都需要获取其系统。每家提供商在部署相似处理器后,都必须寻求差异化。
Amazon 的回答是全栈集成。AWS 正将 Nvidia 加速器与其 Nitro 安全系统、Elastic Fabric Adapter 网络、存储、托管模型服务和定制芯片配对。
Nitro 将大量虚拟化、网络和安全任务转移到专用硬件上。Elastic Fabric Adapter 则在大型训练或推理集群中提供计算节点之间的高速通信。
这些组件对性能的影响可能与加速器本身一样大。拥有更快网络和更高资源利用率的云服务提供商,能够从同级别 GPU 中产出更多计算能力。
Google 正在采取高度相关的做法。其 AI Hypercomputer 战略 将 TPU、Nvidia 加速器、存储、网络和编排整合到一个托管系统中。
Google 已宣布支持 Nvidia Vera Rubin NVL72 系统。它还计划推出 TPU 8t 和 TPU 8i 加速器,以及可跨多个数据中心站点连接多达 100 万颗 TPU 的集群。
Google 的地位部分建立在其对多个层面的掌控之上。它设计芯片、网络、模型和云软件,同时运营能够产生大量 AI 需求的全球消费者服务。
AWS 带来了不同的优势。它拥有广泛的企业云业务覆盖,以及将基础设施组件作为模块化服务提供的丰富经验。
因此,Amazon 与 Google 的竞争并非 Nvidia 对抗专有芯片。两家公司都同时提供 Nvidia 技术和自有加速器。
竞争关键在于客户能否轻松混用这些选择,也在于工作负载能否在它们之间迁移,而无需付出高昂的软件改造成本或承受性能下降。
AWS 表示,其 Nvidia Inference Xfer Library 集成将适用于通过 Elastic Fabric Adapter 连接的 Nvidia GPU 和 Trainium 节点。该库可在不同推理阶段之间传输模型状态。
解耦推理将模型操作分配至不同的计算资源。一组机器可处理输入上下文,另一组则生成输出 token。
迁移用于存储可复用模型上下文的键值缓存,可能带来显著的网络开销。更快的传输可让运营者更高效地使用昂贵的加速器。
如果 AWS 能在一个协调环境中结合 Trainium 和 Nvidia 系统,客户就能获得一条实际可行的迁移路径。他们无需为每种工作负载做出永久性的硬件选择。
Google 通过 TPU 和 GPU 也拥有类似机会。其优势来自成熟的 TPU 部署,以及支撑 Gemini 模型的基础设施。
它面临的挑战是说服外部客户:Google 的集成系统能够像服务 Google 内部工作负载一样有效地服务于他们的模型。AWS 则可以将自身定位为更中立的基础设施提供商。
Microsoft 带来了另一层压力。Azure 表示,其在一年内已部署数十万颗液冷 Grace Blackwell GPU。其 Vera Rubin 部署计划还将 Nvidia 系统与 Microsoft Foundry、Fabric 和实体 AI 工具相连接。
领先云服务商正得出同一个结论:购买加速器只是入场费。竞争优势来自高效运营它,并将其连接至客户已经在使用的服务。
Nvidia 正成为 Amazon 架构的一部分
AWS 并非只是向客户出租 Nvidia GPU;它正允许 Nvidia 技术塑造 Amazon 的定制系统。
Amazon 的定制芯片战略一度看起来是摆脱对 Nvidia 依赖的直接路径。Trainium 提供了替代加速器,而 Inferentia 则瞄准 AI 推理。
扩展后的合作使这种解读变得复杂。Amazon 仍在投资自有芯片,但正将 Nvidia 的网络和内存技术整合到这些芯片周围。
这一选择反映了大型 AI 集群的现实。若网络、内存、电力、存储或软件编排无法同步跟进,加速器便无法高效运行。
Nvidia 多年来一直将其业务转变为平台,而非单一组件产品线。CUDA 依然重要,但该公司如今还提供互连技术、网络设备、CPU、模型、库和机器人软件。
AWS 在不放弃自有处理器的前提下获得这些组件。Nvidia 则获得了对原本可能降低其加速器需求的基础设施的影响力。
这种安排类似于经过协商的相互依赖。Amazon 接受 Nvidia 仍不可或缺,同时 Nvidia 帮助 Amazon 创建包含 Trainium 的混合系统。
这一机制保护 AWS 免受两种相反风险的影响。完全依赖 Nvidia 会使 Amazon 面临供应受限和差异化空间有限的问题。
若强行让客户只使用 Trainium,则会带来另一问题。许多组织已经在使用 Nvidia 软件、模型、库和开发者工具。
异构架构让 AWS 能同时销售两条路径。客户可在兼容性重要时使用 Nvidia GPU,并在经济性或供应情况更有利于 Amazon 硬件时采用 Trainium。
AWS 在此前的 生产级 AI 扩展中强调了这一方法。该公告包含在 GPU 和 Trainium 实例中支持 Nvidia NIXL。
同一公告称,AWS 将自 2026 年起部署逾 100 万颗 Nvidia GPU。它还推出了由 Nvidia 驱动的 EC2 选项,并扩大了对 Nemotron 的支持。
五个月后,新增的 200 万颗 GPU 表明,客户尚未转向远离 Nvidia 硬件。Amazon 和 Nvidia 表示,需求超过了双方此前的预期。
这一说法来自两家公司,尚未经独立审计。不过,Nvidia 的财务业绩为强劲的基础设施需求提供了佐证。
据美联社一篇财报报道称,Nvidia公布的季度数据中心营收为890亿美元。这一结果是上年同期的两倍以上。
据同一篇报道,Nvidia还表示供应受限。黄仁勋告诉分析师,现有供应量只能满足约70%的需求。
稀缺性提升了长期部署协议的战略价值。AWS可以围绕更清晰的硬件时间表规划数据中心、电力、散热和服务。
Nvidia则能更清楚地了解其最大客户之一的需求。这些信息可为多个处理器世代的生产、软件开发和系统设计提供指导。
这项交易也为Vera CPU开辟了路径。Nvidia在AI加速器领域占据主导地位,但通用服务器处理器仍是另一片竞争格局不同的市场。
AWS已提供自家的Graviton处理器,以及Intel和AMD选项。加入Vera后,客户将拥有另一种选择,同时也让Nvidia能够扩大其在每台AI服务器中的份额。
Amazon可能会将Vera限制用于Nvidia整合能够带来明确优势的工作负载。不过,若实现广泛采用,Nvidia将与Graviton形成更直接的竞争。
因此,这项合作在每一层都同时包含协作与冲突。AWS与Nvidia彼此需要,同时两家公司也都在进入对方严防死守的市场。
这才是此次公告背后的真正机制。Amazon正通过选择性整合来管理依赖关系,而非试图彻底消除这种依赖。
这一规模带来财务与运营风险
规划部署数百万块GPU,并不意味着客户一定会持续、按计划且有利润地使用它们。
首个不确定因素是利用率。只有当工作负载足够繁忙,足以证明建设、能源、网络和维护成本合理时,AI加速器才能创造价值。
Amazon表示,更大的承诺由需求推动。但两家公司尚未披露支持各部署阶段的客户合同。
AWS必须提前数年预测需求。最后两百万颗处理器将跨越多代架构和交付窗口,延续至2028年。
客户需求可能迅速变化。训练需求或许会集中在少数模型开发商身上,而企业采用则可能更倾向于规模更小、成本更低的推理系统。
软件效率也在持续提升。更好的模型架构、量化、缓存和调度方式,能够减少完成特定任务所需的计算量。
这些改进并不必然降低基础设施总需求。成本下降往往会推动更广泛的使用。不过,它们确实让长期容量预测变得困难。
第二个不确定因素是执行。安装两百万个加速器远不只是获得芯片那么简单。
数据中心还需要电力、冷却、网络设备、土地、许可、光纤连接和熟练的运营人员。任何一个环节的延误,都可能让昂贵的硬件闲置。
Nvidia已承认其整个制造链都存在供应限制。Amazon的时间表取决于处理器、高带宽内存、封装产能、网络硬件和电力基础设施能否同时到位。
第三个不确定因素涉及集中度。与Nvidia建立更深层的合作关系,能让AWS获得被广泛使用的技术,但也会使更多服务绑定于单一供应商的路线图。
任何影响Rubin或Rubin Ultra的延误,都可能扰乱AWS计划中的容量。软件变更也可能影响横跨计算、网络和托管服务的系统。
Amazon的自研芯片提供了部分对冲。只要客户接受其软件环境和性能特征,Trainium就可以承接相应工作负载。
然而,更深度的整合也会形成新的依赖。NVLink Fusion和Nvidia内存技术能够提升Trainium系统,但也会让Amazon更加依赖Nvidia组件。
第四个不确定因素是客户可移植性。混合式AWS架构可在Amazon云内部提供灵活性,却不一定能让工作负载轻松迁移到其他地方。
客户应审视哪些编排工具、网络功能、模型服务和数据系统会变得不可或缺。仅靠硬件选择并不能防止平台锁定。
Google Cloud和Azure在这方面形成了竞争压力。两者都可在不同的托管环境中提供Nvidia处理器,让成熟买家能够比较的不只是芯片规格。
Google与Nvidia的合作包括G4虚拟机、对Vera Rubin的支持、Dynamo整合,以及Vertex AI中的Nvidia模型。
Google还提供专有TPU。这为买家带来了另一种混合芯片平台,而不是对Nvidia的纯粹替代方案。
Microsoft将Nvidia基础设施与Foundry和Fabric结合,同时加入AMD加速器和内部芯片。Oracle及专业服务商也提供额外的容量选择。
这种竞争应会推动更好的可用性和整合。但它并不保证成本降低,因为需求、能源要求和供应限制依然显著。
政府部署带来进一步审查。AWS和Nvidia计划为Impact Level 6及以上的联邦和国家安全工作负载部署10万块GPU。
这一承诺需要严格的安全控制和漫长的采购流程。它也可能使双方合作受到预算变化、监管、出口政策和政治优先事项调整的影响。
环境压力构成另一项限制。数据中心所在社区越来越多地质疑用电量、用水量、电网扩张和对当地基础设施的影响。
Amazon必须证明已宣布的容量能够获得可靠供电。它还需要说明新设施将如何影响区域资源。
这些风险没有否定需求信号。它们说明,GPU数量不应被视为已经完成的部署,也不应被视为有保证的财务回报。
这项公告描述的是规划中的基础设施。决定性证据将来自已安装容量、客户使用情况、服务可用性和运营利润率。
开发者和企业买家获得更多选择,也面临更多复杂性
这项合作扩大了可用基础设施,但在AWS、Google及其他服务商之间做选择,将需要更深入的工作负载测试。
对开发者而言,直接好处是可能获得更多Nvidia容量。稀缺的加速器可能延误实验、训练任务和生产发布。
AWS计划将这些新处理器分布到其全球基础设施中。区域可用性仍将取决于建设进度和各个EC2服务的上线情况。
不同代际的Nvidia产品适合不同工作负载。Blackwell Ultra面向当前的高端AI系统,而Rubin和Rubin Ultra则代表后续平台世代。
团队不应将每块GPU都视为可互换的产品。内存、网络、数值格式、软件支持和服务器设计,都可能实质性改变应用性能。
对于使用Amazon Bedrock的组织而言,扩展后的模型合作关系很重要。持续支持Nemotron,意味着Nvidia模型将加入一个包含多家开发商模型的目录。
模型可用性并不能决定基础设施选择。组织可能会根据兼容性和运营目标,在Nvidia GPU上提供一个模型,在Trainium上运行另一个模型。
NIXL整合可能让混合环境更具实用性。其设计目标是以更低的通信开销,在分布式资源之间迁移推理状态。
这一能力对推理模型和智能体尤为重要,因为它们可能生成很长的序列并反复调用工具。这些模式消耗的推理容量可能远高于简短的聊天机器人回答。
企业买家应要求基于自身应用的基准测试结果。供应商测试可以展示有价值的工程进展,但很少能复现客户的确切数据和流量。
AWS称,P6-B200实例配备八块Blackwell GPU、1.4TB高带宽内存,以及可达每秒3.2太比特的EFA网络。
该公司还表示,JetBrains观察到,相比基于较旧H200的实例,训练时间缩短了85%以上。这是特定客户的结果,并非普遍性能保证。
Google也报告了其由Nvidia驱动系统的性能提升。其已公布的案例涵盖模拟、模型服务、图像处理和物流应用。
这些比较使用了不同的工作负载和基准。买家不能仅将供应商给出的百分比并列,就判定谁是普遍赢家。
稳妥的评估应衡量吞吐量、延迟、可用性、软件迁移工作量和运营稳定性,也应将闲置容量和数据传输需求纳入考量。
开发仓储或工业系统的团队应关注Amazon Robotics合作。模拟和合成数据可以让工程师在部署实体机器之前测试困难场景。
这项合作将这些工具与Amazon自身的运营环境连接起来。它为Nvidia的物理AI平台提供了一个大规模的宝贵测试案例。
不过,Amazon尚未公布扩展计划带来的部署成果。读者应区分计划中的整合与仓储运营中经过测量的改进。
知识工作者将间接受到影响。更多基础设施可以支持更快的企业智能体、搜索系统、编程助手和多模态应用。
然而,仅靠基础设施增长并不能解决可靠性、隐私或工作流设计问题。智能体仍需要可信数据、明确权限、评估和人工监督。
对于比较amazon google cloud选项的买家而言,决定性问题不是哪家公司宣布了更多芯片,而是哪一个平台能够持续在要求的限制范围内完成特定工作负载。
答案会因应用而异。模型训练、实时推理、科学计算、文档搜索和机器人技术对基础设施提出不同要求。
扩展后的AWS合作提高了竞争基准。Google和Microsoft现在必须展示,在Nvidia和专有系统之间具备可比的供应能力、整合水平和迁移路径。
三个信号将检验这项合作
部署进展、混合芯片采用情况和竞争对手的反应,将决定这项协议是否会改变云计算市场。
第一个信号是GPU的实际可用性。AWS表示,新增的两百万颗处理器将在2027年和2028年间到位。
客户应关注已命名的EC2实例系列、区域上线日期、容量预留和全面可用性。这些细节将显示该计划是否正转化为可用的基础设施。
稳定的一系列上线将加强Amazon的说法,即其能够将大型供应协议转化为可访问的服务。延误则会削弱规模叙事。
第二个信号是Nvidia与Trainium混合系统的采用情况。AWS已描述这些平台之间的技术连接,但客户行为才是更有意义的检验。
应关注在同一推理管线中同时使用两类芯片的生产部署。独立基准测试应显示,NIXL和EFA是否能在真实应用中降低通信开销。
广泛采用混合芯片将支持Amazon的灵活性论点。若客户仍持续选择相互隔离的Nvidia集群,Trainium整合在战略上的重要性将显得较低。
第三个信号是Google Cloud和Microsoft Azure的回应。Google已经计划部署Nvidia Vera Rubin系统,同时扩展其第八代TPU。
微软宣布部署 Vera Rubin,并将整合 Nvidia 软件,同时提供其他加速器选项。两家公司可能都会重点强调容量、利用率和一体化服务。
最具参考价值的回应将包括明确的部署时间表和客户成果。更大的处理器数量固然会引起关注,但若缺少这些细节,所能证明的内容有限。
amazon 与 google 的竞争如今聚焦于编排能力,而非对硬件的独占访问。两家云服务商都能提供 Nvidia 加速器、自研芯片、模型、网络和数据服务。
Amazon 的新优势在于其已公布的 Nvidia 路线图深度与规模。其潜在弱点则是:在推广竞争性芯片的同时,如何维持这一合作关系的复杂性。
Google 的优势在于整合了 TPU、Gemini 和 AI Hypercomputer。其挑战是,在不削弱自研芯片价值主张的前提下,匹配 Amazon 已披露的 Nvidia 容量。
企业应关注这些信号,而不应将此次宣布视为既成定局。应向服务商询问区域部署计划、工作负载基准、可移植性条款以及经过测量的利用率。
随后,应将这些回答与你的实际应用进行比较,而不是只看新闻标题中的 GPU 总量。能够把多样化硬件转化为可靠生产能力的云服务商,才会获得真正有意义的优势。



