AWS 正加大投资以满足需求,但算力仍然紧张
- Ethan Carter

- 1小时前
- 讀畢需時 15 分鐘
尽管今年已承诺投入数千亿美元资本支出,Amazon Web Services 仍在增加基础设施投资,因为需求已超过供给。
AWS CEO Matt Garman 向 Bloomberg 表示,客户希望获得的算力仍多于这家云服务提供商目前能够交付的数量。因此,Amazon 正在其供应链所允许的范围内,尽快建设数据中心、确保关键组件供应并扩展电力接入。
对于一家销售稀缺计算能力的企业而言,这番表态令人安心。但它也暴露了 AI 基础设施热潮背后的核心风险:Amazon 必须提前数年投入资金,同时证明当前的供给短缺代表的是可持续的客户工作负载,而非短暂的市场热情。
Amazon 最新业绩强化了这一论点。AWS 2026 年第二季度销售额达到 422 亿美元,同比增长 37%,为该业务部门 18 个季度以来最快的增长速度。
然而,支撑这一加速增长所需的投资仍在持续攀升。Amazon 目前预计将在数据中心、芯片、机器人及其他长期项目上进行大规模资本支出。内存成本上涨也推动了近期支出的增加。
Microsoft 和 Google 同样面临这些实体约束。三家公司都需要芯片、网络设备、土地、熟练工人以及海量电力。这些要素无法以软件般的速度增加。
因此,竞争已不再局限于模型质量或云服务功能,而越来越取决于哪家提供商能在不损害未来回报的前提下,将资本转化为可用计算能力。
AWS 需求增长快于可用容量
关键变化不只是 AWS 计划增加支出。Amazon 表示,其现有建设规模仍无法满足已确认的客户需求。
在 8 月 3 日的 Garman 访谈中,这位 AWS 负责人描述了一个需求显著超过供给的市场。他表示,公司将继续建设和投资,以满足客户需求。
在 Amazon 公布第二季度业绩后,这种失衡更加明显。根据公司发布的季度业绩,AWS 销售额同比增长 37%,达到 422 亿美元。
AWS 运营利润也从一年前的 102 亿美元增至 166 亿美元。这些数字表明,云业务扩张同时带来了增长和利润。
Amazon 表示,AWS 的年化营收运行率已达到 1690 亿美元。公司还称,其 AI 和半导体业务的年化运行率均已超过 250 亿美元。
年化运行率是将某一时期当前的营收节奏延展至全年。它有助于展示增长动能,但并非预测或有保证的全年业绩。
这一区别很重要,因为 Amazon 正利用当前需求来证明一项需要多年才能回收的支出合理性。今天的一项客户需求,可能会触发对设备和设施的投资,而它们的运营寿命要长得多。
CEO Andy Jassy 曾表示,Amazon 必须先获得土地、电力、建筑、服务器、芯片和网络设备,才能将由此形成的容量变现。部分基础设施可在数月内到位,而大型项目则需要数年时间。
这种提前周期带来了艰难的规划问题。如果 Amazon 建设过于谨慎,客户可能会因 AWS 无法提供所需容量而将工作负载迁往其他平台;如果建设过于激进,利用不足的资产则可能拖累现金流和回报。
Amazon 目前认为,前一种风险更为紧迫。Jassy 告诉投资者,即使完成计划中的投资,公司仍将无法满足 2026 年的全部需求。
他还表示,预计这种失衡将持续至 2027 年。据一份独立的支出分析报道,他称现有的 2028 年需求信号已十分显著。
公司的信心不仅来自训练大型 AI 模型。AWS 表示,人工智能工作负载还会增加对存储、数据库、网络、安全和通用处理器的需求。
训练后工作是在模型完成初始训练周期后对其进行优化。与此同时,推理则是用户使用模型时生成答案的计算过程。
这两类活动都可能消耗广泛的云资源,而不仅仅是专用 AI 加速器。投入生产的智能体还需要数据库、身份控制、监测、内存,以及与业务应用的连接。
这种关系有助于解释 Amazon 为何将 AI 视为其成熟云业务的放大器。一次新的模型部署,可能会将多项传统 AWS 服务一并带入同一个客户账户。
不过,强劲需求并不自动意味着可用供给。只有当 AWS 安装设备、接通电力、启用服务并让容量可用时,才能确认营收。
这类实体交付缺口正是 Garman 表态背后的张力所在。AWS 所描述的并非它希望创造的需求,而是因基础设施限制而无法立即服务的业务。
AI 热潮已变成一场建设挑战
AWS 可以在数分钟内向全球销售软件,但支撑这些软件的基础设施必须通过缓慢且碎片化的实体供应链来建设。
现代 AI 数据中心需要的不只是图形处理器。它还需要变电站、冷却系统、备用发电设施、光纤连接、交换机、内存、存储、服务器和受过培训的运营人员。
每一项依赖都可能成为瓶颈。没有足够电力,建成的建筑价值有限;没有网络、冷却和周边服务器容量,一批运抵的加速器也无法为客户提供服务。
Amazon 对光学基础设施的投资说明了这一依赖链的规模。该公司与 Corning 签署了一项多年期、数十亿美元的协议,采购光纤、线缆和连接产品。
这项光纤协议预计将在北卡罗来纳州创造 1,000 个制造业岗位,同时支持建设工作和技术培训。
光纤至关重要,因为大型 AI 集群需要在处理器、存储系统和其他设施之间传输海量数据。网络容量不足可能导致昂贵的处理器等待数据。
内存也是另一项限制因素。Jassy 将 Amazon 更高的资本需求部分归因于内存成本上升,这表明即使更广泛的战略没有变化,组件价格上涨也会改变支出水平。
电力仍是更棘手的问题。公用事业公司、监管机构、土地所有者和电网运营商都会影响数据中心何时能够接入,以及它能消耗多少电力。
云服务提供商订购更多服务器的速度,可能快于许多地区新增发电或输电能力的速度。因此,设备可得性并不总能转化为可部署的计算能力。
这些限制改变了规模的含义。过去,云规模意味着运营众多区域,并将固定成本分摊给数百万客户。AI 则增加了提前数年协调稀缺实体资源的需求。
Amazon 认为,其运营历史为公司带来了优势。AWS 已花费二十年时间预测需求、谈判供应合同,并为大型客户工作负载设计基础设施。
这类经验并不能消除短缺,但能帮助 AWS 决定应将容量部署在何处、预留哪些组件,以及如何在专用加速器和通用系统之间取得平衡。
Amazon 也自行设计处理器。Trainium 面向模型训练和推理,而 Graviton 则处理基于 Arm 架构的通用计算任务。
自研芯片为 AWS 提供了另一种管理成本和供给的方式。它们可以降低对单一外部处理器供应商的依赖,尽管制造仍依赖于供应有限的半导体供应链。
客户还需要能够高效利用现有硬件的软件。AWS 提供包括 SageMaker AI、Bedrock 和 Bedrock AgentCore 在内的服务,以将模型开发和部署迁移至其基础设施上。
Amazon 表示,Bedrock 让客户能够通过托管服务从多个模型中进行选择。这种模型选择能力支持那些不希望将整个 AI 战略绑定于单一开发商的客户。
AgentCore 为运行 AI 智能体提供基础设施,包括身份、内存、监控和策略控制。AI 智能体是利用模型及连接工具完成多步骤任务的软件。
这些服务之所以重要,是因为基础设施需求取决于生产环境的采用情况。偶尔运行的演示几乎不会带来持续的云资源使用;而每日处理业务交易的智能体,则会在多个系统中持续产生需求。
因此,AWS 必须将实验转化为持续性消耗。当客户在应用中持续使用 AI,而不是为不确定的试点项目预留容量时,其投资逻辑会更有说服力。
随着支出增加,营收增长也在加速,这使容量受限的说法更具可信度。不过,这在一定程度上仍是对当前工作负载将如何成熟的预测。
建筑和电力基础设施的寿命远长于单个 AI 产品。在模型架构、处理器设计和客户偏好仍快速变化之际,Amazon 正作出实体层面的长期承诺。
这种长期资产与快速变化软件之间的不匹配无法避免。问题在于,AWS 能否保持基础设施足够灵活,以支持客户下一步的任何选择。
Amazon 真正的对手是自身的支出承诺
核心竞争在于:Amazon 对持久且供给受限需求的判断,能否经受住在获得营收前数年为容量提供资金的财务现实考验。
Amazon 并非唯一做出这一押注的公司。Alphabet、Microsoft、Meta 及其他科技公司正将巨额资本投入 AI 基础设施。
共同的支出并不会消除 Amazon 的风险,反而提高了其争夺同一批内存、芯片、光纤、建筑劳动力和电力接入资源的成本。
这也可能使预测更加困难。面临 AWS 容量受限的客户,可能会同时向多家提供商预留容量,从而使表面需求超过最终实际消耗。
当云合同包含明确承诺时,它们能提供更有力的证据。即便如此,客户仍可能随着产品、预算或模型策略的调整而改变实施进度。
Amazon 的回应聚焦于长期基础设施的经济性。在对其投资周期的说明中,Jassy 表示,AWS 会在新容量变现之前先投入现金。
他指出,网络和计算硬件的使用寿命约为六年,而数据中心资产可使用超过 30 年。
这一时间跨度让 Amazon 有多次机会从单一设施中获得回报。服务器可以更换,而建筑、电力接入和网络基础设施仍可继续服务客户。
该模型曾在 AWS 早期扩张期间任职。Amazon 在云采用成为主流之前便开始投资,随后随着企业将更多计算任务从私有数据中心迁出而获益。
然而,AI 基建扩张在重要层面有所不同。专用处理器价格高昂,客户需求可能集中于特定模型,硬件性能也在快速迄代。
一座设施可以在数十年间持续保持价值,但其中的处理器老化得更快。较旧的设备仍可用于推理或传统工作负载,但其创收潜力可能下降。
AI 系统也可能变得更高效。更好的模型、软件优化、量化以及更小的任务专用模型,都可以减少实现特定结果所需的计算量。
量化会降低模型使用的数值精度。这项技术可在为许多应用保留足够准确性的同时,减少内存和计算需求。
效率提升并不一定会降低总需求。更低的计算成本可能鼓励更多使用,这种模式通常被称为反弹效应。
AWS 押注于不断增长的采用率将超过效率提升带来的影响。更多应用、用户、智能体和自动化流程将使总计算消耗持续上升。
该公司第二季度的数据目前支持这一观点。AWS 增长加速,AI 和传统云服务均推动了增长。
盈利能力也提供了一定保护。AWS 的营业收入为 Amazon 提供了可观的内部资金来源,即便全公司的现金投资正在增加。
但营业收入和现金流衡量的是不同的事物。资本支出需要立即动用现金,而会计费用则在资产的使用寿命内确认。
因此,投资者必须评估两条时间线。当前云业务利润可以上升,同时自由现金流可能因 Amazon 为未来设施提供资金而走弱。
如果建设成本上升或启用进度延后,压力会更加严重。延迟投用的产能会消耗资本,却无法立即产生云业务收入。
Amazon 更广泛的业务使情况更加复杂。其资本计划还支持物流、机器人、卫星和其他项目,因此整体支出并不完全对应 AWS。
仅凭公开数据,很难进行精确的回报分析。投资者可以看到 AWS 的收入和营业收入,却看不到基础设施经济效益在项目层面的完整拆分。
因此,Amazon 的支出承诺应被视为一项经过审慎考量的押注,而非未来回报的证明。管理层认为需求足以让公司优先扩充产能,而非短期内保留现金。
市场将通过利用率、收入增长、利润率和现金创造能力来评判这一选择。Garman 对需求的表述说明了机会所在,但执行决定其是否会成为一门有吸引力的业务。
Microsoft 和 Google 从两侧施压
AWS 以极大规模领先云市场,但竞争对手可以通过更快扩充产能,或更高效地将 AI 需求转化为云业务增长来对其施压。
Microsoft 凭借庞大的企业软件基础,以及 Azure 与其业务应用之间的紧密联系进入竞争。客户可以通过现有合同、开发者工具和办公产品采用 AI。
Google 则拥有自己的 AI 模型、定制 Tensor Processing Units、研究能力,以及一个从较小基数增长的云业务。其第二季度云业务增长率超过 AWS 的增幅。
仅凭百分比增长并不能确立市场领导地位。一家较小的业务可以扩张得更快,但新增的绝对收入仍可能低于规模更大的竞争对手。
不过,竞争对手的快速增长仍然重要,因为客户可以将工作负载分配给多个提供商。多云战略降低了对单一供应商的依赖,并在产能谈判中创造了筹码。
竞争也会朝相反方向发挥作用。当每家主要提供商都受到产能限制时,客户可立即选择的替代方案会更少。这可以支撑利用率,并降低设施闲置的风险。
其影响取决于产能在哪些地方可用。AI 基础设施在区域、处理器类型、网络配置或软件平台之间并非完全可互换。
需要在某一地点使用特定加速器的客户,并不总能以其他地方的通用产能替代。数据驻留规则和延迟要求进一步限制了这种迁移。
这使得更广泛云市场内部形成许多更小的供给市场。AWS 可能在一种服务上有闲置产能,同时又不得不拒绝另一种服务的需求。
软件兼容性也会影响这些决策。使用 Bedrock、SageMaker AI 或 AWS 数据库的客户,若要将生产系统迁移至 Azure 或 Google Cloud,需承担迁移工作。
围绕竞争对手平台构建的工作负载也是如此。技术转换成本可以维持客户关系,但并不能保证每个新的 AI 项目都会留在同一家提供商。
AWS 的战略强调模型选择和配套基础设施。Amazon 希望客户选择模型的同时,仍将数据、应用、安全控制和智能体服务保留在 AWS 内部。
这一定位不同于围绕单一旗舰模型构建的战略。即使最受欢迎的模型发生变化,它仍将云平台视为持久层。
如果企业更看重灵活性而非与单一模型开发商的深度整合,这种方法可能奏效。若竞争对手的模型与平台组合带来明显更好的经济效益,这一策略便会减弱。
定制处理器是另一条竞争战线。AWS 推广 Trainium 和 Graviton,Microsoft 开发自己的芯片,而 Google 多年来一直在运营定制 AI 加速器。
这些芯片可以提升议价能力,并打造适配各家基础设施的服务。但它们也需要大量研发投入,并需要足够的客户采用率来证明量产合理。
没有任何一家提供商控制整个技术栈。先进半导体制造、内存、网络组件、电网基础设施和建设能力仍分布在外部供应商之间。
这种依赖意味着云竞赛无法仅靠软件发布取胜。采购、设施工程和与公用事业公司的协调,如今都在塑造产品可用性。
Amazon 与 Corning 的协议展示了一种应对方式:通过长期承诺锁定战略性投入品。类似安排可以减少供应不确定性,但也会使公司锁定未来采购。
因此,竞争风险具有双面性。如果 AWS 建设过慢,可能失去业务;而如果每家提供商都依据同一条乐观需求曲线建设,也可能出现供应过剩。
并不需要 AI 采用率全面下降,就可能产生过剩产能。更高效的模型、延迟的企业部署或重复预订,都可能造成较小程度的错配。
对企业买家而言,竞争提供了议价能力,但也带来规划风险。目录中列出的云服务仍可能存在区域配额、等待期或有限的硬件选择。
买家应在模型基准测试之外,评估可用产能、部署进度和合同灵活性。如果生产基础设施到位太晚,表现最佳的演示也价值有限。
开发者面临相关的权衡。为可移植模型和标准接口进行设计可以减少对单一提供商的依赖,但最高效的服务往往使用专有基础设施。
知识工作者可能会间接感受到结果。更多产能可以改善响应时间并扩展 AI 功能,而基础设施短缺可能拖慢产品发布或限制访问。
云提供商正在竞相让这些限制变得不可见。Garman 的评论显示,尽管 AWS 拥有规模和投资优势,它尚未实现这一目标。
什么可能打破 Amazon 的产能押注
Amazon 面临的最大风险并不是 AI 消失,而是基础设施成本增长快于可盈利的客户使用量。
当前的增长证明了真实需求的存在,但并不能确定这种需求会持续多久。企业可以扩大 AI 预算,却仍在艰难部署可靠的应用。
许多项目面临数据质量、安全、治理和集成问题。这些障碍可能导致公司预留基础设施或完成试点后,生产使用仍被延后。
智能体应用带来了另一项不确定性。智能体会反复调用模型并访问多个系统,因此可能产生很高的云计算消耗。
它们也可能带来不可预测的成本或错误。在监控、身份和政策控制变得更加可靠之前,公司可能会限制使用。
Amazon 正在构建服务以解决这些问题。然而,托管工具的存在并不能证明客户会以基础设施计划所假定的规模部署智能体。
第二项风险涉及技术效率。新处理器和模型技术可以用更少的能源、内存或加速器时间完成同一任务。
这种效率可能扩大市场,但时机至关重要。突如其来的改进可能在 Amazon 完全折旧相关硬件之前,降低对某些硬件配置的需求。
硬件组合带来了类似挑战。当客户偏好发生变化时,基于一种加速器的产能并不总能以经济可行的方式转换为另一种。
AWS 可以通过支持多种处理器选项来降低这种风险敞口。但它仍必须预测客户在特定区域需要每种类型的多少设备。
第三项风险是执行。数据中心需要许可证、设备、电力、网络和训练有素的工人按正确顺序到位。
任何一个环节延迟都可能令其他环节闲置。Amazon 可能拥有无法通电的服务器,或在网络连接尚未准备好之前就完成了建筑。
供应合同减少了一些不确定性,同时也带来了承诺。若需求后来走弱,Amazon 可能仍有义务采购组件或支持扩大的制造能力。
社区和监管压力也会影响建设。大型数据中心可能引发对电价、用水、土地消耗、噪音和备用发电的担忧。
这些担忧并不意味着项目会停止。它们可能延长审批时间,或要求额外投资,从而改变项目的经济效益。
第四项风险是财务可见性。Amazon 报告 AWS 销售额和营业收入,但投资者无法将每一笔基础设施投入直接对应到具体客户工作负载。
全公司的资本支出还覆盖 AWS 以外的业务。这种广泛范围使得仅通过公开披露来计算 AI 基建扩张的回报更加困难。
Amazon 对 Anthropic 的投资进一步复杂化了季度比较。第二季度净利润包含了与该项投资相关的大额非经营性收入。
这项会计收益并不代表由 AWS 客户产生的现金。读者应将其与云业务部门的基础销售和经营表现区分开来。
谨慎的分析还应区分需求与稀缺性。产能短缺可能反映了异常强劲的客户增长、建设缓慢、分配效率低下,或多种因素共同作用。
Garman 的说法描述了结果,而非短缺的完整构成。公开报道并未揭示,有多少被请求的产能对应着确定的合同承诺。
这些缺口都不足以推翻 Amazon 的论点。它们界定了检验该论点所需的证据。
第一个值得关注的信号是 AWS 在下一轮财报周期中的收入增长。持续加速将支持 Amazon 的说法:新增产能能够迅速转化为客户支出。
放缓需要更细致的解读。它可能意味着需求走弱,也可能表明供应限制使 AWS 无法承接现有商机。
因此,管理层对新增产能的说明至关重要。投资者应将已启用基础设施的时间与营收及已签约承诺的变化进行比较。
第二个信号是 Amazon 的现金流和 AWS 运营利润率。如果基础设施支出持续超过增长所带来的现金流,营收增长的说服力就会减弱。
在扩建阶段,短期压力在预期之中。更有力的检验在于,随着新的数据中心和处理器投入使用,利用率是否会改善。
利用率上升且利润率保持稳定,将强化投资逻辑。若成本反复增加却没有带来相应的营收增长,则会削弱这一逻辑。
第三个信号是客户在 AWS、Azure 和 Google Cloud 之间的流动。大型合同、区域可用性和生产环境部署将显示,供应短缺究竟是在帮助还是损害 AWS。
等待 AWS 容量的客户可能接受延期、重新设计工作负载,或将其迁移至其他平台。每种应对方式对 Amazon 的长期地位都有不同影响。
Amazon 还必须证明,其 AI 服务能够为更广泛的平台带来需求。存储、数据库、网络和通用计算业务的增长,将验证管理层所描述的乘数效应。
关注此次扩建的读者应聚焦可衡量的交付成果,而非仅仅关注建设公告。已启用的容量、持续的使用情况、利润率和现金创造能力,比项目宣称的规模更能说明问题。
评估云服务商的团队可以将财报说明、容量更新、合同和部署记录保存在一个可搜索的知识库中。这些记录能让团队更容易随时间比较供应商不断变化的说法。
AWS 已明确表态:客户需求足以证明持续投资的合理性,即使这一规模在过去看来会显得极端。下一个问题是,Amazon 能否在客户找到替代方案之前启用产能。
关注下一组 AWS 业绩,寻找三个答案:云业务增长是否仍在加速,新设施是否正在改善可用性,以及现金创造能力是否开始追上投资曲线?
这些信号将决定,Amazon 的容量短缺究竟代表一种持久优势,还是一场代价高昂、与市场预期竞速的比赛。


