top of page

Epoch AI 对算力洪流的 Techmeme 解读发现了需求难题

Epoch AI 持续追踪的算力扩张,对“先进 AI 芯片将永久稀缺”的观点提出了挑战。这篇 Techmeme 解读从一项引人注目的估算开始:自 2022 年以来,全球 AI 算力大约每七个月翻一番。

根据 Epoch AI 的最新分析,这一速度相当于年增长约 3.3 倍。新一代加速器、更高密度的数据中心和定制芯片都在增加产能。然而,硬件洪流并未解答这个行业面临的最大问题。

问题在于,能够带来利润的需求能否足够快地增长,以消化已经投入运营的基础设施。Microsoft、Amazon、Google、Meta、OpenAI 及其合作伙伴,已承诺在芯片、建筑、网络和电力等方面进行大规模扩张。

这并非又一个处理器速度更快的周期。新增产能可支持更大规模的训练,以及更多推理工作——即人们运行 AI 模型时所使用的计算。若客户需求、电力接入或软件采用速度滞后,它同样可能导致昂贵资产未被充分利用。

因此,核心竞争已很清晰:超大规模云厂商押注 AI 使用量将随算力供给一同增长。实体建设遵循施工进度推进,而客户行为则更难预测。

Techmeme 解读揭示了什么:算力激增

最重要的变化并非某一座新数据中心,而是整个已安装基础规模扩张的速度。

Epoch AI 估计,自 2022 年以来,主要 AI 芯片设计商提供的全球算力每年增长约 3.3 倍。这意味着翻倍周期约为七个月,报告给出的置信区间为六至八个月。

该估算以 H100 等效算力表示。这个单位通过将不同加速器的性能换算为 Nvidia H100 处理器的算力,来比较它们。它为跨芯片代际和厂商的比较提供了统一尺度。

这一指标比单纯统计芯片数量更有用。较新的加速器可能比旧型号提供显著更多的计算能力。因此,出货总量相近的两个季度,所增加的有效算力可能截然不同。

Epoch AI 的估算基于财务披露、公司声明、分析师研究以及关于单个芯片的技术信息。其 芯片销售数据覆盖自 2022 年起的 Nvidia 和 Google,而对其他几家设计商的覆盖则始于更晚时期。

这种方法带来了不确定性。公司很少公布完整的出货记录,定制芯片往往也仅部署在所有者自己的数据中心中。算力估算还取决于交付日期、系统配置和可用性能等假设。

尽管如此,这一趋势很难被忽视。Nvidia 在 Epoch AI 的产能估算中贡献了超过 60% 的算力。Google 和 Amazon 则通过其定制加速器提供了其余算力中的大部分。

这种分布也改变了“AI 芯片市场”的含义。它不再仅指向外部客户销售的通用处理器,也包括云公司为自身服务而设计、出资和部署的芯片。

Google 的张量处理单元,即 TPU,便体现了这一模式。Amazon 通过 Trainium 和 Inferentia 走着类似路线。Microsoft 和 Meta 也在开发更专业的硬件,同时继续大量采购 Nvidia 处理器。

由此形成的是分层的供给扩张。Nvidia 提升了通用加速器的性能和产量;云公司则增加针对其软件、网络和偏好工作负载优化的定制芯片。

七个月翻倍的估算也快于最初新闻讨论中强调的九个月数字。这些数字可能描述的是不同的数据集、时期或算力定义。芯片数量并不等同于总计算性能。

对于评估即将到来的算力洪流说法的读者而言,这一区别很重要。行业并非只是安装了两倍数量的实体处理器,而是在更高出货量的同时,提高了每颗处理器的性能。

第一波生成式 AI 基础设施以稀缺为特征。实验室争夺有限的集群、云资源配额和网络设备。下一阶段则面临一种更复杂的可能性:巨量供给先于其经济角色得到明确便已到来。

AI 芯片洪流为何此刻到来

这一激增源于芯片产出、封装、内存、网络和数据中心建设等多项进展的叠加。

一个现代 AI 集群所需的不仅是先进逻辑芯片。它还需要高带宽内存、专用封装、交换机、光纤连接、冷却设备、变压器和可靠电力。任何一个组件短缺,都可能拖延整个系统。

Epoch AI 发现,2025 年制约生产的主要因素是先进封装和高带宽内存,而非逻辑芯片供应。通常称为 HBM 的高带宽内存,能够以极高速度向 AI 处理器传输数据。

先进封装将处理器和内存整合为高度集成的系统。Nvidia 和其他设计商依赖这些技术,因为模型性能日益取决于组件之间高效传输数据的能力。

行业的回应是同时扩张多个环节。内存制造商增加了对 HBM 的投资;封装供应商扩大了产能,芯片设计商则锁定了更长期的供应承诺。

这项 供应链分析并不意味着所有限制因素都已消失。它展示了 2025 年生产压力集中于何处。随着一种受限投入品的扩张速度快于另一种,未来的瓶颈可能发生转移。

网络同样变得至关重要。在大规模训练过程中,数千颗加速器必须相互通信。互连性能不佳会使昂贵的处理器等待数据,从而降低集群的实际性能。

因此,云运营商建设的是系统,而非采购孤立的芯片。他们控制每颗加速器周围的软件、网络设计、存储、冷却和工作负载调度。这种整合可以提高利用率并降低运营摩擦。

代际提升带来了另一重放大效应。更换旧硬件的数据中心,无需按比例增加芯片数量也能获得更高算力。新设施还可支持比早期云设施更高的机架密度。

这些变化解释了为何算力供给能够快于半导体单位出货量增长。每个新单元贡献了更多性能,而配套系统使更多处理器能够协同工作。

这轮建设也反映了数年前作出的决策。数据中心需要土地、电网研究、设备订单、许可和施工。如今启用的产能,往往代表在当前需求显现之前就已作出的承诺。

这种时间差形成了惯性。一家公司无法在不承担损失或延误战略计划的情况下,立即取消一座接近完工的设施。因此,即使投资者情绪或产品需求发生变化,基础设施仍会持续上线。

相同的滞后在相反方向同样存在。AI 使用量突然增加,并不能立即带来新的变电站、输电线路或发电能力。运营商必须在能够验证需求之前就为其进行规划。

这也是大型科技公司在不确定性之下仍持续订购产能的原因。算力短缺可能限制模型开发和云收入。拥有过多算力会削弱回报,但高管通常认为,这一风险优于失去获取算力的机会。

这场军备竞赛还会自我强化。当一家公司宣布更大规模的集群时,竞争对手便面临匹配其训练和推理能力的压力。在模型比较开始之前,算力落后就可能限制试验能力。

然而,原始供给并不保证领先地位。算法、数据质量、模型架构和开发者分发仍会影响结果。一家公司可以拥有更多芯片,却提供不那么实用的服务。

因此,这轮建设既是工业性的,也是战略性的。行业已经解决了足够多的组件约束,从而加快部署;但它尚未证明每一颗已部署的加速器都能创造足够的经济价值。

超大规模云厂商必须将产能转化为付费需求

Microsoft、Amazon、Google 和 Meta 现在都面临压力,需要将建设进度转化为持续的客户工作负载。

超大规模云厂商是拥有庞大全球基础设施版图的云运营商。其规模使其能够批量采购设备,并跨区域分配工作负载;但这也使其承担异常巨大的资本投入。

Microsoft 在其 2026 财年第三季度财报电话会议上表示,需求仍持续超过可用供给。该公司还预计,随着更多产能上线,季度资本支出将增加。

这一表态支持看涨观点。如果客户对 Azure 容量的需求已经超过 Microsoft 所能提供的规模,新增集群应能释放收入。该公司也可以通过既有的企业客户关系来分配 AI 基础设施。

不过,支出的构成值得关注。Microsoft 表示,其近期资本支出的大部分用于使用寿命较短的资产,主要是处理器。这些组件的更换频率高于建筑物或土地。

该公司的 财报讨论也显示了这一押注的广度。Microsoft 提供来自 OpenAI、Anthropic、开源开发者及其他供应商的模型。它正在为一个最终胜者尚未确定的市场提供基础设施融资。

Amazon 通过 AWS 面临类似的考量。其定制 Trainium 处理器可以减少对 Nvidia 的依赖,并为客户提供另一种训练选择。然而,Amazon 必须说服开发者,其软件环境和性能足以抵消迁移成本。

Google 的位置颇具特色,因为它已开发多代 TPU。它可以将这些硬件用于内部产品、Gemini 服务和 Google Cloud 客户。这为吸收新增产能创造了多条渠道。

Meta 的商业模式不同。其核心收入大部分并不来自出租基础设施。它可以将算力应用于广告系统、推荐模型、内容工具及自身的 AI 助手。

这种内部需求带来了灵活性,但也使衡量更为复杂。投资者可以直接观察云收入,却更难拆分额外算力在广告或推荐系统中带来的回报。

OpenAI 和 Anthropic 又增加了一层复杂性。它们需要巨量计算资源,却并不拥有可与最大合作伙伴相提并论的超大规模云业务。它们的增长使长期基础设施协议成为行业需求的关键来源。

核心风险在于循环式承诺。云服务商为产能提供融资,投资模型公司,然后在这些公司购买云服务时确认收入。这些交易仍可能反映真实使用情况,但其持久性取决于终端客户。

企业级应用最终必须承担更大份额的需求。企业需要将 AI 部署到能够支持持续性支出的工作流中,而不只是用于实验。面向消费者的服务则需要获得足够的用户参与度,才能证明其推理成本合理。

推理消耗的总算力可能远超一次模型训练。每一次生成回答、图像、视频或执行软件操作都需要计算。被广泛采用的服务可以让庞大的集群昼夜不停地运转。

智能体系统进一步抬高了赌注。AI 智能体在规划、使用工具、检查结果和重试任务时,可能会进行多次模型调用。因此,单个用户请求所产生的计算量可能远高于一次简单的聊天机器人回复。

Epoch AI 曾警告称,在某些假设下,推理需求的增长速度可能快于供给。其算力紧缺模型测试了令牌需求以多快的速度会耗尽领先 Nvidia 系统的可用容量。

这种可能性使“供给过剩”的结论难以简单成立。即便行业以惊人的速度增加芯片,如果智能体、视频生成、编程系统和推理模型扩张得更快,仍可能面临短缺。

超大规模云服务商面临的压力不只是销售更多虚拟机。它们还必须提升利用率、控制能源成本,并让 AI 应用具备足够价值,以支撑持续使用。

更多芯片并不能消除电力约束

算力洪流将稀缺性从处理器转向电力、电网接入、散热以及地方政治审批。

无法获得电力的加速器只是库存,而不是计算能力。随着已宣布采购的芯片被运往仍在等待公用事业接入的设施,这一区别将变得更加重要。

数据中心将需求集中在特定地点。一个国家的电网可能拥有足够的总发电量,但某个地区仍可能缺少变电站、输电能力或可用的并网接入。地方性限制可能拖延一座已建成建筑的投运。

国际能源署预计,到 2030 年,数据中心将占美国电力需求增长的近一半。该机构还指出,专注于 AI 的设施用电规模可与高耗能工厂相当。

该机构的能源展望预计,在基准情景下,到 2035 年全球数据中心的用电量将约为 1,200 太瓦时。不同部署和效率假设下的结果可能存在显著差异。

这些情景凸显了一个重要不确定性:芯片容量预测并不自动等同于可运行容量预测。硬件的到位速度可能快于公用事业接入和供电的速度。

散热带来另一项限制。高密度 AI 机架会产生大量热量,推动行业转向液冷。对旧设施进行改造以适配这类系统,可能比在新建项目中直接安装更加困难。

用水量也可能加剧当地反对声音,尤其是在干旱地区。数据中心开发商越来越需要说明其设施将如何影响市政供水、电价和附近基础设施。

这带来了芯片预测无法捕捉的政治维度。社区可能拖延许可审批、要求消费者保护措施,或直接拒绝项目。公用事业公司则可能要求开发商为发电和电网升级提供资金。

能源合同是一种应对方式。科技公司已经签署了涉及可再生能源、电池、天然气和核电的协议。有些项目支持现有电站,另一些则依赖需要数年时间的技术开发或建设工程。

效率是另一种应对方式。新芯片可以在单位电力下完成更多工作。量化、模型压缩、缓存和更优的调度,也能降低每次生成结果所需的算力。

但效率并不总会降低总消耗。更便宜或更快的推理可能吸引更多用户,并催生要求更高的应用。由此带来的使用量增长,可能超过单次查询节省的成本。

这种反弹效应已成为看多需求逻辑的核心。更好的硬件降低了 AI 服务的运营成本,从而促使企业将其嵌入更多产品;更多产品随后又需要更多硬件。

怀疑论的论点同样始于这一点,但得出了不同结论。效率可以削弱应用增长与芯片需求之间的联系。更小的模型或许能处理许多过去需要前沿系统完成的任务。

软件改进同样可以延长旧硬件的使用寿命。更优的内核、路由和工作负载管理能够在不增加处理器的情况下提升有效容量。这些改进使实体出货趋势无法完整衡量供给。

利用率在很大程度上仍不透明。企业会公布芯片总量、资本支出或设施电力容量,但很少披露其加速器有多稳定地在执行能够产生收入的工作。一个集群看似繁忙,实际可能在运行回报尚不确定的开发实验。

因此,Epoch AI 的估算应被理解为潜在计算能力的衡量指标。它们并不能证明每一枚处理器都已安装、通电、联网、被充分利用,或具备经济生产力。

这正是 Techmeme 式观察即将到来的算力时的主要局限。硬件曲线清晰可见且陡峭;利用率曲线、电力曲线和收入曲线则仍远不透明。

供给繁荣带来成本与性能之间的权衡

充足的算力可以加速 AI 开发,但也会提高押错架构或需求预测所付出的财务代价。

乐观观点首先着眼于能力。算力变得可用后,研究人员可以训练更多模型、测试更多想法并开展更大规模的实验。产品团队也能够在不严重配给资源的情况下服务更多用户。

更大的供给也能增强竞争。云客户可以在 Nvidia 处理器、Google TPU、Amazon Trainium 和其他加速器之间获得更多选择。模型开发者可以针对价格、可用性或性能来优化工作负载。

定制芯片会给 Nvidia 带来压力,但不会立即取代它。Nvidia 除了处理器,还提供成熟的软件、网络和开发者工具。定制加速器必须与这种一体化平台竞争,而非只与单一组件竞争。

Nvidia 的市场份额也带来集中度风险。一次生产延误、设计问题或出口限制,都可能影响大部分规划中的容量。替代性芯片为云服务商提供了议价能力和运营韧性。

权衡体现在软件碎片化上。为一种加速器调优的工作负载,在另一种加速器上获得良好表现前可能需要额外工程工作。团队必须在更低的运营成本与可移植性、开发时间之间权衡。

硬件老化带来另一层担忧。AI 处理器进步很快,因此一个集群在其所在建筑达到使用寿命中期之前,就可能在经济性上显得过时。运营商可以更换加速器,同时保留电力、散热和网络资产。

这种替换周期改变了财务检验标准。服务商不仅需要足够的需求来填满今天的硬件,还需要在新系统削弱旧设备竞争价值之前获得回报。

当服务商为少数模型客户建设容量时,这种风险尤为突出。失去一个主要租户,可能让专用系统无法立即找到替代工作负载。

供给协议可以转移部分风险,但无法消除它。经营困难的客户可能重新谈判、减少使用,或依赖新的融资。长期承诺的可靠性取决于支撑它们的经济基础。

另一方面,模型采用速度加快,也会使保守建设同样代价高昂。建设不足的服务商可能将开发者拱手让给其他云平台,也可能因等待稀缺容量而延误内部产品。

正确的投资规模无法从单一利用率快照中判断。设施会随时间陆续投运,模型会变化,客户工作负载也会迁移。暂时的过剩容量可能是有意为之的准备,而非失败的证据。

历史技术周期既提供警示,也带来鼓舞。电信公司在互联网泡沫时期过度建设光纤,造成严重亏损;随着互联网流量增长,其中许多基础设施后来变得极具价值。

云计算走上了不同路径。服务商提前投资于需求,然后将广泛的基础设施转化为数千名客户使用的灵活服务。标准化和持续性的企业支出支撑了高利用率。

AI 基础设施兼具这两类先例的特征。它能够像云计算一样服务众多工作负载,但其加速器老化很快。它还依赖于尚未像传统云应用那样成熟的模型经济性。

算力洪流将降低一些门槛。无法自建集群的初创公司可以租用更多容量,研究人员可以使用更强的系统,企业也能在不拥有专用基础设施的情况下部署模型。

但接入仍将不均衡。规模最大的企业可以预留新硬件、谈判能源合同并建设定制网络。较小买家可能更晚获得容量,或为灵活访问支付更高价格。

更多的总算力并不必然让前沿开发更加民主化。即使普通推理变得更便宜,最大的训练集群仍可能继续扩大。供给可以在底层扩展,同时在顶层集中。

这种分化很可能定义下一阶段。常见 AI 任务受到的约束将减弱,而前沿训练和高容量智能体仍会需要庞大的系统。“算力充裕”对不同买家将意味着不同的事。

三个信号将显示这场押注是否奏效

下一项检验是:容量增长能否带来更高利用率、可持续收入,以及足以让新芯片持续运转的并网电力。

第一个信号是云需求相对于已安装容量的情况。Microsoft、Amazon 和 Google 经常说明客户需求是否超过可用供给。从短缺转向闲置容量,将削弱当前的投资逻辑。

仅凭收入增长无法回答这个问题。投资者应将云业务增长与资本强度、折旧以及管理层对利用率的评论进行比较。如果基础设施成本增长快于收入,即使销售额上升,回报也可能下降。

积压订单同样需要谨慎解读。一项已签署的承诺可能覆盖数年,并取决于建设里程碑。最有价值的证据将显示:设施投用后,客户确实在消耗容量。

第二个信号是 AI 应用的实际运营规模。服务商需要来自编程工具、企业助手、媒体生成和自主智能体的持续推理需求。偶尔使用聊天机器人无法消化规划中的基础设施。

开发者也应同时关注模型效率。如果更小的系统能够处理更多任务,应用采用率可以增长,而算力增长未必成比例。如果推理和智能体循环占据主导,每项任务的需求则可能急剧上升。

定价行为可以揭示这种平衡。频繁折扣、慷慨的额度或更容易获得的访问,可能表明供给正在改善。持续配给和漫长的预留周期则表明需求仍超过可部署容量。

第三个信号是电网交付。只有数据中心按计划获得电力,芯片订单才有意义。变电站或输电项目的延误,可能在已宣布算力与可用算力之间造成不断扩大的缺口。

关注公用事业公司批准大规模接入、科技公司为新一代设备提供资金,以及社区施加更严格的条件。这些决策将决定新增产能在哪里投运,以及谁来承担当地成本。

IEA预计,到2030年,数据中心用电量将翻一番,而面向AI的电力消耗有望增至三倍。若电网能够在不反复延误的情况下容纳这一增长,硬件预测的可信度就会提升。

如果接入排队时间变长,即使芯片产量充足,供给曲线也会趋于平缓。企业可能将加速器囤放在仓库中、逐步部署,或将设备转移到电力供应充足的地区。

这三项信号也能区分富有成效的扩张与投机性扩张。强劲的应用使用量、不断提高的利用率以及及时的电网接入,将印证超大规模云服务商的战略。

即使每座设施都按计划启用,疲软的采用率仍会对这一战略构成挑战。若需求强劲但电网延误,稀缺仍将持续,只是稀缺的对象将从处理器变成电力。

从这次对 techmeme 的观察中可以得到更广泛的启示:芯片供应已无法讲完整个AI基础设施的故事。计算正在成为一个由金融、能源、软件和地方政治共同塑造的工业系统。

Epoch AI提出的七个月翻倍估算,展现了硬件进步的惊人速度。但它并不能回答行业是否建设得过多、过少,或是否在错误的地点建设了产能。

对开发者而言,实际问题在于,获取算力是否会变得更便宜、更可靠。企业采购方应关注,供应商是否将新增产能转化为更好的服务限额和可预测的性能。

知识工作者应当把目光放到基准测试标题之外。只有当这轮扩张支撑起能够可靠完成工作、契合现有流程并能证明其运营成本合理性的AI产品时,它才真正重要。

未来几个月,请依次关注云端利用率、应用层推理和电网接入情况。这些信号将共同表明,这场算力洪流究竟是生产性产能,还是一条昂贵的排队队列。

硬件正在到位。现在,行业必须证明客户、应用和电力系统也能与之同步到位。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page