AI 的未来取决于更智能的基础设施,而不只是更大的数据中心
Google News 推送了一篇 Forbes 文章,其观点挑战了 AI 行业面对需求攀升时惯用的应对方式:建设更大的数据中心,并在其中部署更多加速器。
关键矛盾并不在人工智能与实体基础设施之间,而在于通过原始容量扩张,还是通过更好的协同实现扩张。供电、冷却、网络、存储和工作负载部署,如今决定着一座设施能够提供多少有效算力。
这一差别之所以重要,是因为最大的云服务提供商已经启动了规模庞大的建设计划。然而,更大的园区并不会自动带来成比例增长的可用 AI 容量。电网接入、机架密度、散热能力和网络拥塞,都可能阻碍昂贵硬件高效运行。
Forbes 的论述最好被视为一种行业观点,而非已经得到验证的突破或企业公告。但其核心理念仍值得关注。AI 部署的下一阶段,取决于从受限的基础设施中提取更多有效工作量,而不只是增加建筑。
这让超大规模云服务商、公用事业公司、芯片供应商和企业采购方承受着共同压力。他们必须协调那些过去按不同时间表规划的系统。新一代 GPU 的到来速度,可能远快于输电线路、变电站或发电厂的建设。
Google News 实际推送了什么
真正具有新闻价值的变化,是 AI 基础设施讨论从计算规划容量,转向质疑这些容量能够多有效地运行。
该来源文章提出了一个明确论点:AI 的未来取决于更智能的基础设施,而不是一味建设更大的数据中心。这是关于系统设计的观点,并不意味着建设已经停止。
建设仍是行业计划的核心。AI 训练需要大规模的加速器集群,而推理则需要足够分布式的容量,以响应不断增长的用户请求量。存储、网络和电力设备也必须随这些处理器一同扩展。
不过,行业的刚性约束正在扩大。一座设施可以拿到土地和服务器,却还要等待数年才能完成电网并网。它也可能在收到加速器后,才发现尚未安装适合其功率密度的冷却设备。此外,它还可能拥有足够的总电力,却缺乏向单个机架供电所需的本地输配电设备。
这份能源展望说明了挑战的规模。国际能源署预计,在基准情景下,到 2035 年全球数据中心的用电量将达到约 1,200 太瓦时。
这一数字并不意味着每个规划中的园区都会建成或得到充分利用。它表明,电力可得性为何已从设施层面的关注点,转变为 AI 部署的战略性限制。
Gartner 预计,全球数据中心用电量将在 2026 年增长 26%。其电力预测还指出,面向 AI 优化的服务器将占数据中心电力消耗的 31%。
配套基础设施同样在快速增长。Gartner 预计,冷却及其他基础设施的用电量将从 2025 年的 159 太瓦时上升至 2026 年的 195 太瓦时。
这一变化暴露出“越大越好”叙事的重要局限。更多计算设备会增加周边每一套系统的需求。任何一层的薄弱环节,都可能降低整座设施的产出。
因此,Google News 传递的信号比标题乍看之下更广泛。讨论已不再只是比拼谁能宣布建设最大的园区,而是比拼谁能将有限电力转化为可靠、具有经济价值的 AI 服务。
该来源也需要被置于恰当的背景中看待。Forbes Council 文章反映作者的专业观点,并非独立的技术评估。更智能基础设施这一论点,应通过运营数据检验,而不应被当作普遍适用的公式。
即便有这一限定,该论点仍与整个行业可量化的变化相吻合。AI 机架的密度正在提升,电网接入变得更具决定性,推理也正从少量训练集群向更广泛的场景扩散。
这一事件属于编辑层面的重新框定,但其背后的限制是物理性的。这种组合构成了本文的核心张力:规划中的计算容量,并不等同于可交付的计算容量。
更大的园区正遭遇更小的瓶颈
AI 公司正发现,最慢的基础设施层决定了整个部署的速度。
过去,云服务扩张看起来大体上是模块化的。运营商可以随着客户需求增长,增加服务器、租用更多机房面积并扩展网络容量。AI 集群打破了这一模式,因为它们对电力和散热的需求会同步上升。
电力是最明显的瓶颈。数据中心需要电网中的发电能力、输电容量、本地变电站、变压器、开关设备以及园区内的配电设备。每个组件都有自己的审批和交付周期。
国际能源署预计,到 2030 年数据中心用电量将增加一倍以上,达到约 945 太瓦时。AI 是最大的驱动因素,不过传统云服务和其他数字工作负载也在其中发挥作用。
全球占比看似可控,但本地影响仍可能十分严峻。数据中心需求集中在特定地区,通常靠近现有光纤线路、云可用区和成熟的技术人才储备。
这种集中造成了规划错配。一家公用事业公司可能在其服务区域内拥有足够的发电能力,却在拟建园区附近缺乏输电容量。开发商随后可能面临延误、昂贵的升级成本,或建设新增发电能力的要求。
冷却带来另一项限制。传统设施通常通过空气散热,但高密度加速器机架可能超过常见风冷方案的实际极限。液冷系统将冷却液更靠近处理器,并能更高效地带走热量。
液冷并非简单替换设备。它会改变设施管道、维护方式、监控体系,有时还会影响建筑布局。对正在运行的站点进行改造,可能比围绕这项技术设计一座新设施更困难。
网络构成第三项限制。AI 训练会将工作负载分配到数千个持续交换数据的处理器上。缓慢或不可靠的连接会让昂贵的加速器处于等待状态,而非进行计算。
推理的要求不同。推理工作负载运行训练完成的模型以响应实时请求,通常需要满足严格的延迟目标。其容量可能需要更靠近用户、应用程序或受监管的数据。
这些差异削弱了通用数据中心设计的可行性。针对长时间训练运行优化的园区,未必是交互式推理的最佳位置。企业工作负载可能会将数据控制置于最大集群规模之上。
Microsoft 研究人员将这一转变描述为对整个数据中心生命周期的重新设计。他们的基础设施研究考察了供电、冷却、网络和硬件部署等方面的变化。
其教训在于架构层面。当其他组件使处理器缺电、缺数据或缺冷却时,处理器无法发挥其标称性能。利用率与已安装容量同样重要。
这种压力对作出长期容量承诺的公司影响最为严重。它们必须在所有变量尚未稳定前,预测工作负载、芯片世代、能源可得性和模型经济性。
公用事业公司面临的是同一问题的另一种版本。它们必须在评估数据中心开发商异常庞大的需求时,保障现有客户的可靠供电。一项申请并不总会转化为实际运行负载。
这种不确定性使投资更加复杂。为迟到的需求建设电网基础设施,可能加重客户负担;等待确定性,则可能推迟最终被证明可行的项目。
行业被迫作出的回应是协同。开发商需要更早与公用事业公司、设备供应商、网络运营商和地方主管部门合作。他们还需要能够适应一种资源比另一种资源更晚到位的设计。
更大的建筑本身无法解决这些依赖关系。在某些情况下,它反而会放大这些问题。
更智能的 AI 基础设施意味着协调整个系统
更智能的基础设施,并不意味着给数据中心增加一层 AI 软件。它意味着将供电、计算、冷却和工作负载作为一个系统来设计。
第一种机制是工作负载调度。并非每项 AI 任务都需要立即执行。当电力或网络容量受限时,训练、批处理和部分数据准备任务可以在不同时间或地点之间转移。
交互式服务的灵活性较低,因为用户期待快速响应。运营商仍可在不同区域之间路由请求,为简单任务选择更小的模型,或缓存常见结果。每种做法都能减少不必要的加速器工作量。
这使软件成为基础设施控制手段。能够提高利用率的调度器,无需安装另一个同等规模的集群,便可产生更多有用产出。它还可以降低峰值需求,否则这些需求可能需要配置过大的电力设备。
第二种机制是工作负载部署。训练通常受益于高度互联的加速器集群。推理则可能受益于分布在云区域、托管设施、企业站点或边缘位置的部署。
部署决策取决于延迟、数据敏感性、电力可得性和预期利用率。适合某一种工作负载的最佳选择,可能对另一种并不高效。
第三种机制是协同设计。芯片供应商越来越多地将加速器与网络系统、内存、服务器平台和冷却需求一同设计。设施运营商必须在硬件到位前,为由此带来的功率密度做好准备。
协同设计也延伸至电网。开发商可以分阶段建设园区、构建灵活负载,或在计算和冷却系统之间共享容量。这些选择能让公用事业公司更容易为拟建设施提供服务。
Accenture 的开发手册建议将电力视为早期设计输入。它还将工作负载编排、限速和灵活的设施需求描述为提高项目可行性的方式。
灵活性并不意味着 AI 服务不可靠。它意味着识别哪些计算任务有严格时限,哪些任务能够响应基础设施条件。
第四种机制是更好的测量。电能使用效率将设施总用电量与输送给计算设备的电量进行比较。它仍然有用,但并不衡量已完成 AI 工作的商业价值。
一座设施可以报告高效的电力输送,同时却低效运行加速器。低利用率、失败的作业、网络延迟和过大的模型,都可能在电力到达服务器后继续造成能源浪费。
因此,运营商需要工作负载层面的指标。实用的衡量方式包括加速器利用率、已完成请求数、模型响应质量、延迟、每项任务的能耗,以及容量受限的频率。
这些指标有助于企业买家评估部署方案。如果网络延迟或容量受限降低了服务质量,一个名义上更便宜的地区可能表现不佳。如果需求始终不均衡,专用集群也可能造成资源浪费。
更智能的基础设施还包括韧性。AI 应用正日益支持客户服务、软件开发、分析和运营流程。因此,基础设施故障可能中断业务流程,而不只是打断实验性模型训练。
分布式容量可以降低对单个超大型园区的依赖。但它也会引入新的运营复杂性,因为团队必须跨地点管理数据流动、安全性和模型一致性。
这正是主要对手变得清晰之处。这里的选择并不真的是智能系统与实体建设之间的对立。新建项目仍然必要。真正的冲突在于以容量为先的规划与协调化、工作负载感知规划之间。
以容量为先的规划从所需的加速器数量或兆瓦数开始。它将支撑系统视为之后再采购的资源。协调化规划则从必须完成的工作开始,并围绕这些工作设计每一层。
第二种方法在规划阶段较慢,但可以减少后期代价高昂的不匹配。它还迫使企业区分真实需求与投机性的容量预留。
对于企业团队而言,这改变了 AI 采购方式。买家需要询问工作负载将在哪里运行、供应商如何应对容量受限,以及模型选择是否会在负载下发生变化。
他们还需要获得关于数据、延迟、安全性和用户需求的可靠内部信息。一个可搜索的 AI 知识库可以支持这类分析,尽管它无法解决实体基础设施问题。
这种关联很实际。基础设施效率始于了解哪些工作负载最重要。将每项任务都发送给可用的最大模型的公司,会制造本可避免的需求,并削弱成本控制能力。
因此,更智能的 AI 基础设施涵盖硬件与组织层面的决策。它将设施工程与应用设计、财务、安全和运营结合起来。
这比宣布建设另一个园区更难。但更多下一阶段的性能提升,也可能正是在这里找到。
数据中心竞赛施压的不只是超级云服务商
基础设施转型迫使每个参与者重新思考,什么才算是 AI 优势。
超级云服务商面临着最显著的压力。Amazon、Google、Meta 和 Microsoft 既需要足够的容量来服务自身产品,也需要支持云客户。它们还要争夺设备、选址、电力和工程人才。
它们的规模带来了议价能力和地域灵活性,但也造成了风险敞口。当模型架构、芯片性能或客户需求的变化速度快于设施的适应速度时,大规模承诺可能变得低效。
前沿模型开发商面临着相关风险。更多计算资源对训练仍然重要,但模型质量并不只由硬件规模决定。数据质量、算法、评估和后训练方法同样重要。
容量竞赛可能掩盖薄弱的单位经济效益。供应商或许能处理更多请求,却在每一项请求上损失效率。当使用量增长得更快时,计算成本下降并不保证总支出降低。
芯片供应商面临的压力,不仅是提升原始处理性能。客户日益关注内存带宽、互连、能效、软件支持,以及完整系统的冷却要求。
如今,公用事业公司对 AI 部署时间表的影响,与一些科技供应商一样直接。它们的决定将影响园区能否接入、扩建,或按所需负载运行。
公用事业公司还承担着数据中心开发商不具备的公共责任。它们必须维持可靠性,并向广泛的客户群体说明投资的合理性。大型新增负载会影响发电规划和输电升级。
社区在本地感受到这些权衡。项目可能带来建设活动和税收收入,同时也会消耗土地、水资源和电网容量。收益与成本的分配可能引发政治争议。
Pacific Northwest National Laboratory、ASHRAE 和 NEMA 制定的效率框架体现了这种更广泛的责任。它为衡量和改善 AI 数据中心能源性能提供了原则。
企业买家看似远离设施设计,但他们的决策会汇聚为基础设施需求。选择模型、设置响应限制、保留数据和部署智能体,都会影响计算资源消耗。
智能体尤其可能造成不均衡的需求。智能体工作流允许软件在有限人工指导下规划并执行多个步骤。一次用户请求可能触发大量模型调用、搜索和工具操作。
这种放大效应使应用设计成为基础设施问题。开发者需要设置限制、监控、缓存和模型路由。否则,有用的自动化可能产生不可预测的需求。
这种压力是长期性的,因为这些系统遵循不同的更换周期。模型可以在数月内变化。服务器通常服役更久,而建筑物和电网设备的使用寿命则长达数十年。
这种时间差带来了搁浅资产风险。围绕当今最高密度训练集群设计的设施,未来可能面对一个由高效推理或专用处理器主导的环境。
相反的风险同样存在。效率提升可能降低 AI 成本,并将使用量推高到足以增加总消费的程度。这种反弹效应意味着,更智能的基础设施未必会降低整体电力需求。
它应当提升每单位受限容量所交付的有效工作量。总需求是否下降,取决于采用情况、模型设计和用户行为。
Google News 有助于让更广泛的科技受众看到这场争论,但其背后的决策并不抽象。它们影响 AI 服务在哪里运行、可靠性如何提升,以及哪些公司有能力负担扩张成本。
这种转变也迫使高管不再将基础设施视为孤立的 IT 采购。财务团队必须理解长期承诺。安全团队必须评估分布式环境。设施团队必须预判硬件路线图。
没有任何参与者能够独立优化自己的层级。更高效的芯片仍可能催生更大的集群。没有输电设施,新的电力来源仍可能无法接入。工作负载调度不佳时,高速网络也可能闲置。
因此,制胜优势是在约束条件下实现协调。这不如破纪录规模的园区显眼,却更难被竞争对手迅速复制。
“更智能基础设施”的说法并不能证明什么
更智能基础设施的论点颇具说服力,但它并不能证明实体扩张正在结束,或效率将解决所有约束。
第一个不确定性涉及需求。预测取决于采用率、模型架构、硬件进步和应用行为。这些假设的微小变化,都可能导致截然不同的电力预测。
IEA 发布的是情景预测,而非唯一确定的结果。其基准情景提供了有用的规划参考,但未来需求可能高于或低于这一路径。
第二个不确定性涉及利用率数据。云服务商会披露资本支出和部分效率指标,但外界获得的关于整个设备群加速器利用率的细节有限。
缺少一致的工作负载层面报告,就难以比较一家运营商的智能基础设施与另一家的差异。营销术语可能掩盖某种设计是否真正带来可衡量的改进。
第三个不确定性在于地理因素。灵活的工作负载调度可以将部分计算转移到电力充足的地区,但数据并不总能自由流动。
隐私规则、国家安全要求、客户合同和延迟需求都可能限制部署位置。一个技术上高效的地区,可能不适合受监管的工作负载。
第四个不确定性涉及本地环境影响。液冷可以改善散热,但不同冷却设计在用水量和能耗上有所不同。气候和水资源可用性也会因地点而改变这种权衡。
现场发电可以加快电力接入,但其排放和对社区的影响取决于所采用的技术。更快的接入并不自动意味着更清洁。
第五个不确定性是经济层面的。更高的利用率可以减少完成特定工作负载所需的基础设施,但也可能降低 AI 服务价格,刺激足够多的需求来抵消这些节省。
这就是为什么效率与扩张不应被表述为相互排斥的结果。行业很可能会同时推进两者。关键问题在于,优化能否跟上部署速度。
围绕原始标题中宽泛预测的验证缺口同样存在。没有任何单一研究能够证明,更智能的基础设施将在所有 AI 工作负载中比实体规模更重要。
训练前沿模型仍受益于大型、高度互联的集群。一些供应商将继续建设超大型园区,因为规模仍是一项竞争投入。
更有力的论点范围更窄。单靠更大的园区无法绕过电力输送、散热、网络和工作负载效率等限制。能源机构和基础设施研究的证据支持这一结论。
第二个风险是,“智能基础设施”的表述会成为问责的替代品。运营商可以描述编排和效率计划,却不报告社区、客户或监管机构能够评估的结果。
有用的信息披露应将容量与产出关联起来。它应展示资源闲置的频率、设施如何应对电网压力,以及不同工作负载的能源强度如何变化。
运营商还应区分签约电力与实际消耗。已公布容量、申请容量、已通电容量和已利用容量是不同的衡量指标。
同样的纪律也适用于园区公告。一个多阶段项目可能具有很高的最终电力规模,但在多年内仅以其中很小一部分运行。
因此,Google News 的读者应避免走向两个极端。基础设施紧缩既不能证明 AI 增长必须停止,也不能证明软件优化会消除实体限制。
这是一个建立在存在争议假设之上的规划问题。最可信的公司将公布运营证据,而不只是建设目标或效率承诺。
三个信号将检验 Google News 的论点
只有当运营结果表明协调能够从有限资源中产出更多有效 AI 容量时,更智能基础设施的论点才具有可信度。
第一个信号是工作负载层面的效率报告。云服务商和大型运营商应披露更多有关加速器利用率、每项已完成任务的能耗,以及因支撑性约束而损失的容量的信息。
如果有效产出的增长快于电力消耗,这种更好的报告将强化该论点。如果新的编排系统未能显著改变设备群利用率,则会削弱该论点。
第二个信号是公用事业公司如何应对灵活的数据中心负载。开发者正越来越多地讨论转移非紧急计算、分阶段接入,以及在电网压力较大的时期降低需求。
真实的公用事业协议将比试点公告更重要。如果灵活设计能够更快获得接入、且不将可靠性成本转嫁给其他客户,这一论点就会得到更多支持。
如果运营商要求持续保持最大功率,或严重依赖临时化石燃料发电,这一论点就会失去支持。这些结果将表明,调度灵活性仍比倡导者所说的更为有限。
第三个信号是推理增长与设施选址之间的关系。推理为实时应用运行已训练好的模型,而其延迟要求可能更有利于分布式算力。
可衡量地转向区域部署和企业部署,将支持更智能、更分布式基础设施的论点。如果算力仍持续集中在少数超大型园区中,规模化将继续是主导模式。
未来几个季度,这些信号应会体现在运营报告、电网协议和部署数据中。关于计划中兆瓦容量的新闻标题,无法回答核心问题。
开发者和企业买家无需等到这些证据完全出现后才采取行动。他们应衡量模型需求,将紧急工作与灵活工作区分开来,并避免默认将每个请求都交给最大的模型。
他们还应从系统层面的问题来评估服务提供商。工作负载在哪里运行?在算力受限时会发生什么?有哪些性能和能源指标可供参考?部署能否轻松迁移?
知识工作者同样可以发挥作用。AI agents 和 assistants 会将日常行为转化为基础设施需求。更好的提示词、合适的模型、可复用的上下文以及受控的 agent 循环,都可以减少不必要的计算。
构建可重复工作流的团队,可以参考这个实用的 AI workflow 示例,然后衡量自动化在哪些环节节省了工作,又在哪些环节带来了额外处理。
通过 Google News 浮现的 Forbes 论点,归根结底是一个可检验的命题。更大的设施仍将持续落地,但其规模所揭示的信息,将少于其可用产出。
关注运营指标、公用事业协议和推理部署地点。这三个信号将表明,更智能的基础设施究竟正在成为行业真正的优势,还是只是最新的口号。
如今,每一位 AI 买家都面临一个具体问题:你购买的是更多名义上的计算容量,还是在构建一个能将受限资源转化为可靠成果的系统?



