top of page

Bernstein:AI 数据中心每 GW 成本达 395 亿美元,但折旧才是更大的警讯

7小时前
讀畢需時 14 分鐘

Bernstein 估计,采用 Nvidia Vera Rubin 架构的 AI 数据中心,如今每吉瓦成本可达 395 亿美元。然而,这笔醒目的投资并非分析中最具决定性的部分。更持久的负担来自服务器、网络设备、内存和电力系统数十亿美元的折旧,而这些硬件可能在失去经济价值前就已开始折旧。

该估算显示,不同加速器架构的每吉瓦成本介于 346 亿至 395 亿美元之间。据报道,OpenAI 的 Jalapeno 定制 ASIC 设计接近区间下限,而 Nvidia 的 Vera Rubin NVL72 平台则位于上限。这个相对有限的价差挑战了一种看法:即选择更便宜的加速器就能彻底改变整个设施的经济性。

Bernstein 早先的研究估计,一吉瓦 AI 容量的成本约为 350 亿美元,低于 Nvidia 自身给出的 500 亿至 600 亿美元估计。其最新计算细化了组件假设,但战略层面的矛盾依然存在。科技公司正追求更多算力,而设备一旦投入使用,会计成本便开始累积。

Bernstein:AI 数据中心成本达到每吉瓦 395 亿美元

Bernstein 的最新估算显示,加速器的选择会改变成本结构,但无法让吉瓦级 AI 基础设施变得廉价。

一份于 10 月 10 日发布的报告摘要称,一吉瓦容量的总投资介于 346 亿至 395 亿美元之间。这一计算不只是指一栋接入电网的空建筑,还包括加速器、服务器、内存、存储、网络、冷却、备用电源,以及支撑高密度计算机架所需的电力系统。

最高估算适用于 Nvidia 计划推出的 Vera Rubin NVL72 架构。据报道,Bernstein 将单个 Rubin 机架的估算成本从 910 万美元下调至 752 万美元,较该机构此前模型下降约 17%。

根据已发布的基础设施估算,这一调整反映出对高带宽内存和 NAND 存储容量的较低假设。高带宽内存通常简称 HBM,可将高速内存部署在加速器附近,让模型能移动数据,而无需等待速度较慢的存储系统。

这一降幅之所以重要,是因为内存已成为每台 AI 服务器的重要成本构成。不过,较低的内存假设并不能消除周边成本。更多机架仍需要交换机、网络接口卡、电力转换硬件、冷却设备、变压器和发电机。

据报道,OpenAI 的 Jalapeno 架构位于 Bernstein 估算区间的低端。Jalapeno 被描述为一种定制化专用集成电路,即 ASIC,围绕比通用加速器更窄的工作负载设计。定制芯片能够降低部分供应商利润空间,并针对特定任务优化性能。

即便如此,最低与最高配置之间的总差额仍不足每吉瓦 50 亿美元,低于最高估算的 15%。这一结果表明,芯片选择改变的更多是资金流向,而非整体投入规模。

这一点在 Bernstein 此前对 Nvidia GB200 系统的分析中已可见。该研究估计,每吉瓦的总建设成本约为 350 亿美元,其中图形处理器约占资本支出的 39%。网络约占 13%,机械和电力系统则接近三分之一。

因此,加速器仍是最大的单项类别,但并不等同于整个数据中心。较低的加速器价格无法消除供电、散热和连接数千颗处理器所需的设备成本。

Bernstein 此前估计,一套 GB200 NVL72 机架成本约为 590 万美元,其中约 340 万美元用于计算硬件,250 万美元用于相关实体基础设施。这些在早期成本拆解中披露的数据表明,仅依据芯片价格进行比较可能会误导投资者。

这一单位也需要谨慎解读。一吉瓦代表的是极其庞大的持续电力负载,而非传统服务器机房。在满负荷运行时,其电力需求足以使项目成为区域基础设施议题。

因此,Bernstein 的数据中心估算为竞争系统提供了一个共同的比较基准。Nvidia、定制 ASIC 开发商、云运营商和基础设施供应商都可以宣称拥有更高的效率。然而,投资者仍需追问:每一整吉瓦设施究竟能够产出多少有效算力和收入。

这也形成了核心张力。多年来,行业一直将加速器和电力供应视为关键约束。Bernstein 的分析表明,下一个约束在于:运营商能否在已部署设备在财务和技术层面过时前,赚取足够收入。

折旧而非电力,构成最沉重的持续性负担

电力受到公众关注,但折旧决定了 AI 基础设施必须以多快速度创造可持续收入。

折旧是一种会计处理方式,将资产成本分配至其预期使用寿命内。它不要求每个季度支付新的现金,但会降低报告利润,并反映出以真实资本购置的设备正在被消耗。

Bernstein 此前的 Vera Rubin 模型说明了这一规模。若电价为每千瓦时 0.15 美元,一座一吉瓦设施每年将产生约 13 亿美元电力支出。同一模型在硬件使用寿命为六年的假设下,得出每年约 79 亿美元的折旧。

这些数据来自 6 月的一项分析,当时该分析估计 Vera Rubin 基础设施每吉瓦总成本为 470 亿美元。Bernstein 此后下调了其机架估算,因此具体折旧金额也会相应变化。不过,这一关系仍解释了该机构的警示:即使设施消耗一吉瓦电力,持有成本也可能高于电费。

底层的Rubin 成本模型假设配置 3,557 个机架、每个机架功率为 220 千瓦。其中约 320 亿美元分配给机架相关设备,另有 150 亿美元用于实体基础设施。其六年折旧期将初始投入转化为持续的利润表费用。

六年的会计使用寿命并不保证每一颗加速器都能在六年内保持竞争力。当更新一代的系统能够提供更高的每瓦性能或更低的推理成本后,旧服务器仍可能继续运行。实体寿命与经济有效性之间的差距,才是真正的风险。

如果下一代硬件大幅降低生成一次 AI 响应的成本,旧系统的所有者将面临下调租赁价格的压力。除非企业延长使用寿命或计提减值准备,否则其折旧进度仍会持续。两种选择都不会为旧设备创造更多需求。

延长使用寿命会降低年度折旧,并支撑短期利润,但这也意味着设备将能在更长时间内保持生产力。过于激进地做出这种调整的公司,可能只是推迟确认经济性恶化。

减值则走向相反方向。它承认资产无法通过未来现金流收回其账面价值。减值在确认时属于非现金费用,但揭示了早期资本支出将带来低于预期的收益。

这一机制使 AI 折旧成本不同于普通公用事业账单。电力成本随使用量上升,因此利用率较低的集群耗电较少;但即使服务器在等待客户、软件或网络容量,折旧仍会继续。

因此,利用率变得至关重要。满负荷运行的集群可以将折旧分摊至更多训练任务、生成 token 或云服务合同中。利用不足的设施则承担着大部分相同的持有负担,却创造更少收入。

时机问题同样重要。公司通常在完整集群开始服务客户之前,就已对土地、电气设备、芯片和建设作出资金承诺。项目延误可能导致资本被占用却没有相应收入,同时部分已安装资产已开始老化。

AllianceBernstein 将相关风险描述为信息“真空期”。在短于折旧周期的一段时间内,收入证据可能仍不完整。届时,投资者必须在不知道采用规模能否足够快扩大的情况下,为长期支出进行估值。

这一担忧并不意味着这些支出必然浪费。AI 训练和推理需求可能快速增长,新系统也能够处理更多工作量。但这确实意味着,收入增长、利用率和硬件效率必须同步到来。

折旧也改变了读者解读云业务利润率的方式。供应商可能报告 AI 需求不断增长,却仍因新资产投入使用而面临利润率压力。现金流、营业利润和经调整收益可能呈现不同图景,因为它们对资本投资的处理方式不同。

这种负担可以在公司之间转移,但不会消失。租用算力的模型开发商无需拥有每台服务器,但其云服务商会将折旧和融资成本计入合同价格。云运营商可以使用特殊目的实体或租赁安排,但仍会有其他投资者持有这些资产。

因此,核心问题不在于是否有人能够为下一个集群融资,而在于整条链条能否在另一代硬件重设竞争标准之前,创造足够的经济产出。

Nvidia 和定制 AI 芯片面对同样的资本现实

主要竞争并非 Nvidia 与某一款定制芯片之间的较量,而是不断扩展算力的承诺与基础设施折旧现实之间的较量。

Nvidia 的地位使其成为这轮支出浪潮中最显眼的受益者。其加速器、网络产品、软件和机架级系统覆盖了部署的多个环节。当客户重视训练模型或提供模型服务所需时间时,更高的系统性能也能为更昂贵的配置提供合理性。

定制 ASIC 则提供了不同的价值主张。Google、Amazon、Microsoft、Meta 及 AI 实验室都在研发为自身工作负载设计的芯片。这些系统可以消除部分商用芯片利润空间,并让硬件更贴近内部软件需求。

Bernstein 的估算表明,无论采用哪条路径,都无法避开更广泛的成本账单。定制加速器的成本可能更低,但运营商也可能在既定预算下部署更多机架。每个机架仍需要内存、网络、配电、冷却和实体场地。

这一结果类似于杰文斯悖论:效率提高会降低资源使用成本,并刺激额外消费。更高的每美元性能可以降低单项工作负载的成本,同时鼓励开发者运行更大的模型、使用更长的上下文,或服务更多请求。

这种动态有利于基础设施供应商,但也使“效率提升将自动降低资本需求”的说法更为复杂。行业可以将效率收益转化为更多计算能力,而不是降低总支出。

Nvidia 自身的估算显示,这些计算仍存在多大不确定性。该公司此前给出的区间为每吉瓦 500 亿至 600 亿美元,而 Bernstein 较早的分析则将相当规模的容量估值为约 350 亿美元。差距反映了不同的硬件代际、定义,以及对所含基础设施的不同假设。

Broadcom 和 AMD 曾将可服务的加速器市场机会描述为每吉瓦约 150 亿至 200 亿美元。该数字并不代表一座完整建成的数据中心的成本,而是指整个项目中半导体部分的市场机会。

这些衡量指标常被重复引用,仿佛它们回答的是同一个问题。事实并非如此。一项估算可能涵盖加速器,另一项可能涵盖完整机架,还有一项可能计入发电设施或融资。

最新的 Bernstein 区间之所以有参考价值,是因为它在同一套方法论下比较了完整架构。但这并不是一份通用的建设报价。土地价格、电网接入、能源系统、利用率目标、融资和当地劳动力都会改变最终结果。

架构比较还必须考虑有效产出。如果一个更昂贵的集群能更早训练完成模型,或能处理显著更多的请求,它依然可能具备经济性。若软件支持、可靠性或客户需求限制了利用率,较便宜的集群也可能令人失望。

预计 Vera Rubin 相比 Nvidia 的 Blackwell 代际将显著提升计算性能。Bernstein 较早的模型估计,每个 Rubin 机架可提供 2,520 FP8 petaflops,而 Blackwell 为 720 petaflops。FP8 是一种八位数值格式,它以牺牲相较于更大格式的精度为代价,加速 AI 计算。

原始吞吐量并不会直接转化为可计费的工作量。模型架构、内存容量、通信开销、软件优化和正常运行时间,都会影响有多少宣传中的性能真正交付给客户。

定制芯片路线带来了另一种权衡。运营商获得了对硬件设计的控制权,并可能降低供应商利润空间;但他们也承担开发风险、软件集成工作,以及维持有竞争力路线图的挑战。

Nvidia 将这些成本分摊给众多客户,并以成熟的软件环境支持其硬件。即使采购价格更高,这也可能降低部署风险。拥有足够内部需求的超大规模云服务商,则可能有理由作出相反选择。

因此,Bernstein 的数据中心估算并未指出一个简单的赢家。它表明,两种架构都不会改变成本的数量级。财务结果更大程度上取决于利用率、收入以及硬件更新换代的速度。

这也是为什么首要对手最好被理解为计算能力扩张与资本回收之间的对抗。Nvidia 和定制 ASIC 是应对同一压力的不同路径。两者都必须在折旧消耗预期回报之前,产出足够多的有价值工作。

395 亿美元估算并不能证明什么

Bernstein 的计算揭示了成本结构,但无法确定未来利用率、使用寿命或投资回报。

这项估算是通过专有研究的摘要向公众呈现的,而非一份完全可访问的工程物料清单。读者可以查看核心假设,却无法独立审计每个组件或供应商价格。

这一限制很重要,因为模型已经发生变化。Bernstein 在 6 月的分析中,将 Vera Rubin 基础设施估为每吉瓦约 470 亿美元,每个机架为 910 万美元。10 月的摘要则将机架估值下调至 752 万美元,总投资降至 395 亿美元。

数月内机架估算修订 17%,说明该模型对内存、存储和配置假设高度敏感。这并不意味着新估算无效,但确实不应将 395 亿美元视作 AI 基础设施的一条固定定律。

较低的数字同样不能证明回报有所改善。如果市场租赁价格与硬件成本同步下降,运营商可能会将节省的成本让利给客户。竞争可能将成本下降转化为更便宜的推理服务,而不是更高的利润率。

使用寿命估算带来了另一项不确定性。六年提供了方便的折旧周期,但 AI 加速器所处的产品迭代周期要快得多。一些较旧系统仍可能适合推理、微调或要求较低的工作负载;另一些则可能因能耗或软件要求而更早失去经济性。

企业可以通过将旧硬件下放到较低层级的工作负载来延长其使用期。一个不再能训练最大前沿模型的集群,或许仍可服务于较小模型或批处理任务。这些任务的剩余需求和定价仍不确定。

电力成本也存在很大差异。Bernstein 此前的年度 13 亿美元估算采用了每千瓦时 0.15 美元的电价。拥有更便宜合同电力的设施支出会更低,而受限地区则可能面临更高的电费和电网升级成本。

一吉瓦接入容量并不总等同于一吉瓦持续的 IT 负载。维护、冗余、冷却开销、电力使用效率以及爬坡计划都会影响实际耗电量。比较时需要对公用事业电力、关键负载和加速器负载采用一致的定义。

融资进一步令情况复杂化。两座拥有相同设备的项目,可能因一方依赖企业现金、另一方使用高成本债务而产生不同回报。利息与折旧是两回事,但最终都必须由收入支撑。

随着支出范围超出最强劲的企业资产负债表,资金结构正变得更加重要。AllianceBernstein 更广泛的 AI 资本支出分析警告称,债务和供应商融资的增加可能降低融资质量。

同一分析估计,2025 年数据中心建设支出约为 4,000 亿美元。它还预计,超大规模云服务商到 2027 年的投资将超过 1 万亿美元。这些总额显示,利用率或资产寿命的微小变化为何会影响整个行业的盈利。

需求仍是决定性的缺失变量。已签订合同比预测提供更多确定性,但合同本身也需要评估。期限、终止权、客户集中度、预付款和信用支持决定了承诺收入是否与资产风险相匹配。

一些运营商可通过长期租约保护自身,将电力及其他运营成本转嫁给租户。这种结构提升了物业所有者的可见性,但并不能确保租户能从计算能力中赚取足够收入。

该分析同样无法确定 AI 应用会扩张到何种程度。模型开发商正在打造编程系统、研究工具、媒体生成器、广告产品和企业智能体。每位用户的收入和每项任务的成本仍未定论。

对企业买家而言,更低的推理成本可能加速采用。更多组织可以将 AI 系统从实验阶段带入日常工作流程。但团队仍需衡量这些系统是否节省人力、改善产出或创造新收入。

知识工作者同样面临这种约束。获得更多计算能力并不会自动带来更好的决策。组织需要可信的信息、可用的流程以及保留成果的方法。可检索的 AI 知识库可以帮助保留上下文,但不会改变基础设施经济性。

审慎的结论范围有限,却很重要。Bernstein 提供的是一个合理的成本框架,而非 AI 泡沫的证据,也非定制芯片将胜过 Nvidia 的证据。这项估算明确了未来收入必须跨越的门槛。

三个信号将表明投资能否回本

下一阶段的评判标准将是折旧、利用率和收入质量,而不是新增吉瓦数的公告。

第一个信号是超大规模云服务商的折旧增长。Amazon、Microsoft、Alphabet、Meta 和 Oracle 会通过财务报表及业绩评论披露折旧情况。投资者应将这些费用与云业务收入和营业利润进行比较。

在建设浪潮期间,折旧上升是意料之中的事。警示信号会在折旧持续增长速度快于新资产所支撑收入时出现。这种模式将强化一种观点:资本回收已成为首要约束。

使用寿命变化同样值得关注。延长服务器寿命可以在不改变当前现金流的情况下,降低年度费用并提高报告利润。企业应说明旧加速器为何仍具生产力,以及它们将如何被重新分配。

第二个信号是新 Rubin 和定制 ASIC 集群实现的实际利用率。订单公告显示了设备需求,但入住率和工作负载规模揭示了已建成的容量是否在赚钱。

云服务提供商可以通过积压订单转化、AI 服务收入、部署进度和利润率趋势提供佐证。模型公司则可以通过付费使用情况提供更有力的证明,而非注册用户数量或生成 token 等宽泛指标。

如果 Rubin 系统投入服务后保持高利用率,并以更低成本产出每单位有效工作,那么 Bernstein 区间上限将更容易得到支持。如果容量爬坡缓慢,折旧将开始不利于投资逻辑。

定制芯片也面临同样的检验。只有在软件和需求让硬件持续忙碌时,较低的设施成本才有帮助。强劲利用率将支持垂直整合带来持久节省的说法;利用率疲弱则会表明,较低的组件成本无法弥补闲置容量。

第三个信号是合同收入与融资义务之间的关系。行业正越来越多地使用租赁、债务、特殊目的实体、客户预付款和供应商安排,为基础设施提供资金。

这些结构可以加快建设并分散风险,但也可能使经济状况更难追踪。投资者应关注合同期限、客户集中度、利息成本、终止条款,以及付款与资产交付之间的时间差。

AllianceBernstein 认为,在折旧周期超过可见性之前,该行业需要广泛收入增长的证据。它担忧的不只是 AI 公司的总估值,而是支出已经确定、收入轨迹却仍不明朗的阶段。

更强劲的结果将包括:尽管折旧上升,云业务利润率仍在扩大;已建成集群的使用量提高;以及合同收入覆盖期延长。这些发展将削弱“建设规模已超出需求”的观点。

更疲弱的结果则会结合部署延迟、使用寿命延长、租赁价格下跌以及积压订单转化放缓。即使企业继续宣布新项目,这种组合也会强化 Bernstein 的警告。

更广泛的教训是,电力可用性只是入场条件。一家公司一旦获得土地、电力、冷却能力和加速器,便会面对第二个问题:它必须足够快地将这些容量转化为持续的经济产出,以收回投资。

Bernstein 的 AI 数据中心成本让这一期限变得清晰可见。346 亿美元与 395 亿美元之间的差额固然重要,但并非决定性变量。在硬件失去经济价值之前获得的收入,将决定下一吉瓦容量究竟会成为高效的基础设施,还是沉重昂贵的会计负担。

读者现在应当把目光从每座已宣布园区的规模上移开。关注季度业绩中的折旧、新系统投入使用时的利用率,以及支撑建设项目的合同是否具有持久性。这三个信号将揭示,AI 基础设施热潮究竟是在建设一个可持续的计算平台,还是在向其商业模式老化速度快于自身的硬件借用增长。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page