OpenAI、Oracle 和 SoftBank 推出五座新的 Stargate AI 数据中心,规模扩展至 10 GW
- Aisha Washington

- 6月6日
- 讀畢需時 9 分鐘

Stargate AI 数据中心启动及其重要性
美国 AI 基础设施的协调推进
OpenAI、Oracle 和 SoftBank 宣布联合推出 Stargate AI 数据中心计划,在美国新建五个站点以支持大规模 AI 工作负载. 合作伙伴在得克萨斯州揭幕了一个园区,并将该计划围绕一个标题技术目标展开:五个站点合计 10 吉瓦(GW)IT 功率. 作为参考,吉瓦是功率单位,等于十亿瓦——当服务器满负荷运行时,此规模相当于一座小城市的电力需求。
此次宣布更多被视为一项战略性、多年期基础设施计划,而非单一站点建设;媒体报道援引行业估算称,整体投入可能达到数千亿美元,其中一个数字约为 五个站点合计约 5000 亿美元. 配套资本计划的是供应商安排,市场报道特别指出大规模 NVIDIA 硬件承诺,将提供密集 GPU 集群以支持模型训练和推理工作负载。
关键要点: Stargate 不仅仅是又一次数据中心 rollout,而是对美国专用、超高密度 AI 计算能力 的针对性押注,由重量级商业伙伴关系支持。
正在建设的内容以及 10 GW 可实现的功能

专用园区,以计算为先的设计
Stargate 计划被描述为在美国建设五个专用 AI 数据中心站点,专为大规模训练和推理而设计,而非通用托管. 这些站点围绕持续、高功耗 GPU 集群进行工程设计——这些系统用于训练和运行现代神经网络——同时相应投资变电站、冷却设施以及机架与站点之间的低延迟网络。
在实践中,“专用”意味着:设施布局和机械系统针对满载加速器的机架进行优化,而非针对 CPU、存储阵列和多租户可变工作负载的混合。这会影响从地板承重、架空地板设计到冷冻水回路和冗余架构的一切。合作伙伴明确表示,将计算密度和运行连续性置于通用云灵活性之上,这改变了工程权衡的集合。
洞见:为加速器集群设计持续 100%+ 利用率,迫使可靠性、维护和供应链假设与典型多租户云数据中心不同。
合作伙伴角色分工
三家牵头组织为项目带来了不同能力。OpenAI 负责提出 AI 工作负载需求,并发出对持续 GPU 重载计算的需求信号. Oracle 贡献数据中心开发与运营经验、商业云平台以及企业级市场渠道. SoftBank 负责协调投资策略、站点选择和资本动员. 这种分工类似于专业基础设施项目中常见的历史模式:锚定租户定义技术要求,基础设施伙伴负责建设和运营,投资方组织资本。
硬件生态系统与系统集成
市场报道强调潜在的 大规模 NVIDIA 硬件承诺,旨在为 GPU 集群提供设备. 虽然加速器数量和 TFLOPS(每秒万亿次浮点运算)尚未披露,但含义明确:设计围绕由高带宽网络连接、并由专用配电和冷却支持的大规模加速器阵列展开。
系统集成与原始芯片同样重要。持续 AI 训练需要连续的电源和热管理、快速互连(例如高速以太网或 InfiniBand 拓扑),以及在数千台设备上编排模型并行的软件平台。Stargate 计划似乎旨在将这些层级捆绑成一个垂直集成的环境,服务于大型模型。
关键要点: Stargate 将站点级工程与集中 GPU 舰队相结合,旨在提供一个连续环境,针对长时间、高利用率训练运行进行优化,而非通用云弹性。
功率、硬件规模与实际性能
10 GW 实际代表什么
SoftBank 的公告设定了五个初始 Stargate 站点合计 10 GW IT 功率目标. 在数据中心语境中,“IT 功率”指分配给计算设备(服务器、加速器、存储)的电力容量,不包括支撑基础设施损耗。十吉瓦是一个标题指标,定义了该项目可容纳多少 GPU 以及多少持续计算能力的原始上限。
具体而言:现代高端 AI 加速器每机架消耗数千瓦,或每卡根据散热方案消耗数百瓦至数千瓦。扩展到多吉瓦级别意味着数以万计的加速器和数以千计的机架,这一硬件集中度在公有云历史上几乎没有先例。
硬件采购与性能影响
一份被广泛引用的市场报告指出,NVIDIA 硬件联盟规模约为 1000 亿美元,以提供此类建设的 GPU 容量. 虽然美元数字和确切合同条款属于市场报道而非合作伙伴新闻稿,但规模表明需要多年期采购和组装管道。就性能而言,这种硬件密度可实现:
更长的连续高利用率训练窗口,从而缩短收敛的挂钟时间;
能够训练参数量更大的模型,因为更多加速器内存和互连容量可并行调度;
超参数扫描和模型架构迭代的端到端实验周转时间缩短。
不过,Stargate 的 TFLOPS 总量或加速器数量尚未公开披露,因此精确性能结果仍属推测。
初始 10 GW 之外的额外容量
Oracle 和 OpenAI 另有协议在美国开发另外 4.5 GW 的 Stargate 容量,表明标题 10 GW 之外的分阶段扩展. 这种分层方法——先建锚定容量,再签署扩展协议——与大型基础设施项目的典型融资和扩展方式一致。
洞见:容量数字(GW)告诉你潜在上限;实际计算量取决于交付的加速器、冷却/性能调优以及编排软件。
大胆要点: 十吉瓦定义了原始计算潜力的非凡上限——但价值在于如何将这些功率转化为可用、有效编排的 GPU 小时。
rollout、投资与访问

时间表、公开里程碑与分阶段交付
一个 Stargate 站点已在得克萨斯州公开揭幕,更广泛的计划宣布将在美国建设五个站点. 此次公开揭幕是一个早期里程碑;但所有五个站点的详细调试时间表尚未发布。行业观察者应预期分阶段建设、分阶段设备交付,以及随着本地许可和电网升级完成而逐步调试。
大型数据中心项目从开工到全面运营通常需要数月至数年时间。鉴于报道的每站点多吉瓦目标,关键路径项目将包括高容量电网互连、变压器和变电站工程,以及 HPC 机架和冷冻水系统等长周期项目。
融资模式与赌注规模
媒体报道将整个计划估算置于五个站点合计约 5000 亿美元左右. 无论该确切数字是否准确,都表明 Stargate 被视为一个非常庞大的资本计划,多年期部署成本涵盖房地产、电力基础设施、系统和硬件采购。
融资将是合作伙伴股权、供应商融资(例如供应商信贷或分阶段硬件采购合同)以及潜在外部投资者的混合。供应商供应承诺(如报道的 NVIDIA 对齐)也通过提供可预测的硬件路线图来简化采购。
谁付费以及谁可以使用容量
OpenAI 是模型训练和运营的主要受益者,Oracle 的参与表明企业云集成以及潜在的 Oracle Cloud 客户路径. 公开报道尚未详细说明第三方租用条款、定价或对其他公司的批发访问。早期阶段,容量预计将优先用于合作伙伴的工作负载。
对于外部企业,可行的访问途径包括:
由 Stargate 容量支持的 Oracle 介导云服务或私有链路产品。
合作伙伴公司购买预留容量或托管服务的商业安排。
如果合作伙伴选择将闲置容量货币化,则可能有有限的经销商或企业协议。
影响 rollout 的环境与许可约束
大功率消耗和电网互连需求意味着许可、本地社区参与以及可再生能源采购决策将影响时间表。得克萨斯州揭幕包含本地背景,凸显社区和公用事业在进度和接受度中发挥的核心作用。
大胆要点: 预期由电网升级、长周期硬件采购和合作伙伴定价选择驱动的分阶段 rollout;第三方商业访问将取决于 Oracle 和 OpenAI 后续的产品化。
Stargate 与现有超大规模 AI 基础设施的比较及市场影响

规模、重点和供应商关系的差异
Wired 将 Stargate 描述为巩固美国 AI 基础设施领导地位的战略举措,其专用姿态与混合工作负载超大规模运营商不同. 传统超大规模云(例如广泛的多租户运营商)通常在多供应商舰队上平衡多样化工作负载——Web 服务、数据库、企业 VM。相比之下,Stargate 的价值主张是集中的:它旨在为与前沿 AI 训练和推理相关的一组较窄工作负载提供超高密度、加速器优先的容量。
据报道的大规模 NVIDIA 硬件协议强化了这种集中:Tom’s Hardware 报道暗示与 NVIDIA 紧密对齐以供应 GPU. 这种垂直集中可带来优势——通过规模降低单位成本、针对单一加速器架构简化软件优化——但也增加了供应商依赖风险并降低了平台异构性。
市场效应与对竞争对手的压力
高密度特权计算园区网络可能重塑高端 GPU 的供应和定价动态。较小的云提供商和托管商店可能更难获得最新一代加速器,或在大量预留 GPU 小时块的价格上竞争。这可能加速向双层市场转变:一套针对巨型模型训练优化的超高密度、垂直集成设施,以及服务更多样化工作负载的更广泛云生态系统。
对企业和开发者的实际影响包括:
能够访问 Stargate 支持资源的用户可获得更快的迭代周期和更大的模型实验。
如果合作伙伴传递效率收益,可能降低超大规模训练运行的边际成本。
需要软件可移植性策略:针对 Stargate 所用加速器类型和互连优化的模型和工具,可能需要适应才能在其他地方高效运行。
大胆要点: Stargate 的集中方法为其用户放大了容量和速度,同时将市场压力转移到缺乏类似规模或供应商承诺的竞争对手身上。
常见问题
Q1:Stargate AI 数据中心究竟是什么?
这是 OpenAI-Oracle-SoftBank 联合倡议,在美国建设五个专用 AI 数据中心站点,合计目标为 10 GW IT 功率.
含义:专注于托管高密度 GPU 集群以进行大规模训练和推理,而非通用托管。
Q2:投资规模有多大,谁在付费?
媒体报道援引整个计划规模约为五个站点合计 5000 亿美元,但确切融资明细尚未公布。
含义:融资似乎由合作伙伴驱动,伴随多年期资本承诺和供应商采购协议。
Q3:NVIDIA 是否会为 Stargate 供应硬件?
市场报道显示存在大规模 NVIDIA 硬件联盟,旨在为 AI 数据中心提供 GPU 容量。
Q4:其他 Stargate 站点何时上线?
含义:预期分阶段建设、许可和电网工程将在多年内错开可用性。
Q5:其他公司能否在 Stargate 购买容量?
公开报道将 Stargate 主要定位为满足 OpenAI 和合作伙伴需求;Oracle 的角色暗示企业路径,但明确的第三方租用/定价尚未披露.
含义:企业应关注 Oracle 的产品公告,这些公告可能通过云或托管服务开放容量。
Q6:环境影响和可持续性承诺如何?
含义:本地许可、电网升级和可再生能源采购将对时间表和公众接受度产生实质性影响;社区参与将发挥作用。
Stargate AI 数据中心以及基础设施和 AI 生态系统的下一步

整合各部分并展望未来
Stargate 的五站点、10 GW 雄心标志着美国向垂直集成、仅 AI 基础设施的决定性转变。具有强烈计算需求(OpenAI)的锚定租户、云与运营伙伴(Oracle)以及资本组织者(SoftBank)的组合,为大规模交付密集 GPU 容量创造了强大引擎。如果按报道交付,该计划将实质性改变大型模型的训练方式:更快的周转、更大的实验,以及大规模计算运行可能更低的边际成本。
在未来几年,关注三个相互关联的维度:
交付与时间:电网就绪度、本地许可和硬件出货将决定容量何时可用。
商业产品化:Oracle 或合作伙伴是否以及如何向更广泛的企业客户开放容量,将塑造超越合作伙伴生态系统的市场覆盖范围。
可持续性与社区接受度:可再生能源采购、高效冷却技术以及透明的社区参与将影响运营可行性和公众合法性。
存在权衡。硬件和供应商关系的集中可为生态系统内部用户带来效率和速度,但也集中了供应链风险,并引发其他人市场准入的问题。技术胜利——更多 GPU 小时、更高的利用率、更紧密的软硬件优化——可能伴随经济和政治后果:少数组织掌握不成比例比例的生产级训练计算。
对于开发者、企业和政策思考者而言,Stargate 既是机遇,也是适应号召。企业应考虑的策略包括:
关注 Oracle 的 Stargate 支持服务产品,这些服务可能无需内部数据中心投资即可解锁大规模训练。
为模型和工具的可移植性做好准备,认识到今天针对加速器优化的栈可能需要在异构云上运行。
参与关于能源、韧性和 AI 基础设施竞争的本地和全国对话,以塑造公平结果。
最终思考: Stargate 是成为 AI 创新的广泛加速器,还是少数领导者计算能力的整合,将取决于 rollout 执行、定价和访问选择,以及合作伙伴如何透明地应对环境影响和供应链韧性。对观察者和参与者而言,未来两到五年将揭示该计划是通过有效提供容量来民主化大规模 AI,还是将高端训练锁定在新型封闭基础设施之后。无论如何,Stargate 标志着 AI 硬件战略演进中的重大时刻——组织应围绕它进行规划,而不是被它意外。


