top of page

OpenAI、Oracle 和 SoftBank 推出五座新的 Stargate AI 数据中心,规模扩展至 10 GW

OpenAI, Oracle & SoftBank Launch Five New Stargate AI Data Centers to Scale to 10 GW

Stargate AI 数据中心启动及其重要性

美国 AI 基础设施的协调推进

OpenAI、Oracle 和 SoftBank 宣布联合推出 Stargate AI 数据中心计划,在美国新建五个站点以支持大规模 AI 工作负载. 合作伙伴在得克萨斯州揭幕了一个园区,并将该计划围绕一个标题技术目标展开:五个站点合计 10 吉瓦(GW)IT 功率. 作为参考,吉瓦是功率单位,等于十亿瓦——当服务器满负荷运行时,此规模相当于一座小城市的电力需求。

此次宣布更多被视为一项战略性、多年期基础设施计划,而非单一站点建设;媒体报道援引行业估算称,整体投入可能达到数千亿美元,其中一个数字约为 五个站点合计约 5000 亿美元. 配套资本计划的是供应商安排,市场报道特别指出大规模 NVIDIA 硬件承诺,将提供密集 GPU 集群以支持模型训练和推理工作负载。

关键要点: Stargate 不仅仅是又一次数据中心 rollout,而是对美国专用、超高密度 AI 计算能力 的针对性押注,由重量级商业伙伴关系支持。

正在建设的内容以及 10 GW 可实现的功能

What’s being built and what 10 GW enables

专用园区,以计算为先的设计

Stargate 计划被描述为在美国建设五个专用 AI 数据中心站点,专为大规模训练和推理而设计,而非通用托管. 这些站点围绕持续、高功耗 GPU 集群进行工程设计——这些系统用于训练和运行现代神经网络——同时相应投资变电站、冷却设施以及机架与站点之间的低延迟网络。

在实践中,“专用”意味着:设施布局和机械系统针对满载加速器的机架进行优化,而非针对 CPU、存储阵列和多租户可变工作负载的混合。这会影响从地板承重、架空地板设计到冷冻水回路和冗余架构的一切。合作伙伴明确表示,将计算密度和运行连续性置于通用云灵活性之上,这改变了工程权衡的集合。

洞见:为加速器集群设计持续 100%+ 利用率,迫使可靠性、维护和供应链假设与典型多租户云数据中心不同。

合作伙伴角色分工

三家牵头组织为项目带来了不同能力。OpenAI 负责提出 AI 工作负载需求,并发出对持续 GPU 重载计算的需求信号. Oracle 贡献数据中心开发与运营经验、商业云平台以及企业级市场渠道. SoftBank 负责协调投资策略、站点选择和资本动员. 这种分工类似于专业基础设施项目中常见的历史模式:锚定租户定义技术要求,基础设施伙伴负责建设和运营,投资方组织资本。

硬件生态系统与系统集成

市场报道强调潜在的 大规模 NVIDIA 硬件承诺,旨在为 GPU 集群提供设备. 虽然加速器数量和 TFLOPS(每秒万亿次浮点运算)尚未披露,但含义明确:设计围绕由高带宽网络连接、并由专用配电和冷却支持的大规模加速器阵列展开。

系统集成与原始芯片同样重要。持续 AI 训练需要连续的电源和热管理、快速互连(例如高速以太网或 InfiniBand 拓扑),以及在数千台设备上编排模型并行的软件平台。Stargate 计划似乎旨在将这些层级捆绑成一个垂直集成的环境,服务于大型模型。

关键要点: Stargate 将站点级工程与集中 GPU 舰队相结合,旨在提供一个连续环境,针对长时间、高利用率训练运行进行优化,而非通用云弹性。

功率、硬件规模与实际性能

10 GW 实际代表什么

SoftBank 的公告设定了五个初始 Stargate 站点合计 10 GW IT 功率目标. 在数据中心语境中,“IT 功率”指分配给计算设备(服务器、加速器、存储)的电力容量,不包括支撑基础设施损耗。十吉瓦是一个标题指标,定义了该项目可容纳多少 GPU 以及多少持续计算能力的原始上限。

具体而言:现代高端 AI 加速器每机架消耗数千瓦,或每卡根据散热方案消耗数百瓦至数千瓦。扩展到多吉瓦级别意味着数以万计的加速器和数以千计的机架,这一硬件集中度在公有云历史上几乎没有先例。

硬件采购与性能影响

一份被广泛引用的市场报告指出,NVIDIA 硬件联盟规模约为 1000 亿美元,以提供此类建设的 GPU 容量. 虽然美元数字和确切合同条款属于市场报道而非合作伙伴新闻稿,但规模表明需要多年期采购和组装管道。就性能而言,这种硬件密度可实现:

  • 更长的连续高利用率训练窗口,从而缩短收敛的挂钟时间;

  • 能够训练参数量更大的模型,因为更多加速器内存和互连容量可并行调度;

  • 超参数扫描和模型架构迭代的端到端实验周转时间缩短。

不过,Stargate 的 TFLOPS 总量或加速器数量尚未公开披露,因此精确性能结果仍属推测。

初始 10 GW 之外的额外容量

Oracle 和 OpenAI 另有协议在美国开发另外 4.5 GW 的 Stargate 容量,表明标题 10 GW 之外的分阶段扩展. 这种分层方法——先建锚定容量,再签署扩展协议——与大型基础设施项目的典型融资和扩展方式一致。

洞见:容量数字(GW)告诉你潜在上限;实际计算量取决于交付的加速器、冷却/性能调优以及编排软件。

大胆要点: 十吉瓦定义了原始计算潜力的非凡上限——但价值在于如何将这些功率转化为可用、有效编排的 GPU 小时。

rollout、投资与访问

Rollout, investment and access

时间表、公开里程碑与分阶段交付

一个 Stargate 站点已在得克萨斯州公开揭幕,更广泛的计划宣布将在美国建设五个站点. 此次公开揭幕是一个早期里程碑;但所有五个站点的详细调试时间表尚未发布。行业观察者应预期分阶段建设、分阶段设备交付,以及随着本地许可和电网升级完成而逐步调试。

大型数据中心项目从开工到全面运营通常需要数月至数年时间。鉴于报道的每站点多吉瓦目标,关键路径项目将包括高容量电网互连、变压器和变电站工程,以及 HPC 机架和冷冻水系统等长周期项目。

融资模式与赌注规模

媒体报道将整个计划估算置于五个站点合计约 5000 亿美元左右. 无论该确切数字是否准确,都表明 Stargate 被视为一个非常庞大的资本计划,多年期部署成本涵盖房地产、电力基础设施、系统和硬件采购。

融资将是合作伙伴股权、供应商融资(例如供应商信贷或分阶段硬件采购合同)以及潜在外部投资者的混合。供应商供应承诺(如报道的 NVIDIA 对齐)也通过提供可预测的硬件路线图来简化采购。

谁付费以及谁可以使用容量

OpenAI 是模型训练和运营的主要受益者,Oracle 的参与表明企业云集成以及潜在的 Oracle Cloud 客户路径. 公开报道尚未详细说明第三方租用条款、定价或对其他公司的批发访问。早期阶段,容量预计将优先用于合作伙伴的工作负载。

对于外部企业,可行的访问途径包括:

  • 由 Stargate 容量支持的 Oracle 介导云服务或私有链路产品。

  • 合作伙伴公司购买预留容量或托管服务的商业安排。

  • 如果合作伙伴选择将闲置容量货币化,则可能有有限的经销商或企业协议。

影响 rollout 的环境与许可约束

大功率消耗和电网互连需求意味着许可、本地社区参与以及可再生能源采购决策将影响时间表。得克萨斯州揭幕包含本地背景,凸显社区和公用事业在进度和接受度中发挥的核心作用。

大胆要点: 预期由电网升级、长周期硬件采购和合作伙伴定价选择驱动的分阶段 rollout;第三方商业访问将取决于 Oracle 和 OpenAI 后续的产品化。

Stargate 与现有超大规模 AI 基础设施的比较及市场影响

How Stargate compares to existing hyperscale AI infrastructure and market impact

规模、重点和供应商关系的差异

Wired 将 Stargate 描述为巩固美国 AI 基础设施领导地位的战略举措,其专用姿态与混合工作负载超大规模运营商不同. 传统超大规模云(例如广泛的多租户运营商)通常在多供应商舰队上平衡多样化工作负载——Web 服务、数据库、企业 VM。相比之下,Stargate 的价值主张是集中的:它旨在为与前沿 AI 训练和推理相关的一组较窄工作负载提供超高密度、加速器优先的容量。

据报道的大规模 NVIDIA 硬件协议强化了这种集中:Tom’s Hardware 报道暗示与 NVIDIA 紧密对齐以供应 GPU. 这种垂直集中可带来优势——通过规模降低单位成本、针对单一加速器架构简化软件优化——但也增加了供应商依赖风险并降低了平台异构性。

市场效应与对竞争对手的压力

高密度特权计算园区网络可能重塑高端 GPU 的供应和定价动态。较小的云提供商和托管商店可能更难获得最新一代加速器,或在大量预留 GPU 小时块的价格上竞争。这可能加速向双层市场转变:一套针对巨型模型训练优化的超高密度、垂直集成设施,以及服务更多样化工作负载的更广泛云生态系统。

对企业和开发者的实际影响包括:

  • 能够访问 Stargate 支持资源的用户可获得更快的迭代周期和更大的模型实验。

  • 如果合作伙伴传递效率收益,可能降低超大规模训练运行的边际成本。

  • 需要软件可移植性策略:针对 Stargate 所用加速器类型和互连优化的模型和工具,可能需要适应才能在其他地方高效运行。

大胆要点: Stargate 的集中方法为其用户放大了容量和速度,同时将市场压力转移到缺乏类似规模或供应商承诺的竞争对手身上。

常见问题

Q1:Stargate AI 数据中心究竟是什么?

Q2:投资规模有多大,谁在付费?

Q3:NVIDIA 是否会为 Stargate 供应硬件?

Q4:其他 Stargate 站点何时上线?

Q5:其他公司能否在 Stargate 购买容量?

Q6:环境影响和可持续性承诺如何?

Stargate AI 数据中心以及基础设施和 AI 生态系统的下一步

Stargate AI data centers and what’s next for infrastructure and the AI ecosystem

整合各部分并展望未来

Stargate 的五站点、10 GW 雄心标志着美国向垂直集成、仅 AI 基础设施的决定性转变。具有强烈计算需求(OpenAI)的锚定租户、云与运营伙伴(Oracle)以及资本组织者(SoftBank)的组合,为大规模交付密集 GPU 容量创造了强大引擎。如果按报道交付,该计划将实质性改变大型模型的训练方式:更快的周转、更大的实验,以及大规模计算运行可能更低的边际成本。

在未来几年,关注三个相互关联的维度:

  • 交付与时间:电网就绪度、本地许可和硬件出货将决定容量何时可用。

  • 商业产品化:Oracle 或合作伙伴是否以及如何向更广泛的企业客户开放容量,将塑造超越合作伙伴生态系统的市场覆盖范围。

  • 可持续性与社区接受度:可再生能源采购、高效冷却技术以及透明的社区参与将影响运营可行性和公众合法性。

存在权衡。硬件和供应商关系的集中可为生态系统内部用户带来效率和速度,但也集中了供应链风险,并引发其他人市场准入的问题。技术胜利——更多 GPU 小时、更高的利用率、更紧密的软硬件优化——可能伴随经济和政治后果:少数组织掌握不成比例比例的生产级训练计算。

对于开发者、企业和政策思考者而言,Stargate 既是机遇,也是适应号召。企业应考虑的策略包括:

  • 关注 Oracle 的 Stargate 支持服务产品,这些服务可能无需内部数据中心投资即可解锁大规模训练。

  • 为模型和工具的可移植性做好准备,认识到今天针对加速器优化的栈可能需要在异构云上运行。

  • 参与关于能源、韧性和 AI 基础设施竞争的本地和全国对话,以塑造公平结果。

最终思考: Stargate 是成为 AI 创新的广泛加速器,还是少数领导者计算能力的整合,将取决于 rollout 执行、定价和访问选择,以及合作伙伴如何透明地应对环境影响和供应链韧性。对观察者和参与者而言,未来两到五年将揭示该计划是通过有效提供容量来民主化大规模 AI,还是将高端训练锁定在新型封闭基础设施之后。无论如何,Stargate 标志着 AI 硬件战略演进中的重大时刻——组织应围绕它进行规划,而不是被它意外。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page