top of page

Crux AI 招揽 Alan Duong,使 Google 的 TPU 云雄心面临交付时限考验

29分钟前
讀畢需時 14 分鐘

Crux AI 从 Meta 招揽了 Alan Duong,同时面临一项严格期限:在 2027 年期间将 50 亿美元承诺转化为 500 兆瓦 TPU 容量。

这项任命为 Google 和 Blackstone 的合资企业带来了一位曾协助重新设计 Meta 人工智能数据中心的高管。然而,Crux AI 招揽 Alan Duong 的消息传出之际,潜在数据中心选址也被曝出现延误。该公司如今拥有知名领导团队和雄厚支持,但其实体基础设施仍是决定性考验。

这种紧张关系的重要性超出单一高管任命。Crux AI 代表着一种尝试:围绕 Google 的 Tensor Processing Units(即 TPU),而非 Nvidia 占主导地位的图形处理器,建设一家 neocloud。CoreWeave 和其他专业服务商已凭借 Nvidia 硬件确立了 neocloud 模式。Crux AI 必须证明,这一模式同样适用于 Google 的芯片、软件、融资和运营要求。

Crux AI 招揽 Alan Duong 带来了什么改变

Crux AI 招募了一位运营专家,其近期工作经历与公司当前面临的建设挑战高度契合。

任命详情显示,Duong 在 Meta 工作超过 12 年后,加入 Crux AI 担任首席开发官。他最近的职务是数据中心工程与建设副总裁兼负责人。

他所述职责涵盖未来几年数千兆瓦数据中心容量的端到端交付。这一范围不仅包括选址或管理承包商,还涉及电力采购、社区关系、设施设计、建设以及运营移交。

这种区别十分重要,因为 AI 基础设施项目很少因单一孤立原因而失败。开发商可以获得土地,却要等待数年才能完成电网并网;可以获得电力,却遭遇设备短缺、许可争议或建设延误。一座完工建筑若冷却、网络或电气系统无法支持高密度加速器集群,仍可能无法满足客户需求。

Duong 将这一问题描述为一条每个环节都必须稳固的链条。他的评论强调要拥有真正可用电力的选址、高效利用资源、安全施工,以及为数十年运营而设计的设施。这一视角契合 Crux AI 协调资本、芯片、软件、建设和长期运营的需要。

Meta 让 Duong 获得了应对类似艰难转型的经验。2023 年,该公司展示了一种面向 AI 工作负载的新数据中心设计。Meta 表示,这一架构将支持下一代系统,同时提升部署速度和灵活性。

这次重新设计此前经历了一次重要暂停。Meta 曾暂停多个项目,重新评估在生成式 AI 改变其计算需求之前规划的设施。其AI 基础设施计划结合了定制芯片、面向 AI 的数据中心设计,以及一台配备 16,000 块 GPU 的研究超级计算机。

因此,Duong 的团队并非只是扩展既有模板,而是在需求、硬件配置和技术假设不断变化时协助修订项目。Crux AI 目前正处于不同阶段,但面临相关问题。

该合资企业需要围绕 TPU 设计设施,同时争夺所有大型 AI 平台都在使用的建设资源。它还需要说服客户,容量将按期交付。与传统云软件高管任命相比,招揽 Duong 更直接回应了这些执行需求。

不过,经验丰富的高管无法缩短所有公用事业排队时间,也无法消除每一项地方反对意见。他的任命增强了 Crux AI 管理内部依赖关系的能力,但并未消除制约大型数据中心何时何地能够运营的外部限制。

这使得这项任命意义重大,但并非决定性因素。Crux AI 增添了适合这一任务的领导力量。接下来的问题是,其运营模式能否将这些经验转化为已通电的可用容量。

Google 和 Blackstone 为何打造 TPU neocloud

该合资企业将数据中心所有权与 Google 的芯片平台分离,为客户获取 TPU 开辟了新途径。

Google 和 Blackstone 于 2026 年 5 月宣布成立合资企业。Blackstone 作出初始 50 亿美元股权承诺,而 Google 同意提供 TPU、软件和服务。

合作伙伴预计该公司将在 2027 年上线 500 兆瓦容量。Google 在其合资企业公告中表示,这一安排旨在让客户在使用云 TPU 时拥有更多选择和灵活性。

随后,Crux AI 成为该合资企业的公开名称。公司由前 Google 工程副总裁兼首席项目官 Benjamin Treynor Sloss 领导,也招募了其他高级运营人士,其中包括前 Charter Communications 财务主管。

neocloud 是一种主要为 AI 工作负载出租计算容量的专业服务商。与广泛覆盖的超大规模云不同,它专注于加速器、集群和配套基础设施。这种更集中的定位,可以更容易围绕特定处理器平台开发容量。

多数知名 neocloud 都围绕 Nvidia GPU 发展。它们受益于开发者对 Nvidia CUDA 软件环境的广泛熟悉,以及对稀缺加速器的强劲需求。CoreWeave 等公司将获取这些芯片的能力转化为用于模型训练和推理的云产品。

Crux AI 将这一模式应用于 Google 的定制处理器。TPU 是为机器学习打造的专用加速器。Google 已在其内部服务和 Google Cloud 中使用了多代 TPU。

这一架构使 Google 无需完全通过自身资产负债表为每栋建筑提供资金,便可扩大 TPU 的分发范围。Blackstone 贡献资本和基础设施经验。Crux AI 则成为开发设施并服务工作负载的运营层。

对 Blackstone 而言,这一安排使其能够参与 AI 计算基础设施需求增长带来的机遇。这家投资公司在数据中心、能源、房地产和私募信贷领域已拥有丰富经验。当项目需要在产生收入前投入巨额资本时,这些能力尤为重要。

对 Google 而言,战略目标不止于出租更多服务器。更广泛的 TPU 可用性可以降低市场对单一加速器供应商的依赖,也能吸引希望通过常规 Google Cloud 采购路径之外获取专用容量的客户。

该合资企业计划采用多种开发模式。据报道,其计划包括已通电的空壳设施、定制建设设施、托管机房区块、交钥匙合作伙伴安排,以及自建绿地开发。

已通电的空壳设施提供建筑和电力接入,由另一方安装计算系统。定制建设项目则面向特定客户设计。托管服务将客户设备置于共享设施内。

采用多种形式可帮助 Crux AI 匹配不同的时间表和风险水平。现有托管空间的启用速度可能快于新园区。绿地开发让公司拥有更多控制权,但也面临更大的许可和建设风险。

这种设计在投资组合层面创造了灵活性,但并未改变每次部署都需要适宜电力、冷却、网络和设备这一基本要求。Crux AI 必须以足以支持 TPU 集群和客户服务承诺的规模整合这些组成部分。

这正是该合资企业战略遭遇首次反转之处。Google 和 Blackstone 创建实体,是为了扩大对稀缺 AI 基础设施的获取渠道;Crux AI 现在必须争夺限制市场其他参与者的同样稀缺投入要素。

真正的竞争是 TPU 交付能力与 Nvidia 的 neocloud 网络之争

Crux AI 并非只是另一家云服务商;它检验的是 Google 能否围绕 TPU 复制 neocloud 模式。

Nvidia 的优势不仅在于处理器性能。开发者熟悉其编程环境,云服务商支持其系统,专业运营商也已出租其硬件。这一网络降低了客户在服务商之间迁移工作负载时的摩擦。

Google 拥有成熟的 AI 加速器架构,但扩大 TPU 采用范围并不只是制造芯片。客户需要可用集群、兼容软件、可预测的支持,以及对未来容量能够如期交付的信心。

Crux AI 解决了这一方程中的基础设施部分。其数据中心可以为 TPU 消费建立专用渠道。Google 的软件和服务可让这些系统易于使用,而无需 Crux AI 独立开发完整的机器学习平台。

Blackstone 的资本也回应了 neocloud 面临的一项结构性挑战。这些服务商在客户收入开始前需要大量投入;它们必须购买设备、确保设施和预留电力,同时应对漫长的建设周期。

即使成熟的 neocloud 也面临债务、利用率和客户集中度等问题。该行业可以实现快速收入增长,同时消耗大量现金。由基础设施投资者支持的新进入者拥有不同的融资支持,但仍需要客户和严谨执行。

因此,与 CoreWeave 的比较很有参考价值,但并不完整。CoreWeave 凭借获取 Nvidia GPU 的能力以及围绕高要求 AI 客户打造的软件栈站稳脚跟。Crux AI 则以 Google 技术、Blackstone 资本和已宣布的大规模容量目标起步。

这些要素构成了可信的竞争者,但并不等同于一项已经完成的服务。Crux AI 必须证明,客户愿意将重要工作负载交给以 TPU 为核心的服务商。它还必须证明,其设施与 Google 服务的组合能够在 Google 传统云架构之外可靠运行。

竞争压力最直接地落在 Nvidia 的专业云服务渠道上。如果 Crux AI 成功,AI 开发者将获得另一条获取大型加速器集群的途径。neocloud 运营商也可能面临更强动力,以支持 Nvidia 产品组合以外的处理器。

这种结果将扩大硬件选择,但软件仍是主要限制因素。围绕 Nvidia 库开发的应用程序,未必能在不进行工程改造的情况下迁移至 TPU。困难程度取决于模型架构、框架和工作负载。

Google 可以通过编译器、框架、托管服务和迁移支持减轻这一负担。Crux AI 可以改善访问和运营。任何一方都不能假定,仅凭实体可用性就能说服客户更换平台。

该合资企业最初可能最吸引已经使用 Google AI 软件或兼容 TPU 框架的组织。它也可能吸引寻求大规模专用部署和第二加速器容量来源的买家。

推理工作负载提供了另一项机会。推理是指运行已训练模型以生成预测或响应的过程。这类任务能够回报效率和可预测的规模扩展能力,尤其是在应用服务大量用户时。

训练客户往往更看重灵活性,因为模型设计变化迅速。他们可能更倾向于选择软件兼容性最广的硬件。Crux AI需要明确的工作负载战略,而非将所有AI计算视作可互换的资源。

这使得主要竞争格局变得清晰。Nvidia的neocloud网络拥有成熟的硬件需求、熟悉的软件环境和运营经验。Crux AI则提供由Google和Blackstone支持、垂直协同的TPU替代方案。

Alan Duong无法决定软件层面的竞争。他的职责位于这一方程的物理基础设施侧。但物理交付能力决定了Google是否有机会争夺这些工作负载。

场址延误令2027年容量目标承压

Crux AI的领导层任命并不能消除有关潜在设施已遭遇开发挫折的报道。

Bloomberg在9月报道称,这家合资企业在计划运行Google处理器的主要数据中心地点面临延误。该报道以其此前的内部名称Project Braid指代这一业务。

其中一个问题涉及怀俄明州夏延市的一项拟议开发项目。据报道,Google放弃了在该地点与数据中心开发商Crusoe合作的计划。更广泛的夏延项目此前与一个规划容量为1.8吉瓦的园区有关。

这对Crux AI 500兆瓦目标的具体影响仍不清楚。该公司尚未公开完整的场址清单、建设时间表、客户名单或修订后的交付计划。这限制了外界对其进展的评估。

根据这份场址延误报道,这些障碍说明了雄心勃勃的AI基础设施计划所面临的现实限制。资本和芯片供应并不保证数据中心能够建成。

大型项目需要争取可能耗时数年的公用事业承诺。开发商需要变压器、开关设备、发电机、冷却系统和专业施工劳动力。多个项目往往会在同一市场争夺这些资源。

地方反对意见可能增加另一层不确定性。社区正日益审视用电量、用水量、税收安排、噪声、施工交通和长期就业情况。即使开发商已确定土地和输电接入条件,已宣布的园区仍可能面临政治阻力。

Crux AI的开发模式能够分散这种风险。在推进更大型的绿地项目时,它可以使用托管容量或合作伙伴设施。较小规模的容量区块也可能在整个园区建成前率先上线。

不过,组合灵活性也可能带来运营复杂性。不同场址可能采用不同的电气设计、冷却系统、承包商和所有权结构。Crux AI仍必须在这些环境中提供一致的计算服务。

2027年目标也需要谨慎解读。实现500兆瓦上线,可能指已通电的设施容量、已安装的计算设备,或已可供付费客户工作负载使用的容量。这些里程碑并不总是同时达成。

Crux AI及其合作伙伴已公开说明预期容量数字。但它们尚未公布足够细节,以判断哪些项目支撑这一目标,或存在多少应急余量。因此,读者应将这一数字视为目标,而非已建成的基础设施。

Duong的经验之所以相关,恰恰是因为这些依赖关系彼此交织。在Meta期间,他参与了设施重新设计,而该公司的计算需求也在变化。Crux AI需要类似的协调能力,但它缺少Meta长期的运营历史和内部需求基础。

Meta可以依托自身产品产生的工作负载来证明设计变更的合理性。Crux AI最终必须将容量出售给外部客户。因此,延误可能同时影响建设成本和商业信誉。

选择用于大型模型部署的基础设施时,客户需要的不只是一则公告。他们需要交付日期、服务条款、软件支持,以及容量将持续可用的信心。错过进度可能令这些工作负载流向其他提供商。

这家合资企业公开的雄心与建立运营体系所需时间之间,也可能存在错配。Crux AI正在招聘建设、能源、运营、供应谈判和资本市场相关岗位。在开发场址的同时组建这些团队,会提高组织层面的要求。

这并不意味着该目标无法实现。Blackstone可以为多种路径提供融资,Google能够提供大量技术支持。Duong则带来了管理复杂建设项目的直接经验。

不确定性在于目前可获得的证据。公司已宣布名称、领导层、融资和容量雄心,但尚未证明其具备承诺规模的TPU运营容量。

Alan Duong带来了有价值的Meta方法论,而非捷径

Duong在Meta的履历显示了如何管理基础设施转型,但Crux AI面对的客户、芯片和财务激励仍然不同。

Meta在2023年的重新设计,为此次任命提供了最清晰的历史参照。该公司已认识到,为传统服务规划的设施未必适合快速扩张的AI系统。

AI集群对数据中心网络和电力系统提出了特殊要求。训练模型时,数千个加速器需要交换大量数据。中断或瓶颈可能导致昂贵设备未得到充分利用。

高密度系统还会产生集中的热量。设施设计人员必须协调芯片路线图、冷却方式、机架布局、配电和维护计划。围绕昨日硬件设计的建筑,可能在其预期运营寿命结束前便失去效率。

Meta的下一代设计旨在提升灵活性,同时支持AI系统。Duong当时表示,公司需要能够适应仍在演进技术的设施。这对Crux AI而言,比任何单一蓝图都更具参考价值。

随着Google推出新一代处理器,TPU云将持续变化。功率密度、冷却、互连和软件要求都可能改变。Crux AI需要可重复的设计,但不能将每个未来场址锁定在2026年作出的假设之上。

Duong的端到端方法有助于实现这种平衡。场址选择不仅要考虑当前可用电力,也要考虑扩展空间。采购必须在建设进度固定前,纳入交付周期长的设备需求。

社区沟通的重要性也比许多科技公司预期得更早。开发商不能将所在地视作一次性交易。地方关系可能决定扩建能否推进,或是否会变得政治上困难。

Meta的经验显示,当既有设计不再适用时,暂停具有价值。但这并不意味着每次暂停都能毫无代价地恢复。重新设计可能延迟项目、增加合同复杂度,并使早期规划工作搁置。

Crux AI必须决定在哪些方面标准化有利,在哪些方面灵活性更重要。统一设计可以加快采购和运营。因地制宜的方式则能更好适应区域电网、水资源限制、气候和建筑市场。

公司还需要在自身责任与Google的责任之间建立明确边界。Google提供TPU、软件和服务,Crux AI则开发和运营基础设施。客户仍会期待问题得到解决,而不会因两家机构之间的职责划分而产生混乱。

当接口足够明确时,这种分工可以发挥作用。硬件交付日期必须与建筑就绪时间一致。客户迁移生产工作负载前,必须完成软件验证。维护计划必须覆盖设施系统和计算设备。

Blackstone带来了另一套激励机制。基础设施投资者通常寻求可预测、长期的回报。AI计算市场的变化速度可能快于传统基础设施合同。在设施的运营寿命内,处理器世代和客户偏好都可能转变。

因此,Crux AI需要建设即使需求变化仍具实用价值的建筑。其据称由带电空壳设施、托管、合作伙伴关系和自建开发构成的组合,可以分散这一风险。这一方法同样需要谨慎的资本配置。

Duong的任命表明,公司理解这项挑战既是组织挑战,也是技术挑战。吉瓦级计划不能依赖小团队以非正式方式协调供应商。它需要采购、建设、安全、能源和运营职能共享进度与标准。

不过,聘请经验丰富的领导者是投入,而非结果。市场将通过已完成项目、已交付集群、可靠性和客户采用情况来评判Crux AI。高管履历不能替代这些衡量标准。

三个信号将显示Crux AI能否交付

下一阶段应依次通过场址就绪度、客户承诺和可用TPU容量来判断。

第一个信号是详细的建设和通电计划。Crux AI不必披露每一项商业条款,但需要有可识别的项目,以及许可进展、公用事业安排、建设里程碑和预计运营日期。

获得确认的电力比庞大的开发储备更重要。一个场址在纸面上可能令人印象深刻,却可能要等待多年才能完成输电升级或设备到位。近期通电的证据将增强外界对2027年目标的信心。

第二个信号是客户需求。Google和Blackstone将这项云服务描述为让客户以另一种方式获取TPU的途径。具名客户、长期容量协议或披露的工作负载类别,将显示买家是否接受这一主张。

需求质量与规模同样重要。少数大型合同有助于为建设提供融资,但客户集中会带来风险。更广泛的训练和推理客户群将表明这是一个更具持久性的平台。

第三个信号是运营容量。投资者和客户应区分已宣布的兆瓦数,与已经通电、配备设备、完成验证并正在服务工作负载的建筑。这些阶段会提供逐步增强的证据。

运营表现将揭示这家合资企业是否能作为云服务运作,而非仅仅是一组房地产项目。客户将关注集群可用性、网络、支持、部署速度和软件兼容性。

这些信号应按顺序出现,但开发工作将彼此重叠。没有客户证据的场址公告会令需求保持不确定;没有已通电设施的客户协议则无法解决交付风险。

竞争不会等待Crux AI完成这一过程。以Nvidia为中心的neocloud持续扩张,超大规模云服务商也在投资自有加速器和AI服务。更广泛的基础设施竞争同样引发了关于集中度、融资和可及性的疑问。

Crux AI最有力的论点是协同。Google提供处理器平台和技术服务。Blackstone提供雄厚资本和基础设施经验。Duong则带来了Meta AI数据中心转型的实践知识。

其最大的风险同样在于协同:芯片、电力、建设、软件、融资以及客户排期必须同步推进。任何一个环节延误,都可能削弱其他领域进展的价值。

因此,Crux AI 聘请 Alan Duong 值得关注,但不应被视为项目执行力的证明。这让一位可信的基础设施负责人接手该公司最艰巨的任务,也让交付标准变得更明确。

未来一年,应关注具名且已确认电力供应的站点、承诺部署实际工作负载的客户,以及投入运营的 TPU 集群。这些事实将决定 Crux AI 是成为有意义的替代选择,还是仍停留在雄心勃勃的基础设施规划阶段。

对于开发者和企业采购方而言,实际问题并非又一家 neocloud 是否已经推出,而是 Crux AI 能否在项目需要时提供可靠的 TPU 容量。应追踪其设施、合同和运营里程碑,而非公告的规模。如果这三项信号能够同步推进,Google 就将打造出一条超越其传统云业务的更强路径;如果它们出现背离,报道中的延误将比高管阵容更重要。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page