Alibaba 与 Google 的基础设施竞赛升温,云业务瞄准 100 天建成 AI 数据中心
- Martin Chen

- 1天前
- 讀畢需時 12 分鐘
Alibaba Cloud 表示,能够在 100 天内交付一座大型 AI 数据中心,这让 Alibaba 与 Google 围绕部署速度展开的基础设施竞赛更加激烈。据报道,随着 AI 算力需求攀升,该公司计划将其全球模块化交付能力提升至原来的三倍。相比又一次模型发布,这一组合更为重要,因为建筑、电力、制冷和网络容量正日益决定谁能出售真正可用的 AI 算力。
这项 100 天目标来自一则关于 Alibaba Cloud CUBE DC 5.0 架构的报道;该预制化系统于 2024 年推出。Alibaba 表示,这种方法将更多装配工作转移至工厂,对主要子系统进行标准化,并减少施工现场的作业量。最新的性能与产能说法尚未得到广泛的独立验证。
尽管两家公司所处的地理位置不同,Google 仍提供了最清晰的对照。两者如今都将模块化基础设施描述为应对芯片、制冷需求和 AI 工作负载快速变化的方案。Alibaba 强调建设速度,而 Google 则强调可在不同硬件代际间演进的可互换系统。
这不只是 Alibaba 与 Google 在云市场份额上的故事。它也是一次检验:工厂制造的基础设施能否将建设工期转化为竞争优势。答案将取决于已完成的项目、可靠的运营、可获得的电力,以及 Alibaba 产能目标背后的具体含义。
Alibaba Cloud 将 CUBE DC 5.0 转化为交付承诺
Alibaba Cloud 正将 CUBE DC 5.0 从一项架构方案,转变为关于可重复建设速度的承诺。
该公司于 2024 年 9 月的 Apsara Conference 上推出 CUBE DC 5.0。当时,Alibaba 表示,该架构可将建设时间最多缩短一半,并预计于 2025 年在中国的一处 Alibaba Cloud 设施完成初步部署。
最新的 100-day build claim 表明,Alibaba 认为该设计已经超越了早期目标。报道称,该工期将一座大型设施的交付压缩至略多于三个月。
CUBE DC 5.0 针对电力、制冷和计算环境的部分环节采用预制模块。预制化意味着,部件会在安装前于最终站点之外完成组装和测试。这减少了必须在多变的当地条件下、于室外完成的定制作业。
Alibaba 的公开基础设施资料列出了该系统的若干要素,包括共享的风液制冷架构、产品化舱体方案、直流供电设备和自动化运维工具。其一体化 DC 不间断电源系统据称可实现接近 98% 的全链路效率。
早期技术披露也为 CUBE DC 5.0 给出了颇具雄心的上限。Alibaba 曾向 Data Center Dynamics 表示,一座完整建成的设施可支持最高 200 兆瓦的 IT 容量,并提到机架密度可达 200 千瓦。
这些上限描述的是设计范围,而不是已确认的平均部署水平。一座 200 兆瓦站点代表一个大型园区,单个项目的规模则可能小得多。这些数字表明,Alibaba 设计该系统是为了服务高密度 AI 集群,而非传统企业服务器机房。
据报道,该公司还表示,与上一代相比,建设成本可降低超过 10%。这一说法需要谨慎解读:它涉及的是设施建设,而不一定包括服务器、加速器、内存、网络设备,或设施启用后的耗电成本。
对于 AI 园区而言,这些未计入的项目可能占据总支出的主导地位。更快、更便宜的建筑并不会让稀缺芯片变得低价,但确实能够缩短昂贵硬件等待可用电力和制冷条件的时间。
据报道,将全球模块化产能提升至三倍的计划,意味着这一承诺从单一项目延伸至交付网络。然而,“产能”可能指工厂产出、签约供应能力、部署吞吐量或已建成的兆瓦规模。Alibaba 尚未公开足够细节,无法将这些含义等同看待。
这种区别构成了本文的核心张力。Alibaba 将 100 天作为一种基础设施能力来展示,但投资者和客户需要看到该工期能够在不同站点重复实现的证据。
为何 Alibaba 与 Google 的竞争如今贯穿建设环节
Alibaba 与 Google 的竞争正从模型和云软件,转向决定算力何时可用的实体系统。
AI 基础设施面临时间错配。加速器的迭代速度快于传统设施完成设计、审批、供货和调试的速度。一栋按某种散热特性规划的建筑,可能在建设完成前就要接纳密度更高的机架。
制冷清楚地说明了这一问题。传统风冷让冷空气在服务器周围流动,而液冷则通过靠近计算组件的液体带走热量。高密度 AI 加速器产生的热量足够大,许多新集群因此需要采用基于液体的设计。
配电系统也必须适应。更高的机架密度将更多电力集中到更小的楼面空间,从而改变开关设备、备用电源、线缆和散热需求。这些系统无法在服务器到位后随意追加。
Alibaba 提出的答案是标准化。其模块可以重复制造,在受控环境中测试,并在目的地组装。这一流程比起一次性的建设项目,更接近工业化生产。
Google 则通过其所谓的敏捷、可替换数据中心追求类似目标。可替换性意味着,组件可以在不重新设计整个设施的前提下被更换或重新配置。Google 认为,模块化、可互操作的基础设施能够吸收加速器、存储、网络和制冷方面的变化。
Google 自身的工作负载数据体现了这种动机。2025 年 10 月,Google 表示其 Gemini 模型每月处理近一千万亿个 token;同时还称,过去 24 个月内 AI 加速器的消耗量增长了 15 倍。
截至 2026 年 7 月,据报道,Google 的数据中心每月处理约 3.2 千万亿个 token。这些指标采用 Google 自己的统计方法,但其趋势明确:AI 服务正迫使基础设施团队为快速且不均衡的需求增长作出规划。
Alibaba 在中国境内及其国际区域同样面临相当压力。其 2026 财年年报显示,截至 2026 年 3 月 31 日,Alibaba Cloud 已在 34 个区域提供计算服务。该公司还援引 Omdia 数据称,其在中国 AI 云市场占有 35.8% 的份额。
Alibaba 已承诺持续投资 AI 和云业务。更快建成的设施能够让这笔支出更早产生效益,因为芯片可以更早服务客户。延迟建成的建筑会让已购设备闲置,或迫使部署转移至不那么合适的地点。
压力并不限于这两家服务商。Amazon Web Services、Microsoft、Meta、Oracle 以及专业 AI 运营商,都在争夺电力接入、建筑劳动力、电气设备和制冷系统。模块化建设无法消除这些限制,但可以改变它们发生的顺序。
这正是 Alibaba 与 Google 的对比即使不存在直接竞标也仍然重要的原因。两家公司都在试图将基础设施工程转化为更快的服务扩张能力。它们的选择可能影响整个更广泛市场中的供应商和企业预期。
Google 长期以来围绕其 TPU 加速器设计定制设施。Alibaba 则将云基础设施与其 Qwen 模型、Platform for AI 以及自主开发的处理器相结合。两家公司都日益掌控从芯片到客户之间的更多层级。
这种垂直整合提高了赌注。一家能够协调模型、加速器、网络和设施的服务商,可以优化整个系统;而一旦任何一个层级未能达到交付目标,它也将承担更多风险。
工厂制造的模块是 100 天目标背后的机制
只有当 Alibaba 在设备抵达施工现场前完成更多工程工作时,这一工期才具备可行性。
传统数据中心项目涉及设计、地基、结构建设、电力系统、制冷、控制和调试等环节的顺序推进。某一阶段的延误可能阻塞其后的所有环节。因站点而异的工程设计,也让经验更难迁移。
模块化项目则将其中一部分流程转变为并行生产。工作人员可以在工厂组装电力、电池、制冷或计算模块的同时准备场地,随后将完成的单元运抵现场进行连接和系统级测试。
Inspur 于 2026 年发布的一份项目说明提供了具体案例。该公司描述了宁夏一座采用 Alibaba CUBE DC 5.0 技术的 60 兆瓦 AI 设施。其中一栋建筑使用了 260 种标准化产品,由 342 个预制集装箱构成。
这些模块涵盖液冷计算、风冷计算、电池、水处理和中压供电。Inspur 表示,集装箱在现场组装前已于工厂完成集成和测试。这正是 Alibaba 交付承诺背后的运行机制。
宁夏项目也表明,模块化并不意味着一个装满服务器的普通集装箱。模块将复杂基础设施划分为标准化组件包,工程师仍须将这些组件包整合为一套可靠的电气与热管理系统。
Inspur 表示,该设施的液冷机架单个最高可支持 83 千瓦,并称其电能使用效率最低可达 1.159。电能使用效率衡量的是设施总耗能与输送至计算设备的能耗之比。
接近 1.0 的数值意味着制冷、电力转换及其他建筑系统带来的额外开销更少。不过,这一数值来自项目参与方。跨季节的独立运营数据将提供更有力的检验。
Alibaba 的共享制冷设计解决了另一个不确定性来源。它通过共同的冷源同时支持风冷和液冷设备。当不同代际的加速器带来不同的散热需求时,这种灵活性尤为重要。
直流配电可减少电网与服务器组件之间的部分转换环节。更少的转换步骤可以减少设备数量和电能损耗。该设计仍需具备适用于大型集群的冗余、保护系统和维护流程。
标准化也可改善采购流程。服务商无需重新设计每一间配电室,而是从成熟生产线订购可重复使用的模块。供应商能够预测组件需求,并通过重复作业提升装配效率。
不过,100 天这一数字很可能并未涵盖开发的全部阶段。土地获取、电网并网、许可、环境审查和交付周期较长的公用事业工程,可能需要更早开始。报道称,这一数字似乎更适用于主要前置条件具备后设施本身的交付。
这一边界在电力是主要瓶颈的地区尤为重要。预制建筑无法创造输电容量,也无法加快尚未订购的涡轮机、变压器或变电站的建设进度。
建设速度与服务就绪速度也并不相同。运营商必须启用电力通路、验证冷却系统、测试故障切换流程、部署网络、保障场地安全,并集成云软件。客户关心的是可用实例何时上线,而不只是建筑结构何时完工。
因此,最有力的解读范围虽窄,却很重要。CUBE DC 5.0 可通过并行制造和标准化装配,压缩数据中心建设中可控部分的周期;但它无法将所有外部依赖同步压缩进同一时间表。
Alibaba Google 的说法仍未证明什么
尚未解答的问题是,模块化速度能否经受住当地监管、供应约束以及多年高密度运行的考验。
Alibaba 有证据表明,CUBE DC 5.0 并非只存在于演示文稿中。宁夏部署项目提供了具名项目、技术规格和可见的预制化设计。但这并不能独立证明,类似站点都能稳定地在 100 天内投入服务。
该公司尚未公布所称工期的详细计时方式。读者目前无法得知倒计时从何时开始、何时结束。不同定义可能让同一个项目被描述为 100 天建设,或是历时多年的开发。
其全球模块化产能的说法也缺乏明确基数。将一个小型生产基地的产能扩大三倍,与将一个成熟的跨区域业务扩大三倍,意义不同。工厂已排产的产能,也不同于已启用并可供云客户使用的 IT 负载。
可靠性同样值得关注。工厂测试能够提升一致性,因为模块从受控生产线下线时,未知因素更少。不过,模块之间的连接会形成接口,这些接口必须在高负载和不断变化的负载下保持可靠。
当设施混用不同冷却方式和不同代际的机架时,维护工作可能变得更复杂。运营商需要备件、受过培训的技术人员,以及清晰的隔离流程。建设阶段的速度不应在日后造成运营僵化。
地理因素带来了另一项挑战。不同市场的电气标准、消防规范、天气条件、地震风险、水资源可用性和许可规则各不相同。为一个司法辖区设计的模块,可能需要在其他地区进行调整。
这对 Alibaba Google 的比较尤其相关。Google 的基础设施扩张覆盖众多受监管市场和公用事业系统。与其在国内的工程工作相比,Alibaba 将其 100 天流程复制到国际市场的能力,目前记录较少。
Google 的战略也存在自身的验证缺口。其可互换架构是一种设计方向,并不能证明每个设施组件都能实现互换。硬件供应商、专有接口和旧建筑都可能限制这种灵活性。
两家公司还都面临模块化无法单独解决的电力约束。Google 已与公用事业公司协商灵活负载安排,使部分数据中心需求能够在电网承压时转移。它还为未来增长推进了新的能源项目。
Alibaba 所处的市场中,大型计算负载可以部署得更靠近中国西部的能源资源。宁夏项目反映了这一思路。将计算能力向内陆转移可改善电力获取条件,但也会带来网络和工作负载部署方面的考量。
芯片供应构成另一项不确定性。Alibaba 的年报称,其 T-Head 子公司已将一款自研 GPU 实现规模化量产。公开证据对其产量、性能和客户可获得性仍披露有限。
如果加速器、内存或光网络设备迟到,即使设施快速完工也价值有限。反过来也一样:如果合适的供电空间尚未完工,可用芯片也不会产生云收入。
因此,所称 10% 的建设节省不应被视为 AI 计算总成本降低 10%。服务器和网络设备并不属于这一狭义说法的范围。电力和维护成本则会贯穿设施的整个运营生命周期。
过度建设也存在风险。云服务提供商针对的需求可能随模型效率、推理定价和客户采用情况而变化。更快的模块化部署降低了时机风险,但也可能使企业在需求得到验证之前更容易扩张产能。
模块化提供了一种部分防护,因为服务商可以分阶段建设。较小的增量让运营商能够随着合同和工作负载增长逐渐明朗而增加基础设施。如果企业过早订购整个生产管线,这一优势就会消失。
对于企业买家而言,正确的回应既不是全盘否定,也不是照单全收。Alibaba 已展示出可信的机制和至少一个规模可观的部署项目。其最大胆的工期和全球产能说法,仍需要具有可比性、且经独立记录的项目来验证。
三个信号将决定这一优势是否真实存在
已完成产能、国际市场的重复落地和运营表现,将决定 Alibaba 是否建立了基础设施优势。
第一个信号,是一个在 100 天工期内交付、且有完整记录的 CUBE DC 5.0 项目。Alibaba 应明确起始条件、完工里程碑、IT 负载、调试周期,以及客户工作负载开始运行的日期。
公开的时间线将澄清启用准备工作是否在计时开始前就已完成,也能让客户在同等条件下将 Alibaba 的说法与传统项目进行比较。缺少这些细节,100 天仍只是一个吸引人却具有弹性的标题数字。
若获得确认,将强化 Alibaba 关于模块化建设改变计算资源可用性的论点。若调试周期明显更长,则会削弱这一说法,尤其是在建筑已经完工、但系统仍不可用的情况下。
第二个信号,是在 Alibaba 最熟悉的国内环境之外进行部署。东南亚、欧洲或其他国际市场的项目,将检验其监管适应能力、供应商协调能力和当地施工实践。
Alibaba 的全球云服务版图提供了适合检验国际复制能力的地点。然而,云区域可能使用租赁设施、公司自建园区,或两者结合。模块化交付能力并不自动意味着在各地都进行完全自有的建设。
成功的国际部署将支持其计划将全球模块化产能提升至三倍的说法。这将表明其制造流程可以跨越不同建筑规范和供应网络。仅有国内增长,仍会让“全球”这一部分缺乏确定性。
第三个信号,是来自宁夏项目及后续设施的持续运营数据。买家应关注可用性、季节性能耗使用效率、机架密度利用率、冷却切换情况和维护表现。
该项目的预制模块提供了有用的技术基线。其 60 兆瓦负载规模足以暴露小型示范项目可能隐藏的集成问题。若持续表现接近所提及的效率水平,将强化 Alibaba 的工程论据。
运营问题不会否定模块化建设作为一个类别的价值,但会表明复杂性从施工现场转移到了制造、集成或维护环节。长期数据必须揭示的,正是这种权衡。
Google 的回应将提供更多背景。其模块化战略强调跨组件和跨代际的互操作性。若 Google 公布可重复的部署改进,行业可能会在不同专有系统之下,趋向共同的原则。
即便企业客户从不直接在这两家服务商之间做选择,这场竞争仍可能令其受益。更快的建设能够扩大区域计算供给、缩短等待时间,并支持更多加速器配置。谨慎实施的标准化也能提升可靠性。
开发者应当关注,因为物理产能会影响 API 可用性和推理成本。产品团队应当关注,因为区域产能会影响延迟、数据驻留和发布进度。基础设施买家应当关注,因为供应商的说法如今已从软件延伸至建设执行能力。
因此,Alibaba Google 的竞争正成为一场工业系统竞赛。模型依然引人注目,但为数千颗加速器供电并进行冷却的能力,决定了这些模型能够在多大范围内运行。
Alibaba 提出了一套具体机制:制造可重复的模块,在交付前对其进行测试,并与现场施工并行完成装配。它还为这一机制附加了令人印象深刻的数字,包括 100 天和计划中的三倍产能提升。
如今,举证责任已从架构转向可重复性。请关注具名站点、可比时间线、已启用兆瓦数和跨多个季节的运营结果。这些信号将表明,Alibaba 的速度究竟是持久的云服务优势,还是一个经过狭义表述的建设里程碑。


