跨域网络直面 AI 数据中心成本高墙
Google News 在 8 月 11 日揭示了一项关键矛盾:AI 集群需要更多空间和电力,但连接多个站点可能抵消其经济收益。
这一讨论源自 Data Center Dynamics 及其关于数据中心互连(DCI)的行业论坛;DCI 负责在设施之间传输流量。Google、Meta、Nokia、Lumen Technologies 和 Zayo 参加了 2026 年 3 月的会议。他们共同面对的问题,比又一次提升标称带宽更具影响力。
AI 开发者越来越希望让多栋建筑像一个计算系统那样运行。这种称为跨域网络(scale-across networking)的方法,可以突破单一设施的物理限制。但它也会让宝贵的加速器暴露于光纤故障、拥塞、距离和同步延迟的风险之中。
因此,核心竞争在于成本与性能之间的平衡。运营商可以将计算容量部署在电力供应充足的地点,并分布到多个站点。随后,他们必须建设足够快速且可靠的光网络,才能让昂贵的处理器持续高效运转。
Google 和 Meta 已开始描述跨越建筑边界的架构。设备供应商则在推广更高速的相干光学技术,这类技术将数据编码到光信号上,以实现更远距离的传输。但这并不保证分布式训练在生产规模下仍具经济性。
Google News 聚焦正在走向生产环境的网络架构
跨域网络正从行业构想转变为最大规模 AI 集群的设计要求。
OFC 论坛议程将 DCI 描述为增长最快的网络细分领域,年增长率超过 50%。该议程还将跨域网络视为一种独立的后端应用场景,而非普通的站点间流量。
传统 DCI 在设施之间传输应用、存储、复制和客户流量。这些流量可能需要很高的容量,但通常比同步 AI 训练更能容忍波动。
后端 AI 网络在加速器执行同一训练或推理任务时将它们连接起来。每个处理器会反复交换模型参数、中间结果和同步消息。即使本地计算资源仍然可用,延迟的流量也会让处理器处于等待状态。
跨域网络将这一后端网络扩展到一栋建筑之外。参与的设施组成更大的计算域,尽管它们之间仍由光纤和地理距离隔开。
这一差异很重要,因为运营商不再只是为了弹性或数据迁移而连接独立数据中心。他们正试图将跨站点的加速器协调为一台机器的组成部分。
Nokia 对该论坛的说明将 AI 连接划分为三个维度。纵向扩展(scale-up)连接机架内的处理器,横向扩展(scale-out)连接设施内的机架,而跨域扩展(scale-across)则连接一个设施之外的集群。
这些类别对应不同的工程要求。短距离铜缆连接仍普遍用于机架内部,而较长路径则以光链路为主。跨域扩展为 AI 网络增加了相干传输、线路系统、光纤路由和运营控制。
Google 工程师 Kevin Croussore 与来自 Meta、Zayo、Lumen Technologies 和 Nokia 的代表共同参加了论坛。他们的参与表明,这一问题横跨云运营商、网络运营商和设备供应商。
时机同样重要。2026 年 4 月,Google 为 AI Hypercomputer 推出了新的横向扩展网络 Virgo Network。Google 表示,训练需求如今已超过单个数据中心可提供的电力和空间。
Virgo 架构采用扁平化双层拓扑和独立控制域。Google 的设计目标是在减少网络层级的同时,提供可预测的延迟和故障隔离能力。
Virgo 并不会让每一个远程数据中心都等同于本地机架。但它表明,Google 现在将一个园区视为统一的计算环境,而非一组彼此隔离的建筑。
这种架构变化形成了本文的核心张力。将一个集群拆分至多个设施可以释放电力和机房空间,但也会引入一种网络,其成本和行为会直接影响有效计算产出。
运营商不能再仅以原始容量评估 DCI。他们必须衡量网络保留了多少加速器工作时间、恢复速度如何,以及每传输一比特消耗多少电力。
电力稀缺正迫使 AI 集群跨越多栋建筑部署
压力源于高度集中的计算需求,与具备电力条件的数据中心容量扩张较慢之间的不匹配。
大型 AI 系统集中部署数千个加速器、内存设备、交换机、冷却组件和电力转换系统。增加处理器也会提高为其供电、散热和连接所需的配套基础设施规模。
单栋建筑最终会受到公用事业供电、变电站、冷却系统、建设进度和当地审批的限制。运营商可以设计更高密度的机架,但密度并不能创造额外的电网容量。
与其长距离输送电力,传输数据往往更为可行。因此,光纤成为将分别供电的设施整合为更大资源池的工具。
Google 在 2026 年 5 月直接阐述了这一原则。该公司表示,会将数据中心部署在能源资源附近,再通过网络将 AI 工作负载分配到各园区。
其全球基础设施体现了这项投资的规模。Google 表示,其广域网带宽在 2020 年至 2025 年间增长了七倍。该网络承载消费者服务、云流量、训练数据和 AI 计算资源。
Meta 在不同规模上面临同样的物理限制。其 Prometheus 集群设计为跨至少五栋数据中心建筑提供 1 吉瓦容量。
根据 Meta 对基础设施的说明,Prometheus 还纳入了相邻的托管空间和临时防风雨结构。这种安排使网络成为集群基础建设方案的一部分。
Meta 更大型的 Hyperion 项目预计将在 2028 年开始陆续上线。该公司称,建成后的集群将支持最高 5 吉瓦容量。
这些数字说明了为何跨域网络如今正受到关注。如此规模的设施无法依赖一个传统数据大厅或一个本地交换网络。
Meta 的后端聚合系统 BAG 可连接跨设施的多个 AI 网络。BAG 是一个集中式以太网超级脊骨层,这意味着它连接各个独立网络架构的上层。
该公司表示,后端聚合将帮助互连 Prometheus 使用的数万个 GPU。它还必须桥接 Meta 两种不同的网络架构设计。
这种方法带来的压力并不只落在超大规模云厂商身上。云服务商需要足够的站点间容量,才能提供大型加速器资源池。网络运营商则需要具备可预测延迟、物理路径多样性和更快部署速度的线路。
光学设备供应商必须提升容量,同时避免功耗、模块成本或故障率以同样速度增长。数据中心开发商也必须在建筑启用前规划好光纤路径。
企业买家面临间接影响。其 AI 服务成本部分取决于供应商使用加速器的效率。网络利用率不佳的分布式集群可能浪费昂贵的计算容量。
这种被迫作出的应对是长期性的。运营商需要在大型集群投用前数年,协调站点选址、能源采购、光纤路由、计算架构和工作负载软件。
跨域网络为他们提供了另一种设计选择,但并未消除稀缺性。它将集中的电力约束,转换为分布式系统问题。
具备成本效益的跨域网络取决于有效 GPU 工作时间
最便宜的网络组件,并不一定能带来最低的训练成本。
AI 训练通过反复进行计算和通信来推进。加速器在本地计算结果、交换信息,并在继续之前等待其他参与者。
这种行为使尾延迟格外重要。尾延迟衡量的是一组请求中最慢的响应,而不是全部流量的平均响应时间。
一条延迟链路、拥塞路径或性能吃紧的节点,都可能拖慢规模大得多的任务。成本体现为加速器闲置时间,而非简单的网络费用。
这正是为什么原始带宽无法完整衡量跨域网络经济性。高容量链路仍可能带来不稳定的完成时间、薄弱的故障恢复能力或过高的功耗。
Google 围绕确定性延迟、高二分带宽和硬件故障隔离设计 Virgo。二分带宽衡量网络两半之间能够同时通过多少流量。
这些特性旨在让分布式任务以可预测的方式持续运行,也说明了 AI 网络与尽力而为型应用流量的不同。
Meta 正通过网络和软件改进来应对这一问题。其 Prometheus 工作包括 Twine 和 MAST,这些系统旨在支持跨地理分布式数据中心的训练。
调度变得至关重要,因为并非每个工作负载都应跨越每一种距离。运营商可以将需要紧密同步的任务部署在同一局部区域,同时将敏感度较低的阶段分布到更广泛的区域。
相干光学技术使更长距离的高容量连接成为可能。该技术利用复杂的调制和信号处理,在超出普通数据中心距离的光纤链路上保持数据传输。
现代相干模块可以采用面向交换机的可插拔形态。这减少了某些应用对独立传输设备机框的依赖,并可简化部署。
不过,模块采购成本只是网络经济性的一部分。运营商还必须考虑光纤可用性、线路系统、放大设备、监控、更换人工、安全性和冗余容量。
网络本身也会消耗原本可用于计算的电力。一种提升带宽、却需要更多光学和交换设备的设计,可能加剧站点最初的电力约束。
Ciena 在其 DCI 产品组合中推广 400G、800G 和 1.6T 系统。Marvell 同样介绍了面向新兴跨域部署的 1.6T 相干模块。
这些路线图表明容量将显著增长,但并未证明每一种 AI 工作负载都能在多个设施之间高效利用这些容量。
软件必须协调部署、路由、拥塞控制、检查点保存和恢复。运营商还需要跨计算层和传输层的可视性,而这些层此前通常作为独立系统管理。
一次光路故障不应迫使大型训练任务从头开始。网络和工作负载调度器需要协同的恢复策略,以限制已完成工作的损失。
这一要求改变了买方比较设计方案的方式。每传输比特的成本仍然有参考价值,但每完成一个训练步骤的成本更接近业务成果。
作业完成时间、加速器利用率、光学功耗和恢复时长应纳入同一分析。将它们视为彼此独立的采购指标,可能掩盖真实成本。
只有当网络能够保留足够的有效处理器时间,以抵消新增基础设施时,跨域扩展才具备成本效益。更快的光学技术有助于实现这一目标,但最终结果取决于架构与运营。
开放式以太网面临专有性能压力
跨域扩展网络加剧了可互操作以太网系统与高度受控的加速器互连架构之间的竞争。
以太网拥有庞大的装机基础、广泛的供应商市场和成熟的运营工具。这些优势可降低供应商集中度,并让运营商拥有更多组件选择。
Meta 的 BAG 设计使用以太网汇聚不同的后端互连架构。这一决策显示,超大规模云服务商如何在底层开发专用系统的同时,保留通用互连层。
Google 同样在芯片、系统、网络架构、软件和云服务之间进行垂直整合。垂直控制让公司能够针对自身工作负载调优多个层面,即使单个接口采用既有标准也是如此。
Nvidia 则通过 NVLink、InfiniBand、Spectrum-X Ethernet 和机架级系统提供了另一种参照。其产品组合在协调一致的架构下连接了加速器、交换机、接口硬件和软件。
更紧密的集成可以提升性能可预测性,并降低部署不确定性。但它也可能限制组件替换,并将路线图决策集中于单一供应商。
开放系统承诺灵活性,但互操作性并不保证分布式训练的效率。不同供应商的设备可以支持相同的标称链路速率,却可能在拥塞或故障时表现不同。
因此,运营商面临艰难的采购决策。更深度整合的架构可减少工程投入,而开放设计可提升采购灵活性和长期议价能力。
这场讨论也延伸至光学接口。可插拔模块支持替换和供应商选择,而共封装光学则将光引擎置于更靠近交换芯片的位置。
共封装光学可缩短交换芯片与光学连接之间的电气距离。更短的电气路径可在高数据速率下改善信号完整性和能效。
当光学部件与交换硬件集成得更紧密时,可维护性会变得更困难。更换小型故障模块,比维修连接在昂贵交换机封装上的光引擎更简单。
线性可插拔光学从模块中移除了数字信号处理器。这种方法可以降低功耗和延迟,但会将更多信号处理责任转移给主机设备。
Data Center Dynamics 在其网络复杂性分析中指出,光学可靠性和尾延迟正成为新的限制因素。该机构还指出,更快的更新周期会增加设计和安装团队的压力。
物理层仍然很容易被忽视。更多光纤意味着更大的线缆束、更密集的配线面板、更严格的损耗预算,以及要求更高的测试流程。
逻辑网络图可能显示两个站点通过冗余路径连接。但在实践中,除非运营商验证物理多样性,否则两条路径可能共用管道、桥梁、电力系统或施工风险。
标准可通过形成更大的组件市场来降低成本。但其成熟速度也可能慢于围绕单一供应商节奏开发的专有系统。
因此,核心竞争仍然是成本与性能之间的较量,而不是以太网与某一个具名竞争对手之间的对抗。供应商策略服务于这场竞争,但不能取代它。
让处理器闲置的开放网络同样昂贵。将买方锁定在不利升级路径中的专有网络,也可能变得昂贵。
最终胜出的方案,将在保持可控功耗、维护和采购要求的同时,提供可预测的作业性能。没有任何单一接口规范能够独自证明这一结果。
光学路线图仍需通过可靠性考验
最大的不确定性在于,新兴光学系统能否在持续 AI 工作负载下兑现宣传中的容量,而不产生新的运营成本。
光链路已经在大型数据中心内部和数据中心之间承载流量。跨域扩展改变了这些链路的流量模式、故障敏感性和预期利用率。
AI 后端流量可能持续且同步。它可能长期占满链路,为维护事件或不可预测的性能波动留下更少余地。
更高的信号速率也缩小了工程裕量。组件必须在高密度、高温和功耗受限的环境中维持信号质量。
行业正从 400G 向 800G 相干可插拔模块演进,同时供应商也在准备 1.6T 产品。每次转型都会影响交换机、模块、测试设备、光纤设计和运营实践。
IEEE Spectrum 报道称,光学供应商也在为较短距离的 AI 连接开发密集波分复用技术。DWDM 可通过一根光纤传输多个光学波长。
一项 2026 年设计将流量分布到八条较低速率的通道上,目标聚合速度达到每秒 1.6 太比特。其开发者计划在预计于 2028 年部署前扩大生产规模。
这份光学扩展路线图前景可观,但供应商目标并非量产证据。制造良率、热特性、误码率和长期可靠性仍需经过现场验证。
同样的谨慎也适用于供应商的性能声明。如果架构需要更多链路或冗余容量,较低的模块功耗并不必然降低系统总功耗。
更高带宽也不保证更短的作业完成时间。在发生故障时,拥塞控制、工作负载放置和软件恢复可能主导最终结果。
距离构成另一项固定限制。光速很快,但传播延迟无法通过软件或更好的调制技术消除。
额外的交换机、光电转换、队列和纠错会增加更多延迟。运营商可以降低这些损失,却无法让远处的设施表现得与相邻机架完全相同。
这限制了适合跨域扩展的工作负载。一些训练任务可以容忍更广范围的分布,特别是在软件围绕局部性和检查点机制设计时。
其他任务则需要极其频繁的同步。当网络距离反复导致处理器停顿时,其经济性可能恶化。
在集群规模下,可靠性也有不同含义。单个组件即使故障率较低,在庞大的链路规模中部署后仍可能频繁引发事故。
此时,修复时间与故障频率同样重要。技术人员可能需要定位受损光纤、更换模块、清洁连接器,并在多个设施之间重新测试路径。
运营技能可能成为瓶颈。高密度光学设施需要专业的安装、文档记录、测量和故障排除实践。
供应链带来了更多不确定性。相干模块、激光器、连接器和光纤设备的加速采用,可能造成短缺或质量参差不齐。
审慎的结论并不是跨域扩展会失败。Google、Meta 及其供应商有明确理由对此投入。
尚未解决的问题是:在计入实际故障、维护和软件开销后,分布式集群能否维持高利用率。公开的容量规格无法回答这一问题。
买方应将降本声明视为特定架构下的结果。某家超大规模云服务商定制网络的成果,未必能迁移到采用不同设施、光纤路由和软件的较小运营商。
Google News 读者接下来应关注什么
三个信号将表明,跨域扩展网络是否正成为一种经济的生产模式,而非昂贵的权宜之计。
第一个信号是正在运行的多楼宇集群的实测利用率。Meta 的 Prometheus 部署提供了一个尤其相关的测试案例,因为其规划中的一吉瓦容量跨越多座建筑。
Meta 已说明其网络拓扑,但决定性证据将来自持续的工作负载表现。有价值的披露包括作业完成时间、加速器利用率、恢复时长和与网络相关的中断情况。
多座建筑之间的高利用率将支持这样一种观点:光纤能够释放闲置电力,而不会浪费计算资源。频繁的同步停顿则会削弱这一论点。
第二个信号是 1.6T 相干模块进入量产。供应商已经公布产品和送样计划,但运营商需要的是批量供货能力和现场可靠性。
关注超大规模云服务商的认证、电信运营商部署、互操作性测试,以及完整系统层面的功耗测量。仅凭模块规格,很难揭示部署成本。
多家供应商成功通过认证,将改善容量和采购选择。延迟、低良率或高故障率,则会让 800G 系统的经济性维持更久。
第三个信号是 Google、Meta 和 Nvidia 如何在不同网络域之间分配工作负载。它们的软件选择将揭示跨域扩展在哪些场景创造价值,以及物理局部性在哪些场景仍不可或缺。
Google 表示,其网络覆盖 AI Hypercomputer 内部的互连架构、跨越该系统的互连架构,以及全球骨干网。Meta 正通过 BAG 连接不同的训练互连架构。
Nvidia 持续为纵向扩展、横向扩展和跨域扩展环境开发集成系统。这些域之间的边界,将与它们的最高速度同样重要。
向局部性感知调度的转变,将证实距离仍是一个硬性的设计约束。在多个设施间广泛部署同步作业,则表明网络和软件改进正在降低这一代价。
Google News 在这里适合作为发现渠道,而不是技术证据。读者应关注底层工程出版物、部署报告和独立测试。
对于开发者而言,这一转变会影响可用加速器容量和分布式训练平台的行为。对于企业买方而言,它可能影响服务可靠性、区域可用性和 AI 计算成本。
网络架构师应评估完整工作负载的结果,而不是孤立地比较链路速率。采购团队也应要求提供故障恢复、功耗和互操作性证据。
最重要的问题很实际:在计入网络成本和延迟后,另一座相连建筑能否产生与之成比例的计算价值?
在接受跨域扩展已解决 AI 数据中心成本问题的说法前,请跟踪这三个信号。网络必须证明,分布式电力能够转化为高效计算,而不是由昂贵光纤连接起来的闲置容量。



