AI 数据中心热潮背后的光纤瓶颈
Google News 揭示了一项以芯片为中心的 AI 预测常常忽略的矛盾:数据中心所需的光连接远多于现有供应链最初的设计供给能力。
这一限制并不只在于玻璃光纤本身。光引擎、硅光子、连接器、激光器、专用封装以及经过培训的安装人员,都会影响计算集群扩展的速度。
这改变了基础设施的核心问题。购买更多加速器,并不能保证运营商能够高效地将它们连接起来、为周边网络供电,或按计划部署设施。
Google、NVIDIA、Amazon、Meta 和其他大型运营商如今都面临同样的物理现实。可用的 AI 容量取决于能否在处理器、机架、建筑和区域之间传输数据,同时避免造成不可接受的延迟或电力成本。
因此,竞争正从争夺芯片转向争夺完整系统。近期的供应协议和工厂扩建表明,光连接已迅速从采购细节变为战略资产。
Google News 指向 GPU 短缺之外的问题
AI 基础设施竞赛出现了第二项硬件约束,它位于处理器之间,而非处理器内部。
图形处理器主导了早期的短缺讨论,因为它们价格昂贵、供应稀缺,且是训练大型模型的关键。这种侧重很合理,因为企业当时正努力获得足够多的加速器。
但当数千个此类处理器进入同一个计算集群后,情况便会改变。它们必须在整个工作负载期间交换模型参数、中间结果和同步消息。
等待数据的处理器无法发挥其标称性能。因此,即使每颗芯片都正常运行,网络仍可能导致昂贵的计算设备处于闲置或未充分利用状态。
传统企业数据中心主要围绕 CPU 工作负载构建,其通信模式的要求较低。许多连接可以保持短距离、电连接,并局限在单个机架内。
大型 AI 系统使用更密集的集群,并将一项工作负载分配给大量加速器。这样的拓扑结构使交换机离服务器更远,同时增加了链路数量和传输距离。
NVIDIA 解释称,这种设计使得从网络接口到交换机、以及交换机之间的连接必须使用光学方案。其 AI factory networking 概览还指出了传统组件带来的功耗和可靠性成本。
这一区别很重要,因为“光纤瓶颈”可能指代多种彼此关联的短缺。运营商需要原始光纤、成品线缆、连接器、收发器、光引擎、交换机、封装产能,以及能够安装所有这些设备的人员。
增加某一层的产能,并不会自动消除其他层的限制。线缆供应无法弥补激光器缺货、光引擎良率不佳或半导体封装延期的问题。
设施外部的物理线路又构成了一层限制。AI 工作负载越来越多地在独立建筑、区域园区和遥远的数据中心之间传输信息。
这些线路需要管道、通行权、施工团队、放大器和网络设备。云服务商采购服务器的速度,未必总能快过运营商建设一条新的城际线路。
这正是 Google News 报道背后的核心反转。AI 热潮的估值围绕计算需求展开,但可用计算能力依赖于一条更广泛的产业链。
这条产业链包括此前获得关注度低于芯片制造的材料制造和精密装配企业。它们的生产周期可能远长于软件发布周期。
不同运营商会在不同时间遭遇这一瓶颈。拥有长期合同的超大规模云服务商可能锁定供应,而较小的建设方则会面临更长的交付周期或更少的配置选择。
这种不均衡的获取能力可能重塑竞争格局。采购承诺最大的企业获得的不只是更低的采购风险,它们还能够预留启用新增计算容量所需的实体投入品。
数据中心内部及之间的光纤需求正在上升
AI 集群在多个层面消耗光连接,使每一次扩建既是计算项目,也是网络建设项目。
在数据中心内部,加速器通过纵向扩展和横向扩展网络进行通信。纵向扩展连接形成紧密协调的计算域,而横向扩展网络则连接更大的服务器和交换机群组。
铜缆在短距离内仍然有用。然而,随着速率提高、连接延伸至更大的系统,电信号的高效传输会变得更加困难。
信号损耗会带来额外的处理、冷却和功耗需求。当数千条链路在同一设施内同时运行时,这种压力会更加严重。
光学方案将电数据转换为光,通过光纤传输。这种方法能更高效地处理更长距离和更高带宽,但也增加了激光器、调制器、探测器、连接器和制造环节。
AI 基础设施还要求更高的连接密度。设施必须在有限的机架空间内容纳更多光纤和端口,同时兼顾弯曲半径、气流、可维护性和信号质量。
连接数量会随集群规模扩大而增加。更大的系统需要更多通信路径,而冗余设计还会增加额外链路,以便在组件故障期间维持工作负载运行。
Lumen 和 Corning 在 2024 年 8 月提供了一个早期信号。双方的光纤供应协议为 Lumen 在两年内预留了 Corning 全球光纤产能的 10%。
两家公司表示,生成式 AI 在数据中心内至少需要 10 倍的光纤连接。他们还计划将 Lumen 在美国的城际网络里程增加一倍以上。
这项协议解决了两项不同的需求。密集集群需要大量内部布线,而分布式设施则需要站点之间的高容量线路。
Corning 表示,其新型线缆可在现有管道中容纳两到四倍的光纤。这种密度很重要,因为新建管道通常比利用现有线路敷设改进型线缆更慢。
更高密度的线缆并不能消除所有施工限制。运营商仍需要可用的通道、合适的建筑、许可、熔接能力和兼容的终端设备。
不过,这有助于解释为什么光纤创新会影响部署速度。材料和线缆设计的改进,能够从已建成的实体基础设施中释放更多容量。
同样的逻辑也适用于设施内部。更高密度的系统让建设方能够在不扩建每条通道的情况下连接更多设备,但这要求精确安装和谨慎的热管理规划。
因此,数据中心设计团队必须更早作出光学相关决策。等到服务器到货后再处理,可能暴露出布局不兼容、组件缺失或安装进度拖延等问题,从而延迟启用。
这使网络从一项辅助采购转变为容量规划的关键投入。一个集群的可用规模,取决于其通信网络在真实工作负载下能够持续支撑的能力。
对客户而言,结果未必表现为明显的光纤短缺。它可能体现为云区域上线延迟、加速器供应受限,或等待专属容量的时间更长。
最终用户看到的是更少的计算选择。而根本原因可能位于云服务本身数层供应商之外。
超大规模云服务商正在锁定供应链
长期采购协议表明,主要 AI 建设方不再将光学产能视为可互换的普通商品。
NVIDIA 和 Corning 于 2026 年 5 月宣布了一项多年期合作,涵盖 AI 基础设施的先进光连接。Corning 计划将美国光纤产量提高 50% 以上。
该公司还计划将国内光连接制造产能提高十倍。其制造扩张计划包括在北卡罗来纳州和得克萨斯州新建三座设施。
这些数字揭示了预期需求变化的规模,也表明现有产能并非为如今进入建设阶段的基础设施计划而设。
这项合作涵盖的不只是原始玻璃。光连接包括将光纤转化为可部署网络所需的线缆、组件、连接器和管理系统。
Amazon 随后与 Corning 达成一项多年期、数十亿美元的协议,采购 Corning 的光纤、线缆和连接产品。该安排支持 Amazon 不断扩大的美国数据中心布局。
这项 Amazon 光纤协议还支持在北卡罗来纳州创造 1,000 个制造业岗位,并带来额外的建设工作。
Meta 也与 Corning 建立了另一项大型多年期供应关系。Corning 表示,其与 Meta 的协议价值最高可达 60 亿美元,支持在北卡罗来纳州扩大光缆制造。综合来看,这些承诺表明超大规模云服务商更倾向于确保供应,而不是进行短期现货采购。
这种行为类似于此前围绕先进芯片和高带宽内存的竞争。大型买家会提前作出承诺,因为产能扩张需要工厂、专用工具、认证工作和经过培训的员工。
这一策略从两方面给较小运营商带来压力。首先,在新增产能完全投产前,大型合同就可能吸收未来的产出。
其次,供应商会自然围绕核心客户优化产品。较小买家可能获得更少选择、更晚的交付窗口,或只能使用围绕其他运营商架构设计的系统。
即使 Google 在内部开发部分光学技术栈,它也面临同样的经济压力。垂直整合可以减少对外部组件供应商的依赖,但不能消除制造约束。
内部设计的光学组件仍然需要材料、制造、封装、测试和部署。拥有设计权改变的是控制力,而非生产规律。
TrendForce 报道称,Google 正在内部开发光学组件,而其他供应商则在锁定外部供应。不同策略追求的是同一个目标:可预测地获得关键网络技术。
这正是 Google 光网络具有战略重要性的原因。Google 长期运营全球私有网络,并为其计算服务设计定制基础设施。
AI 提升了这类经验的价值,但也提高了所需规模。为搜索、视频和云流量建设的网络,如今还必须支持需要高度同步的加速器工作负载。
采购竞争并不只是 Google 与 NVIDIA 或 Amazon 之间的较量。核心冲突在于已承诺的需求与制造现实之间的落差。
超大规模云服务商可以签订合同并为工厂提供资金。供应商仍必须建设设施、验证工艺、提高良率,并稳定地大规模交付产品。
这种延迟为能够准确预测需求的运营商创造了优势,也让那些 AI 计划增长快于基础设施预订速度的公司面临风险。
市场最终或许会新增充足产能。但在此之前,长期协议会将行业分为两类:已锁定供应的买家,以及面临交付风险的买家。
共封装光学将瓶颈推向芯片附近
行业为解决网络限制而提出的方案,依赖于部分同样受限、也用于先进 AI 处理器的制造体系。
目前大多数光连接采用可插拔收发器。这些可拆卸模块安装在交换机面板上,负责将电信号转换为光信号。
可插拔设计成熟且便于维护。技术人员无需报废主交换机组件,就能更换故障模块。
然而,更高速的电信号在从交换芯片穿过电路板传输时会损失更多能量。这种损耗会提高功耗、发热量和信号处理要求。
通常被称为 CPO 的共封装光学技术,将光引擎移至交换芯片旁。更短的电气路径可在数据进入光纤前减少损耗。
NVIDIA 表示,传统的每秒 200 吉比特通道可能产生高达 22 分贝的电气损耗。据称,其 CPO 设计可将该路径损耗降至约四分贝。
该公司还表示,接口功耗可从约 30 瓦降至最低九瓦。这些仍是与 NVIDIA 架构和运行假设相关的供应商声明。
NVIDIA 的 Spectrum-X Photonics announcement 表示,其系统设计目标是实现每秒 409.6 太比特的交换容量。所列最高配置支持 512 个端口,每个端口以每秒 800 吉比特运行。
这些数字解释了 CPO 为何备受关注。当集群包含数千条高速连接时,网络功耗会成为一项主要成本。
但 CPO 转移了制造难题,而非让其消失。光引擎将激光器、调制器、光电探测器和耦合组件集成在紧凑组件中。
每个组件都必须在高温、高功耗的硅芯片附近可靠运行。制造商需要实现较高良率,因为一个缺陷元件就可能影响昂贵的集成封装。
硅光子技术又增加了一层依赖。这项技术使用半导体制造方法构建光学功能,使光信号处理更接近传统芯片生产。
先进封装随后将光子器件、电子元件和支撑结构整合在一起。该过程需要极高精度,并会竞争部分同样用于高性能处理器的资源。
TrendForce 的 CPO production analysis 将光引擎良率、硅光子产能和先进封装列为三项核心限制因素。
该机构称,NVIDIA 已开始向部分合作伙伴交付 Spectrum-X CPO 交换机。Broadcom 也在继续有限交付其 51.2 太比特 Bailly 交换机。
TrendForce 表示,NVIDIA 与 TSMC 共同开发的系统可提供最高每秒 400 太比特的能力。预计其产量将在 2026 年下半年扩大。
据报道,Broadcom 的系统相比传统可插拔光学方案可将功耗最多降低 70%。TrendForce 称,Meta 已完成部署验证。
这些进展标志着行业正从实验室演示迈向早期商业化制造。但这并不意味着供应商能够满足每一项已规划的 AI 部署需求。
CPO 也带来了可维护性问题。可更换的收发器能够隔离部分故障,而高度集成的光学组件可能使维修更加复杂或昂贵。
工程师必须决定效率何时足以抵消模块化带来的优势。一些部署可能继续在合适距离内采用改进型可插拔光学、线性驱动光学或铜缆。
更可能出现的是混合型未来,而非统一方案。不同连接可根据传输距离、带宽、功耗、可靠性和维护要求采用不同技术。
这种不确定性如今已影响采购决策。运营商必须在某一种架构尚未明确胜出、覆盖数据中心各个环节之前预订组件。
Google AI 基础设施故事未能证明什么
可见的投资确认了强劲需求,但并不能证明光纤会无限期地维持行业主导性约束。
供应短缺往往包含时间上的问题。当客户预测依赖于不确定的未来需求时,制造商会犹豫是否建设过多产能。
AI 公司预测模型将更大、集群将更密集、推理量将持续上升。这些预测支持建设工厂,但技术进步可能改变每项工作负载所需的基础设施规模。
更小的模型可能处理更多任务。更好的调度可提高加速器利用率,而改进后的压缩和网络算法能够减少部分通信开销。
公司也可能以不同方式分配工作负载。训练集群的协同要求比许多推理系统更严格,后者可将请求分散到更多相互独立的服务器上处理。
因此,“光纤瓶颈”这一说法可能过于宽泛。原始光纤、成品线缆、光引擎、激光器、封装和安装劳动力各自拥有不同的供给曲线。
Corning 的扩张覆盖了多个连接层级,但无法独立解决所有光子学短缺问题。TSMC、组件供应商、设备制造商和数据中心承包商仍是供应链的一部分。
当前证据也更有利于最大型的运营商。NVIDIA、Amazon、Meta 和 Google 的建设规模,并不代表所有企业部署。
一家使用租用云资源的普通公司不会自行安装光学网络。它所面临的风险会体现在服务可用性、区域选择和合同条款中。
当前供应协议主要描述了美国的制造与数据中心建设情况。欧洲、亚洲及其他地区的条件可能不同。
在特定市场,本地许可、电力接入、电信政策和建设能力可能比光纤供应更具决定性。基础设施瓶颈并不存在普遍适用的优先顺序。
电力仍是一项主要的竞争性限制因素。如果公用事业公司无法为设施送电,或无法提供充足的发电和输电能力,已建成的网络也无济于事。
冷却带来了另一道边界。高密度加速器和光学封装会产生热量,运营商必须在不降低可靠性的前提下将其移除。
随着 CPO 产量增长,先进封装可能成为更紧的限制。TrendForce 指出,光子产品可能与 AI 芯片争夺有限的封装资源。
这形成了一个循环问题。原本旨在释放更多加速器能力的网络技术,可能依赖于已经限制这些加速器的制造产能。
CPO 所宣称的可靠性提升也需要来自长期现场运行的证据。实验室测试和部分合作伙伴部署无法重现数千个站点中的所有维护条件。
这种集成方式可以消除容易发生故障的电气接口和可插拔模块,但也可能将更多价值集中在一个更难更换的封装内。
开放标准或可降低另一项风险。AMD、Broadcom、Meta、Microsoft、NVIDIA 和 OpenAI 在 2026 年协助成立了一个光学扩展联盟。
该组织的 optical specification 面向多种实现方式,包括可插拔、板载和共封装光学。其路线图延伸至每根光纤每秒 3.2 太比特及更高水平。
共享的物理层可增加组件选择,并减少专有方案造成的碎片化。然而,一项规范并不能保证产品可互换、高制造良率或及时部署。
Google AI 基础设施可能遵循自身的实现路径,同时在其他领域支持兼容的行业方案。这种灵活性有利于 Google,但会使简单的市场份额预测变得复杂。
最稳妥的结论更为有限:光学连接已成为一项实质性的规划约束,而最大的买家正据此投入资金。
目前仍不清楚哪一种组件会造成最长延迟。随着工厂投产、设计成熟以及 AI 工作负载演变,答案将不断变化。
三项信号将显示瓶颈是否正在缓解
工厂产出、现场可靠性和部署进度,将决定光学供应能否支撑承诺中的 AI 扩建计划。
第一个信号是 Corning 的制造爬坡。只有经过验证的光纤、线缆、连接器和组件以可靠规模从工厂出货,已宣布的产能才有意义。
Corning 的 second-quarter 2026 results 提供了早期基准。光通信销售额达到 20.7 亿美元,较上年同期增长 32%。
企业网络销售额增长 65%。Corning 表示,生成式 AI 产品销售增长更快,但未披露该类别的单独数据。
该公司计划将美国光纤产量提高 50%以上,也预计将国内光学连接制造产能扩大至原来的十倍。
读者应关注未来财报中的产出、利润率、客户集中度和建设进展。平稳爬坡将强化供应能够追上需求的判断。
延迟或不断增加的积压订单则会支持相反结论。这将表明商业承诺正跑在可执行生产能力之前。
第二个信号是早期 CPO 部署的表现。NVIDIA 和 Broadcom 必须证明,集成光学方案能够在有限验证项目之外可靠运行。
有用的指标包括制造良率、系统可用性、维修流程、能耗,以及部署生产系统的客户数量。
一台交换机可以达到带宽目标,却仍带来运营问题。数据中心运营商关心的是可预测的维护和整体系统正常运行时间,而不仅仅是峰值规格。
广泛的客户采用将验证 CPO 是解决电信号损耗的实用途径。反复延迟或可维护性问题,则会为可插拔替代方案保留更大的角色。
第三个信号是超大规模云服务商新增 AI 产能的时间表。已宣布的设施应转化为启用的集群、可用的云服务以及更大的区域容量。
Google News 读者应将基础设施承诺与交付日期进行比较。项目延期可能揭示公司未在公开公告中单独说明的限制因素。
项目延迟并不能自动证明存在光纤短缺。电力接入、许可、冷却系统、芯片、建设或融资同样可能影响进度。
跨多个项目观察到的模式将更具参考价值。如果连接性是差异化因素,已锁定光学供应的设施应能更可预测地投入运行。
同样的比较也适用于 Google 的光网络。若垂直整合能够减少对外部供应的依赖,Google 自研组件的工作应当带来可衡量的部署收益。
相关证据可能包括更快的集群扩容、新的光学系统、更低的网络功耗,或更少的供应预警。沉默并不能否定进展,但具体的部署案例会让这一判断更具说服力。
这让故事回到了核心矛盾:AI 行业曾承诺,通过更多计算能力实现可扩展的智能;但这些计算能力如今却日益依赖精密光学制造。
Google News 凸显了这一瓶颈,但仅凭采购公告无法作出定论。决定性证据将来自工厂、实际运行的网络,以及已完成建设的数据中心。
关注光学产能是否按时交付给客户。随后再观察,CPO 系统能否在不牺牲可维护性的前提下,经受住生产负载的考验。
最后,将超大规模云服务商的建设承诺与已启用的容量进行对比。这三项检查将揭示,光纤究竟只是暂时性短缺,还是 AI 热潮面临的长期限制。



