AI 数据中心韧性如今已超越单纯的正常运行时间
- Ethan Carter

- 8月4日
- 讀畢需時 15 分鐘
Google News 揭示了 AI 基础设施热潮中一个更尖锐的矛盾:数据中心可能达到正常运行时间目标,却越来越难以安全运营。机架密度上升、用电需求波动、液冷、电网限制以及软件依赖,正在改变故障的演变方式。
Data Center Frontier 最近一则基于行业对自适应电力基础设施讨论的标题,捕捉到了这一转变。过去的目标是在孤立组件发生故障时保持设备可用。如今面临的挑战,则是在跨越电力、冷却、网络、软件、供应商和人工运营的扰动中,维持有用的计算能力。
这一差别至关重要,因为传统冗余仍只能覆盖部分故障面。双路电源无法解决不稳定的电网。备用发电机无法纠正错误的切换操作流程。若监控软件漏检冷却异常,冗余泵提供的保护也十分有限。
Uptime Institute 的最新发现构成了核心张力。单个站点的故障频率已连续五年下降,但进一步改善正变得愈发困难。外部故障、高密度工作负载、运营复杂性和相互依赖的系统,正在增加传统可用性指标难以揭示的风险。
这并非反对正常运行时间。可用性依然不可或缺。不过,AI 基础设施如今需要更广泛的检验:设施能否吸收扰动、保留关键工作负载、可预测地恢复,以及避免在响应过程中制造新的故障。
Google News 正在呈现一场更广泛的韧性讨论
真正重要的变化并非某一种新设备,而是对数据中心故障含义的更广泛定义。
相关行业讨论认为,电力韧性必须超越静态冗余。Trystar 的自适应电力观点主张采用能够吸收扰动、适应不断变化的条件,并在电网或环境压力下维持运行的基础设施。
这一方法涵盖了人们熟悉的设备。正常供电失效时,不间断电源可提供短时连续供电。转换开关可在可用电源之间切换负载。发电机、电池和微电网则可在特定条件下提供替代电力。
变化在于这些部件必须如何协同工作。AI 集群在原本通常为更可预测的计算而设计的系统后端,承载着规模庞大且持续变化的负载。运营商必须将电源、冷却回路、控制系统、维护程序和工作负载优先级作为一个运营系统进行协调。
传统的正常运行时间百分比将这种复杂性简化为可用时长。这个数字有助于买方比较服务承诺,但对中断发生时的周边条件几乎没有说明。它也无法反映设施是否平稳恢复,或只是险些避免了一起更严重的事故。
一个站点即使经历多起危险事件,仍可能报告出色的年度正常运行时间。另一个站点可能记录到一次短暂中断,但其保护系统避免了设备损坏,并安全地恢复了服务。单凭这一百分比,无法区分这两种结果。
AI 工作负载也使服务可用性的定义更加复杂。一个集群可能仍保持在线,但热限制迫使处理器降低性能。网络拥塞可能让昂贵的加速器闲置,却并未使其断开连接。冷却控制问题可以维持基础服务,却令全面生产运行变得不安全。
这些属于降级状态,并不一定是传统意义上的宕机。但它们仍可能延误训练任务、降低推理容量,或导致无法履行对客户的承诺。对运营商和 AI 客户而言,有效完成工作比服务器是否响应健康检查更重要。
Data Center Frontier 曾将 AI 设施描述为高度耦合的物理与数字系统。其基础设施圆桌讨论强调,必须在电力、冷却、化学、建设、控制和运营数据之间实现协调。
这一框架将韧性从设备间延伸至整个设施生命周期。设计假设必须经得起调试、维护、扩容和日常运营的考验。一个系统并不会仅因图纸中包含冗余组件而具备韧性。
只有当这些组件在现实的故障组合下仍能正确运行时,系统才具有韧性。这需要测试系统切换过程,而不只是单个资产。还需要准确理解跨越组织边界的依赖关系。
Google News 可以放大这场讨论,但运营商必须将其转化为工程决策。重点并不是正常运行时间已经无关紧要,而是它只能提供 AI 基础设施风险的不完整视图。
AI 电力密度改变了故障的计算逻辑
AI 将更多电力和散热需求集中到更小空间中,同时加大了基础设施问题的发生速度和后果。
国际能源署报告称,全球数据中心用电需求在 2025 年增长了 17%。根据其更新后的能源展望,以 AI 为重点的设施在同期用电量增长了 50%。
该机构预计,数据中心总用电量将从 2025 年的 485 太瓦时增至 2030 年约 950 太瓦时。以 AI 为重点的用电增长更快,预计将在此期间增长至三倍。
这些全球数据仅描述了问题的一面。AI 需求具有地域集中性,而电网容量、发电能力、变压器和审批流程仍是本地问题。即便全国电力供应看似充足,某个地区也可能面临严重的接入限制。
国际能源署估计,到 2027 年,一台先进机架的峰值用电需求可能与 65 个家庭相当。该机构还报告称,AI 服务器的功率密度在 2020 年至 2025 年间增长了 11 倍,预计到 2027 年还将再增长四倍。
密度改变了情况恶化的速度。传统机架附近发生冷却中断时,运营商尚有一定的热裕量。高密度加速器机架则会在有限空间内储存并释放更多热量。
这缩短了响应时间,也使传感器、阀门、泵、控制软件和冷却液质量成为可用性链条的一部分。一个微小的机械或控制错误,就可能迅速影响昂贵的计算设备。
高密度芯片日益需要直接液冷,即通过处理器附近的液体带走热量。这种方式能够处理普通机房级风冷无法高效应对的负载,但也在计算设备与设施系统之间建立了新的运营边界。
Google 表示,下一代 AI 和高性能计算芯片的热设计功耗通常超过 1,000 瓦。其 Brazos cooling system 旨在将液冷设备部署到现有的风冷设施中。
Brazos 采用机架安装式闭环液对气设计。Google 表示,它可以帮助运营商部署高密度硬件,而无需立即围绕冷冻水分配系统重建整座设施。
这对既有设施限制而言是一种务实的回应,但也体现了更广泛的权衡。改造系统可以加快部署,同时增加接口、泵、热交换器、控制系统和维护要求。每个接口都需要监控,并制定明确的故障响应方案。
伴随冷却系统变化的,还有电力行为。国际能源署表示,AI 训练和模型使用可能导致大规模、快速的功率波动。这些波动对电气设备提出了不同于稳定企业计算负载的要求。
电池可以平滑这些变化、支持短时续航,并有可能与电网互动。国际能源署预测,到 2030 年,全球数据中心的电池储能装机容量可能达到 20 至 25 吉瓦。
储能并不能消除系统级工程的需求。电池、发电机、公用电网供电和负载控制必须在不产生不稳定切换的情况下协同工作。其控制逻辑还必须考虑维护状态和部分设备故障。
压力还延伸至供应链。变压器、开关设备、燃气轮机、先进芯片和高带宽内存都面临产能限制。当失效组件需要长交期的替代品时,冗余设计所提供的保障十分有限。
因此,AI 密度既改变了即时故障动态,也改变了长期恢复能力。运营商不仅需要满足正常工作所需的电力和散热容量,还需要具备可维护的架构。一个在调试阶段表现良好的设计,在设备老化或容量扩展时仍可能变得脆弱。
正常运行时间不等于韧性
正常运行时间记录的是结果,而韧性描述的是系统如何准备、遏制并从扰动中恢复。
可用性通常衡量一项服务保持可用的时间占比。韧性则提出更多问题:什么发生了故障、影响扩散得多广、还剩多少容量,以及系统恢复得有多安全?
当基础设施分布式部署时,这一区别尤为重要。云服务可以通过将工作负载转移至其他区域来应对设施故障。受影响的建筑发生了故障,但客户可能几乎感受不到中断。
反过来也可能发生。所有本地组件都能正常工作,但网络、软件、身份验证或上游云服务故障仍可能使服务不可用。完美的设施正常运行时间并不能保证应用可用性。
Uptime Institute 的2026 年故障分析发现,单站点故障频率已连续第五年下降。不过,改进速度有所放缓,约十分之一的受访者将其最近一次故障描述为严重或极其严重。
电力仍是造成重大故障的首要原因。涉及不间断电源、转换开关和发电机的故障依然突出。电网限制和高密度工作负载正在引入额外的压力点。
该报告还发现,在公开报道的事件中,外部基础设施故障正变得更加显著。光纤和连接故障正在增加,并且往往造成更长时间的中断。
这一模式挑战了以设施为中心的韧性评估。运营商可以检查每一条内部电力路径,却忽略共享光纤路由、公用事业变电站、燃料供应商或云控制平面。
外部依赖关系映射之所以困难,是因为责任分散。托管服务提供商负责建筑设施,客户负责服务器和应用程序。公用事业公司、电信公司、硬件供应商和软件供应商则运营着其他环节。
合同界定了责任,但合同并不能隔离故障传播。一条不可用的网络路径可能使原本健康的设备陷入停滞。一次延迟的燃料交付,可能在电网长时间中断期间削弱发电机的就绪能力。
核心冲突由此浮现:组件冗余与运营连续性。组件冗余假设备用资产能够替代故障资产。运营连续性则关注整个系统能否在真实条件下完成这种切换。
一台闲置的发电机可能在例行测试中启动成功,却在持续负载下失效。一台转换开关可能运行正常,但其控制设置却将电力导向非预期路径。一块电池可能具备备用容量,但上游软件问题会阻止其被正确调度。
因此,测试必须复现实际运行序列。负载箱可让团队在不让生产设备承担风险的情况下验证发电机容量。集成系统测试则考察多个组件在模拟故障期间如何协同运行。
设施还需要测试降级运行。并非每起事件都需要立即关停或完全切换。运营人员需要预先定义的状态,在降低热负荷或电气压力的同时保留最有价值的工作负载。
AI 工作负载调度提供了另一层保障。训练任务有时可以暂停或迁移,而对延迟敏感的推理则需要立即获得容量。韧性规划应在中断发生前区分这两类工作负载。
这种方法将物理基础设施与业务优先级连接起来。它避免在资源受限事件中对每台服务器采取完全相同的处置方式。当容量恢复时,它也能提供更清晰的恢复顺序。
Google News 读者可能会将 uptime 与 resiliency 视为可互换的概念。运营人员承受不起这种模糊性。服务级别指标与工程能力回答的是不同的问题。
自适应供电面对运营现实
只有当团队能够在异常条件下理解、测试并控制自适应基础设施时,它才能发挥作用。
原始行业讨论中描述的电力策略包括双路市电供电、冗余不间断电源系统、转换开关、移动式配电、负载箱和现场储能。这些要素能够在中断期间形成多条供电路径。
更多路径也意味着更多运行状态。每种状态都需要清晰的控制逻辑、准确的仪表数据,以及与已安装系统相匹配的操作程序。否则,冗余只会变成缺乏可靠保护的复杂性。
自动转换开关清楚地体现了这一取舍。自动化能够比人工团队更快地转移负载。然而,不正确的传感、时序或控制配置,可能触发不必要的切换,或阻止正确的切换。
当自动化失效时,手动控制仍然很有价值,但前提是设备易于操作且人员训练有素。团队必须了解在特定电气条件下哪些操作是安全的。一种无人能够自信操作的手动选项,提供的保护十分有限。
微电网同样带来机遇与风险。微电网是一种本地电力系统,可与更大范围的电网断开并独立运行。它可以整合发电设备、电池、控制系统和按优先级划分的负载。
在公用电网不稳定期间,临时孤岛运行可以维持关键服务。然而,安全分离与重新并网需要谨慎同步。设施还必须在事件持续期间维持充足的燃料、储能和发电能力。
IEA 估计,对于波动的数据中心负载,要实现可靠的现场燃气发电,所需容量必须比需求高出 30% 至 70%。这一发现使“现场发电始终能迅速应对电网延迟”的说法变得更为复杂。
额外容量会消耗土地、资本、设备和维护资源。燃气轮机供应同样受限。IEA 指出,尽管现场发电的关注度不断上升,大多数数据中心仍然更倾向于接入电网。
韧性规划必须考虑这些限制,而不是假设备用能力无限。运营人员需要了解替代系统能够支撑关键负载多长时间,也必须明确当中断持续时间超过这一窗口时将如何应对。
冷却系统同样需要这种严谨性。直接芯片冷却让液体接近昂贵的处理器,因此泄漏检测和水质管理成为重要的运营职能。设施团队和计算团队都必须能够看到泵状态与流量数据。
组织边界可能妨碍这种可见性。机械工程师可能监控冷却回路,而 IT 团队则关注处理器温度。任何一种视角都无法完整解释一个正在发展的问题。
共享遥测数据可以连接这些信号。遥测数据是从设备和控制系统持续采集的运行数据。它帮助团队关联电力、冷却液流量、温度、工作负载和设备行为的变化。
然而,仪表盘并不会自动形成共同认知。团队需要就阈值、职责和升级流程达成一致,还需要统一时钟,以便在事件发生后准确重建事件记录。
事件顺序记录仪能够以高分辨率为电气活动加上时间戳。这些证据帮助团队确定哪个设备最先动作,以及保护机制是否按设计运行。没有准确的时间信息,事故后分析可能会混淆原因与后果。
调试投运必须建立初始基线,后续变更应以该基线为参照进行核查。容量扩展、固件更新、阀门调整和控制修改,都可能逐渐使运行中的设施偏离原始设计。
因此,变更管理成为物理韧性的一部分。每项修改都需要记录明确目的、经过测试的回滚路径,以及对依赖系统的审查。即使某项变更看似仅限于一个机架,这种纪律也很重要。
最具韧性的架构不一定是设备最多的架构,而是故障状态仍可被理解的架构。运营人员应能解释:当多项假设同时失效时,系统将如何运行。
更多自动化带来新的故障模式
自动化能够缩短响应时间,但也会将风险集中到软件、数据质量、配置和人工监督之中。
自动化之所以具有吸引力,是因为 AI 设施产生的运行数据多到团队无法手动逐一检查。预测系统可在阈值被触发前识别温度、振动、电能质量和设备性能中的模式。
这些工具能够支持基于状态的维护。运营人员不必按固定日历维护每个组件,而可以依据设备实际健康状况开展维护。这既能减少不必要的干预,也能更早识别正在发展的故障。
但在通过实际运行结果验证之前,预测输出仍只是企业或模型的声明。误报会浪费注意力,漏检异常则会造成不应有的信心。
自动化控制也可能在陌生的组合条件下失效。一项针对能效优化的规则,可能在异常运行期间与韧性目标发生冲突。两个各自正确的控制回路,也可能以不稳定的方式相互作用。
软件更新带来另一种风险。一座设施可能拥有冗余的机械设备,但这些设备通过共享代码、共享身份验证或共同的网络基础设施进行控制。因此,单个软件错误可能绕过物理隔离。
Uptime Institute 在 2025 年报告称,基于软件和分布式的韧性工具在提高可用性的同时也增加了复杂性。该机构警告说,这些工具可能模糊责任归属,并使根因分析更加复杂。
其 2026 年分析强化了这一警告。Uptime 预计,更多故障将源于软件、网络、外部依赖和物理设备之间的相互作用。这些事件将更难归因于某一个失效组件。
人为错误仍然居于核心位置。Uptime 发现,在 2026 年,与人为错误相关的停机事件中,未遵循程序仍是首要驱动因素。不清晰或不一致的程序也依然普遍存在。
这不应被简单理解为对运营人员的批评。程序失效往往揭示更广泛的系统问题:文档可能已经过时,设备可能难以操作,人员配置也可能不足以应对系统复杂性。
自动化可以减少日常工作量,但也可能削弱很少使用的技能。如果软件负责正常切换,员工练习手动控制的机会就会减少。他们第一次真正介入时,可能正处于高压故障场景。
定期演练可以抵消这种能力衰减。团队应练习降级模式、传感器失效、自动化不可用和告警冲突等情境。演练应涵盖设施人员、IT 运营人员、安全团队、供应商和客户代表。
Google News 的报道常常聚焦于新型冷却设备、电力交易或大型园区。更不显眼的运营问题在于:这些系统部署后,团队能否安全地管理它们。
安全也必须纳入韧性模型。运营技术将电气和机械设备连接到监控与控制网络。更强的连接性提升了可见性,但也暴露出另一条中断路径。
设施需要网络隔离、访问控制、日志记录、经过测试的恢复程序,以及安全的供应商支持。一个依赖已泄露凭证或不可用远程访问的备用系统,可能在需要时无法运行。
数据质量同样值得重视。故障传感器可能误导人工操作员和自动控制系统。冗余传感、合理性检查和校准记录,有助于区分设备问题与测量问题。
当自动化控制关键切换时,独立保障仍然重要。保护功能不应完全依赖于同一软件层,而该软件层同时还用于优化。运营人员还需要一种经过测试的方法来重新获得本地控制权。
目标不是减少自动化,而是采用决策可观测、权限有边界且有人类监督演练的自动化。系统应进入已知状态,而不是产生令人意外的组合。
对于“完全自主设施”的说法,尤其值得审慎审视。AI 可以帮助关联告警、检索程序并提出建议措施,但它并不消除对电气安全、工作负载优先级或恢复决策的责任。
具备韧性的组织将自动化视为一层防御。它会验证输出、保留手动操作能力并调查险些发生的事故;当运行证据与原始设计相矛盾时,也会更新程序。
三项信号将显示韧性是否正在改善
下一项考验在于,运营人员能否就工作负载连续性、集成测试和外部依赖提供可衡量的证据。
第一项信号是对工作负载层面服务降级的更广泛披露。传统停机数字应同时反映损失的计算容量、热节流、被中断的训练时间和推理可用性。
这种报告将显示设施在压力条件下是否仍能保持有效生产力,也将帮助客户区分无缝切换与长期降级运行。
一个积极信号将是云服务商和托管数据中心服务商采用标准化披露。这将强化这样一种观点:韧性已超越建筑可用性。若持续依赖单一的 uptime 百分比,则会削弱这一结论。
第二个信号是对高密度供电与冷却系统开展更一体化的测试。运营商应公布证据,证明其已测试快速负载变化、泵故障、控制系统失效、发电机切换以及部分冷却能力受限等情况。
测试应涵盖真实的工作负载行为。静态电力负载无法充分复现大型 AI 集群带来的波动。设施需要了解,当计算需求快速变化时,控制系统会如何响应。
Google 决定通过 Open Compute Project 开放其 Brazos 设计,提供了一个有用的测试案例。行业是否采纳,将显示市场对在风冷建筑与液冷 AI 设备之间进行改造升级路径的需求。
关键证据将来自现场表现。运营商应关注泄漏事件、维护需求、热稳定性和恢复表现。仅有产品可用性,并不能证明其具备韧性。
第三个信号是将韧性评估扩展到设施边界之外。审查应包括电网连接、燃料供应、网络路由、云依赖、关键供应商,以及社区或监管限制。
这一变化很重要,因为外部故障正变得更加突出。一栋实现全面冗余的建筑,仍可能因共用的公用事业、电信或软件依赖而中断服务。
最有力的证据将是由公用事业公司、网络服务提供商、供应商、运营商和客户共同参与的联合演练。这类演练能够在真正的紧急情况迫使各方协调之前,暴露彼此冲突的假设。
关注 Google News 和其他科技报道是否开始披露这些运营指标。公布的兆瓦数和加速器数量描述的是规模,而非存续能力。恢复表现、经过测试的依赖关系和降级后的可用容量,能提供更清晰的图景。
对于开发者和企业采购方而言,眼下应采取的行动是提出更好的问题。在设施受限时,工作负载会迁移到哪里?哪些依赖在不同区域之间仍然共用?在无法获得正常公用事业服务的情况下,关键容量能够维持运行多久?
运营商也应提出同样直接的问题。团队能否在没有中央自动化系统的情况下控制设施?供电和冷却切换是否经过了联合测试?每一项关键外部依赖是否都有明确的责任人?
AI 基础设施竞赛仍将奖励速度、密度和获取电力的能力。当复杂性超越运营纪律时,这些优势就会变成负担。胜出的设施不会只是避免停机;它们将能够吸收冲击、保障优先级工作,并在无需临场应变的情况下恢复运行。


