top of page

Vertiv AI 负载稳定性让数据中心韧性超越冗余

56分钟前
讀畢需時 13 分鐘

Vertiv 正推动 AI 数据中心韧性超越冗余设备,认为毫秒级的功率波动如今需要覆盖整个电气系统的主动控制。其围绕 Vertiv AI 负载稳定性的工作反映出基础设施工程的一项更广泛转变。容量和备用路径依然重要,但两者都无法保证发电机、电池、开关设备及电网会在负载突变期间保持同步。

这里的矛盾在于静态冗余与动态稳定性之间。传统设计通过提供另一套组件或电气路径来应对设备故障。AI 集群则带来了不同挑战:数千个加速器可同时改变运行状态,在没有任何组件发生故障的情况下引发快速的功率变化。

这一差异使 Vertiv 与 ABB、Schneider Electric、公用事业公司及电网研究人员站在同一问题的不同方向上。他们提出的方案涵盖更智能的 UPS 控制、负载模拟器、同步调相机、电池系统以及新的并网要求。

正在浮现的经验很直接:不能只根据一个 AI 数据中心在电源消失后如何表现来判断它。运营商还必须了解设施在扰动发生前、发生中和发生后的每一毫秒里如何运行。

Vertiv AI 负载稳定性将 UPS 转变为主动控制层

最直接的变化是,UPS 被要求控制正常工作负载的波动,而不只是弥合停电带来的短暂缺口。

传统的不间断电源位于计算设备与上游供电源之间。它熟悉的角色是在另一套电源可用之前维持供电。这一模式主要将 UPS 视为应对异常事件的保险。

AI 计算改变了这一模式。Vertiv 表示,大型 GPU 集群可在数毫秒内从低负载切换至满负载。这种变化可能出现在训练任务启动、结束、到达同步点,或在不同计算阶段之间切换时。

冗余 UPS 可以承受另一台设备的故障,但这并不意味着系统能够吸收反复发生的功率阶跃,同时不对其电池、变换器、发电机或公用事业连接造成压力。

Vertiv 的应对方案将固件控制与工作负载专项测试相结合。其 Battery Shield 功能旨在由 UPS 内部处理某些负载阶跃,无需让所连接的电池反复循环。输入功率平滑功能(IPS)则利用储能,降低上游发电机或公用事业公司所感知的负载波动。

当计算需求突然上升时,UPS 可以通过储能提供部分差额。当需求下降时,它可以以更稳定的速率继续取电,同时恢复电池电量。

这使 UPS 成为两个响应速度截然不同的系统之间的缓冲层。GPU 几乎可以立即改变状态,而发动机、涡轮机、电网控制及部分电气保护系统则以较慢的时间尺度响应。

Vertiv 表示,其控制系统能够管理从零到满负载的功率阶跃,而不是在每种情况下都自动启用电池。这属于厂商说法,实际性能将取决于系统配置、运行限制和真实的工作负载特征。

该公司还开发了 AI Load Simulator。该设备通过高速开关和数字控制,再现同步加速器负载相关的幅度、频率和占空比。

Vertiv 首先在意大利博洛尼亚的客户体验中心部署了该模拟器。该公司称,正将该系统扩展至其他设施和客户现场。

该模拟器之所以重要,是因为传统调试测试通常使用稳定负载箱。这些测试能够确定设备是否可承载指定负载,但未必能显示集成供电链路会如何应对快速重复的波动。

Vertiv 的高级 UPS 控制最清晰地表达了其观点:运营商必须测试基础设施的时序与相互作用,而不只是验证各组件铭牌标示的容量。

这一方案并未让冗余变得过时,而是改变了冗余必须证明的内容。备用路径必须能在扰动依次穿过控制系统、电池、发电机和保护装置后,仍然保持可用。

为什么冗余设备并不能保证系统稳定

冗余回答的是是否存在另一套组件;动态稳定性则关注整个系统能否在快速变化期间保持受控。

数据中心通常采用 N+1 或 2N 等配置描述电力韧性。在 N+1 设计中,设施拥有比预期负载所需数量多一台的设备。2N 设计则提供两条完整的容量路径。

这些标签依然具有价值。它们传达了可维护性以及对某些设备故障的容忍能力,但并不能描述所有共享依赖、控制交互或瞬态响应。

电力瞬态是电压、电流、频率或需求发生的短暂而快速的变化。即使采用名义上的冗余设计,瞬态仍可能穿透系统,因为两条电气路径都可能遭遇相同的上游事件。

一套共用控制系统也可能向重复部署的设备发出相同响应。相同的保护设定可能使两条独立路径在相同条件下断开。共享的开关设备、电缆路径、燃料系统或软件还可能带来额外的共模风险。

AI 将工作负载同步加入了这份风险清单。数千个加速器可能同时进入或退出高强度计算阶段,由此产生的功率波动可越过机架层面,并传导至设施基础设施。

发电机说明了时序问题。发电机需要依靠调速器和励磁控制来将频率与电压保持在可接受范围内。严重的负载阶跃可能快于机械系统的补偿速度。

如果发电机失去频率控制,UPS 可能拒绝与之同步。即使拥有充足的额定发电容量,保护系统仍可能为了防止损坏而隔离设备。

电池行为则带来另一项权衡。使用电池平滑每一次功率波动,能够保护发电机和电网;但频繁的浅循环可能加速老化,或减少真正停电时可用的储能。

将每次波动都传递至上游可以保护电池,却会让发电机、变压器和公用事业连接承受易变负载。Vertiv AI 负载稳定性控制试图动态管理这一取舍。

冷却系统也应纳入稳定性分析。计算需求突然增加会产生热量,但冷却液回路、泵、换热器和冷水机组的响应速度各不相同。因此,电气与热控制必须在整个变化过程中协调工作。

这正是为什么对单个组件进行调试只能提供不完整的证据。UPS 可以通过出厂测试,发电机可以达到额定指标,冷却系统可以提供设计容量;但它们的组合行为仍可能在陌生的时序下失效。

ABB 提出了与之相关的同步调相机观点。这类旋转设备无需为常规工作负载供电,便可支撑电压、短路强度和系统惯性。其稳定性缺口分析将这类设备置于大型数据中心的并网接入点。

这些方法相互补充,而非直接替代。UPS 控制靠近计算负载运行,电池可以快速转移能量,同步调相机能够增强本地电网,发电机和公用事业则提供持续能源。

工程上的挑战在于协调它们。在未验证控制关系的情况下增加更多设备,系统复杂度的增长速度可能快于韧性的提升速度。

AI 工作负载带来新型电网风险

数据中心可以通过断开连接来保护自身,但若多座设施同时采取这一行动,反而可能破坏更大范围电力系统的稳定。

这是动态稳定性讨论中最重要的反转。单个站点看似合理的保护行为,在许多大型站点同时响应时可能变得危险。

数据中心历来被视为可靠负载。其用电量虽然很大,但通常足够可预测,公用事业公司可依据既有商业和工业假设进行建模。

AI 训练和推理使这一图景变得复杂。加速器利用率可能带来更陡峭的爬坡和更频繁的变化,其时序可能取决于软件调度、模型架构、网络以及服务器之间的同步。

公用事业公司关心的不只是年度总用电量。它们必须持续维持发电与需求之间的平衡。任一方向的突然变化都会影响系统频率和潮流。

一座切换到备用电源的数据中心,会作为负载从电网中消失。若多座设施在同一次电压扰动期间断开,电网可能几乎瞬间失去一大块需求。

一项 2026 年技术调查描述了一起 2024 年 7 月事件:一次输电故障之后,约 1,500 MW 负载消失。作者报告称,数据中心切换至备用系统是造成这一变化的重要原因。

这一例子表明,站点层面成功的切换仍可能带来系统层面的问题。设施保住了计算服务,而电网则必须应对发电与用电之间突然出现的不平衡。

这项同行评审的电网集成调查强调了电压和频率穿越行为。穿越是指在临时电网扰动期间,保持连接并在规定限制内运行。

公用事业公司越来越需要准确模型,以了解数据中心在这类事件中将如何表现。一座被建模为传统静态负载的设施,一旦涉及 UPS 控制、大型电池系统、备用发电和同步 AI 集群,其响应可能截然不同。

模型质量在并网研究中至关重要。工程师在接入大型负载前,利用这些研究考察故障、电压恢复、频率响应和保护协调。

如果模型遗漏了重要控制逻辑,研究可能会批准一项无法反映真实行为的接入。如果假设过于保守,流程也可能要求不必要的基础设施,或延误有用容量的接入。

这一挑战已引起区域可靠性组织关注。东南电力可靠性委员会于 2026 年 9 月举办的一场讨论强调了突然负载损失、快速需求波动和设施间切换。参与者呼吁改进模型,并采用更一致的并网实践。

这项计算负载综述表明,动态稳定性正超越设备营销范畴,成为电网规划和并网接入议题。

因此,运营商正面临来自两方面的压力:客户要求计算能力持续不中断,而公用事业公司则需要在扰动期间获得可预测的运行行为。仅针对其中一项义务进行优化的设计,可能会削弱另一项。

更理想的目标是协同韧性。数据中心应保护自身设备,在条件允许时保持并网,并避免向上游输出不必要的波动。

该机制取决于控制、储能与现实测试

动态稳定性是一种由协调响应形成的系统行为,而非某家供应商可以在设施建成后附加的功能。

第一层是工作负载可见性。运营商需要了解加速器集群何时改变功率状态、这些变化出现的频率,以及软件能否将其错峰安排。

并非所有 AI 工作负载的行为都相同。训练任务可能包含同步屏障,使大量设备的活动保持一致。推理需求可能随不可预测的用户流量变化,而批处理则可能提供更大的调度灵活性。

第二层是快速电气响应。UPS 变流器和电池可在旋转式发电设备跟上之前作出反应。其控制策略决定了多少波动会被本地吸收,以及多少会传递至上游基础设施。

第三层是持续供能。电池无法无限期覆盖每一次波动。在初始过渡后,发电机、公用电网供电、可再生能源发电及其他能源必须接管负载。

第四层是保护协调。断路器和继电器需要采用既能保护设备、又不会过度切除健康系统的设定。这些设定必须反映电力电子设备和大型计算负载的实际行为。

第五层是热连续性。液冷泵和控制阀需要在过渡期间保持供电。运营商还必须了解,在温度超过设备限值之前,冷却液容量可以吸收热量多久。

Vertiv 的负载模拟器通过重现快速电力需求变化,弥补了部分验证缺口。这可揭示 UPS 控制是否能平滑输入、发电机能否保持稳定,以及切换序列是否按设计运行。

实时工作负载测试仍然重要,因为模拟器依赖预设的负载曲线。若测试重现了错误的幅度或时序,可能会带来信心,却无法代表实际部署的系统。

最强的调试投运方案会结合多个层级。组件测试验证单个设备;集成系统测试检验各部分之间的相互作用;基于工作负载的场景则重现预期的加速器行为和可信的故障情况。

随后,历史运行数据应持续更新这些场景。随着模型、芯片、固件和调度器变化,昨日的负载曲线可能成为过时的替代指标。

Emerson 也曾提出类似观点,主张在太阳能发电、电池储能和数据中心需求之间建立统一的控制环境。其控制架构论点侧重于确定性的协调,而非彼此孤立的点状解决方案。

这一比较揭示了行业竞争的核心。一种路径是增加独立设备,并假定冗余本身就能带来安全;另一种则将控制、模型和验证视为安全系统的一部分。

任何一种路径单独采用都无法奏效。软件无法弥补物理容量不足;额外硬件也无法纠正每一种不稳定的控制交互。

运营商还需要为自动化设定边界。用于平滑功率的控制器必须为停电保留足够的电池电量;它必须遵守变流器限值,并避免掩盖持续恶化的上游状况。

人工运营人员需要可理解的状态信息和后备程序。无法解释或演练的自动化响应,可能会在情况偏离预设场景时延误恢复。

网络安全也属于同一讨论范畴。将工作负载遥测、UPS 控制、储能系统和电网接口连接起来,会扩大控制面。认证、网络分段、变更管理和手动覆盖机制必须与自动化同步发展。

因此,动态稳定性所要求的不仅是快速响应,更是受治理的响应——具备经过测试的限值,以及每项控制决策的明确责任归属。

现有证据仍不足以形成统一的 AI 就绪标准

行业普遍认同 AI 负载不同于传统负载,但尚未建立一项公开测试来证明设施能够安全地管理这些负载。

Vertiv 的主张描述了特定控制方案和测试设备。ABB 推广电网强度解决方案。Schneider Electric 强调故障穿越能力,而其他供应商则聚焦于电池、发电机或工作负载管理。

这些立场提供了有价值的工程选项,但它们也来自销售基础设施的公司,因此独立验证至关重要。

在客户中心成功演示,并不自动证明其能适用于每一种公用事业公司、发电机类型、电池化学体系、拓扑结构或 GPU 工作负载。现场条件可能改变结果。

AI 就绪数据中心的定义仍然尤其宽泛。它可以指机架密度、液冷、网络带宽、供电容量,或加速器硬件的可用性。

动态稳定性增加了另一项要求,但买方需要可衡量的验收标准。他们需要知道测试了哪些负载曲线、纳入了哪些故障序列,以及适用了哪些运行限值。

标准负载曲线将有助于比较系统,但标准化本身也带来风险。随着加速器架构和软件框架演进,实际工作负载也会发生变化。

更好的做法是将一小组通用压力场景与设施专属的运行轨迹结合。通用测试支持横向比较,本地曲线则保留相关性。

公用事业公司也需要透明的动态模型。这些模型应呈现欠压响应、频率保护、UPS 行为、电池限制和切换序列,同时不暴露不必要的客户数据。

模型验证必须在投运后持续进行。固件更新可能改变响应时间;电池状态、发电机配置或 IT 调度的变化,也可能改变设施行为。

当同一供应商同时提供模型、控制系统和性能主张时,独立工程审查尤为重要。这并不意味着该主张必然错误,但它会将假设集中在同一个组织中。

研究正开始填补这一缺口。一项 2026 年研究对由小型模块化反应堆和电池储能供电的并网数据中心进行了建模。该模拟考察了故障条件下的电气、计算和热行为。

这项动态稳定性研究发现,其建模的一体化系统改善了电压和频率表现。不过,模拟结果并不等同于现场验证,商业反应堆部署还会引入额外的不确定性。

更直接的证据将来自实际运营的站点。运营商应公布匿名化运行轨迹,展示负载爬坡、电网扰动、设备响应和恢复时序。

缺少此类证据,动态稳定性就有可能沦为又一个宽泛的营销标签。供应商都可以宣称具备自适应行为,却在不同假设下测试不同场景。

买方应直接提出问题。经验证的最大负载阶跃是多少?系统可以多频繁地重复这一过程?假定的电池荷电状态是什么?测试是否包含发电机同步和冷却连续性?

他们还应询问故障由什么引起。有价值的测试计划不仅展示一次成功演示,还应识别控制饱和、保护动作或恢复变得不可靠的边界。

这些边界决定了设计是否具备真正的运行裕度。当系统的过渡限值仍不清楚时,冗余设备带来的安心作用微乎其微。

三个信号将表明动态稳定性是否成为标准

下一阶段将由电网规则、可重复的调试投运数据,以及运营中 AI 设施内具备工作负载感知能力的控制来决定。

第一个信号是大型数据中心在并网要求中的定位。公用事业公司和可靠性机构已经更加关注故障穿越行为和突然失负荷。

更详细的要求将强化动态稳定性的价值。它们可能要求经过验证的模型、明确的电压和频率响应,或披露扰动期间的切换行为。

如果要求仍然碎片化,供应商将继续围绕当地公用事业惯例开发各自的解决方案。这会减缓比较进程,并增加在多个市场建设的运营商的工程工作量。

第二个信号是集成测试能否变得可重复。Vertiv 的模拟器是专为工作负载形态的电力测试设计的工具之一。其他供应商和独立实验室也需要可比的方法。

可重复的测试应结合快速负载爬坡、持续运行时段、电网扰动和组件故障。它还应记录电池使用情况、发电机响应、电压、频率和恢复时间。

发布测试结果与测试本身同样重要。买方需要足够的细节,才能区分受控演示和具有代表性的运行场景。

现场结果将强化这样一种主张:Vertiv AI 负载稳定性能够同时保护设施设备和上游基础设施。有关电池劣化、控制冲突或切换失败的证据,则会缩小这一主张的适用范围。

第三个信号是工作负载调度器与设施控制之间的集成。多数现有方法是在电力需求开始变化后才作出响应。协调机制可以提前向电力系统发出通知。

调度器可以错开非紧急任务、放缓一次过渡,或在集群之间转移工作。这些行动会将计算视作一种可灵活调节的负载,而非不可控的需求来源。

这种方法带来了商业和运营层面的问题。云客户期待在承诺的时间获得计算资源。运营商必须决定哪些工作负载可以转移而不违反性能承诺。

它还要求软件与运营技术之间建立可信的信息流。数据中心不应让每个应用程序都能直接影响关键电气控制。

尽管如此,具备工作负载感知能力的协调提供了一条仅靠硬件无法实现的路径。储能可以平滑过渡,但调度有时可以避免过渡变得严重。

对基础设施团队而言,实际的应对方式是保留证据和运行背景。电力轨迹、调试投运报告、固件变更和事故复盘应能在各工程团队间检索。

结构化的工程知识库可帮助团队将电气行为与配置变更及工作负载事件关联起来。当一次暂态只持续几毫秒、但其根本原因横跨多个系统时,这种关联尤为有价值。

更广泛的问题已不再是 AI 数据中心是否需要冗余——它们确实需要。问题在于,运营商能否证明其冗余资产在关键过渡期间能像一个受控系统般协同行动。

Vertiv、ABB、Schneider Electric 和电网研究人员正从不同立场汇聚到这一问题上。他们偏好的设备各不相同,但其诊断正日益趋同。

AI 基础设施已将韧性变为一项持续要求。它必须贯穿日常计算、负载快速变化、电网故障以及整个恢复过程。

运营商如今应在接受“AI 就绪”这一标签前,要求提供动态模型、结合工作负载的调试测试,以及公开的响应边界。哪座规划中的设施能够展示:当数千个加速器同时改变状态时,其整套供电链路将如何运行?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page