NVIDIA AI 工厂生产将电力限制转化为调度问题
NVIDIA 已将 AI 工厂生产的关注点从更快的芯片扩展出去,声称在设施电力预算不变的情况下实现了高出 24% 的 token 吞吐量。其新主张很简单,却影响深远:电力应成为一种受管理的计算资源,而非每台服务器各自逼近的固定上限。
这一转变连接了数据中心运营商通常分开处理的两个问题。NVIDIA DSX MaxLPS 在 GPU 集群内部重新分配电力,而 DSX Flex 则响应设施外部的条件。二者共同将兆瓦转化为可由软件围绕工作负载、服务优先级和公用事业请求进行调度的资源。
如今的冲突已不再是 NVIDIA 与另一家芯片制造商之间的竞争,而是灵活计算与长期以来将数据中心视为恒定、不可协商电力负载的做法之间的对立。如果这一模式能超越早期部署,公用事业公司将获得一种可控资源,运营商则可从既有接入容量中提取更多可带来收入的工作负载。
NVIDIA AI 工厂生产获得新的效率单位
重要变化在于,NVIDIA 希望基础设施采购方衡量的是每兆瓦可产生的有效 token,而不只是 GPU 速度或设施效率。
NVIDIA 将 DSX 推出为一套面向完整 AI 设施的参考设计、仿真工具、运营软件和电力控制方案。该公司将 AI 工厂描述为把电力和数据转化为 token、模型及其他计算产出的基础设施。
这种表述听起来可能带有宣传意味,但它指出了一项现实限制。即使建筑内还有空间容纳更多服务器,数据中心也无法超过其电网接入所能提供的电力。新增发电和输电设施可能需要多年建设。
NVIDIA DSX MaxLPS 处理的是设施内部的这一限制。该软件监控 GPU、服务器和机架之间的功耗,随后根据每项工作负载的行为重新分配未使用的电力余量。
传统配置假定每台服务器都可能同时达到其设定的最大功率。因此,运营商会在已安装设备与设施电力上限之间保留安全余量。这能保障可靠性,但也意味着部分容量在正常运行期间始终未被利用。
训练任务、推理服务、网络设备和冷却系统也会形成不同的需求模式。它们的峰值并不总会同时出现。静态限制无法充分利用这些差异。
动态分配试图收回这些闲置余量。运行功率低于上限的节点可以将容量让给需要更多电力的其他节点。工厂仍遵守整体电力边界,但更多设备能够执行有用的工作。
Lambda 在一个包含 19 个 NVIDIA HGX B200 节点的五机架集群上测试了这一方法。根据 DSX results,Lambda 以 85% 的功率策略运行这些节点。
对比方案是在同一设施预算内,让 16 个节点以完整配置功率运行。Lambda 报告称,19 节点配置将集群吞吐量从约每秒 400 万 token 提升至约每秒 500 万 token。
两家公司表示,这相当于 token 吞吐量提升 24%,每瓦性能提升 23%。这一结果并不意味着每个集群都能获得相同增益。工作负载构成、利用率、网络和散热条件都会影响可用余量。
不过,这项测试改变了采购讨论的重点。运营商历来会比较加速器性能、互连带宽、内存和总成本。感知电力的调度增加了另一个问题:在固定电力接入容量之后,有多少已安装计算能力能够高效运行?
这个问题很重要,因为未使用的 GPU 仍会带来资本成本和折旧成本。一座设施可能拥有足够的加速器来承接额外需求,却没有获准消耗更多电力。因此,回收内部余量可以在无需新增变电站的情况下创造商业容量。
NVIDIA 表示,在适合的 Vera Rubin NVL72 部署中,MaxLPS 最多可支持增加 40% 的 GPU 容量。该数字是一项预测,而非经验证的全机群结果。它取决于 MaxLPS 能否与更广泛的数据中心电力规划协同工作。
该公司还计划在未来的 DSX 参考设计中纳入 800 伏直流架构。NVIDIA 预计,对于将在 2027 年推出的 Vera Rubin 系统,相较于较低电压的配电方案,这将带来 3% 至 5% 的端到端效率提升。
更高电压的配电可减少转换环节,并降低输送特定功率所需的电流。但它也带来了新的设备、运营和安全要求。因此,软件优化与电气重新设计解决的是同一限制的不同层面。
眼前的证据来自当下的集群管理。更大的愿景则是打造一座计算、网络、冷却和电气系统如同一台协调机器般响应的设施。
这正是 NVIDIA “每兆瓦 token”主张的基础。然而,内部效率只解决了一半问题。公用事业公司同样需要设施在更广泛电网接近极限时改变自身行为。
一座四兆瓦工厂成为可调度的电网资源
NVIDIA 的 Santa Clara 测试之所以重要,是因为该设施在优先级推理持续运行的同时自动降低了需求。
在八月一个炎热的傍晚,Silicon Valley Power 向 NVIDIA 位于加利福尼亚州 Santa Clara 的 Eos AI 工厂发出了需求响应信号。随着太阳落山,整个公用事业服务区域内的空调需求正在上升。
Emerald AI 的 Conductor 平台接收该信号后,应用了预先设定的工作负载层级。较低优先级的计算任务被降速或迁移,而较高优先级服务继续运行。在无人操作干预的情况下,设施需求从四兆瓦降至三兆瓦。
这一兆瓦的削减量相当于初始负载的 25%。NVIDIA 还将该事件描述为响应能力的一部分,即在一分钟内实现最高 40% 的削减。两项数据反映的是不同测量方式,因此不应将其视为可互换的数据。
据 NVIDIA 称,自初始事件以来,Silicon Valley Power 已向该设施发送超过 200 次信号。该公司表示,工厂每次都成功作出响应。每次事件的独立运营数据尚未公布。
该公用事业公司于 2026 年 4 月宣布了 Santa Clara pilot。其既定目标是测试灵活数据中心能否支持可靠性,并改善既有基础设施的利用。
Silicon Valley Power 是一家服务 Santa Clara 的市属公用事业公司。它所在的市场数据中心高度集中,新的计算项目正竞争有限的输电和配电容量。
该项目为公用事业公司与大型客户之间提供了不同的关系模式。公用事业公司不再假定设施始终需要其最大接入容量,而可以在受限时段请求其暂时减少用电。
需求响应是指当电网状况、电价或可靠性需求发生变化时调整用电量的做法。工业场所已参与此类项目多年。将其应用于 AI,需要与计算服务等级进行更紧密的协调。
铝冶炼厂或冷藏仓库管理的是具有已知限制的物理流程。AI 工厂管理的则是紧急程度、检查点需求和客户承诺各不相同的任务。将这些任务视为可互换,可能会导致服务目标未达成,或训练进度丢失。
Conductor 将灵活工作与优先级工作分开。批量推理、评估运行和部分训练流程可以容忍延迟。交互式推理和严格排期的任务则需要更高程度的保护。
该平台必须识别哪些工作负载可以让出资源,计算所需削减量,并维持场站的总功率目标。电网事件结束后,它还需要撤销这些调整。
这正是电力管理转变为调度问题的地方。减少一兆瓦并不只是一项电力指令,而是一系列关于哪些任务应减速、暂停、迁移或继续运行的计算决策。
NVIDIA 对当前部署的身份保持谨慎。Eos 装置采用 Emerald AI Conductor,尚不是专用的 DSX Flex 装置。它是对 DSX Flex 意图推广行为模式的早期实现。
这一区别很重要。该试点支持这一技术概念,但并不能证明 DSX Flex 本身已经在同等规模上完成商业部署。
此前的测试提供了更多证据。2025 年一项 Phoenix field trial 涉及一个拥有 256 块 GPU 的商业数据中心集群。研究人员报告称,在维持既定服务质量保障的同时,实现了持续三小时的 25% 功率削减。
NVIDIA 和 Emerald AI 表示,它们已在横跨两大洲的商业数据中心完成五次现场演示。Silicon Valley Power 的项目推动该模式从演示走向可重复的公用事业调度。
更广泛的目标并不是让数据中心消耗很少的电力。这些设施仍将是大型负载。目标是让部分需求变得可预测、可测量且可暂时调整。
这一能力为公用事业公司提供了具有运营价值的资源。它也为运营商提供了获得更大或更快接入容量的可能路径。只有双方都能验证承诺的削减量,这一交易才能成立。
真正的对手是始终在线的负载模式
灵活计算挑战了这样一种假设:每座 AI 设施都必须在每一个小时为其最大电网需求预留容量。
公用事业公司围绕峰值进行网络规划,因为设备必须在最严苛的条件下发挥作用。然而,这些峰值只占一年中的有限时段。在限制较少的时段,输电线路和变电站可能存在未使用容量。
大型数据中心使这种规划更加复杂。一座拟建设施可能申请数百兆瓦容量,却几乎无法提供其实际负载曲线的历史证据。公用事业公司必须决定现有设备能否在不降低可靠性的情况下为其供电。
最稳妥的答案往往是经历漫长的并网流程,然后建设新的基础设施。这种做法限制了风险,却与 AI 公司的开发周期发生冲突。加速器和模型市场的发展速度快于输电建设。
NVIDIA 和 Emerald AI 提出了一种有条件的替代方案:设施获得可用容量的接入权,但同意在公用事业公司发出符合条件的指令时降低用电量。
这一理念类似于可中断工业电价,但软件使响应更具选择性。工厂无需关闭,而是可以保护紧急任务并减少价值较低的工作。
这使工作负载优先级成为并网协议的一部分。公用事业公司关注场站的总体响应,而运营商决定如何在数千个加速器之间实现这一响应。
NVIDIA 在 2026 年 3 月的能源合作中纳入了 AES、Constellation、Invenergy、NextEra Energy、Nscale Energy & Power 和 Vistra。该组织正在探索灵活设施、现场发电、电池储能以及更快的电网接入方式。
这些参与者代表了电力系统中的不同环节。他们的参与表明,灵活性正超越狭义的技术实验。开发商、发电企业和公用事业公司都在评估它可能如何影响项目设计和商业协议。
这种方法也与孤立的表后供电模式竞争。一些数据中心开发商计划建设专用发电设施,因为电网接入无法足够快地到位。燃气轮机、电池和其他现场资源可以填补这一延迟。
本地发电可能加快项目进度,但永久孤立也存在缺点。当计算需求下降时,设备可能处于闲置或低利用状态。周边电网也无法在自身压力时期依赖这些资源。
NVIDIA 倾向的设计是让计算与发电和储能协同。设施可以降低工作负载需求、释放电池电量,或调整现场发电,以满足电网提出的目标。
这并不能消除对新建发电厂或输电设施的需求。灵活需求主要在受限时段发挥作用。持续的年度增长仍需要额外的能源生产和输送基础设施。
NVIDIA 引用的 Duke University 分析估计,有限的负荷灵活性可让现有系统承载大量新增需求。这类建模取决于输电条件、地理位置和削减负荷的持续时间。
全国性的容量估算不应直接套用于某一家公用事业公司。电力瓶颈具有本地性。发电不足地区面临的限制,与变电站过载社区所面临的限制并不相同。
不过,NVIDIA 的定位揭示了其商业压力。其客户无法部署缺少电力供应的加速器。当 GPU 在并网队列中等待时,速度更快的 GPU 并不会创造收入。
因此,该公司有动力将其影响力延伸至服务器机架之外。DSX 将设施设计、工作负载调度和电力控制纳入 NVIDIA 计算平台的一部分。
这一战略也让 NVIDIA 更接近公用事业运营。电网运营商采用严格标准,因为响应失效可能影响其他客户。若没有遥测数据、测试和可执行的义务,软件供应商的性能声明并不足够。
新近重启的 AI Energy Management Alliance 旨在构建这一政策层。其 20 名参与者包括 NVIDIA、Google、Emerald AI、Anthropic、National Grid、AES、Constellation、NRG 和 RWE。
Google 提供了重要的历史参照。它已经根据电力条件调整部分数据中心工作负载。该公司的参与表明,灵活计算并非 NVIDIA 硬件独有的功能。
据有关灵活性联盟的报道,Google 已通过覆盖美国各地的公用事业协议承诺提供 1 吉瓦可削减需求。这一规模提高了其他运营商所面临的竞争标准。
核心竞争仍不止于 Google 与 NVIDIA 之间的较量。这是自适应设施与“大型数字负荷无法与电网协商”这一假设之间的竞争。
每兆瓦更多 Token 仍需要艰难取舍
电力灵活性通过确定工作优先级来创造容量,这意味着必须有人决定哪些计算任务可以等待。
“无需丢弃任务”这一说法可能掩盖了实际的取舍。优先级较低的任务可能以更慢速度继续运行、暂停,或稍后恢复。即使任务未被取消,其完成时间也可能改变。
这一结果对某些工作而言可以接受。离线推理、数据预处理、模型评估和具备容错能力的训练可提供调度灵活性。实时应用通常具有严格的延迟要求。
运营商需要在电网事件开始前完成准确分类。调度器无法在收到公用事业命令后即兴确定优先级。客户合同、截止时间和技术依赖关系必须已被纳入系统。
混合工作负载让这件事更加困难。一项训练任务可能依赖大量 GPU 之间的同步通信。不均衡地降低功率,可能拖慢整个任务,或让昂贵的资源处于等待状态。
检查点机制可以保存进度,但写入模型状态需要时间和存储带宽。恢复大型任务也会产生开销。短暂的电网事件可能在迁移或创建检查点产生收益之前就已结束。
推理则带来不同的问题。面向用户的需求可能与电力需求同时上升。炎热的傍晚可能同时带来高强度制冷负荷和消费者活动高峰。
因此,调度器必须在其他地方寻找可削减空间,同时保留对延迟敏感的容量。当设施的大部分服务于交互式流量时,这会更加困难。
NVIDIA 的 Lambda 测试展示了在一种受控配置下更好的集群利用率。它并未证明同样的收益适用于每种模型架构、租户组合或网络设计。
24% 的吞吐量结果比较的是:采用 85% 功率策略的 19 个节点,与满功率运行的 16 个节点。这是一个有价值的设施功率预算比较。但它并不证明限制任何现有集群的功率都会自动提高吞吐量。
每瓦性能也可能与绝对性能相冲突。让更多节点低于最大功率运行,可能提高总体吞吐量,但单个请求所需时间可能更长。运营商必须决定哪一种衡量方式能够支持其服务义务。
Token 的定义也带来另一项限制。不同模型、语言和工作负载中的 Token 并不相同。小型模型的一百万 Token,与大型模型的一百万 Token 并不代表相同的经济或计算价值。
每兆瓦 Token 数最适合作为一致工作负载的内部指标。在比较无关服务时,它的信息价值会降低。收入、延迟、模型质量和已完成任务仍然重要。
公用事业验证带来了另一项挑战。电网需要一个稳定的基准线,显示设施在未接到调度命令时本会消耗多少电力。否则,运营商可能因本来就会发生的负荷减少而获得奖励。
设施还必须证明,需求并未在同一受限时段简单地转移至另一处附近站点。地理迁移可能帮助一家公用事业公司,却会加剧另一市场的压力。
明确的计量规则将决定灵活性是否能够换来更快的接入或财务补偿。AI Energy Management Alliance 表示,削减应当可验证且可执行。监管机构仍需界定这些术语。
社区接受度构成另一项考验。灵活设施仍可能增加总用电量、用水量、建设活动和本地基础设施需求。
公众担忧已相当显著。Axios 引述的 2026 年 9 月民调发现,84% 的美国人担心数据中心会影响当地电价。跨党派的大多数人支持让开发商承担必要电网升级的费用。
需求响应可能减少部分高峰期投资,但并不保证电价更低。结果取决于费率、基础设施所有权、调度频率以及成本如何分配。
因此,NVIDIA 及其合作伙伴不应将一次成功的设施响应视为广泛可负担性的证明。Santa Clara 事件表明,自动化削减可以奏效。但它们并未解决谁能在财务上受益的问题。
同样的谨慎也适用于 NVIDIA 对未来 GPU 容量最高提升 40% 的预测。“最高”描述的是有利情形。实际部署需要在多种工作负载模式下提供透明结果。
技术可靠性还必须经受非常规事件的考验。在常规测试中响应完美的系统,仍必须能在通信故障、工作负载突然激增和极端电网状况下正常运行。
网络安全也成为风险的一部分。连接公用事业信号与工作负载控制的平台,处于关键基础设施和高价值计算资产之间。身份验证和故障处理必须防止恶意或意外命令。
最安全的设计需要明确的回退行为。丢失电网信号不应让设施处于不安全的功率状态。调度器故障不应让优先服务遭受不受控制的限速。
这些担忧并未否定灵活 AI 基础设施。它们界定了一个前景可期的生产试点与可靠市场标准之间的距离。
DSX 将 NVIDIA 的控制范围扩展至 GPU 之外
NVIDIA 正将系统效率转化为一种平台战略,使其覆盖从模型工作负载到公用事业调度的整个链条。
DSX 产品组合覆盖 AI 工厂生命周期的多个阶段。DSX Sim 在建设前为拟议设计建模。参考设计规定了经过验证的计算、网络、存储、电力和冷却组合。
DSX OS 为生命周期管理、系统健康状态、运行时一致性和韧性提供模块化操作层。MaxLPS 在集群内分配可用功率。DSX Flex 将设施行为与外部电网条件连接起来。
每个部分都针对不同的生产力损失来源。模拟可在资本投入前识别设计瓶颈。运行时管理可缩短恢复时间。动态电力控制则可以启用原本会因静态规划而闲置的设备。
这一组合战略让 NVIDIA 参与到过去由不同供应商分别处理的决策中。随着机架级密度提升,芯片选择、网络、冷却、任务调度和电气设计正越来越相互影响。
据 NVIDIA 表示,GB200 NVL72 机架通过其直液冷系统传导约 120 千瓦的热量。移除这些热量与向处理器供电密不可分。
未来的 Vera Rubin NVL72 系统将进一步提升协同设计的重要性。更高密度会改变母线槽、开关设备、冷却回路和建筑布局。运营商无法将服务器视为一个独立的盒子。
这支持了 NVIDIA 的核心机制:优化整个工厂,而不是分别最大化每个组件。若一块 GPU 以自身峰值运行,却触发其他地方的电力限制,可能反而造成更差的设施整体结果。
这一战略也保护 NVIDIA 免受电力可用性限制加速器销售的市场影响。能够让一条接入连接支撑更多 GPU 的软件,将扩大其硬件的可用市场。
云服务提供商面临类似激励。提供商从已完成的计算工作中获得收入,而不是从标称 GPU 容量中获得收入。即使新数据中心尚未启用,更高的集群利用率也能改善经济效益。
公用事业公司获得的是另一种收益。可调度的数据中心可以成为一种规划选项,而非无法控制的预测负荷。这并不使其等同于发电厂,但它能在关键时期降低需求。
能源企业可将灵活性与新增发电相结合。混合项目可能在并网过程中使用现场资源,随后再与更广泛的电网进行协调。
这一架构促使竞争性基础设施平台提供相当的控制能力。随着电力容量趋紧,基于 AMD 的集群、定制加速器和独立编排系统都需要提出可信的电力管理方案。
开放式调度系统已经能够管理工作负载优先级和资源限制。NVIDIA 的优势在于将这些控制能力与详细的加速器遥测数据及其参考架构相结合。
其劣势在于可能导致平台集中化。运营商可能更倾向于采用可跨异构硬件、多云环境和多种调度系统运行的控制方案。电网灵活性不能依赖于每个设施都使用同一家加速器供应商。
Emerald AI 的角色在一定程度上回应了这一担忧。Conductor 位于公用事业请求与计算运营之间。然而,公开案例重点展示 NVIDIA 系统,因而更广泛的互操作性仍是一个重要问题。
Google 参与该联盟也拓宽了这一领域。它带来了定制加速器、全球基础设施和碳感知计算方面的经验。一个通用的公用事业框架将需要兼容多种技术实现。
因此,胜出的标准可能是在设施内部结合特定供应商的优化,而在电网边界采用供应商中立的验证机制。公用事业公司需要的是可靠的兆瓦级响应,而不是获取每一项内部调度细节。
对企业 AI 买家而言,影响将以间接方式显现。云容量、服务可用性和模型成本,都取决于服务商如何高效利用受限设施。
集群吞吐量提升 24% 并不会机械地转化为客户获得 24% 的收益。服务商可能利用这些增益服务更多客户、维持利润率,或缩短部署延迟。
开发者应转而关注服务级表现。灵活基础设施的成功,体现在它能够改变用电需求,却不会造成明显的延迟峰值、任务中断或不可预测的可用性问题。
对于评估服务商的技术团队而言,电力管理加入了一长串运营问题。工作负载可移植性、检查点支持、区域容量、队列行为和延迟保障,都会影响其面临限电的风险。
新的竞争单位不再只是最快的加速器,而是在稀缺且日益附带条件的电力供应下,产出的实用且可靠的计算能力。
三个信号将揭示灵活 AI 工厂能否规模化
下一个考验是,DSX 能否从精选示范项目走向可重复部署、公用事业规则和可衡量的客户成果。
第一个信号是 NVIDIA 计划在弗吉尼亚州马纳萨斯建设的 96 兆瓦 AI Factory Research Center。该项目涉及 Digital Realty、Emerald AI、Electric Power Research Institute 和 PJM Interconnection。
NVIDIA 将其描述为首个专用的商业规模 DSX Flex 部署项目。预计该项目将使用 Vera Rubin 基础设施,并建立在合作伙伴此前示范成果的基础上。
其重要性源于规模和持续时间。与小型测试集群相比,一座 96 兆瓦的设施拥有更多样化的工作负载、设备和运行状态。反复调度将揭示其性能能否保持可预测性。
读者应关注实测响应时间、削减深度、恢复行为和服务级影响。公开的基准数据将比又一次成功示范公告更重要。
如果马纳萨斯设施能够在真实运行条件下实现经过验证的削减,NVIDIA 的论点将获得相当有力的支持。若出现延迟或公开数据有限,该模式仍将依赖合作伙伴的说法。
第二个信号是监管采纳。Silicon Valley Power 的灵活并网方式,让参与设施以可调度的需求为交换,获得更多电网接入能力。
其他公用事业公司和区域输电组织必须决定是否提供类似安排。相关规则需要包括资格测试、基准方法、处罚措施、遥测要求以及限电上限。
联邦监管机构已要求区域电网运营商研究连接大型灵活负载的新方法。这创造了机会,但并不保证会形成一条全国性的快速通道。
各州和电网区域的电力市场存在差异。适合圣克拉拉的结构,未必适用于 PJM、ERCOT 或其他地区的垂直一体化公用事业公司。
如果监管机构制定可执行的灵活负载电价机制,商业激励将会增强。运营商可用有限的调度自由度交换更快获得电力的机会。
如果规则仍然是定制化的,部署将只能逐家公用事业公司推进。这会提高交易成本,并限制 DSX Flex 的可服务市场规模。
第三个信号是独立的工作负载证据。NVIDIA 和 Lambda 已提供有价值的早期数据,但买家需要看到不同模型和运行环境下的结果。
未来披露应区分训练、批量推理和交互式推理,并同时报告整体效率和应用层延迟。
结果还应展示公用事业事件的频率和持续时间。在低频削减期间表现良好的系统,在反复或长期约束下的行为可能不同。
独立评估将有助于厘清,每兆瓦生成更多 token 是否代表持久的生产力,还是仅仅反映了有利的基准配置。它也会揭示几乎不具备灵活性的工作负载。
这三个信号相互关联。只有当设施能够提供可靠响应时,公用事业公司才会奖励灵活性。只有当客户工作负载持续受到保护时,运营商才会参与。
NVIDIA AI 工厂生产如今将电力视为一种可由软件在时间、设备和业务优先级之间分配的变量。这将电力从背景性投入重新定义为计算架构的主动组成部分。
圣克拉拉部署表明,一座多兆瓦 AI 设施可以自动响应公用事业指令。Lambda 的集群表明,动态分配能够在固定电力预算内提高吞吐量。
这两项成果都不足以证明行业范围采纳已成定局。商业规模、中立验证和明确的公用事业规则仍未得到解决。
对基础设施团队而言,实际问题已不再是电力限制是否影响 AI 部署——它们已经在产生影响。真正的决策是,工作负载能否变得足够灵活,从而在不削弱服务保障的前提下获得更多容量。
关注马纳萨斯,关注并网规则,也关注应用层性能。这些结果将决定 NVIDIA 是创造了新的运营标准,还是仅优化了一组范围有限的早期部署。



