top of page

SK hynix AI 基础设施触及物理极限:电力与散热

4小时前
讀畢需時 14 分鐘

SK hynix 已将其 AI 基础设施分析转向一项仅靠更快处理器无法解决的约束:高密度计算系统需要充足的电力和散热能力才能运行。

该公司对 AI 数据中心的最新研究认为,如今的性能取决于一个集成系统。计算、内存、存储、网络、供电和热管理必须协同运行。任何一个薄弱环节都可能导致昂贵的加速器处于等待、降频或无法使用的状态。

这一观点改变了 AI 基础设施竞赛的重心。Nvidia、超大规模云服务商、内存供应商、公用事业公司和散热厂商不再各自解决孤立的问题。它们都围绕同一个物理极限进行建设:进入服务器的每一瓦电力最终都会转化为设施必须排出的热量。

这一转变并未降低处理器或高带宽内存的重要性,而是让它们可发挥的性能取决于芯片封装之外的基础设施。如果一个站点无法为机架供电、让冷却液流经设备,或将设施接入电网,更快的加速器也价值有限。

SK hynix 的 AI 基础设施分析超越芯片本身

SK hynix 正将电力和散热视为性能组件,而非后台设施服务。

该公司的基础设施分析延续了其关于 AI 系统设计的更广泛观点。单个组件固然重要,但它们的规格并不能保证应用层面的性能。

一个 AI 训练集群会反复传输模型参数、激活值、检查点和训练数据。推理系统则必须检索上下文,将其通过内存传输,协调加速器,并在可接受的延迟范围内返回答案。

每个阶段都消耗能源。每次传输也都会产生热量,包括那些并不直接参与用户所请求计算的传输。

这形成了一条依赖链。加速器需要来自内存的数据。内存和存储需要高吞吐量连接。网络交换机必须协调数千台设备。电力系统则必须不间断地为所有设备供电。

随后,冷却设备必须排出由此产生的热量。如果无法做到,硬件会降低运行频率,以维持在安全温度范围内。这一被称为热节流的过程能保护组件,但会降低可用性能。

同样的问题也存在于设施规模层面。数据中心运营商可以采购处理器,却不具备部署这些处理器所需的电力容量。运营商也可能预留了公用事业电力,却缺少将电力输送至高密度机架所需的内部配电设备。

变压器、开关设备、不间断电源、母线槽和备用系统都会成为部署进度的一部分。它们的规格决定了一栋建筑能够支持多少计算容量。

热量传导路径同样重要。热量必须从硅芯片经由封装材料、冷板或散热器、冷却液回路、热交换器,以及设施最终的排热系统传递出去。

任何一个薄弱环节都会抬高温度或限制机架密度。运营商可能不得不将设备分散到更多机房空间,降低处理器功率,或在升级建筑期间推迟部署。

SK hynix 在这一转变中拥有直接利益。其高带宽内存产品位于高密度计算封装中的加速器旁。HBM 通过堆叠内存芯片,并借助短距离垂直通道进行连接,从而提升内存带宽。

这种架构有助于更快地向处理器提供数据。然而,它也将组件和热量集中在更小的区域内。

2026 年 5 月,SK hynix 宣布了面向未来 HBM 产品的一种集成散热方案。该公司称,其iHBM 热设计在测试中将封装热阻降低了 30%。

这一数字仍属于公司主张,商业化结果将取决于最终产品和系统设计。尽管如此,该公告表明,为何内存供应商如今会将散热与带宽和容量一并讨论。

热性能正在成为产品架构的一部分。它不能再完全交由服务器制造商或设施运营商处理。

AI 数据中心的电力需求增长快于电网

核心电力问题并不只是总能耗,而是在所需的地点和时间输送大量电力。

国际能源署估计,数据中心在 2024 年消耗了约 415 太瓦时电力,约占全球用电量的 1.5%。

其基准情景预测,到 2030 年,数据中心的用电量将达到约 945 太瓦时。这将使该行业的用电量占全球总用电量略低于 3%。

国际能源署预计,主要与 AI 应用相关的加速服务器用电量,到 2030 年将以约 30% 的年增长率上升。这类服务器将占全球数据中心用电量预计净增量的近一半。

这些数字意义重大,但其地理分布带来了更尖锐的运营挑战。数据中心将负载集中在特定的公用事业服务区、变电站和输电区域内。

电动汽车车队将需求分散到众多家庭和充电地点。而一个 AI 园区则可能通过少量电网连接申请数百兆瓦的电力。

国际能源署的能源需求展望指出,一座数据中心可在两到三年内投入运营。大型能源基础设施通常需要更长的规划和建设周期。

这种时间错配让公用事业公司和开发商承受压力。科技公司希望在需求依然强劲时获得计算容量。公用事业公司则必须研究电网影响、采购变压器、建设变电站,有时还需扩大发电或输电能力。

在电力到达服务器之前,规划中的园区并不构成可用的 AI 容量。已宣布容量、已签约容量和已通电容量是不同的衡量指标。

美国体现了这种不确定性的规模。美国能源部 2024 年的一份报告估计,数据中心在 2023 年使用了约占全国用电量 4.4% 的电力。

该报告预测,到 2028 年,其占比可能达到 6.7% 至 12%。这一范围异常宽泛,因为 AI 应用、硬件效率、利用率和建设进度仍然难以预测。

这项美国能源估计并不意味着每座拟建设施都会获得接入。它说明不同的部署情景会带来截然不同的电网结果。

因此,电力可得性会影响 AI 系统的建设地点。训练工作负载有时可以迁往电力充足的地区,因为它们并不总是需要紧邻终端用户。

生产环境中的推理则灵活性较低。支持工厂、医院、金融系统或交互式应用的服务,可能具有延迟、韧性和数据驻留要求。

企业必须在这些要求与当地电网容量之间取得平衡。一个拥有用户、光纤连接和合适土地的地区,如果电力无法按时到位,仍可能是不佳的部署地点。

这种压力正在改变采购方式。科技公司正签署长期可再生能源合同,支持核电重启,投资先进地热项目,并考虑现场发电。

这些措施可以增加供应,但无法消除发电机与服务器之间所需的基础设施。输电线路、变电站、变压器和内部电力系统仍不可或缺。

清洁发电也不会自动在某一特定园区提供持续稳定的电力。当风电和太阳能输出发生变化时,运营商仍需要电网平衡、储能、稳定电源或其他资源。

结果是,AI 性能的定义变得更加复杂。基准测试可以说明处理器完成某项工作负载的速度,却无法保证运营商能在目标地点为数千颗这类处理器供电。

120 千瓦机架改变了散热方程

机架级功率密度正迫使 AI 数据中心以液冷辅助的热设计取代仅依赖空气散热的假设。

传统数据中心将计算设备分布在多个机架中,可通过让经过调节的空气流经服务器风扇和机房级系统来散热。这种方法对许多企业和云工作负载仍然实用。

高密度加速器系统会产生不同的热特征。它们在每个机架中部署更多计算设备、内存、网络和电力硬件。

Nvidia 列出的 GB200 NVL72 系统每个机架的近似功耗为 120 千瓦。该机架集成了 72 块 Blackwell GPU、Grace CPU 和 NVLink 交换设备。

相比之下,许多传统企业机架的功率密度仅为这一水平的一小部分。具体差异会因设施和工作负载而有很大不同,因此并不存在适用于所有场景的单一传统机架数值。

重要的变化在于架构层面。一个 120 千瓦机架会将热量集中在狭小的占地空间内,并需要为同等负载设计的供电路径。

Nvidia 为 GB200 NVL72 采用了混合系统。其文档称,该系统约 85% 使用液冷,15% 使用风冷。

该公司的机架级散热设计将液体输送至连接主要发热组件的冷板。与机房空气相比,冷却液能在更接近热源的位置吸收热量。

直连芯片液冷并不会将整台服务器浸入液体中。它让冷却液在密封冷板中循环,这些冷板与处理器、内存邻近组件或其他高温设备形成热接触。

冷却液分配单元在 IT 设备回路和设施水回路之间传递热量。泵、歧管、传感器、控制装置和热交换器维持流量和温度。

液体单位体积可携带的热量高于空气。因此,它适用于仅依靠风扇会需要过大气流、空间或电力的机架。

然而,液冷并非风冷的通用替代方案。服务器中仍有需要气流的组件,设施也必须将收集到的热量排出建筑物。

运营商还会面临新的工程要求。他们必须监测冷却液化学性质、压力、流量、连接器完整性、冷凝风险和泄漏检测。

维护流程会变得更复杂。技术人员需要接受在高价值电子设备附近处理流体系统的培训。运营商必须决定如何隔离机架、更换托盘或维护泵,而不影响集群运行。

冷却系统还必须与计算架构匹配。为某一种处理器封装设计的冷板,无法自动支持未来的每一种封装。

不同硬件代际之间,供液温度和流量可能发生变化。设施规划人员必须避免建成一个在下一代机架到来时便会过时的热管理系统。

改造现有数据中心则带来了另一项挑战。较老的建筑可能拥有足够的总供电能力,却缺少高密度液冷系统所需的管道、地板承重能力、机架尺寸或散热能力。

运营商可以将加速器服务器分布到更多机架中,但这会增加线缆长度和占地需求。它还可能使高速网络部署更复杂,因为物理距离会影响延迟和信号完整性。

他们可以降低处理器功耗,但这会牺牲性能。也可以安装后门式热交换器或封闭式风冷系统,不过随着密度上升,这些方案同样会面临限制。

新建数据中心拥有更大的灵活性。设计人员可以从一开始就围绕预期机架负载协调电力和热管理系统。

但这并不能消除不确定性。今天设计的建筑必须支持数年后交付的硬件,而处理器功耗、冷却接口和集群架构仍在持续变化。

功耗与性能成为新的基础设施权衡

竞争不再是最高芯片性能与较慢芯片之间的较量,而是理论性能与可部署性能之间的较量。

硬件供应商可以通过增加晶体管、内存带宽和更快的互连来提升性能。这些改进往往会提高封装复杂度和系统功耗,即便每瓦性能有所改善也是如此。

每瓦性能衡量的是系统每消耗一单位能源所完成的计算工作量。它至关重要,但无法告诉运营商总需求是否会下降。

更高效的硬件能够降低完成单项任务所需的能耗。更低的成本随后可能推动更多任务、更大模型、更长的推理过程以及更广泛的部署。

这种反弹效应解释了为何效率提升能够与不断增长的用电量并存。需求增长速度快于每单位工作所需能耗的下降速度。

AI 智能体又增加了一个变量。一个智能体在给出一个答案前,可能会反复调用模型、检索文档、使用软件工具,并评估中间结果。

因此,一次用户操作可能触发多次推理。视频生成、科学计算负载和扩展推理所需的计算量,也可能高于简短的文本回复。

运营商需要在多个层面提高效率。处理器必须高效执行计算;内存必须在不过度等待或移动数据的情况下为处理器供给数据。

网络必须以最小延迟协调设备。软件必须调度任务,并避免设备在持续耗电的同时处于闲置状态。

冷却系统必须在不增加过多额外负担的情况下移除热量。设施必须高效地转换和分配电力。

这也是为什么电力使用效率(PUE)无法描述整个问题。PUE 比较的是设施的总耗电量与其技术设备耗电量。

较低的 PUE 表示设施额外开销更少。但它并不能揭示处理器是否得到充分利用、软件是否高效调度工作,或模型是否使用了超出必要范围的计算资源。

一座设施可能拥有出色的 PUE,却运行着利用率偏低的加速器。反过来,略高的 PUE 若能支撑更多有用的计算工作,也可能意味着整体系统与工作负载匹配得更好。

真正相关的衡量单位,是在功耗、成本、延迟和可靠性限制内交付的有效工作。要衡量这一结果仍然很困难,因为企业很少披露有关 AI 利用率或单位工作负载能耗的标准化数据。

SK hynix 的系统级分析框架在此颇具参考价值。内存带宽可以让加速器持续工作,但更大的带宽也会影响封装功耗和发热。

减少数据移动可以节省能源,因为信息无需反复跨越较长的电气路径传输。将内存置于更靠近计算单元的位置可以提高速度和效率,但更高的封装密度也会使散热更加困难。

这正是核心权衡:更紧密的集成改善了数据移动,但也集中了承载的热负荷。

同样的矛盾也出现在机架层面。高密度系统缩短了网络路径,并将更多加速器置于一个紧密连接的域内。

但它们也需要更大的供电线路和更强大的冷却回路。若设施无法支持该机架,便可能需要采用密度较低的设计,从而失去部分网络和空间优势。

基础设施供应商正通过协同参考架构作出回应。芯片制造商会在系统交付客户前,与服务器厂商、电力设备供应商和冷却专家合作。

这种协作降低了集成风险,但也可能缩小运营商的选择空间。规格高度明确的机架,可能需要特定的冷却液温度、电源托架、连接器和管理软件。

客户获得了经过验证的设计,但也会更加依赖某一特定设备链。更换一个组件可能需要对整个系统重新进行验证。

云服务商拥有优势,因为它们能够在大规模下协调定制服务器、网络、软件和建筑设施。较小的运营商和企业通常需要与既有设施及多家供应商合作。

他们面临更艰难的改造决策。将 AI 工作负载迁移至云端可以避免本地设施升级,但也会带来运营成本、数据控制、延迟和供应商依赖方面的问题。

本地建设能提供控制权,却需要电力容量、冷却专业能力和更长的规划周期。正确选择取决于工作负载特征,而非仅仅取决于处理器规格。

液冷解决的是热传递,而非所有约束

冷却技术能够解锁更高密度的计算,但它无法创造电网容量,也无法保证 AI 服务具备经济性。

围绕液冷的热度有时会将多个问题压缩为一个。液体比空气更有效地将热量从芯片带走,但电力仍必须送达机架。

捕获的热量仍需排放到室外、加以再利用,或转移至其他地方。水泵和散热设备仍会消耗能源。

用水量同样取决于完整系统。液冷机架可以在封闭的技术回路中运行,而设施则可能在其他环节使用蒸发式冷却塔。

另一座设施可能使用干式冷却器,用水更少,但耗能更高,或在炎热天气下提供较低的冷却效率。气候和当地水资源条件会影响最佳设计方案。

声称液冷要么完全消除用水,要么必然消耗更多水,都需要结合具体情境看待。答案取决于冷却液回路、散热设备、运行温度、气候和发电方式。

可靠性也需要同样谨慎的看待。电子设备附近的液体带来了泄漏担忧,但传统风冷设施同样包含水系统和机械设备。

工程质量、监控、组件设计和维护决定了运营风险。无论采用何种传热介质,管理不善的冷却系统都可能失效。

也无法保证每个机架都会持续以其额定功耗运行。工作负载模式、软件调度、芯片供应情况和客户需求决定了实际利用率。

设计人员仍需为预期峰值预留容量。若为罕见的峰值而对设施每个部分都过度建设,可能会提高资本成本,并降低低负载下的效率。

建设不足则会造成相反的问题。设施可能拥有昂贵的加速器,却无法让它们同时以满性能运行。

这些不确定性使投资决策更加复杂。IEA 明确建模了多种需求情景,因为 AI 的采用、效率和基础设施瓶颈可能推动用电量朝不同方向发展。

其高效率情景表明,硬件、软件和设施改进能够在提供同等数字服务的同时降低用电量。其更高增长情景则反映了更快的采用速度和更少的供应约束。

两种结果都无法得到保证。企业正在对基础设施作出大规模承诺,但尚不清楚每项 AI 工作负载长期能产生多少收入。

这造成了产能搁浅的风险。围绕某一种机架规格或冷却标准优化的设施,若硬件设计发生变化,可能需要付出高昂代价进行调整。

反向风险同样真实存在。等待标准稳定下来,可能会让运营商在客户需要时缺乏产能。

SK hynix 也面临自身的不确定性。如果 HBM 和高密度 AI 系统的需求持续增长,该公司将从中受益。因此,其公开分析来自供应链参与者,而非中立观察者。

其结论应依据实测部署数据进行评估。有价值的证据包括实际机架利用率、交付的计算工作量、冷却能耗、组件温度、停机时间和设施总成本。

即使需求增长较慢,物理层面的论点依然成立。电力和热限制决定了任何已部署系统能够持续支撑的能力。

仍不确定的是,市场将需要多少基础设施、这些设施将建在何处,以及 AI 服务带来的收入是否足以证明这项投资的合理性。

三个信号将表明瓶颈是否正在缓解

下一阶段将通过已通电容量、运行中的冷却数据,以及真实工作负载下的效率来衡量。

第一个信号,是已宣布的数据中心项目与获得确定电网连接的设施之间的差距。建设公告体现了开发商的雄心,而已通电的兆瓦数则揭示了可部署容量。

应关注公用事业并网时间表、变压器供应情况、变电站建设和项目延误。更短的周期将支持这样的观点:电力供应正在追上 AI 投资。

持续的延误则会强化相反的结论。它们将表明,处理器产能的扩张速度可能快于使用这些处理器所需的基础设施建设速度。

第二个信号,是来自高密度液冷机架的运行数据。供应商已经发布设计规格,但运营商需要来自持续生产工作负载的证据。

相关指标包括冷却液温度、泵送能耗、机架正常运行时间、维护要求、组件故障率,以及单位设施功耗对应的计算输出。

更高程度的标准化同样重要。通用连接器、热接口和运行范围可以降低集成成本,并使硬件升级更容易。

碎片化的要求将拖慢采用速度,尤其是在必须支持众多客户和供应商设备的托管数据中心中。

第三个信号,是 AI 服务需求的增长是否快于效率提升。IEA 预计单项任务所需的能耗将显著改善,但总能耗取决于使用规模和工作负载复杂度。

只有当计算需求以可控速度增长时,更高效的推理才会缓解基础设施压力。智能体、视频生成和更长的推理工作负载都可能吸收这些收益。

标准化披露将帮助客户和政策制定者区分有用的计算增长与可避免的浪费。企业目前在广泛的组织层面报告能源和排放数据,这使得单项 AI 服务难以评估。

全球电力展望预计,到 2030 年,数据中心的用电量将增长逾一倍。这一预测并非命运,却揭示了规划挑战的规模。

SK hynix 对 AI 基础设施的分析指出了一个关键的物理问题。下一个限制因素不只是厂商能够生产多少加速器,更在于有多少运营方能够为其供电、散热、连接并高效利用。

开发者和企业采购方现在应当关注:其 AI 算力部署在何处、加速器的利用效率如何,以及需求增长时将会发生什么。采购团队应将供电和散热准备情况,与处理器、内存和模型性能一并纳入评估。

最重要的基准或许已不再能写进芯片规格表。它是整个设施能够从每一兆瓦受限电力中,可靠交付多少实际 AI 工作。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page