当机架电力接近极限,Intel 将 AI 供电移入芯片内部
随着现代 AI 加速器封装进入数千安培级别,Intel Foundry 概述了一项多层级供电策略。该公司认为,传统布线、电容器和主板稳压器仅靠渐进式改良,已无法继续支撑更高的计算密度。
这份新的供电白皮书将通常被分别讨论的多项技术联系起来,包括 PowerVia 背面供电、嵌入式电容器、先进 chiplet 桥接技术以及集成式稳压器。
这种组合之所以重要,是因为供电问题如今已从数据中心配电延伸至单个晶体管。NVIDIA、Google 和 Microsoft 正在设施层面推广 800 伏直流配电,而 Intel 则聚焦最后阶段:数千安培的电流必须在不产生不可接受损耗或电压波动的情况下,输送至高度密集的逻辑电路。
如今的矛盾已不只是性能与耗电量之间的取舍。芯片设计者还必须决定在哪里进行电压转换、电力如何抵达每颗裸片,以及储存的电荷如何应对突发工作负载。
Intel 并未声称单一架构可以解决所有情形。其立场更具深远影响:AI 数据中心供电已成为贯穿整个技术栈的设计问题,每一层都会影响下一层。
Intel 的 AI 供电如今已是全栈问题
Intel 的核心观点是,供电已直接限制加速器可实现的性能。
AI 加速器以较低的核心电压运行,却消耗大量电力。由于电功率等于电压乘以电流,要在相同输出功率下使用更低电压,就需要更高电流。
Intel 表示,当前的加速器封装已经需要数千安培电流。这些电流必须穿过受限区域,而该区域同时容纳计算裸片、高带宽内存、互连、散热组件和封装连接结构。
在工作负载快速变化时,挑战会更加严峻。加速器的大面积区域可在数个时钟周期内,从有限活动切换为高强度计算。这种转换会产生电流瞬态,也就是负载几乎立刻需要大幅增加电流。
供电网络无法在没有电阻和延迟的情况下作出响应。由此产生的电压下跌,会在活动增强时降低晶体管可获得的电压。设计者会通过预留裕量来补偿,为确保可靠性提供额外电压,但这也会消耗更多能量。
Intel 以比较 1 千瓦与 5 千瓦处理器的模型说明这种压力。在其 1 千瓦示例中,系统在主板稳压器输入端需要 1,252 瓦功率。
在 5 千瓦示例中,所需输入功率升至 8,301 瓦。Intel 将不断扩大的差距归因于稳压器损耗、电阻损耗,以及为应对电压下跌而预留的功率。
这些数字代表 Intel 的建模分析,而非来自已披露商用加速器的实测结果。不过,它们表明,随着电流增加,效率为何会恶化。由电阻造成的损耗会随电流平方增长,因此提高电流会带来不成比例的代价。
封装复杂性带来了另一项限制。现代加速器可整合计算 tile、输入输出裸片、高带宽内存和硅桥。每个组件都可能具有不同的电压需求和瞬态特性。
电力必须通过基板、凸点、桥接结构和硅通孔抵达这些组件。硅通孔,即 TSV,是穿过硅材料的垂直电连接。
传统正面设计还使信号线与电源轨争夺布线空间。增加额外布线层能够缓解拥塞,但也可能拉长电源与活跃电路之间的路径。
更长的路径会增加电阻,也会提高电力抵达晶体管前损失的电压。
问题并不止于封装。Intel 估计,传统机架通常支持约 10 至 20 千瓦,且主要依赖风冷。现代 AI 机架已超过 100 千瓦,并且往往需要液冷。
行业路线图目前指向本十年后期机架功耗接近 1 兆瓦。达到这一水平的机架,无法仅依靠增加更多传统线缆、稳压器和散热设备。
更高的机架功率会压缩这些支撑系统可用的空间。它还会让微小的效率损失变得更加昂贵,因为每一瓦浪费的电力都会转化为必须移除的热量。
结果形成了一条相互依赖链。设施电压影响机架配电;机架配电影响电路板设计;电路板电压影响稳压器布局,而稳压器布局又影响封装布线和散热。
因此,Intel 的 AI 供电不能被视为单一组件功能。其价值取决于这些层级能否作为一个协调统一的网络运行。
PowerVia 将电源线与信号传输分离
PowerVia 通过将主要电源布线移至硅片背面,改变了通往晶体管层的物理路径。
传统芯片通过晶体管上方的金属层同时传输信号和电力。随着设计密度提高,这两个网络争夺的布线空间愈发有限。
Intel 的背面供电架构 PowerVia 为电力提供了独立路径。它将粗电源布线和连接置于裸片背面,同时保留正面层用于信号传输。
这种架构的作用不只是缓解布线拥塞。它还缩短了外部电源连接与活跃电路之间的电阻路径,从而可降低 IR drop,即电流通过电阻时损失的电压。
Intel 随 Intel 18A 制造工艺推出了 PowerVia。该公司表示,这项技术可改善信号布线、标准单元利用率,并增强高负载下的电压稳定性。
一份 Intel 18A 简介称,PowerVia 可将单元利用率提高最多 10%。该简介还称,在功耗不变的条件下,性能可提升最多 4%。
这些数字取决于设计和配置,不应被解读为采用 Intel 18A 制造的每款处理器都会自动获得改善。
背面供电还会改变散热、测试和制造要求。裸片背面不再只是结构表面,或通往散热系统的一条简单路径。
电源连接必须与散热及先进封装结构共存。当电力从下方进入时,工程师还需要采用不同的方法检查和调试电路。
Intel 在将 PowerVia 纳入其量产路线图前,已通过测试芯片处理了其中一些问题。不过,客户产品仍是更重要的验证点,因为商用设计会引入更大规模的系统和更多样化的工作负载。
Intel 的下一代技术提高了门槛。Intel 18A-P 增加了 Power Boost,这是一种连接正面与背面接点的双接点架构。Intel 报告称,该方法在匹配电容条件下可实现超过 10% 的频率提升。
Intel 14A 计划引入 PowerDirect,即其背面技术的第二代。Intel 表示,PowerDirect 将进一步改善面积与供电表现。
这些进展使 Intel 置身于更广泛的制造竞赛之中。TSMC 和 Samsung 也在开发背面供电技术,尽管其实施方式和量产时间表有所不同。
相关竞争不只是哪个晶圆厂最先引入背面布线。客户还将比较良率、设计复杂度、热学表现、可用工具,以及完整产品中的实际收益。
这也对电子设计自动化供应商构成压力。其软件必须理解背面连接、布局限制、时钟布线、热相互作用和新型供电网络的行为。
它同样改变了设计规划。供电不再能等到大多数逻辑和物理决策完成后才考虑。架构师必须将供电路径与 chiplet、内存、散热和信号接口一并纳入考量。
对于 AI 加速器公司而言,其吸引力很明确:释放正面资源能够支持更多信号带宽,同时缩短高电流所经过的路径。
不过,PowerVia 仅解决了输送电力的稳态路径问题。它并不能在加速器活动突然变化时,提供所需的本地储存电荷。
这一需求将电容器推向 Intel 战略的核心。
嵌入式电容器成为封装架构的一部分
Intel 正在将电容器分布于裸片和封装各处,因为没有单一储能层能够覆盖所有瞬态时间尺度。
去耦电容器会在电路附近储存少量电荷。当需求增长快于更大范围供电网络的响应速度时,它会释放这些电荷。
传统系统将电容器置于主板和封装上。现代加速器封装为这些组件留下的空间更少,因为计算裸片和内存占据了大部分顶面。
底面同样拥挤。球栅连接必须在封装及其电路板之间传输电流和输入输出信号。
在快速瞬态期间,距离至关重要。距离负载更远的电容器,必须通过更长、电阻更高且电感更大的路径输送能量。
Intel 的首项应对方案是 Omni MIM,一种片上金属-绝缘体-金属电容器。不同于较早的平面设计,Omni MIM 通过沟槽垂直延伸电容器结构。
这种三维结构可在不占用同等水平硅面积的情况下提高电容密度。将其置于活跃电路附近,有助于其响应高频功率变化。
不过,片上电容仍然有限。其储存的电荷最终必须由另一层级中更大的电容器补充。
因此,Intel 正在开发 eMIM-T,将多层 MIM 电容器置于封装增层内部。这种方法可在不占用活跃裸片面积的前提下,将额外电容置于负载附近。
另一项称为嵌入式深沟槽电容器的技术位于封装核心内部。Intel 将其描述为面向低频和中频去耦的补充级别。
这些层级构成响应层次。片上电容器应对最快的变化;封装电容器提供更多储存能量;电路板和机架系统则支持持续时间更长的事件。
Intel 还曾单独报告其在新型电容材料上的进展。其研究人员在特定材料中展示了达到每平方微米 98 飞法的本征电容密度。
该公司将这一数字与当时现有技术所用材料的每平方微米 37 飞法进行了比较。Intel 还报告称,在高温测试期间,该材料在超过 400,000 秒内保持稳定表现。
这些实验并不保证能够立即投入制造。沉积均匀性、多层集成、漏电、可靠性和生产成本,仍将决定一种材料能否进入客户产品。
芯粒桥接带来了另一个供电难题。Intel 的 Embedded Multi-die Interconnect Bridge(EMIB)通过一块小型硅桥连接相邻芯粒。
传统实现会让电源绕过这块桥接结构。随着电流密度上升,这种绕行会增加电阻,并使电流集中在边缘连接处。
Intel 更新的 EMIB-T 设计在桥接结构中加入 TSV,为电源提供了更直接的垂直路径。它还集成本地 MIM 电容器,以抑制高速输入输出电源轨上的噪声。
Intel 表示,与其早期架构相比,EMIB-T 可将带宽提升一倍,并将电源噪声降低 50%。这些说法源自 Intel 支持的技术研究,仍需在量产系统中验证。
这一目标对 HBM4 及后续内存接口尤为重要。高带宽内存将宽数据链路与严格的电压容差结合在一起,因此对供电噪声十分敏感。
在这里,供电与数据传输已密不可分。增加更多内存带宽会提高电流需求,并占用供电网络所需的布线空间。
因此,改进后的桥接结构必须同时传输信号和电流。仅优化数据路径,可能会形成供电限制,导致接口无法达到预期性能。
嵌入式电容器同样存在取舍。它们会增加制造步骤,并占用封装体积。一旦发生故障,可能影响包含多颗高价值芯粒的昂贵组件。
设计人员必须对电气行为、机械应力、热量和测试覆盖率之间的相互作用进行建模。即使单独表现良好的电容器,也必须经受住封装组装和长期运行周期的考验。
Intel 的产品组合策略承认这些限制。它提供多种电容器布局位置,而非将某一种技术视为通用答案。
剩下的问题是,如何从根本上减少穿过封装的电流。Intel 的答案是:将电压转换移至更靠近计算负载的位置。
Intel IVR 技术将转换移向负载端
集成式电压调节以更复杂的封装集成为代价,换取更短的供电路径和更快的响应。
传统主板电压调节器会将通常约为 12 伏的配电电压,转换为处理器所需的更低电压。随后,产生的电流再穿过主板和封装。
当加速器电流进入数千安培级别时,这种模式会变得低效。长距离低电压路径会产生电阻损耗,其电感还会拖慢对突发需求的响应。
集成式电压调节器,即 IVR,会将转换器置于处理器上、封装内,或直接放在负载下方。它先以较高电压传输电力,再在本地进行转换。
更高的电压可让相同功率以更低电流传输。随后,本地转换仅在晶体管使用点附近产生所需的低电压。
Intel 从事 IVR 研究已超过十年。其最初的全集成式电压调节器将开关、控制逻辑和输出电容器整合到处理器芯片上。
该设计使用封装内的空心电感器储能。随着电流密度提高,这些电感器需要更小的占位面积,可能降低其品质和转换效率。
Intel 后来推出了 CoaxMIL,这是一种紧凑型磁性电感器,最初部署于第四代 Xeon Scalable 处理器。后续 Xeon 产品系列采用了更新版本。
该公司表示,磁性设计提高了电流密度和转换效率。耦合配置还可在占用更少封装面积的同时改善瞬态响应。
其更具雄心的方案是从本地转换器中移除电感器。Intel 将这一设计称为 C2VR,即连续电容式电压调节器。
C2VR 利用高密度 MIM 电容器,将最高 2.4 伏的输入转换为典型的处理器核心电压。Intel 表示,该设计的效率可超过 90%,并可提供每平方毫米 10 安培的电流。
C2VR 相关研究报告称,其峰值效率为 92%,功率密度为每平方毫米 12.7 瓦。与任何转换器结果一样,实际性能会受到工作负载、电压比、热条件和具体实现的影响。
电容式调节器可以快速改变输出电流,因为它不依赖大型磁性储能组件。这一特性有助于在电流突变时限制压降。
Intel 表示,C2VR 可扩展至数千安培级负载。它可位于芯片侧、封装底面、封装层内部或基底芯片内。
最简单的做法,是将 IVR 放置在封装的焊盘侧。与主板调节器相比,这一位置缩短了路径,也避开了一些芯片上集成的难题。
不过,它也会产生新的冲突。调节器及其散热需求会占用封装底面空间,而这些空间原本可用于封装连接。
可用连接数量减少,可能增加转换器输入路径上的电阻。这种损耗可能抵消将转换器置于负载附近所带来的部分优势。
Intel 更高度集成的概念是将 C2VR 直接置于计算芯片下方。电力通过背面 TSV 输入,到达调节器后,再垂直传输至处理器。
Intel 表示,电容式调节器在保持功能的同时可薄至 100 微米以下。其外形使其适合嵌入封装层或堆叠式基底芯片中。
这最清晰地体现了 Intel 的 AI 供电策略。背面布线让电力穿过硅层,嵌入式电容器使其稳定,本地调节器则在负载附近完成转换。
这一机制有望缩短电气路径并改善瞬态响应。但它也会在本已高温的处理器下方形成集中的热量和高度耦合的制造难题。
调节器故障可能影响整个封装,而不是像主板组件那样可以更换。因此,测试、维修、热管理和良率将成为经济性评估的关键部分。
Intel 将 C2VR 描述为一种可扩展架构,但该论文未指出任何已在完整数千安培规模下采用它的商用 AI 加速器。在评估成熟度时,这一区别至关重要。
行业正在重构供电链条的两端
Intel 的封装级工作与迈向更高设施电压的趋势相辅相成,但这两项转变必须在兼容的接口处衔接。
Google、Microsoft 和 NVIDIA 正通过 Open Compute Project 制定 800 伏直流配电的通用要求。这项工作面向设施设备与高密度计算机架之间的电力传输。
更高电压可降低输送给定功率所需的电流。这能够减少导体尺寸、铜材用量、配电损耗以及布线带来的物理负担。
OCP framework 描述了两条部署路径。现有设施可以使用侧边供电机架,在计算机架附近将 480 伏交流电转换为直流电。
未来设施则可将中压交流电直接转换为 800 伏直流电。该设计取消了中间转换环节,并可更直接地整合电池或直流微电网。
该组织表示,已有超过 80 家合作伙伴在开发兼容基础设施。参与者包括转换器、母排、连接器、保护系统和机架级设备的供应商。
这项工作并未消除机架内的低电压转换。加速器核心的工作电压仍远低于 800 伏,因此设施配电与晶体管之间仍保留多个转换阶段。
Intel 主要聚焦于该链条的最后一段。PowerVia、封装电容器、EMIB-T 和 IVR 解决的是封装输入端与有源逻辑之间的距离问题。
因此,NVIDIA 的设施架构与 Intel 的封装策略并非直接替代关系。它们解决的是同一端到端问题的不同环节。
竞争张力体现在谁掌控接口。加速器供应商可以规定机架架构,而晶圆代工厂和封装供应商则定义封装内部的选项。
Texas Instruments、Infineon 和 STMicroelectronics 等功率半导体供应商负责这些层级之间的转换环节。设备公司则提供断路器、整流器、母线槽和冷却系统。
一项 Texas Instruments 分析 估计,采用 48 伏配电的一兆瓦机架,需要近 450 磅铜材来控制配电损耗。
TI 还表示,当前处理器的电流需求可超过 1,000 安培。该公司正与 NVIDIA 合作开发 800 伏配电和下一代多相处理器供电方案。
咨询机构的估算说明了行业为何此刻行动。一份 数据中心评估 将新兴 AI 机架的需求置于 200 至 600 千瓦之间。
同一分析预计,本十年后期部分机架的需求将接近一兆瓦。传统低压系统并非为这种密度与持续需求的组合而设计。
标准仍是一项重要限制。高压直流需要适应直流特性的保护装置、故障隔离、连接器、监控系统和操作流程。
与交流电不同,直流电不会在每个周期跨越零点。因此,中断直流故障可能需要专用设备,以阻止持续的电弧。
OCP 参与者正在借鉴电动汽车和工业系统的实践。不过,数据中心具有不同的可用性要求、服务模式和物理配置。
不同设施的部署方式也会有所不同。新的 AI 园区可以围绕直流配电进行设计,而现有站点可能缺乏进行大规模改造所需的电力容量或列间空间。
这种多样性支持 Intel 不规定单一供电架构的做法。不同的加速器和设施将以不同方式组合电压等级、调节器、电容器和冷却方法。
风险在于碎片化。定制接口可能拖慢供应商、增加认证复杂度,并阻碍设备服务多个客户。
机遇则在于协同。通用机架接口可为组件制造商提供稳定目标,而代工技术则可优化通往每颗芯片的最后一段路径。
接下来必须验证什么
决定性证据将来自完整系统,而非孤立的效率主张或工艺演示。
第一个信号是 Intel 封装级技术组合的商业应用。客户需要披露能够在持续 AI 工作负载下,将背面供电、先进电容器、芯粒桥接和近负载调节相结合的产品。
PowerVia 已通过 Intel 18A 进入量产,但客户采用情况和系统表现比单纯的工艺可用性更重要。良率、频率、电压稳定性和热性能必须在量产规模下保持可靠。
第二个信号是调节器集成。Intel 已公布颇具说服力的 C2VR 测量结果,包括超过 90% 的效率和高电流密度。
更严苛的测试是加速器规模的封装。工程师需要获得涵盖数千安培运行、工作负载瞬态、热量、老化、制造差异,以及与背面供电相互作用的证据。
故障表现同样值得关注。高度集成的稳压器必须保护昂贵的计算与内存裸片,不能让局部故障演变为整包失效。
第三个信号是 800 伏互操作性的进展。OCP 规范需要多家供应商提供兼容产品,随后还要经过能够在演示场景之外安全运行的部署验证。
这些部署将揭示,所承诺的转换损耗和铜材用量下降,是否能转化为更好的设施经济性。它们也会暴露维护和培训方面的要求。
Intel 自己的论文也包含重要警示。论文称不存在通用解决方案,并指出芯片底面 IVR 面临电气、散热和机械方面的限制。
该文档还表示,路线图和性能预测仍存在不确定性。大多数已报告的收益会因工作负载、配置和实施方式而异。
这种克制是恰当的。将更多电源功能整合进硅片和先进封装,能够改善电气特性,但也会提高集成成本并集中风险。
架构团队需要评估从电网连接到晶体管的完整路径。优化某一个转换环节,可能只是将热量、电阻或复杂性转移到别处。
他们还必须考虑工作负载行为。训练、推理、网络和内存密集型任务会产生不同的电流模式,即使它们的平均功耗看起来相近。
对开发者和企业采购方而言,影响将间接显现。更好的供电能力可以提高加速器的持续利用率,并减少每单位有效计算所需的基础设施。
它还可能影响硬件的可获得性。需要专用设施、专有接口或复杂冷却方案的系统,实际触达的客户可能少于其基准测试结果所暗示的范围。
因此,比较 AI 基础设施的团队应关注持续性能,而不只是峰值吞吐量。他们应考察机架要求、冷却方案、电压架构和部署限制。
技术组织可以将这些评估保存在可搜索的工程知识库中。如今,电源规格横跨处理器文档、机架设计、设施规划和标准化工作。
更大的转变已经显现。AI 性能不再只取决于晶体管、内存带宽或互连速度。
供电决定了有多少硅片能够同时可靠运行。Intel 的方案将电源布线、储能电荷和电压转换进一步靠近其所支持的计算单元。
未来一到三个月应能厘清三点:具名客户的采用情况、封装 C2VR 的验证情况,以及可互操作的 800 伏硬件。若三方面均取得进展,将强化 Intel 的全栈论证。
任何一个层面缺乏证据,都会暴露核心风险。除非整条链路协同工作,否则高效组件并不能造就高效的 AI 数据中心。
随着 Intel 的 AI 供电技术进一步深入封装,采购方应提出一个实际问题:完整系统能否持续提供其宣称的计算能力,而不将损耗转移到别处?



