OpenAI 对 CXL 替代 HBM 的质疑揭示 AI 内存真正的取舍
据报道,尽管降低高带宽内存成本、缓解其供应稀缺性的压力日益加大,OpenAI 已否定了“CXL 可替代 HBM”的观点。一名 OpenAI 加速器研究人员表示,他尚未找到适合用 CXL 运行 AI 模型的有力应用场景。Intel 一名架构高管则另行指出,相比替代 HBM,CXL 更适合作为存储的补充。
这些评论挑战了 AI 基础设施采购方颇具吸引力的一种设想。Compute Express Link,即 CXL,可让处理器通过一致性互连访问额外内存。它承诺提供更大容量、共享内存池和更灵活的资源分配。不过,灵活性无法消除活跃模型执行对带宽的需求。
更深层的情况并非 CXL 已经失败,而是 CXL 与 HBM 分别解决内存问题的不同部分。HBM 让频繁访问的数据以极高带宽靠近加速器;CXL 则能扩展容量,并将较冷的数据迁移至成本更低的层级。
这一差异促使内存供应商、加速器设计者和云运营商构建更智能的层级体系。因此,核心竞争并不是将 CXL 与 HBM 视为可互换产品,而是替代的经济性与以足够快的速度传输数据、让昂贵 AI 处理器持续工作的物理要求之间的较量。
OpenAI 关于 CXL 替代 HBM 的说法面临带宽检验
据报道,OpenAI 和 Intel 的评论缩小了 CXL 的角色范围,但并未让这项技术失去意义。
这些言论出现在 2026 年 9 月 16 日于加州圣克拉拉举行的 AI Infrastructure Summit 小组讨论会上。据 Financial News 报道,从事加速器设计的 OpenAI 研究员 Daniel Morris 对 CXL 在实际模型执行中的实用性提出质疑。
据报道,Morris 表示:“从实际运行 AI 模型的角度看,我找不到 CXL 的用途。”他指出了一种可能角色:存放大型模型很少访问的非活跃信息。
据报道,Intel 片上系统架构负责人 Vidhya Thyagarajan 也提出了类似区分。她表示,通过 CXL 进行内存池化可能很有用,但它无法替代 HBM。她将 CXL 定位为二级存储的补充。
Intel 据报道的立场中,最重要的一点涉及数据传输。根据译自该小组讨论报道的内容,在 GPU 与 CXL 连接内存之间传输的信息“绝不可能像 HBM 那样快”。
这些评论需要谨慎归因。它们由韩国媒体报道、再由 TrendForce 汇总,而非作为 OpenAI 或 Intel 的正式政策声明发布。现有的英文 Financial News 文章也标明其为 AI 辅助翻译。
两家公司均未发布与这些言论配套的基准测试。OpenAI 尚未公开技术论文,证明 CXL 缺乏有用的模型执行工作负载。Intel 也仍是更广泛 CXL 生态系统的重要参与者。
这些评论依然值得关注,因为它们来自负责加速器和系统架构的专家。他们所作的区分反映出一个基本约束:容量和带宽彼此相关,但不能互相替代。
HBM 通过宽接口将堆叠 DRAM 紧邻处理器部署。这种设计支持高度并行的加速器所需的持续数据传输。CXL 则通过基于 PCI Express 技术的链路连接内存和设备,优先考虑一致性访问与可组合性。
CXL 可以让处理器看到更大的内存池,但无法自动让该内存池中的每一个字节都具备本地 HBM 的表现。距离、链路宽度、交换、协议开销和资源争用,仍会共同影响实际性能。
这正是据报道的相关言论所揭示的矛盾。行业希望摆脱昂贵 HBM 的束缚,但推动这种需求的工作负载仍对内存吞吐量高度敏感。
因此,如果 CXL 替代 HBM 的论点假定性能不等的内存位置可以提供相同性能,它便无法成立。更可信的论点应从判断哪些数据必须保持在近端、哪些数据可以迁移到更远位置开始。
为何 AI 加速器仍依赖 HBM
HBM 之所以难以替代,是因为 AI 处理器需要快速、反复地访问庞大的工作数据集。
现代加速器会并行执行大量数学运算。这些计算单元需要持续获得模型权重、激活值及其他中间数据。如果内存无法足够快地提供信息,处理器的一部分便会等待,而非计算。
这种情况通常被称为内存带宽压力。增加更多算术单元无法解决这一问题;系统必须提供足够的可用带宽,才能让这些单元保持忙碌。
训练对内存提出了尤为苛刻的传输要求。大量加速器会反复交换参数和中间结果。HBM 的物理邻近性和宽接口使其适合承担这种持续的数据传输。
推理的访问模式有所不同,但这并未让带宽变得无关紧要。已部署的模型仍需访问权重。生成每个 token 都可能需要读取大量模型数据,特别是在处理较小请求批次时。
长上下文和智能体工作负载带来了另一类内存问题。它们会累积键值缓存,用于保留此前 token 的注意力信息。这些缓存可能大到足以挤压加速器旁可用的容量。
与带宽需求相比,CXL 更自然地应对这种容量压力。它可以提供额外内存,并支持在主机或设备之间共享。然而,通过更窄的链路迁移正在活跃使用的缓存,可能引入新的瓶颈。
官方 CXL 概览介绍了三种相关协议。CXL.io 负责设备发现和管理;CXL.cache 支持对处理器内存的一致性访问;CXL.mem 则让主机访问连接至 CXL 设备的内存。
这些能力支持内存扩展、池化和共享。它们可以减少闲置容量,例如一台服务器缺少内存,而另一台服务器存在未使用资源。它们还可以帮助运营商围绕不断变化的工作负载需求配置基础设施。
这种运营灵活性很有价值,但它回答的问题不同于 HBM。CXL 解决的是如何让更多内存变得可访问;HBM 解决的是如何让足够的数据每秒抵达处理器。
CXL 4.0 改善了这一答案。该规范将信号传输速率从每秒 64 千兆传输提升至 128 千兆传输,并引入捆绑端口。端口捆绑可以组合设备端口,以提高连接带宽。
CXL Consortium 还表示,较新的标准在提高信号传输速率的同时不会增加协议延迟。这一说法并不意味着远程 CXL 内存具备与加速器旁 HBM 相同的端到端特性。
实际性能还取决于内存设备、控制器、交换机、拓扑结构、软件放置策略和工作负载访问模式。更快的标准可以改善链路,却无法消除系统中的所有差异。
因此,CXL 4.0 规范削弱了一项批评,但未抹去这种架构差异。CXL 带宽正在提升,而 HBM 仍占据最高性能层级。
这解释了为何据报道的 OpenAI 怀疑态度如此重要。OpenAI 正在为加速器利用率直接影响服务能力和运营效率的工作负载设计基础设施。当先进处理器因缓慢的数据传输而闲置时,成本会随之上升。
Intel 据报道的观点具有另一层意义。Intel 曾帮助确立 CXL,并持续支持围绕该标准的产品和演示。因此,一名 Intel 架构师作出的狭义评估,并非对 CXL 本身的否定。
相反,这表明即使是 CXL 的主要支持者,也看到了替代叙事的局限。Intel 可以支持 CXL 内存,同时承认本地高带宽内存承担着另一种功能。
真正的较量是替代还是分层
当 CXL 被视为另一层内存,而非更慢的 HBM 时,它会更具说服力。
分层架构会根据数据的访问频率和性能要求进行放置。频繁使用的信息保留在快速但稀缺的内存中;活跃度较低的信息则迁移至容量更大、成本更低的层级。
处理器数十年来一直依赖这一原则。寄存器、缓存、主内存和存储设备在速度与容量之间取得平衡。如今,AI 系统正将这一层级扩展至加速器、主机内存、共享内存和闪存存储。
替代叙事将这些层级压缩为一种误导性的比较。它询问 CXL 是否可以从 AI 服务器中移除 HBM。更有用的问题是:在工作负载的每个阶段,哪些数据必须保留在 HBM 中。
OpenAI 据报道的立场为冷数据存储留下了空间。模型很少需要的信息,并不总是值得占用稀缺的 HBM。CXL 可以让这类信息保持可访问,而不必将其放入固态存储。
挑战在于预测。系统必须在加速器请求信息之前,知道哪些信息将变得活跃。一次延迟传输就可能使生成过程停顿,并抹去采用较低成本层级带来的经济收益。
这正是工作负载感知软件变得至关重要的原因。数据放置、预取、缓存淘汰和调度,决定了 CXL 是在扩展有效容量,还是仅仅增加延迟。
SK hynix 研究人员在 2026 年 6 月展示了一项具体尝试。他们的 Inference Tiered Memory Expansion 架构将 CXL 混合内存置于主机内存和闪存存储之间。
该设计面向长上下文推理的共享上下文基础设施。它采用量产级 CXL 内存模块、PCIe Gen5 固态硬盘和 FPGA 原型。研究人员聚焦于具有可预测访问模式的模型权重和前缀缓存。
其 ITME 研究报告称,与传统 CPU 卸载相比,吞吐量最高提升 35.7%。该系统将 CXL 内存作为可按字节寻址的中间层,并主动从存储设备迁移信息。
这一结果并不与据报道的 OpenAI 对 CXL 替代 HBM 的质疑矛盾。ITME 并未将 CXL 作为本地 HBM 的直接替代品,而是赋予 CXL 在更快内存与更慢存储之间的独特角色。
该实验还面向超出主机内存限制的容量需求。它的价值在于避免更慢的存储访问并简化远程扩展,而非在每一次模型操作中匹配 HBM 的带宽。
这一差异对于解读供应商说法非常重要。一项基准测试可以表明,与基于 SSD 的基线方案相比,CXL 改善了系统表现;但这并不必然表明 CXL 能匹配纯 HBM 配置。
当比较对象体现其预期层级时,CXL 可以带来可量化的收益。2024 年,使用 Micron CXL 模块和 Intel Xeon 6 处理器的研究人员报告了另一项案例。
他们的配置结合了八个 CXL 设备与十二个 DDR5 通道。软件在两种内存类型之间交错分布页面。研究人员报告称,只读带宽提高了 24%,混合读写带宽最高提高了 39%。
在已测试的高性能计算和 AI 工作负载中,几何平均性能提升为 24%。再次强调,该结果衡量的是 CXL 对 CPU 内存系统的补充作用,而非将其作为 GPU HBM 的替代品。
这些研究支持一种更聚焦但务实的 CXL 定位。CXL 可以扩展容量、提升 CPU 内存的总带宽,并减少对较慢存储的依赖。当访问模式允许预取时,它还可以支持共享上下文层。
这些优势都不要求 CXL 击败 HBM。关键在于系统架构师将其部署在延迟和带宽仍可接受的位置。
Samsung 和 SK hynix 面临双向压力
内存供应商必须守住 HBM 利润空间,同时证明 CXL 产品能够在旗舰内存之外创造价值。
Samsung Electronics 和 SK hynix 在 HBM 供应链中占据强势地位。持续增长的加速器需求,为两家公司投资更高容量、更高速度的 HBM 世代提供了理由。
据报道,OpenAI 和 Intel 的评论进一步巩固了这一市场。如果 CXL 无法接管活跃模型内存,加速器供应商将继续依赖 HBM 来存储对性能至关重要的数据。
不过,HBM 角色的稳定并不意味着市场一成不变。AI 推理正在催生对更多样化内存系统的需求。训练、交互式推理、批处理和上下文存储在容量、延迟、功耗、带宽和成本方面各不相同。
因此,Samsung 和 SK hynix 都有动力在多个层级销售产品。它们可以为加速器附近提供 HBM,同时开发用于扩展和共享的 CXL 内存模块。
如果基础设施支出发生转移,这一策略也能为它们提供保护。寻求降低成本的客户可能会减少每套系统中的 HBM 配置,但不会完全取消 HBM。内存厂商仍可通过 CXL 连接的 DRAM 和其他层级参与其中。
ITME 研究说明了这种可能性。SK hynix 并未将 CXL 混合内存定位为 HBM 的直接替代品。其架构在 HBM、DDR、CXL 内存和 SSD 的层级结构中插入了另一层。
这种方式将表面上的竞争转化为产品组合扩张。更多层级意味着更多部署决策,但也带来了额外的产品和软件需求。
云服务商面临类似压力。只有当客户高效使用时,富含 HBM 的加速器才有价值。预留容量、闲置内存和超配配置都可能抬高推理的实际成本。
CXL 池化提供了一种让部分内存更灵活分配的可能方式。当工作负载的峰值不同,共享池可以减少闲置容量。其收益取决于拓扑、隔离、软件支持和可预测的服务质量。
加速器设计者面临最艰难的权衡。他们必须决定每颗芯片应封装多少本地内存。内存太少会限制模型和上下文;内存太多则会提高封装复杂度,并在工作负载并未使用时占用稀缺容量。
可信的分层设计可让加速器厂商为活跃数据配置 HBM,并将较冷的数据转移至其他位置。然而,硬件需要具备足够的链路带宽,软件也必须在数据变得紧急之前将其迁移。
Nvidia、AMD、Google、Intel 以及定制加速器团队都在探索本地内存、网络和横向扩展系统之间的不同平衡。它们的架构不应只按容量进行比较。
一台提供更多总内存的服务器,应用性能仍可能更差。实际吞吐量取决于处理器访问各层级的频率,以及数据传输能否与有用计算重叠。
这也是为什么 CXL 的采用不会产生单一、普遍的结果。数据库工作负载、基于 CPU 的分析、模型服务、训练和检索系统具有不同的访问模式。适合一种工作负载的最佳层级结构,可能会损害另一种工作负载。
因此,CXL 更广泛的成功或许并不会以显著替代 HBM 的数字体现。其采用可能会通过内存扩展模块、可组合服务器、上下文存储和降低存储流量的基础设施呈现出来。
这一结果会令期待直接 HBM 竞争者的人失望。但它仍将代表 AI 服务器分配内存方式的重要变化。
据报道的结论存在重要局限
两位小组讨论嘉宾的评论无法决定 CXL 的未来,因为标准、产品和 AI 工作负载仍在变化。
第一个局限在于证据层面。最强烈的表述来自媒体对一场会议小组讨论的报道。被引用的报道中没有提供录音、文字记录、基准测试包或对应的 OpenAI 出版物。
读者不应将这些评论解读为每一种 OpenAI 工作负载都排斥 CXL 的证据。据报道,Morris 表示很难找到 CXL 在模型执行中的实际用途,但这一判断的边界仍不清楚。
该表述可能指向当前的加速器设计、当前软件,或某一类特定模型。它未必涵盖上下文存储、预处理、检索、检查点或未来的解耦式系统。
Intel 的立场也需要结合背景理解。该公司支持 CXL 开发,并展示了 Xeon 处理器的内存模式。其据报道的批评针对的是替代 HBM,而不是连贯内存扩展的实用性。
第二个局限是技术进展。CXL 4.0 将标准的信令速率提升一倍,并支持端口绑定。实现这些能力的产品仍需要在真实工作负载下验证。
规范带宽不等于应用带宽。工程师必须测量实际吞吐量、延迟分布、争用、功耗,以及故障情况下的性能。
第三个局限涉及软件。内存分层只有在系统能够智能放置数据时才能良好运作。糟糕的策略可能将热点数据移入慢速层级,或浪费带宽传输不会被使用的信息。
在某些情况下,长上下文推理可能让这个问题更易管理。前缀缓存和模型权重可能具有可预测的访问模式。这种可预测性为预取和复用创造了机会。
其他工作负载则更加严苛。不规则访问、快速变化的请求或严格的延迟要求,都会让远程内存更难使用。平均吞吐量也可能掩盖严重的长尾延迟问题。
第四个局限是每项主张所选择的基准。CXL 通常与主机 DDR 或 SSD 访问竞争,而非 HBM。相对存储的积极结果并不能证明其与加速器本地内存等价。
反过来的错误同样可能发生。证明 CXL 无法匹敌 HBM,并不能证明它缺乏经济价值。较低层级只需要优于该层级中可用的替代方案即可。
因此,有效评估必须明确数据、工作负载和基准。它应说明哪些信息驻留在 HBM 中,哪些通过 CXL 移动,以及传输多频繁地延迟计算。
功耗同样值得仔细审视。跨系统移动数据会消耗能量。更大的内存池可以减少昂贵的存储操作,但交换和传输也会带来成本。
当内存变为共享资源时,可靠性和隔离至关重要。运营方需要可预测的故障处理、访问控制、加密、可观测性和服务保障。这些运营要求可能会在硬件可用后延缓采用。
CXL Consortium 在 4.0 版本中描述了可靠性、可用性和可维护性的改进。这些功能强化了基础设施层面的论据,但生产环境证据仍比规范表述更重要。
因此,正确结论比标题主张更为有限。现有证据支持对 CXL 直接替代 HBM 的怀疑,但不足以宣称 CXL 与 AI 基础设施无关。
三个信号将揭示 CXL 的下一步定位
下一阶段将由生产环境测量、加速器集成,以及分层设计能够降低推理总成本的证据决定。
第一个信号是来自超大规模云服务商和模型开发者的部署证据。OpenAI、Microsoft、Google、Meta、Amazon 以及其他运营商可以在大多数研究人员无法企及的规模上测试内存架构。
重要披露将把容量增长与应用性能区分开来。有价值的结果应报告模型吞吐量、延迟、加速器利用率,以及访问 CXL 内存的请求占比。
面向共享上下文或冷权重的生产部署,将强化分层论点。若无法超越类似存储的角色,则会印证据报道的 OpenAI 判断。
第二个信号是实现 CXL 4.0 带宽和端口绑定的硬件。该联盟于 2025 年 11 月发布 CXL 4.0,但规范先于广泛可用的平台出现。
即将推出的系统必须展示有多少链路带宽真正到达应用。供应商还需要证明,交换和多设备配置能够在负载下保持可预测的延迟。
强劲结果将削弱 CXL 仅限于冷存储的观点。但这不会自动证明它能替代 HBM,因为 HBM 在同一时期也将持续进步。
第三个信号是对 ITME 等架构的独立验证。据报道,35.7% 的吞吐量提升颇具前景,但它来自特定原型和基准。
独立团队应测试不同模型、上下文长度、请求模式和存储配置。它们还应测量长尾延迟、能耗、软件开销和恢复行为。
可重复的收益将表明,CXL 在推理中占据了有用的中间层级。若在可预测工作负载之外表现不佳,则会将该架构限制在专业化部署中。
这些信号还将明确谁面临最大的压力。如果本地带宽仍然不可或缺,HBM 供应商面临的即时替代风险就较低。但它们仍需为推理所形成的每一层提供产品。
CXL 供应商必须停止将容量营销为性能的保证。其最有力的论据将来自依据可测量访问模式放置数据的完整系统。
AI 基础设施买家应询问数据在每个模型阶段驻留在哪里。他们还应询问,当一个原本被认为较冷的对象突然变热时会发生什么。
OpenAI CXL 替代 HBM 的争论最终带来了一个有益的修正。内存架构不是一个组件淘汰其他所有组件的竞赛,而是由距离、带宽、容量和软件共同塑造的资源分配问题。
评估这些主张的团队应将基准细节、工作负载假设和架构决策保存在可搜索的工程知识库中。下一次供应商演示应与这些假设比较,而非与简化的替代口号比较。
关注首批独立的 CXL 4.0 部署、生产环境上下文内存系统和工作负载级成本数据。这些结果将揭示 CXL 会成为关键 AI 内存层级,还是仍只是一条专业化扩展路径。



