top of page

Panmnesia Meta CXL 架构将 AI 计算扩展至机架之外

9月14日
讀畢需時 16 分鐘

Panmnesia 与 Meta 提出了一种 CXL 架构,可在一个一致性计算域内连接多达 960 个 AI 加速器。这一设计挑战了紧密耦合的机架系统与传统数据中心网络之间的边界。但它也带有一个关键限定:这是一项由部分硅芯片组件支撑的架构提案,而非已投入生产、拥有 960 个加速器的部署方案。

Panmnesia Meta CXL 架构发表于《Nature Reviews Electrical Engineering》2026 年 8 月 10 日刊登的一篇综述文章中。其目标是让 CPU、加速器和内存更像同一颗大型处理器中的组件。Compute Express Link,即 CXL,是一种开放互连标准,支持共享内存访问和硬件管理的缓存一致性。

这一目标使 CXL 与包括 NVLink、Ethernet 和 InfiniBand 在内的成熟纵向扩展互连和横向扩展网络并列。这些技术分别解决分布式计算的不同环节。论文认为,CXL 可将可预测、类似内存的通信延伸至 AI 数据中心更广的范围。

该提案之所以重要,是因为大型 AI 任务往往要等待其中最慢的设备。增加加速器能够提升理论容量,但也会带来更多通信路径和更多延迟机会。因此,核心竞争并非 CXL 与某一家厂商之间的较量,而是面向高度同步 AI 工作负载的硬件管理一致性与软件协调网络之间的竞争。

Panmnesia Meta CXL 架构实际提出了什么

该提案将 CXL 从服务器内存扩展技术推进为面向 AI 系统的跨机架纵向扩展互连。

这篇经过同行评审的 CXL 架构综述 描述了一种用于数据中心设计的“类单芯片”方案。这一表述并不意味着每台服务器在物理上融合为一体,而是指分离的资源遵循类似大型计算封装内部的通信和内存规则。

当前的 AI 系统通常包含多个通信层级。同一服务器或机架内的加速器可使用专用的高带宽互连。机架之间的流量通常则经由 Ethernet 或 InfiniBand 网络传输。软件、网络接口、协议栈和数据副本共同协调这一交换过程。

这些层级提供了路由灵活性和故障隔离能力,但也使时序变得更难预测。一次请求可能遭遇不同的队列深度、软件活动、拥塞状况和路径长度。大型同步任务会感受到这些差异,因为参与其中的加速器通常需要在集合通信或同步点汇合。

该综述将延迟离散度——即更快与更慢操作之间的差异——视为核心约束。平均延迟仍然重要,但较低的平均值可能掩盖具有破坏性的异常值。一个延迟的参与者就可能让数百个其他加速器处于等待状态。

Panmnesia 与 Meta 提议通过托盘、pod 和互连层资源组成的结构化层级来扩展一致性域。缓存一致性是确保处理器和设备之间共享数据副本保持一致的机制。硬件管理的一致性可减少应用程序通过网络软件协调每一次数据移动的需求。

拟议架构依赖三项核心硬件组件:高扇出、无阻塞交换机,用于连接大量资源并限制内部争用;链路加速单元,负责设备侧通信功能;以及互连控制器,用于在更大的一致性域中配置和管理资源。

这一层级结构旨在维持固定或规律的跳数。每当数据通过一个中间连接或交换机时,就会产生一次跳转。即便资源位于不同物理位置,保持路径一致也能缩小延迟差异。

这比为单台服务器附加额外内存更具雄心。已发布的设计将 CPU、加速器和内存设备视为可组合的构建模块。工作负载可通过共享地址结构访问这些资源,而不必将每个远程组件都视为独立的网络目的地。

作者描述了一种在单个一致性域中容纳多达 960 个加速器的配置。这一数字源于论文的架构安排,即通过更大的互连结构对加速器进行分组。它不应被解读为经过独立基准测试的生产集群。

这一区别定义了报道的核心张力:拟议系统提供了跨机架一致性的蓝图,而公开证据仅验证了这张蓝图的部分内容。《Nature》的发表支持该架构的研究意义,但并不代表其已具备商业就绪性。

为什么 AI 基础设施需要的不只是更快的加速器

压力来自同步通信、内存容量和不可预测的停顿,而不只是算力不足。

AI 基础设施供应商多年来一直在提高加速器吞吐量。然而,更大的模型将工作分配到更多设备上,使通信在总执行时间中的占比不断上升。每个加速器都必须与其他组件交换参数、激活值、梯度或路由信息。

同步训练任务通常只有在所有参与设备完成一个阶段后才能继续推进。如果下一步计算依赖于延迟同伴的数据,速度更快的设备也无法自行继续。随着系统规模扩大,遇到慢路径的概率也会增加。

这篇《Nature》综述指出,AI 模型参数量在五年内增长了一百万倍。这一比较说明了论文的研究动机,但模型规模本身并不决定基础设施需求。架构、稀疏性、精度和工作负载设计同样会影响模型所需的计算和内存资源。

推理带来了另一处压力点。大型推荐系统和语言系统可能将内存密集型服务分布在多台服务器上。网络化系统能够处理这类工作,但通常需要显式数据传输、软件协调和资源复制。

CXL 改变了计算与远程内存之间的接口。它不再将所有远程资源呈现为网络端点,而是可以通过加载和存储操作暴露内存。因此,处理器能够以面向内存的语义访问附接或池化的容量。

CXL 规范 逐步扩大了可用设计空间。早期版本聚焦于主机与设备之间的一致性连接,后续版本则增加了交换、内存池化、设备间直接通信和更广泛的互连功能。

这一演进解释了 Panmnesia 与 Meta 为何在此时提出该方案。CXL 已超越点对点服务器附接模型,其较新的互连功能支持更复杂的拓扑结构,尽管符合标准本身并不能带来可预测的数据中心性能。

Meta 已探索过一种规模更小的生产用途。其 Vistara 内存扩展器芯片通过 CXL 将回收的 DDR4 内存连接至较新的服务器。该设备将新增容量呈现为一个独立的 NUMA 节点,即具有不同访问特征的内存区域。

这一实现解决的是容量和硬件复用问题,而非整个数据中心的一致性。但它仍说明了超大规模云服务商为何重视 CXL。当主机平台更新换代时,附接于某一代服务器硬件的内存不必因此失去价值。

据报道,Meta 在其 MemServer 设计中将本地 DDR5 内存与速度较慢、经由 CXL 附接的 DDR4 相结合。Linux 可以将频繁使用的页面保留在本地内存中,同时将较冷的数据页迁移至扩展层。这种安排依赖于工作负载行为,因为频繁访问较慢内存可能会降低性能。

Panmnesia 在 2026 年 6 月的 International Symposium on Computer Architecture 上公布了另一组结果。根据其 ISCA 部署摘要,Meta 发现 CXL 内存可将分布式 AI 推理所需的服务器数量最多减少 25%。

同一份公司公告称,Meta 将分布式缓存的平均响应时间缩短了约 29%。这些结果涉及特定的生产服务和配置,并不能验证该综述完整的跨机架架构。

尽管如此,这些数字仍将更大的提案与一个具体的经济问题联系起来。未充分利用的内存可能闲置计算能力,而内存短缺则可能迫使运营商增加服务器。更好的池化可减少这种失衡,而无需让每台机器都配置其理论最大容量。

因此,眼下的压力主要落在围绕刚性服务器边界构建的基础设施上。它同样影响那些在有限物理域内提供高速加速器通信的专有纵向扩展系统。买家希望将这些优势扩展至更大规模的部署,同时不牺牲可预测的性能。

硬件一致性挑战软件协调网络

核心竞争在于受控硬件互连与通过软件协调分布式资源的灵活网络之间。

Ethernet 和 InfiniBand 已经连接了规模极大的 AI 集群。它们支持成熟的路由、运维、安全和故障管理能力。其规模使之不可或缺,Panmnesia Meta CXL 架构也不会令它们过时。

该提案针对的则是网络时序波动会造成影响的工作负载。传统横向扩展通信通常要求软件识别远程缓冲区、提交传输并检测完成状态。每个步骤都可能增加开销或延迟差异。

CXL 互连可在附接设备之间保留共享地址模型。硬件也可参与维护一致性。这种设计使远程内存或加速器看起来与发出请求的处理器结合得更紧密。

这种差异类似于组织项目的两种方式。一种方式是在独立团队之间发送正式消息;另一种方式则让参与者在一个共享且持续同步的环境中协作。后一种方式可减少协调步骤,但也会带来更强的依赖关系。

Panmnesia 提议的交换机很重要,因为早期 CXL 继承了 PCI Express 的一些结构特征。基于层级的路由通常以树状结构组织设备。树状结构易于管理,但其形态可能限制路径、扇出能力和大型互连设计。

基于端口的路由使用分配给互连端口的标识符来引导流量。它允许更灵活的拓扑,并可提供替代路径。Panmnesia 表示,其交换机同时支持基于端口和基于层级的路由,从而在保留兼容性的同时拓宽部署选择。

链路加速单元负责处理端点附近执行的工作。它旨在减少与一致性处理和其他协议活动相关的延迟。随后,互连控制器会协调整个系统的配置和资源分配。

这些组件共同的目标是稳定路径,而不只是降低某一项基准测试的平均延迟。该综述认为,硬件必须控制由路由、队列、控制器和竞争流量带来的波动。可预测性因此成为一种架构属性,而非偶然出现的基准测试结果。

Panmnesia 表示,其 CXL 和 PCIe fabric controller 及 link acceleration unit 已完成硅验证。该公司还称其 fabric switch 已完成流片,并已开始提供预发布硅片。这些说法表明项目已不止于软件模拟,但距离完整的数据中心部署仍有差距。

公开报道显示,该设计拟实现数百纳秒级的跨服务器访问。传统基于网络的访问通常处于微秒级时延范围。由于这两类方案涵盖多种配置,因此这一比较应被视为架构层面的参考,而非普适性基准。

所宣称的 960 加速器域体现了预期规模,但并不能证明该规模下的应用吞吐量、利用率或韧性。买家仍需看到覆盖训练、推理、内存池化及故障恢复的工作负载级结果。

专有加速器互连仍是另一个重要参考对象。NVLink 和 NVSwitch 可在支持的 Nvidia 系统内实现高带宽 GPU 通信。其他加速器供应商也围绕自身产品提供了类似的纵向扩展技术。

这些互连通常具备紧密集成和成熟的集合通信支持。但它们也可能将买家绑定至单一加速器系列或系统设计。CXL 的吸引力则在于,它可在处理器、内存和异构设备之间提供行业标准接口。

开放标准并不会自动实现互操作性。控制器、交换机、固件、操作系统和加速器仍需具备兼容行为。即便每个组件都通过协议兼容性测试,性能也可能存在差异。

因此,这一拟议 fabric 应被视为新增的基础设施层。Ethernet 和 InfiniBand 仍将处理那些受益于广泛覆盖范围和独立故障域的流量。专用加速器互连也仍会在高度集成的系统内部发挥作用。

CXL 将处于两者之间。它会将类似内存的访问与一致性扩展到服务器、机架或传统纵向扩展机箱之外。其价值取决于运营商能否在不将芯片级故障敏感性扩散至整个设施的情况下,获得这种更紧密的耦合。

真正的考验在于波动性、距离与故障隔离

如果长链路、拥塞或某个故障组件会让整个系统变得不可预测,那么一致性域的实用价值就会下降。

电信号传输构成了这一方案最明确的物理限制。高速电链路会随距离增加而损失信号质量。Retimer 可以恢复信号,但每增加一个组件,都会引入时延、功耗、成本和运维复杂度。

CXL 最初是为服务器内部及邻近系统之间的相对短距离连接设计的。将其延伸至跨机架场景,需要精细的通道设计;若扩展至整个数据中心,则需要不同的物理方案。

该综述指出,光链路和 CXL-over-optics 是突破电连接限制的路径。CXL-over-optics 通过光通信承载 CXL 流量,同时尝试保留其内存与一致性语义。光传输可覆盖比同类电链路更长的距离。

不过,光学并不能消除所有时延。电光转换、交换、协议处理以及更长的物理传输距离都会影响响应时间。关键挑战在于,能否将总路径时延严格控制在足以支持同步 AI 工作负载的范围内。

该架构也扩大了故障的影响范围。传统分布式系统假定节点和网络路径会彼此独立地发生故障。软件可以通过重试、复制或隔离任务来应对这些故障。

大型一致性系统会产生更多共享状态。交换机、内存设备、控制器或光路径的失效,都可能影响多个参与者。恢复机制必须在保证正确性的同时,避免单一故障令系统过大范围地停摆。

Nature 综述明确将一致性、内存层级、fabric 控制和光学集成列为持续研究方向。其要点还指出,该架构仍受限于电链路的范围。这种表述比“一个芯片”的比喻更为审慎。

安全性也带来了另一个悬而未决的问题。共享内存系统需要在不同工作负载和租户之间实施严格隔离。大型 CXL fabric 必须在更多设备之间保护地址空间、管理接口和内存内容。

运维软件的重要性将不亚于交换机硅片。Fabric controller 必须发现资源、应用策略、监控拥塞、隔离故障并协调维护。运营商还需要能够追溯究竟是哪条路径造成了时延异常值。

这一方案并未消除软件。它将对时间更敏感的协调工作转入硬件,同时将配置和策略分配给管理平面。这种分离可以降低运行时开销,但也带来了严苛的控制难题。

应用行为带来了另一项限制。局部性可预测的工作负载可以将频繁访问的数据保留在计算资源附近,并将池化容量用于较冷的数据。随机访问模式的工作负载则可能产生更多 fabric 流量,并承受更高的时延代价。

Meta 的内存分层案例反映了这一取舍。本地 DDR5 提供的带宽远高于附加的 DDR4 层。当软件能够识别稳定的工作集并将其保留在处理器附近时,页面放置策略才能发挥作用。

同样的规律也适用于加速器。CXL 内存可以增加容量,但无法复现安装在 GPU 旁边的高带宽内存所具备的带宽和邻近性。正确的比较方式并不是孤立地将远程 CXL 容量与本地 HBM 对照。

运营商应当考虑每类数据应归属哪一层。模型权重、键值缓存、嵌入向量、检查点和中间结果具有不同的访问模式。其中一些可以容忍更远的距离,另一些则依赖本地带宽。

独立测试需要衡量的不应只是有利的平均值。有效的评估应报告尾部时延、拥塞行为、每传输字节的能耗、故障恢复能力及应用完成时间。测试还应改变拓扑和工作负载放置方式。

最重要的证据缺口在于规模。Panmnesia 已描述核心组件的硅验证;Meta 已描述生产环境中的 CXL 内存使用。但两者都不构成对跨多个机架、960 个一致性加速器的公开端到端测试。

一项已报道的架构比较恰当地将该设计描述为一个拟议方向。该报道还指出,数百纳秒级数据不应被解读为已在所有部署中得到独立验证。

这种审慎态度并不削弱论文的价值。综述文章常用于梳理新兴领域并指出研究方向。该出版物的价值在于其系统级论证,而非证明某一商业产品已经满足所有要求。

CXL 正从内存扩展走向 Fabric Computing

这一更广泛的转变,正在让 CXL 从额外内存连接演变为可组合 AI 基础设施的候选骨干。

CXL 最初作为扩展服务器内存的实用方案而受到关注。Type 3 设备可通过一致性主机接口增加内存容量。池化随后允许多台主机从共享容量中获取资源,而不必为每台服务器预留相同容量的内存。

这解决了常见的资源利用问题:一些服务器内存不足,另一些则留有未被使用的容量。共享池可以让资源更贴近实际需求,减少闲置硬件。

半导体行业的多家公司已开发出 CXL controller、内存扩展器、交换机和 retimer。Intel 和 AMD 通过服务器处理器支持 CXL。内存和基础设施供应商也已推出围绕同一标准的设备。

Panmnesia 与 Meta 的 CXL 架构超越了这些组件级用途。它将 fabric 视为具备可预测路径的结构化计算系统。内存池化成为更大一致性域中的一项功能。

这一方向也改变了买家评估基础设施的方式。CXL 内存卡可通过容量、时延、带宽和兼容性进行评判;而数据中心 fabric 则需要额外衡量拓扑、路由、管理、隔离和故障行为。

Meta 的 Vistara 项目提供了一个有价值的历史阶段。该定制 CXL 2.0 芯片将 DDR4 内存连接至基于 DDR5 的较新系统。公开的 Vistara 实现细节描述的是面向生产环境的内存扩展设计,而非跨机架加速器 fabric。

这种较窄的应用场景很重要,因为成功的标准往往通过渐进式部署传播。运营商可以先从内存扩展开始,再增加池化、采用交换机制,随后测试更具雄心的一致性域。每一步都会积累运维经验。

Panmnesia 的战略覆盖了这一演进过程中的多个环节。其产品组合包括控制器知识产权、端点设计、交换机、retimer 和 fabric 管理。该公司正将自身定位为架构供应商,而非单一孤立组件供应商。

然而,商业定位与实际采用仍是两回事。Nature 文章的作者来自 Panmnesia 和 Meta,但共同署名并不意味着宣布供应协议,也不能确认 Meta 将部署 Panmnesia 的完整 fabric。

Meta 有充分理由研究开放互连。作为超大规模云服务商,它运营着多样化的处理器、加速器、存储系统和内存代际。标准化连接可以降低对单一设备系列的依赖,并支持更灵活的资源使用。

与此同时,当标准产品无法满足需求时,超大规模云服务商往往会自行开发定制芯片。Vistara 表明 Meta 能够为内部应用场景构建专用 CXL 设备。因此,Panmnesia 必须证明自身提供的价值超越协议本身。

其差异化基础在于低时延控制、灵活路由、更大规模的 fabric 和端点加速。这些主张需要与替代性 CXL 交换机及专有纵向扩展系统进行比较。买家也将评估软件集成与制造就绪程度。

竞争结果不会产生唯一的普遍赢家。AI 数据中心已结合多层互连,因为没有任何单一 fabric 能够优化所有距离和流量模式。更可能的问题是每一层的边界应从何处开始、又在何处结束。

在服务器内部,本地链路和内存总线仍不可或缺。在加速器机箱内,专有纵向扩展 fabric 可以提供极高带宽。跨机架时,Ethernet 和 InfiniBand 则提供了成熟的覆盖能力与运维独立性。

CXL 可能在这些层之间形成新的连贯区域。该区域可包括池化内存、存储级设备、CPU 和选定的加速器。其规模将由时延容忍度、故障边界和经济性决定。

这篇 Review Article 为该区域提供了一套连贯的架构词汇。Trays 将邻近组件分组;Pods 则连接更大规模的资源集合。Fabric 层连接这些分组,同时尝试保持规则化路径。

该模型类似于芯片设计,因为现代处理器同样以层次化方式组织资源。核心、缓存、内存控制器和互连均位于结构化区域中。这一方案将类似的放置和路由原则应用到了数据中心规模。

但这一类比终究存在边界。数据中心跨越更长距离,包含可替换设备,并服务于相互独立的工作负载。它无法接受芯片设计者在单一封装内可以容忍的所有限制。

因此,最可信的解读并不是一个字面意义上占满整个房间的处理器,而是一个数据中心:它拥有由硬件管理的更大区域、更直接的资源访问,以及比传统网络所能提供的更严密时序控制。

三个信号将表明该设计能否走出论文

下一阶段取决于端到端演示、光学验证,以及运营方能否在大型一致性互连中控制故障的证据。

第一个信号是使用完整架构进行多机架工作负载演示。它应结合所提出的交换机、链路加速单元、互连控制器、内存、CPU 和加速器。组件验证无法揭示共享流量下出现的所有交互问题。

一项有说服力的测试应在具有实际意义数量的加速器上运行同步 AI 训练或推理。它应报告中位延迟和尾延迟、实际实现的带宽、利用率以及总任务完成时间。结果应包含拥塞和混合流量场景,而不只是空闲互连。

接近所提议的 960 个加速器规模的证据,将有力支持该论文的核心论点。如果较小规模的演示能够展现跨机架的可预测扩展能力,仍然具有价值。若继续依赖组件级结果,最大的主张仍将未经验证。

第二个信号是端到端 CXL-over-optics 原型。电连接限制了一致性互连能够延伸的距离。因此,对于完整的数据中心愿景而言,光传输并非可有可无的点缀。

一个有价值的原型必须在测量转换延迟、链路稳定性、功耗以及光学故障恢复能力的同时,保持 CXL 行为。它还应展示交换机和控制器如何在更长距离上维持一致的路径。

成功的光学验证将加强这样一种论点:一致性域可以延伸至相邻机架之外。过高的延迟或运维复杂性会将 CXL 推回更小的 pod。届时,以太网和 InfiniBand 将保留更多跨机架互连角色。

第三个信号是关于故障隔离和软件运维的生产环境证据。大型一致性互连在设备或路径发生故障时,需要明确的恢复流程。它们还需要能够在工作负载停滞前识别拥塞和延迟波动的监控能力。

关注有关互连遥测、热插拔行为、安全边界和部分故障恢复的公开细节。部署公告应区分有限试验与生产服务。供应商关系也应与研究合作分别看待。

这一信号对该架构的强化或削弱速度,可能快于又一项延迟声明。如果故障变得更难控制,运营方不会扩大一致性域。可预测性必须包含恢复能力,而不仅是正常执行。

Panmnesia Meta CXL 架构为一个真实的 AI 基础设施问题提出了严肃的答案。当通信延迟令更多加速器处于闲置状态时,增加加速器并不能带来成比例的收益。由硬件管理的一致性为系统设计人员提供了另一种降低协调成本的方式。

该提案的重要性在于其实现机制及尚存的差距。Panmnesia 和 Meta 将经同行评审的架构论证与组件级芯片及范围更窄的生产证据连接起来。但他们尚未展示完整数据中心像一枚芯片那样运行。

开发者和企业采购方现在应将目光投向峰值加速器数量之外。应询问数据存放在哪里、移动频率如何、由哪些链路承载,以及其中一条路径变慢时会发生什么。随着供应商发布结果,请跟踪上述三个信号。如果多机架测试证实尾延迟稳定且故障得到有效控制,CXL 将从共享内存技术迈向定义 AI 互连的关键技术。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page