Panmnesia CXL Scale-Up Fabric 将 AI 服务器扩展至机架之外
Panmnesia 提出了一种 CXL scale-up fabric,可在机架之间延伸一致性通信,突破了长期限制 CXL 部署范围的电气距离限制。该设计将 CPU、加速器和内存置于一个更大的共享域中。其作者称,其中一种配置可容纳 960 个加速器。
这赋予了 Compute Express Link(即 CXL)比当前进入服务器的内存扩展产品更具雄心的角色。CXL 是一种开放互连技术,使处理器和设备能够共享内存,同时由硬件维持数据一致性。Panmnesia 和两位 Meta 研究人员正在探讨,这种语义能否延伸至 AI 数据中心中更大范围的基础设施。
该提案并未证明 Meta 计划部署此类 fabric,也未展示一个运行生产工作负载的完整 960 加速器系统。真正的竞争将在硬件一致性 scale-up 与当前用于连接跨机架资源的 Ethernet 或 InfiniBand 网络之间展开。
Panmnesia CXL Scale-Up Fabric 重新定义机架边界
该提案将机架边界视为工程约束,而非一致性计算机的永久边界。
该架构出现在 Nature Reviews Electrical Engineering 于 2026 年 8 月 10 日在线发表的一篇综述文章中。十位作者隶属于 Panmnesia,Kayvon Shakeri 和 Han Wang 则隶属于 Meta Infra。
这篇 CXL scale-up 综述描述了一种“像单芯片一样”的数据中心。这并不意味着机架会在字面意义上变成一个处理器,而是指将熟悉的芯片级特性——包括共享寻址和有序事务——扩展至更大的物理系统。
大多数生产服务器仍围绕相对固定的节点组织资源。主机处理器拥有本地内存,并通过短距离电气链路连接加速器。一旦工作负载跨越服务器或机架边界,数据便通过 Ethernet 或 InfiniBand 传输。
这一模式能够扩展至规模庞大的集群,但远程通信的行为不同于本地内存操作。软件必须准备消息、通过网络栈移动数据,并协调副本或同步。拥塞和路由变化也会导致完成时间出现波动。
拟议的 fabric 试图在更大范围内保留类似内存的访问方式。它结合了高连接度、无阻塞交换机,链路加速单元和 fabric 控制器。这些组件协同管理流量、一致性、恢复和资源放置。
Panmnesia 表示,在所审查的配置中,一个 CPU 可直接协调 16 个加速器,而其参考配置中为两个。作者还描述了一个最多包含 960 个加速器的一致性域,约为所引参考平台的 13 倍。
一致性域是一组共享一致内存视图的组件。当某个设备修改缓存数据时,系统会确保其他参与方不会继续使用过时版本。扩展这种行为能够减少部分软件协调工作,但也会让互连承担更多状态管理责任。
作者还估计,跨服务器的往返访问时间可达数百纳秒。传统基于网络的路径可能处于微秒级。这些数字说明的是该架构的预期效果,而非来自完整建成数据中心的独立性能基准测试。
这一差别至关重要。该提案延续了现有技术发展轨迹,但其最大配置仍是设计目标。物理组件和覆盖整个数据中心的系统处于不同的验证阶段。
为什么 AI 基础设施需要的不只是更快的加速器
AI 服务器正承受压力,因为已部署的计算、内存和带宽很少能以相同比例扩展。
AI 训练和推理会将工作分配到多个处理器上,因为单个加速器无法容纳大型工作负载所需的全部模型、激活值和缓存。增加加速器能够提升理论计算能力,但这些设备必须持续交换参数、中间结果和内存内容。
大型语言模型推理带来了尤为突出的内存问题。每个活跃序列都会生成一个键值缓存,其中存储了生成后续 token 所需的注意力数据。即使模型本身不变,更长的上下文和更多并发用户也会扩大该缓存。
运营商可以购买 CPU、内存和加速器配比固定的服务器。然而,需要额外内存的工作负载可能迫使他们购入更多未被充分利用的计算资源。反过来,一个节点中的闲置内存对其他内存不足的任务帮助有限。
CXL 池化将部分采购决策彼此分离。例如,CXL Type-3 设备可向主机提供内存,而无需表现得像另一台通用服务器。交换能力可以让多个主机访问资源池,而非将每项资源永久分配给一台机器。
Meta 已描述了一种范围更窄的生产应用。其 Vistara 项目通过定制 CXL 内存扩展芯片,将回收的 DDR4 内存连接至更新的服务器。根据在 ISCA 2026 展示的结果,所评估的分布式推理工作负载最多可减少 25% 的服务器需求。
Meta 还报告称,一个分布式缓存工作负载将平均查询处理时间缩短了约 29%。这些结果涉及服务器内部的实用内存扩展,并不能验证 Panmnesia 完整的跨机架架构。
不过,Vistara 提供了认真看待这一更广泛提案的重要理由。CXL 不再只是一项等待实用硬件落地的规范。一家超大规模云服务商已表明,在生产条件下,一致性内存扩展能够改变服务器数量和工作负载性能。
Panmnesia 则在推进该路径的另一侧。它开发旨在扩大 CXL 可连接设备数量的控制器和交换技术。该公司在 ISCA 2026 展示了低延迟控制器和基于端口路由交换机的芯片结果。
这项芯片评估报告称,在最多达到 64 个节点的配置中实现了稳定运行。该结果属于 Panmnesia 的控制器和交换机研究,而非拟议的 960 加速器部署。
Meta 和 Panmnesia 的项目共同缩小了两种不同的差距。Meta 展示了运营商为何可能在现实基础设施中使用 CXL。Panmnesia 则展示了专用硬件如何在不承受传统 PCIe 设计所有延迟成本的前提下,扩展至直连内存之外。
这种压力也延伸至加速器厂商和网络供应商。如果一致性 fabric 覆盖 AI 系统内部更多通信,一部分流量可能绕开网络栈。Ethernet 和 InfiniBand 仍将不可或缺,但内存访问与网络之间的边界将发生移动。
固定跳数硬件瞄准网络波动性
核心机制不只是原始链路速度,而是为数据和一致性操作提供更可预测的路径。
网络化 AI 系统通过接受多层抽象来适应距离。一个请求在抵达远程内存或另一加速器之前,可能经过软件、网络接口控制器、交换机、队列和协议处理。这种灵活性支持超大规模部署,但也带来了延迟波动。
该综述将快速与缓慢请求之间的这种差异视为系统级障碍。同步 AI 任务往往必须等待最慢的参与方后才能继续。平均延迟看似可以接受,但尾延迟仍会持续降低加速器利用率。
Panmnesia 的架构将处理器、加速器和内存组织为托盘和 pod,随后通过一种结构化 fabric 连接这些单元,旨在保持固定或有界的跳数。资源放置遵循芯片平面规划中的概念,即物理位置会影响通信时间。
无阻塞交换机旨在连接可用输入和输出,不会强迫无关传输等待同一内部路径。高扇出使一个交换元件能够触达许多端点。这两项特性都无法消除争用,但都可能使系统行为更易于规划。
链路加速单元负责管理原本需要较慢介入的操作。Panmnesia 描述了用于缓存一致性功能的硬件,包括跟踪相关缓存数据及使过期副本失效。fabric 控制器则提供系统级协调和资源管理。
Panmnesia 的控制器工作还针对 CXL 协议路径内部的开销。由于 CXL 使用 PCIe 物理层,许多早期实现采用了面向 PCIe 的控制器设计。这种方法简化了开发,但保留了为外设流量设计的缓冲和同步选择。
该公司称,其控制器在内部层之间共享缓冲区,并移除了其中一些同步操作。其交换机采用基于端口的路由,根据端点标识符转发流量。传统的分层路由会将设备限制在树状组织中。
基于端口的路由允许更灵活的拓扑和路径选择。该交换机同时支持两种方式,以便在分层结构仍合理的场景中保持兼容性。Panmnesia 认为,这些变化抵消了流量经过交换机时引入的大部分延迟。
这项控制器设计非常重要,因为每增加一跳都会威胁 CXL 的价值主张。能够共享资源、却让内存速度变得不可预测的 fabric,只会转移瓶颈,而无法消除瓶颈。
硬件一致性还可以消除重复的数据复制。CPU 和加速器能够使用共享内存协同工作,同时由控制器确保一致性。软件仍需要分配和调度策略,但不必将每次传输都实现为显式网络交换。
以一个加速器需要大型共享缓存的推理服务为例。基于网络的系统可能会划分缓存、复制条目,或通过远程直接内存访问获取远程块。一致性 fabric 则将内存呈现为由硬件协议管理的可寻址容量。
这并不会让远程内存变成本地内存。距离、交换机、介质转换和内存设备仍会增加延迟。其优势在于提供了稳定的访问模型,软件能够识别并据此进行调度。
这正是 Panmnesia CXL scale-up fabric 与一条更快电缆的不同之处。它将控制功能移入 fabric,再对物理资源进行布局,使通信路径保持规则。它能否成功,取决于整个系统在扩展时能否维持这些特性。
CXL Over Optics 延伸距离,但改变工程方程
光链路解决了电气距离问题,但也引入了该提案尚未解决的成本、功耗、可靠性和集成问题。
高速电信号在短距离连接中表现良好,包括服务器内部走线和跨越邻近设备的线缆。随着数据速率和距离增加,信号损耗会变得更难管理。重定时器能够恢复信号,但每增加一个组件都会消耗功率并增加延迟。
光纤能够以更低的距离相关损耗,将高带宽流量传输得更远。光学 CXL 将电气协议转换为光信号进行传输,然后在接收端附近将这些信号转换回来。这种方法可将 CXL 的传输距离延伸至铜缆实际可达范围之外。
该综述将电光集成视为突破当前链路限制的路径。这一点至关重要,因为覆盖多个机架的一致性域不能依赖理想化的电气连接。物理传输介质成为架构的一部分,而不再只是留给部署团队处理的细节。
光学 CXL 在技术上具有可信度。Rambus、Samtec 和 Viavi 此前已展示过一种通过光缆实现的远程 CXL 内存扩展方案。MACOM 也推出了一款旨在通过光纤传输 PCIe 和 CXL 流量的芯片组。
Marvell 已在其更广泛的数据中心产品组合中展示了光学 PCIe 和 CXL 连接能力。Marvell 作者于 2026 年发表的一篇研究论文提出了一种用于大语言模型缓存存储的光子 CXL 内存设备。其报告结果来自仿真和模拟,而非已被广泛部署的产品。
更广泛的市场也在朝着同一方向发展。NVIDIA 已在其 InfiniBand 和以太网网络系统中使用光收发器。Optical Compute Interconnect 团队正在为扩展型 AI 系统开发一种开放、与协议无关的光学连接方案。
这些努力强化了在计算资源附近采用光学互连的理由,但也带来了竞争。数据中心运营商可能更倾向于选择可承载多种协议的光学层,而不是与 CXL 语义紧密关联的单一架构。
CXL 4.0 specification 提升了带宽,并引入了面向更大规模系统的能力。但规范并不保证不同供应商的光模块、交换机、主机和管理软件能够在所需延迟下实现互操作。
每一次电光转换都会引入新的故障点。激光器会老化,连接器会积累污染物,热条件也会影响组件。工程师必须确定:发生光通道故障时,能否在不干扰更大一致性域的前提下将其隔离。
功耗是另一项约束。在达到足够传输距离和带宽时,光互连可能比电气链路更高效。不过,收发器和转换电子设备仍会消耗能源。其效率交叉点取决于传输距离、通道速率、封装、利用率和散热条件。
成本比较同样需要谨慎。资源池化可以减少闲置资源,但光学互连网络会增加交换机、模块、控制器、光纤和运维复杂性。使用更少服务器所带来的节省,必须在整个使用寿命内超过互连网络的完整成本。
延迟也不只取决于传播时间。干净的光学通道并不能消除排队、协议重试、地址转换或一致性流量。所宣称的数百纳秒级范围,必须在负载、故障和混合访问模式下依然成立。
这些问题并不会否定远距离 CXL。它们界定了将一种架构转化为基础设施所需完成的工作。决定性证据将来自端到端系统,而非孤立的链路测量。
真正的竞争:一致性纵向扩展与网络化横向扩展
CXL 无需取代以太网或 InfiniBand 才具备价值,但它必须赢得对这些网络如今所承载流量的控制权。
纵向扩展将组件连接起来,使其像一台更大、紧密耦合的计算机一样运行。横向扩展则通过网络连接彼此独立的计算机。AI 数据中心同时采用两者:系统内部使用短距离专有链路,系统之间则由网络互连架构连接。
NVIDIA 的 NVLink 和 NVLink Switch 可在受支持的平台内提供紧密耦合的加速器通信。UALink 致力于为加速器建立开放的纵向扩展互连。以太网和 InfiniBand 仍是跨机架及大型集群传输 AI 流量的主要选择。
CXL 起源于不同的定位。它早期的吸引力集中在内存扩展、分层和池化上。它通过 PCIe 物理层提供缓存一致性协议,并支持加速器之外的设备。
Panmnesia 的方案试图扩大这一职责范围。如果 CPU 能够跨机架寻址更多加速器和共享内存,CXL 互连网络便开始类似于完整 AI pod 的系统背板。网络随后再将这些一致性 pod 连接到更远的距离。
这种分工最有说服力的场景,是具有频繁、细粒度内存访问的工作负载。通过软件负担较重的网络路径发送大量小请求,可能带来显著开销。硬件一致性可以使这些访问更加直接且更具可预测性。
网络化横向扩展仍更适合松耦合服务和故障隔离。一台服务器可以重启,而不必扰动所有对等节点。运营商熟悉以太网管理,市场上也拥有广泛的兼容硬件选择。
巨型一致性域本身也带来协调成本。随着更多设备参与,控制器必须跟踪所有权和缓存副本。即使应用程序没有传输有用数据,这些机制产生的流量也可能消耗带宽。
故障行为变得尤其重要。该综述设想通过替换故障设备,而不是让整台服务器退出服务。要实现这一结果,需要精确的错误隔离、一致的状态恢复,以及能够适应拓扑变化的软件。
安全边界同样发生变化。具备内存语义的访问与具有明确端点的基于数据包的服务相比,可能以不同方式暴露资源。访问控制、隔离、加密和可观测性必须覆盖整个互连网络。
官方 CXL architecture 提供了标准化的协议基础,但运营商仍需要其之上的编排能力。调度器必须理解哪些内存是本地的、哪些是远程的,以及哪些加速器共享最短路径。
应用程序不能假定统一地址空间中的每一个字节都具有相同的性能。页面放置和内存分层将决定工作负载能否从池化容量中受益。错误的放置可能将便捷寻址变为反复的远程访问延迟。
这为网络供应商创造了机会,而非必然的失败。智能网卡、远程直接内存访问以及优化的集合通信库都在持续降低横向扩展的开销。以太网供应商也正在为 AI 工作负载增加拥塞控制和遥测能力。
最可能的结果是分层架构。专有加速器链路可能主导最短距离的纵向扩展域。CXL 可在更广泛的 pod 中连接内存和异构资源。以太网或 InfiniBand 则可连接 pod、建筑物以及地理位置分散的设施。
Panmnesia 的设计之所以重要,是因为它主张移动这些层之间的边界。该公司并非只是提供更多内存插槽,而是提出让 CXL 承担 AI 系统中更大部分的通信和控制平面。
一篇综述文章并非 960 加速器部署
现有证据支持一项严肃的架构方向,而不是一个已完成的数据中心产品或已宣布的 Meta 部署计划。
这篇发表于 Nature 的文章是一篇综述,而非一套已按完整提议规模运行的系统报告。它结合了架构分析、现有技术和经过验证的组件。读者应区分不同类别的证据。
Panmnesia 表示,其控制器和链路加速单元已完成硅片验证。其互连网络交换机已完成制造,并已提供预发布硅片。另有独立的 ISCA 工作报告称,该方案在最多 64 个节点下表现稳定。
对于一家无晶圆厂半导体公司而言,这些里程碑具有重要意义。它们表明,架构的一部分已超越示意图和软件模型。但它们并不能证实该系统能够在 960 个加速器和多个光学机架之间实现一致性运行。
大规模和延迟对比描述的是该架构旨在提供的能力。独立工作负载、持续流量、组件故障和多供应商硬件,都可能暴露较小规模测试无法发现的约束。
Meta 的角色同样值得精确表述。两名 Meta Infra 研究人员共同撰写了这篇综述,并参与了其讨论。该出版物并未包含 Meta 将构建 Panmnesia 所提互连网络的承诺。
Meta 公开描述的 CXL 部署是 Vistara,这是一套在新型服务器中复用 DDR4 模块的内存扩展系统。其数据中心网络在单个系统之外的通信中,仍依赖基于以太网的基础设施。
研究合作可以影响未来设计,但不等于产品路线图。Meta 会评估许多技术,而超大规模云服务商也经常发布前景可观、却从未获得全规模部署的研究成果。
Panmnesia 对 CXL 的广泛采用同样拥有直接商业利益。十名作者与该公司有关联,综述中的利益冲突声明也标明了这些关系。这并不会否定技术论点,但使外部验证变得至关重要。
960 加速器这一数字引发了实际问题。系统必须维护多少目录状态?在共享写入下,一致性流量会如何增长?交换机、链路或端点发生故障后,互连网络能多快恢复?
软件构成另一项考验。操作系统可以暴露 CXL 内存,但 AI 框架和调度器必须决定何时使用它。如果软件反复将延迟敏感数据放置在远离使用该数据的加速器的位置,那么名义上的共享资源池几乎不会带来价值。
互操作性可能同样困难。一个有用的互连网络应能组合来自多家供应商的处理器、加速器、内存设备、交换机和光学链路。专有扩展或许能改善某一种配置,却可能削弱开放标准的经济合理性。
因此,行业应避免两种捷径。既不应因为完整系统尚不存在就否定这项工作,也应避免将架构估算描述为生产基准。
最可信的解读介于这两个极端之间。Panmnesia 已验证相关硅片,并阐明了一套能够解决真实通信问题的系统。其最大的性能和规模主张仍需要端到端验证。
三个信号将表明远距离 CXL 是否已经就绪
下一阶段取决于完整系统验证、光学互操作性和软件采用,而非又一张架构图。
第一个信号是运行具有代表性 AI 工作负载的跨机架原型系统。它应通过所提出的交换层级连接处理器、加速器和池化内存。公开结果必须包括中位延迟和尾延迟、争用下的带宽、功耗以及故障后的恢复情况。
接近 960 加速器目标的测试将有力支持 Panmnesia 的论点。较小的系统同样可能具有价值,前提是它能说明哪些限制属于物理、架构或经济层面。若结果仅限于模拟,核心部署问题仍将悬而未决。
第二个信号是多供应商 CXL-over-optics 演示。它应结合来自独立供应商的主机硅片、交换机、光模块和内存设备。当运营商能够在不重新设计互连网络的情况下替换某个组件时,标准合规性才最具意义。
此类演示应在报告传输距离和通道速率的同时,披露转换延迟和每传输比特的能耗。它还应展示链路恢复和错误处理能力。只有当最终系统仍可管理时,光学传输距离才真正具有价值。
第三个信号是软件支持将一致性资源视为性能层级。操作系统、调度器和 AI 框架需要具备拓扑感知能力,必须根据延迟、容量和当前拥塞情况部署模型状态与缓存数据。
开发者应关注将这类软件与可衡量应用成果联系起来的生产案例研究。实用指标包括首个 token 生成时间、每秒 token 数、加速器利用率,以及每种工作负载所需的服务器数量。
对于企业采购方而言,核心问题不在于 CXL 是否具有技术吸引力,而在于可组合基础设施能否在不增加故障排查和容量规划难度的前提下提升资源利用率。
对于工程师而言,这一方案改变了服务器边界的定义。服务最终可能跨越多个机架访问资源,同时由硬件在其软件栈底层处理一致性。这或许能简化其中一个层面,却也使拓扑感知在其他环节变得不可或缺。
对于知识工作者和 AI 用户而言,这些硬件选择会影响服务响应速度和上下文容量。更大的共享内存池可以支持更长的对话或更多并发请求,但前提是数据移动始终保持可预测性。
评估这些主张的团队应保留其背后的论文、基准测试细节和供应商披露信息。可搜索的技术知识库有助于将未来结果与当下的架构承诺进行比较。
Panmnesia CXL scale-up fabric 已指明一条可信路径,可突破受机架限制的一致性边界。如今,行业还需要完整的光学系统、独立的工作负载数据,以及能够智能利用其拓扑的软件。哪家供应商会率先公布这些证据?



