top of page

Panmnesia Meta CXL 架构将 AI 数据中心重塑为一颗芯片

6小时前
讀畢需時 14 分鐘

Panmnesia 与 Meta 提出了一种 CXL 设计,在突破当前机架边界的情况下,可在同一一致性域内协调多达 960 个加速器。Panmnesia Meta CXL 架构将 AI 数据中心视为一个统一管理的计算系统,而非一组通过网络相连的服务器。这一构想挑战了 AI 基础设施扩展的主流路径。

该提案见于 Nature Reviews Electrical Engineering 于 2026 年 8 月 10 日发表的一篇 CXL 数据中心综述。其将处理器、加速器、内存和交换机组织为一个受控层级,横跨托盘、Pod 及更大规模的 Fabric。专用硬件将减少请求穿越该层级时出现的不一致通信延迟。

这并非又一项更高速连接方案。Nvidia 的 NVLink 将紧密协同的加速器通信集中在 GB200 NVL72 等系统内部。Ethernet 和 InfiniBand 通常负责机架之间的流量。Panmnesia 与 Meta 希望借助 CXL,即 Compute Express Link,将一致性资源访问进一步延伸至整个数据中心。

他们的论点伴随着两项重要证据。Panmnesia 表示,已完成核心控制器、交换机和链路处理组件的流片或验证。Meta 则已在生产基础设施中单独部署其 Vistara CXL 内存平台。

这些成果使 CXL 更难被视为仅限实验室的技术。但它们并不能证明整个 AI 数据中心已可像一颗芯片般运行。核心考验在于:可预测的延迟、故障隔离和软件控制能否在经过精心组织的部署之外依然成立。

Panmnesia Meta CXL 架构改变了计算单元的边界

该提案将架构边界从服务器或机架,推向整个协同的数据中心 Fabric。

传统服务器拥有一组明确的处理器、内存和连接设备。软件能够通过相对可预测的访问路径协调这些组件。流量一旦离开服务器,便会进入采用不同协议、具有不同延迟、拥塞行为和故障条件的网络。

现代 AI 集群已在削弱这种以服务器为中心的模式。一项训练或推理任务可占用数百个加速器。这些设备会反复交换参数、梯度、嵌入向量和中间结果,而非处理彼此完全独立的请求。

增加加速器会提升理论计算能力,同时也会增加一次延迟传输让其他设备陷入等待的机会。当一条迟到的消息穿过拥塞或异常漫长的路径时,昂贵的处理器可能处于闲置状态。

原始报道将重尾延迟描述为核心问题。Panmnesia 表示,在现有环境中,实测第 99 百分位往返延迟可能达到中位数的大约五倍。随着更多设备加入,这一差距使任务完成时间更难预测。

拟议中的单芯片数据中心通过规则的托盘、Pod 和 Fabric 层级来应对这种波动。资源将按功能分组,而不是永久捆绑为完全相同的服务器。CPU 可位于一类托盘中,加速器和内存则位于其他类别中。

这种解耦改变了基础设施运营商分配设备的方式。工作负载可以获得所需的处理器、内存和加速器,而无须预留多台完整服务器中的每个组件。闲置容量将更容易分配给其他用途。

它也改变了替换边界。按照该提案,运营商可替换故障加速器或内存设备,而无须将其所在服务器视为基本故障单元。该方式可能减少闲置硬件,但运营收益仍需通过生产环境验证。

CXL 为这一设计提供了共同语言。它是一项开放互连标准,支持主机与连接设备之间的 I/O、缓存一致性访问和内存事务。一致性意味着参与组件能够维持对共享数据的一致视图,而不必完全依赖应用层复制。

CXL 3.0 增加了 Fabric 能力和基于端口的路由,后者通过分配给 Fabric 端口的标识符引导流量。该标准支持非树状拓扑,并描述了最多可包含 4,096 个节点的 Fabric。这些协议能力提供的是基础,而非完整的数据中心架构。

Panmnesia 与 Meta 则加入了路由、排序和延迟控制机制。因此,重要变化不只是采用 CXL,而是尝试让大型 Fabric 以通常与较小型计算机相关的某种严谨性运行。

为什么 AI 基础设施正面临协同瓶颈

如今,AI 基础设施对可预测数据传输的依赖程度,已不亚于对增加算力的依赖。

庞大的加速器数量在系统规格中颇为亮眼。但实际性能取决于这些加速器在真实工作负载中交换数据的一致性。集体操作通常要求每一位参与者在工作继续前到达同一个同步点。

这种行为会让缓慢的异常值演变为全系统成本。单个延迟设备就可能延长一次操作,因为每个加速器都在等待其结果。即使 Fabric 提供很高的平均带宽,只要尾延迟仍不可预测,性能依然可能不及预期。

Meta 自身的加速器工作说明了这种压力。其 MTIA 300 训练芯片集成了网络接口和通信引擎,因为推荐模型需要频繁移动数据。Meta 表示,嵌入表可占推荐模型参数的 99% 以上。

这类工作负载会在大量加速器之间频繁执行 AllReduce、AllToAll 和 AllGather 操作。这些集体操作在参与处理器之间合并或重新分发数据。当相同硬件资源同时处理通信与模型计算时,它们可能彼此竞争。

Meta 为 MTIA 300 设计了专用消息引擎和内置网络 Chiplet,以将通信与计算分离。根据 Meta 的 MTIA 300 结果,其通信系统在单个机架内可实现最高 940 GB/s 的带宽。

Meta 还称,在一个生产推荐模型上,其通信速度是等效 GPU 集群的 3.9 倍。该测试涉及一个跨 40 个加速器运行、拥有 1,500 亿参数的模型。这些仍是公司报告的特定工作负载结果,并非普遍比较。

更广泛的经验支持 Panmnesia Meta CXL 架构。通信正从处理器封装、机架一路延伸至数据中心,成为一级设计约束。若分别优化每一层,边界处的延迟与资源利用率仍会恶化。

当前的纵向扩展互连解决了其中一部分问题。Nvidia 的 NVLink 可在受支持的 GPU 系统内部提供高带宽通信。UALink 正在开发由行业支持的纵向扩展替代方案,旨在连接来自多家供应商的加速器。

Ethernet 和 InfiniBand 则处理更大规模集群中的横向扩展通信。这些技术仍不可或缺,因为它们提供了成熟的网络、路由和运维工具。CXL 提案并未令它们失去必要性。

相反,拟议中的 CXL 纵向扩展 Fabric 重新定义了运营商从一致性资源访问切换到基于网络的消息交换的位置。Panmnesia 与 Meta 希望将这一转换点推离每一台设备更远。其架构将把更多加速器和内存纳入同一个受控域。

这种扩展会给 Nvidia 及其他系统供应商带来压力。威胁不只是又一条具有竞争性带宽指标的互连链路,而是一个围绕开放规范构建、可组合性更强的系统模型。

理论上,遵循这一模式的运营商可混合不同资源类型,而无须接受某一家供应商的整套机架架构。不过,符合标准并不保证实际互操作性。固件、操作系统、管理层、安全策略和工作负载调度器也必须协调一致。

因此,竞争边界在于架构。专有的机架级系统提供更紧密的集成与既有性能,而以 CXL 为中心的模式则承诺更广的域、更细粒度的资源分配和更大的供应商灵活性。

三项硬件控制机制让单芯片数据中心成为可能

Panmnesia 的设计重点在于限制延迟波动,因为仅凭原始链路速度无法造就可预测的系统行为。

第一个组件是高扇出、无阻塞交换机。高扇出使一个交换层能够连接大量设备。无阻塞设计旨在避免某一流量路径天然排斥另一条可用连接。

减少交换级数可降低跳数。保持路径长度相近,也会缩小近端与远端资源之间的差异。当数百个加速器反复等待共享操作时,这种规律性尤为重要。

第二个组件是链路加速单元,即 LAU。它将重复性的连接层协议工作转移到专用硬件流水线中。该流水线旨在使每一跳的处理更加规律。

卸载协议处理可减少通用处理引入的时序波动。由于明确的硬件承担重复任务,路径也更易于分析。Panmnesia 尚未公布足够的公开工作负载数据,以证明其在提议的完整规模下的表现。

第三个组件是结合 CXL 与 PCIe 控制的 Fabric 控制器。它在整个系统中应用统一的请求排序策略。当事务可能穿越许多交换机和设备、沿不同路径传输时,一致的排序至关重要。

这些组件共同应对三种不确定性来源:路径长度、逐跳处理和事务排序。该架构试图让通信延迟具备边界,而非仅在平均水平上更快。

Panmnesia 表示,Fabric 控制器和 LAU 已完成硅验证。该公司还称,其 Fabric 交换机已完成流片,并正在供应预发布硅片。这些步骤使该项目区别于仅由仿真支持的架构。

该公司的 ISCA 披露提供了另一个有用的检查点。Panmnesia 于 6 月 29 日在 Raleigh 举行的 ISCA 2026 上展示了基于硅片的 CXL 控制器和基于端口路由的交换机。

据 Panmnesia 称,该演讲之前经历了约六个月针对该会议 Industry Track 的同行评审。同行评审增强了特定投稿的技术基础,但并不能验证其后提出的每一项商业或数据中心规模声明。

已发布的架构称,一颗 CPU 可直接协调 16 个加速器。Panmnesia 强调的对比是,Nvidia 的 GB200 NVL72 配置中每颗 CPU 对应两个加速器。这得出了所述八倍的直接协调差异。

在更大的层级中,该设计支持在一个一致性域内接入多达 960 个加速器。Panmnesia 将其描述为大约是基于 NVLink 的机架内加速器数量的 13 倍。这一比较反映的是不同的架构边界,不应被视为完整的性能基准。

研究人员还估计,数据访问延迟可从微秒级网络延迟降至数百纳秒。这在比较条件下大致相当于一个数量级的降低。端到端应用性能仍将取决于争用、软件、拓扑结构和内存放置方式。

官方 CXL fabric specification 解释了为何这种拓扑在技术上是可行的。CXL 3.0 支持跨主机的一致性内存共享,并引入基于端口的路由以构建更大规模的网络结构。

不过,该标准并未规定 Panmnesia 完整的控制系统。它定义的是供应商据以构建产品的协议工具。控制器、交换机、LAU 和管理软件决定了这一实现能否提供可预测的行为。

这一差别对买家而言至关重要。CXL 标签确认的是与行业标准部分内容的兼容性。它并不会自动实现所提议的单芯片数据中心、统一延迟或高效的工作负载调度。

Meta 的 Vistara 部署让 CXL 不再只是提案

Meta 的生产经验表明,CXL 能够改善真实服务,不过 Vistara 解决的问题比这一新架构更为有限。

Meta 将 Vistara 开发为端到端的 CXL 内存扩展平台。它包括定制专用集成电路、固件、操作系统支持和大规模部署工具。该系统为原本受内存容量限制的服务器连接额外内存。

内存容量是超大规模基础设施中反复出现的问题。CXL Consortium 对 Meta 项目的介绍称,其约 40% 的服务器受内存容量限制。当应用需要在可访问内存中容纳更大数据集时,增加处理器无法解决这一问题。

传统服务器配置会促使资源过度配置。运营商必须在每台机器中安装足够的内存,以覆盖预期峰值。一些服务器最终拥有闲置容量,而另一些则无法为不断增长的工作负载容纳足够内存。

CXL 内存扩展创造了另一层级。软件可以将访问频率较低的数据放在外接内存中,同时将频繁访问的数据保留在更快的本地内存中。平台必须谨慎管理这种放置,因为不同层级的延迟和带宽各不相同。

Meta 还利用 Vistara 将回收的 DDR4 内存连接到围绕 DDR5 设计的新系统。这延长了现有组件的可用寿命,并降低了仅安装新内存的依赖。不过,这也引入了需要感知工作负载进行管理的较慢内存层级。

生产结果值得关注。根据 CXL Consortium 的 Vistara deployment summary,Meta 已在数百万台服务器和多个工作负载类别中部署该平台。

Meta 表示,CXL 扩展将解耦式机器学习推理所需的服务器数量最多减少了 25%。该公司还报告称,分布式缓存的平均延迟降低了 29%。这两项数据描述的是特定生产结果,并非对所有服务的保证。

缓存结果听起来有些反直觉,因为 CXL 外接内存可能比本地 DRAM 更慢。但当本地内存不足会导致更昂贵的网络请求、数据驱逐或存储访问时,更大的容量仍可改善应用延迟。较慢的内存层级可以避免启用更慢的后备方案。

这一经验验证了 Panmnesia Meta CXL 架构所需的若干组件。定制芯片可以在大规模部署中处理 CXL 流量。操作系统可以暴露扩展内存,而生产软件可以根据访问模式放置数据。

Vistara 也表明,链路周边需要大量工程工作。硬件本身无法决定哪些页面应属于每个内存层级。遥测必须识别访问模式,软件则必须在不破坏应用稳定性的情况下作出响应。

这一新提案进一步扩展了该挑战。它从在服务器后方增加内存,转向在大型网络结构中协调处理器、加速器和内存。随着一致性域扩大,调度和故障处理变得更加复杂。

因此,Vistara 是可行性的证据,而非对完整愿景的证明。它证实 CXL 能在超大规模生产环境下带来可衡量的价值。但它并未展示 960 个加速器在所提议层级中运行一个同步 AI 工作负载的能力。

这一差别避免了两种相反的错误。将该架构视为纯粹推测,忽视了 Meta 的部署和 Panmnesia 的芯片。将 Vistara 视为数据中心级一致性域的验证,则是将证据延伸到了 Meta 报告之外。

延迟、故障和软件仍是最严峻的考验

该架构最重要的承诺——数据中心规模的可预测性——也是最需要强有力独立证据支持的主张。

一致性域随着规模扩大而更难管理。每个参与者都需要对共享内存保持一致视图,同时事务必须遵循排序和所有权规则。更多设备也意味着更多拥塞、故障和意外交互的机会。

Panmnesia 通过固定跳数组织、硬件协议处理和集中式排序策略来应对路径变化。这些机制是合理的。公开报道尚未提供在 960 加速器部署中满载运行的测量结果。

数百纳秒级访问延迟的估计,只有结合其运行条件才有意义。买家需要在多个负载水平下了解延迟分布,包括中位数和尾部表现。他们还需要在内存、加速器和控制流量同时运行时的测量结果。

带宽同样值得严格审视。如果多个加速器同时请求同一内存或路由资源,即便网络结构具有可预测性,仍可能成为瓶颈。无阻塞交换机设计可减少内部冲突,但所连接的链路和目标设备仍受物理限制。

一致性流量可能在不传输应用数据的情况下消耗容量。缓存失效、所有权变更、重试和排序消息都会增加工作量。开销高度取决于工作负载共享模式和软件放置决策。

故障处理带来另一种张力。资源解耦让运营商能够替换单个故障组件,而非整台服务器。然而,更大的共享域可能增加暴露于交换机、控制器或网络管理故障风险下的工作负载数量。

因此,该架构需要清晰的故障边界。运营商必须知道,故障链路会隔离一个设备、一个托盘、一个 pod,还是更广泛的域。恢复过程还需要在作业继续运行或重启时保持数据一致性。

当内存可跨主机访问时,安全边界变得更加重要。CXL 规范包括隔离和安全机制,后续版本还扩展了设备管理和链路保护功能。不过,具体实现仍必须在硬件和软件中正确配置这些能力。

多供应商互操作性构成另一项风险。CXL 提供开放协议,但完整系统依赖处理器、加速器、内存设备、交换机、固件、操作系统和编排工具。微小差异可能仅会在复杂的生产流量下显现。

Nvidia 的垂直整合模式规避了其中一部分不确定性。供应商可以围绕已知组件协调硬件、固件、库和系统设计。客户以灵活性换取更窄的支持边界和更统一的性能范围。

CXL 横向扩展网络则采取相反路线。它承诺可组合性、更广泛的资源共享,以及更少依赖于单一加速器系统。除非供应商将这些层级打包为受支持的平台,否则运营商需要承担更多集成工作。

软件可能成为决定性层级。调度器需要具备拓扑感知能力,避免将工作负载分配到技术上具备一致性、但资源位置欠佳的组合上。内存放置必须兼顾带宽、复用和延迟敏感性。

开发者也需要实用的抽象。大多数 AI 团队不会手动管理数百台设备间的缓存行。框架和通信库必须将模型行为转化为高效的网络结构操作。

Panmnesia Meta CXL 架构仍具可信度,因为其作者承认这是一个系统问题,而不仅仅是信号传输问题。其商业前景仍未确定,因为芯片可用性只是部署准备度的一部分。

三个信号将表明 CXL 能否走出机架

接下来的证据必须将 Panmnesia 已获验证的组件,与在逐步扩大的生产规模下可重复的工作负载结果联系起来。

第一个信号是使用 Panmnesia 已出货或预生产芯片进行的端到端系统基准测试。它应包括控制器、LAU、交换机、软件栈和多个资源托盘。测量结果应报告持续争用下的中位数和尾部延迟。

有说服力的测试还应将相同工作负载与成熟的 NVLink、Ethernet 或 InfiniBand 配置进行比较。仅靠加速器数量无法决定比较结果。实用指标包括完成时间、设备利用率、能耗、恢复行为和软件开销。

如果 Panmnesia 发布可重复的多 pod 结果,其核心主张将更有说服力。如果性能随着流量扩大而急剧恶化,单芯片数据中心仍将是一种架构方向,而非可部署的系统。

第二个信号是超越技术设计团队的商业采用。Panmnesia 表示正在为商业供应准备经过验证的组件。具名的服务器、交换机、内存或加速器合作伙伴,将显示可互操作的产品生态系统是否正在形成。

客户试用比组件发布更重要。买家应关注是否有其他运营商通过完整的 CXL 横向扩展网络运行生产工作负载。Meta 之外的部署将减少对单个超大规模运营商专有工程资源的依赖。

缺乏采用并不会否定这项研究。它只会表明,集成成本、风险或专有替代方案仍更具吸引力。开放标准只有在多个供应商和客户能够共同使用时,才具备战略重要性。

第三个信号是既有互连生态系统如何回应。Nvidia 正持续扩展 NVLink 和其机架级系统。UALink 支持者正在为加速器横向扩展开发另一条开放路径,而 Ethernet 供应商则在降低 AI 流量的延迟。

直接的竞争回应可能会强化 Panmnesia 和 Meta 的判断。它将表明,更大、更可预测的协调域已成为采购优先事项。如果更快的专有系统更早触达客户,也可能削弱 CXL 的地位。

CXL 无需取代每一种 AI 网络才具有意义。内存扩展、池化和一致性设备访问可以与 Ethernet、InfiniBand、NVLink 或 UALink 并行创造价值。混合架构比由一种网络结构承担所有职责更有可能出现。

因此,基础设施采购方应将问题拆分为三个:CXL 是否解决了真实的资源问题?这一实现能否在承诺的规模下控制延迟?由此带来的利用率提升,是否足以证明其运维复杂性是合理的?

Meta 的 Vistara 成果回答了第一个问题,至少对部分内存受限服务而言如此。Panmnesia 已流片的组件则初步证明了硬件可行性。至于 960 加速器的愿景,仍需更多证据来回答第二和第三个问题。

对开发者而言,影响将通过框架而非线缆体现。更好的资源池化能力,或可在不成倍增加完整服务器的情况下,提供更大的内存容量。可预测的互连架构也可能减少同步操作期间加速器的闲置时间。

企业采购方应要求供应商提供分位数延迟、故障域示意图、互操作性矩阵,以及生产工作负载结果。单一的峰值带宽数字,无法说明多个任务竞争时共享互连架构的实际表现。

Panmnesia 与 Meta 的 CXL 架构值得关注,因为它结合了开放标准、已验证的芯片,以及超大规模部署经验。其最有力的理念是:AI 计算已超越服务器这一传统的自然设计边界。

同样重要的是,它仍有一个悬而未决的问题:数据中心能否获得类似芯片的协同能力,却不在楼宇规模上承受类似芯片的故障与复杂性问题?

关注首批完整部署,而不只是下一次组件发布。它们将揭示 CXL 是否会成为真正的数据中心级协调层,还是仍只是一项具有更大抱负的宝贵内存技术。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page