Panmnesia CXL AI 数据中心将扩展之争推向 GPU 之外
- Martin Chen

- 7小时前
- 讀畢需時 14 分鐘
Panmnesia 提出了一种 CXL AI 数据中心架构,可在一个统一的执行域内协调多达 960 个加速器。该设计与 Meta 研究人员共同开发,旨在让跨机架资源的行为更像一颗大型芯片内部的组件。
这一主张改变了人们熟悉的 AI 基础设施争论。核心问题不再只是哪个公司能打造最快的 GPU,而在于数百个加速器、内存设备和处理器能否以足够可预测的方式通信,从而协同成为一台机器。
Panmnesia CXL AI 数据中心目前仍是一项架构方案,而非已有公开文档佐证的全规模商业部署。不过,它的可信度高于一般的概念发布。该设计出现在一篇受邀发表的同行评审综述中,而 Meta 也已单独披露其自身 CXL 内存基础设施的生产结果。
该方案将 Compute Express Link,即 CXL,用于应对当前数据中心模式中的一个难题。CXL 是一种开放互连标准,支持处理器、加速器和内存之间的一致性通信。相较于传统网络和软件层,它可提供更直接的资源访问方式。
Panmnesia 和 Meta 并未主张 CXL 应取代所有 Ethernet 或 InfiniBand 连接。他们提出的是更聚焦、但影响更深远的观点:需要紧密同步执行的工作负载,需要比通用网络通常能够提供的跨机架路径更具可预测性。
该方案将数据中心视为一个执行单元
Panmnesia 和 Meta 希望将芯片级协同扩展到单台服务器和机架之外。
大型 AI 工作负载会将计算分配给多个加速器。这些加速器必须在训练或推理任务的全程中交换模型参数、中间结果和同步消息。
一个延迟参与者就可能迫使其所在组中的所有其他设备等待。工程师通常将这种延迟参与者称为“慢节点”。随着系统规模扩大,最快与最慢通信路径之间的差异会变得愈发昂贵。
新架构着重缩小这种延迟差距。平均延迟依然重要,但当数百台设备必须完成同一项同步操作时,可预测的到达时间同样关键。
根据已发布的单芯片方案,该设计将 CPU、加速器和内存置于一个分层的 CXL 域中。方案使用三类主要硬件组件来控制通信路径。
第一类是高扇出、无阻塞交换机。高扇出意味着一个交换层可连接大量设备;无阻塞设计则旨在避免无关连接彼此造成不必要的干扰。
第二个组件是链路加速单元。这类硬件负责处理原本需要更多软件处理或协议转换的通信功能。
第三个组件是 Fabric 控制器。它管理规模更大的连接资源集合,并决定设备如何组织、访问和隔离。
这些组件共同旨在让 Fabric 内部的通信更具确定性。设备仍分布在不同的板卡、服务器和机架中,但它们之间的交互将遵循受控的硬件路径。
公告中描述的参考系统将一颗 CPU 与两颗加速器配对。在拟议设计下,一颗 CPU 可协调 16 个加速器,提升至原来的八倍。
更大的分层域最多可包含 960 个加速器。公告称,这一数字约为其参考平台规模的 13 倍。
该方案还将原本通过传统网络需耗时微秒级的路径,其往返通信延迟目标设定为数百纳秒。在建模对比中,这意味着最高可达一个数量级的降低。
这些数字描述的是综述中呈现的架构,不应被解读为来自 960 加速器生产部署的独立验证结果。
这一区别很重要。一篇综述文章可以结合既有证据、设计原则和未来架构,但并不能自动证明每个组件都已在所提上限下协同运行。
尽管如此,这篇论文确立了明确的技术方向。Panmnesia 正将完整的数据中心,而非单台服务器,视为硬件设计的基本单元。
为什么 AI 扩展已成为通信问题
增加加速器能够提升理论算力,但同步工作负载的推进速度只取决于其最慢的必要数据交换。
多年来,AI 基础设施供应商持续提升加速器性能、内存带宽和机架密度。这些进步依然重要。然而,一个大型模型很少会在单台设备上作为孤立的计算序列运行。
训练会将模型层和数据分配到多个加速器上。推理系统同样会将大模型、检索索引和推荐表拆分到多种资源中。
每一次拆分都会带来通信。设备必须在与任务其余部分保持同步的同时,传输激活值、梯度、参数和缓存数据。
问题增长的速度快于简单的设备数量所暗示的程度。增加一个加速器不仅会增加一个参与者,也可能带来更多通信关系,以及又一个潜在的延迟来源。
通用网络旨在支持多样化流量和灵活路由。这种灵活性引入了网络接口、缓冲、协议处理、拥塞管理和软件协调。
这些特性使 Ethernet 和 InfiniBand 能够在大型设施中发挥作用,但也会产生需要由紧密同步的 AI 任务吸收的时序波动。
在现代加速器机架内部,供应商已使用专用的 scale-up 链路来减少这些损耗。Nvidia 在受支持的系统中使用 NVLink 和 NVLink Switch。业界也正在开发 UALink,作为面向加速器的开放 scale-up 连接方案。
这些技术专注于在有限的物理范围内紧密耦合设备。CXL 则围绕处理器、加速器和内存之间的一致性连接发展,包括内存扩展、池化和共享。
Panmnesia 的设计将这种一致性模型延伸得更远。它的主要对手并非某一家特定芯片公司,而是当紧密耦合的工作跨越机架边界时所采用的、由软件协调且基于网络的 scale-out 路径。
这并不意味着 Ethernet 已经过时。Scale-out 网络仍然是存储、全设施连接、服务通信以及可容忍较宽松同步的工作负载所必需的。
争议聚焦于计算路径。Panmnesia 认为,在参与同一项紧密同步操作的设备之间,不应存在反复的数据复制和软件干预。
Meta 的生产经验为这一论点提供了实际背景。该公司开发了 Vistara,这是一套定制的 CXL 内存扩展平台,涵盖芯片、固件、操作系统支持和集群部署。
Meta 表示,Vistara 已在包括分布式机器学习推理、数据库、缓存、大数据处理和构建系统在内的生产服务中运行。一份 CXL Consortium 的 Vistara 部署摘要称,解耦式推理最多可减少 25% 的服务器数量。
同一摘要还称,分布式缓存的平均延迟降低了 29%。这些是 Meta 报告的生产结果,并非对 Panmnesia 完整 960 加速器设计的基准测试。
即便如此,它们说明了 CXL 为何已超越实验室讨论阶段。超大规模云服务商如今已有证据表明,一致性内存扩展能够影响服务器数量和服务延迟。
商业压力落在多个群体身上。加速器供应商必须证明其系统能够高效利用昂贵设备;云运营商必须减少闲置的内存和算力容量;互连供应商则必须在不形成僵化专有孤岛的前提下,提供可预测的通信。
对企业买家而言,这一问题最终会落到容量规划上。能够将内存与加速器独立分配的系统,可减少因某一资源达到上限而不得不再购买整台服务器的需求。
Panmnesia CXL AI 数据中心如何控制延迟
CXL 提供一致性通信,但 Panmnesia 的机制依赖于对标准周边路由、缓冲和层级结构的控制。
CXL 建立在 PCI Express 的物理基础之上,同时增加了一致性内存和缓存访问协议。一致性可让连接的组件对共享数据保持一致的视图。
这一能力是实现类似单芯片执行的必要条件,但并不充分。标准可以定义设备如何通信,却无法保证每一种可能的系统设计都具有相同的延迟。
大型 Fabric 会引入交换机、队列、控制器、流量冲突和不同长度的路由。每个环节都可能提高平均延迟,或扩大不同请求之间的差异。
因此,Panmnesia 的方案强调有界的延迟波动。该架构试图在同步工作负载开始等待之前,就让路由和硬件行为具备可预测性。
其高扇出交换机扩大了可直接组织的设备数量。无阻塞交换结构旨在于流量模式允许时,维持同时存在的通信路径。
链路加速单元将部分通信工作转入硬件处理。这可以减少操作系统干预,并避免部分在由软件管理的缓冲区之间反复进行的数据传输。
Fabric 控制器将资源组织为分层群组。该设计并非将每台设备视作距离相同的端点,而是采用类似芯片内部模块布局的放置原则。
频繁通信的组件可以位于相近的逻辑区域,而更广泛的连接则将这些区域组合为一个更大的域。
这种层级结构之所以重要,是因为物理距离会带来影响。电连接在更长路径上会损失信号质量,而重定时器或额外的交换级可能增加延迟。
综述提出在 Fabric 各部分之间的较长距离使用光连接。CXL-over-optics 可在将信号传输至超出普通电气走线或线缆所能支持的距离时,保留 CXL 通信模型。
光传输并不能消除排队、拥塞、故障或控制器开销。它解决的是物理距离与信号传输问题,其余部分仍由整个架构负责实现可预测执行。
行业标准也在持续演进。官方 CXL 4.0 specification 将数据速率提升一倍至 128 GT/s,支持端口绑定,并新增内存可靠性功能。
规范进展为实施者带来了更高带宽和更大的设计灵活性,但并不保证不同供应商的产品能够实现相同延迟,或在数据中心规模下完美互操作。
Panmnesia 一直在构建验证其理论所需的底层能力。该公司在 ISCA 2026 上展示了一款基于硅的 CXL 控制器和一款基于端口路由的交换机。
基于端口的路由根据设备端口标识符传输流量。与 PCIe 和早期 CXL 实现所采用的树状分层路由相比,它支持更灵活的拓扑结构。
Panmnesia 表示,其优化后的控制器和交换机在将连接扩展至数十台服务器的同时,仍将内存访问延迟维持在相近水平。该公司发布的硅验证结果于 6 月 29 日在 ISCA 产业专题会场展示。
这些结果支撑了更大规模架构背后的各项独立机制。但它们尚不能证明整个数据中心设计已具备商业就绪性。
这种分层证据仍然值得关注。许多基础设施发布直接从一张架构图跳到大规模部署宣称。Panmnesia 则可以列举控制器芯片、交换机实现、早期全系统框架,以及 Meta 独立的生产实践经验。
尚缺的一步是在所公布规模上的集成。硬件、固件、操作系统、编排软件、光链路和故障管理,都必须在持续负载下协同运行。
CXL 解决的不只是网络延迟,还有固定服务器配比的限制
该架构还试图解决因计算与内存必须以固定服务器组合采购而造成的资源浪费。
一台 AI 服务器包含特定组合的 CPU、加速器、本地内存和网络资源。这种组合无法完美适配每一种工作负载。
某项服务可能需要大量加速器算力,但所需容量有限。另一项服务可能承载庞大的嵌入表或检索索引,却只需要相对较少的算术计算。
运营方通常会通过增加一整台服务器或加速器来应对内存不足。新机器提供了内存,却也带来了工作负载可能并不需要的计算能力。
CXL 内存池将这些采购决策拆分开来。一个内存池可以服务多个主机,软件则可根据不断变化的需求分配容量。
Panmnesia 曾在早期 CXL 应用研究中探索这一模式。其全系统框架连接了 CXL CPU、GPU、内存扩展器和交换系统。
在公司披露的CXL 应用测试中,Panmnesia 将检索数据库置于大型内存池中,同时在 GPU 资源上运行语言模型推理。该公司称,其性能超过基于 SSD 对照方案的六倍。
这一结果是采用特定配置的厂商基准测试,不应推广至所有检索系统、存储设备或 CXL 产品。
不过,这一应用场景本身很具体。检索增强生成,即 RAG,会在语言模型生成答案前检索相关文档。大型向量索引所需的容量可能远超单个加速器能够提供的水平。
将索引置于共享内存池中可以减少对较慢存储的访问。它也能让多项计算资源使用一个集中管理的容量层。
相同逻辑同样适用于推荐系统。大型嵌入表可能需要大量内存,但并不总能证明按固定比例增加 GPU 是合理的。
Meta 的 Vistara 工作展示了另一种变化。该公司利用 CXL,将较旧的 DDR4 内存连接至围绕 DDR5 处理器设计的新服务器。
复用内存可以减轻硬件更换压力,并延长现有组件的使用寿命。但这也带来了与可靠性、性能层级、固件和集群管理有关的工程挑战。
更广泛的转变,是从服务器组合转向资源组合。运营方根据工作负载选择所需的计算、内存和加速资源,而不是接受单台机器内置的固定比例。
如果这一模式能够跨厂商运作,买方将获得更大的议价与选择空间。内存、处理器和加速器可以遵循各自独立的更换周期演进。
如果它仍受限于专有实现,超大规模云服务商或许会从中受益,而普通企业则可能面对另一批彼此不兼容的平台。
因此,CXL 作为开放标准的地位很重要。它为处理器、内存设备、交换机和管理软件建立了共同的技术基础。
协议层面的开放并不会自动形成竞争充分的产品市场。买方仍需要经过验证的设备、一致的管理接口、安全控制和可靠的互操作性。
这正是 Panmnesia 的定位变得有趣的地方。该公司并不试图在原始计算性能上直接与 Nvidia、AMD 或超大规模云服务商的定制加速器竞争。
它销售的是决定这些设备能否高效协同运行的连接层。随着买方混用加速器、接入更大的内存池并要求更高利用率,这一层的价值也会随之提升。
最大规模的主张仍需系统级证据
公开的架构与可运行的芯片降低了技术不确定性,但并未解决可靠性、安全性或部署经济性的问题。
首个不确定性是规模。Panmnesia 表示,其已实现并验证核心组件,随后为商业供应做好准备。
该公司尚未公开记录过一套生产部署:960 个加速器在持续的客户工作负载下作为一个统一域运行。读者应将该架构的最大配置与已观察到的部署区分开来。
第二个不确定性是故障隔离。更大的执行域能够改善资源共享,但也会增加基础设施软件必须监控的关系数量。
该方案称,故障硬件可以在设备层面更换,而无需更换整台服务器。更细粒度的更换单元可以减少浪费并提升可维护性。
然而,运营方还需要证据表明,单个设备故障不会破坏共享状态,或使结构中更大范围的部分停滞。恢复行为与正常路径延迟同样重要。
第三个不确定性是拥塞。无阻塞交换设计能够减少某些冲突,但真实的 AI 工作负载可能形成集中的流量模式。
许多加速器可能请求同一内存区域,或在同一个同步阶段通信。受控条件下数百纳秒的表现,并不能保证在峰值争用下仍能得到相同结果。
第四个问题是内存层级。远程共享内存能够提供更大容量,但它并不具备本地高带宽内存的所有特性。
HBM 靠近加速器,能提供适合密集模型计算的带宽。CXL 内存可以补充这一层级,尤其适合容量密集型数据,但无法在所有操作中直接替代 HBM。
因此,该架构需要智能的数据放置策略。频繁访问、对延迟敏感的数据应保留在加速器附近;更大或时间敏感性较低的数据则可以存放在共享容量中。
软件必须理解这些差异。否则,理论上更大的内存空间可能带来不一致的应用性能。
第五个不确定性是安全性。将一致性访问扩展到跨机架范围,会提高隔离、访问控制、加密和结构管理的重要性。
传统网络中的配置错误可能导致某项服务暴露。共享内存结构中的错误,则可能影响多个设备所使用数据的直接访问。
CXL 包含安全与可靠性能力,较新的版本也在持续改进它们。生产环境买方仍将要求对芯片、固件、管理软件和操作流程进行验证。
功耗是另一个悬而未决的问题。更高效的资源池可以减少不必要的服务器,并提高硬件利用率。
但交换机、重定时器、光模块、控制器和更大的内存系统同样消耗能源。相关衡量标准应是每项已完成工作负载的总能耗,而非单个组件的额定功率。
最后一个不确定性是经济性。Panmnesia 的架构承诺减少闲置资源,并实现更细粒度的替换。
这些节省必须超过新交换机、控制器、光学组件、集成、验证和运维培训的成本。超大规模云服务商可以将定制工程成本摊销到庞大的集群中,而较小的运营方则面临不同的门槛。
这也是 Meta 的参与重要、但不能构成全面背书的原因。Meta 带来了在大规模基础设施中部署系统的经验。
其证据表明,CXL 内存扩展可以创造生产价值。但这并不能证明 Panmnesia 提议的跨机架域中的每一个要素都将达到同等成熟度。
负责任的解读既不是否定,也不是照单全收。Panmnesia 已将一个可信的问题、开放标准、已实现的组件和超大规模运营证据整合为一套架构。
剩余的工作,是证明这些部分在全规模结合后仍能保留其优势。
三个信号将表明该架构是否具备可部署性
下一阶段必须以可重复的工作负载、互操作性和客户证据,取代架构最大配置的宣称。
第一个信号是运行公认 AI 工作负载的完整机架或多机架演示。Panmnesia 应披露加速器数量、拓扑、内存配置、软件栈和流量条件。
最有价值的结果将包括尾延迟、吞吐量、利用率、功耗和恢复时间。仅有平均延迟不足以检验该方案对可预测执行的核心承诺。
一场接近所提议的 960 加速器域的演示,将有力支持“如同一颗芯片”的论点。规模小得多的演示仍然会有帮助,前提是该公司解释其结果如何扩展。
第二个信号是跨厂商互操作性。当不同供应商的处理器、加速器、内存设备、交换机和管理工具能够协同工作时,开放 CXL 架构才具有商业意义。
测试应包括长时间运行、错误注入、固件更新、设备更换和安全隔离。成功的多厂商部署将强化 Panmnesia 对抗专有基础设施孤岛的论据。
持续存在的兼容性问题则会削弱这一论据。买方不希望以异常脆弱的认证流程为代价换取资源灵活性。
第三个信号是具名的生产客户或概念验证部署。Panmnesia 表示,其核心组件正在走向商业供应。
客户试用应揭示,共享资源是否能减少真实服务所需的服务器或加速器总量。它还应表明,运营节省是否能在增加结构成本后依然成立。
SK Telecom 是一项相关测试。这两家公司此前同意开发并验证一套基于 CXL 的 AI 机架,使用真实模型测量 GPU 利用率、内存利用率、延迟和吞吐量。
这一工作的结果将把 Panmnesia 的组件研发与数据中心建设者的运营需求联系起来。公开测量结果将比又一张架构图更有分量。
这些信号也将澄清 CXL 如何与 Ethernet、InfiniBand、NVLink 和 UALink 共存。最可能的结果是分层基础设施,而不是一种通用连接方式。
本地加速器互连可服务于对带宽最敏感的通信。CXL 可组织一致性内存和纵向扩展资源。Ethernet 或 InfiniBand 则可继续处理更广泛的横向扩展流量。
Panmnesia 的贡献在于提出:一致性层应当比今天延伸得更远。这既是一项技术押注,也是一项对可预测性的商业押注。
对开发者而言,这可能改变大型模型和检索系统分配内存的方式。应用或许会将容量视为一种可管理的资源池,而非每台服务器周围的硬性边界。
对企业采购方而言,其价值将来自更高的利用率和更独立的升级周期。不过,这些优势仍取决于管理工具能否让新增的拓扑结构易于理解。
随着这些系统不断演进,工程团队需要保留基准测试结果、配置决策、事故记录和兼容性发现。一个可搜索的知识库可帮助团队在本地技术文档之间关联这些运营证据。
Panmnesia 提出的 CXL AI 数据中心方案值得关注,因为它将扩展性的讨论从组件速度转向系统协同。它也为自身的成功设定了可衡量的标准。
值得关注的是多机架工作负载测试、跨厂商互操作性,以及具名的生产环境部署。如果这三项都能伴随可复现的数据落地,数据中心或许会越来越不像由多台机器构成的网络,而更像一台经过精心组织的计算机。


