d-Matrix 的 NVLink Fusion 合作将 Raptor 纳入 NVIDIA 的机架战略
尽管 d-Matrix 正在打造一款旨在替代传统 GPU 设计的推理加速器,公司仍为 Raptor 采用了 NVIDIA NVLink Fusion。这项合作将未来的处理器接入 NVIDIA 的机架架构、网络、CPU 及基础设施供应链,也揭示了 d-Matrix 与 NVIDIA 的 NVLink Fusion 合作背后的核心矛盾。
专用加速器可以挑战 NVIDIA 的计算芯片,却不必取代其平台的其余部分。对 d-Matrix 而言,这种取舍为其雄心勃勃的芯片设计提供了一条更快通向可部署基础设施的路径。对 NVIDIA 而言,每一颗通过 NVLink 接入的新 XPU,都会巩固其在机架层面的地位。
这一决定出台时,Raptor 尚未成为商业产品。d-Matrix 预计该芯片将在 2026 年底前流片,集成 MGX 的系统最初将于 2027 年第四季度上市。这一时间表意味着,这是一项路线图公告,而非量产性能的证据。
这也使 d-Matrix 跻身于一批日益扩大的公司之列,它们正借助 NVIDIA 基础设施来部署专用处理器。这些合作伙伴包括成熟的芯片供应商、云服务商和推理领域专家。另一条路线,则是围绕 AMD Helios 架构、UALink 和 Ultra Ethernet 等技术构建开放式机架。
d-Matrix NVLink Fusion 协议带来的变化
d-Matrix 不再将 Raptor 设计为一张独立的加速器卡,而是将该处理器设计为 NVIDIA 定义的机架的一部分。
两家公司于 2026 年 9 月 10 日宣布合作。根据 Raptor 公告,这项安排包含多年产品路线图,而非一次性的互操作性测试。
Raptor 将连接至 NVLink 交换机,在紧密连接的系统内部实现纵向扩展通信。纵向扩展网络可让多个加速器更像一项大型计算资源那样协同工作,其通信延迟低于普通数据中心网络。
该机架还将采用 Spectrum-X Ethernet,在系统之间实现横向扩展网络。这一层负责连接不同机架或集群,同时处理分布式 AI 工作负载相关的拥塞和流量模式。
拟议设计包括 NVIDIA Vera CPU、BlueField-4 数据处理单元和 ConnectX-9 SuperNIC,还采用 NVIDIA MGX——一种覆盖物理托盘、供电、散热和系统集成的模块化参考架构。
Astera Labs 将提供连接技术,以维持整个系统中的高吞吐量数据传输。d-Matrix 表示,该机架将采用现有 MGX 制造生态系统中的模块化无缆托盘。
这一范围很重要,因为单颗处理器本身并不是可用的 AI 服务。采购方需要服务器、固件、网络、编排、散热、维修流程,以及可靠的替换部件供应。
初创公司通常必须自行构建这些要素,或说服合作伙伴来构建它们。随后,它还必须为无法容忍意外停机的客户验证整套系统。
NVLink Fusion 改变了这一顺序。NVIDIA 提供其纵向扩展互连和机架设计中部分要素的访问权限,使其他公司的 XPU 能够进入同一基础设施框架。
XPU 泛指针对不适合通用 CPU 的工作负载进行优化的专用处理器。对 Raptor 而言,其目标是生成式 AI 推理,尤其是对延迟敏感的 token 生成。
d-Matrix Raptor XPU 还可与 NVIDIA GPU 系统并行运行,包括 Vera Rubin NVL72。NVIDIA 将这种安排称为解耦式推理,即不同处理器负责服务工作的不同阶段或类型。
这种共存构成了故事的反转。d-Matrix 无需在整个数据中心取代 NVIDIA,便可赢得推理部署。它可以争夺特定工作负载,同时依赖芯片周边无处不在的 NVIDIA 组件。
NVIDIA 同样获得了重要收益。它可以容纳定制加速器,同时不放弃对周边系统架构的控制。竞争边界从芯片转移到了机架。
因此,这项交易不仅仅是又一个兼容性认证。它检验的是:即使第三方加速器与 NVIDIA GPU 竞争,NVIDIA 能否让这些加速器反而增加对其基础设施的需求。
为什么机架集成已成为真正的门槛
如今稀缺的能力已不再是设计出令人印象深刻的加速器,而是将这些芯片转化为客户能够可预测地部署的基础设施。
AI 推理对硬件提出的要求不同于模型训练。训练强调在大量加速器之间进行大规模并行计算。推理还必须管理响应时间、并发用户、模型内存以及不可预测的请求流。
推理模型加剧了这种压力,因为它们在返回答案前可能生成更多 token。长上下文应用还会维持庞大的键值缓存,用于存储 token 生成过程中所需的信息。
这些工作负载使内存移动成为核心约束。加速器可以拥有充足的算力,却仍可能让计算单元等待模型权重或缓存上下文。
d-Matrix 通过以存储器为中心的计算来应对这一问题。其架构将矩阵运算置于更接近已存储数据的位置,缩短信息在推理过程中的传输距离。
然而,解决处理器内部的内存瓶颈,并不等于解决处理器外部的部署问题。机架级系统必须在真实运行条件下协调加速器、主机、存储、网络、供电和散热。
每个组件都会引入验证工作。工程师必须验证信号完整性、热性能、固件兼容性、集体通信、故障恢复和维修流程。
液冷机架又增加了一层运营要求。新供应商必须适配既有设施设计,而不能要求客户围绕单一处理器重建供电和冷却系统。
NVIDIA 的 最初 NVLink Fusion 发布公告 直接解决了这一问题。该公司于 2025 年 5 月推出这一平台,用于采用外部 CPU 和 XPU 的半定制 AI 基础设施。
其首批合作伙伴名单覆盖了设计链的多个环节。MediaTek、Marvell、Alchip、Astera Labs、Synopsys 和 Cadence 分别支持定制芯片、连接技术或知识产权。
Fujitsu 和 Qualcomm 计划推出可与 NVIDIA GPU 协同工作的定制 CPU。后续合作将该平台扩展至更多处理器和云端设计。
这一不断扩大的合作阵容给每一家独立加速器供应商带来了压力。芯片厂商可以加入成熟的机架生态系统、独自构建同等系统,或与竞争性的开放标准结盟。
第一条路径可降低集成风险,但会带来战略依赖。第二条路径保留更多控制权,却需要资本、时间和客户信心。第三条路径则取决于另一生态系统能否达到相近的成熟度。
d-Matrix 为 Raptor 选择了速度和可部署性。其首席执行官 Sid Sheth 对这一约束的表述很直接:推理需求正在上升,而资本、时间和能源仍然有限。
公司的决定也反映出其发展阶段。d-Matrix 在推出 Raptor 前已开始交付 Corsair 平台,但其规模仍远小于它希望挑战的基础设施供应商。
在推出新内存架构的同时构建新的机架平台,会成倍增加执行风险。采用 MGX 让公司能够将更多工程资源集中于处理器、编译器和推理软件。
这一选择并不会消除验证工作。Raptor 仍必须正确实现 NVLink、与 NVIDIA 的其他设备协同工作,并达到系统级性能和可靠性目标。
但它确实缩小了客户必须同时接受的新要素范围。熟悉的机架可使基础设施团队更容易评估陌生的加速器。
这一结果给竞争加速器公司带来的压力不亚于 GPU 供应商。如今,仅提供高速芯片的初创公司,必须与封装在经过验证、可维护机架设计中的处理器竞争。
NVLink Fusion 如何围绕 Raptor 运作
NVLink Fusion 将处理器选择与机架构建分开,但仍让 NVIDIA 的互连技术处于系统中心。
该架构有两个网络层级。NVLink 在纵向扩展域内连接加速器,而 Spectrum-X 则在更大的横向扩展集群中承载流量。
在机架内部,NVLink 交换机为 Raptor 设备之间提供高带宽、低延迟通信。当模型或其工作数据无法驻留在单个加速器上时,这种连接尤为重要。
在该域之外,ConnectX SuperNIC 和 Spectrum-X Ethernet 将系统连接到整个数据中心。BlueField DPU 可处理网络、隔离和数据移动等基础设施任务。
Vera CPU 充当主机处理器。MGX 则定义了机械和电气框架,将这些要素封装为可部署的托盘和机架。
要理解 NVLink Fusion 的工作方式,必须区分访问权限与标准化。NVIDIA 正在向获批的第三方芯片开放其互连架构,但 NVLink 仍是由 NVIDIA 控制的技术。
因此,这种设计在横向上具有包容性,却并非供应商中立。合作伙伴可获得平台访问权限,而 NVIDIA 仍对接口、验证、路线图和周边组件保持影响力。
这种模式提供了现实优势。共享机架能够支持不同类型的加速器,而无需运营商为每种处理器创建独立的物理设计。
数据中心建设者可以标准化机房空间、冷却连接、配电和维护实践。随后,计算容量可根据工作负载需求进行调整。
NVIDIA 还拥有成熟的制造网络。原始设备制造商和设计制造商已经在生产源自 MGX 和 NVIDIA 机架级 GPU 平台的系统。
该公司的 技术说明 描述了对 NVLink 接口、chiplet、交换机、线缆和机架技术的访问,也包括供电和液冷设计。
对 d-Matrix 而言,这套基础设施解决了原始加速器基准测试无法体现的问题。购买推理容量的客户会同时评估部署周期、可维护性、利用率和运营风险,以及每秒 token 数。
即使实验室结果更具优势,若处理器延迟交付或需要专用机架,仍可能失去竞争力。基础设施的一致性可能胜过狭义的性能优势。
这一方法也让客户能够混合部署专用推理和基于 GPU 的工作负载。NVIDIA 表示,Raptor 机架可与 Vera Rubin NVL72 系统并行工作,而非取代它们。
一种可能的部署方式,是将对延迟敏感的 token 生成交由 Raptor,同时将其他模型阶段保留在 GPU 上。两家公司尚未公布能够证明该工作流的完整生产配置。
软件仍然是实现这种拆分的关键。模型运行时必须正确分配任务、管理内存并传输数据,不能抵消专用硬件带来的收益。
d-Matrix 已为 Corsair 和 Raptor 开发了自有软件栈。其与更广泛 NVIDIA 生态的整合程度,将决定买家面对的是一个易于管理的平台,还是两个彼此相邻的系统。
这种差异将直接影响开发者。硬件异构性能更好地匹配工作负载,但也可能带来独立的编译器、监控工具、性能配置和调试路径。
NVLink 可降低设备之间的通信摩擦,但并不会自动让它们的编程模型保持一致。
因此,这项合作的价值取决于物理连接之上的协同。两家公司必须将兼容的组件转化为可重复部署的模式,供云运营商以服务形式提供。
Raptor 的内存设计是机架内部的核心赌注
NVIDIA 提供系统基础,但 Raptor 仍需证明客户为何需要另一种推理处理器。
Raptor 延续了 d-Matrix 早期 Corsair 平台以内存为中心的设计思路。其核心特征是采用三维封装,将计算芯片直接置于定制 DRAM 之上。
DRAM 的密度高于 SRAM,后者是 Corsair 大量使用的高速内存。然而,传统 DRAM 距离计算单元更远,通常也需要更多能耗来传输每一比特数据。
d-Matrix 的设计通过高密度垂直连接,将大量小型内存块直接暴露给计算引擎。其目标是在兼具 DRAM 容量的同时,大幅提升本地带宽。
在 Hot Chips 2026 上,该公司展示了一种封装:一枚 TSMC 4 纳米计算芯片键合在定制 DRAM 芯片上方。该接口采用 36 微米连接间距。
展示的设计每张卡提供 32GB 容量,并宣称拥有每秒 100 太字节的内部带宽。这些数字描述的是封装内部的数据传输,而非不同加速器之间的网络带宽。
针对该项 3D DRAM design 的独立报道也指出了一项重要限定:许多已公布的性能结果仍是基于早期硅片的预测。
d-Matrix 测得垂直接口的能耗为每比特 0.37 皮焦耳。该公司将这一数值与数据传输至 HBM4 基础芯片约每比特 2.4 皮焦耳进行了比较。
一篇相关研究论文预测,其单卡吞吐量约为基于 HBM 的设计的 4.7 倍。无论是预测还是接口测量,都不能证明完整量产系统的性能。
散热管理是另一项挑战。逻辑芯片位于顶部,因此冷板能够与其直接接触;下方的 DRAM 同时充当中介层。
该完整封装公布的功耗预算为 422 瓦。在满负荷运行时,垂直内存接口占用 296 瓦。
热量会影响 DRAM 的数据保持能力,即内存单元在刷新前维持数据的时长。在公布的运行温度下,该设计需要显著更频繁地执行刷新操作。
d-Matrix 表示,较小的内存块可限制由此带来的带宽损耗。该设计还配备备用内存块、纠错机制和冗余设计,旨在维持可靠运行。
这些细节说明,为何与成熟的液冷机架整合至关重要。Raptor 的架构并非只需要一个连接器,而是需要围绕这种特殊封装设计的供电、散热和验证体系。
该技术瞄准 token 生成,因为这一阶段通常需要反复调取模型权重,而每字节执行的算术运算相对有限。更高的本地内存带宽可让计算单元持续保持忙碌。
处理输入提示词的预填充阶段则具有不同的性能特征。它可能需要更多算力,并可能更适合不同的加速器配置。
这种差异支持了解耦式推理的观点。只要软件和网络能够高效完成交接,运营商就可以将不同的处理器分别分配给预填充和解码任务。
但 Raptor 的价值不能仅从带宽推断。实际性能取决于模型支持、数值格式、调度、批处理规模、上下文长度以及可接受的响应延迟。
内存容量同样重要。32GB 单卡无法独立容纳每一个大型模型,因此更大的工作负载需要跨多台设备进行分割。
这一要求使 NVLink 的纵向扩展域更具重要性。Raptor 的内部内存设计和 NVIDIA 的外部互连网络必须协同工作,避免形成新的瓶颈。
因此,d-Matrix Raptor XPU 是一项复合型押注。其 3D 封装必须以可量产的良率投入生产,而机架必须将该封装转化为可靠的应用性能。
NVIDIA 的开放平台仍有边界
主要竞争并非 d-Matrix 与 NVIDIA GPU 之间的较量,而是 NVIDIA 主导的集成方案与供应商中立机架基础设施之间的竞争。
NVIDIA 将其 AI 平台描述为“纵向集成、横向开放”。这句话概括了其战略,但买家应审视其中每一部分的实际含义。
纵向集成将 NVIDIA 的处理器、交换机、网络适配器、DPU、软件、机架设计和供应链关系整合在一起。横向开放则允许特定的外部 CPU 和 XPU 进入这一环境。
这种结构扩大了系统内部的处理器选择,但系统的关键互连网络仍由 NVIDIA 控制。它比纯 GPU 机架更开放,但不如由行业共同治理的互连标准那样中立。
这条边界对 NVIDIA 具有商业价值。如果定制加速器获得更多份额,该公司仍可为其周边提供高价值的网络和基础设施组件。
随着 AI 系统从服务器转向机架级计算机,NVIDIA 也可以让 NVLink 保持核心地位。机架成为产品,而单个处理器则成为可配置组件。
d-Matrix 将从中受益,因为它能够接触已在为 NVIDIA 设备准备设施的买家。这项合作降低了测试一种不太熟悉处理器的组织成本。
不过,d-Matrix 也会因此依赖 NVIDIA 的认证流程和基础设施路线图。交换机、CPU、软件或商业条款的变化,都可能影响其系统规划。
两家公司尚未披露该合作的财务结构,也未具体说明哪些软件层将共享,或客户将如何采购和获得完整机架的支持。
这些未解问题很重要,因为开放性包含多个维度。硬件可以实现物理互操作,而采购、管理和开发仍可能紧密依附于单一供应商。
竞争方案强调开放的行业接口。AMD 的 Helios rack design 采用 OCP Open Rack Wide、用于纵向扩展连接的 UALink,以及面向更大集群的 Ultra Ethernet。
Helios 整合 AMD Instinct 加速器、EPYC 处理器和 Pensando 网络技术。其公开设计包含 72 个加速器,呼应了行业向高密度机架级系统发展的趋势。
UALink 旨在让多家供应商通过共享规范连接加速器。该方案承诺提供更广泛的可移植性,尽管开放规范并不保证产品成熟度或部署规模同样出色。
NVIDIA 的优势在于,NVLink 已在多代已出货系统中运行。其制造合作伙伴也拥有高密度液冷机架的实际经验。
开放路线提供更大的理论独立性。NVIDIA 路线则在一家公司的架构主导下提供了成熟的集成路径。
两种选择都无法完全消除锁定效应。采用 Raptor 的买家同样依赖 d-Matrix 软件、其 3D 内存供应链,以及这家初创公司支持未来产品的能力。
更广泛的竞争格局还包括 Groq、Cerebras、AMD、Intel 以及超大规模云厂商自研的加速器。一篇 inference market overview 此前将这些公司列为面向 GPU 主导工作负载的替代方案。
其中数家此后已更接近提供完整系统。以 Groq 为例,它也已加入 NVIDIA 持续扩展的推理基础设施战略。
这种趋势表明,NVIDIA 希望吸纳专业化方案,而非抵制它们。成功的 XPU 可以成为采用 NVIDIA 网络和机架技术的又一个理由。
对 d-Matrix 而言,加入该平台是一种务实选择。但这也意味着,该公司对 NVIDIA 的挑战比简单的竞争芯片叙事所暗示的更为有限。
这项合作竞争的是哪种处理器执行推理,而非由谁定义大部分周边基础设施。
交付、基准测试和客户将决定结果
该公告确立了架构意图,但并未证明制造准备度、商业需求或量产性能。
首个观察节点是 Raptor 计划在 2026 年底前完成流片。流片是芯片设计定稿并交付制造的阶段。
若能实现这一里程碑,将支持当前时间表;若未能实现,则会压缩在 2027 年末之前完成制造、封装、测试、软件开发和机架认证的时间。
第二个信号是可由独立方复现的系统性能。买家需要的是完整 Raptor 机架的结果,而不是孤立的带宽数据或预测的模型运行结果。
这些评估应披露模型、上下文长度、批处理规模、延迟目标、精度设置和功耗。若缺少这些条件,每秒 token 数可能掩盖重大权衡。
对于该公司的高端 token 服务定位而言,单用户性能将尤其重要。如果单个请求必须在大批次中等待,高总吞吐量的意义就会降低。
能耗测量应覆盖整个机架。封装级效率可能会被 CPU、交换机、散热设备、网络和闲置容量所稀释。
第三个信号是具名客户部署。d-Matrix 表示,Raptor 正在接受超大规模云厂商和前沿实验室评估,但尚未披露这些机构的名称。
已确定的云实例、托管推理服务或公布的量产集群,将增强该合作的商业说服力。评估本身并不代表采购意向。
初始供应仍计划在 2027 年第四季度。这段较长的间隔给了竞争系统改善内存、网络和推理软件的时间。
这也使 d-Matrix 面临制造不确定性。该公司必须生产定制 DRAM 芯片,将其与先进逻辑芯片键合,实现可接受的良率,并在持续高温下验证该封装。
其拥有超过 100 项专利的说法,并不能解决这些量产问题。专利保护技术理念,而客户需要可靠的供应量和可预测的服务。
NVIDIA 同样有工作要完成。相关 Vera、BlueField、ConnectX、Spectrum-X 和 NVLink 组件必须按照兼容的时间表达到所需成熟度。
Astera Labs 必须作为集成设计的一部分交付其连接组件。随后,机架制造商需要对无缆托盘、散热、固件和系统管理进行认证。
软件也面临并行的时间表。Raptor 出货时,d-Matrix 必须支持当下的模型和框架,而不只是设计阶段已有的模型。
模型架构可能迅速变化。稀疏混合专家模型、更长的上下文窗口、多模态工作负载和新的解码技术,都会改变内存和通信模式。
专用处理器能否成功,取决于其架构能否在这些变化中持续保持价值。它还需要以足够快的速度更新编译器,跟上主流模型的演进。
NVIDIA 的平台可以降低物理部署风险,但无法保证软件采用。开发者和云运营商仍需要有充分理由将工作负载导向 Raptor。
最有说服力的方案,应结合低单用户延迟、具竞争力的能耗表现,以及便捷的模型接入流程。任何一个环节的短板,都可能限制其利用率。
买家还应关注 NVIDIA 如何将 Raptor 与自家的 GPU 及其他推理产品并列定位。技术接入条件相同,并不必然带来同等的商业曝光度。
另一个值得关注的问题是平台集中化。支持外部 XPU 能为客户提供更多处理器选择,但也会让更多机架层面的决策受到 NVIDIA 的影响。
这种结果既非纯粹开放,也不是简单的排他。在日益统一的基础设施边界之内,竞争仍将以分层市场的形式存在。
如果 Raptor 能以已出货、可量化且广泛可用的服务形态跨越这道边界,d-Matrix 与 NVLink Fusion 的合作就将具有重要意义。在此之前,其意义主要体现在战略层面。
d-Matrix 已接受这样一个事实:没有可信赖的机架方案,更好的推理芯片仍不足以取胜。NVIDIA 则接受了专用处理器可以进入其平台,同时不会削弱其基础设施地位。
未来几个月,请依次关注流片、完整系统基准测试以及具名部署案例。每一个里程碑都将显示,这一路线图是否正在成为真正的产品。
对于基础设施采购方而言,真正有价值的问题不是 Raptor 是否能击败所有 GPU,而是它能否在不增加不可接受的运营复杂度的前提下,提供有价值的推理能力组合。相关证据将决定 NVIDIA 的机架究竟会成为加速器选择的起飞平台,还是又一个持久的依赖点。



