SK-Hynix CPO 向内存迈进,但真正的难题才刚刚开始
SK hynix 已将 CPO 的应用从网络交换机延伸至内存,提出一种以光互连为核心的架构,通过光来连接处理器池与内存池。SK-hynix 的 CPO 路线图瞄准了一个日益突出的系统问题:处理器性能的提升速度快于其间数据互连的发展速度。这也使这家内存供应商进入了通常由处理器、网络和封装公司主导的领域。
这一事件本身早于该报道进入当前热门榜单。Nature Electronics 于 2026 年 8 月 19 日发表了这篇综述文章,SK hynix 则于 8 月 20 日宣布该消息。这篇论文是一份技术路线图,并非产品发布、客户部署或可运行的光内存原型。
这种区别构成了核心张力。CPO,即共封装光学(co-packaged optics),将光子引擎置于处理器或交换机旁,以缩短高功耗的电气传输路径。Broadcom、Nvidia 和 Intel 已将这一思路的不同版本应用于网络或计算 I/O。SK hynix 现在则认为,光最终应延伸至内存接口本身。
SK-Hynix CPO 路线图将光延伸至内存
关键变化并非又一个更快的光交换机,而是重新组织处理器获取内存方式的提议。
这份同行评审路线图考察了覆盖电气子系统、转换接口及光传输网络的光芯片间互连。作者描绘了一条从二维 CPO,经由 2.5D 中介层集成,最终走向三维异质堆叠的发展路径。
Nature Electronics 将这项工作定位为综述文章,而非单一实验器件的报告。来自 SK hynix、University of Virginia、University of Illinois Urbana-Champaign、Nanyang Technological University、MIT 和 Yonsei University 的研究人员共同参与了这项工作。
领导 SK hynix AI 基础设施团队的 Seunghoon Hong,以及 University of Virginia 教授 Kyusang Lee 担任共同通讯作者。他们的参与意义重大,因为该论文结合了内存厂商的商业视角与异质电子和光子集成的学术研究。
CPO 的直接机制已相对成熟。随着数据速率和距离的提高,较长的电气走线会损失信号质量。设计人员会通过串行器、解串行器、重定时器和信号处理电路来补偿,但这些组件会消耗功率并增加延迟。
共封装设计将光引擎移近交换机、加速器或处理器。电信号仅需经过一段较短的封装级路径,便会转换为光信号。随后,光链路负责在更长距离上传输数据。
SK-hynix 的 CPO 路线图更进一步。其以光互连为核心的架构使用光子中介层——一种包含光通信路径的封装层——将 XPU 池直接连接至内存池。XPU 是 GPU 和其他计算加速器的通用称谓。
这一设计可让多个加速器访问共享内存资源,而不只是依赖每个处理器旁边连接的内存。SK hynix 表示,随着 AI 模型和集群规模扩大,这种安排将使系统级数据移动更具灵活性。
该公司的技术概述为未来基础设施设定了三个方向性目标:每个节点应超过每秒 100 太比特,传输每比特所耗能量低于 1 皮焦耳,且芯片间延迟低于 10 纳秒。
这些是路线图目标,而不是已披露 SK hynix 系统的实测结果。该公司尚未披露面向该内存池的商业产品、发布时间表、客户认证、产量或具体内存技术。
这一空白并不意味着该论文不重要。它明确了 SK hynix 希望内存与 AI 系统其余部分之间的边界如何移动。在光内存接口成为标准化产品之前,该公司已在争取架构设计中的一席之地。
时间线同样得到核实。期刊记录显示发表日期为 8 月 19 日,而 SK hynix 的新闻稿在一天后发布。之后登上热门榜单反映的是关注度重新升温,而非 8 月 28 日的新产品公告。
带宽墙正移向加速器之外
更快的 HBM 可以缓解一个瓶颈,却可能暴露封装、机架和内存资源之间的另一个瓶颈。
高带宽内存(HBM)将 DRAM 堆叠在加速器附近,并通过宽接口连接。这种安排提供的带宽远高于传统服务器内存,已成为现代 AI 加速器的核心组成部分。
SK hynix 已从这一转变中受益。不过,拥有数千个加速器的集群不能作为数千个彼此孤立的处理器与 HBM 岛屿运行。训练和推理任务必须在规模不断扩大的系统中交换模型状态、参数、激活值和中间结果。
论文的论点始于一种失衡。根据 SK hynix 的说法,计算吞吐量通常每两年增长三倍,而互连带宽仅增长约 1.4 倍。这一差距将性能限制从算术计算转向数据移动。
这一说法描述的是广泛趋势,而非适用于每种架构的通用测量。不同加速器、网络拓扑和工作负载可能产生不同的比例。尽管如此,底层约束在业内已广为人知:闲置的处理器无法弥补等待数据所损失的时间。
电气链路在短距离内依然有效。铜互连技术成熟、便于维护,并拥有庞大的组件生态系统。但当设计人员要求在更长路径上传输更高带宽,同时还需满足严格的功耗和封装限制时,问题便会加剧。
在高速条件下,电气通道需要更强的均衡和更多信号调理。物理走线还会争夺封装边缘、板级面积和散热能力。因此,即使单个芯片性能更强,增加链路数量仍可能提高系统复杂度。
光互连改变了距离方程。光能够以更低的传播损耗和更少的电磁干扰承载高带宽信号。密集波长通道也能增加每根光纤所传输的信息量。
不过,光并不能消除所有电子组件。数据仍在电子电路中起始和终止。调制器将电信号转换为光信号,而光电探测器及相关电路则在目标端完成反向转换。
整体收益取决于整条链路。设计人员必须计算激光器功耗、驱动器、接收器、控制电路、封装损耗、散热和协议开销。仅凭低损耗光纤并不能保证系统高效。
这也是 SK hynix 将该项目定位为协同设计的原因。内存设备、控制器、光引擎、中介层、热管理系统和一致性协议必须作为一个整体架构协同工作。孤立地优化某个光子组件,无法解决主要系统约束。
这一提议对多条既有边界施加了压力。加速器厂商目前塑造本地内存接口;网络供应商控制着系统间光网络的大部分;封装公司则决定电子和光子芯粒如何组装与散热。
通过光互连连接的内存池将跨越这三条边界。它需要处理器能够以可预测的方式访问远程容量,需要控制器维持数据一致性,也需要封装技术支持在高热计算硅芯片附近布置高密度光通道。
因此,商业压力是长期性的,但架构竞争已经开始。谁定义内存协议、控制器位置和光接口,谁就可能影响哪些组件成为可互换部件,哪些仍保持专有。
对企业买家而言,这不只是一个组件故事。内存容量、通信延迟和利用率会影响一项工作负载所需的加速器数量,也会影响昂贵内存是否会闲置在未充分利用的处理器旁。
SK-hynix 的 CPO 主张是,内存池化能够提高这种利用率。然而,论文并未证明生产系统在真实模型上能带来多大改善。工作负载行为、局部性、拥塞和软件调度将决定实际收益。
以光互连为核心的内存挑战直连 HBM 模式
主要竞争是在紧密直连的电气内存与可经光互连访问的池化内存之间,而不是 SK hynix 与某一家特定竞争对手之间。
直连 HBM 具有明确优势:物理距离近。加速器通过短而宽的连接访问内存,延迟可预测。这种安排支持需要反复访问附近张量和模型数据的工作负载。
其局限在于缺乏灵活性。内存容量和带宽随每个加速器封装一同配置。如果一个处理器需要更多容量,而另一个处理器处于低利用率状态,系统无法将所有可用 HBM 自由重新分配为共同资源。
以光互连为核心的内存池承诺提供不同的平衡。多个加速器可以通过光链路访问更大的共享资源。容量可以较少受单一处理器封装周围物理限制的制约。
这一提议类似更广泛的内存解耦努力,即让计算和内存成为可独立部署的资源。不同之处在于其预期的传输方式。电气网络可支持池化,但光链路为更大覆盖范围和更高带宽密度提供了路径。
这并不意味着本地 HBM 会消失。更可信的架构会保留快速直连内存,用于对延迟敏感的数据,同时将池化容量用于更大或访问频率较低的工作集。软件需要决定数据应放在哪里。
这种分层结构带来了困难问题。跨越光网络的内存请求无法完全等同于本地 HBM 访问。额外的转换、路由、仲裁和协议步骤可能改变平均延迟和尾延迟。
一致性是另一道障碍。一致性协议协调共享数据的缓存副本,使处理器看到一致的状态。将这种协调扩展至众多加速器和池化内存,可能产生更多流量、控制器复杂性和故障恢复需求。
Lee 教授在 SK hynix 的公告中承认了这一限制。他将低功耗光子集成、一致性协议和系统可靠性列为仍待解决的商业化挑战。这一表述使路线图更具可信度,但也表明实际部署距离愿景仍有多远。
拟议架构还必须明确内存池中使用何种介质。它可以采用 HBM、传统 DRAM、高带宽闪存或多个层级。每一种选择都会改变延迟、耐久性、容量、功耗和成本特征。
目前没有公开规格回答 SK-hynix CPO 概念中的这一问题。论文确立了架构方向,同时将未来产品和实施选择留待后续决定。
竞争态势提供了有益的背景。Broadcom 已经在交换层推出了 CPO 设计。其 102.4 Tbps 交换机采用先进的多芯片封装,将光子引擎与高容量以太网交换机集成在一起。
Nvidia 正将共封装硅光技术纳入其网络技术栈。其光子平台将光学引擎部署在交换 ASIC 旁边,以支持规模更大的 scale-out 与 scale-across 网络结构。
Intel 在 2024 年展示了另一条路径。其光学 I/O chiplet与 CPU 共封装,并实现了实时数据传输。这项工作聚焦于光学计算互连,而非已披露的共享内存产品。
这些努力表明,CPO 已不再局限于实验室讨论。它们也凸显了 SK hynix 所处位置的不同。Broadcom 和 Nvidia 正在推进光网络的商业化,而 Intel 展示了紧邻计算芯片的光学 I/O。
SK hynix 则将讨论延伸至内存端点。其贡献并不能证明它在可部署的光学系统方面领先于这些公司,而是试图确保内存架构成为 CPO 设计流程的一部分。
这项工作可能改变供应商之间的关系。能够参与定义控制器、协议和封装接口的内存厂商,其影响力将超越按既定容量和带宽销售内存堆叠本身。
处理器厂商依然拥有强大的议价能力。它们控制加速器架构、内存调度、缓存行为以及软件栈的大部分内容。若没有发送请求的处理器提供紧密支持,池化内存设计将难以落地。
超大规模客户则掌握另一项决定性优势。他们能够验证池化内存的灵活性是否足以抵消更高的系统复杂度。他们的采购承诺也能为量产所需的封装与光学供应链提供支撑。
这并不是一场简单的替代竞赛。直连 HBM 可将本地性能最大化,而光学池化瞄准的是系统灵活性与覆盖范围。若池化层能够满足延迟、可靠性和软件要求,未来系统很可能会同时采用两者。
这正是 SK hynix CPO 论文背后真正的转变。这家凭借部署在处理器旁的内存而成为 AI 核心参与者的公司,如今主张让部分内存在物理上与处理器分离,并通过光学方式访问。
路线图仍面临散热、良率与可靠性挑战
将光学器件更靠近高热硅芯片能够缩短电连接,但也会把制造与运维风险集中在一个更难维护的封装之中。
CPO 将可插拔光模块从系统前面板这一熟悉的位置移除。这一变化可以提升带宽密度和能效,但也可能在发生故障时使光学组件更难触及。
可插拔收发器通常可以在不报废交换机或处理器封装的情况下更换。共封装光学引擎则更贴近昂贵的硅芯片。因此,维修策略、冗余设计和故障隔离将成为核心设计问题。
热管理同样困难。处理器和交换机会产生大量热量,而激光器、调制器和光电探测器对温度变化的反应各不相同。将这些组件放在一起可以降低电损耗,却也会形成要求更高的热环境。
Nature Electronics 摘要明确将热管理、可制造性和标准化列为尚未解决的要求。这些问题同样适用于传统 CPO;当架构延伸至内存时,其重要性会进一步上升。
光子中介层必须以精确对准和可接受的损耗连接多种类型的裸片。当一个组件包含更多部件和接口时,封装良率可能下降。一个微小光学元件的缺陷,就可能影响一个更大封装的经济性。
三维集成进一步提高了难度。堆叠电子与光子组件可缩短连接并提高密度,但也使散热、测试、组装和失效分析更加复杂。
激光器的部署位置也带来取舍。集成式激光器可缩短光路,但必须承受封装热量。外置激光器能够改善可维护性和热隔离,但会增加耦合、对准和系统管理要求。
光纤连接同样并不简单。高密度封装需要可重复的连接方式,并能在组装和运行过程中保持稳定。这些连接既要维持信号完整性,也要适配服务器制造与维护流程。
标准将决定这些系统会形成可互操作的市场,还是垂直整合的产品。厂商必须就电接口、光学引擎、控制方式、封装边界和测试流程达成一致。
内存池化在物理层之上还增加了协议问题。系统必须管理寻址、访问权限、拥塞、排序和一致性。它还必须能够在光路、控制器、内存设备或加速器发生故障时恢复运行。
AI 集群对可靠性的要求尤其严格。在分布式软件重建工作期间,一个链路问题就可能让大量昂贵的处理器闲置。若在未充分隔离故障的情况下增加组件数量,降低链路功耗带来的收益可能被完全抵消。
软件是另一项常被低估的约束。操作系统、运行时、编译器和 AI 框架需要了解内存位置及其访问成本。将每个字节都视为同样接近,会导致糟糕的数据放置决策。
开发者最终可能会面对内存层级中的又一个层级。本地 HBM 仍将是最快的资源。光学池化内存可以提供更大的容量,但具有不同的延迟特性;存储则负责承载更冷的数据。
这一层级需要可用的抽象。应用程序不应需要手动控制每个张量的放置位置。不过,自动化系统必须足够准确地预测访问模式,避免在光学网络上反复传输数据。
池化也扩大了安全问题。共享内存资源需要在工作负载、租户和加速器之间实现强隔离。控制器必须防止未经授权的访问,同时避免为每次请求增加过多延迟。
这些问题都不会否定该架构。它们解释了为何同行评审路线图不应被描述为商业突破。这篇论文梳理了仍待完成的工作,并释放出 SK hynix 偏好方向的信号。
最有力的证据将是具备端到端测量结果的可运行原型。这些测量应包括应用性能、总链路能耗、尾延迟、热行为、错误率以及组件故障下的恢复能力。
仅有组件级带宽纪录并不充分。该架构的主张关乎系统效率,因此验证必须考虑控制器、转换阶段、网络争用和软件开销。
制造方面的证据同样重要。良率、测试覆盖率、封装组装时间和现场可更换性都会影响采用情况。一项技术上可行的设计,仍可能因运营成本而输给改进后的电连接或可插拔光学方案。
因此,目前的 SK hynix CPO 路线图应采用谨慎措辞来描述。它定义了目标和集成路径,但并未证实光学内存接口已准备好投入生产,也未表明池化内存会在所有工作负载中优于直连 HBM。
三个信号将表明光学内存是否正在成为现实
下一阶段需要明确的硬件、可测量的系统结果,以及将路线图转化为可实施接口的生态系统共识。
第一个信号是已披露的原型。SK hynix 或其合作伙伴需要明确说明内存类型、光子引擎、控制器、中介层以及所连接的处理器。一个实际运行的系统将使该提案超越示意图和组件目标。
最有价值的演示将运行一项具有代表性的 AI 或高性能计算工作负载。它应在相同条件下比较本地 HBM、电学池化和光学池化。
如果端到端测量结果接近论文所述的带宽、能耗和延迟目标,将强化论文的论点。若结果排除了激光器或控制器功耗,比较的说服力就会减弱,因为这忽略了关键系统成本。
第二个信号是具名的处理器、云服务、封装或光子合作伙伴。光学内存池化跨越了太多技术边界,单一家内存供应商无法独自部署。
与加速器厂商的合作将表明其支持相关内存协议和软件模型。超大规模云厂商的参与,则能证明该架构满足的是运营需求,而不只是供应商的愿景。
封装与晶圆代工厂的参与将展示光子中介层如何进入规模化制造。专业光学合作伙伴可以进一步澄清激光器部署、调制器、耦合和光纤连接方案。
缺乏具名合作伙伴并不能推翻该路线图。公司往往会先发布架构研究,之后才公布商业计划。尽管如此,一个已确认的项目仍会比又一次泛泛而谈的合作声明提供更有力的证据。
第三个信号是一致性、接口标准和可维护性方面的进展。一项共享规范将表明,厂商正就处理器如何发现并访问池化光学内存逐步达成共识。
应关注控制器归属、寻址、排序、拥塞管理、错误处理和隔离等细节。这些选择将决定光学内存是成为可互操作的基础设施,还是某个平台内部的专有功能。
可维护性也应出现在同一讨论中。厂商需要说明,当激光器、光学引擎、光纤连接或内存模块发生故障时将如何处理。可信的设计必须避免因一次光学故障而更换整个高价值封装。
这些信号也将揭示谁承受的压力最大。如果加速器厂商采用开放式光学内存接口,直连内存将成为更大内存池中的一个层级;如果它们坚持协议专有化,内存供应商可能仍会是由处理器主导平台中的组件提供商。
企业买家应关注工作负载结果,而非孤立的带宽声明。只有当软件能够使用池化容量、且不会造成延迟尖峰、拥塞或不可接受的故障域时,池化容量才有意义。
开发者应关注运行时如何暴露这一新层级。透明放置可简化采用,但为了获得可预测的性能,可能仍需显式控制。这种平衡将决定该架构更像普通内存,还是一种专用互连网络。
知识工作者和普通 AI 用户不会配置光子中介层。但若基础设施兑现其承诺的灵活性,他们仍可能通过更大的上下文窗口、更高效的推理以及更少的容量限制感受到成果。
目前,最好将 SK hynix CPO 理解为一项战略性架构主张。已验证的事件是 8 月 19 日发表的一篇综述文章,随后是 8 月 20 日的公司公告,而不是一款新近出货的内存产品。
这篇论文之所以重要,是因为 SK hynix 已将光学内存池化纳入其公开路线图。尚未得到解答的问题是,合作伙伴、原型和标准能否将这一立场转化为基础设施。
未来几个月,请不要被“光将彻底改变 AI 系统”这类宽泛承诺所左右。更值得关注的是:是否出现具名原型、完整的功耗与延迟测量结果,以及明确的相干接口定义。这三个信号将表明,光学内存是否正从路线图走向数据中心。



