SK-hynix CPO 路线图推动光互连走向内存,但产品鸿沟仍然存在
SK hynix 于 2026 年 8 月 20 日发布了一份三阶段光学集成路线图,但 SK-hynix 的 CPO 计划并不是一次产品发布。这是一项有研究支撑的提议:让光更接近处理器,并最终直接进入共享 AI 内存系统。这一区别构成了核心张力。
该路线图瞄准单节点超过 100 太比特每秒的带宽、低于每比特 1 皮焦耳的能耗,以及低于 10 纳秒的芯片间延迟。这些数字描述的是未来基础设施的设计目标。SK hynix 尚未宣布一套同时达到这三项目标的商用系统。
这一更大的布局之所以重要,是因为 Nvidia 和 Broadcom 已经将共封装光学推进到网络交换机中。SK hynix 则试图将这一理念进一步深入计算架构。其拟议目标是采用光学互连织网连接处理器池与内存池,而非让光学互连止步于网络交换机。
SK-hynix CPO 路线图实际宣布了什么
SK hynix 宣布的是技术方向,而不是可交付的光学内存产品。
该公司在其 8 月 20 日发布的 CPO 路线图公告中确认了这一活动。其背后的综述论文刊登于 Nature Electronics,题为“面向高性能计算与人工智能的共封装光学”。
共封装光学,即 CPO,将光学引擎放置在其服务的处理器或交换机附近。光学引擎负责将电信号数据转换为光,并将接收到的光转换回电信号。
这种近距离布局缩短了要求最高的电传输路径。随后,光纤可在更长距离上传输数据,其传播损耗低于同等速度下铜走线所能提供的水平。
这篇经过同行评审的光互连综述由 SK hynix 研究员 Seunghoon Hong 与来自五所大学的研究人员共同撰写。这些机构包括弗吉尼亚大学、伊利诺伊大学厄巴纳-香槟分校、MIT、南洋理工大学和延世大学。
论文将发展路径分为三个广泛的集成阶段。二维封装将电子与光子组件并排放置在共享基板上。2.5D 设计则通过中介层连接它们;中介层是位于多颗芯片下方的高密度通信层。
更长期的 3D 阶段将不同的电子和光子组件垂直堆叠。这种方法可以进一步缩短连接距离,但也会使散热、制造、测试和维修更加困难。
SK hynix 最具影响力的提议超越了这些封装示意图。它在 XPU 池与独立内存池之间设置光子中介层。XPU 是对 GPU、CPU 及其他专用加速器的统称。
在这一模型下,加速器会保留高速本地高带宽内存,即 HBM,用于处理最直接的任务。处理器还可以通过光链路访问更大的内存资源。
这一架构并不会让本地 HBM 过时。本地内存仍将服务于对延迟敏感的计算。光学池则可提供无法放置在每个处理器封装旁的容量与灵活性。
这种分离至关重要。当前的加速器系统将每个处理器与有限容量的 HBM 紧密耦合。相比之下,池化设计提出的问题是:多个处理器能否共享更大的内存层级,同时又不损失过多速度或可预测性。
路线图公布的目标为这一架构描绘了终点。它提出单节点带宽超过 100 Tb/s、能耗低于 1 pJ/bit,以及芯片间延迟低于 10 纳秒。
这些是严苛的系统要求,而非已公布 SK hynix 硬件的经验证规格。公开材料没有列出产品名称、客户部署、制造合作伙伴、送样时间表或发布日期。
这场活动仍然具有实质意义。一家主要 HBM 供应商已正式将光互连纳入其未来内存架构的视野。不过,读者应将这一公告视为研究与生态系统信号。
这一表述也解释了原始热点列表中的发布日期差异。SK hynix 的底层公告日期为 2026 年 8 月 20 日。之后的社交媒体关注并不代表第二次产品发布。
为什么带宽墙已延伸到 HBM 之外
HBM 改善了内存与单个加速器之间的通路,但大规模 AI 系统在数千个组件之间制造了第二个瓶颈。
AI 计算的扩展并不只是让单块 GPU 更快。大型训练和推理工作负载会将任务分布到处理器、服务器、机架和数据中心 Pod 之间。每增加一个层级,就会产生更多数据移动。
HBM 解决了这一问题中的关键部分。它将内存芯片垂直堆叠,并通过先进封装将其放置在加速器附近。短而宽的接口提供的带宽远高于普通封装外内存连接。
这种设计有助于为处理器提供数据,无需让每个字节都通过狭窄的传统内存通道。然而,每个加速器封装的空间、供电能力、散热容量和中介层面积都是有限的。
增加更多 HBM 堆栈最终会碰到这些物理限制。提高 HBM 带宽也不会自动改善独立加速器之间或远距离机架之间的通信。
Nature Electronics 的综述通过电学物理描述了更广泛的限制。随着电连接变得更快或更长,电阻、电容和与频率相关的失真都会加剧。工程师可以通过均衡器、重定时器和数字信号处理器进行补偿。
这些组件能够恢复信号质量,但会消耗能量,并增加热量、成本和延迟。它们还会占用本可用于计算或内存的电路板面积。
光链路将长距离部分转移到光纤中。与高速电信号穿过电路板和线缆时遭遇的同类频率相关损耗相比,光可以在更远距离上传播。
CPO 并不会消除电信号。处理器和内存仍以电子方式运行,电驱动器和接收器依然不可或缺。该架构减少了最高速电信号在转换前需要传输的距离。
这一细节解释了为什么近距离如此重要。可插拔光模块位于电路板边缘。数据必须先从交换机或处理器穿过电走线,才能到达该模块。
共封装引擎则在主芯片旁完成转换。电传输段变得更短,而光纤负责更长的路径。
研究人员多年来一直在研究这一概念。2023 年发布的一篇广泛的 CPO 技术综述记录了硅光子、激光器、封装、电接口和光功率传输方面的进展。
SK hynix 的介入改变了重点。该公司正在探讨光学应如何与内存层级互动,而不仅是如何取代可插拔网络模块。
内存层级会根据速度、容量、位置和能耗,为不同的存储与内存技术分配不同任务。寄存器和缓存最接近计算单元。HBM 提供更大的本地工作内存,而其他层级则在更远距离上提供不断增加的容量。
光学内存池将引入另一个层级。它的价值在于让多个处理器共享更大的资源,同时将本地 HBM 留给最热的数据。
这可能对大型模型很重要,因为它们的参数、键值缓存、训练状态或检索索引可能超出单个加速器的本地内存容量。如今,软件通常会将这些资产分布到多个设备上,并通过网络互连织网协调传输。
更低能耗的光学路径将为系统架构师提供更多数据放置选择。他们或许会将昂贵的本地容量留给对延迟敏感的张量,同时将较冷的数据放入池化层级。
然而,可用内存不仅取决于链路带宽。应用还关心访问延迟、争用、一致性、故障隔离、安全性和软件支持。
高速物理链路无法决定在拥塞期间哪个处理器应获得优先级。它也无法让远程内存完全像本地 HBM 一样工作。控制器、协议、操作系统、编译器和工作负载调度器必须有效地暴露这一新拓扑。
对开发者而言,这意味着该路线图并不只是一个更快线缆的故事。它指向一种不同的系统模型:数据放置将变得更动态,也可能更复杂。
评估此类系统的团队将需要可靠记录硬件假设、基准测试和软件依赖关系。可搜索的工程知识库可帮助团队在平台演进过程中保留这些决策。
因此,这一压力已超出光学组件供应商范围。加速器制造商、内存供应商、晶圆厂、封装公司、网络供应商和云运营商必须就各个组件如何连接达成一致。
真正的竞争是本地内存与池化内存
主要竞争并不是 SK hynix 与某一家光学供应商之间的竞争,而是紧密连接的本地内存与本地加池化混合架构之间的竞争。
本地 HBM 提供了直接的性能优势。它位于加速器旁,可提供可预测的高吞吐量访问。软件已经理解设备与其附属内存之间的基本关系。
其缺点是物理稀缺性。每个处理器只能支持由封装空间、热限制、接口宽度、功耗、制造良率和系统经济性所允许的容量。
池化架构改变了这一方程式。理论上,多个处理器可以访问共享容量层级,从而让内存可根据工作负载需求分配,而不是受固定封装边界限制。
潜在的利用率优势很直观。一个处理器可能需要大量内存分配,而另一个需要得更少。共享池可以将可用容量导向前一个工作负载,而非让内存闲置在后一个处理器旁。
随着 AI 系统支持混合工作负载,这种灵活性会变得更有价值。训练、批量推理、实时推理、微调、数据准备和检索对内存的需求各不相同。
拟议架构保留本地 HBM,是因为池化会引入权衡。即便光链路具有较低的传播延迟,数据仍必须经过转换、交换、控制器和仲裁。
距离依然重要。位于封装或电路板另一端的远程池,其访问特征不会与通过中介层直接连接的 HBM 相同。
因此,SK-hynix CPO 论点最有力的版本是混合式架构。本地 HBM 提供即时带宽,而光学池化提供容量和系统级灵活性。
这一混合模型对传统加速器设计形成压力。处理器供应商必须决定哪些内存功能应留在封装内部,哪些可以外移而不损害应用性能。
它也对 SK hynix 自身形成压力。从内存组件迈向系统架构,需要在光子学、封装、控制器、协议和软件协同方面具备专业能力。
SK hynix 并不控制每一层。晶圆代工厂制造逻辑芯片和光子器件。封装合作伙伴组装异构组件。加速器厂商定义接口,而超大规模云服务商选择架构并编写运行软件。
Nvidia 已经展示了 CPO 需要多大程度的纵向协同。其在 2025 年 3 月发布的光子交换机公告中,点名了 TSMC、Coherent、Corning、Foxconn、Lumentum、SENKO 及其他生态合作伙伴。
Nvidia 介绍了总吞吐量为 100 Tb/s 或 400 Tb/s 的 Spectrum-X Ethernet 配置。它还概述了一款 Quantum-X InfiniBand 交换机,配备 144 个以 800 Gb/s 运行的端口。
这些数字涉及网络交换机,而非光学共享内存。它们表明,当前商业化 CPO 活动主要集中于网络领域,因为该领域的架构和采购逻辑更为清晰。
Broadcom 也通过以太网交换走出了类似路径。其第三代200G CPO 平台扩展了一个既有项目,该项目围绕交换芯片、光引擎、自动化测试和制造合作建立。
SK hynix 则从相反的方向进入这场讨论。Nvidia 和 Broadcom 从网络交换出发,将光学器件进一步靠近交换 ASIC;SK hynix 则从内存出发,探索光如何扩展有效内存系统。
这未必意味着直接的产品碰撞。这些路径可以在同一个 AI 集群中相互补充。竞争的关键在于,谁来定义接口,并在系统设计中占据最具影响力的位置。
如果内存池化变得重要,内存供应商便可能影响控制器行为、封装、协议和工作负载优化。这一角色的战略分量高于供应可互换的内存组件。
如果光学内存仍不具备可行性,加速器和网络厂商将保持更强的控制力。届时,CPO 将主要通过交换机扩展,而 HBM 仍与每颗处理器紧密耦合。
因此,这一路线图检验的是一个具体命题:AI 基础设施是否足够需要共享内存的灵活性,以至于值得引入新的光学层级。
这一命题有其合理性,但取决于工作负载。大语言模型推理可能需要大量内存容量。训练工作负载可能产生高强度的集合通信模式。科学计算则可能优先考虑不同的延迟和一致性特征。
没有任何单一基准测试能够代表所有使用场景。池化设计必须证明,它在哪些方面优于增加本地 HBM、传统网络、通过 CXL 连接的内存,或软件层面的数据分区。
这一路线图仍面临散热、良率和标准难题
让光学器件更靠近计算可提高信号效率,却也使封装的散热、制造、测试和维修更加困难。
热管理是最明确的未解问题之一。高性能处理器会产生集中的热量,而光子器件和激光器可能对温度变化十分敏感。
将这些技术置于同一封装内,会带来相互竞争的热需求。有效冷却处理器,并不意味着光学行为也能保持稳定。
温度变化会导致光学波长漂移,并改变调制器性能。控制电路或可进行补偿,但这些电路会增加功耗和复杂性。
一篇 2026 年的热管理综述将激光器列为主要可靠性隐患。该综述还指出,当光引擎成为高度集成封装的一部分时,其可维护性会受到限制。
发生故障的可插拔收发器通常可以从前面板上拆下。发生故障的共封装光学组件,则可能影响价值高得多的处理器或交换机总成。
外置激光器设计通过将激光源置于主封装之外,可以缓解部分散热和更换问题。但它们也引入了光传输、连接器、耦合和冗余方面的要求。
制造良率构成另一项挑战。一个包含计算裸片、内存堆叠、电接口、光子芯片、光纤连接和先进基板的封装,只有在其互连部件协同工作时才能成功。
组合组件可能放大单一缺陷的财务影响。一处薄弱的光连接,就可能迫使制造商报废或返工包含昂贵且功能正常硅芯片的总成。
随着集成度提高,测试也更加困难。制造商必须评估电气性能、光学对准、热稳定性、封装应力和长期可靠性。
路线图中的 2D、2.5D 和 3D 顺序承认了这一演进过程。每个阶段都可以缩短数据路径并提高密度,但也都会缩小具有不同材料和运行特性的组件之间的物理间隔。
三维异构集成体现了这种权衡最强烈的一面。垂直堆叠可以形成更短的连接,但埋藏的接口更难检查、冷却和更换。
标准化可能同样重要。内存池必须与来自多家供应商的处理器、交换机、控制器和软件进行通信。
如果没有稳定的接口,云运营商将面临依赖单一紧密耦合平台的风险。供应商同样会面临不确定性:究竟哪些设计值得进行大规模制造投资。
标准必须覆盖的不只是物理信号传输。系统还需要发现机制、内存映射、一致性规则、拥塞管理、遥测、错误恢复、安全和资源分配。
CXL 已通过基于 PCIe 的互连解决了内存扩展和池化的部分问题。光学架构必须明确:它是承载 CXL 流量、引入另一种协议,还是作为多种协议之下的更低层物理层。
公开的 SK hynix 材料并未解答这些问题,也没有指出任何正在测试所提议处理器到内存方案的客户。
这一缺失很重要,因为标题中的性能目标相互关联。某项设计可能实现出色带宽,却无法达到能耗目标。另一项设计可能实现较低链路能耗,却需要昂贵的冷却或控制系统。
每比特低于 1 pJ 的目标尤其值得谨慎看待。统计边界决定这一数字是否包含激光器、电驱动器、接收器、调谐电路、交换、冷却和内存控制器开销。
同样,芯片到芯片低于 10 纳秒的延迟,并不等同于应用可见的内存延迟。软件感知的是经由控制器、仲裁、协议和内存访问的完整路径。
该公告并未声称某个商用节点已在一项有文档记录的工作负载下实现全部目标。将这些目标视为已测得的产品规格,会夸大现有证据。
部署同样是个问题。数据中心运营商已大力投资可插拔光模块、成熟的维修流程和熟悉的供应链。
CPO 必须提供足够的能耗、密度或可靠性价值,才能证明改变这些运营方式是合理的。技术上优雅的封装,仍可能因更换流程造成过多停机时间或库存风险而失利。
Nvidia 和 Broadcom 提供了相关检验,因为它们的交换机产品将 CPO 置于明确的运营角色中。其供货情况、现场可靠性、维修模式和客户采用情况,将塑造市场对更深层光学集成的信心。
SK hynix 面临更艰难的第二步。光学内存池化必须同时证明物理封装的可靠性,以及一种对软件而言具有吸引力的资源形态。
三个信号将显示光学内存是否成真
只有当 SK hynix 公布硬件、合作伙伴和经测量的部署结果时,这一路线图才具有商业意义。
第一个信号是具备明确配置的原型。SK hynix 应披露处理器类型、内存技术、光引擎、中介层设计、协议和测量边界。
这样的原型可让客户区分组件性能与完整系统性能,也能显示 2D、2.5D 或 3D 路线图中的哪个阶段最先具备实用性。
已发布的测量结果应报告节点总带宽、每比特能耗、端到端延迟、热条件、错误率和持续运行表现。结果还应包含相应的控制和冷却开销。
如果某个原型能在可复现工作负载下接近既定目标,这一路线图将获得支持。如果披露仍仅限于组件仿真,商业化鸿沟就依然很大。
第二个信号是具名的生态体系和标准路径。光学内存无法仅靠一家内存供应商独自实现量产。
可信的项目需要加速器合作伙伴、晶圆代工厂、封装供应商、光子器件供应商、系统制造商,以及云计算或高性能计算客户。它还需要一套其他供应商能够实施的接口策略。
对既有标准的支持将降低采用阻力。专有方案或许初期推进更快,但客户需要证据表明锁定和互操作性风险仍处于可控范围。
如果 SK hynix 宣布与主要计算和封装合作伙伴共同推出可互操作原型,其系统级雄心将更为具体。如果竞争性接口不断增加,标准化风险也会随之上升。
第三个信号是将混合架构与本地 HBM 及现有扩展方案进行比较的工作负载证据。仅靠容量无法证明其价值。
测试应展示光学池化在哪些场景下能提升模型规模、加速器利用率、吞吐量或能源利用,同时不带来不可接受的延迟。它们也应揭示哪些工作负载仍更适合完全本地化的内存。
独立客户试验比供应商预测更有分量。生产遥测数据则更具说服力,尤其是当其涵盖故障、热漂移、维护和软件调度时。
最近的竞争性证据将来自网络领域。Nvidia 已宣布的 CPO 交换机和 Broadcom 的制造项目,可以显示集成光学器件是否能经受数据中心运行条件的考验。
成功的交换机部署将增强 CPO 的基础论据。它们不会自动验证光学内存,但会降低围绕封装、供应链和服务实践的不确定性。
采用不佳或可靠性问题则会产生相反效果。它们会强化支持可插拔光学、板载光学或集成度更低方案的观点。
SK hynix 的 CPO 路线图最终要求行业重新划定内存的边界。它不再将容量视为永久附着于单个加速器的资源,而是提出一个横跨本地 HBM 和光学连接池的层级体系。
这正是该公告不止于另一篇光子学论文的原因。它让一家领先的内存供应商置身于未来 AI 系统架构主导权的竞争之中。
但路线图终究只是地图。它没有提供正在出货的目的地、客户时间表,或证明每项目标能够协同实现的证据。
对基础设施采购方和开发者而言,务实的行动是追踪证据,而不是标题中的目标。关注完整原型、由标准支撑的合作伙伴群体,以及独立的工作负载结果。
光学内存会成为本地 HBM 旁边可用的一个层级,还是 CPO 将继续集中于网络交换机?下一个可信答案必须来自经测量的系统,而非另一张示意图。



