top of page

Samsung SK hynix PIM 芯片并非 2026 年的新发布,但竞争已进入新阶段

9月25日
讀畢需時 13 分鐘

尽管近期出现的一则标题暗示情况并非如此,Samsung 和 SK hynix 并未宣布将在 2026 年 10 月联合推出新一代内存计算芯片。该表述所依据的可验证事件可追溯至 2022 年 2 月,当时 SK hynix 正准备在 ISSCC 展示存内计算技术。

这一差别很重要,因为 Samsung SK hynix PIM 芯片如今已成为更广泛 AI 基础设施竞争的一部分。两家公司都已从单独的研究公告,转向围绕推理、数据移动、容量和能耗设计的内存系统。

最初的报道聚焦于存内计算,即 PIM:它将部分计算置于内存内部,而不是将每项操作都发送至独立处理器。如今的竞争规模更大。Samsung 和 SK hynix 正在推进 PIM、高带宽内存、闪存、封装和软件的不同组合。

这并不只是 Samsung 与 SK hynix 围绕某一款实验性芯片的较量。主要竞争实际上发生在以 GPU 为中心的传统系统,以及将存储或计算更靠近数据的架构之间。

所谓发布可追溯至 ISSCC 2022

现有证据表明,这是一项早期会议公告,而不是计划于 2026 年 10 月举行的新发布。

SK hynix 于 2022 年 2 月 16 日宣布推出 GDDR6-AiM。该公司将其描述为一款在 GDDR6 内存中加入计算功能的存内计算产品。

SK hynix 表示,将在 2022 年国际固态电路会议上展示这项成果。该届 ISSCC 于当年 2 月 20 日至 2 月 24 日在线举行,而非在 2026 年 10 月举行。

该公司的公告提供了多项与重新出现的标题相符的线索:它涉及下一代内存芯片、在内存中进行计算,以及亮相一场重要的全球半导体会议。

时间表述也与在该会议前不久撰写的报道一致。不过,SK hynix 当时称,展示将在“本月底”进行,而不是下个月。

根据 GDDR6-AiM 公告,该样品将计算功能与运行速率为每秒 16 千兆比特的 GDDR6 相结合。该公司将其定位于机器学习、高性能计算和大规模数据处理。

SK hynix 声称,以 GDDR6-AiM 替代传统 DRAM,可使某些计算快 16 倍。该公司还声称,通过减少内存与处理器之间的数据移动,功耗可降低 80%。

这些均为公司针对特定工作负载报告的结果,并不能证明所有 AI 模型、服务器或生产环境都能获得可比的提升。

同期,两家韩国内存制造商还分别在 ISSCC 进行了展示。官方 ISSCC 新闻资料包 列出,SK hynix 展示了一款带宽达每秒 896 GB 的 HBM3 设计。

Samsung 展示了一款每个引脚运行速率达每秒 27 千兆比特的 16 千兆比特 GDDR6 设计。这些展示涉及先进内存性能,但并非联合发布 PIM 产品。

Samsung 自身的 PIM 历史开始得更早。2021 年 2 月,该公司推出 HBM-PIM,即在每个内存 bank 中集成可编程处理单元的高带宽内存版本。

Samsung 表示,该设计面向 AI 训练、推理和高性能计算。其论文也入选 ISSCC 展示。

因此,主要来源支持一个更准确的结论:Samsung 与 SK hynix 都在 2021 年和 2022 年 ISSCC 周期前后推进以内存为中心的计算。它们并未发布一款共同开发的产品。

去除原始日期的标题,可能会将这项历史性进展包装成突发新闻。当聚合平台未展示发布者的完整时间戳时,读者应谨慎看待“下个月”等相对时间表述。

为什么存内计算在 2026 年仍然重要

PIM 仍具意义,因为数据移动如今消耗的时间和能源,单靠更快的算术运算无法弥补。

传统加速器会在处理器与内存之间反复传输模型权重、激活值和中间结果。当内存系统无法足够快地供应数据时,处理器可能处于闲置状态。

工程师将这一限制称为“内存墙”。处理器性能的提升速度,快于系统高效移动大型数据集的能力提升速度。

用实际术语解释,存内计算并没有名称听上去那么复杂。部分操作在数据存储的位置完成,从而减少穿越连接内存和处理器接口的往返。

这一思路并非用普通 DRAM 替代 CPU 或 GPU。相反,它将适合的操作分配给置于内存子系统内部或附近的专用逻辑。

这一区别很重要。通用处理器仍更适合控制流和多样化计算。内存侧计算最适用于需要在大型数据集上反复执行可预测操作的工作负载。

AI 推理就会产生许多这类工作负载。语言模型在生成每个 token 时,必须持续检索参数并管理临时数据。

更长的提示词还会加大对键值缓存的压力。键值缓存是在生成过程中复用的、先前计算得到的注意力数据集合。保留这些信息可以减少重复计算,但需要可观的内存容量和带宽。

增加更多 GPU 算力并不能自动解决这些问题。如果数据无法足够快地抵达计算单元,额外的处理器可能会增加成本和功耗,却无法带来成比例的性能提升。

PIM 方法试图减轻这种失衡。它们可以在更靠近内存的位置执行矩阵计算、搜索、筛选或数据移动管理等操作。

Samsung 最初的 HBM-PIM 设计 将可编程计算单元置于 HBM 堆叠的 bank 内部。HBM 使用垂直连接的 DRAM die,在紧凑封装中提供高带宽。

Samsung 报告称,其原型在特定应用中将系统性能提升逾一倍,同时将能耗降低超过 70%。这些数据来自 Samsung 的测试,不应被视为独立基准测试结果。

SK hynix 最初则通过 GDDR6-AiM 采取了不同路线。GDDR 内存通常与图形相关联,但其带宽也使其适合用于 AI 加速。

该公司后来将 AiM 芯片组合为名为 AiMX 的加速卡。这种封装为在服务器中测试 PIM 提供了更清晰的路径,无需围绕内存重新设计整个处理器。

这正是 Samsung SK hynix PIM 芯片在最初报道四年后仍值得关注的原因。AI 基础设施日益依赖的不仅是 GPU 峰值吞吐量。

运营商如今会评估平台提供模型服务的效率、处理长上下文的能力、缓存数据管理方式,以及在功耗限制内扩展的能力。内存架构会影响所有这些指标。

结果是,内存正从作为组件的更快内存,转变为计算架构的一部分。这一变化提高了那些过去在处理器背后供应标准化芯片的公司的战略价值。

Samsung 与 SK hynix 的 AI 内存竞争已成为系统之争

竞争已从单项内存规格扩展至移动、存储和处理 AI 数据的完整路径。

Samsung 在持续开发 PIM 的同时,正将该技术与其更广泛的内存和封装产品组合结合。其优势在于能够同时覆盖内存、逻辑制造和先进封装。

在 Future of Memory and Storage 2026 上,Samsung 展示了约 30 项内存和存储技术。产品阵容包括 HBM4E、HBM5、LPDDR5X-PIM 和企业级存储产品。

LPDDR5X-PIM 将计算功能引入低功耗 DRAM。这使该方案与能耗和原始吞吐量同样重要的边缘系统和设备相关。

Samsung 还展示了 zHBM,这是一种拟议中的三维架构,将高带宽内存置于处理器上方。该设计旨在缩短数据路径,并通过专门的冷却结构应对散热限制。

这种方法不同于在每一种内存产品中插入计算单元。它将物理距离、封装和热量视为同一个数据移动问题的组成部分。

因此,Samsung 2026 年的 内存产品组合 从近期 HBM 产品延伸至更长期的架构。其中一些为已出货产品,另一些仍处于样品、演示或路线图概念阶段。

SK hynix 正围绕 HBM、PIM、高带宽闪存和软件构建自己的技术栈。该公司将这一方向称为“全栈 AI 内存”战略。

其 GDDR6-AiM 芯片仍是 AiMX 的基础,后者是一款面向大型语言模型工作负载设计的加速卡。SK hynix 已在服务器中展示 AiMX,而非将该技术局限于独立 die。

2026 年 9 月,该公司展示了一台运行交互式语言模型演示的 AiMX 服务器。它还展示了高带宽闪存及名为 SALT-KV 的软件技术。

高带宽闪存,即 HBF,将垂直互连技术应用于 NAND 闪存。SK hynix 将其定位为快速 HBM 与传统固态存储之间、以容量为重点的层级。

SALT-KV 用于处理语言模型推理期间产生的键值缓存。该公司表示,其软件会根据缓存信息的特征及再利用潜力进行管理。

SK hynix 认为,这些技术服务于不同的推理需求。PIM 面向快速解码,而 HBF 为长上下文工作负载提供更多容量。

这一产品组合展现了当前 Samsung 与 SK hynix 的 AI 内存竞争。两家公司都未将赌注押在普通 DRAM 的某一种通用替代品上。

Samsung 强调跨封装、内存与制造环节的整合。SK hynix 则围绕不同的 AI 服务模式,组合专用内存层级和软件。

Micron 及其他内存供应商带来了竞争压力,而 Nvidia、AMD 和定制加速器设计商则会影响哪些接口将具备商业重要性。一种技术上令人印象深刻的内存设计,仍需要处理器支持和客户认证。

云服务运营商也在自行设计更多芯片。它们的选择可能决定一种内存技术是成为获得广泛支持的标准,还是始终绑定于狭窄的加速器配置。

这使得对软件层的控制日益重要。开发者需要能够理解每项操作应在何处运行的编译器、库、调度器和监控工具。

要求大规模重写应用程序的硬件会带来阻力。能够通过熟悉框架呈现的硬件,更有可能从演示走向生产部署。

这一机制旨在减少数据移动

存算一体最有力的理由,不是让内存变成 GPU,而是让更少的数据字节穿越代价高昂的瓶颈。

现代 AI 服务器包含多种不同形式的内存与存储。寄存器和缓存最接近计算核心,其后是 HBM 或其他直连内存。

系统内存则在距离加速器更远的位置提供额外容量。固态硬盘可容纳规模大得多的数据集,但延迟也更高。

数据在这些层级之间的每次传输都会消耗能量,同时引入延迟,并占用接口、控制器和封装资源。

PIM 通过将有限的计算单元部署在存储数据旁来改变工作流程。这些单元可先处理适合的操作,再将更小的结果发送回中央处理器。

以检索大型嵌入表的推荐系统为例。即使最终输出只是一小组候选结果,传统设计也可能需要将大量数据传输到处理器。

内存侧逻辑可以在数据源头附近完成筛选或合并。处理器因此接收更少的数据字节,并减少等待内存流量的时间。

语言模型推理则是另一种案例。生成文本需要反复访问模型参数和缓存的注意力数据。

PIM 可加速部分重复性计算。高容量内存层级可将更多模型工作数据保留在服务器附近,而不必反复从较慢的存储设备加载。

这两种方法都不会取代 GPU。GPU 仍负责模型的核心计算并协调执行。

其目标是构建更均衡的系统。计算能力、带宽、容量与功耗应协同扩展,而不是让某一种资源处于闲置状态。

SK hynix 在其 2026 年 9 月 AI Infra Summit 演讲中提出了这一观点。该公司表示,传统 GPU-HBM 架构正越来越难以满足从低延迟智能体到长上下文服务等各类工作负载的需求。

其 AI memory showcase 展示了 PIM、HBF、AiMX 和 SALT-KV。参观者可以查看硬件,并与运行在搭载 AiMX 的服务器上的语言模型演示进行交互。

这一演示的重要性高于又一个理论性能指标。它展示了从一颗内存芯片走向开发者和客户可评估系统的路径。

不过,会议演示并不能证明量产经济性。它无法证明在大规模集群中的可靠性、跨模型的软件兼容性,或更低的总体拥有成本。

Samsung 面临同样的考验。其 PIM 和三维内存概念必须与处理器路线图、封装产能、冷却系统及客户软件相适配。

这一机制也带来了权衡。加入内存的逻辑会占用芯片面积和功耗,同时增加设计复杂性。

针对某一类计算优化的 PIM 单元,在模型架构变化后可能会变得不那么有用。固定功能带来效率,但通用可编程性会增加成本和开销。

内存制造商必须决定这条边界应设在哪里。灵活性过低会缩小市场,灵活性过高则会重现传统处理器的复杂性。

这些矛盾解释了为何仅通过峰值性能来解读存内计算会误导读者。数据移动确实是问题所在,但能否实际部署取决于完整系统。

会议宣称仍需量产证据支撑

尚未解决的问题不是 PIM 是否可行,而是它是否足够广泛适用,足以证明新增一层硬件和软件的合理性。

公司公告通常会报告为匹配新架构而挑选的工作负载结果。这些测试可以证明技术潜力,却未必能预测生产环境中的表现。

SK hynix 最初宣称处理速度提升 16 倍、功耗降低 80%,适用于特定计算任务。这些说法并未涵盖所有工作负载,也没有披露普适性的部署结果。

Samsung 早期的性能和能耗声明同样基于内部评估。它们应被视为供应商测量结果,而非完整量产系统之间的独立对比。

工作负载敏感性构成第一项风险。当操作具有重复性、可并行且受数据移动限制时,内存侧计算带来的收益最大。

控制流不规则的程序获益可能较少。一些任务也可能受网络、处理器调度或存储限制,而非内存带宽限制。

软件构成第二道障碍。PIM 芯片需要工具来决定哪些操作应在内存内部执行,哪些仍应留在加速器上。

这些工具必须适应不断变化的模型和框架。否则,客户将面临可能抵消基础设施节省的工程成本。

标准化构成第三项挑战。AI 处理器、内存设备和软件栈来自不同供应商,并各自遵循不同的发布周期。

专有实现最初可能推进得更快。通用编程模型可以覆盖更多客户,但行业达成共识需要时间。

制造又带来另一重不确定性。将逻辑与高密度内存结合,可能会使测试、良率管理、封装和热设计更加复杂。

内存行业拥有大规模生产可靠 DRAM 的丰富经验。加入计算能力可能改变标准化内存之所以具有吸引力的经济模式。

Samsung 广泛的制造能力为其提供了多种集成选择。但它仍需证明,组合这些能力能够以可接受的良率制造出可靠的系统。

SK hynix 在高带宽内存领域占据强势地位,并展示了更广泛的 AI 内存解决方案。它必须将这种技术势头转化为展会之外可重复的客户部署。

这正是 Samsung 与 SK hynix 的 AI 内存竞争不再只是规格竞赛的原因。不同架构可在市场不同领域获得成功。

Samsung 可能会在高度集成的封装或低功耗设备中找到更强机会。SK hynix 则可能凭借加速卡、专用推理系统或分层内存架构获得市场牵引力。

两家公司也都依赖掌控加速器设计的客户。Nvidia、AMD、云服务提供商及其他芯片开发商,既可能支持、重塑,也可能绕开内存供应商偏好的架构。

因此,最有力的证据将是具名的量产部署,并提供可重复的工作负载结果。客户需要在真实条件下披露性能、能耗、利用率和软件成本。

在缺少此类证据时,读者应区分三个发展阶段:研究论文证明可行性,原型展示集成能力,而通过验证的商业产品则证明已具备客户就绪度。

这条重新出现的标题最初描述的是前两个阶段。它不应被解读为 Samsung SK hynix PIM 芯片已经实现广泛商业采用的证据。

三项信号将表明 PIM 是否正在成为市场

客户验证、软件支持和可重复的推理经济性,将决定存算产品能否突破专用部署的局限。

第一项信号是具名的量产平台采用 PIM 或 AiMX。已确认的服务器或加速器部署,将表明客户已接受硬件、软件和可靠性方面的权衡。

披露的质量同样重要。试点、备忘录或展会合作关系,与面向客户提供的已出货系统并不具有同等分量。

量产采用将强化内存供应商能够从 AI 计算中获取更多价值的论据。若持续依赖传统 HBM,则会削弱架构转型的说法。

第二项信号是主流 AI 软件中的支持。开发者应关注编译器集成、优化内核、开放编程接口和框架级调度。

软件决定应用程序能否使用专用硬件,而无需围绕单一供应商重写。它也决定系统能否随着模型结构变化而适应。

广泛的工具支持将增强 Samsung SK hynix PIM 芯片的市场前景。碎片化或封闭的软件将使其仅限于能够维护定制基础设施的客户。

第三项信号是经独立测量的推理经济性。有效的比较应涵盖多种模型类型下的延迟、吞吐量、能耗、内存容量和利用率。

长上下文推理尤其值得关注,因为其缓存需求会直接增加内存容量压力。快速交互式智能体则提供了另一项测试,因为它们更强调低延迟。

如果 PIM、HBF 或三维内存能够在无需过多软件工作的情况下改善这些指标,以内存为中心的计算将更具吸引力。如果收益在选定演示之外消失,传统加速器设计仍将保有优势。

读者还应将 PIM 与 HBM 的更广泛成功区分开来。HBM 已成为高性能 AI 加速器不可或缺的组成部分,但这并不保证内存内部计算也会获得采用。

更可能的短期结果是混合层级架构。GPU 将继续处于核心位置,而专用内存和存储层将处理那些受益于更高带宽、更大容量或本地处理的工作负载。

Samsung 和 SK hynix 正通过不同技术组合为这一结果做准备。它们的战略表明,未来 AI 系统不会依赖单一类型的内存。

更大的转变在于观念层面。内存供应商越来越将其产品描述为 AI 基础设施的活跃组成部分,而非被动的存储组件。

这一转变提高了处理器公司的竞争压力,也让云运营商在数据存储、移动和处理的位置上拥有更多选择。

开发者和企业买家应关注部署情况,而非会议标签。关键问题在于,计入集成成本后,新型内存架构是否能改善真实工作负载。

原始报道作为历史标记仍有价值。它记录了韩国最大的内存制造商公开挑战计算与存储传统分离的时刻。

四年后,这一理念并未消失。它已扩展为围绕 PIM、HBM、高带宽闪存、先进封装和内存感知软件展开竞争的路线图。

下一项真正重要的公告,不会是又一次承诺内存能够计算,而是证明客户可以重复部署该技术、衡量其收益,并在不断变化的 AI 工作负载中持续支持它。

对于评估 AI 基础设施的任何人而言,这才是应当遵循的务实检验标准。在将下一场会议演示视为市场转型之前,请先寻找具名系统、可用软件和第三方结果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page