top of page

SK hynix 存内计算瞄准 GPU 与 HBM 之外的 AI 瓶颈

1小时前
讀畢需時 14 分鐘

尽管行业多年来依赖 GPU 与 HBM 系统,SK hynix 仍将存内计算重新置于其 AI 战略的核心。在 AI Infra Summit 2026 上,该公司展示了一款 AiM 芯片、一张 AiMX 加速卡,以及一台运行交互式大语言模型演示的服务器。传递的信息很直接:将每一项操作都交由 GPU 处理,正日益成为代价高昂的瓶颈。

9 月 16 日的演讲并未将 PIM 作为一项新发明推出。SK hynix 于 2022 年公布了首个 GDDR6-AiM 样品,并于 2023 年展示了 AiMX 卡。变化在于公司对这项技术定位的论述。SK hynix 目前将其定位为 GPU 与高带宽内存基础设施的专用协作伙伴,尤其面向快速 AI 推理。

这一区别很重要,因为主要竞争并非 SK hynix 与 Nvidia 或其他芯片制造商之间的较量,而是传统 GPU-HBM 架构与异构设计之间的竞争;后者将内存密集型工作交由专用内存硬件处理。新方法有望减少数据移动,但商业化采用仍取决于软件、生产经济性以及经独立验证的性能。

SK hynix 在圣克拉拉展示了什么

SK hynix 将 PIM 展示为更广泛 AI 服务系统中的实际运行组成部分,而不仅仅是一款实验室内存芯片。

该公司于 9 月 15 日至 9 月 17 日在加利福尼亚州圣克拉拉参加了 AI Infra Summit 2026。SK hynix 表示,该活动吸引了约 6,000 名参会者,约为前一年的两倍。其展位面积也扩大了一倍,并以“New Spectrum”为主题整合展示了多项内存技术。

PIM 展示包括公司的 AiM 内存芯片、AiMX 加速卡,以及一台装有该卡的服务器。存内计算,即 PIM,将有限的计算功能置于内存内部或紧邻内存的位置。它减少了在内存与独立处理器之间来回传送每一份数据的需求。

参观者可以与展示系统上运行的 LLM 服务互动。这一细节使展示超越了静态芯片样品,尽管会议演示并不能证明其已具备量产部署条件。AI 基础设施展示表明,SK hynix 希望客户将该产品理解为服务器中可部署的组件。

副总裁 Lim Eui-cheol 在大会的数据移动分论坛上介绍了这一战略。他在演讲中表示,日益多样化的工作负载已无法适配单一硬件设计。超低延迟智能体、长上下文应用和高吞吐量推理,对内存容量、带宽和计算资源提出了不同要求。

Lim 表示,仅依靠传统 GPU-HBM 架构已越来越难以满足所有这些要求。这是该公司的立场,而非对当前 GPU 系统的独立结论。不过,这解释了 SK hynix 为何在同一活动中带来三项不同技术。

PIM 面向快速解码和内存受限型操作。高带宽闪存,即 HBF,旨在 HBM 与 SSD 存储之间提供更大的 NAND 容量。SALT-KV 则是一套以软件为主导的系统,用于将 LLM 的键值缓存分布在 HBM、DRAM 和 SSD 层级之间。

键值缓存用于在语言模型生成过程中保存先前计算出的注意力信息。随着对话变长以及更多请求同时运行,其内存占用会不断增长。高效地迁移或保留这些数据,会影响推理速度和基础设施利用率。

因此,这一产品组合体现了一项核心判断:AI 服务将需要多个专用内存层,而不是单一、速度统一的内存池。SK hynix 正试图将自身角色从销售高速内存,转变为设计 AI 数据应存放在哪里、特定操作应在哪里执行。

这一雄心也解释了为何不能将 2026 年的亮相描述为 SK hynix 首次发布 PIM。该公司于 2022 年 2 月公布 GDDR6-AiM,并于 2023 年推出首张 AiMX 原型卡,随后在 2024 年将该卡展示容量翻倍至 32 GB。

最新活动将叙事从组件开发推进至系统部署。不过,SK hynix 尚未公开提供确认大规模商业采用所需的出货量、具名客户部署案例或量产时间表。

这一缺口构成了本文的核心张力。SK hynix 可以展示一台集成 PIM 的服务器,并阐述一个颇具说服力的架构问题;但它仍须证明客户会围绕该方案重构软件与基础设施。

为什么 GPU 与 HBM 系统面临数据移动问题

SK hynix 所瞄准的限制,出现在昂贵处理器等待数据、而非执行有效计算时。

现代 AI 加速器将高度并行的处理器与高带宽内存,即 HBM,相结合。HBM 通过堆叠 DRAM 芯片并以密集的垂直互连连接它们。将这些堆叠结构置于 GPU 附近,能够提供远高于传统服务器内存的带宽。

这一配置已成为 AI 训练与推理的核心。不过,提高处理器吞吐量并不能消除所有内存限制。一个工作负载仍可能受限于反复读取模型权重、注意力数据或中间结果。

即使数学运算本身很简单,数据移动仍会消耗时间与能源。传统系统从内存取出数据,将其发送至处理器执行操作,再将结果写回内存。在大型模型中反复执行这一序列,可能导致算术硬件未被充分利用。

这一问题在 LLM 解码期间尤为明显。解码按顺序生成输出 token,因此每一步都依赖此前的状态。该过程通常只执行相对有限的计算,却需要读取大量模型与上下文数据。

训练呈现出不同的平衡关系。它将更大的数学运算成组执行,并能让 GPU 单元保持高负载。推理工作负载的差异更大,因为批处理规模、上下文长度、延迟目标和请求模式会随服务而变化。

SK hynix 正利用这种多样性来挑战“每一项重要操作都应在 GPU 上完成”的假设。其观点并非通用加速器已经不再必要。该公司主张卸载适合的内存受限型操作,同时将计算密集型任务保留在成熟处理器上。

这种方法对现有系统设计的多个环节提出了挑战。GPU 运营者必须考虑,增加更多加速器容量是否是解决推理缓慢问题的最高效方案。服务器厂商则必须判断,新增一种卡类是否能带来足以证明其复杂性合理的收益。

云服务提供商面临相关问题。如果软件无法可靠地将工作调度到该组件上,更快的组件价值也会受限。硬件利用率、模型兼容性、系统管理与维护的重要性,可能不亚于理论带宽。

经济性还取决于客户运营何种服务。优先追求即时 token 输出的高端对话智能体,与一次处理数千项请求的批处理服务有不同需求。长上下文检索则引入了另一种内存模式。

SK hynix 表示,PIM 最适合高端服务中的快速解码工作负载。这一限定很重要。它将方案范围收窄至那些低延迟与重复内存访问足以证明专用硬件合理性的工作负载。

该公司并未将某一种内存技术描述为解决所有 AI 瓶颈的答案。HBF 面向长上下文使用场景的容量与带宽。SALT-KV 决定缓存信息应存放在哪里。PIM 则在存储数据附近执行特定计算。

这种分工挑战了当前偏好扩展成熟 GPU-HBM 平台的做法。在既有软件已支持的情况下,增加更多 GPU 和更快 HBM 在运营上仍更简单。异构设计只有在工作负载被正确划分后,才能提供效率优势。

研究人员也持续发现同样的权衡。一项关于异构 DRAM-PIM-GPU 系统的 2026 年研究得出结论,有意义的效率提升需要全系统协同优化。其 PIM 设计分析发现,静态内存与闲置 GPU 功耗会显著改变表观效率。

该研究还发现,在其测试配置中,工作负载映射带来的端到端收益有限。这些结果并未直接评估 SK hynix 的 2026 年服务器,但说明了为何组件层面的测量无法单独预测完整应用性能。

对企业采购方而言,这意味着应将 PIM 作为系统架构来评估。相关问题并不是能否在内存中执行计算,而是在计入所有开销后,受支持的应用能否更快、更高效地完成有效工作。

SK hynix 存内计算将部分工作转移至数据所在位置

SK hynix 的存内计算改变了计算发生的位置,但并不会将 DRAM 变成 GPU 的完整替代品。

该公司的 AiM 设计为 GDDR6 内存加入了计算功能。GDDR6 是一种高速图形内存标准,可在不采用 HBM 堆叠结构的情况下提供可观带宽。多个 GDDR6-AiM 设备可组合在 AiMX 加速卡上。

2022 年,SK hynix 表示,其首个 GDDR6-AiM 样品运行速率为每秒 16 千兆比特,电压为 1.25 伏。该公司引用的标准对比内存运行电压为 1.35 伏。公司还宣称,在特定操作中可实现最高 16 倍的性能提升,并将功耗降低 80%。

这些数据来自 SK hynix,且描述的是特定条件。它们不应被解读为在所有 AI 应用中都能实现普遍提升。最初的 GDDR6-AiM 公告并未说明每一种量产模型、服务器或软件栈的表现。

下一步是 AiMX。SK hynix 于 2023 年使用 Meta 的 OPT 13B 语言模型演示了首张加速卡原型。该公司表示,与基于 GPU 的对比方案相比,该系统的数据处理速度提升超过十倍,功耗则降至五分之一。

这项说法包含一个重要条件。SK hynix 表示,相关性能假设该卡的 AiM Control Hub 使用专用集成电路。因此,演示结果依赖于特定的控制器实现,而不只是内存芯片本身。

不过,首张 AiMX 原型卡确立了预期机制。该卡并非要求 GPU 获取每一个数值,而是在 GDDR6-AiM 设备附近执行受支持的操作。减少的数据流量可让 GPU 腾出资源,处理更符合其优势的工作。

SK hynix 在 2024 年更新了该原型。新卡容量为 32 GB,是前一版本的两倍。该公司使用 Meta 的 Llama 3 70B 模型演示了该卡,并聚焦多批次推理。

多批次处理将多个请求分组执行。它可以提高利用率,但也会加重内存与调度压力。SK hynix 将 AiMX 定位为这一环境中的注意力加速器。

注意力机制使 LLM 能将当前 token 与相关的早期 token 建立关联。它对模型行为至关重要,但涉及移动和处理大量已存储的状态数据。这使得注意力机制的部分环节成为近存计算加速的理想目标。

该公司还声称,其 2024 年设计在相同功耗下可将移动端 LLM 速度提升至移动 DRAM 的三倍。再次强调,这是一项由公司自行报告的对比,并非广泛开展的独立基准测试。32 GB AiMX 演示并未宣布面向大众市场的供应计划。

在 2026 年大会上,Lim 提供了 PIM 与静态随机存取存储器(SRAM)之间的另一项对比。SRAM 速度很快,但会占用大量芯片面积,容量通常也低于 DRAM。

根据一篇关于该演讲的韩国报道,Lim 表示,在相同面积内,PIM 可提供约为 SRAM 300 倍的容量,同时仍能保持较高的内部带宽。大会发言将 PIM 描述为规避 SRAM 容量与成本限制的一种方式。

这一对比涉及真实的架构权衡。高速本地存储器有助于降低延迟,但大规模 SRAM 阵列成本高昂且占用面积大。DRAM 的密度高得多,但普通 DRAM 不具备同样的直接计算能力。

SK hynix 提议将内存芯片与计算芯片分离,并通过混合键合将二者垂直连接。混合键合可在无需传统焊球的情况下连接抛光表面与铜互连。这能够支持经过独立优化的芯片之间更高密度的连接。

这种分离十分重要,因为将大量逻辑直接嵌入 DRAM 芯片可能降低内存容量并抬高制造成本。逻辑芯片可采用适合计算的制程,而内存芯片则保留以 DRAM 为核心的设计。

不过,混合键合也带来了自身的量产要求。对准精度、表面质量、散热、良率和测试都会影响成本。技术上优雅的堆叠方案,并不会自动成为经济的量产产品。

因此,其机制比“能够计算的内存”这一说法所暗示的更为精确。AiM 在数据附近处理受支持的操作;AiMX 则将这些设备整合为加速器。主机处理器、GPU、内存层级、控制器和软件栈仍共同协调完整工作负载。

这种限制也是潜在收益的来源。专用硬件无需取代每一个组件才能创造价值;它只需要从重要工作负载中消除足够多的重复数据移动。

真正的对手是“一刀切”的架构

SK hynix 正在挑战这样一种观点:更快的 GPU-HBM 组合应当处理 AI 推理的每一个阶段。

这是一场路线对路线的竞争。一条路线是通过增加更快的加速器、更大的 HBM 堆叠和额外系统来延伸主流架构。另一条路线则将工作分配给 GPU、PIM、存储以及由软件管理的内存层级。

第一条路线受益于成熟的软件基础。开发者已经在使用成熟的 GPU 框架、优化内核、监控系统和部署工具。模型提供商通常也会发布围绕这些平台设计的配置。

第二条路线承诺让硬件与工作负载实现更好的匹配。受内存限制的操作可在数据附近运行,而 GPU 继续处理计算密集型任务。速度较慢但容量更大的内存层级,可保存无需立即访问的信息。

这种分工类似于一条专业化生产线。每个组件执行与其特性相匹配的工作。由此形成的系统可能更高效,但协调难度也会增加。

SK hynix 的策略对 GPU 厂商形成了间接压力。如果 PIM 卡承担了相当一部分解码工作,客户可能以更少的 GPU 周期支撑相同的服务量。不过,成功的 PIM 系统也可能通过降低完整 AI 服务的成本,进一步提升 GPU 需求。

因此,将 PIM 描述为 GPU 的直接替代品,会扭曲该公司目前的表述。SK hynix 展示了部署在服务器内的 AiMX,并讨论了异构基础设施。其目标是减少低效的数据移动,而不是消除处理器。

在主要内存供应商中,Samsung 提供了最清晰的竞争参照。该公司开发了 HBM-PIM,并使用 AMD 加速器硬件演示过这项技术。Samsung 还探索了用于端侧 AI 的近存计算和 PIM 设计。

Samsung 的做法表明,行业认为近存计算不只是 SK hynix 的一项实验。其 HBM-PIM 架构将部分操作卸载至 HBM,而非使用基于 GDDR6 的 AiM 卡。

内存形式的差异并不能简单决定谁会胜出。HBM 可在加速器附近提供极高带宽,而 GDDR6 则可提供不同的容量、封装和成本特征。客户将评估完整系统及其支持的工作负载。

PIM 开发者还面临一个熟悉的标准化问题。当软件无需大规模重写即可面向硬件开发时,硬件会更容易被采用。若设计绑定于某一供应商的自定义库或狭窄的算子集合,则可能始终只是专业型产品。

编译器必须识别适合卸载的操作。运行时必须调度这些操作并管理数据放置。监控工具则必须解释多个处理位置之间的故障和性能变化。

模型的演进速度也快于服务器更新周期。若新的架构改变内存访问模式,为一种注意力模式优化的加速器可能失去相关性。因此,可重配置性和软件更新与原始硅性能同样重要。

这正是 SK hynix 更广泛产品组合在战略上变得相关的原因。SALT-KV 试图跨内存和存储进行放置决策。HBF 提供了另一层容量层级。PIM 则处理选定操作。

这些技术共同表明,SK hynix 希望影响完整的数据路径。这一角色超出了制造带宽更高的内存设备,还需要系统软件、客户集成和持续的开发者支持。

评估此类硬件的工程团队需要保留基准测试条件、模型版本、功耗测量和部署发现。可搜索的工程知识库能够让这些假设持续关联到后续采购决策。

因此,竞争问题不只是哪个公司制造的内存最快。胜者必须让专用内存能够在现有 AI 运营体系中被理解和使用。没有采用路径的组件优势,不会改变基础设施设计。

PIM 演示仍未证明什么

SK hynix 已证明技术路线具有连续性,但尚未证明其已获得大规模商业采用。

AiM 项目如今已跨越多个公开里程碑。SK hynix 于 2022 年发布内存样品,2023 年演示了一张卡,2024 年将展示容量翻倍,并在 2026 年展示了一台服务器。

这一进展具有意义。它表明持续投资,而非一次性的大会发布。然而,公开演示无法回答买家关心的若干问题。

首先,SK hynix 尚未披露 2026 年 PIM 配置的通用量产日期。最新演示未列出超大规模客户、签约部署或确认的出货量。

其次,该公司最引人注目的性能主张采用了经过选择的对比。2022 年的数据涵盖特定计算;2023 年的 AiMX 结果依赖基于 ASIC 的控制中心条件;2024 年的演示则聚焦于特定模型和处理配置。

公平的评估需要匹配的硬件、相同的模型质量、等效精度和完整的系统功耗。它还应涵盖主机处理器、空闲组件、内存刷新、网络和软件开销。

应在多种批量大小和上下文长度下测量延迟。吞吐量应包含卡外的请求调度和数据传输。可靠性测试应覆盖持续运行,而非仅限于受控演示。

第三,PIM 并不会同样加速 AI 工作负载的每个部分。算术密集型操作仍可能更适合 GPU 或专用张量处理器。若任务划分不当,跨设备同步可能抵消收益。

近期学术研究进一步强化了这一谨慎态度。系统级效率取决于通道配置、静态功耗、模型结构和工作负载映射。经过完整推理流水线测量后,表现良好的内核结果可能会缩小。

第四,制造经济性仍不确定。增加逻辑和高密度互连会提高设计复杂度。通过混合键合分离内存与逻辑可以保护内存密度,但会增加封装步骤和良率考量。

类似 chiplet 的结构也要求在组装前后进行测试。某一层的缺陷可能影响组合封装的价值。供应商必须证明性能收益能够覆盖这些生产成本。

第五,软件可移植性将影响客户的采用意愿。企业不会只为一项亮眼的基准测试部署加速器。他们需要对不断演进的模型、常见框架、安全更新、可观测性和可预测维护的支持。

因此,SK hynix 的主张应被视为一项等待市场验证的技术论证。该公司已证明 PIM 能够从内存样品发展至交互式服务器,但尚未证明由此形成的平台已准备好进入广泛的替换周期。

这一区别并不意味着该公告不重要。它定义了下一项证据标准。相比又一个数字更大的原型机,在真实服务条件下运行的具名部署将更具意义。

三个信号将表明 AiMX 是否正在成为基础设施

下一阶段取决于客户证据、可复现的系统基准测试,以及可用的软件生态系统。

第一个信号,是与具名系统或客户绑定的生产承诺。出货日期、服务器认证或云端部署将使 AiMX 超越反复出现的大会演示。出货量信息会进一步强化这一证据。

如果 SK hynix 宣布此类承诺,其以内存为中心的架构将更接近商业平台。若又一次展示仍缺乏部署细节,采用问题仍将悬而未决。

第二个信号,是可由独立方复现的基准测试。它应当在多个模型、上下文长度和批量大小下,将 AiMX 与明确界定的 GPU-HBM 系统进行比较。结果必须包含服务器总功耗和端到端延迟。

透明测试将加强这样一种主张:SK hynix 的存内处理可降低真实推理成本。即使标题数字看起来很大,狭窄的组件测量或未匹配的系统也会削弱比较的说服力。

第三个信号,是更广泛的软件支持。买家应关注与常见推理框架的集成、已记录的算子覆盖范围、性能分析工具以及服务器合作伙伴的支持。面向公众的开发者访问将揭示该平台需要多少模型适配。

强大的软件集成将表明,SK hynix 理解采用这项技术不仅仅是一个半导体问题。封闭的演示栈会让 AiMX 依赖定制工程。

这些信号也为技术采购方提供了实用的评估框架。应确认目标模型能否在不改变质量的情况下运行;衡量整台服务器,而非单张卡;记录哪些操作在 PIM 上执行,哪些仍由 GPU 完成。

随后测试当流量、上下文和批处理大小变化时,性能将如何变化。AI 服务很少始终处于某一种经过精心挑选的工作负载中。当模型和用户行为发生变化时,基础设施仍必须保持实用性。

SK hynix 已有力证明,数据移动值得获得更多关注。其 2026 年的演示也表明,PIM 已超越该公司的首个芯片样品。尚未解决的问题是,客户是否愿意接受另一种加速器及其软件要求。

请关注首个生产部署、首个可复现的系统基准测试,以及首个可广泛获取的开发栈。这些里程碑将决定 AiMX 是成为 AI 基础设施的一部分,还是仍停留在令人印象深刻的演示阶段。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page