top of page

SK hynix 表示,AI 数据中心正超越仅靠 GPU 的设计

8月11日
讀畢需時 13 分鐘

SK hynix 凭借一个直接的观点登上 Google News:AI 数据中心不再只是向传统服务器机房中添加更多 GPU。

该公司在 8 月 11 日发布的基础设施专题中描述了这些设施内部更广泛的架构转变。如今,内存带宽、存储容量、网络、散热和电力,与处理器一道共同限制着 AI 可实现的有效性能。

这一变化将熟悉的 GPU 优先设计置于系统级方法的对照之下。NVIDIA 仍是加速计算的核心,但其最新机架系统同样说明,处理器无法独自持续进步。周边基础设施必须为其提供数据、连接、散热和供电。

SK hynix 对这一解读有着明确的商业利益。它销售高带宽内存、服务器 DRAM 和企业级固态硬盘。当数据移动成为限制因素时,这些产品的战略价值便会提升。

不过,潜在压力并不局限于一家供应商的营销。AI 推理正在带来持久化上下文、更大的工作数据集,以及更频繁的数据传输。与此同时,高密度加速器机架正迫使运营商重新设计供电和散热系统。

因此,重要的故事并非又一次组件发布,而是数据中心正从服务器的集合转变为协调一致的计算系统。

Google News 故事预示着更广泛的基础设施转变

AI 数据中心内部的变化是架构性的,而非表面的。

SK hynix 的基础设施系列将内存和存储置于 AI 系统设计的核心位置。这种表述不同于早期的公共叙事,后者常常将 GPU 视为基础设施故事的全部。

加速器负责模型训练和推理背后的矩阵计算。然而,除非系统能以匹配的速度提供数据,否则它们无法保持高效运行。

高带宽内存(HBM)是堆叠式 DRAM,部署在靠近加速器的位置以实现快速数据传输。它能减少处理器等待模型参数和中间结果的时间。

系统内存服务于不同层面。它支持 CPU、操作进程、数据准备,以及无法留在稀缺 HBM 容量中的工作负载。

企业级 SSD 为模型文件、训练数据、嵌入向量、缓存上下文和生成结果提供持久化存储。与位于处理器旁的内存相比,它们拥有更大的容量,但访问延迟也更高。

这些层级构成了内存层次结构。高频使用的信息会留在靠近计算的位置,而更大或活跃度较低的数据集则转移至成本更低的存储层。

AI 工作负载使跨越这一层次结构的协同变得更加重要。如果数据到达速度过慢,即使系统配备了高速加速器,仍可能浪费其容量。

这一挑战通常被称为“内存墙”。该术语描述了处理器能力与内存交付数据速率之间不断扩大的差距。

SK hynix 的论点也得到其产品组合方向的支持。其近期的 AI 内存概览覆盖 HBM、服务器内存和基于 NAND 的存储,而非单一旗舰组件。

该公司表示,HBM4 使用 2,048 个输入输出连接。它还声称,其带宽是上一代的 2.54 倍,能效提升超过 40%。

除非在已部署的客户系统中得到验证,否则这些数字仍属于厂商主张。但它们显示出内存开发商正在优化的方向:带宽、能耗、容量以及与加速器的集成。

存储也出于类似原因而改变。SK hynix 已展示面向高密度服务器、高容量和直接液冷设计的企业级 SSD。

其中一个例子是支持直接液冷的 PEB210 E1.S 硬盘。物理设计很重要,因为存储必须在产生远超传统企业服务器热量的机架中运行。

另一款产品 PS1101 E3.S 使用四级单元 NAND,容量最高可达 122 TB。四级单元 NAND 会在每个单元中存储四个数据位,从而提高密度,但也会带来性能和耐久性方面的权衡。

这类产品本身并不能让数据中心具备“AI 就绪”能力。它们表明,每一层都在围绕更高密度和持续的数据移动进行重新设计。

因此,Google News 的报道具有信号意义,尽管关键词涵盖的范围比这一个故事更广。组件供应商如今将自己定位为架构合作伙伴,因为客户需要协调一致的系统。

这是第一个重大变化。竞争的单位正从单个芯片扩展至机架、设施和电力接入。

为什么 AI 推理改变了硬件组合

训练引发了第一波需求激增,但推理将压力扩展至整个数据路径。

训练通过处理大型数据集并调整内部参数来构建模型。它需要高密度集群、快速的加速器通信,以及充足的 HBM 容量。

每当训练完成的模型响应请求时,推理便会发生。它可持续运行于搜索、编程、客户支持、内容创作和自主软件代理等场景。

这种运行模式改变了基础设施经济性。训练任务可以按大批量调度,但生产环境中的推理通常必须在严格的延迟目标内作出响应。

推理系统还会增加另一重负担。它们可能在给出答案之前生成并评估大量中间 token,从而增加每次请求的计算量和内存流量。

长上下文应用也必须保留更多信息。系统可能需要在一次交互中访问对话历史、文档、工具结果、权限和应用状态。

将所有这些信息保留在 HBM 中并不现实。HBM 提供卓越带宽,但容量有限,且与昂贵的加速器封装紧密耦合。

因此,运营商需要额外的内存和存储层级。这些层级必须提供可接受的响应时间,同时不能消耗与加速器相邻内存相同的资源。

NVIDIA 的机架系统让这种系统级转变变得可见。该公司的 GB200 NVL72通过大型 NVLink 域连接了 72 个 Blackwell GPU 和 36 个 Grace CPU。

NVLink 是 NVIDIA 用于在处理器之间传输数据的高速互连技术。在这一配置中,它帮助机架更像一个协调统一的计算资源运行。

NVIDIA 还在 GB200 NVL72 中采用液冷。该设计反映了一个简单的物理约束:高密度处理器产生的热量,超过了传统风冷系统能够高效移除的水平。

更新的 GB300 参考架构进一步推高了这些需求。NVIDIA 文档描述了一套包含 72 个 Blackwell Ultra GPU、36 个 Grace CPU 和九个 NVSwitch 托盘的机架。

同一份文档将完整机架的最大需求设定为 142 千瓦。该数字仅涵盖一个机架,而非整个设施。

每个计算托盘还包含本地 NVMe 存储。NVMe 是一种协议,可通过 PCI Express 连接为固态存储提供快速访问。

本地闪存可承载操作软件、缓存和反复访问的数据。它能减少部分流向远程存储的流量,但无法消除对共享数据系统的需求。

这正是为什么仅靠 GPU 的叙事已无法解释 AI 基础设施。加速器置身于由内存、存储、网络、散热和供电设备构成的网络之中。

任何一个层面的瓶颈都会降低其他层面的价值。GPU 利用不足尤其昂贵,因为运营商仍需承担其采购、部署和电力成本。

AI 推理也提升了对可预测性能的要求。当数千名用户同时请求答案时,存储延迟或网络暂停都可能转化为用户可感知的应用延迟。

知识工作者可能会将这一问题感受为检索缓慢或上下文不完整。开发者则会看到超时、不稳定的 token 吞吐量和不断上升的服务成本。

物理原因可能远在应用层之下。软件团队无法完全弥补带宽受限、设备过热或电网容量不足的问题。

当客户认识到这些依赖关系时,SK hynix 会从中受益。不过,更广泛的机制并非其产品组合所独有。

Samsung、Micron、Solidigm、Kioxia 以及其他内存或存储供应商都面临同样的机会。它们也承受着为特定加速器和工作负载优化产品的压力。

市场正从标准化组件转向更深度的协同设计。协同设计意味着供应商围绕共同的系统目标,对芯片、封装、散热和软件进行调优。

这种方法可以提升效率,但也会带来新的依赖关系。客户或许获得更高性能,却可能失去跨硬件平台的灵活性。

真正的竞争是 GPU 规模与系统平衡

AI 运营商如今必须在最大化标称算力与平衡让算力持续忙碌的基础设施之间作出选择。

主要冲突并非 SK hynix 对阵 NVIDIA。这两家公司位于同一供应链的互补环节。

真正有意义的对立图景是 GPU 规模与系统平衡。一条路径优先增加加速器容量,另一条则优化数据和能源的完整流动。

GPU 规模仍然具有吸引力,因为它提供了清晰的采购指标。当配套资源能够同步跟进时,更多加速器可以提升模型容量、训练速度或推理吞吐量。

系统平衡则更难衡量。它需要根据具体工作负载,对内存容量、存储部署、网络拓扑、散热和电气设计作出决策。

这种复杂性促使买家关注可见的处理器数量。然而,配备更多 GPU 的机架并不必然是生产力更高的机架。

利用率是关键区别。等待数据、网络同步或热恢复的加速器,仍会消耗资本,却无法产生相称的产出。

内存带宽影响参数到达处理器的速度。网络带宽决定处理器在节点和机架间协作的效率。

存储吞吐量影响模型加载、检查点保存、检索和上下文缓存。散热决定设备能否持续保持额定性能。

供电可用性决定机架能否运行。这些层级形成了一条链,最薄弱的一环可能决定系统产出。

SK hynix 将其应对方案称为全栈 AI 内存战略。该公司将 HBM、面向 AI 的 DRAM 和基于 NAND 的存储整合为协调一致的产品组合。

这一战略符合其商业定位,因此读者应区分产品与证据。广泛的产品组合并不意味着每位客户都需要在所有内存层级上使用同一家供应商。

客户将评估故障率、软件兼容性、耐久性、供应保障和总能耗。他们也会基于实际工作负载而非孤立规格来比较产品。

不过,这种产品组合方法揭示了供应商关系的变化。内存生产商希望更早获得加速器路线图、散热规格和客户工作负载需求。

SK hynix 已讨论过定制化 HBM,即针对特定处理器调整基础芯片和封装等要素。基础芯片负责管理堆叠内存与其主机系统之间的通信。

定制化可以提升可用性能,但也可能拉长开发周期,并使产品更紧密地绑定于少数大型客户。

企业级存储也正在走向专业化。容量仍然重要,但密度、冷却兼容性、延迟一致性和能耗如今都会影响采购决策。

安装在液冷 AI 机架中的硬盘,与传统风冷服务器中的存储设备面临不同要求。机械尺寸和热特性因此成为架构层面的选择。

这给整个供应商市场带来压力。内存厂商必须交付速度更快的产品,同时提升效率并支持更多面向客户的定制设计。

服务器制造商必须整合处理器、内存、网络、存储和冷却系统,同时避免增加运维复杂度。数据中心运营商则必须支持超出旧有设施假设的机架。

云服务提供商还面临额外问题。他们需要将复杂的物理系统转化为可靠服务,让客户无需管理每个组件即可使用。

软件开发者同样会承受其后果。模型架构、量化、缓存、检索和批处理方面的决策,将决定内存和存储承受多大压力。

量化会降低表示模型数值时使用的精度。它可以减少内存占用并提高吞吐量,但激进的设置可能影响模型质量。

缓存会保存可复用的计算结果或上下文。它减少重复工作,但也带来有关放置、保留、安全性和失效处理的额外决策。

这些技术可以提升基础设施效率,但无法消除物理限制。效率提升往往会鼓励更多使用,从而使总需求回升。

因此,系统平衡路线并不承诺降低绝对消耗。它承诺从受限的设备和能源中产出更多有用工作。

对于在 Google News 上看到高效 AI 硬件相关说法的读者而言,这一区别很重要。更高的每瓦性能可以与不断上升的总用电需求并存。

电力与冷却构成最严苛的限制

内存可以缓解数据瓶颈,但无法解决电力、变压器、冷却设备或电网连接的短缺问题。

国际能源署估计,到 2030 年,全球数据中心耗电量将达到约 945 太瓦时。这将是其基准情景下当前水平的两倍以上。

除其他数字服务持续增长的需求外,AI 是这一增长的最大推动因素。加速服务器占预计净增长的近一半。

IEA 还预计,到 2030 年,数据中心将占美国电力需求增长的近一半。其在本地的集中分布,使挑战远大于其全球占比所显示的程度。

当输电和发电项目需要数年时间时,一座设施无法简单地订购更多电力。电网连接、变压器、许可和当地反对意见都可能延迟部署。

该机构估计,若不解决整合问题,约 20% 的计划数据中心项目将面临延误。其能源展望将基础设施建设时序视为 AI 增长的核心因素。

一项更新后的 2026 年分析又提出了警告。该分析称,数据中心的用电量在 2025 年增长了 17%,而以 AI 为重点的设施增长更快。

同一分析称,五家大型科技公司在 2025 年的资本支出超过 4,000 亿美元,并预计 2026 年还将增长 75%。

这些数字说明了投资规模,但支出并不保证产能已经建成。设备供应、融资、许可和电网接入仍然是彼此独立的限制因素。

冷却与电力问题紧密相关。处理器消耗的电力最终会转化为必须从设备中排出的热量。

风冷对许多部署仍然有用。不过,极高密度的加速器机架正越来越多地采用液体,以更有效地传导热量。

直接液冷会让冷却液靠近高发热组件。它可以支持更高密度的设备,但需要泵、歧管、热交换器、控制系统和泄漏管理系统。

NVIDIA 当前的机架文档包含托盘级和机架级泄漏检测。这一细节表明,液冷正成为计算平台的一部分,而非可选的数据中心配套设施。

存储供应商也必须适应。部署在高密度机架内的硬盘需要适合的外形规格、材料、监控能力和热设计规格。

这一转变带来实际风险。许多现有数据中心的设计机架密度显著更低,若不进行昂贵改造,就无法接纳新系统。

运营商可能需要新的配电设施、管道、地面布局和散热设备。建设周期可能削弱更早获得新处理器所带来的收益。

不同冷却设计和地点的用水量也有所不同。一个系统可以减少用于冷却的电力,同时对当地水资源施加压力。

因此,有关环境表现的说法需要全系统测量。芯片层面的每瓦性能无法涵盖设施建设、冷却、用水或发电方式。

IEA 预计,到 2035 年,可再生能源将满足数据中心电力需求增长中的约一半。其预测中,天然气和核电也发挥重要作用。

这种混合能源供应使简单的可持续性叙事变得复杂。排放取决于设施所在地、运行时间表、合同安排,以及实际为电网供电的发电来源。

另一个不确定因素是需求本身。硬件效率可以降低完成单项任务所需的能源,但更低成本可能会鼓励执行更多任务。

AI 智能体加剧了这种可能性。一个智能体在完成一个用户目标时,可能会发起多次模型调用、搜索、检索操作和工具请求。

结果便是反弹效应。每项操作变得更便宜,但由于软件执行了更多操作,基础设施总消耗反而上升。

SK hynix 可以提高内存带宽或存储密度,却无法决定客户如何高效设计模型、调度工作负载或选择能源来源。

这正是关键的审慎视角。组件改进能够支持更好的系统,但供应商规格并不能证明设施层面的节省。

独立测量必须显示持续利用率、每项有用任务的能耗、故障率和冷却开销。没有这些结果,效率仍只是一项附带条件的说法。

Google News 读者接下来应关注什么

三个信号将显示,以内存为中心的基础设施是否正成为一种运营模式,而非供应商叙事。

第一个信号是来自液冷机架系统的部署证据。买家应关注生产环境中 GB200 和 GB300 部署的利用率、可用性、功耗和服务数据。

成功部署将强化系统平衡的论点。它们将表明,紧密整合的计算、内存、网络、存储和冷却系统能够可靠地大规模运行。

反复延期或维护问题则会削弱这一论点。它们将表明,机架级整合的推进速度快于数据中心运营能力所能支持的水平。

第二个信号是下一代内存和存储的采用情况。HBM4 认证、企业级 SSD 出货量以及面向客户的定制内存设计,将揭示运营商在 GPU 之外的投入方向。

SK hynix 已将 HBM4、服务器 DRAM 和高容量企业级 SSD 定位为同一 AI 基础设施栈的组成部分。商业采用情况必须验证这一定位。

关注客户是否披露工作负载层面的收益。有用指标包括加速器利用率、推理延迟、存储能耗,以及持续需求下的吞吐量。

孤立的带宽纪录参考价值较低。它们无法显示网络、冷却和应用程序争夺资源时,完整系统会如何运行。

广泛采用将强化 AI 基础设施正走向以内存为中心的观点。采用有限则表明,GPU 仍占据大部分采购优先级。

第三个信号是数据中心建设与可用电力之间的关系。应密切关注电网连接排队、变压器供应、项目延期和企业能源协议。

IEA 的2026 年评估称,近期的物理瓶颈已经在限制扩张。这使电力可用性成为检验每项硬件预测的直接标准。

更快的电网审批和可靠的能源供应将强化预期中的基础设施建设。更多延误则会将关注点从芯片可得性转向系统能够实际运行的地点。

这些信号的重要性不止于半导体投资者。开发者将通过加速器获取、推理定价、延迟和区域服务可用性感受到其影响。

企业买家应向供应商索取工作负载层面的证据。处理器基准测试无法揭示检索延迟、上下文存储成本,或完整生产服务的可靠性。

知识工作者应预期,基础设施设计将塑造产品行为。更长上下文、更快回答和更持久的智能体,都需要界面背后协调一致的内存和存储支持。

Google News 的报道可能会让每个新组件看似只是一个孤立里程碑。更有价值的问题是,该组件是否消除了当前活跃的系统瓶颈。

SK hynix 说 AI 数据中心正从内部发生变化,这一点是正确的。然而,胜者不会仅由内存带宽、存储容量或 GPU 数量决定。

胜者将由完整系统将电力和数据转化为可靠 AI 工作的能力决定。在未来几个月,请同时关注已部署机架的表现、内存采用情况和电网接入。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page