top of page

NetApp 收购 PEAK:AIO 瞄准 AI 存储瓶颈

9月29日
讀畢需時 12 分鐘

NetApp 于 9 月 25 日宣布计划收购 PEAK:AIO,瞄准了一个会随着 GPU 集群扩张而愈发严重的存储瓶颈。该交易将把 PEAK:AIO 的元数据架构和并行文件技术纳入 NetApp 的 ONTAP 数据平台。交易金额和交割日期尚未披露。

这并非只是又一次为企业存储贴上 AI 标签的尝试。NetApp 希望改变其系统为并行运行的处理器定位、协调并交付海量文件的方式。该公司称,最终形成的架构旨在支持万亿级文件和多 EB 级部署。

这一计划也揭示了 NetApp 所感受到的竞争压力所在。VAST Data、Weka 和 Pure Storage 等专注于 AI 的厂商一直在推广围绕高度并行工作负载构建的架构。NetApp 已具备企业级覆盖能力和成熟的数据服务,但它必须证明,这些优势能够与 AI 规模所需的性能并存。

因此,核心问题并不在于 PEAK:AIO 是否拥有相关技术。其并行 NFS 和元数据方案直接针对了一个公认的问题。更难的问题在于,NetApp 能否在不延迟交付、也不削弱其性能优势的前提下,将这些技术整合进 ONTAP。

NetApp 收购 PEAK:AIO 是一场元数据押注

NetApp 收购的是一种扩展文件协调能力的方法,而不只是增加另一组存储容量。

NetApp 将该交易描述为有意收购总部位于曼彻斯特的软件定义存储公司 PEAK:AIO。根据收购公告,该交易仍须满足惯常交割条件并获得监管批准。

PEAK:AIO 为人工智能和高性能计算工作负载开发高性能文件技术。其软件将重要的元数据功能与承载底层数据的系统分离。这种分离使元数据服务能够随着工作负载增长而独立扩展。

元数据记录文件相关信息,包括名称、位置、权限和关联关系。存储系统必须先处理这些信息,应用程序才能高效访问数据本身。当数千个处理器同时请求大量小文件时,这项任务会变得尤为困难。

NetApp 计划将 PEAK:AIO 的元数据服务和并行命名空间技术与其核心数据管理软件 ONTAP 相结合。命名空间为应用程序提供了一种在分布式存储环境中一致定位文件的方式。并行命名空间则允许多个客户端同时完成这项工作。

拟议架构还将采用并行 NFS,通常称为 pNFS。该标准允许客户端从元数据服务获取协调信息,并通过多条存储路径访问数据,从而避免将每个请求都强制经过单一传统文件服务器。

NetApp 表示,这一模式可帮助共享存储与大型 GPU 集群同步扩展。其既定目标是减少昂贵处理器等待数据时出现的停顿。不过,该公司尚未公布该整合架构经独立验证的结果。

这一差别很重要,因为交易尚未完成。NetApp 尚未披露哪些 PEAK:AIO 产品将继续独立存在、它们将如何打包销售,或整合后的能力何时能交付给客户。此次公告明确的是方向,而不是成品。

PEAK:AIO 还带来了与在高要求规模下开展工作的研究机构之间的合作关系。NetApp 指出,洛斯阿拉莫斯国家实验室和卡内基梅隆大学参与了这项技术的开发。PEAK:AIO 还列出了医疗保健、机器人、科研和自然保护领域的其他部署案例。

这些关系为 NetApp 带来了技术可信度和潜在的参考环境,但并不能自动证明整合进 ONTAP 的产品将获得同样的表现。整合可能改变部署模式、支持要求以及数据请求的传递路径。

NetApp CEO George Kurian 将此次收购定位为提供兼具规模、安全性和运营一致性的共享存储。这也是该公司更广泛的承诺:在不要求客户放弃熟悉的企业级控制能力的前提下,提供专业级性能。

这一承诺构成了本文的主要张力。NetApp 并非试图成为另一家小型 AI 存储专业厂商,而是试图吸收专业架构,同时保留 ONTAP 对成熟企业而言有价值的特性。

为什么 AI 集群会让元数据成为性能问题

当存储无法以同样的速度定位和供给数据时,更多 GPU 并不会提升 AI 系统的表现。

大型训练任务会反复加载模型参数、检查点、代码,以及海量文本、图像、音频或视频集合。某些操作传输大型顺序文件,另一些则会在众多客户端之间产生数百万乃至数十亿次更小的请求。

传统存储控制器可能成为这些请求的协调节点。它必须解析文件位置、执行权限控制、更新目录并维持一致性。增加存储容量并不一定会扩展这条控制路径。

这种错配正是元数据成为竞争焦点的原因之一。AI 基础设施团队可以购买更多 GPU、更快的网络和更多闪存存储。如果文件操作仍集中在能力有限的元数据服务之后,这些投入的表现依然会不及预期。

PEAK:AIO 的 Lattice 项目为拟议机制提供了一个有用的视角。Lattice 是面向 NFSv4.2 和 pNFS Flex Files 的开源横向扩展元数据架构。它在用户空间运行元数据服务,并通过共享权威源进行协调。

该项目由 PEAK:AIO 发起,并在与洛斯阿拉莫斯和卡内基梅隆的合作中逐步形成。其公开代码库描述了多个共享同一事实源的元数据服务器进程。这一设计旨在超越单一固定元数据服务器的限制。

这种方法可以将元数据处理能力与数据容量分开扩展。从理论上讲,运营方可以在文件活动增加时添加协调资源,而无需重建整个存储系统。它还支持标准 NFS 访问,无需每个应用程序都采用专有接口。

标准之所以重要,是因为 AI 环境很少只运行一种统一的工作负载。训练框架、分析工具、数据准备流水线和企业应用程序可能都需要访问相同信息。熟悉的文件协议可以减少应用层面需要进行的改动。

但熟悉的访问方式并不保证操作简单。分布式元数据系统必须在节点故障、客户端重新连接,或并发请求修改关联文件时保持一致性。它们还必须能够恢复,避免让应用程序获得不完整的命名空间视图。

这些工程要求解释了 NetApp 的 ONTAP 基础为何重要。ONTAP 已提供企业环境中广泛使用的数据保护、快照、安全控制、复制和管理实践。PEAK:AIO 则提供了另一个维度:高度并行的访问能力和可独立扩展的元数据。

因此,这笔收购瞄准的是一种具体机制。PEAK:AIO 可以扩展用于告知应用程序数据位置的控制平面,而 ONTAP 则可以继续负责数据的存储、保护和治理。

NetApp 表示,整合后的系统旨在支持万亿级文件和多 EB 级环境。这些是架构目标,而非已披露的客户结果。买方应将系统预期上限与其自身工作负载模式下经过测试的性能区分开来。

小文件操作尤其值得关注。以大型顺序传输为主的基准测试可以产生令人印象深刻的吞吐量,却未必能代表模型训练、检查点操作或多模态数据准备。以元数据为重点的测试,更能表明新设计是否解决了其声称要解决的问题。

延迟的一致性也比单一峰值数字更重要。一个集群可能报告很高的总吞吐量,但个别任务仍会经历停顿。这些停顿会让 GPU 等待,从而削弱整项基础设施投资的经济合理性。

PEAK:AIO 的技术为 NetApp 解决这一问题提供了可信的方法。只有当 NetApp 公布整合系统可重复验证的结果,并且客户能够在生产环境中复现这些结果时,这笔收购才会真正具有意义。

AI 原生存储厂商如今面对的是更全面的 NetApp

该交易通过将专业厂商的架构主张与 NetApp 的装机基础和企业运营模式相结合,为这些厂商带来压力。

在宣布此次收购之前,NetApp 就已开始转向解耦式 AI 存储。其 AFX 平台将存储性能与容量分离,并面向高度并发的文件和对象工作负载。NetApp 将 AFX 定位为基于 ONTAP 的系统,服务于训练、推理和数据密集型应用。

该公司称,其现有的 AFX 架构能够独立扩展性能和容量。AFX 还与 AI Data Engine 配套,后者可对元数据进行索引,并帮助组织发现和治理 AI 应用程序所使用的信息。

PEAK:AIO 为这一战略增加了另一层能力。AFX 面向存储平台,而 PEAK:AIO 带来了横向扩展元数据和并行 NFS 专长。NetApp 在 7 月收购 DataPelago,则增加了在更靠近存储位置处处理数据的技术。

综合来看,这些行动表明 NetApp 希望掌控存储的企业数据与 GPU 计算之间更大范围的路径。该公司正在超越容量、保护和文件服务,希望影响数据准备、发现、协调和交付。

这一扩张使 NetApp 与围绕 AI 和高性能工作负载设计的公司展开更直接的竞争。VAST Data、Weka、DDN、Hammerspace 和 Pure Storage 各自以不同方式切入市场。它们共同的主张是,传统存储架构无法高效服务现代计算集群。

VAST Data 是一个尤其相关的比较对象。其解耦式共享一切设计将计算逻辑与存储介质分离,同时让处理节点能够访问共享的系统状态。其架构概述将元数据描述为其平台不可或缺且分布式的一部分。

Pure Storage 也在 FlashBlade//EXA 内部将数据与元数据分离。该公司将该系统定位为面向 AI 和高性能计算的大规模并行架构。其设计采用基于行业标准服务器构建的独立元数据节点和数据节点。

NetApp 目前正在接受专业厂商的大部分架构前提:元数据应能独立扩展,客户端需要并行访问,而 AI 工作负载所需的不只是加入更快的介质。争论已从这些改变是否必要,转向谁能够可靠地交付它们。

这一转变改变了竞争格局。专业厂商可以强调其专注的设计和早期 AI 部署。NetApp 则可以凭借 ONTAP、全球分销、支持关系、安全功能以及已安装的企业客户基础作出回应。

一家 NetApp 渠道合作伙伴将 PEAK:AIO 的并行 NFS 客户端描述为 NetApp 过去所缺乏的能力。该合作伙伴还将这一缺失认定为竞争劣势。这些评论出现在公告发布后的渠道采访中。

这是此次收购最明确的战略价值。NetApp 正在填补竞争对手可能在 AI 基础设施评估中指出的缺口。它现在可以为客户提供潜在的演进路径,而非要求另建独立的存储环境。

这一路径可能会吸引已使用 ONTAP 管理重要企业数据的组织。将大型数据集迁入孤立的 AI 平台会带来运营成本、重复副本和额外的治理工作。扩展现有平台或可减轻这些负担。

但既有优势也可能限制灵活性。NetApp 必须为广泛的客户群保留兼容性、升级路径和支持预期。AI 原生厂商可更激进地进行优化,因为它们需要保护的历史环境较少。

竞争问题并不只是 NetApp 能否匹配专业厂商的基准成绩。买方将评估完整系统,包括部署工作量、故障恢复、访问控制、云集成和运营一致性。NetApp 预计这些更广泛的标准将有利于其平台。

专业厂商将回应称,性能架构必须放在首位。他们可以主张,后续增加企业功能优于承受早期系统遗留的性能约束。NetApp 的集成工作必须在客户环境中驳倒这一论点。

集成才是 PEAK:AIO 交易的真正考验

NetApp 找到了正确的瓶颈,但收购公告并不能证明两种架构将作为一个产品协同运行。

首个不确定性在于时间。NetApp 尚未提供交易完成日期或详细交付时间表。它也尚未说明首个预计纳入 PEAK:AIO 技术的 ONTAP 或 AFX 版本。

这一缺失的路线图限制了当前的采购决策。客户目前无法比较最终配置、支持条款、升级要求或部署依赖关系。他们也无法确定现有 PEAK:AIO 系统是否会直接过渡到 NetApp 的产品组合中。

第二个不确定性涉及产品边界。PEAK:AIO 销售可在行业标准硬件上运行的软件定义存储。NetApp 则在更大的数据平台内销售集成系统、软件订阅和云服务。

NetApp 可以将 PEAK:AIO 保留为灵活的软件层,也可以将选定组件整合进 AFX 和 ONTAP。每条路径都会对现有客户、硬件合作伙伴和开源 Lattice 社区产生不同影响。

Lattice 使这一问题尤为重要。其公开代码让研究人员和基础设施工程师能够检查并影响元数据架构。被大型厂商收购可以带来工程资源,但也可能改变项目优先级。

NetApp 尚未详细说明收购后 Lattice 的治理方式。用户应关注代码仓库活跃度、许可决策、发布频率以及对外部贡献的处理。持续开发将支持 NetApp 的说法,即基于标准的访问仍处于核心地位。

第三个不确定性是性能证据。NetApp 的公告描述了一个面向数万亿文件和数 EB 级部署的系统,但未提供集成基准测试、客户配置、测试方法,或与竞争系统的比较。

公司基准测试仍需接受审视,但它们会提供一个有用的起点。买方需要获得涵盖小文件、大文件、混合读写、检查点工作负载、故障条件和并发租户的结果,也需要持续测量数据,而非短暂峰值。

存储效率应通过 GPU 利用率而非仅仅存储吞吐量来评估。关键结果是加速器是否花费更少时间等待输入。这需要衡量完整工作流,包括网络、客户端、元数据、存储介质和训练软件。

第四个不确定性涉及大规模韧性。将元数据解耦可以消除固定瓶颈,但也会引入分布式协调要求。NetApp 必须展示在大规模训练或推理工作负载期间元数据服务发生故障时会发生什么。

恢复行为应当可见且可复现。客户需要了解作业会暂停、重新连接、重启,还是遇到不一致的文件视图。他们还需要证据表明,快照、复制和安全策略在新的访问路径中仍然有效。

第五个不确定性是组织整合。PEAK:AIO 的价值部分来自专门的工程团队和专注的产品文化。NetApp 必须留住这些专业能力,同时将其与规模更大的发布、支持和销售组织相连接。

大型厂商收购小团队的速度往往快于整合其技术。产品重叠可能造成内部依赖、路线图延迟或所有权不清晰。NetApp 近期的收购使协调相关组件变得更加重要。

该公司在宣布 PEAK:AIO 计划前仅数月便收购了 DataPelago。如今,它必须将数据处理、元数据协调、AFX 存储、AI Data Engine 和 ONTAP 服务连接起来。一系列相关资产并不会自动构成连贯的架构。

买方也不应将计划中的收购视为停止评估替代方案的理由。VAST Data、Weka、Pure Storage 及其他厂商已推出面向类似工作负载的系统。竞争性测试将显示,NetApp 更广泛的平台能否抵消其 AI 专注型部署在成熟度上的优势。

这些不确定性均不会否定这笔交易。它们界定了公告之后仍需完成的工作。NetApp 已获得一个针对真实技术约束的合理答案,但尚未交付整合后的成果。

三个信号将显示 NetApp 的战略是否奏效

接下来的证据应来自产品路线图、可复现的性能数据,以及使用集成架构的生产客户。

第一个信号是明确的集成路线图。NetApp 应说明哪些 PEAK:AIO 组件将进入 ONTAP、AFX 或其他产品。它还应解释客户能否在现有硬件上部署该技术。

可信的路线图需要包含发布窗口、支持的协议、迁移选项和产品归属。它应区分已正式可用的技术与仍在开发的功能。清晰的边界将加强 NetApp 关于这是可执行平台计划的论点。

模糊的路线图会削弱这一论点。如果 PEAK:AIO 在多个季度内仍是孤立产品,竞争对手就可以声称 NetApp 购买了专业能力,却未弥合其架构缺口。反复延迟会让这种批评更具说服力。

第二个信号是技术验证。NetApp 需要测试元数据操作和端到端 AI 工作流的基准,而不只是展示标志性的吞吐量数字。独立测试的分量将高于由公司控制的演示。

有用的结果将包括文件创建速率、目录操作、检查点行为、混合文件工作负载,以及节点故障期间的延迟。测试应披露客户端数量、网络配置、存储介质、软件版本和数据集特征。

NetApp 还应将存储结果与 GPU 活动关联起来。减少空闲时间将直接支持此次收购的经济论据。当更快的文件系统能提高消耗其数据的昂贵处理器利用率时,其价值才最为突出。

据其交易分析称,StorageReview 此前使用一种服务器配置测试 PEAK:AIO 软件,测得每秒 160 GB 的性能。该结果提供了背景参考,但并不能验证未来与 ONTAP 集成的架构。

第三个信号是研究环境之外的客户采用。国家实验室和大学是有价值的验证场所,因为它们运行要求严苛的技术工作负载。企业买方还需要涵盖治理、多租户、支持和可预测升级的案例。

一项有说服力的参考案例应展示某个组织如何在不牺牲应用性能的前提下,将 AI 数据整合至组合平台。它应记录部署规模、工作负载类型、此前的瓶颈、运营变化和可量化结果。

关注早期客户是否将该系统用于生产训练、大规模推理或智能体应用。仅有概念验证活动,并不足以证明企业信任该架构来承载重要数据和持续性工作负载。

竞争对手的反应将提供次要指标。VAST Data、Weka 和 Pure Storage 很可能会强调现有部署、架构成熟度和专注性能。NetApp 必须用证据而非更广泛的产品组合话术作出回应。

NetApp 收购 PEAK:AIO,使该公司能够对 AI 原生存储市场作出更有力的技术回应。但这也提高了预期。NetApp 现在承诺在一个平台中提供专业级元数据扩展能力、并行访问和成熟的企业运营能力。

基础设施负责人应利用未来数月检验这一主张。向 NetApp 索取集成路线图、故障行为、基准测试方法和客户参考案例。随后,在真正重要的工作负载下,将这些回答与已上线的替代方案进行比较。

如果 NetApp 能将 PEAK:AIO 的专注技术转化为可量化的 ONTAP 和 AFX 改进,这笔收购将在战略上显得合理。如果这些资产仍然彼此独立,或者组合系统缺乏可复现的结果,其影响将显得较小。决定最终走向的将是下一次产品发布,而非此次公告。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page