top of page

Kioxia GP1 达到 1000 万 IOPS,但硬件仍有更多待验证之处

Kioxia 展示了其 GP1 Series 达到每秒 1000 万次输入/输出操作(IOPS)的表现,为 Google News 读者提供了 AI 存储正在变革的具体信号。这一数字令人印象深刻,但它代表的是早期设备演示,而非已在生产级 AI 集群中验证的量产产品。

GP1 属于 Kioxia 更广泛的 GP Series,该系列 SSD 专为 GPU 的直接、细粒度访问而设计。Kioxia 计划在 2026 年底前向部分客户提供评估样品。其长期目标超过 1 亿 IOPS,最新演示与目标架构之间仍存在显著差距。

这段差距才是真正的故事。Kioxia 并非只是想打造一块更快的企业级硬盘。它希望让闪存成为昂贵 GPU 内存的延伸,在特定 AI 数据场景中与以 DRAM 为中心的设计竞争。SK hynix、Samsung、Solidigm 及其他存储供应商也在探索类似路径,而 Nvidia 正在定义可能让这些方案发挥作用的系统。

Google News 标题忽略了 Kioxia 的两个不同里程碑

Kioxia 已展示一款达到 1000 万 IOPS 的设备,而其 1 亿 IOPS 数字仍是下一代系统目标。

这一区别至关重要,因为 Kioxia 的多项披露如今正被一并传播。这些数字描述的是该公司路线图的不同阶段,并非一款已完成产品的单一已验证规格。

Kioxia 最早在其 2025 年企业战略演示中概述了一款超高 IOPS SSD。该公司描述了一款采用 XL-FLASH 和新控制器的设备,预计将在 2026 年实现超过 1000 万 IOPS。它还将 GPU 直接访问定位为降低数据路径中 CPU 参与度的方式。

2026 年 3 月,Kioxia 正式宣布开发 GP Series。其 GP Series 发布公告介绍了可由 GPU 访问的闪存、512 字节请求,以及相比传统 Kioxia TLC 硬盘更低的单次操作能耗。该公告没有发布完整的商业规格表。

随后,Kioxia 在 6 月的投资者活动中扩大了这一雄心。该公司表示,未来的 GP 产品将面向需要超过 1 亿 IOPS 的 AI 系统。其 Investor Day 更新将这一性能与 XL-FLASH、专用控制器以及对 Nvidia Storage-Next 的支持一同呈现。

这些说法并不意味着 GP1 演示已达到 1 亿 IOPS。更站得住脚的解读是,GP1 在约 1000 万 IOPS 处奠定了第一步。后续的 GP 世代和更大规模的系统配置预计将追求更高目标。

Kioxia 也在官方英文材料中使用“GP Series”,而部分 FMS 2026 报道则将展示的第一代设备称为 GP1。读者不应将 GP1、GP Series 和 1 亿 IOPS 路线图视为可互换的名称。

这也是信息聚合可能压平重要技术背景的原因之一。Google News 标题能捕捉公告,却无法体现模拟器、演示硬件、评估样品与通过认证的量产硬盘之间的界限。

产品时间线同样重要。Kioxia 表示,部分客户应在 2026 年底前收到 GP Series 评估样品。评估样品让系统构建者测试集成、固件、工作负载和可靠性。它们并不能证明产品已广泛供应或实现大规模部署。

这意味着买家仍缺少若干常规采购信息。Kioxia 尚未提供 GP1 的最终容量范围、耐久性规格、持续工作负载特征、外形规格矩阵或全面上市日期。该公司也尚未发布广泛的第三方基准测试结果。

这则消息是真实的,但其范围比最引人注目的数字所暗示的更有限。Kioxia 已展示,其专用闪存架构能够进入超越传统企业级 SSD 的性能等级。它尚未证明该技术能在生产级推理中替代有意义份额的 HBM 或 DRAM。

为什么 AI 系统突然需要如此之多的小型操作

GP1 针对频繁、微小的请求进行优化,因为智能体式推理对存储的压力不同于训练或传统文件访问。

IOPS 衡量的是设备每秒完成多少次输入/输出操作。它本身并不衡量传输的数据量。一块硬盘可以凭借小请求实现高 IOPS,同时提供低于另一块传输大型连续数据块设备的总带宽。

传统企业级 SSD 的营销通常强调顺序吞吐量和 4KB 随机操作。这些指标适合数据库、虚拟机、分析任务和通用服务器存储。面向 GPU 的 AI 访问可能涉及更小的数据片段,并以更高并发度被请求。

Kioxia 的设计采用 512 字节访问粒度,这意味着每项操作可获取比传统 4KB 请求更小的数据单元。当有效数据仅占较大数据块的一小部分时,这种差异可减少不必要的数据移动。

该公司将这一访问模式与低延迟存储级内存 XL-FLASH 相结合。XL-FLASH 采用单层单元存储,每个存储单元保存一位数据。相较于 TLC 或 QLC 闪存可提供的更高密度,这种方式更偏重延迟和耐久性。

Kioxia 自身的 技术说明称,第一代 GP 产品旨在支持 1 亿次 512 字节随机读取操作。该说明还将第二代产品的送样安排在 2027 年。在客户对代表性硬件进行测试之前,这些目标仍只是公司预测。

一项目标工作负载是检索增强生成(RAG)。这种方法会在模型生成回答前检索外部信息。大型向量索引可能涉及许多小型、不规则读取,尤其是在数据库仅将最热数据保留于内存中时。

另一项目标涉及无法全部保留在 GPU 高带宽内存中的模型参数。例如,混合专家模型会为每个 token 激活大型网络中经过选择的部分。如果软件能在 GPU 停顿前预测并检索数据,快速存储便可容纳使用频率较低的部分。

KV cache 则带来相关但更复杂的机会。键值缓存会存储语言模型处理对话时创建的中间注意力数据。复用这些数据可以避免重复此前的计算,但较长提示词和并发会话可能消耗大量内存。

GPU 需要立即访问最热的缓存条目。活跃度较低的上下文可在包含 HBM、主机内存、本地 SSD 和共享存储的层级中移动。Nvidia 的 KV cache manager通过协调多个内存与存储位置上的缓存块,体现了这种分层方法。

不过,并非每种缓存工作负载都偏好微小读取。软件可在将许多 token 移入存储前,将其合并为更大的数据块。Samsung 在一项 推理存储研究中描述了 33MB 的缓存文件,使顺序带宽在该测试配置中变得重要。

这种差异使得单一 IOPS 数字无法预测应用性能。向量搜索、参数检索、模型加载和 KV cache 卸载可能产生不同的数据块大小、队列深度、读写比和延迟要求。

应用还决定 CPU 是否位于数据路径中。GPU 发起的访问可减少软件开销和不必要的传输,但它需要驱动、网络、安全、编排和存储固件的全面支持。

因此,Kioxia 销售的既是一种架构理念,也是一款设备。其核心观点是,AI 服务器需要一个针对 GPU 访问模式构建的存储层,而不是熟悉的面向 CPU 的 NVMe 存储的更快版本。

真正的竞争是闪存扩展与昂贵内存之间的较量

Kioxia 必须证明,闪存能够扩展 GPU 可访问容量,而不会让加速器在每个重要请求上等待。

高带宽内存紧邻 GPU,其延迟远低于 NAND 闪存,带宽则高得多。但它的容量有限,部署成本也很高。这些特性使 HBM 对活跃模型数据和计算极具价值,却难以扩展为通用存储库。

DRAM 构成了另一个容量更大、性能低于 HBM 的层级。按单位容量计算,它的成本仍高于 NAND。大型推理系统已经在这些层级之间分配数据,根据紧迫性、复用率和可用空间移动信息。

GP1 并未消除内存与存储之间的物理差异。它试图让闪存适用于能够容忍微秒级而非纳秒级延迟的数据,前提是设备能处理足够多的并发请求。

这构成了本文的核心冲突:专用闪存扩展与继续依赖 HBM 和 DRAM。只有当其 SSD 能让系统从每块昂贵 GPU 中处理更多有用工作、又不引入有害延迟时,Kioxia 才能胜出。

单块达到 1000 万 IOPS 的硬盘,相比传统企业级 SSD 看起来颇为惊人。但在系统层面,相关比较会发生变化。多块 GPU 可产生巨大的总需求,而每个停滞的请求都可能让昂贵的计算资源闲置。

Kioxia 的定制控制器是这一论点的核心。该控制器必须调度大量小型操作、与 GPU 高效通信,并管理 XL-FLASH,且不能让软件开销变成新的瓶颈。每次操作的功耗同样重要,因为 AI 机架已面临严格的供电和散热限制。

Nvidia Storage-Next 提供了更广泛的架构。它要求存储供应商构建面向 GPU 发起型工作负载的设备,并将闪存视为 GPU 可访问内存的一部分。Kioxia 的 GP Series 是供应商的响应之一,而非一个孤立的专有实验。

这一理念不同于 Nvidia 的 Context Memory Storage 方法,后者专注于 KV cache 以及通过分层内存系统进行的高带宽数据移动。Kioxia 将其 CM Series 定位于这种面向带宽的角色,并将 GP Series 留给更低延迟、高 IOPS 访问和 RAG 工作负载。

这种产品组合的划分很能说明问题。Kioxia 并未声称一块特殊 SSD 就能处理所有 AI 存储模式。它提供用于带宽和耐久性的 TLC 硬盘、用于细粒度访问的 XL-FLASH,以及用于高容量的 QLC 产品。

GP1 较低的密度带来了经济权衡。基于 SLC 的 XL-FLASH 相比 TLC 或 QLC NAND,需要为给定容量投入更多物理闪存单元。因此,买家需要从更低延迟中获得足够的应用价值,才能证明使用它是合理的。

回报可能来自更高的 GPU 利用率、更大的模型容量、更多并发会话或更快的检索。但这些收益都不会因硬盘级 IOPS 结果而自动实现。软件必须将正确的数据放在 GP1 上,并足够早地发起请求。

开发者应将 SSD 视为另一个具有明确调度要求的层级。设计不佳的流水线可能反复搬运数据、造成缓存抖动,或使互连链路不堪重负。这些问题会削弱更快介质带来的价值。

当工作负载拥有庞大的工作集,并且可识别出热点和温数据区域时,这一架构会更具说服力。HBM 可以容纳最热的信息,而 GP1 则存放仍对性能敏感的温数据。高容量 TLC 或 QLC 存储可保留更冷的数据。

这一层级并不会取代内存。它改变的是:在任何时刻,必须占据最昂贵层级的数据量。这个更聚焦的主张在技术上可信,但买家仍需要应用基准测试来量化其价值。

Kioxia 正在加入一场竞争,而非独自开创新品类

竞争对手正通过不同介质、接口和性能优先级,争夺同一存储机会。

SK hynix 曾介绍一款面向细粒度 AI 推理访问的 AIN P 产品。其拟议设计采用 512 字节操作,目标是在 PCIe 6.0 上实现约 5000 万 IOPS,随后迈向 1 亿 IOPS。预计时间表将延续至 2027 年。

该路线图与 Kioxia 的核心论点非常相似。两家公司都预计,AI 推理将产生足够多的小型随机操作,从而证明有必要采用为新性能等级设计的控制器和闪存配置。

这一比较也说明了 Kioxia 早期演示的重要性。一款能够实现 1000 万 IOPS 的可运行 GP1 设备,让客户可以在各项路线图达到最终目标之前便开始评估相关硬件。

这并不能决定胜负。SK hynix 可以通过与其更广泛的内存产品组合整合来竞争。Samsung 可以结合企业级 SSD、DRAM、HBM 和系统验证能力。Solidigm 则强调大容量存储,以及软件辅助的 KV 缓存或向量检索。

传统企业级 SSD 也在持续改进。Samsung 为其 PM1753 标注了最高 330 万随机读取 IOPS 和每秒 14.5 GB 的性能。这些数据落后于 GP1 的头部 IOPS 指标,但 Samsung 的设备也提供了有文档支持的企业功能和工作负载测试。

Kioxia 现有的 CM7 对比材料显示,其 PCIe 5.0 企业级硬盘可达 140 万 IOPS。相较这一基线,1000 万 IOPS 的 GP1 代表着显著的设备级提升。这一差距有助于解释为何专用介质和控制器正受到关注。

历史背景还带来了另一位竞争者,尽管它已不再积极开发。Intel Optane 使用 3D XPoint 介质,在 DRAM 与 NAND SSD 之间提供延迟和耐久性表现。它在商业上的衰落证明,技术优势并不保证市场能够持续。

Optane 面临艰难的经济性、有限的采用规模,以及将新内存层级融入现有系统的挑战。GP1 受益于 NAND 制造经验和 Nvidia 的架构支持,但仍面临集成和需求风险。

行业分析也将原始性能与实际部署效果区分开来。ServeTheHome 的评估认为,设计导入在很大程度上取决于 Nvidia 是否会在未来系统中推动 Storage-Next。这种依赖使 Nvidia 对采用情况拥有显著影响力。

软件层也可能成为另一条竞争边界。存储供应商需要与推理运行时、向量数据库、编排系统和 GPU 通信框架兼容。需要大量定制工作的硬件,主要只会吸引规模最大的运营商。

开放的软件支持可以扩大市场。清晰的接口可让基础设施团队将 GP1 与普通 NVMe 阵列、远程内存、压缩缓存或重新计算进行比较。封闭集成可能在特定系统中产生强劲效果,但会限制更广泛的采用。

Kioxia 还需要说明 GP1 与其 CM9 系列之间的定位关系。CM9 提供有文档支持的 25.6 TB 容量和每天三次全盘写入的耐久度。GP1 目前强调访问粒度和 IOPS,但尚未提供同样完整的公开规格。

这一差异表明,CM9 是更适合带宽密集型 KV 缓存部署的近期选择。GP1 则是面向微小请求和 GPU 内存扩展的更具实验性质的选项。将两者的主张混在一起,会使两款产品都更难评估。

Google News 的报道可能会让市场看起来像一场简单的 SSD 速度竞赛。实际竞争涉及内存放置、互连、固件、软件调度、耐久度、容量、功耗和整体系统经济性。

1000 万 IOPS 这一数字无法证明什么

一次设备演示无法证明量产延迟、耐久度、能效,或每秒 token 数的提升。

基准数字取决于工作负载设置。IOPS 会随请求大小、队列深度、读取比例、数据模式、预留空间以及提交命令的工作线程数量而变化。峰值结果未必能描述混合 AI 流量下的持续表现。

Kioxia 表示 GP1 支持 512 字节访问,相比 4 KB 请求,这自然会在相同数据量下产生更多操作。在就总吞吐量得出结论之前,买家应同时比较 IOPS 和传输字节数。

以 512 字节计算,1000 万次操作相当于每秒约 5.12 GB 的请求数据量,尚未计入协议开销。这一计算说明,出色的 IOPS 数字可以与中等水平的聚合带宽并存。该设备优化的是访问粒度,而不只是大块传输。

延迟分布同样重要。平均值可能掩盖偶发的慢请求,而尾延迟衡量的是高比例操作中最差的体验。运行大量并行请求的 AI 服务通常很在意这些异常值。

即使大多数读取能迅速完成,一次延迟的缓存获取也可能阻塞生成步骤。因此,买家需要在真实队列深度下的百分位延迟,而不仅是合成随机读取测试中的平均延迟。

耐久度仍是另一个悬而未决的问题。KV 缓存系统会写入新状态、删除过期会话,并在不同层级间移动数据。随着组织更新文档或嵌入向量,向量索引也会变化。XL-FLASH 应当比更高密度的 NAND 具备优势,但 GP1 需要公布工作负载评级。

容量将决定该设备的角色。小型高速 SSD 可以充当温缓存,而更大的设备则可容纳更多模型参数或检索数据。没有最终容量信息,架构师便无法计算硬盘数量、机架空间或故障暴露程度。

每次操作的功耗是 Kioxia 宣称相较其传统 TLC SSD 的一项优势。该公司尚未提供足够的公开数据,以比较具有代表性工作负载下的整机功耗。散热要求和空闲表现也会影响部署。

由于直接 GPU 访问改变了数据路径,可靠性功能需要仔细审视。运营商仍需要错误处理、访问控制、隔离、遥测、固件管理、断电保护,以及设备故障后的可预测恢复能力。

在共享基础设施中,安全性尤为重要。缓存的提示词或检索到的企业数据可能包含敏感信息。GPU 定向存储必须保持租户隔离,并防止陈旧数据跨越工作负载边界。

软件开销可能抵消部分介质层面的收益。驱动程序、内存注册、地址转换、请求批处理和缓存管理都会消耗资源。当运行时无法高效发出请求时,再快的 SSD 也无济于事。

系统基准应衡量首个 token 时间、每秒 token 数、并发用户数、GPU 利用率,以及每个完成请求的能耗。这些指标将存储行为与 AI 运营商实际销售的服务联系起来。

可信的测试还应将 GP1 与更多 DRAM、传统 NVMe 硬盘、重新计算和远程缓存系统进行比较。每种替代方案都带来不同的资本、功耗、容量和运营成本。

最有力的证据将来自超出 HBM 容量、且反复访问细粒度数据的客户工作负载。如果 GP1 能在保持响应延迟稳定的同时提高有效 GPU 工作量,Kioxia 的架构主张就会得到支持。

在此之前,1000 万 IOPS 的演示只能证明一个更有限的观点:Kioxia 已打造出一款专用闪存设备,在演示条件下能够实现异常高的小块操作速率。它并不能证明每一种 AI 应用都需要该产品。

三个信号将决定 GP1 是否成为 AI 基础设施

样品规格、应用基准和平台采用情况,将决定 GP1 能否超越令人印象深刻的 FMS 演示。

第一个信号是 Kioxia 的评估样品套件。该公司预计将在 2026 年底前向选定客户提供 GP Series 样品。这些设备应当揭示最终容量、接口、外形规格、耐久度、功耗限制和持续性能。

延期将削弱当前的时间表。若能按时提供具有完整文档的样品,则会加强 GP1 正在成为可部署产品、而非技术展示的判断。

第二个信号是来自 Kioxia、Nvidia 或客户的端到端基准测试。最有价值的结果将比较同一模型和服务器在不同内存层级下的表现。测试应报告 GPU 利用率、响应延迟、吞吐量和能耗。

仅有硬盘级 IOPS 图表并不足够。核心承诺是提升 AI 系统效率,因此验证必须在受控条件下展示更多完成的推理工作,或更大的可用模型规模。

Kioxia 还应披露其演示结果是使用一台设备、多个控制器、模拟器,还是完整的 Storage-Next 节点。这一背景将帮助买家估算达到更高系统级目标所需的硬件。

第三个信号是服务器制造商、云服务商和推理软件项目对 Nvidia Storage-Next 的采用。GP1 所依赖的不仅仅是兼容的 PCIe 插槽。它还需要一条稳定路径,让 GPU 能够寻址、调度、保护和恢复存储在闪存上的数据。

获得主要服务器供应商的支持将增强 Kioxia 的地位。集成到常见推理运行时会更加重要,因为开发者通常会通过已在使用的软件来采用新硬件。

竞争对手的时间表将影响这些信号。如果 SK hynix 很快提供其高 IOPS 产品的样品,买家将获得更多议价能力和对比数据。如果传统 TLC 硬盘缩小了大部分性能差距,专用 SLC 的经济性就会更难辩护。

1 亿 IOPS 的目标值得单独看待。Kioxia 将其描述为下一代 AI 系统的需求和 GP Series 的目标。该公司尚未证明一台已出货的 GP1 设备如今能够持续达到这一速率。

因此,未来的 Google News 更新应围绕三个问题来阅读:这个数字是实测还是预测?它描述的是单个硬盘还是一个系统?该基准是否改善了实际 AI 工作负载?

对开发者而言,这一进展之所以重要,是因为内存放置正在成为推理工程的一部分。团队可能需要分析哪些模型数据、缓存块和检索索引应当使用 HBM、DRAM、专用闪存或普通存储。

企业买家应在预留容量前索取工作负载轨迹和应用结果。他们还应审查故障行为、可观测性、安全控制和软件可移植性。仅靠峰值 IOPS 无法回答这些运营问题。

知识工作者不会直接购买 GP1 驱动器,但他们仍能感受到其带来的结果。更高效的内存利用率可支持更长时间的会话、更多并发智能体以及更广泛的检索,而无需让 GPU 内存按比例增长。

Kioxia 通过展示一款达到约 1000 万 IOPS 的第一代设备,并阐明通往更大目标的路径,赢得了关注。下一步没有那么吸睛,却更为重要:证明这些操作能够持续让 GPU 保持高效工作。

关注评估样品,而不只是标题数字。留意经过测量的应用收益、清晰的系统配置,以及平台合作伙伴的承诺。这些信号将表明,GP1 会成为实用的 AI 内存层级,还是仅仅停留在出色的 SSD 基准测试成绩。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page