top of page

Kioxia GP1, 1,000만 IOPS 달성했지만 하드웨어는 아직 더 입증해야 한다

Kioxia는 GP1 Series가 초당 1,000만 건의 입출력 작업을 처리하는 모습을 시연하며, AI 스토리지가 변화하고 있음을 Google News 독자들에게 구체적으로 보여줬다. 이 수치는 인상적이지만, 실제 운영 AI 클러스터에서 검증된 출하 제품이 아니라 초기 단계의 디바이스 시연을 의미한다.

GP1은 GPU의 직접적이고 세분화된 접근을 위해 설계된 SSD 제품군인 Kioxia의 더 넓은 GP Series에 속한다. Kioxia는 2026년 말까지 일부 고객에게 평가용 샘플을 제공할 계획이다. 장기 목표는 1억 IOPS를 넘는 것이며, 최근 시연과 지향하는 아키텍처 사이에는 여전히 큰 간극이 남아 있다.

바로 그 간극이 핵심이다. Kioxia는 단순히 더 빠른 엔터프라이즈 드라이브를 만들려는 것이 아니다. 플래시를 값비싼 GPU 메모리의 확장으로 만들고, 일부 AI 데이터 영역에서 DRAM 중심 설계와 경쟁시키려 한다. SK hynix, Samsung, Solidigm 등 다른 스토리지 공급업체도 유사한 방향을 추구하고 있으며, Nvidia는 이들을 활용할 수 있는 시스템을 정의하고 있다.

Google News 헤드라인이 놓치는 서로 다른 두 Kioxia 이정표

Kioxia는 1,000만 IOPS 디바이스를 시연했지만, 1억 IOPS는 여전히 차세대 시스템의 목표치다.

이 구분은 중요하다. 여러 Kioxia 발표 내용이 현재 함께 유통되고 있지만, 이 수치들은 단일한 검증 사양을 갖춘 완성 제품이 아니라 회사 로드맵의 서로 다른 단계를 설명한다.

Kioxia는 2025년 기업 전략 발표에서 처음으로 초고 IOPS SSD의 개요를 공개했다. 회사는 XL-FLASH와 신규 컨트롤러를 사용하는 디바이스를 설명하며, 2026년 중 1,000만 IOPS 이상을 예상한다고 밝혔다. 또한 데이터 경로에서 CPU 개입을 줄이기 위한 방법으로 GPU 직접 접근을 제시했다.

2026년 3월 Kioxia는 GP Series 개발을 공식 발표했다. GP Series 발표에서는 GPU 접근 가능한 플래시, 512바이트 요청, 그리고 기존 Kioxia TLC 드라이브보다 작업당 낮은 에너지 사용량을 설명했다. 다만 이 발표에는 완전한 상용 사양표가 포함되지 않았다.

이후 Kioxia는 6월 투자자 행사에서 목표를 더 확장했다. 회사는 향후 GP 제품이 1억 IOPS 이상을 요구하는 AI 시스템을 겨냥할 것이라고 밝혔다. Investor Day 업데이트는 XL-FLASH, 전용 컨트롤러, Nvidia Storage-Next 지원과 함께 이 성능을 제시했다.

이러한 주장들이 GP1 시연이 이미 1억 IOPS에 도달했다는 뜻은 아니다. 더 타당한 해석은 GP1이 약 1,000만 IOPS로 첫 단계를 확립했다는 것이다. 이후 GP 세대와 더 큰 시스템 구성은 더 높은 목표치를 추구할 것으로 예상된다.

Kioxia는 공식 영어 자료에서 “GP Series”라는 명칭도 사용하며, 일부 FMS 2026 보도에서는 시연된 1세대 디바이스를 GP1으로 지칭한다. 독자들은 GP1, GP Series, 1억 IOPS 로드맵을 서로 바꿔 쓸 수 있는 명칭으로 취급해서는 안 된다.

이는 뉴스 집계가 중요한 기술적 맥락을 평면화할 수 있는 이유 중 하나다. Google News 헤드라인은 발표 자체를 포착하지만, 에뮬레이터·시연 하드웨어·평가용 샘플·검증된 양산 드라이브의 경계까지는 담아내지 못한다.

제품 일정도 마찬가지로 중요하다. Kioxia는 일부 고객이 2026년 말까지 GP Series 평가용 샘플을 받을 것이라고 밝히고 있다. 평가용 샘플을 통해 시스템 구축업체는 통합, 펌웨어, 워크로드, 신뢰성을 시험할 수 있다. 이는 광범위한 공급이나 대규모 배포의 증거는 아니다.

이는 구매자가 아직 여러 통상적인 구매 정보를 확보하지 못했다는 뜻이다. Kioxia는 GP1의 최종 용량 범위, 내구성 사양, 지속 워크로드 프로필, 폼 팩터 매트릭스, 일반 공급 일정을 공개하지 않았다. 폭넓은 제3자 벤치마크 결과도 아직 발표하지 않았다.

이 뉴스는 사실이지만, 그 범위는 가장 극적인 숫자가 암시하는 것보다 좁다. Kioxia는 특화된 플래시 아키텍처가 기존 엔터프라이즈 SSD를 넘어서는 성능 등급에 진입할 수 있음을 보여줬다. 그러나 이 기술이 운영 추론 환경에서 HBM이나 DRAM의 의미 있는 비중을 대체할 수 있다는 점까지는 아직 증명하지 못했다.

AI 시스템이 갑자기 এত 많은 소규모 작업을 필요로 하는 이유

GP1은 에이전트형 추론이 학습이나 일반적인 파일 접근과 다른 방식으로 스토리지에 부담을 주기 때문에, 빈번하고 작은 요청에 최적화돼 있다.

IOPS는 디바이스가 초당 완료하는 입출력 작업 수를 측정한다. 그 자체로 전송되는 데이터량을 측정하는 지표는 아니다. 드라이브는 작은 요청으로 높은 IOPS를 기록하면서도, 큰 순차 블록을 이동하는 다른 디바이스보다 전체 대역폭은 낮을 수 있다.

전통적인 엔터프라이즈 SSD 마케팅은 대개 순차 처리량과 4킬로바이트 랜덤 작업을 강조한다. 이 지표들은 데이터베이스, 가상 머신, 분석, 범용 서버 스토리지에 적합하다. GPU가 직접 수행하는 AI 접근은 훨씬 높은 동시성으로 더 작은 데이터 조각을 요청할 수 있다.

Kioxia의 설계는 512바이트 접근 단위를 사용한다. 즉, 각 작업은 기존의 4킬로바이트 요청보다 더 작은 단위를 가져올 수 있다. 유용한 항목이 더 큰 블록의 일부만 차지할 때, 이 차이는 불필요한 데이터 이동을 줄일 수 있다.

회사는 이 접근 패턴을 저지연 스토리지 클래스 메모리인 XL-FLASH와 결합한다. XL-FLASH는 단일 레벨 셀 스토리지를 사용하며, 각 메모리 셀에 1비트를 저장한다. 이 접근법은 TLC나 QLC 플래시가 제공하는 더 높은 집적도보다 지연 시간과 내구성을 우선한다.

Kioxia의 자체 기술 설명에 따르면, 1세대 GP는 1억 건의 512바이트 랜덤 읽기 작업을 지원하도록 설계됐다. 또한 2세대 샘플 제공 시점은 2027년으로 제시한다. 이러한 목표는 고객이 대표적인 하드웨어를 시험하기 전까지 회사의 전망치에 머문다.

목표 워크로드 중 하나는 검색 증강 생성, 즉 RAG다. 이 방법은 모델이 답변을 구성하기 전에 외부 정보를 검색한다. 대규모 벡터 인덱스는 특히 데이터베이스가 가장 자주 쓰이는 데이터만 메모리에 유지할 때, 수많은 작고 불규칙한 읽기를 수반할 수 있다.

또 다른 목표는 모든 모델 파라미터를 GPU 고대역폭 메모리에 유지할 수 없는 경우다. 예를 들어 mixture-of-experts 모델은 각 토큰에 대해 더 큰 네트워크의 일부만 활성화한다. 소프트웨어가 GPU가 멈추기 전에 이를 예측하고 가져올 수 있다면, 빠른 스토리지는 덜 자주 사용되는 부분을 보관할 수 있다.

KV cache는 관련성이 있으면서도 더 복잡한 기회를 제공한다. 키-값 캐시는 언어 모델이 대화를 처리하는 동안 생성된 중간 어텐션 데이터를 저장한다. 이 데이터를 재사용하면 이전 연산을 반복하지 않아도 되지만, 긴 프롬프트와 동시 세션은 상당한 메모리를 소모할 수 있다.

GPU는 가장 자주 사용되는 캐시 항목에 즉시 접근해야 한다. 덜 활성화된 컨텍스트는 HBM, 호스트 메모리, 로컬 SSD, 공유 스토리지로 구성된 계층을 통해 이동할 수 있다. Nvidia의 KV cache manager는 여러 메모리 및 스토리지 위치에 걸쳐 캐시 블록을 조정함으로써 이러한 계층형 접근을 반영한다.

하지만 모든 캐시 워크로드가 작은 읽기에 유리한 것은 아니다. 소프트웨어는 많은 토큰을 스토리지로 옮기기 전에 더 큰 블록으로 결합할 수 있다. Samsung은 한 추론 스토리지 연구에서 33메가바이트 캐시 파일을 설명했으며, 해당 테스트 구성에서는 순차 대역폭이 중요했다.

이러한 차이 때문에 하나의 IOPS 수치만으로 애플리케이션 성능을 예측할 수는 없다. 벡터 검색, 파라미터 검색, 모델 로딩, KV cache 오프로드는 서로 다른 블록 크기, 큐 깊이, 읽기·쓰기 비율, 지연 시간 요구사항을 만들 수 있다.

애플리케이션은 CPU가 데이터 경로에 위치하는지도 결정한다. GPU 주도 접근은 소프트웨어 오버헤드와 불필요한 전송을 줄일 수 있지만, 드라이버, 네트워킹, 보안, 오케스트레이션, 스토리지 펌웨어 전반의 지원이 필요하다.

따라서 Kioxia는 디바이스만큼이나 아키텍처적 아이디어를 판매하고 있다. 이 회사의 논지는 AI 서버가 익숙한 CPU 중심 NVMe 스토리지의 빠른 버전이 아니라, GPU 접근 패턴을 위해 구축된 스토리지 계층을 필요로 한다는 것이다.

진짜 경쟁은 플래시 확장과 값비싼 메모리의 대결이다

Kioxia는 플래시가 중요한 모든 요청에서 가속기를 기다리게 만들지 않으면서 GPU 접근 가능 용량을 확장할 수 있음을 보여줘야 한다.

고대역폭 메모리는 GPU 가까이에 위치하며 NAND 플래시보다 훨씬 낮은 지연 시간과 훨씬 높은 대역폭을 제공한다. 하지만 용량이 제한적이고 배포 비용도 높다. 이러한 특성은 HBM을 활성 모델 데이터와 연산에 유용하게 만들지만, 범용 저장소로 확장하기는 어렵게 한다.

DRAM은 HBM보다 용량이 크고 성능은 낮은 또 하나의 계층을 더한다. 그럼에도 용량 단위당 비용은 NAND보다 높다. 대규모 추론 시스템은 이미 긴급성, 재사용성, 가용 공간에 따라 정보를 이동시키며 이러한 계층에 데이터를 분산하고 있다.

GP1은 메모리와 스토리지 사이의 물리적 차이를 없애지 않는다. 디바이스가 충분한 동시 요청을 처리한다는 전제 아래, 나노초가 아닌 마이크로초를 감수할 수 있는 데이터에 플래시를 유용하게 만들려 한다.

이는 이 글의 핵심 충돌을 만든다. 특화 플래시 확장 대 HBM 및 DRAM에 대한 지속적인 의존이다. Kioxia가 승리하려면 SSD가 유해한 지연 시간을 추가하지 않으면서, 각 값비싼 GPU에서 시스템이 더 많은 유용한 작업을 처리하도록 해야 한다.

단일 1,000만 IOPS 드라이브는 기존 엔터프라이즈 SSD와 비교하면 매우 뛰어나 보일 수 있다. 그러나 시스템 수준에서는 비교 기준이 달라진다. 여러 GPU는 막대한 총수요를 만들어낼 수 있으며, 요청 하나가 지연될 때마다 값비싼 연산 자원이 유휴 상태에 빠질 수 있다.

Kioxia의 맞춤형 컨트롤러는 이 논지의 핵심이다. 컨트롤러는 다수의 작은 작업을 스케줄링하고, GPU와 효율적으로 통신하며, 소프트웨어 오버헤드가 새로운 병목이 되지 않도록 XL-FLASH를 관리해야 한다. AI 랙은 이미 엄격한 전력 및 냉각 제약에 직면해 있으므로 작업당 전력 사용량도 중요하다.

Nvidia Storage-Next는 더 넓은 아키텍처를 제공한다. 이는 스토리지 공급업체에 GPU 주도 워크로드용 디바이스 구축을 요구하고, 플래시를 GPU 접근 가능 메모리의 일부로 취급한다. Kioxia의 GP Series는 고립된 독점 실험이 아니라, 이에 대한 하나의 공급업체 대응이다.

이 아이디어는 KV cache와 계층형 메모리 시스템을 통한 고대역폭 이동에 집중하는 Nvidia의 Context Memory Storage 접근법과는 다르다. Kioxia는 대역폭 지향 역할에는 CM Series를 배치한다. 반면 GP Series는 더 낮은 지연 시간, 높은 IOPS 접근, RAG 워크로드에 할당한다.

이 제품군 구분은 많은 것을 보여준다. Kioxia는 하나의 이색적인 SSD가 모든 AI 스토리지 패턴을 처리할 수 있다고 주장하지 않는다. 이 회사는 대역폭과 내구성을 위한 TLC 드라이브, 세분화된 접근을 위한 XL-FLASH, 고용량을 위한 QLC 제품을 제공한다.

GP1의 낮은 집적도는 경제적 상충관계를 만든다. SLC 기반 XL-FLASH는 TLC나 QLC NAND보다 같은 용량을 위해 더 많은 물리적 플래시 셀을 사용한다. 따라서 구매자는 더 낮은 지연 시간이 그 사용을 정당화할 만큼 충분한 애플리케이션 가치를 제공하는지 판단해야 한다.

그 수익은 더 높은 GPU 활용률, 더 큰 모델 용량, 더 많은 동시 세션, 더 빠른 검색에서 나올 수 있다. 그러나 이러한 이점 중 어느 것도 드라이브 수준의 IOPS 결과만으로 자동으로 따라오지는 않는다. 소프트웨어는 올바른 데이터를 GP1에 배치하고, 충분히 이른 시점에 요청해야 한다.

개발자는 SSD를 명시적인 스케줄링 요건을 가진 또 하나의 계층으로 봐야 합니다. 설계가 부실한 파이프라인은 데이터를 반복적으로 이동시키고, 캐시 교란을 일으키거나 인터커넥트를 과부하 상태로 만들 수 있습니다. 이런 실패는 더 빠른 미디어의 가치를 떨어뜨립니다.

아키텍처는 식별 가능한 핫 및 웜 영역을 포함한 대규모 작업 세트를 워크로드가 가질 때 더욱 설득력을 얻습니다. HBM에는 가장 빈번히 쓰이는 정보를 담고, GP1에는 성능 민감성이 유지되는 웜 데이터를 둘 수 있습니다. 고용량 TLC 또는 QLC 스토리지는 더 차가운 데이터를 보관할 수 있습니다.

이 계층 구조는 메모리를 대체하지 않습니다. 대신 가장 비싼 계층에 항상 상주해야 하는 데이터의 양을 바꿉니다. 이는 기술적으로 신뢰할 수 있는, 보다 제한적인 제안이지만 구매자는 이를 정량화할 애플리케이션 벤치마크가 필요합니다.

Kioxia는 독자적인 카테고리를 만드는 것이 아니라 경쟁에 뛰어들고 있다

경쟁사들은 서로 다른 미디어, 인터페이스, 성능 우선순위로 동일한 스토리지 기회를 공략하고 있습니다.

SK hynix는 세밀한 AI 추론 접근을 겨냥한 AIN P 제품을 설명한 바 있습니다. 제안된 설계는 512바이트 작업을 사용하며 PCIe 6.0에서 약 5,000만 IOPS를 목표로 하고, 이후 1억 IOPS로 나아가는 경로를 제시합니다. 예상 일정은 2027년까지 이어집니다.

이 로드맵은 Kioxia의 핵심 논지와 매우 유사합니다. 두 회사 모두 AI 추론이 새로운 성능 등급에 맞춰 설계된 컨트롤러와 플래시 구성을 정당화할 만큼 충분한 소규모 랜덤 작업을 생성할 것으로 예상합니다.

이 비교는 Kioxia의 초기 시연이 중요한 이유도 보여줍니다. 1,000만 IOPS로 작동하는 GP1 장치는 모든 로드맵이 최종 목표에 도달하기 전부터 고객이 평가를 시작할 수 있는 하드웨어를 제공합니다.

그렇다고 경쟁의 승패가 결정되는 것은 아닙니다. SK hynix는 더 폭넓은 메모리 포트폴리오와의 통합을 통해 경쟁할 수 있습니다. Samsung은 엔터프라이즈 SSD, DRAM, HBM 및 시스템 검증을 결합할 수 있습니다. Solidigm은 대용량 스토리지와 소프트웨어 지원 KV 캐시 또는 벡터 검색을 강조해 왔습니다.

기존 엔터프라이즈 SSD도 계속 개선되고 있습니다. Samsung은 PM1753에 대해 최대 330만 랜덤 읽기 IOPS와 초당 14.5기가바이트를 제시합니다. 이 수치는 GP1의 헤드라인 IOPS에는 못 미치지만, Samsung 장치는 문서화된 엔터프라이즈 기능과 워크로드 테스트도 제공합니다.

Kioxia의 기존 CM7 비교 자료는 PCIe 5.0 엔터프라이즈 드라이브에 대해 140만 IOPS를 제시합니다. 이 기준과 비교하면 1,000만 IOPS의 GP1은 장치 수준에서 상당한 증가를 의미합니다. 이 격차는 특수 미디어와 컨트롤러가 주목받는 이유를 설명하는 데 도움이 됩니다.

역사적 맥락에서는 더 이상 활발히 개발되지 않지만 또 다른 경쟁자가 등장합니다. Intel Optane은 3D XPoint 미디어를 사용해 DRAM과 NAND SSD 사이의 지연 시간 및 내구성을 제공했습니다. 상업적 쇠퇴는 기술적 우위가 지속 가능한 시장을 보장하지는 않는다는 점을 보여줬습니다.

Optane은 어려운 경제성, 제한적인 채택, 기존 시스템에 새로운 메모리 계층을 맞춰 넣어야 하는 과제에 직면했습니다. GP1은 NAND 제조 경험과 Nvidia의 아키텍처 지원이라는 이점이 있지만, 여전히 통합 및 수요 위험에 직면해 있습니다.

업계 분석은 원시 성능과 실질적인 배포를 구분하기도 합니다. ServeTheHome의 평가는 설계 채택이 Nvidia가 향후 시스템에 Storage-Next를 얼마나 적극적으로 도입하느냐에 크게 좌우된다고 주장합니다. 이러한 의존성은 Nvidia에 채택 과정에서 상당한 영향력을 부여합니다.

소프트웨어 계층은 또 다른 경쟁 경계가 될 수 있습니다. 스토리지 공급업체는 추론 런타임, 벡터 데이터베이스, 오케스트레이션 시스템 및 GPU 통신 프레임워크와의 호환성이 필요합니다. 광범위한 맞춤 작업이 필요한 하드웨어는 주로 최대 규모의 운영자에게만 매력적일 것입니다.

개방형 소프트웨어 지원은 시장을 넓힐 수 있습니다. 명확한 인터페이스는 인프라 팀이 GP1을 일반 NVMe 어레이, 원격 메모리, 압축 캐시 또는 재계산과 비교할 수 있게 합니다. 폐쇄형 통합은 일부 시스템에서 강력한 결과를 낼 수 있지만 더 폭넓은 채택은 제한할 수 있습니다.

Kioxia는 GP1이 CM9 제품군과 함께 어디에 위치하는지도 설명해야 합니다. CM9는 25.6테라바이트의 문서화된 용량과 하루 드라이브 기록 3회 수준의 내구성을 제공합니다. GP1은 현재 동등하게 완전한 공개 사양 없이 접근 단위와 IOPS를 강조하고 있습니다.

이 차이는 CM9가 대역폭 집약적인 KV 캐시 배포를 위한 더 단기적인 선택지임을 시사합니다. GP1은 초소형 요청과 GPU 메모리 확장을 위한 더 실험적인 선택지입니다. 두 제품의 주장을 혼합하면 모두 평가하기가 더 어려워집니다.

Google News 보도는 시장을 단순한 SSD 속도 경쟁처럼 보이게 할 수 있습니다. 실제 경쟁에는 메모리 배치, 인터커넥트, 펌웨어, 소프트웨어 스케줄링, 내구성, 용량, 전력, 전체 시스템 경제성이 포함됩니다.

1,000만 IOPS 수치가 입증하지 못하는 것

장치 시연만으로는 양산 수준의 지연 시간, 내구성, 전력 효율 또는 초당 토큰 증가를 입증할 수 없습니다.

벤치마크 수치는 워크로드 설정에 따라 달라집니다. IOPS는 요청 크기, 큐 깊이, 읽기 비율, 데이터 패턴, 오버프로비저닝, 명령을 제출하는 워커 수에 따라 변합니다. 최고 결과는 혼합 AI 트래픽에서의 지속 성능을 설명하지 못할 수 있습니다.

Kioxia는 GP1이 512바이트 접근을 지원한다고 말하며, 이는 자연스럽게 동일한 데이터 볼륨에서 4킬로바이트 요청보다 더 많은 작업을 생성합니다. 구매자는 총 처리량에 관한 결론을 내리기 전에 IOPS와 전송 바이트를 모두 비교해야 합니다.

512바이트 기준 1,000만 작업은 프로토콜 오버헤드 전 기준으로 매초 약 5.12기가바이트의 요청 데이터를 의미합니다. 이 계산은 탁월한 IOPS 수치가 중간 수준의 총 대역폭과 공존할 수 있는 이유를 보여줍니다. 이 장치는 단순한 대용량 전송이 아니라 세분성을 위해 최적화되었습니다.

지연 시간 분포도 마찬가지로 중요합니다. 평균값은 간헐적인 느린 요청을 숨길 수 있는 반면, 테일 지연 시간은 높은 비율의 작업 가운데 가장 나쁜 경험을 측정합니다. 많은 병렬 요청을 처리하는 AI 서비스는 이런 이상값에 자주 민감합니다.

대부분의 읽기가 빠르게 완료되더라도 지연된 캐시 페치는 생성 단계를 멈출 수 있습니다. 따라서 구매자는 합성 랜덤 읽기 테스트에서의 평균 지연 시간뿐 아니라 현실적인 큐 깊이에서의 백분위 지연 시간이 필요합니다.

내구성도 여전히 공개되지 않은 문제입니다. KV 캐시 시스템은 새 상태를 기록하고, 만료된 세션을 삭제하며, 데이터를 계층 간에 이동합니다. 조직이 문서나 임베딩을 업데이트하면 벡터 인덱스도 변합니다. XL-FLASH는 고집적 NAND보다 장점을 제공해야 하지만, GP1에는 공개된 워크로드 등급이 필요합니다.

용량은 장치의 역할을 결정합니다. 작고 빠른 SSD는 웜 캐시 역할을 할 수 있는 반면, 더 큰 장치는 더 많은 모델 파라미터나 검색 데이터를 보관할 수 있습니다. 최종 용량이 없으면 아키텍트는 드라이브 수, 랙 공간 또는 장애 노출도를 계산할 수 없습니다.

작업당 전력 소비는 Kioxia가 기존 TLC SSD 대비 장점으로 내세우는 요소 중 하나입니다. 회사는 아직 대표 워크로드에서 전체 장치 전력을 비교할 만큼 충분한 공개 데이터를 제공하지 않았습니다. 냉각 요건과 유휴 상태 동작도 배포에 영향을 줍니다.

직접 GPU 접근은 데이터 경로를 바꾸므로 신뢰성 기능을 면밀히 검토해야 합니다. 운영자는 여전히 오류 처리, 접근 제어, 격리, 텔레메트리, 펌웨어 관리, 전원 손실 보호 및 장치 장애 후 예측 가능한 복구가 필요합니다.

공유 인프라에서는 보안이 특히 중요해집니다. 캐시된 프롬프트나 검색된 엔터프라이즈 데이터에는 민감한 정보가 포함될 수 있습니다. GPU 지향 스토리지는 테넌트 격리를 보존하고 오래된 데이터가 워크로드 경계를 넘지 못하도록 해야 합니다.

소프트웨어 오버헤드는 미디어 수준의 이점 일부를 상쇄할 수 있습니다. 드라이버, 메모리 등록, 주소 변환, 요청 배치 및 캐시 관리는 모두 자원을 소비합니다. 런타임이 요청을 효율적으로 발행하지 못하면 빠른 SSD도 도움이 되지 않습니다.

시스템 벤치마크는 첫 토큰까지의 시간, 초당 토큰 수, 동시 사용자 수, GPU 활용률 및 완료된 요청당 에너지를 측정해야 합니다. 이 지표들은 스토리지 동작을 AI 운영자가 실제로 판매하는 서비스와 연결합니다.

신뢰할 수 있는 테스트는 GP1을 더 많은 DRAM, 기존 NVMe 드라이브, 재계산 및 원격 캐시 시스템과도 비교해야 합니다. 각 대안에는 서로 다른 자본, 전력, 용량 및 운영 비용이 따릅니다.

가장 강력한 증거는 HBM 용량을 초과하고 세분화된 데이터에 반복적으로 접근하는 고객 워크로드에서 나올 것입니다. GP1이 응답 지연 시간을 유지하면서 유효 GPU 작업을 늘린다면 Kioxia의 아키텍처 주장은 지지를 얻게 됩니다.

그때까지 1,000만 IOPS 시연은 더 제한적인 점을 입증합니다. Kioxia는 시연된 조건에서 이례적으로 높은 소형 블록 작업률을 낼 수 있는 특수 플래시 장치를 만들었습니다. 이것이 모든 AI 애플리케이션에 해당 제품이 필요하다는 점을 입증하지는 않습니다.

GP1이 AI 인프라가 될지를 결정할 세 가지 신호

샘플 사양, 애플리케이션 벤치마크 및 플랫폼 채택 여부가 GP1이 인상적인 FMS 시연을 넘어설지를 결정할 것입니다.

첫 번째 신호는 Kioxia의 평가용 샘플 패키지입니다. 회사는 2026년 말까지 선정된 고객에게 GP Series 샘플을 제공할 것으로 예상합니다. 이 장치는 최종 용량, 인터페이스, 폼팩터, 내구성, 전력 제한 및 지속 성능을 드러내야 합니다.

지연은 현재 일정을 약화시킬 것입니다. 완전한 문서와 함께 제때 샘플링이 이루어진다면 GP1이 기술 쇼케이스가 아니라 배포 가능한 제품이 되고 있다는 근거가 강화될 것입니다.

두 번째 신호는 Kioxia, Nvidia 또는 고객이 제공하는 엔드투엔드 벤치마크입니다. 가장 유용한 결과는 서로 다른 메모리 계층 구조에서 동일한 모델과 서버를 비교하는 것입니다. GPU 활용률, 응답 지연 시간, 처리량 및 에너지를 보고해야 합니다.

드라이브 수준의 IOPS 차트만으로는 충분하지 않습니다. 핵심 약속은 AI 시스템 효율 향상이므로, 검증은 통제된 조건에서 더 많은 완료된 추론 작업 또는 더 큰 사용 가능 모델을 보여줘야 합니다.

Kioxia는 시연된 결과가 하나의 장치, 여러 컨트롤러, 에뮬레이터 또는 완전한 Storage-Next 노드 중 무엇을 사용하는지도 공개해야 합니다. 이 맥락은 구매자가 더 높은 시스템 수준 목표에 필요한 하드웨어를 추정하는 데 도움이 됩니다.

세 번째 신호는 서버 제조업체, 클라우드 제공업체 및 추론 소프트웨어 프로젝트가 Nvidia Storage-Next를 채택하는지 여부입니다. GP1은 호환되는 PCIe 슬롯 이상에 의존합니다. GPU가 플래시에 저장된 데이터를 주소 지정, 스케줄링, 보호 및 복구할 수 있는 안정적인 경로가 필요합니다.

주요 서버 공급업체의 지원은 Kioxia의 입지를 강화할 것입니다. 개발자는 일반적으로 이미 사용하는 소프트웨어를 통해 새 하드웨어를 채택하므로, 일반적인 추론 런타임에 통합되는 것은 더욱 중요합니다.

경쟁사의 일정도 이런 신호에 영향을 미칠 것입니다. SK hynix가 고 IOPS 제품을 신속히 샘플링하면 구매자는 협상력과 비교 데이터를 얻을 것입니다. 기존 TLC 드라이브가 성능 격차의 상당 부분을 좁힌다면 특수 SLC의 경제성을 방어하기는 더 어려워집니다.

1억 IOPS 목표는 별도로 다뤄야 합니다. Kioxia는 이를 차세대 AI 시스템의 요건이자 GP Series의 목표로 설명합니다. 회사는 단일 출하 GP1 장치가 현재 그 속도를 지속한다고 입증하지 않았습니다.

따라서 향후 Google News 업데이트는 세 가지 질문을 기준으로 읽어야 합니다. 이 수치는 측정된 것인가, 예상치인가? 하나의 드라이브를 설명하는가, 시스템을 설명하는가? 벤치마크가 실제 AI 워크로드를 개선하는가?

개발자에게 이 발전이 중요한 이유는 메모리 배치가 추론 엔지니어링의 일부가 되고 있기 때문입니다. 팀은 어떤 모델 데이터, 캐시 블록 및 검색 인덱스가 HBM, DRAM, 특수 플래시 또는 일반 스토리지를 사용할 가치가 있는지 프로파일링해야 할 수 있습니다.

엔터프라이즈 구매자는 용량을 예약하기 전에 워크로드 추적과 애플리케이션 결과를 요청해야 합니다. 또한 장애 동작, 관측 가능성, 보안 제어 및 소프트웨어 이식성을 검토해야 합니다. 최고 IOPS만으로는 이러한 운영상의 질문에 답할 수 없습니다.

지식 노동자들이 GP1 드라이브를 직접 구매하지는 않겠지만, 그 효과는 체감할 수 있다. 메모리 활용 효율이 높아지면 GPU 메모리를 비례해서 늘리지 않고도 더 긴 세션, 더 많은 동시 에이전트, 더 폭넓은 검색을 지원할 수 있다.

Kioxia는 약 1,000만 IOPS를 구현한 1세대 장치를 선보이고, 훨씬 더 큰 목표를 향한 경로를 제시하며 주목을 받았다. 다음 단계는 덜 극적이지만 더 중요하다. 이러한 작업이 GPU를 생산적으로 계속 가동시키는지를 입증하는 일이다.

헤드라인뿐 아니라 평가용 샘플도 지켜봐야 한다. 측정된 애플리케이션 성능 향상, 명확한 시스템 구성, 플랫폼 파트너의 약속을 살펴보라. 이러한 신호는 GP1이 실용적인 AI 메모리 계층이 될지, 아니면 뛰어난 SSD 벤치마크로 남을지를 보여줄 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page