SK hynix의 Processing-in-Memory, GPU와 HBM을 넘어선 AI 병목 해소에 도전
SK hynix는 업계가 수년간 GPU와 HBM 시스템에 의존해 온 상황에서도 processing-in-memory를 AI 전략의 중심에 다시 올려놓았다. AI Infra Summit 2026에서 이 회사는 AiM 칩, AiMX 가속기 카드, 그리고 대화형 대규모 언어 모델 시연을 구동하는 서버를 선보였다. 메시지는 명확했다. 모든 연산을 GPU를 거쳐 처리하는 방식은 점점 비용 부담이 큰 병목이 되고 있다는 것이다.
9월 16일 발표는 PIM을 새로운 발명품으로 소개한 것이 아니었다. SK hynix는 2022년 첫 GDDR6-AiM 샘플을 발표했고, 2023년 AiMX 카드를 시연했다. 달라진 점은 이 기술이 어디에 속하는지에 대한 회사의 주장이다. SK hynix는 이제 이를 특히 빠른 AI 추론을 위한 GPU 및 고대역폭 메모리 인프라의 특화된 파트너로 자리매김하고 있다.
이 구분은 중요한 의미를 갖는다. 핵심 경쟁 구도는 SK hynix와 Nvidia 또는 다른 칩 제조사 간의 대결이 아니다. 이는 기존 GPU-HBM 아키텍처와, 메모리 집약적 작업을 전용 메모리 하드웨어로 보내는 이기종 설계 간의 경쟁이다. 새로운 접근 방식은 데이터 이동을 줄일 수 있다고 약속하지만, 상용 도입은 여전히 소프트웨어, 생산 경제성, 독립적으로 검증된 성능에 달려 있다.
Santa Clara에서 SK hynix가 선보인 것
SK hynix는 PIM을 단순한 실험실용 메모리 칩이 아니라 더 폭넓은 AI 서빙 시스템의 운영 구성 요소로 제시했다.
이 회사는 캘리포니아 Santa Clara에서 9월 15일부터 9월 17일까지 열린 AI Infra Summit 2026에 참여했다. SK hynix에 따르면 이 행사는 약 6,000명의 참가자를 끌어모았으며, 이는 전년의 약 두 배 규모다. 부스 규모도 두 배로 확대됐고, “New Spectrum” 테마 아래 여러 메모리 기술을 결합해 선보였다.
PIM 전시에는 회사의 AiM 메모리 칩, AiMX 가속기 카드, 그리고 해당 카드를 탑재한 서버가 포함됐다. Processing-in-memory, 즉 PIM은 제한된 연산 기능을 메모리 내부 또는 바로 인접한 위치에 배치한다. 이를 통해 모든 데이터를 메모리와 별도 프로세서 사이에서 오갈 필요를 줄인다.
방문객들은 전시 시스템에서 실행되는 LLM 서비스와 상호작용할 수 있었다. 이는 정적인 칩 샘플을 넘어선 시연이지만, 컨퍼런스 시연만으로 양산 준비가 입증되는 것은 아니다. AI 인프라 전시는 SK hynix가 고객이 이 제품을 어떻게 이해하기를 원하는지 보여줬다. 즉, 서버 내에 배치 가능한 구성 요소라는 것이다.
임의철 부사장은 컨퍼런스의 Data Movement 트랙에서 이 전략을 발표했다. 그의 세션은 갈수록 다양해지는 워크로드가 더 이상 단일 하드웨어 설계에 맞지 않는다고 주장했다. 초저지연 에이전트, 긴 컨텍스트 애플리케이션, 대규모 추론은 메모리 용량, 대역폭, 컴퓨팅 자원에 서로 다른 요구를 제기한다.
임 부사장은 기존 GPU-HBM 아키텍처만으로는 이러한 모든 요구를 충족하기 어려워지고 있다고 말했다. 이는 현 GPU 시스템에 대한 독립적인 판단이 아니라 회사의 입장이다. 다만 SK hynix가 같은 행사에 세 가지 서로 다른 기술을 가져온 이유를 설명해 준다.
PIM은 빠른 디코딩과 메모리 병목 연산을 겨냥한다. High Bandwidth Flash, 즉 HBF는 HBM과 SSD 스토리지 사이에 더 큰 NAND 용량을 배치하기 위한 기술이다. SALT-KV는 LLM의 키-값 캐시를 HBM, DRAM, SSD 계층 전반에 분산하기 위한 소프트웨어 주도형 시스템이다.
키-값 캐시는 언어 모델 생성 과정에서 이전에 계산된 어텐션 정보를 저장한다. 대화가 길어지고 더 많은 요청이 동시에 처리될수록 메모리 사용량은 커진다. 이 데이터를 효율적으로 이동하거나 유지하는 방식은 추론 속도와 인프라 활용률에 영향을 미칠 수 있다.
따라서 이 포트폴리오는 하나의 핵심 판단을 반영한다. AI 서빙에는 단일하고 균일하게 빠른 풀 대신 여러 특화 메모리 계층이 필요하다는 것이다. SK hynix는 고속 메모리를 판매하는 역할에서 벗어나 AI 데이터가 어디에 위치해야 하고 선택된 연산이 어디서 실행돼야 하는지를 설계하는 역할로 전환하려 하고 있다.
이러한 목표는 2026년 등장을 SK hynix의 첫 PIM 공개로 설명해서는 안 되는 이유이기도 하다. 이 회사는 2022년 2월 GDDR6-AiM을 발표했다. 2023년 첫 AiMX 프로토타입 카드를 공개했고, 2024년에는 시연된 카드 용량을 두 배인 32 GB로 늘렸다.
이번 행사는 구성 요소 개발에서 시스템 배치로 서사를 진전시킨다. 그러나 SK hynix는 광범위한 상용 도입을 확인하는 데 필요한 출하량, 실명 고객 배치 사례, 양산 일정을 공개적으로 제공하지 않았다.
이 격차는 이 글의 핵심 긴장을 만든다. SK hynix는 통합 PIM 서버를 선보이고 설득력 있는 아키텍처 문제를 설명할 수 있다. 하지만 고객이 이 솔루션을 중심으로 소프트웨어와 인프라를 재구성할 것이라는 점은 여전히 입증해야 한다.
GPU와 HBM 시스템이 데이터 이동 문제에 직면하는 이유
SK hynix가 겨냥하는 제약은 고가의 프로세서가 유의미한 계산을 수행하는 대신 데이터를 기다릴 때 나타난다.
현대 AI 가속기는 고도로 병렬화된 프로세서와 고대역폭 메모리, 즉 HBM을 결합한다. HBM은 DRAM 다이를 적층하고 고밀도 수직 연결을 통해 이어 붙인다. 이러한 스택을 GPU 가까이에 배치하면 기존 서버 메모리보다 훨씬 큰 대역폭을 제공한다.
이 구성은 AI 학습과 추론의 핵심 요소가 됐다. 그러나 프로세서 처리량을 늘린다고 해서 모든 메모리 제약이 사라지는 것은 아니다. 워크로드는 모델 가중치, 어텐션 데이터, 중간 결과를 반복적으로 읽으면서 여전히 제한될 수 있다.
수학적 연산 자체가 단순하더라도 데이터 이동에는 시간과 에너지가 든다. 기존 시스템은 메모리에서 데이터를 가져와 프로세서로 보내고, 연산을 수행한 뒤 결과를 다시 기록한다. 대규모 모델에서 이 과정을 반복하면 산술 하드웨어가 충분히 활용되지 못할 수 있다.
이 문제는 특히 LLM 디코딩 과정에서 두드러진다. 디코딩은 출력 토큰을 순차적으로 생성하므로 각 단계가 이전 상태에 의존한다. 이 과정은 대량의 모델 및 컨텍스트 데이터를 읽는 반면, 비교적 적은 연산만 수행하는 경우가 많다.
학습은 다른 균형을 보인다. 더 큰 수학 연산을 묶어 GPU 유닛을 높은 수준으로 활용할 수 있다. 반면 추론 워크로드는 배치 크기, 컨텍스트 길이, 지연 시간 목표, 요청 패턴이 서비스마다 달라 훨씬 폭넓게 변한다.
SK hynix는 이러한 다양성을 활용해 모든 중요한 연산이 GPU에서 이뤄져야 한다는 가정에 도전한다. 이 회사의 주장은 범용 가속기가 불필요해졌다는 것이 아니다. 컴퓨팅 집약적 작업은 기존 프로세서에 맡기면서, 적합한 메모리 병목 연산을 오프로드하자는 제안이다.
이 접근 방식은 현 시스템 설계의 여러 부분에 압박을 가한다. GPU 운영자는 더 많은 가속기 용량이 느린 추론에 대한 가장 효율적인 해법인지 검토해야 한다. 서버 공급업체는 추가적인 카드 유형이 복잡성 증가를 정당화할 만큼 충분한 이점을 제공하는지 판단해야 한다.
클라우드 제공업체도 관련된 질문에 직면한다. 소프트웨어가 작업을 안정적으로 스케줄링하지 못한다면 더 빠른 구성 요소의 가치는 제한적이다. 하드웨어 활용률, 모델 호환성, 시스템 관리, 유지보수는 이론적 대역폭만큼 중요할 수 있다.
경제성은 고객이 어떤 서비스를 운영하는지에 따라서도 달라진다. 즉각적인 토큰 전달을 우선시하는 프리미엄 대화형 에이전트는 수천 건의 요청을 처리하는 배치 서비스와 요구 사항이 다르다. 긴 컨텍스트 검색은 또 다른 메모리 패턴을 만든다.
SK hynix는 PIM이 프리미엄 서비스의 빠른 디코딩 워크로드에 가장 적합하다고 말한다. 이 단서는 중요하다. 낮은 지연 시간과 반복적인 메모리 접근이 특화 하드웨어를 정당화하는 워크로드로 제안 범위를 좁히기 때문이다.
회사는 하나의 메모리 기술을 모든 AI 병목의 해법으로 제시하지 않는다. HBF는 긴 컨텍스트 사용 사례의 용량과 대역폭을 다룬다. SALT-KV는 캐시된 정보가 어디에 있어야 하는지 결정한다. PIM은 저장된 데이터 가까이에서 선택된 계산을 수행한다.
이러한 구분은 익숙한 GPU-HBM 플랫폼을 확장하려는 기존 선호에 도전한다. 기존 소프트웨어가 이미 이를 지원하는 상황에서는 GPU와 더 빠른 HBM을 추가하는 편이 운영 측면에서 더 단순하다. 이기종 설계는 워크로드가 올바르게 분할된 뒤에야 효율성을 제공한다.
연구자들도 계속해서 같은 트레이드오프를 확인하고 있다. 이기종 DRAM-PIM-GPU 시스템을 다룬 2026년 연구는 의미 있는 효율성을 위해 시스템 전반의 공동 최적화가 필요하다고 결론지었다. 해당 PIM 설계 분석은 정적 메모리와 유휴 GPU 전력이 겉으로 드러나는 효율성을 크게 바꿀 수 있음을 발견했다.
이 연구는 또한 테스트한 구성에서 워크로드 매핑이 제한적인 종단 간 향상만 만들었다고 밝혔다. 이 결과는 SK hynix의 2026년 서버를 직접 평가한 것은 아니다. 다만 구성 요소 수준의 측정만으로는 완전한 애플리케이션 성능을 예측할 수 없는 이유를 보여준다.
기업 구매자에게 이는 PIM을 시스템 아키텍처로 평가해야 한다는 뜻이다. 핵심 질문은 메모리 내부에서 연산이 가능한지가 아니다. 모든 오버헤드를 포함한 뒤에도 지원되는 애플리케이션이 유의미한 작업을 더 빠르고 효율적으로 완료하는지다.
SK hynix processing-in-memory, 선택된 작업을 데이터 쪽으로 이동시키다
SK hynix processing-in-memory는 연산 위치를 바꾸지만, DRAM을 GPU의 완전한 대체재로 바꾸지는 않는다.
회사의 AiM 설계는 GDDR6 메모리에 연산 기능을 추가한다. GDDR6는 HBM의 적층 구조를 사용하지 않으면서도 상당한 대역폭을 제공하는 고속 그래픽 메모리 표준이다. 여러 GDDR6-AiM 장치를 AiMX 가속기 카드에 결합할 수 있다.
2022년 SK hynix는 첫 GDDR6-AiM 샘플이 초당 16기가비트로 작동하고 1.25볼트를 사용한다고 밝혔다. 회사가 비교 대상으로 언급한 표준 메모리는 1.35볼트로 작동했다. 또한 특정 연산에서 최대 16배 빠른 성능과 80%의 전력 소비 감소를 주장했다.
이 수치는 SK hynix가 제시한 것이며 선택된 조건을 설명한 것이다. 이를 AI 애플리케이션 전반의 보편적 향상으로 해석해서는 안 된다. 원래의 GDDR6-AiM 발표는 모든 상용 모델, 서버, 소프트웨어 스택의 성능을 확립하지 않았다.
다음 단계는 AiMX였다. SK hynix는 2023년 Meta의 OPT 13B 언어 모델을 사용해 첫 가속기 카드 프로토타입을 시연했다. 회사는 이 시스템이 GPU 기반 비교 구성보다 10배 이상 빠르게 데이터를 처리하면서 전력은 5분의 1만 사용했다고 밝혔다.
이 주장에는 중요한 조건이 포함됐다. SK hynix는 성능이 카드의 AiM Control Hub용 애플리케이션별 집적 회로를 전제로 한다고 말했다. 따라서 시연 결과는 메모리 칩만이 아니라 특정 컨트롤러 구현에 의존했다.
그럼에도 첫 AiMX 프로토타입은 의도된 메커니즘을 확립했다. GPU가 모든 값을 가져오도록 하는 대신, 이 카드는 GDDR6-AiM 장치 가까이에서 지원되는 연산을 수행한다. 트래픽 감소는 GPU가 강점에 더 잘 맞는 작업에 집중하도록 도울 수 있다.
SK hynix는 2024년 프로토타입을 업데이트했다. 새 카드는 이전 버전의 두 배인 32 GB 용량을 탑재했다. 회사는 Meta의 Llama 3 70B 모델로 이를 시연하며 멀티배치 추론에 초점을 맞췄다.
멀티배치 처리는 여러 요청을 실행을 위해 묶는다. 이는 활용률을 높일 수 있지만, 메모리와 스케줄링에 가해지는 압력도 커진다. SK hynix는 이 환경에서 AiMX를 어텐션 가속기로 제시했다.
어텐션은 LLM이 현재 토큰을 이전의 관련 토큰과 연결할 수 있게 한다. 이는 모델 동작에 필수적이지만, 상당한 양의 저장 상태를 이동하고 처리해야 한다. 이 때문에 어텐션의 일부는 니어 메모리 가속에 매력적인 대상이 된다.
이 회사는 또한 2024년 설계가 동일한 전력 수준에서 모바일 DRAM 대비 모바일 LLM 속도를 세 배 향상할 수 있다고 주장했다. 다시 말해, 이는 광범위한 독립 벤치마크가 아니라 회사가 보고한 비교였다. 32 GB AiMX 시연은 대중 시장 출시를 발표하지 않았다.
2026년 컨퍼런스에서 임 사장은 PIM과 정적 랜덤 액세스 메모리, 즉 SRAM 간의 또 다른 비교를 제시했다. SRAM은 빠르지만 상당한 칩 면적을 차지하며 일반적으로 DRAM보다 용량이 작다.
발표에 관한 한국 언론 보도에 따르면, 임 사장은 PIM이 동일 면적에서 SRAM 대비 약 300배의 용량을 제공할 수 있다고 말했다. 또한 높은 내부 대역폭도 유지할 수 있다. 컨퍼런스 발언은 PIM을 SRAM의 용량 및 비용 제약을 피하는 방법으로 제시했다.
이 비교는 실제 아키텍처상의 트레이드오프를 다룬다. 빠른 로컬 메모리는 지연 시간을 최소화하는 데 도움이 되지만, 대규모 SRAM 어레이는 비용이 높고 면적을 많이 차지한다. DRAM은 훨씬 높은 집적도를 제공하지만, 일반 DRAM에는 같은 수준의 직접 연산 능력이 없다.
SK hynix는 메모리 다이와 컴퓨팅 다이를 분리하고 하이브리드 본딩으로 수직 연결하는 방식을 제안한다. 하이브리드 본딩은 기존 솔더 범프 없이 연마된 표면과 구리 연결부를 결합한다. 이는 독립적으로 최적화된 다이 사이에 더 조밀한 연결을 지원할 수 있다.
이 분리는 상당한 로직을 DRAM 다이 내부에 직접 내장할 경우 메모리 용량이 줄고 제조 비용이 상승할 수 있기 때문에 중요하다. 로직 다이에는 연산에 적합한 공정을 적용하고, 메모리 다이에는 DRAM 중심 설계를 유지할 수 있다.
다만 하이브리드 본딩은 자체적인 생산 요구사항도 수반한다. 정렬, 표면 품질, 열, 수율, 테스트는 모두 비용에 영향을 미친다. 기술적으로 우아한 적층 구조가 자동으로 경제적인 대량 생산 제품이 되는 것은 아니다.
따라서 그 메커니즘은 “연산하는 메모리”라는 표현이 시사하는 것보다 더 정밀하다. AiM은 데이터 근처에서 지원되는 연산을 처리한다. AiMX는 이러한 장치를 가속기로 결합한다. 호스트 프로세서, GPU, 메모리 계층, 컨트롤러, 소프트웨어 스택은 여전히 전체 워크로드를 조율한다.
이러한 한계는 잠재적 이점의 원천이기도 하다. 특화 하드웨어는 가치를 제공하기 위해 모든 구성 요소를 대체할 필요가 없다. 중요한 워크로드에서 반복적인 데이터 이동을 충분히 줄이기만 하면 된다.
진짜 경쟁 상대는 만능형 아키텍처다
SK hynix는 더 빠른 GPU-HBM 조합이 AI 추론의 모든 단계를 처리해야 한다는 생각에 도전하고 있다.
이는 경로 대 경로의 경쟁이다. 한 경로는 더 빠른 가속기, 더 큰 HBM 스택, 추가 시스템을 도입해 지배적인 아키텍처를 확장한다. 다른 경로는 GPU, PIM, 스토리지, 소프트웨어 관리형 메모리 계층에 작업을 분산한다.
첫 번째 경로는 성숙한 소프트웨어 기반의 이점을 얻는다. 개발자들은 이미 확립된 GPU 프레임워크, 최적화된 커널, 모니터링 시스템, 배포 도구를 사용하고 있다. 모델 제공업체들은 종종 이러한 플랫폼을 중심으로 설계된 구성을 공개한다.
두 번째 경로는 하드웨어와 워크로드 간의 더 나은 정렬을 약속한다. 메모리 바운드 연산은 데이터 근처에서 실행할 수 있고, GPU는 계속해서 연산 집약적 작업을 처리한다. 느리지만 더 큰 메모리 계층은 즉시 접근할 필요가 없는 정보를 보관할 수 있다.
이러한 분업은 특화된 생산 라인과 닮아 있다. 각 구성 요소가 자신의 특성에 맞는 작업을 수행한다. 그 결과 시스템은 더 효율적으로 될 수 있지만, 조율은 더 어려워진다.
SK hynix의 전략은 GPU 공급업체에 간접적으로 압력을 가한다. PIM 카드가 디코딩의 의미 있는 비중을 처리한다면, 고객은 동일한 서비스 규모를 위해 필요한 GPU 사이클을 줄일 수 있다. 그러나 성공적인 PIM 시스템은 완전한 AI 서비스를 더 경제적으로 만들어 GPU 수요를 늘릴 수도 있다.
이 때문에 PIM을 직접적인 GPU 대체재로 설명하면 회사의 현재 발표를 왜곡하게 된다. SK hynix는 서버 내부의 AiMX를 공개하고 이기종 인프라를 논의했다. 목표는 프로세서의 제거가 아니라 비효율적인 데이터 이동이다.
주요 메모리 공급업체 중 Samsung은 가장 명확한 경쟁 기준점이다. Samsung은 HBM-PIM을 개발하고 AMD 가속기 하드웨어와 함께 이 기술을 시연했다. Samsung은 온디바이스 AI를 위한 프로세싱 니어 메모리와 PIM 설계도 탐색해 왔다.
Samsung의 접근 방식은 업계가 메모리 근처 연산을 단순한 SK hynix 실험 이상으로 보고 있음을 확인해 준다. Samsung의 HBM-PIM 아키텍처는 GDDR6 기반 AiM 카드 대신 HBM 내부로 선택된 연산을 오프로드한다.
메모리 형식의 차이가 단순한 승자를 만들지는 않는다. HBM은 가속기 근처에서 매우 높은 대역폭을 제공하는 반면, GDDR6는 용량, 패키징, 비용 측면에서 다른 특성을 제공할 수 있다. 고객은 전체 시스템과 지원되는 워크로드를 평가하게 될 것이다.
PIM 개발업체들은 익숙한 표준화 문제에도 직면한다. 소프트웨어가 대규모 재작성 없이 하드웨어를 대상으로 할 수 있을 때 도입은 더 쉬워진다. 한 공급업체의 맞춤형 라이브러리나 제한된 연산자 집합에 묶인 설계는 특수 제품으로 남을 위험이 있다.
컴파일러는 오프로드에 적합한 연산을 식별해야 한다. 런타임은 해당 연산을 스케줄링하고 데이터 배치를 관리해야 한다. 모니터링 도구는 여러 처리 위치에 걸친 장애와 성능 변화를 설명할 수 있어야 한다.
모델은 서버 교체 주기보다도 빠르게 진화한다. 하나의 어텐션 패턴에 최적화된 가속기는 새로운 아키텍처가 메모리 접근 방식을 바꾸면 관련성을 잃을 수 있다. 따라서 원시 실리콘 성능과 함께 재구성 가능성과 소프트웨어 업데이트도 중요하다.
이 지점에서 SK hynix의 더 폭넓은 포트폴리오는 전략적으로 의미를 갖는다. SALT-KV는 메모리와 스토리지 전반의 배치 결정을 개선하려 시도한다. HBF는 또 다른 용량 계층을 제공한다. PIM은 선택된 연산을 처리한다.
이 기술들을 종합하면, SK hynix가 전체 데이터 경로에 영향을 미치고자 한다는 점을 시사한다. 이 역할은 더 높은 대역폭의 메모리 장치를 제조하는 수준을 넘어선다. 시스템 소프트웨어, 고객 통합, 지속적인 개발자 지원이 필요하다.
이러한 하드웨어를 평가하는 엔지니어링 팀은 벤치마크 조건, 모델 버전, 전력 측정, 배포 결과를 보존해야 한다. 검색 가능한 엔지니어링 지식 기반은 이러한 가정이 이후의 구매 결정에도 연결되도록 도울 수 있다.
따라서 경쟁의 질문은 어느 회사가 가장 빠른 메모리를 만드는가보다 더 넓다. 승자는 기존 AI 운영 환경에서 특화 메모리를 이해하고 사용할 수 있게 만들어야 한다. 도입 경로 없는 부품 우위는 인프라 설계를 바꾸지 못한다.
PIM 시연이 아직 입증하지 못한 것
SK hynix는 기술적 연속성을 확립했지만, 아직 대규모 상업적 도입을 확립하지는 못했다.
AiM 노력은 현재 여러 공개 이정표에 걸쳐 있다. SK hynix는 2022년 메모리 샘플을 발표했고, 2023년 카드를 시연했으며, 2024년 전시 용량을 두 배로 늘렸고, 2026년 서버를 공개했다.
이러한 진전은 의미가 있다. 단발성 컨퍼런스 발표가 아니라 지속적인 투자를 나타낸다. 그러나 공개 시연만으로는 구매자에게 중요한 몇 가지 질문에 답할 수 없다.
첫째, SK hynix는 2026년 PIM 구성의 일반적인 양산 일정을 공개하지 않았다. 최신 발표에서는 하이퍼스케일 고객, 계약된 배포, 확정된 출하 물량도 밝히지 않았다.
둘째, 회사의 가장 눈에 띄는 성능 주장은 선택된 비교를 사용한다. 2022년 수치는 특정 연산을 다뤘다. 2023년 AiMX 결과는 ASIC 기반 제어 허브 조건에 의존했다. 2024년 시연은 특정 모델과 처리 구성에 집중했다.
공정한 평가는 동일한 하드웨어 조건, 동일한 모델 품질, 동등한 정밀도, 완전한 시스템 전력을 요구한다. 또한 호스트 프로세서, 유휴 구성 요소, 메모리 리프레시, 네트워킹, 소프트웨어 오버헤드도 포함해야 한다.
지연 시간은 여러 배치 크기와 컨텍스트 길이에 걸쳐 측정해야 한다. 처리량에는 요청 스케줄링과 카드 외부 데이터 전송도 포함해야 한다. 신뢰성 테스트는 통제된 시연뿐 아니라 지속적인 운영을 다뤄야 한다.
셋째, PIM은 AI 워크로드의 모든 부분을 동일하게 가속하지 않는다. 연산량이 많은 작업은 여전히 GPU나 전용 텐서 프로세서에 더 적합할 수 있다. 작업이 부적절하게 분할되면 장치 간 동기화가 성능 이득을 상쇄할 수 있다.
최근 학술 연구도 이러한 신중함을 뒷받침한다. 시스템 수준 효율은 채널 구성, 정적 전력, 모델 구조, 워크로드 매핑에 좌우된다. 유리한 커널 결과도 전체 추론 파이프라인을 측정하면 축소될 수 있다.
넷째, 제조 경제성은 여전히 불확실하다. 로직과 고밀도 인터커넥트를 추가하면 설계 복잡성이 증가할 수 있다. 하이브리드 본딩으로 메모리와 로직을 분리하면 메모리 집적도를 보호할 수 있지만, 패키징 단계와 수율 고려사항이 추가된다.
칩렛과 유사한 구조는 조립 전후의 테스트도 필요로 한다. 한 레이어의 결함은 결합된 패키지의 가치를 떨어뜨릴 수 있다. 공급업체들은 성능 향상이 이러한 생산 비용을 감당하고도 유지된다는 점을 보여야 한다.
다섯째, 소프트웨어 이식성이 고객의 도입 의지를 좌우할 것이다. 기업은 인상적인 벤치마크 하나만을 위해 가속기를 배포하지 않는다. 진화하는 모델, 일반적인 프레임워크, 보안 업데이트, 관측 가능성, 예측 가능한 유지보수에 대한 지원이 필요하다.
따라서 SK hynix의 주장은 시장 검증을 기다리는 기술적 근거로 읽어야 한다. 회사는 PIM이 메모리 샘플에서 인터랙티브 서버로 발전할 수 있음을 보여줬다. 그러나 결과 플랫폼이 광범위한 교체 주기에 대비됐다는 점은 보여주지 못했다.
이 구분이 발표의 중요성을 낮추는 것은 아니다. 이는 다음 증거 기준을 정의한다. 더 큰 수치를 내세운 또 다른 프로토타입보다 실제 서비스 조건에서 운영되는, 실명으로 공개된 배포가 더 중요할 것이다.
AiMX가 인프라로 자리 잡고 있는지 보여줄 세 가지 신호
다음 단계는 고객 증거, 재현 가능한 시스템 벤치마크, 그리고 사용 가능한 소프트웨어 생태계에 달려 있다.
첫 번째 신호는 실명으로 공개된 시스템 또는 고객과 연계된 생산 약정이다. 출하일, 서버 인증, 클라우드 배포는 AiMX를 반복적인 컨퍼런스 시연의 범주 밖으로 옮길 것이다. 물량 정보는 이러한 증거를 더욱 강화할 것이다.
SK hynix가 이러한 약정을 발표한다면, 자사의 메모리 중심 아키텍처는 상업 플랫폼에 더 가까워 보일 것이다. 배포 세부 사항 없는 또 다른 쇼케이스는 도입에 관한 질문을 미해결 상태로 남길 것이다.
두 번째 신호는 독립적으로 재현 가능한 벤치마크다. 이는 여러 모델, 컨텍스트 길이, 배치 크기에 걸쳐 AiMX를 정의된 GPU-HBM 시스템과 비교해야 한다. 결과에는 전체 서버 전력과 엔드투엔드 지연 시간이 포함되어야 한다.
투명한 테스트는 SK hynix의 프로세싱 인 메모리가 실제 추론 비용을 줄인다는 주장을 강화할 것이다. 구성 요소 단위의 제한적인 측정이나 조건이 맞지 않는 시스템은, 헤드라인 수치가 커 보이더라도 비교의 신뢰도를 떨어뜨릴 것이다.
세 번째 신호는 더 폭넓은 소프트웨어 지원이다. 구매자는 일반적인 추론 프레임워크와의 통합, 문서화된 연산자 지원 범위, 프로파일링 도구, 서버 파트너의 지원을 주시해야 한다. 공개 개발자 접근은 이 플랫폼이 얼마나 많은 모델 적응을 요구하는지 보여줄 것이다.
강력한 소프트웨어 통합은 SK hynix가 도입을 단순한 반도체 문제가 아닌 것으로 이해한다는 신호가 될 것이다. 폐쇄형 데모 스택은 AiMX를 맞춤형 엔지니어링에 의존하게 만들 수 있다.
이러한 신호들은 기술 구매자에게도 실질적인 평가 프레임워크를 제공한다. 정확히 같은 모델이 품질 변화 없이 실행되는지 확인해야 한다. 카드 한 장이 아니라 서버 전체를 측정해야 한다. 어떤 연산이 PIM에서 실행되고 어떤 연산이 GPU에 남는지도 기록해야 한다.
그다음 트래픽, 컨텍스트, 배치 크기가 변할 때 성능이 어떻게 달라지는지 시험해야 한다. AI 서비스는 신중하게 선택된 단일 워크로드 안에만 머무르는 경우가 드물다. 인프라는 모델과 사용자 행동이 변화해도 계속 유용해야 한다.
SK hynix는 데이터 이동이 더 많은 관심을 받을 가치가 있다는 설득력 있는 근거를 제시했다. 2026년 발표는 또한 PIM이 회사의 첫 칩 샘플을 넘어 발전했음을 보여준다. 아직 해결되지 않은 문제는 고객이 또 하나의 가속기와 그에 따른 소프트웨어 요구사항을 받아들일지 여부다.
첫 번째 프로덕션 배포, 첫 번째 재현 가능한 시스템 벤치마크, 그리고 처음으로 폭넓게 접근 가능한 개발 스택을 지켜봐야 한다. 이러한 이정표가 AiMX가 AI 인프라의 일부가 될지, 아니면 인상적인 데모로 남을지를 결정할 것이다.



