SK hynix AI 인프라 분석: 이제 아키텍처가 성능의 상한을 결정한다
SK hynix는 더 빠른 프로세서가 더 빠르거나 효율적인 AI 서비스를 더 이상 보장하지 않는다는 직접적인 충돌을 중심으로 AI 인프라 전략을 재정립했다. 10월 2일 분석에서 SK hynix는 메모리의 위치, 인터커넥트 설계, 데이터 이동 방식이 이제 애플리케이션이 실제로 활용할 수 있는 가속기 성능을 결정한다고 주장했다.
이러한 결론은 AI 워크로드의 변화를 반영한다. 학습에는 여전히 막대한 연산이 필요하지만, 실제 운영 환경의 지출은 점차 추론, 긴 컨텍스트, 추론 루프, 지속적으로 작동하는 AI 에이전트를 지원하는 데 집중되고 있다. 이러한 워크로드는 모델 가중치, 중간 결과, 저장된 컨텍스트를 반복적으로 불러온다.
따라서 핵심 경쟁은 더 이상 한 칩 제조사와 다른 제조사 간의 대결이 아니다. 프로세서 중심 설계와 메모리 중심 아키텍처의 대결이다. NVIDIA, 클라우드 제공업체, 메모리 제조사, 시스템 구축업체는 모두 서로 다른 스택 영역을 통제하면서 이에 대응하고 있다.
SK hynix AI 인프라 분석이 병목 현상을 재정의하다
중요한 변화는 새로운 SK hynix 칩이 아니라, AI 성능으로 간주되는 범위가 더 넓어졌다는 점이다.
회사의 최신 인프라 분석은 연산을 훨씬 더 큰 데이터 경로의 한 단계로 제시한다. 정보는 스토리지에서 메모리로 이동하고, 캐시와 인터커넥트를 거쳐 최종적으로 가속기로 향한다. 결과는 다시 이 계층 구조의 일부를 거쳐 되돌아간다.
각 전송은 지연 시간을 더하고 에너지를 소비한다. GPU가 데이터를 기다리거나 다른 가속기와 정보를 교환하는 데 시간을 쓰고 있다면, 더 빠른 GPU도 이러한 비용을 없앨 수 없다.
이러한 주장은 범용 컴퓨팅을 형성해 온 프로세서 중심 모델에 도전한다. 이 모델은 데이터를 중앙 프로세서로 가져와 요청된 연산을 수행하고 결과를 다른 곳으로 이동시킨다. 캐시, 프리페칭, 멀티스레딩, 비순차 실행은 지연을 숨기는 데 도움이 되지만, 하드웨어와 소프트웨어의 복잡성도 높인다.
SK hynix는 이러한 불균형이 심각해졌다고 말한다. 회사는 단순 산술 연산보다 DRAM 접근 한 번에 150배에서 2,000배 더 많은 에너지가 필요할 수 있다는 연구를 인용한다. 또한 대규모 머신러닝 모델에서 메모리 접근과 데이터 이동이 시스템 에너지의 90% 이상을 소비했다는 연구도 언급한다.
이 수치가 모든 모델이나 배포 환경을 설명하는 것은 아니다. 칩, 메모리 기술, 정밀도 형식, 워크로드 패턴에 따라 결과는 달라진다. 그럼에도 추가적인 산술 처리량이 기대에 못 미치는 시스템 수준의 향상으로 이어질 수 있는 이유를 보여준다.
대규모 언어 모델 추론에서는 이러한 불균형을 더 쉽게 볼 수 있다. 각 토큰을 생성하려면 모델은 가중치를 읽고 이전 토큰을 처리하면서 생성된 정보를 참조해야 한다. 더 뛰어난 추론 능력이 이러한 동작을 없애지는 않는다. 오히려 시퀀스를 늘리고 유지해야 하는 상태의 양을 증가시키는 경우가 많다.
키-값 캐시, 즉 KV 캐시는 모델이 전체 컨텍스트를 다시 계산하지 않도록 이전 토큰의 어텐션 데이터를 저장한다. 이는 연산을 절감하지만 메모리를 차지하며, 컨텍스트가 길어지고 동시 세션이 늘어날수록 크기도 커진다.
이로 인해 모델 학습과는 다른 용량 문제가 발생한다. 학습 클러스터는 대규모의 계획된 배치를 처리할 수 있는 경우가 많다. 반면 추론 서비스는 예측할 수 없는 요청, 다양한 컨텍스트 길이, 사용자 대면 지연 시간 목표를 처리해야 한다.
에이전트형 애플리케이션은 또 다른 복잡성을 더한다. 에이전트는 텍스트를 생성하고, 도구를 호출하고, 결과를 기다린 뒤, 그 결과를 컨텍스트에 추가하고, 또 다른 추론 주기를 시작할 수 있다. 세션 데이터는 여전히 가치 있는 상태로 남아 있는 동안 가속기는 강도 높은 처리와 유휴 상태를 오갈 수 있다.
NVIDIA도 자체 agentic inference 자료에서 같은 압력을 설명한다. NVIDIA는 장시간 실행되는 에이전트의 인프라 문제로 KV 캐시 증가, 불규칙한 도구 대기, 낮은 GPU 활용률을 지목한다.
두 회사는 서로 다른 상업적 위치에서 이 문제에 접근한다. NVIDIA는 가속 컴퓨팅 플랫폼을 판매하고, SK hynix는 이러한 플랫폼에 공급되는 메모리 제품을 제공한다. 그럼에도 이들의 진단은 겹친다. 유용한 성능은 프로세서, 메모리, 스토리지, 네트워킹, 소프트웨어를 조율하는 데 달려 있다.
SK hynix는 전략적 주장도 제시하고 있다. 메모리가 일급 설계 요소가 된다면, 메모리 공급업체는 시스템 아키텍처에 대한 영향력을 얻게 된다. 이들의 역할은 더 높은 용량이나 대역폭을 갖춘 부품을 공급하는 데 그치지 않는다.
따라서 이 발표는 제품 출시라기보다 경쟁의 향방에 관한 선언에 가깝다. SK hynix는 구매자가 개별 프로세서 사양이 아니라 완전한 데이터 경로를 평가하기를 원한다.
이러한 변화가 이 글의 핵심 긴장을 만든다. AI 인프라는 연산 용량을 중심으로 구매되고 마케팅돼 왔지만, 추론 경제성은 점점 그 연산 자원을 지속적으로 공급할 수 있는지에 달려 있다.
추론은 메모리를 제한 자원으로 바꾼다
추론은 최적화 목표를 최대 규모의 계산을 완료하는 일에서, 수용 가능한 시스템 비용으로 응답성 있는 토큰을 제공하는 일로 바꾼다.
학습 작업은 상당한 전력과 연산을 소비하지만, 시작과 끝이 정해져 있다. 추론은 지속적인 서비스다. 각 사용자 프롬프트는 운영자가 계속 관리해야 하는 기한, 상태, 데이터 이동을 만들어 낸다.
챗봇도 언어 모델이 한 번에 한 토큰씩 출력을 생성하기 때문에 반복적인 메모리 접근이 필요하다. 추론 시스템은 최종 답변을 내놓기 전에 많은 내부 토큰을 생성할 수 있다. 에이전트는 여러 도구와 외부 데이터 소스에 걸쳐 이 과정을 반복할 수 있다.
컨텍스트 길이는 부담을 가중시킨다. 모델은 어텐션 레이어가 나중에 사용할 수 있는 정보를 보존해야 한다. 어텐션 레이어는 사용 가능한 컨텍스트 중 다음 연산에 어떤 부분이 중요한지를 결정한다.
KV 캐시는 이전 어텐션 계산의 반복을 피하지만, 그 대가로 압박이 메모리로 이동한다. 용량은 얼마나 많은 세션을 활성 상태로 유지할 수 있는지를 결정한다. 대역폭은 시스템이 해당 상태를 얼마나 빠르게 불러올 수 있는지를 결정한다.
고대역폭 메모리, 즉 HBM은 이 문제의 일부를 해결한다. HBM은 메모리 다이를 수직으로 적층하고 고대역폭 메모리를 가속기 가까이에 배치한다. 이 구성은 프로세서에서 더 멀리 떨어진 기존 메모리보다 훨씬 빠르게 데이터를 공급한다.
SK hynix는 주요 공급업체이므로 HBM을 강조할 분명한 이해관계가 있다. 그러나 회사는 HBM만으로 병목 현상이 해결된다고 주장하지는 않는다. 분석은 전체 경로에 스토리지, 네트워크, 메모리 컨트롤러, 인터커넥트가 포함돼야 한다고 말한다.
이 단서는 중요하다. 데이터가 더 느린 계층에 있거나 혼잡한 링크를 지나야 한다면, 고가의 가속기도 여전히 대기할 수 있다. 가속기 옆에 더 빠른 메모리를 추가하는 것은 실제로 해당 메모리를 사용하는 전송에만 개선 효과를 준다.
용량은 속도와 충돌할 수도 있다. 가장 빠른 메모리 계층은 모든 활성 세션에 제공하기에는 희소하고 비용이 많이 든다. 더 느린 DRAM과 스토리지는 더 큰 용량을 제공하지만, 계층 간에 캐시된 컨텍스트를 이동하면 지연이 발생할 수 있다.
따라서 운영 시스템에는 배치 정책이 필요하다. 자주 재사용되는 정보는 가속기 가까이에 남아 있어야 한다. 비활성 컨텍스트는 시스템이 모델이 다시 필요로 하기 전에 이를 불러올 수 있다면 다른 계층으로 이동할 수 있다.
NVIDIA의 캐시 관리 문서는 캐시 재사용과 라우팅을 핵심 최적화 목표로 설명한다. 요청은 이미 유용한 컨텍스트를 보유한 워커에 도달해야 불필요한 전송과 반복 연산을 줄일 수 있다.
이 때문에 서빙 소프트웨어도 아키텍처 논의의 일부가 된다. 하드웨어는 용량과 전송 경로를 제공하지만, 모델 상태가 어디에 존재하는지는 소프트웨어가 결정한다. 또한 해당 상태를 언제 이동할지, 다음 요청을 어떤 프로세서가 처리할지도 결정한다.
그 결과 운영 단위가 달라진다. 초당 요청 수는 여전히 유용하지만, 연속적인 모델 호출을 여러 번 수행하는 에이전트를 완전히 설명할 수는 없다. 운영자는 토큰, 활성 컨텍스트, 캐시 재사용, 지연 시간, 하드웨어 점유율도 이해해야 한다.
그 압박은 클라우드 제공업체와 기업 인프라 팀에 가해진다. 이들은 가속기 수라는 헤드라인 수치가 아니라 워크로드 동작을 기준으로 자원을 프로비저닝해야 한다. 균형이 맞지 않는 클러스터는 상당한 연산 용량을 보유하면서도 낮은 토큰 처리량을 제공할 수 있다.
개발자도 영향을 받는다. 모든 대화를 무기한 유지하는 애플리케이션은 메모리 수요를 부풀릴 수 있다. 대규모 프롬프트를 반복하거나 요청을 워커 간에 무작위로 이동시키는 에이전트 설계는 캐시 재사용을 무력화할 수 있다.
이것이 개발자가 칩 아키텍트가 되어야 한다는 뜻은 아니다. 애플리케이션 동작이 이제 인프라 효율성에 더 직접적으로 영향을 미친다는 의미다. 컨텍스트 관리, 요청 라우팅, 모델 선택은 애플리케이션 아래에서 이동하는 데이터의 양을 바꿀 수 있다.
엔지니어링 팀에는 애플리케이션 의사결정과 관찰된 인프라 동작을 연결하는 기록도 필요하다. 검색 가능한 엔지니어링 지식 베이스는 팀 전반에 걸쳐 벤치마크 가정, 배포 변경, 장애 조사 결과를 보존할 수 있다.
더 큰 결과는 경제성에 있다. 구매자는 초당 최대 연산 횟수만으로 추론 효율성을 추정할 수 없다. 컨텍스트가 늘어나고, 세션이 일시 중단되며, 요청이 메모리를 두고 경쟁할 때 시스템이 어떻게 동작하는지 물어야 한다.
이것이 지금 SK hynix의 AI 인프라 주장이 중요한 이유다. 추론은 아키텍처를 구현 세부 사항에서 제품의 비용과 응답성의 일부로 바꾼다.
진짜 경쟁은 아키텍처와 부품 속도 사이에 있다
주요 상대는 다른 메모리 공급업체가 아니라, 개별 부품이 빨라지면 AI 시스템도 자동으로 빨라진다는 믿음이다.
부품 개선은 여전히 중요하다. 더 빠른 가속기는 산술 연산을 더 빨리 완료하고, 더 높은 대역폭의 메모리는 이를 더 빠르게 공급하며, 더 나은 네트워크는 노드 간 정보를 이동시킨다. 문제는 구매자가 이러한 사양을 독립적이고 누적 가능한 것으로 취급할 때 발생한다.
시스템 성능은 중요한 경로 중 가장 느린 경로를 따른다. 모델 가중치를 기다리는 동안 산술 유닛이 사용되지 않는 프로세서는 가치를 창출하지 못한다. 연결부가 필요한 속도로 데이터를 제공하지 못한다면 추가 메모리 용량도 도움이 되지 않는다.
프로세서 중심 시스템은 점점 더 정교한 메커니즘으로 이를 보완하려 한다. 여러 캐시 계층은 자주 사용하는 정보를 연산 장치 가까이에 유지한다. 프리페처는 다음에 필요할 데이터를 예측한다. 병렬 스레드는 프로세서가 정지 상태에서 다른 작업을 수행하도록 돕는다.
이러한 방법은 여전히 유용하지만, AI 워크로드는 그 한계를 드러낸다. 모델 파라미터와 컨텍스트는 로컬 캐시를 초과할 수 있다. 접근 패턴은 프리필, 토큰 생성, 검색, 도구 실행, 멀티 에이전트 조정 과정에서 변화한다.
메모리 중심 컴퓨팅은 다른 질문에서 출발한다. 데이터를 중앙 프로세서에 얼마나 빨리 도달시킬 수 있는지를 묻는 대신, 아키텍트는 데이터가 이미 어디에 있는지를 묻는다. 이후 그 위치를 중심으로 연산과 전송 경로를 배치한다.
이 접근 방식이 모든 연산을 메모리 내부에서 수행해야 한다는 뜻은 아니다. 일부 데이터는 GPU 옆의 HBM에 있어야 한다. 다른 정보는 장치 간에 공유되는 풀드 메모리에 존재할 수 있다. 선택된 연산은 메모리 가까이에 배치된 가속기에서 실행될 수 있다.
올바른 구성은 워크로드에 따라 달라진다. 모델 아키텍처, 배치 크기, 컨텍스트 길이, 지연 시간 요구 사항, 동시 요청 수가 모두 균형을 바꾼다. 네트워크 토폴로지와 소프트웨어 스케줄링도 이를 다시 바꿀 수 있다.
이러한 가변성은 재구성 가능한 인프라가 주목받는 이유를 설명한다. 고정된 서버 구성은 프로세서와 메모리를 미리 정해진 비율로 묶는다. 이 비율 때문에 한 자원은 고갈되는 반면 다른 자원은 충분히 활용되지 않을 수 있다.
분리형 시스템은 자원을 풀로 분리한다. 이후 CPU, 가속기, 메모리, 스토리지, 네트워킹을 워크로드 요구에 맞춰 조합할 수 있다. 메모리 집약적인 서비스는 다른 모든 구성 요소를 중복하지 않고도 더 큰 풀에서 자원을 가져올 수 있다.
풀링에는 비용이 따른다. 원격 액세스는 대개 지연 시간을 늘리고 인터커넥트 대역폭을 소비한다. 공유 자원은 새로운 경합 지점이 될 수도 있다. 유연성으로 절감되는 비용이 통신 비용보다 클 때에만 이 아키텍처는 성공한다.
이것이 SK hynix의 주장에 담긴 핵심적인 전환점이다. 더 많은 데이터를 더 빠르게 이동시키는 것이 항상 최선의 해답은 아니다. 더 나은 설계는 데이터를 아예 이동하지 않도록 하는 설계일 수 있다.
이 원칙은 AI가 추론 중심으로 이동하면서 더욱 중요해졌다. 학습은 상당한 컴퓨팅 밀도를 갖춘 대규모 동기화 클러스터에 유리하다. 추론은 다양한 요청 형태와 더 엄격한 응답 시간 기대치를 제시한다.
같은 인프라가 짧은 프롬프트, 문서 분석, 코드 생성, 장시간 실행되는 에이전트를 모두 처리할 수 있다. 각 워크로드는 메모리 용량, 대역폭, 스토리지, 통신에 서로 다른 요구를 제기한다.
정적 클러스터는 하나의 프로필에는 최적화될 수 있지만 다른 프로필에서는 성능이 저조할 수 있다. 재구성 가능한 자원 배치는 더 나은 활용도를 약속하지만, 그만큼 유능한 오케스트레이션 소프트웨어도 필요하다. 지능형 스케줄링이 없는 하드웨어 유연성은 병목 지점을 옮겨 놓기만 할 수 있다.
NVIDIA의 자체 설계는 가속기 공급업체도 이 문제를 인식하고 있음을 보여준다. NVLink fabric은 전용 고대역폭 경로로 GPU를 연결해 일반적인 주변장치 인터페이스를 넘어 조정할 수 있도록 한다.
이는 SK hynix의 입장을 무효화하지 않는다. 오히려 프로세서 성능이 메모리 및 통신 아키텍처에 점점 더 의존하고 있음을 확인해 준다. 경쟁의 핵심은 누가 이 아키텍처를 통제하며, 그 구성 요소들이 얼마나 개방적으로 상호 운용될 수 있는지에 있다.
독점적인 스케일업 패브릭은 긴밀하게 통합된 성능을 제공한다. 개방형 인터커넥트 표준은 더 폭넓은 장치 선택권과 메모리 확장을 제공할 수 있다. 어느 접근법도 모든 워크로드에서 자동으로 승리하는 것은 아니다.
클라우드 공급업체는 두 방식을 모두 사용할 수 있다. 긴밀히 연결된 가속기는 통신 집약적인 모델 연산을 처리하고, 풀링된 메모리는 더 긴 컨텍스트 또는 덜 활성화된 데이터를 지원할 수 있다. 스토리지는 더 긴 검색 시간을 허용하는 정보를 위한 또 다른 용량 계층을 제공할 수 있다.
따라서 프로세서 중심과 메모리 중심이라는 명칭을 절대적인 범주로 해석해서는 안 된다. 현대 시스템은 둘 다 결합한다. 의미 있는 차이는 설계가 어떤 비용을 근본적인 제약으로 간주하느냐에 있다.
프로세서 중심 설계는 연산이 희소하다고 가정하고 데이터를 연산 쪽으로 이동시킨다. 메모리 중심 설계는 데이터 이동이 희소하다고 보고 데이터 주변에 더 많은 연산을 배치한다. 추론은 두 번째 가정을 강화하고 있다.
CXL, NVLink, 그리고 근접 메모리 처리는 작업을 분담한다
메모리 확장, GPU 통신, 로컬 처리는 서로 다른 기능을 수행하므로 단일 인터커넥트나 가속기만으로 데이터 문제를 해결할 수는 없다.
Compute Express Link, 즉 CXL은 프로세서, 가속기, 메모리 장치 간 캐시 일관성을 갖춘 연결을 제공한다. 캐시 일관성은 모든 업데이트를 수동으로 복사하지 않아도 구성 요소들이 공유 데이터에 대해 일관된 관점을 유지할 수 있게 한다.
CXL은 메모리 확장과 풀링을 지원할 수 있다. 시스템은 하나의 프로세서에 물리적으로 연결된 메모리를 넘어서는 용량을 제공할 수 있다. 플랫폼과 소프트웨어가 해당 구성을 지원한다면 여러 장치가 공유 자원에서 자원을 가져올 수도 있다.
이러한 유연성은 고립된 용량을 겨냥한다. 한 서버나 가속기는 메모리가 부족한 반면 다른 서버나 가속기에는 사용되지 않는 공간이 있을 수 있다. 풀링은 현재 워크로드에 따라 용량을 할당할 기회를 만든다.
CXL은 메모리와 로컬 처리를 결합한 장치도 가능하게 한다. 전체 데이터세트를 중앙 가속기 쪽으로 전송하는 대신, 근접 메모리 장치가 선택된 연산을 로컬에서 수행할 수 있다. 이후 더 작은 결과만 반환한다.
NVLink와 NVSwitch는 시스템의 다른 부분을 다룬다. NVLink는 NVIDIA 프로세서와 가속기 간에 고대역폭 연결을 제공한다. NVSwitch는 이러한 경로를 확장해 더 큰 GPU 그룹이 스위칭 패브릭을 통해 통신할 수 있도록 한다.
대형 모델은 종종 여러 가속기에 걸쳐 파라미터와 중간 값을 분할한다. 이 장치들은 활성화값, 부분 결과, 동기화 메시지를 교환해야 한다. 통신이 느리면 GPU를 더 추가해서 얻는 이점이 줄어들 수 있다.
따라서 CXL은 유연한 메모리 액세스와 확장에 중점을 두는 반면, NVLink는 긴밀하게 조정된 가속기 통신에 중점을 둔다. 동일한 역할을 수행하지 않으면서도 더 큰 공통 목표를 지원할 수 있다.
근접 메모리 가속은 설계를 한층 더 밀어붙인다. 연산이 메모리 장치 내부 또는 인근으로 이동해 시스템 전반을 오가는 데이터량을 줄인다. 이 접근 방식은 제한된 통신으로 연산을 로컬에서 수행할 수 있을 때 가장 효과적이다.
Tesseract는 초기 연구 사례를 제공한다. 설계자들은 3D 적층 메모리 근처에 처리 장치를 분산하고 그래프 데이터를 이들 장치 사이에 나눴다. 각 장치는 로컬 데이터를 처리하고 필요할 때만 메시지를 교환했다.
2015년 Tesseract 연구는 다섯 가지 그래프 워크로드에서 평균 10배의 성능 향상을 보고했다. 또한 평가된 기존 시스템과 비교해 평균 에너지가 87% 감소했다고 보고했다.
이 결과는 현대의 프로덕션 언어 모델 서비스가 아닌 그래프 처리에서 나온 것이다. 그럼에도 이 실험은 아키텍처 원칙을 입증했다. 처리 성능과 메모리 대역폭이 함께 증가하면 성능도 확장될 수 있다.
더 최근의 프로젝트는 언어 모델 추론에 유사한 아이디어를 적용한다. CXL-Enabled GPU-Free System의 약자인 CENT는 CXL 메모리 확장과 메모리 뱅크 근처에 배치된 처리 장치를 결합한다.
동료 심사를 거친 CENT 연구는 유사한 평균 전력에서 선택된 GPU 기준선 대비 2.3배 높은 처리량과 2.3배 낮은 에너지를 보고한다. 또한 달러당 토큰 수가 5.2배 더 많다고 보고한다.
이 수치는 신중하게 해석해야 한다. 이는 저자들이 모델링하고 평가한 아키텍처, 워크로드, 기준선, 가정을 설명한다. GPU 없는 추론이 주류 가속기 배포를 대체할 준비가 되었다는 점을 입증하지는 않는다.
그럼에도 CENT는 지배적인 설계를 검증대에 올린다. 한 번에 하나의 토큰을 생성하는 자기회귀 추론은 학습보다 산술 집약도가 낮은 경우가 많다. 산술 집약도는 이동된 데이터 단위당 얼마나 많은 연산이 수행되는지를 측정한다.
산술 집약도가 낮은 워크로드는 메모리 병목 상태가 될 수 있다. 메모리가 데이터를 충분히 빠르게 공급하지 못하면 연산 장치를 더 추가해도 이점은 크지 않다. 특수한 근접 메모리 설계는 이러한 불일치를 겨냥할 수 있다.
아키텍처의 핵심 질문은 새로운 조정 비용을 만들지 않고 얼마나 많은 작업을 이동할 수 있느냐이다. 어텐션, 모델 레이어, 분산 통신은 완벽하게 분할되지 않는다. 일부 연산은 여전히 여러 장치의 결과를 필요로 한다.
프로그래밍 지원도 또 다른 장애물이다. 개발자들은 이미 성숙한 GPU 프레임워크, 최적화된 커널, 배포 도구에 의존하고 있다. 새로운 근접 메모리 아키텍처는 이 소프트웨어와 통합되거나, 비용이 큰 마이그레이션을 정당화해야 한다.
관측 가능성도 더 어려워진다. 분산 시스템은 가속기, 메모리 컨트롤러, 스토리지 계층 전반으로 연산을 이동시킬 수 있다. 운영자는 그 전체 경로에서 시간과 에너지가 어디에 소비되는지 파악해야 한다.
보안 경계에도 주의가 필요하다. 공유 메모리 풀은 워크로드와 테넌트를 격리해야 한다. 지속적인 에이전트 컨텍스트에는 민감한 프롬프트, 검색된 문서, 자격 증명 또는 도구 결과가 포함될 수 있다.
이러한 우려가 설계를 무효화하는 것은 아니다. 이는 아키텍처가 벤치마크 속도 이상의 것을 결정하는 이유를 보여준다. 신뢰성, 격리, 프로그래밍 가능성, 스케줄링은 모두 프로덕션 성능의 일부다.
연구 결과는 프로덕션 증거가 아니다
메모리 중심 설계에는 신뢰할 만한 근거가 있지만, 가장 강력한 결과도 여전히 워크로드별 결과이며 배포 경제성을 보장할 수는 없다.
SK hynix의 글은 공개된 연구와 업계 전망을 결합한다. 연구는 데이터 이동이 에너지와 지연 시간을 지배할 수 있다는 주장을 뒷받침한다. 하지만 하나의 아키텍처가 표준이 될 것이라는 점을 입증하지는 않는다.
Tesseract는 그래프 워크로드에서 근접 메모리 처리를 시연했다. CENT는 언어 모델 추론을 위한 야심 찬 CXL 기반 설계를 평가했다. 둘 다 기술적 가능성을 확립하는 데 도움이 되지만, 프로덕션 서비스에는 연구 프로토타입이 완전히 재현할 수 없는 제약이 따른다.
실제 배포 환경은 변화하는 모델, 정밀도 형식, 컨텍스트 정책, 지연 시간 목표를 지원한다. 또한 장애, 소프트웨어 업그레이드, 시끄러운 이웃, 트래픽 급증도 처리한다. 모든 아키텍처는 이러한 조건에서 성능을 내야 한다.
비교는 선택된 기준선에 크게 의존할 수 있다. 배칭 또는 캐시 재사용이 약한 GPU 플랫폼은 비효율적으로 보일 수 있다. 고도로 최적화된 서빙 스택은 기반 하드웨어를 바꾸지 않고도 활용도를 개선할 수 있다.
모델 진화는 또 다른 불확실성을 만든다. KV 캐시 크기를 줄이는 기술은 메모리 압박을 완화할 수 있다. 값을 더 적은 비트로 표현하는 양자화는 모델과 캐시의 풋프린트를 줄일 수 있다. 개선된 어텐션 방식은 액세스 패턴을 바꿀 수 있다.
소프트웨어는 불필요한 이동도 피할 수 있다. 프리픽스 캐싱은 공유되는 프롬프트 구간을 재사용한다. 캐시 인지 라우팅은 관련 요청을 연관된 상태를 보유한 워커로 보낸다. 분리형 프리필과 디코딩은 서로 다른 단계를 특화된 자원 풀에 할당한다.
NVIDIA의 다계층 캐시 접근 방식은 GPU HBM, CPU 메모리, 로컬 NVMe 스토리지, 원격 스토리지에 걸쳐 KV 데이터를 배치한다. 이는 GPU 인프라를 중심으로 구축된 메모리 중심 대응책이다.
이는 경쟁 구도를 해석하는 데 중요하다. 메모리 중심 컴퓨팅이 반드시 GPU를 대체하는 것은 아니다. 데이터 관리에 쓰는 작업을 줄여 GPU의 실질적 활용도를 높일 수 있다.
근접 메모리 프로세서는 제조 및 표준화 문제에도 직면한다. 로직을 추가하면 면적, 열 특성, 수율, 제품 비용에 영향을 줄 수 있다. 클라우드 운영자가 광범위하게 배포하기 전에 새 장치에는 안정적인 인터페이스가 필요하다.
CXL은 유연성을 제공하지만, CXL 연결은 로컬 HBM과 동등하지 않다. 용량, 대역폭, 지연 시간은 서로 다른 위치를 차지한다. 워크로드 배치는 이러한 차이를 고려해야 한다.
분리는 통신을 늘리면서 자원 활용도를 개선할 수 있다. 너무 많은 장치를 지원하는 원격 풀은 혼잡해질 수 있다. 잘못 배치된 연산은 고정 서버에서보다 더 먼 거리를 이동할 수 있다.
따라서 SK hynix의 주장을 가장 강하게 해석한 형태는 문자 그대로 받아들일 경우 지나치게 광범위하다. 아키텍처가 구성 요소 성능을 대체하지는 않는다. 느린 프로세서, 약한 메모리, 제한된 네트워크는 각각 시스템을 제약할 수 있다.
더 방어 가능한 결론은 아키텍처가 구성 요소 성능 중 얼마나 많은 부분을 실제로 활용할 수 있는지를 결정한다는 것이다. 더 빠른 구성 요소는 여전히 가치가 있지만, 그 가치는 데이터 배치와 조정에 달려 있다.
상업적 인센티브도 해석에 반영해야 한다. 고객이 메모리를 전략적인 시스템 자원으로 취급할수록 SK hynix는 이익을 얻는다. 고객이 긴밀하게 통합된 가속 플랫폼과 독점적 패브릭을 채택할수록 NVIDIA는 이익을 얻는다.
그러한 유인은 어느 주장도 틀렸다는 뜻은 아니다. 오히려 독립적인 벤치마크의 중요성을 높인다. 구매자는 자신의 모델, 세션 길이, 요청 패턴, 신뢰성 요구사항을 반영하는 테스트를 필요로 한다.
비용 비교에는 하드웨어 구매 비용 이상이 포함돼야 한다. 전력, 냉각, 랙 공간, 활용률, 소프트웨어 개발, 운영, 마이그레이션이 모두 총비용에 영향을 미친다. 특화 설계는 에너지를 절감할 수 있지만 더 많은 엔지니어링 지원을 요구할 수 있다.
벤치마크는 응답 시간 분포의 후반부에 있는 느린 요청을 측정하는 테일 레이턴시도 보고해야 한다. 평균 처리량은 사용자가 직접 경험하는 지연을 가릴 수 있다.
지속형 에이전트는 추가적인 질문을 제기한다. 컨텍스트를 가까이 유지하면 응답성은 좋아지지만, 유휴 세션이 부족한 메모리를 점유할 수 있다. 공격적인 퇴거 정책은 용량을 절약하지만 에이전트가 재개될 때 비용이 큰 재로딩을 유발한다.
이러한 트레이드오프는 컴퓨팅의 다른 영역에서 캐싱과 유사하지만, 규모는 더 크다. 단일 세션도 방대한 컨텍스트와 중간 상태를 보존할 수 있다. 수천 개의 동시 에이전트는 배치 정책을 중대한 용량 결정으로 바꿀 수 있다.
회의적인 입장은 메모리 중심 컴퓨팅에 장점이 없다는 주장이 아니다. 아직 보편적인 구성 방식이 확립되지 않았다는 것이다. 워크로드는 지나치게 다양하고, 기술 스택도 계속 변화하고 있다.
SK hynix는 현재 데이터 센터를 대체할 완성된 해법이 아니라 하나의 방향을 제시했다. 다음 증거는 배포 가능한 제품, 상호운용 가능한 시스템, 재현 가능한 워크로드 수준 측정에서 나와야 한다.
메모리 중심 AI의 승패를 가를 세 가지 신호
새로운 시스템이 실제 추론 워크로드 전반에서 데이터 이동 감소를 측정 가능한 성과로 전환할 때에만 이 주장은 힘을 얻을 것이다.
첫 번째 신호는 풀링 및 계층화된 컨텍스트 메모리를 중심으로 한 제품 수준의 통합이다. 애플리케이션이 모든 전송을 직접 처리하도록 강요하지 않고 HBM, DRAM, 스토리지 전반에서 KV 캐시를 관리하는 시스템을 주목해야 한다.
핵심 측정치는 이론적 용량이 아니다. 더 많은 동시 세션을 지원하면서도 레이턴시를 유지하는지 여부다. 높은 캐시 적중률과 예측 가능한 테일 레이턴시는 아키텍처 우선 논지를 뒷받침할 것이다.
컨텍스트가 자주 늦게 도착한다면 이 주장은 약화된다. 추가 용량이 응답성을 희생하는 대가로 확보되는 셈이다. 운영자는 더 많은 로컬 메모리나 더 단순한 고정 구성 방식을 선호할 수 있다.
두 번째 신호는 CXL 메모리 풀링과 니어메모리 처리의 더 폭넓은 배포다. 발표만으로는 이 문제를 결론낼 수 없다. 구매자에게는 상호운용 가능한 하드웨어, 운영체제 지원, 오케스트레이션 도구, 애플리케이션 프레임워크가 필요하다.
성공적인 배포는 공유 용량이 인터커넥트를 과도하게 압박하지 않으면서 활용률을 개선한다는 점을 보여줘야 한다. 또한 혼합 워크로드에서의 격리, 장애 처리, 성능도 문서화해야 한다.
CXL이 제한적인 확장 역할에만 머문다면 메모리 중심 아키텍처는 계속 발전하겠지만, 재구성 가능한 비전은 더디게 진전될 것이다. 독점적인 스케일업 패브릭이 고성능 배포에 대한 통제권을 더 많이 유지할 수도 있다.
세 번째 신호는 완전한 시스템을 측정하는 독립적인 추론 벤치마킹이다. 테스트에는 긴 컨텍스트, 멀티턴 에이전트, 도구 대기, 캐시 퇴거, 동시 사용자가 포함돼야 한다.
최고 산술 처리량은 여전히 중요하겠지만, 토큰 레이턴시, 토큰당 에너지, 메모리 활용률, 네트워크 트래픽과 함께 제시돼야 한다. 구매자에게는 신중하게 선택한 하나의 모델뿐 아니라 변화하는 워크로드에서 나온 결과도 필요하다.
여러 모델 계열에 걸친 증거는 SK hynix의 AI 인프라 논지를 강화할 것이다. 하나의 아키텍처나 합성 트래픽에만 한정된 결과는 더 큰 불확실성을 남긴다.
독자는 공급업체 간 책임이 어떻게 이동하는지도 지켜봐야 한다. 메모리 제조업체는 더 많은 로직, 펌웨어, 레퍼런스 아키텍처를 제공할 수 있다. 가속기 기업은 스토리지와 컨텍스트 관리에 대한 통제 범위를 확대할 수 있다.
클라우드 제공업체는 두 접근법을 결합할 가능성이 높다. 이들은 가속기, 메모리 풀, 스토리지 전반에 걸쳐 독점적인 오케스트레이션 계층을 구축할 수 있다. 이들의 규모는 배치를 동적으로 최적화할 만큼 충분한 워크로드 데이터를 제공한다.
개발자와 기업 구매자에게 당장의 교훈은 실용적이다. 각 서빙 단계에서 모델 가중치와 컨텍스트가 어디에 있는지 물어야 한다. 얼마나 자주 이동하는지, 어떤 링크를 통과하는지, 혼잡 상황에서는 어떤 일이 일어나는지도 물어야 한다.
그다음 시스템이 그러한 경로를 측정하는지 확인해야 한다. GPU 활용률만으로는 캐시 전송에서 멈추는 서비스를 설명할 수 없다. 메모리 용량만으로는 풀이 데이터를 제때 제공하는지 알 수 없다.
AI 에이전트는 컨텍스트를 지속적인 인프라 상태로 전환하기 때문에 이러한 질문을 시급하게 만든다. 각 추론 루프는 그 상태를 확장할 수 있고, 모든 도구 호출은 예측 가능한 처리를 중단시킬 수 있다.
승리하는 아키텍처는 단순히 더 많은 컴퓨트 옆에 더 많은 메모리를 배치하지 않을 것이다. 대신 통신 오버헤드를 통제하면서 각 워크로드에 적합한 데이터 경로를 맞출 것이다.
그러한 결과를 위해서는 칩, 인터커넥트, 스토리지, 서빙 소프트웨어, 애플리케이션 설계 전반의 협력이 필요하다. 어떤 단일 사양도 그 결과로 나타나는 성능을 설명할 수는 없다.
따라서 다음 인프라 검토를 위한 질문은 구체적이다. 최신 투자가 유용한 데이터 이동을 줄였는가, 아니면 그저 또 하나의 빠른 구성 요소를 추가했을 뿐인가? 이 구분이 SK hynix의 메모리 중심 논지가 프로덕션 표준이 될지, 영향력 있는 설계 논지로 남을지를 결정할 것이다.



