top of page

SemiAnalysis 4-hi HBM 분석: 더 짧은 스택이 AI 추론에서 우위를 점할 수 있는 이유

9월 14일
13분 분량

SemiAnalysis는 4-hi HBM이 DRAM 다이 수를 3분의 1로 줄이면서도 전체 대역폭을 제공할 수 있다며, AI 메모리 업계의 고적층 경쟁에 의문을 제기했다.

이 주장이 중요한 이유는 가속기 제조사들이 수년간 더 높은 메모리 스택을 추가해 왔기 때문이다. 더 많은 층은 용량을 늘리고, 더 큰 모델을 지원하며, 고대역폭 메모리를 AI 컴퓨팅의 필수 요소로 자리 잡게 했다.

SemiAnalysis 4-hi HBM 분석은 이제 추론이 이러한 계산을 바꾼다고 설명한다. 랙 규모 시스템은 더 많은 총용량을 제공하고, 양자화와 캐시 오프로딩은 각 GPU가 보유해야 하는 메모리 양을 줄인다.

이 보고서는 모든 워크로드에 더 적은 메모리가 필요하다고 말하지는 않는다. 학습, 대규모 배치, 미래 모델은 여전히 더 높은 스택의 이점을 얻을 수 있다. 다만 더 날카로운 주장은 용량이 부족해지기 전에 대역폭이 토큰 생성을 제한하는 경우가 많은 인터랙티브 추론에 관한 것이다.

이는 두 가지 설계 우선순위 간의 직접적인 경쟁을 만든다. 하나는 가속기당 최대 메모리 용량을 우선시한다. 다른 하나는 제한된 DRAM 웨이퍼에서 최대 토큰 대역폭을 끌어내는 데 초점을 둔다.

Nvidia의 알려진 Rubin Ultra 메모리 감축은 즉각적인 신호를 제공한다. SemiAnalysis에 따르면 이 가속기는 표준 Rubin 및 Blackwell Ultra의 288GB에서 줄어든 192GB HBM을 탑재할 예정이다.

회사는 4-hi Rubin Ultra 구성에 대해 공개적으로 상세히 밝히지 않았다. 그러나 알려진 8-hi 스택으로의 전환은 계속해서 더 높아지는 HBM이 더 이상 자동적인 선택이 아님을 시사한다.

이 논리가 4-hi HBM4E까지 확장된다면, AI 인프라는 각 스택의 외부 대역폭을 희생하지 않고도 더 적은 DRAM 다이를 사용할 수 있다. 이는 메모리 비용을 낮추고 제한된 웨이퍼 공급량에서 더 많은 사용 가능한 HBM 패키지를 생산하게 할 수 있다.

Nvidia의 메모리 로드맵은 더 이상 한 방향으로만 움직이지 않는다

의미 있는 변화는 Nvidia가 갑자기 적은 메모리만 필요로 하게 된 것이 아니다. 추가 용량이 어떤 비용을 치르더라도 더 이상 가치 있어 보이지 않는다는 점이다.

Blackwell Ultra는 고용량 방향을 분명히 확립했다. Nvidia는 Blackwell Ultra GPU당 288GB의 HBM3E와 GB300 NVL72 랙 전체에서 20TB를 명시한다.

회사의 GB300 사양에는 총 GPU 메모리 대역폭이 초당 576TB에 이른다고도 적혀 있다. 이 수치는 Nvidia가 이전에 용량과 대역폭 모두를 강조한 이유를 보여준다.

SemiAnalysis는 이제 Rubin Ultra가 이 추세의 일부를 되돌릴 것이라고 보고한다. GPU당 예상되는 192GB는 Blackwell Ultra와 기존 Rubin 대비 3분의 1 감소한 수치다.

이 비교에는 다소 주의가 필요하다. Rubin Ultra의 아키텍처는 4개의 컴퓨트 다이에서 2개로 변경된 것으로 알려졌다. 따라서 이전의 예상 메모리 용량은 다른 시스템 설계에 해당한다.

이 변화를 보정한 뒤에도 SemiAnalysis는 메모리가 컴퓨트 다이당 기존 256GB에서 96GB로 감소한다고 추정한다. 이는 외관상 사양 조정이 아니라 상당한 아키텍처 재설정이다.

보고서는 공급을 한 가지 이유로 지목한다. Nvidia는 상당한 첨단 로직 및 패키징 용량을 확보한 것으로 알려졌지만, 가용 HBM 웨이퍼는 동등한 규모의 12-hi 스택을 지원할 수 없다.

12-hi 스택에는 베이스 다이 위에 12개의 코어 DRAM 다이가 포함된다. 8-hi 스택은 8개를 사용하므로, 동일한 가공 DRAM 공급량으로 더 많은 완성 스택을 지원할 수 있다.

이는 HBM이 비트당 기존 DRAM보다 더 많은 제조 용량을 소비하기 때문에 중요하다. TSV로 알려진 실리콘 관통 전극은 메모리 스택을 수직으로 관통해 신호와 전력을 전달한다.

이러한 TSV에는 추가 공정이 필요하다. HBM 다이에는 수직 연결을 위한 영역도 포함돼 있어, 유사한 공정으로 제조한 일반 메모리보다 비트 밀도가 낮아진다.

SemiAnalysis는 이전에 HBM이 범용 DRAM보다 비트당 약 3배 많은 웨이퍼 용량을 소비한다고 추정했다. 생산이 HBM4로 이동하면서 이 추정치는 약 4배에 이른다.

이 수치는 업계 표준이 아니라 분석가의 추정치다. 그러나 근본적인 제조 부담은 메모리 공급업체 전반에서 잘 알려져 있다.

SK hynix, Samsung, Micron은 여러 개의 양품 다이를 가공하고, 박형화하고, 연결하고, 테스트하고, 패키징해야 한다. 층이 하나 추가될 때마다 소재 사용량이 늘고 패키지는 추가적인 수율 위험에 노출된다.

더 높은 스택은 역사적으로 가속기에 해당 용량이 필요했기 때문에 이러한 부담을 정당화해 왔다. 모델 가중치, 활성화 값, 그래디언트, 옵티마이저 상태, 키-값 캐시는 서로 다른 워크로드에서 모두 메모리를 두고 경쟁한다.

새로운 결정은 일부 추론 시스템에서 용량이 임계점을 넘었음을 시사한다. 랙이 필요한 작업 세트를 보유하게 되면, 모든 GPU에 메모리를 추가하는 데서 얻는 가치는 줄어든다.

Nvidia는 SemiAnalysis가 제시한 정확한 Rubin Ultra 용량 구성을 공개적으로 확인하지 않았다. 따라서 이 주장은 확정된 제품 사양이 아니라 보고된 로드맵 변경으로 남아야 한다.

그럼에도 공급망 준비는 공개 출시 전에 방향을 드러낼 수 있다. SemiAnalysis는 업계가 12-hi와 16-hi 제품을 추진한 뒤 공급업체들이 8-hi 구성을 표준으로 준비하고 있다고 말한다.

이러한 알려진 변화는 4-hi HBM의 가능성을 연다. 8개 층으로 충분하다면, 설계자들은 4개 층이 일부 추론 배포를 더 경제적으로 지원할 수 있는지 물어야 한다.

최근의 용량 경쟁 당시에는 이 질문이 시대를 거스르는 것처럼 들렸을 것이다. 심각한 DRAM 제약 아래에서는 업계의 가장 실용적인 아키텍처 선택지 중 하나가 된다.

SemiAnalysis 4-hi HBM은 다이를 줄이면서도 대역폭을 유지한다

더 짧은 HBM 스택은 용량을 줄이지만, 패키지의 외부 대역폭을 자동으로 줄이지는 않는다.

HBM은 극단적인 신호 속도에만 의존하지 않고 매우 넓은 인터페이스를 통해 데이터를 전송한다. HBM4는 이 인터페이스를 스택당 2,048개 데이터 연결로 확장한다.

HBM4 표준은 2025년 4월 JEDEC이 발표했다. 이 표준은 새로운 세대의 AI 및 고성능 메모리를 위한 기반을 정의한다.

SemiAnalysis에 따르면 각 HBM4 DRAM 다이는 스택의 데이터 연결 가운데 최대 512개에 접근할 수 있다. 따라서 4개의 다이로 2,048개 연결을 모두 채울 수 있다.

다섯 번째에서 열두 번째 다이를 추가하면 용량은 증가한다. 하지만 외부 인터페이스는 2,048개 연결을 넘어 넓어지지 않는다.

더 높은 스택에서는 사용 가능한 핀이 더 많은 메모리 층에 분산된다. 스택은 가속기에 여전히 동일한 전체 인터페이스를 제공한다.

이것이 짧은 스택 논리의 핵심 메커니즘이다. 동일한 세대와 신호 속도를 사용한다면 4-hi, 8-hi, 12-hi 패키지는 비슷한 명목 대역폭을 제공할 수 있다.

반면 용량은 크게 차이 난다. SemiAnalysis는 32기가비트 HBM4E 코어 다이를 모델링해 4-hi는 16GB, 8-hi는 32GB, 12-hi는 48GB를 제시한다.

이는 일반적으로 구매할 수 있는 소매 제품이 아니라 모델링된 미래 구성이다. 패키지 인터페이스를 그대로 유지하면서 층 수가 용량을 어떻게 바꾸는지 보여준다.

경제적 차이는 공급업체가 소모하는 자원에서 비롯된다. DRAM 용량은 HBM 스택 비용의 상당 부분을 차지하는 반면, 추론 고객은 가속기에 데이터를 공급하는 대역폭을 중시하는 경우가 많다.

4-hi 구매자는 더 적은 기가바이트를 얻는다. 그러나 구매자는 컴퓨트 유닛을 계속 공급하는 데 필요한 데이터 경로는 여전히 확보할 수 있다.

이는 관련 효율성 지표를 바꾼다. 용량 중심 조달은 각 가속기 옆에 몇 기가바이트가 들어가는지를 묻는다. 대역폭 중심 조달은 해당 메모리 링크가 몇 개의 토큰을 지원할 수 있는지를 묻는다.

추론에서는 두 번째 질문이 더 중요할 수 있다. 자기회귀 디코딩은 출력을 순차적으로 생성하며, 각 단계에서 모델의 활성 가중치를 메모리에서 읽어야 한다.

이 과정은 이동하는 바이트당 비교적 적은 연산을 수행하는 경우가 많다. 따라서 디코딩은 메모리 대역폭 제한 상태가 되며, 원시 연산 성능보다 데이터 전달이 먼저 처리량을 제한한다.

더 높은 스택은 워크로드가 추가 용량을 사용할 때에만 도움이 된다. 그렇지 않으면 추가 다이는 가용 대역폭으로 충분히 자주 읽을 수 없는 정보를 담게 된다.

SemiAnalysis는 스택당 초당 3,328GB라는 예시적 HBM4E 대역폭을 제시한다. 이 수치는 초당 13기가비트로 동작하는 2,048개 핀을 기준으로 계산된다.

초당 100개의 생성 토큰에서는 토큰당 33.28GB의 이론적 대역폭에 해당한다. 모든 토큰이 한 번씩 읽어야 한다면 유용한 작업 세트는 이 예산을 초과할 수 없다.

그렇다면 48GB 스택은 토큰당 이론적 대역폭으로 스캔할 수 있는 양보다 더 많은 데이터를 담게 된다. 해당 속도의 특정 워크로드에서는 일부 용량을 활용할 수 없게 된다.

실제 시스템은 명목 대역폭의 모든 단위를 지속적으로 유지하지 못한다. 프로토콜 오버헤드, 접근 패턴, 통신, 소프트웨어 동작은 유효 처리량을 낮춘다.

이러한 한계는 짧은 스택의 논리를 강화할 수 있다. 사용 가능한 대역폭이 낮을수록 워크로드는 설치된 전체 용량을 활용하기 전에 대역폭 한계에 도달한다.

이 메커니즘으로 설명되는 4-hi HBM은 단순히 더 저렴한 메모리가 아니다. 외부 대역폭과 최대 수직 밀도를 분리하는 구성이다.

이 구분은 제조 생산량에도 영향을 미친다. 4층 스택에 사용된 웨이퍼는 이론적으로 12층 스택에 사용된 웨이퍼보다 3배 많은 패키지를 지원할 수 있다.

실제 증가 폭은 수율, 베이스 다이 가용성, 테스트, 패키징 처리량에 따라 달라진다. 더 짧은 스택은 추가 층과 관련된 누적 조립 손실의 일부도 피할 수 있다.

SemiAnalysis는 결과적으로 HBM 웨이퍼당 대역폭이 와트당 토큰만큼 중요하다고 주장한다. 두 지표 모두 빠르게 확대할 수 없는 자원에 대비한 유용한 AI 출력량을 측정한다.

추론이 최대 용량보다 대역폭을 더 중시하는 이유

인터랙티브 추론은 프로세서에 빠르게 데이터를 공급할 수 있는 메모리를 보상하며, 사용되지 않는 용량은 토큰 처리량에 거의 기여하지 않는다.

학습과 추론은 HBM에 서로 다른 요구를 제시한다. 학습은 정방향 및 역방향 패스에서 대규모 배치를 처리하면서 가중치, 활성화 값, 그래디언트, 옵티마이저 데이터를 저장한다.

이 워크로드는 막대한 용량을 소모할 수 있다. 또한 충분한 연산을 수행하기 때문에 많은 작업에서 컴퓨트 제한 상태가 될 수 있다.

추론 디코드는 다르다. 시스템은 토큰을 하나씩 생성하면서 활성 가중치와 사용자의 키-값 캐시, 즉 KV 캐시를 반복적으로 읽는다.

KV 캐시는 이전 토큰의 어텐션 정보를 저장한다. 이를 통해 모델은 다음 토큰을 생성할 때마다 전체 대화를 다시 계산하지 않아도 된다.

더 많은 사용자와 더 긴 컨텍스트는 이 캐시를 키운다. 그러나 시스템이 허용 가능한 지연 시간 목표 안에서 해당 사용자를 처리할 수 있을 때에만 더 큰 용량이 가치 있다.

배치 처리는 상황을 복잡하게 만든다. 여러 요청을 함께 처리하면 서버는 하나의 모델 가중치 읽기를 여러 사용자에게 분산할 수 있다.

더 큰 배치는 총처리량을 개선하지만 더 많은 KV 캐시 용량도 요구한다. 이 지점에서 8-hi 또는 12-hi 스택이 다시 우위를 얻을 수 있다.

대신 상호작용성이 희생된다. 제공업체는 더 큰 배치를 구성하기 위해 더 오래 기다리거나, 더 작은 배치로 토큰을 빠르게 반환할 수 있다.

SemiAnalysis는 미래의 Rubin Ultra NVL576 구성에서 Kimi K3를 사용해 이 관계를 모델링한다. 필요한 사용자당 속도가 높아질수록 더 높은 스택이 제공하는 처리량 증가가 감소한다는 결과를 제시한다.

사용자당 모델링된 초당 213토큰에서는 보고서가 4-hi를 넘는 처리량 이점을 찾지 못했다. 추가 메모리 용량이 유용해지기 전에 대역폭 한계가 먼저 도달한다.

곡선의 다른 지점에서는 8-hi가 최대 처리량을 8% 높인다. 12-hi 구성은 4-hi 대비 10% 높인다.

이러한 개선은 모델 내부에서 실제로 나타난다. 문제는 추가 메모리와 시스템 비용을 상쇄할 수 있느냐다.

SemiAnalysis는 자사가 모델링한 8-hi Rubin Ultra 시스템의 비용이 4-hi 기준 구성보다 12.1% 높다고 추정한다. 12-hi 구성은 26.3%를 추가한다.

이는 미래 부품과 가정된 메모리 가격을 바탕으로 한 분석가 추정치다. 벤더 견적이나 실제 배포된 Rubin Ultra 시스템에서 측정한 소유 비용이 아니다.

이러한 가정 아래 처리량은 시스템 비용보다 더 느리게 증가한다. 그 결과 두 고적층 구성 모두 토큰당 비용이 더 높다.

이는 SemiAnalysis의 4-hi HBM 사례에서 가장 강력한 주장이다. 더 짧은 적층은 하드웨어 비용만 줄이는 것이 아니라, 지출 단위당 모델링된 출력도 개선한다.

랙 규모 컴퓨팅은 이 주장의 설득력을 높인다. 이전 서버는 GPU 8개를 연결했기 때문에 각 장치의 메모리가 전체 서빙 시스템을 크게 제약했다.

H100 HGX 시스템은 총 640GB의 HBM을 제공했다. 시스템이 상당한 KV 캐시를 저장하기도 전에 대규모 모델 가중치가 그 용량 대부분을 차지할 수 있었다.

H200은 GPU당 메모리를 늘려 이 부담을 완화했다. 이 단계에서 장치당 용량 증가는 즉각적인 운영 가치를 지녔다.

GB300 NVL72는 규모를 바꾼다. Nvidia는 NVLink로 Blackwell Ultra GPU 72개를 연결해 훨씬 더 큰 공유 통신 도메인을 만든다.

이 랙은 약 20TB의 GPU 메모리를 탑재한다. 총 용량은 GPU 8개로 구성된 Hopper 서버보다 훨씬 크다.

SemiAnalysis는 이러한 증가를 2조8,000억 파라미터 규모의 mixture-of-experts 모델인 Kimi K3와 비교한다. 이런 모델은 각 토큰마다 전문가 중 일부만 활성화한다.

보고서는 양자화된 Kimi K3 복제본이 1,561GB를 차지한다고 추정한다. 이는 약 21TB 규모의 GB300 NVL72 구성에서 8% 미만을 소비한다.

양자화는 더 적은 비트로 수치를 표현해 가중치 저장 공간과 메모리 트래픽을 줄인다. 일부 수치 정밀도를 대가로 하드웨어 요구 사항을 크게 낮춘다.

대규모 NVLink 도메인은 더 많은 GPU에 전문가를 분산하기도 한다. 이 구성은 통신 요구량을 늘리지만, 각 장치가 보유해야 하는 모델 가중치 수를 줄인다.

보도에 따르면 Rubin Ultra는 도메인을 NVL72에서 NVL576으로 확장한다. 연결 GPU 수가 8배 늘어나면 가속기당 HBM이 3분의 1 줄어드는 효과를 상쇄할 수 있다.

따라서 용량 문제는 개별 GPU의 문제가 아니라 랙 수준의 할당 문제로 옮겨간다. 배포 환경은 더 얇은 로컬 메모리 스택을 사용하면서도 대규모 모델을 유지할 수 있다.

이것이 메모리 제약을 없애지는 않는다. 다만 설계자가 이를 해결하는 위치와 먼저 부족해지는 자원이 무엇인지 바꾼다.

캐시 오프로딩은 도움이 되지만, 4-hi HBM이 공짜는 아니다

짧은 적층 전략은 소프트웨어, 보조 메모리, 워크로드 특성이 줄어든 HBM 용량이 병목이 되는 것을 막을 수 있을 때에만 작동한다.

SemiAnalysis는 Kimi K3와 GB300 GPU 16개를 사용한 InferenceX 워크로드로 이 가정의 일부를 테스트했다. GPU 8개는 프리필을 처리하고, 나머지 8개는 디코드를 처리했다.

프리필은 토큰 생성이 시작되기 전에 프롬프트를 처리한다. 이를 디코드와 분리하면 운영자는 각 단계를 서로 다른 컴퓨팅 및 메모리 특성에 맞춰 조정할 수 있다.

실험은 허용 HBM 활용률을 92%에서 85%로 낮췄다. 이는 8-hi와 4-hi 스택 사이의 용량 감소폭보다 훨씬 작다.

그러나 이 제한은 사용 가능한 KV 캐시 공간을 상당히 줄였다. 보고서에 따르면 총 서빙 KV 용량은 GPU당 53GB에서 34GB로 감소했다.

분리형 쌍에서는 사용 가능한 예산이 44GB에서 24GB로 떨어졌다. 이는 각각 36%와 44% 감소한 수치다.

대부분의 테스트된 동시성 수준에서 처리량은 비슷하게 유지됐다. 제한된 구성은 비활성 KV 캐시 데이터를 일반 서버 DRAM으로 옮겼다.

이 과정을 KV 캐시 오프로딩이라고 한다. 자주 접근하는 정보는 HBM에 유지하면서, 덜 뜨거운 대화 상태는 더 느리지만 더 큰 메모리로 옮긴다.

에이전틱 워크로드는 이 접근 방식에 적합할 수 있다. 도구가 실행되거나 CPU가 코드를 실행하거나 외부 서비스가 정보를 반환하는 동안 자주 멈춘다.

이러한 대기 시간 동안 GPU는 모든 대화의 캐시를 즉시 필요로 하지 않는다. 덜 뜨거운 데이터를 옮기면 활성 요청에 사용할 값비싼 HBM을 확보할 수 있다.

제한된 테스트에서는 명확한 한계가 나타났다. 동시성이 70을 넘어서자 처리량은 고메모리 구성 대비 거의 30% 하락했다.

GPU KV 점유율이 100%에 도달했다. 이후 선점, 반복 전송, 대기열 처리가 유효 작업량을 줄였다.

제약된 실행에서는 DRAM 기반 KV 캐시의 읽기 횟수도 10배 이상 많았다. 오프로딩은 용량 부담을 완화했지만 더 느린 계층을 통한 트래픽을 늘렸다.

이 결과는 지지와 경고의 의미를 동시에 지닌다. 소프트웨어가 의미 있는 메모리 감소 이후에도 성능을 보존할 수 있음을 보여주지만, 이는 워크로드 의존적 임계값 아래에서만 가능하다.

동시에 긴 컨텍스트를 사용하는 사용자가 많은 프로덕션 서비스는 이 임계값을 넘을 수 있다. 그런 경우 더 높은 HBM 스택은 더 큰 배치와 더 높은 총처리량을 지원할 수 있다.

네트워크 용량도 중요하다. 수백 개 가속기에 모델 전문가와 캐시를 분산하면 집약적인 올투올 통신이 발생한다.

시스템은 메모리 용량 병목에서 벗어나 네트워크 병목으로 전환될 수 있다. 이런 결과 역시 추가 HBM을 활용하지 못하게 하지만, 전반적인 성능 효율을 보장하지는 않는다.

보조 DRAM도 또 다른 제약이다. AI 시스템이 CPU 측 용량을 늘리면서 서버 메모리 역시 자체적인 공급 압박을 겪고 있다.

오프로딩은 전력도 소비하고 운영 복잡성도 추가한다. 소프트웨어는 무엇을 핫 상태로 유지할지, 무엇을 옮길지, 데이터를 언제 되돌려야 할지를 결정해야 한다.

잘못된 결정은 용량 절감을 지연 시간 급증으로 바꿀 수 있다. 이 아키텍처에는 신중한 스케줄링, 캐시 관리, 워크로드 격리가 필요하다.

향후 모델 성장은 더 큰 불확실성을 제시한다. SemiAnalysis는 자사 분석이 현재 워크로드를 향후 출시될 것으로 예상되는 하드웨어에 적용한다는 점을 인정한다.

AI 서버는 종종 5년 이상 배포 상태로 유지된다. 이 기간 동안 모델, 컨텍스트, 사용자 동시성, 추론 워크로드는 크게 달라질 수 있다.

보고서는 Kimi K3보다 3배 큰 모델과 사용자당 캐시 요구량이 3배인 상황을 스트레스 테스트한다. 이 가정에서는 더 높은 스택이 더 유용해진다.

8-hi 구성은 4-hi보다 총 토큰을 36% 더 제공한다. 12-hi 버전은 47% 더 제공하지만, 두 구성 모두 사용자당 속도는 더 낮게 작동한다.

추정 비용을 포함하면 사용자당 초당 180토큰 미만에서 8-hi가 유리해진다. 12-hi 시스템은 여전히 모델링된 비용 증가를 상쇄하지 못한다.

이 결과는 4-hi HBM이 보편적 처방이 될 수 없는 이유를 보여준다. 선호되는 스택 높이는 모델 크기, 지연 시간 목표, 배칭, 시스템 수명에 따라 달라진다.

훈련 시스템은 공격적인 용량 축소에 특히 부적합하다. 활성값, 그래디언트, 옵티마이저 상태가 사용 가능한 메모리를 모두 사용할 수 있기 때문이다.

여러 독립 모델을 제공하는 추론 시스템도 용량이 필요하다. 운영자는 하나의 최적화된 워크로드에서 가장 낮은 비용보다 유연성을 더 중시할 수 있다.

하드웨어 구매자는 선택권 문제에 직면한다. 4-hi 가속기는 현재 서비스에는 효율적일 수 있지만, 워크로드가 바뀐 뒤에는 제약이 될 수 있다.

연구자들은 설치된 하드웨어에 맞춰 모델을 조정할 수 있다. 반복 계산, 양자화, 희소 전문가, 더 작은 캐시는 저장된 파라미터에 대한 의존도를 낮출 수 있다.

그러나 그러한 적응이 보장되는 것은 아니다. 모델 품질 개선은 다시 더 많은 파라미터 수나 메모리 집약적 아키텍처에서 비롯될 수 있다.

따라서 가장 적절한 해석은 더 제한적이다. 4층 HBM은 신중하게 특성화된 추론에 강력한 구성 옵션이지만, 더 높은 메모리를 자동으로 대체하는 수단은 아니다.

더 적은 레이어는 메모리 공급업체와 시스템 구축업체에 압박을 가한다

구매자가 기가바이트보다 대역폭을 최적화한다면, 경제적 압박은 DRAM 생산에서 베이스 다이, 패키징, 네트워킹, 완전한 시스템 통합으로 이동한다.

SK hynix, Samsung, Micron은 더 고밀도이면서 높은 HBM을 개발하는 데 수년을 투자해 왔다. 이들의 로드맵은 용량, 신호 전송 속도, 패키징 수율, 열 제어를 강조한다.

SK hynix는 2025년에 12층 HBM4 샘플 공급을 시작했다. 해당 HBM4 발표는 초당 2TB 이상의 대역폭을 제공하는 36GB 패키지를 설명했다.

이 제품 방향은 훈련과 용량 집약적 추론에 여전히 유용하다. 4-hi로의 의미 있는 전환은 매우 다른 구매 우선순위를 더하게 된다.

고객은 더 적은 코어 다이로 전체 인터페이스 대역폭을 요구할 수 있다. 공급업체는 더 많은 패키지를 출하하지만 각각의 패키지 안에 들어가는 DRAM 비트 수는 줄어든다.

얼핏 보면 이는 HBM 매출에 부정적으로 보인다. 벤더들은 가속기 세대마다 더 많은 특수 DRAM 콘텐츠를 판매하며 혜택을 얻어 왔다.

SemiAnalysis는 결과가 더 균형적일 수 있다고 주장한다. 더 짧은 스택은 조립 수율을 높이고 웨이퍼당 판매 가능한 패키지 생산량을 늘릴 수 있다.

공급업체는 HBM을 주로 기가바이트 제품으로 취급하는 대신 대역폭 가치에 비용을 청구할 수도 있다. 고객이 이 모델을 받아들일지는 여전히 불확실하다.

공급 측 이점은 더 분명하다. 이론적으로 12-hi에서 4-hi로 전환하면 고정된 DRAM 양에서 확보할 수 있는 스택 규모 다이 그룹 수가 3배가 된다.

더 짧은 스택이 패키징 수율을 높인다면 실제 증가는 단순 비율을 넘을 수 있다. 다른 부품이 제약을 받으면 이 비율보다 낮아진다.

모든 HBM 패키지에는 여전히 베이스 다이, 테스트, 적층, 가속기 옆 부착 공정이 필요하다. 패키지 생산량이 늘어나면 이 모든 단계의 수요도 증가한다.

HBM4는 더 많은 로직을 포함하고 첨단 파운드리 공정을 사용할 수 있기 때문에 베이스 다이의 중요성을 높인다. DRAM 절감이 동등한 파운드리 용량을 만들어내지는 않는다.

더 많은 메모리 패키지는 더 많은 가속기 패키지도 필요로 한다. 이러한 패키지에는 인터포저, 유기 기판, 전력 공급, 냉각, 고밀도 조립이 요구된다.

따라서 병목은 사라지기보다 이동할 수 있다. 로직 웨이퍼, 베이스 다이, 기판, 회로 기판, 시스템 통합 모두 더 높은 수요에 직면하게 된다.

대규모 스케일업 도메인은 또 다른 제약을 심화한다. 더 많은 가속기는 총 메모리가 실용적인 공유 자원처럼 작동하기 전에 광범위한 스위칭과 네트워킹을 필요로 한다.

Nvidia의 GB300 NVL72는 NVSwitch 트레이 9개를 사용해 GPU 72개를 연결한다. 5세대 NVLink 패브릭은 총 초당 130TB의 대역폭을 제공한다.

향후 NVL576 시스템은 이 규모를 크게 확장해야 한다. 이들의 경제성은 네트워크가 분산된 전문가와 캐시 이동을 지원할 만큼 충분히 빠르게 유지되는지에 달려 있다.

전력은 마지막 경계로 남는다. 대역폭이 풍부한 HBM 패키지 수를 두 배로 늘리는 것은 운영자가 그에 연결된 가속기를 배포할 수 있을 때만 도움이 된다.

4-hi 전략은 새로운 전력 용량을 만들지 않고도 DRAM 공급을 늘릴 수 있다. 데이터센터 건설, 냉각, 전력망 접근성은 여전히 사용 가능한 컴퓨팅 규모를 결정한다.

이러한 압박은 HBM 웨이퍼당 토큰 수가 유용한 지표이지만 완전한 지표는 아닌 이유를 설명한다. 운영자는 토큰당 와트, 랙, 네트워크 포트, 자본 예산을 함께 최적화해야 한다.

이 변화는 기존 메모리 시장에도 영향을 미친다. HBM 생산은 서버, PC, 모바일 DRAM과 제조 자원을 두고 경쟁한다.

HBM 코어 다이를 더 적게 사용하면 일부 웨이퍼 용량을 해당 제품에 돌려줄 수 있다. 에이전틱 AI 배포와 함께 CPU 측 메모리가 증가하는 상황에서 이러한 완화는 중요하다.

그러나 이점은 실제 도입에 달려 있다. 훨씬 많은 가속기 출하를 가능하게 하는 4-hi 설계는 더 큰 총 출하량을 통해 일부 절감분을 소진할 수 있다.

메모리 공급업체 역시 비트 수요가 약화된다면 빠른 전환에 저항할 수 있다. 그들의 대응은 제품 공급 가능성, 인증 일정, 생산 용량 배분을 통해 나타날 것이다.

따라서 핵심 경쟁은 Nvidia와 특정 메모리 공급업체 간의 대결이 아니다. 대역폭 중심의 추론 설계와 용량 중심의 HBM 경제성 간의 경쟁이다.

이 경쟁 구도는 업계에 미치는 영향을 명확히 보여준다. 대역폭이 수익을 창출하고 설치된 기가바이트 수가 그렇지 않을 때는 낮은 적층이 승리한다.

고객이 추가 용량을 더 큰 배치, 더 많은 모델 또는 더 긴 하드웨어 유연성으로 전환할 수 있을 때는 높은 적층이 승리한다.

4-hi HBM의 실제 승리를 보여줄 세 가지 신호

낮은 적층 가설이 신뢰를 얻으려면 제품 로드맵, 생산 가능성, 측정된 추론 결과가 하나로 수렴해야 한다.

첫 번째 신호는 Nvidia의 최종 Rubin Ultra 구성이다. 공개 문서는 메모리 용량, 적층 높이, 대역폭, NVL576 시스템 아키텍처를 확인해야 한다.

8-hi HBM을 사용한 192GB 구성의 확정은 방향성 논거를 뒷받침할 것이다. 12-hi로의 복귀는 용량 요구 사항이 전반적으로 완화됐다는 주장을 약화시킬 것이다.

상용 4-hi Rubin 제품은 훨씬 강력한 증거가 될 것이다. 그때까지 SemiAnalysis의 4-hi HBM 제안은 미래 ASIC과 가속기에 관한 정보에 기반한 전망으로 남는다.

두 번째 신호는 고속 4-hi HBM4 또는 HBM4E에 대한 공급업체 인증이다. 공급업체는 가속기 설계자가 요구하는 신호 전송 속도에서 해당 패키지를 제공해야 한다.

명목 인터페이스 폭만으로는 충분하지 않다. 제품에는 완성 시스템에서 허용 가능한 수율, 열 특성, 신뢰성 및 지속 성능이 필요하다.

SK hynix, Samsung 또는 Micron이 공개 로드맵에 4-hi 구성을 추가하는지 지켜봐야 한다. 고객 샘플링은 낮은 적층이 내부 아키텍처 연구 단계를 넘어섰음을 보여줄 것이다.

가격 모델도 주목해야 한다. 4-hi 비용이 주로 더 낮은 용량에 비례한다면, 대역폭 경제성은 매력적이게 된다.

공급업체가 대부분의 가치를 베이스 다이와 인터페이스에 반영해 가격을 책정한다면 예상 절감 폭은 줄어들 수 있다. 패키지 부족 역시 더 적은 DRAM 탑재량에도 높은 프리미엄을 유지시킬 수 있다.

세 번째 신호는 다양한 워크로드 전반의 독립적인 추론 테스트다. 벤치마크에는 대화형 어시스턴트, 에이전틱 서비스, 긴 컨텍스트 요청, 대규모 배치 배포가 포함돼야 한다.

평균 토큰 처리량만으로는 충분하지 않다. 테스트에는 사용자별 속도, 큐잉 동작, 캐시 적중률, 오프로드 트래픽, 테일 레이턴시가 필요하다.

결과는 크기와 아키텍처가 다른 모델도 비교해야 한다. Kimi K3에 최적화된 구성은 모든 미래 프런티어 모델을 위한 최선의 선택임을 입증할 수 없다.

결정적 증거는 현실적인 서비스 수준 목표 아래에서 안정적인 토큰당 비용 우위를 보이는 것이다. 이 우위는 높은 동시성과 변화하는 워크로드 구성에서도 유지돼야 한다.

개발자가 관심을 가져야 하는 이유는 하드웨어 제약이 모델 설계를 좌우하기 때문이다. 가용 메모리는 양자화, 전문가 배치, 컨텍스트 처리 및 캐시 정책에 영향을 미친다.

엔터프라이즈 구매자가 관심을 가져야 하는 이유는 헤드라인 용량이 오해를 불러일으킬 수 있기 때문이다. 대역폭, 네트워킹 또는 지연 시간이 한계를 정하는 경우 더 많은 HBM이 더 유용한 추론을 보장하지는 않는다.

인프라 팀은 랙 수준에서 작업 세트를 평가해야 한다. 단일 메모리 프로필을 선택하기 전에 학습, 프리필, 디코드, 에이전틱 워크로드를 구분해야 한다.

또한 운영 여유분을 확보해야 한다. 수요가 더 큰 배치나 더 많은 동시 모델 쪽으로 이동하면, 지나치게 좁게 최적화된 4-hi 시스템은 장점을 잃을 수 있다.

더 넓은 교훈은 더 적은 메모리가 항상 이긴다는 것이 아니다. 메모리는 워크로드가 실제로 소비하는 자원을 기준으로 구매해야 한다는 점이다.

대화형 추론에서 그 자원은 흔히 대역폭이다. 4층 HBM은 더 적은 수의 희소한 DRAM 다이를 사용하면서도 전체 외부 데이터 경로를 유지할 수 있다.

이 점은 SemiAnalysis의 4-hi HBM 분석을 업계의 최고 적층 가정에 대한 진지한 도전으로 만든다. 다음 제품 공개를 통해 하드웨어 팀들이 이에 동의하는지 확인할 수 있을 것이다.

미래 가속기 플릿을 확정하기 전에 세 가지 질문을 던져야 한다. 작업 세트가 랙 규모에서 적합한가, 콜드 캐시 데이터를 안전하게 이동할 수 있는가, 추가 용량이 유용한 처리량을 높이는가?

답이 대역폭을 가리킨다면, 낮은 적층의 왕은 로드맵에 포함될 자격이 있다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page