top of page

AMD Helios, Nvidia 도전을 랙 스케일 경쟁으로 전환하다

AMD는 역대 최대 규모의 Advancing AI 행사에서 Helios의 양산 돌입을 발표하며, Nvidia를 향한 도전의 무대를 개별 가속기에서 완성형 AI 랙으로 옮겼다. 이 AMD ServeTheHome 보도는 7월 23일 기조연설에서 무엇이 달라졌는지, 어떤 주장이 아직 검증되지 않았는지, 그리고 이제는 왜 슬라이드보다 출하 일정이 더 중요한지를 살펴본다.

Helios는 하나의 랙 스케일 설계 안에 72개의 Instinct MI455X 가속기, EPYC Venice 프로세서, Pensando 네트워킹, AMD의 ROCm 소프트웨어를 결합한다. AMD는 3분기 말 무렵 출하를 시작할 것이라고 밝혔다. OpenAI, Microsoft, Anthropic, Cerebras의 고객 약정은 AMD가 이 일정을 신뢰할 만하게 만들기 위해 필요했던 근거를 제공했다.

기조연설은 AMD 주장의 더 어려운 부분도 드러냈다. Nvidia는 GPU 사양만으로 AI 인프라를 주도하는 것이 아니다. 그 우위는 네트워킹, 소프트웨어, 배포 경험, 개발자 지원, 연례 시스템 출시 전반에 걸쳐 있다. 따라서 AMD는 개방형 대안이 제때 제공되고 데이터센터 규모에서 안정적으로 작동할 수 있음을 입증해야 한다.

AMD ServeTheHome 보도, Helios의 양산 전환을 보여주다

기조연설에서 가장 중요한 변화는 단순했다. Helios가 미래 아키텍처에서 AMD가 완전 양산 중이라고 밝힌 제품으로 전환됐다는 점이다.

AMD는 7월 22일과 23일 샌프란시스코 Moscone Center에서 Advancing AI 2026을 개최했다. Lisa Su CEO는 둘째 날 오전 기조연설을 진행했다. ServeTheHome은 기술 세션, 제품 전시, 추가 좌석까지 갖춘 확장된 행사를 Nvidia의 GTC에 가장 가까운 AMD의 대응 행사로 설명했다.

keynote live blog는 사전 공개에서 정식 출시로 이어지는 전환을 담았다. AMD는 행사 이전에도 Helios를 논의했지만, 양산 상태와 고객 배포 시점은 여전히 확정되지 않은 상태였다. Su는 제조가 시작됐으며 3분기 말에 출하를 시작할 것이라고 말했다.

이 시점이 중요한 이유는 랙 스케일 시스템이 단순한 프로세서 집합이 아니기 때문이다. 가속기, 호스트 CPU, 네트워킹, 메모리, 냉각, 전력 공급, 소프트웨어를 하나의 배포 가능한 장비로 통합한다. 고객은 칩 하나의 고립된 최대 성능이 아니라 완성된 랙의 동작을 평가한다.

각 Helios 랙에는 대규모 AI 워크로드에 데이터를 공급하도록 설계된 고대역폭 메모리인 HBM4를 31테라바이트 탑재한 72개의 MI455X 가속기가 들어간다. AMD는 총 메모리 대역폭이 초당 1.4페타바이트에 이른다고 설명했다. 이 랙에는 EPYC Venice 프로세서와 Pensando Vulcano 네트워크 인터페이스 컨트롤러도 포함된다.

AMD에 따르면 MI455X는 2나노미터급 공정으로 제조된 컴퓨트 칩렛을 사용한다. 다른 구성 요소는 3나노미터급 공정으로 생산된다. 각 가속기는 432기가바이트의 HBM4를 탑재해 대형 모델, 긴 컨텍스트, 추론 워크로드에 상당한 메모리 용량을 제공한다.

AMD는 Helios가 비교 대상으로 사용한 경쟁 시스템보다 메모리 용량은 50% 더 크고 FP4 성능은 15% 더 높다고 주장했다. FP4는 적합한 AI 워크로드에서 메모리와 연산 요구량을 줄이는 4비트 수치 형식이다. 낮은 정밀도는 처리량을 높일 수 있지만, 모델 품질과 워크로드 호환성은 여전히 실제 결과에 영향을 미친다.

회사는 또한 MI455X의 토큰 처리량이 이전 세대인 MI355X보다 최대 34배 높다고 밝혔다. AMD는 이 증가의 일부를 아키텍처 변화에, 나머지를 소프트웨어 개선에 돌렸다. 이런 비교는 세대 간 발전을 보여주지만, Nvidia의 현행 시스템 대비 성능을 독립적으로 입증하지는 않는다.

양산 전환은 입증 책임을 바꾼다. 기조연설 전에는 AMD가 아키텍처 다이어그램, 고객 의향, 예상 성능을 중심으로 Helios를 설명할 수 있었다. 이제부터 구매자는 실제 납품된 랙, 소프트웨어 안정성, 클러스터 가동 시간, 전력 소비, 워크로드 경제성을 평가할 수 있다.

AMD의 더 폭넓은 발표 페이지는 행사가 Helios에만 국한되지 않았음을 확인해 준다. Advancing AI program은 EPYC Venice, MI455X, ROCm.AI, Kria 로보틱스 하드웨어, 여러 고객 협업을 다뤘다. 그러나 이 개별 제품들을 연결한다는 점에서 랙은 경쟁 구도의 중심에 남아 있다.

이 때문에 이번 행사는 단순한 가속기 출시가 아니었다. AMD는 고객이 구매하고 배포하며 확장해야 할 단위로 Helios를 제시했다. 이는 실행 위험이 배가되는 시스템 수준에서 Nvidia와 직접 경쟁하겠다는 의미다.

OpenAI와 Anthropic, 출시를 용량 시험대로 만들다

AMD의 가장 강력한 근거는 벤치마크 차트가 아니었다. 수 기가와트 규모의 인프라를 도입할 준비를 하는 고객들이 현장에 있었다는 점이다.

OpenAI는 2026년 말 무렵 Helios를 대규모로 배포한 뒤 2027년 내내 설치를 가속할 것으로 예상한다고 밝혔다. 이 회사는 기조연설 수개월 전에 사전 양산 랙을 받았고, 이미 AMD와 최적화 작업을 진행하고 있었다.

OpenAI의 컴퓨트 전략 부사장 Sachin Katti는 고객의 압박을 직접적으로 요약했다. “더 많은 컴퓨트를 더 빠르게 필요로 합니다.” 이 발언은 대체 인프라가 매력적으로 떠오른 이유를 보여준다는 점에서 중요하다. 대형 모델 개발업체들은 단일 공급업체가 쉽게 제공할 수 있는 수준을 넘어서는 용량을 필요로 한다.

OpenAI의 참여는 조달을 넘어선다. AMD는 양사가 하드웨어 로드맵, 시스템 설계, 소프트웨어, AI가 생성한 GPU 커널 전반에서 협력하고 있다고 밝혔다. 커널은 특정 연산이 가속기에서 실행되는 방식을 제어하는 저수준 프로그램이다. 커널 품질은 사용자가 기반 하드웨어에서 얻는 성능에 큰 영향을 미친다.

이 관계가 OpenAI가 Nvidia를 포기한다는 뜻은 아니다. 대형 AI 개발업체들은 시장 선도업체에서 계속 구매하면서도 인프라를 통상 다변화한다. AMD의 기회는 충분한 성능, 소프트웨어 지원, 제조 물량을 갖춘 신뢰할 수 있는 두 번째 플랫폼이 되는 데서 나온다.

Anthropic도 또 하나의 대형 약정을 제공했다. 양사는 MI450 시리즈 용량을 최대 2기가와트까지 포괄하는 계약을 발표했으며, 첫 1기가와트는 2027년 중 공급될 것으로 예상된다. reported agreement에 따르면 AMD는 Anthropic에 최대 50억 달러를 투자하기로도 합의했다.

이 금융 요소는 신중하게 해석할 필요가 있다. 이는 AMD를 주요 고객과 결속시키지만, 동시에 공급업체가 구매자의 확장을 지원하는 구조이기도 하다. 이 협정은 수요 가시성을 제공하지만, 전략적 자금 지원 없이 이루어진 완전히 독립적인 구매와 동일한 신호를 제공하지는 않는다.

Anthropic 공동 창업자 Tom Brown은 Claude가 주말 동안 AMD의 AI 서버를 구성했다고 말했다. 이 주장은 AMD의 소프트웨어 목표를 보여준다. AI 에이전트가 광범위한 하드웨어별 전문 지식 없이도 개발자가 플랫폼을 설치하고 조정하며 사용할 수 있도록 도와야 한다는 것이다. 독립 운영자들은 이 경험이 통제된 협업 환경 밖에서도 일반화되는지 여전히 검증해야 한다.

Microsoft는 다른 종류의 검증을 더한다. AMD는 Microsoft가 확장된 인프라 파트너십을 통해 Helios를 배포할 것이며, 이 파트너십에는 EPYC Venice 기반 Azure 인스턴스도 포함된다고 밝혔다. Microsoft는 이미 대규모 이기종 플릿을 운영하고 있어, 그 배포 경험은 기업 구매자에게 특히 의미가 크다.

Meta는 Open Compute Project를 통해 기반 랙 설계에 기여했다. Meta의 인프라 리더들은 AI 시스템이 전체 데이터센터에 걸친 공동 설계를 필요로 한다고 주장해 왔다. 이 접근법은 Helios를 한 공급업체의 완전한 네트워킹 스택에 묶인 폐쇄형 어플라이언스가 아닌 개방형 랙 아키텍처로 만들려는 AMD의 노력과 맞닿아 있다.

이러한 고객 이름은 두 가지 방식으로 Nvidia에 압박을 가한다. 첫째, 주요 모델 개발업체들이 공급 대안을 원한다는 점을 보여준다. 둘째, AMD에 실제 워크로드를 제공해 더 광범위한 배포가 시작되기 전에 병목 현상을 드러낼 수 있게 한다.

Nvidia는 여전히 더 강력한 설치 기반과 성숙한 배포 파이프라인을 보유한다. 이 회사의 시스템은 주요 클라우드, 모델 연구소, 기업 환경 전반에서 운영된다. AMD에 대한 고객 발표가 그 우위를 없애지는 않는다.

따라서 당면한 시험대는 운영 용량이다. AMD는 발표된 일정에 맞춰 MI455X 가속기를 제조하고, HBM4 공급을 확보하며, 랙을 조립하고, 네트워킹을 검증하고, 소프트웨어 배포를 지원해야 한다. 어느 한 계층에서의 지연도 Helios 제품 전체에 영향을 준다.

수요는 더 이상 핵심 불확실성이 아니다. OpenAI, Anthropic, Microsoft, Meta는 구매자들이 또 다른 선택지를 원한다는 사실을 보여줄 만큼 충분한 관심을 나타냈다. 관건은 AMD가 이 관심을 약속한 속도로 작동하는 용량으로 전환할 수 있느냐다.

Nvidia의 우위는 GPU만이 아니라 시스템에 있다

Helios가 경쟁력 있는 구성 요소를 조립한 랙이 아니라 하나로 조율된 제품처럼 작동해야만 AMD는 Nvidia에 도전할 수 있다.

Nvidia의 랙 스케일 전략은 가속기, CPU, NVLink 인터커넥트, 네트워킹, 냉각 설계, 소프트웨어를 하나의 로드맵 아래 결합한다. 고객은 통합이 배포 작업과 성능 불확실성을 줄일 수 있기 때문에 그에 따른 공급업체 의존성을 받아들인다.

Helios도 랙 스케일 컴퓨팅으로의 같은 기본 전환을 따르면서 개방성을 경쟁 차별점으로 내세운다. AMD는 MI455X 가속기와 x86 EPYC 프로세서, Pensando 네트워킹, 일반적인 AI 프레임워크를 지원하도록 설계된 소프트웨어를 결합한다. 회사는 고객이 구성 요소와 배포 모델에 대해 더 큰 유연성을 얻는다고 주장한다.

이 주장은 상당한 엔지니어링 자원을 갖춘 클라우드 제공업체와 대형 모델 개발업체에 매력적이다. 이들은 개방형 시스템을 조정하고, 소프트웨어 변경에 기여하며, 공급업체 간 협상할 수 있다. 더 작은 조직은 튜닝에 투입할 엔지니어가 적기 때문에 긴밀히 통합된 시스템을 더 선호할 수 있다.

따라서 비교는 벤치마크 우위를 넘어선다. 구매자는 배포 시간, 모델 호환성, 장애 복구, 네트워킹 동작, 에너지 사용량, 지원을 고려해야 한다. 이론상 더 높은 성능을 내는 랙도 활용률이 낮거나 소프트웨어 장애가 운영 워크로드를 중단시킨다면 경쟁에서 밀릴 수 있다.

AMD는 Helios가 일부 비교에서 10~15% 더 높은 성능과 경쟁 인프라 대비 달러당 토큰 수 30% 향상을 제공한다고 밝혔다. 토큰은 AI 모델이 처리하고 생성하는 텍스트 단위다. 달러당 토큰 수는 처리량을 비용과 연결한다는 점에서 유용하지만, 공급업체의 계산은 모델 선택, 배치 크기, 정밀도, 전력 가정, 활용률에 크게 좌우된다.

회사는 이 수치를 확정된 사실로 볼 만큼 충분한 독립적인 운영 데이터를 공개하지 않았다. 제3자 테스트는 널리 쓰이는 모델과 현실적인 서비스 패턴 전반에서 비교를 재현해야 한다. 학습, 배치 추론, 대화형 추론, 에이전트형 워크로드는 시스템에 서로 다른 부하를 준다.

전력도 또 다른 제약 요인이다. 데이터센터는 점점 더 제한된 전력 용량에 직면하고 있어 와트당 성능이 순수한 속도만큼 중요해지고 있다. AMD는 Helios를 효율성 개선으로 제시했으며, Nvidia 역시 Vera와 Rubin 플랫폼에 대해 비슷한 주장을 내놓았다.

independent launch report는 Nvidia가 같은 주에 새로운 Vera CPU 세부 사항을 공개했다고 전했다. 이 시점은 경쟁 구도를 분명하게 만들었다. 양사는 이제 개별 프로세서가 아니라 랙과 데이터센터 규모에서 AI 성능을 설명하고 있다.

AMD는 또한 EPYC Venice를 앞세워 Nvidia의 서버 CPU 진입에 맞섰다. Venice는 Zen 6 아키텍처를 사용하며 소켓당 최대 256코어 구성까지 제공한다. AMD는 선택한 테스트에서 최고 처리량 구성이 Nvidia의 Vera CPU보다 소켓당 성능이 2.2배 높다고 주장했다.

이 결과는 독립 검토자가 재현하기 전까지는 기업 간 비교에 머문다. 그럼에도 CPU에 대한 강조는 전략적으로 중요하다. 에이전틱 AI 시스템은 CPU를 활용해 도구를 조율하고, 작업을 스케줄링하며, 데이터를 준비하고, 스토리지를 관리하고, 가속기가 계속 작동하도록 유지한다.

AMD는 이미 의미 있는 서버 CPU 사업을 보유하고 있어, 전통적인 x86 인프라에서 Nvidia에 없는 기반을 갖추고 있다. AMD는 서버 CPU 매출 점유율이 46%에 도달했다고 밝혔지만, 이 수치는 AMD 자체의 시장 정의를 반영하므로 제3자 측정치와의 비교가 필요하다.

Nvidia는 가속기 소프트웨어 측면에서 더 강한 입지를 갖고 있다. CUDA에는 수년간 축적된 라이브러리, 문서, 통합 기능, 숙련된 개발자, 운영 지식이 있다. ROCm도 개선됐지만, 호환성 문제가 발생할 때마다 고객이 Nvidia 인프라에 남을 이유가 하나 더 늘어난다.

따라서 Helios는 AMD의 가장 강한 부분과 가장 약한 부분을 하나의 패키지로 묶는다. EPYC 프로세서, 칩렛 엔지니어링, 메모리 용량, 개방형 표준은 신뢰할 만한 차별점을 제공한다. 소프트웨어 성숙도와 배포 실행력은 Nvidia가 우위를 방어할 수 있는 영역으로 남아 있다.

ROCm.AI, AMD의 가장 지속적인 격차를 좁히려 하다

ROCm.AI는 경쟁력 있는 실리콘만으로는 어려운 개발자 경험을 보완할 수 없다는 판단 아래, 소프트웨어 최적화를 자동화 서비스로 만들려는 AMD의 시도다.

AMD는 코딩 에이전트를 활용해 GPU 소프트웨어를 생성, 포팅, 최적화하는 도구 모음인 ROCm.AI를 공개했다. 이 플랫폼은 가속 컴퓨팅을 위한 AMD의 개방형 소프트웨어 환경인 ROCm을 기반으로 한다.

AMD는 ROCm이 이제 수개월마다 대규모 업데이트를 내는 대신 6주 주기의 릴리스를 따른다고 밝혔다. 더 빠른 릴리스는 하드웨어 지원과 프레임워크 호환성을 개선할 수 있다. 다만 프로덕션 사용자가 검증하기 전에 변경 사항이 도입되면 업그레이드 부담도 커질 수 있다.

ROCm.AI에는 AMD가 만든 에이전트 스킬과 Hyperloom이라는 성능 도구가 포함된다. 기조연설에서 AMD는 Hyperloom이 코드를 수정해 토큰 처리 속도를 38% 개선하는 모습을 시연했다. 이 사례는 작동 방식 자체는 뒷받침하지만, 하나의 연출된 워크로드만으로 일반적인 성능 향상을 입증할 수는 없다.

AMD는 최신 소프트웨어가 ROCm 7 대비 추론 성능은 3.3배, 학습 성능은 2.4배 높다고도 밝혔다. 이는 내부 세대 간 비교다. 소프트웨어가 얼마나 많은 성능을 끌어낼 수 있는지 보여주는 동시에, 이전 구성의 경쟁력이 얼마나 빠르게 뒤처질 수 있는지도 드러낸다.

더 큰 방향성은 설득력이 있다. 현대 가속기에는 복잡한 메모리 계층, 행렬 엔진, 통신 경로, 수치 형식이 포함된다. 개발자는 이러한 기능을 효율적으로 활용하기 위해 특화된 커널이 필요한 경우가 많다. AI 코딩 에이전트는 사람이 수작업으로 처리할 때보다 최적화 선택지를 더 빠르게 탐색할 수 있다.

Triton 프로그래밍 언어를 만든 OpenAI의 Philippe Tillet은 AI 생성 커널을 논의하기 위해 기조연설에 참여했다. AMD와 OpenAI는 AMD 가속기를 대상으로 하는 코드에 모델을 적용하고 있다. 더 나은 생성 커널은 수작업으로 튜닝된 소프트웨어 자산이 많은 플랫폼이 가진 우위를 줄일 수 있다.

자동화가 플랫폼 차이를 없애지는 않는다. 생성된 코드는 여전히 정확성 테스트, 성능 검증, 하드웨어 세대 전반에 걸친 유지보수가 필요하다. 특정 텐서 형태나 모델 구성에서 잘 작동하는 커널이 다른 조건에서는 성능이 떨어질 수 있다.

개발자는 디버깅 품질도 평가해야 한다. 자동화 도구가 최적화를 만들어 내면 팀은 장애, 수치 변화, 하드웨어 의존성을 이해해야 한다. 불투명한 성능 개선은 워크로드가 바뀔 때 운영상 부담이 될 수 있다.

데이제로 지원도 또 다른 과제다. AMD는 ROCm.AI가 출시 첫날부터 소프트웨어가 새 하드웨어를 활용하도록 도울 것이라고 말한다. 인기 프레임워크, 라이브러리, 모델이 즉시 접근하지 못한다면 MI455X의 성능은 제한된 가치만 갖게 되므로 이 목표는 중요하다.

Nvidia의 소프트웨어 우위는 커널 성능을 넘어선다. 프로파일링, 오케스트레이션, 네트워킹 라이브러리, 추론 서버, 문서, 커뮤니티 답변, 엔터프라이즈 지원까지 포괄한다. AMD는 원시 성능을 계속 높이는 동시에 전체 워크플로를 개선해야 한다.

오픈소스 접근 방식은 그 노력을 가속할 수 있다. 고객은 코드를 검토하고 변경을 제안하며, 모든 계층에서 단일 공급업체에 의존하는 일을 피할 수 있다. 개방형 개발은 폐쇄형 시스템이 지원되는 구성 뒤에 숨길 수 있는 미완성 영역도 드러낸다.

AMD의 소프트웨어 주장은 특권적 엔지니어링 접근 권한이 없는 조직들로부터 더 폭넓은 증거를 얻어야 한다. OpenAI, Meta, Anthropic은 새로운 인프라에 전문가를 배정할 수 있다. 일반 기업에는 신뢰할 수 있는 설치 경로, 익숙한 프레임워크, 예측 가능한 업데이트, 최적화가 실패했을 때의 지원이 필요하다.

이 차이는 전략적 파트너와 더 넓은 시장을 구분한다. ROCm.AI가 주로 AMD와 함께 하드웨어를 공동 설계하는 고객에게만 효과적이라면, 몇몇 거대한 배포를 강화할 수는 있어도 Nvidia의 광범위한 소프트웨어 우위를 없애지는 못한다. 독립 개발자가 같은 경험을 재현할 수 있다면 AMD의 공략 가능 시장은 크게 확대된다.

이 지점에서 지식 관리는 운영상 중요해진다. 새로운 가속기 플랫폼을 평가하는 엔지니어링 팀은 벤치마크, 구성 변경, 장애, 공급업체 가이드를 보존해야 한다. 검색 가능한 engineering knowledge base는 장기적인 마이그레이션 과정에서 그러한 증거에 계속 접근할 수 있게 해준다.

따라서 ROCm.AI는 개발자 발표 이상의 의미를 갖는다. 이는 역사적으로 AMD 채택을 늦춰 온 소프트웨어 작업을 압축하려는 시도다. 향후 몇 달은 자동화가 이 격차를 줄이는지, 아니면 일부 시연을 더 쉽게 만드는 데 그치는지를 보여줄 것이다.

제품 로드맵은 광범위하지만, 근거는 고르지 않다

AMD는 데이터센터부터 로보틱스까지 일관된 포트폴리오를 제시했지만, 가장 강한 주장은 여전히 미래의 공급과 공급업체가 선택한 테스트에 의존한다.

EPYC Venice는 Helios를 넘어선 가장 즉각적인 확장을 의미한다. AMD는 Helios용 고주파 모델, 256코어의 고밀도 버전, 범용 컴퓨팅용 128코어 옵션이라는 세 가지 주요 구성을 설명했다. Su에 따르면 Venice는 이미 완전 생산 단계에 있다.

이 프로세서 제품군은 AMD가 에이전틱 워크로드가 CPU 수요를 늘릴 것으로 예상하기 때문에 중요하다. 에이전트는 텍스트만 생성하지 않는다. 데이터를 검색하고, 애플리케이션을 호출하고, 코드를 실행하고, 작업을 조율하고, 결과를 모니터링한다. 이러한 단계는 범용 프로세서에 상당한 작업을 전가할 수 있다.

AMD는 CPU 시장이 2030년까지 2,200억 달러에 도달할 것으로 추정했다. 이 전망은 AI 가속기 1조4,000억 달러를 포함한 2조 달러 규모의 더 넓은 컴퓨팅 시장 추정치 안에 배치됐다. 이러한 전망은 독립적인 시장 합의가 아니라 AMD의 계획 가정을 표현한다.

AMD는 또한 일반적인 서버 슬롯에 장착할 수 있는 PCIe 가속기 Instinct MI350P를 출시했다. MI350P는 완전한 Helios 랙을 설치하는 것보다 부담이 적은 경로를 기업에 제공한다. AMD는 자동화된 위협 탐지와 개인화된 AI 어시스턴트 관련 내부 활용 사례를 강조했다.

AMD는 내부 배포에서 지능형 모델 라우팅이 토큰 비용을 43% 줄였다고 밝혔다. 라우팅은 복잡성, 지연 시간, 보안 요구 사항에 맞춰 선택된 모델로 요청을 보낸다. 이 방식은 더 큰 모델의 불필요한 사용을 줄일 수 있지만, 절감 효과는 요청 패턴과 라우팅 정확도에 따라 달라진다.

AT&T는 더 큰 규모의 프로덕션 사례를 제시했다. 이 통신사는 고객 서비스, 전사, 인프라 계획 등 다양한 작업에 매월 약 1조 개의 AI 토큰을 처리한다고 밝혔다. AT&T는 데이터 주권과 클라우드, 온프레미스, 격리 환경 전반에서 워크로드를 실행할 수 있는 능력을 강조했다.

Cerebras는 또 다른 추론 모델을 소개했다. 계획 중인 서비스는 프롬프트 처리를 토큰 생성과 분리해, 서로 다른 단계를 Helios와 웨이퍼 스케일 시스템에 할당한다. 두 회사는 이 조합이 Cerebras 시스템 단독 대비 5배의 성능을 제공할 수 있다고 주장한다.

hybrid inference plan은 2026년 후반 Cerebras Cloud에 도입될 예정이다. 이는 추론의 서로 다른 단계에 특화된 프로세서를 사용하는 더 광범위한 업계 흐름과 닮아 있다. 이러한 특화는 효율성을 높일 수 있지만 오케스트레이션을 더 복잡하게 만든다.

AMD는 Kria 시스템온모듈과 로보틱스 개발자 플랫폼으로 피지컬 AI에도 진출했다. 시스템온모듈은 임베디드 제품을 위한 컴퓨팅, 메모리, 인터페이스를 소형 보드에 패키징한다. AMD는 Kria를 로봇과 엣지 디바이스에 사용되는 Nvidia Jetson 시스템의 경쟁 제품으로 포지셔닝했다.

기조연설의 이 부분은 이야기를 확장했지만 초점을 약화시켰다. 데이터센터 고객은 Helios를 명확한 경쟁 제품 및 배포 일정과 비교해 평가할 수 있다. 로보틱스 개발자는 서로 다른 소프트웨어, 전력, 안전, 하드웨어 요구 사항에 직면한다.

로드맵은 더 멀리 이어졌다. AMD는 Zen 7 기반 EPYC 세대인 Florence가 2028년에 출시될 것이라고 밝혔다. Zen 8 기반 Ravenna는 2030년을 목표로 개발 중이다. 또한 MI600이 2028년에 출시될 것으로 예상되는 가운데, 매년 Instinct 및 랙 스케일 제품을 출시할 계획이다.

AMD는 MI500을 Instinct 세대 중 가장 큰 변화로 설명하고, 4년간 추론 처리량이 2,000배 이상 높아질 것으로 전망했다. processor road map은 고객에게 계획 가시성을 제공하지만, 이처럼 먼 미래의 성능 주장은 상당한 불확실성을 내포한다.

소프트웨어, 수치 형식, 랙 크기, 측정 방법론은 모두 수년에 걸친 처리량 비교에 기여할 수 있다. 이 헤드라인 수치는 하나의 칩이 2,000배 더 빨라진다는 직접적인 추정치로 읽어서는 안 된다.

위험은 AMD에 신뢰할 만한 기술이 부족하다는 데 있지 않다. 광범위한 포트폴리오가 회사가 모두 똑같이 잘 지원하기에는 너무 많은 실행 영역을 만든다는 점이 위험이다. Helios, Venice, ROCm.AI, 엔터프라이즈 가속기, 클라이언트 시스템, 로보틱스 제품은 각각 지속적인 엔지니어링이 필요하다.

Nvidia 역시 매년 하드웨어와 소프트웨어 출시를 실행해야 하는 같은 압박에 직면해 있다. 더 큰 AI 매출 기반, 설치 기반, 생태계는 지연을 흡수할 여지를 더 많이 제공한다. AMD는 확장하는 동시에 신뢰를 구축해야 한다.

이번 기조연설은 AMD의 방향성을 유난히 명확하게 보여줬다. AMD는 부품 선택권과 개방형 소프트웨어를 유지하면서 완전한 AI 시스템 전반에서 경쟁하고자 한다. 구매자는 이 일관된 전략과 아직 검증되지 않은 개별 주장을 구분해야 한다.

Helios가 시장을 바꿀지 결정할 세 가지 신호

다음 판단은 또 한 번의 아키텍처 약속이 아니라 출하된 시스템, 측정된 워크로드, 반복 주문에서 나와야 한다.

첫 번째 신호는 3분기 말 출하 목표다. AMD는 Helios가 완전 생산 단계에 있으며 그 마감 시점 무렵 출하를 시작할 것이라고 밝혔다. 이를 달성하면 랙이 샘플링 단계를 넘어섰다는 주장을 강화할 것이다. 중요한 지연이 발생하면 고객 도입 일정은 Nvidia의 다음 제품 주기에 더 가까워진다.

출하 발표만으로는 충분하지 않다. 구매자는 OpenAI, Microsoft 및 기타 명시된 고객사의 설치 용량을 지켜봐야 한다. 검증 연구실에 있는 랙은 프로덕션 모델을 서비스하는 클러스터보다 증거력이 낮다.

두 번째 신호는 독립적인 워크로드 데이터다. 검토자와 고객은 학습, 배치 추론, 인터랙티브 추론, 에이전트형 애플리케이션을 테스트해야 한다. 결과에는 전력 소모, 랙 활용률, 지연 시간, 소프트웨어 신뢰성, 달러당 토큰 수가 포함돼야 한다.

Helios는 본격적인 Nvidia 도전에 뒷받침될 수 있는 사양을 갖췄다. 72개의 가속기, 31테라바이트의 HBM4, Venice CPU, 랙 규모 네트워크는 신뢰할 만한 하드웨어 기반을 구축한다. 실제 배포를 통해 애플리케이션이 그 용량을 얼마나 지속적으로 활용할 수 있는지가 판가름 날 것이다.

독립적인 소프트웨어 테스트도 마찬가지로 중요하다. 개발자는 설치 시간, 프레임워크 호환성, 커널 품질, 디버깅, 업그레이드 동작을 측정해야 한다. ROCm.AI는 AMD와 가장 긴밀한 파트너십을 맺은 기업들 밖의 팀들도 지원해야 일반적인 구매 행태를 바꿀 수 있다.

세 번째 신호는 2027년 동안의 반복 수요다. OpenAI의 계획된 가속, Anthropic의 첫 기가와트, Microsoft의 Azure 배포, Cerebras Cloud의 제공은 구체적인 점검 지점을 제공한다. 초기 약정을 넘어선 확장은 고객이 성능과 운영을 신뢰한다는 신호가 될 것이다.

반복 주문은 AMD의 개방형 플랫폼 논리도 검증하게 된다. 구매자들은 협상력을 높이거나 공급 위험을 줄이기 위해 두 번째 공급업체를 추가하는 경우가 많다. 이들은 플랫폼이 수용 가능한 경제성과 신뢰성을 제공할 때에만 해당 공급업체를 확대한다.

Nvidia의 대응은 각 신호를 좌우할 것이다. 이 회사는 가격을 조정하고, 시스템 제공 시점을 앞당기며, 효율성을 개선하고, 고객 통합을 심화할 수 있다. Vera와 Rubin 로드맵은 AMD가 공략하려는 전력 제약 데이터센터를 동일하게 겨냥한다.

이 때문에 AMD ServeTheHome 이야기는 단일 기조연설을 넘어선다. 이 행사는 AMD가 랙 규모 전략에 생산 관련 주장과 단기 출하 일정을 결부한 시점을 의미했다. 또한 주요 고객들을 무대에 세워 의도한 활용 방안을 설명하게 했다.

기조연설은 Su가 주장한 것처럼 Helios가 최고의 AI 랙인지 여부를 결론내리지 않았다. 대신 검증 가능한 명제를 제시했다. AMD는 개방형 시스템이 경쟁력 있는 성능에 필적하고, 경제성을 개선하며, 대규모 생산 단계에 도달할 수 있다고 말한다.

이제 인프라 리더들은 세 가지 직접적인 질문을 던져야 한다. 랙은 약속한 시점에 출하됐는가? 독립 워크로드가 AMD의 경제성 주장을 재현했는가? 고객들은 첫 시스템을 운영한 뒤 배포를 확대했는가?

그 답은 Helios가 지속 가능한 두 번째 플랫폼이 될지, 아니면 제한된 점유율을 지닌 전략적으로 유용한 대안에 머무를지를 결정할 것이다. 배포 현황을 추적하고, 운영 증거를 기록하며, 완전한 시스템을 비교해야 한다. AMD의 Nvidia 도전의 다음 단계는 기조연설 무대가 아니라 데이터센터 내부에서 측정될 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page