top of page

AMD SemiAnalysis: AMD의 CUDA 도전, 랙 스케일 현실의 벽에 부딪히다

7월 26일
12분 분량

AMD는 여전히 신뢰할 수 있는 경쟁과 안정적인 배포를 가르는 두 가지 운영상 문제를 안고 있지만, Advancing AI 2026에서 지금까지 가장 강력한 CUDA 도전장을 내밀었다. 최신 AMD SemiAnalysis 평가는 대폭 향상된 소프트웨어, 에이전트가 생성한 커널 개선, 훨씬 경쟁력 있어진 MI455X 아키텍처를 확인했다. 동시에 불안정한 내부 개발 클러스터와 어려운 Helios 양산 전환도 지적했다.

이 조합이 핵심이다. AMD는 더 이상 본질적으로 쓸 수 없는 소프트웨어 스택에 발목 잡힌 기업처럼 보이지 않는다. 이제는 실행력, 테스트 역량, 그리고 72개의 첨단 가속기를 신뢰할 수 있는 운영 시스템으로 전환하는 난관에 제약받는 모습이다.

Nvidia가 여전히 주된 경쟁자인 이유는 CUDA가 단순한 프로그래밍 인터페이스가 아니기 때문이다. CUDA에는 성숙한 라이브러리, 검증된 프레임워크, 배포 방식, 네트워킹, 그리고 수년에 걸쳐 축적된 개발자 지식이 포함된다. AMD는 랙 스케일에서 작동하는 하드웨어를 출하하는 동시에 이러한 장점들의 중요성을 낮춰야 한다.

AMD Advancing AI 2026이 경쟁의 조건을 바꾸다

AMD는 개별 가속기의 개선 가능성을 제시하는 단계에서, 최첨단 AI 인프라를 위한 완전한 대안을 제시하는 단계로 이동했다.

AMD는 7월 22일과 23일 샌프란시스코에서 열린 행사에서 Instinct MI455X, Helios 랙 설계, ROCm.AI를 핵심으로 내세웠다. 또한 Anthropic, Microsoft, OpenAI, Cerebras 및 기타 주요 AI 인프라 구매자와의 파트너십을 강조했다.

Advancing AI 행사에서 AMD는 MI455X를 자사 최고 성능 가속기로, ROCm.AI를 AI 기반 개발 플랫폼으로 제시했다. AMD는 Anthropic이 최대 2기가와트 규모의 MI450 시리즈 GPU를 배포할 계획이라고 밝혔다. Microsoft 역시 Helios 기반 인프라를 배포할 계획이다.

이러한 고객 약정은 AMD를 단발성 벤치마크 시연의 영역 밖으로 옮긴다는 점에서 중요하다. 최첨단 연구소와 클라우드 제공업체는 변화하는 모델, 프레임워크, 네트워크 구성 전반에서 수천 개의 가속기를 운영해야 한다. 하나의 통제된 테스트에서 좋은 성능을 내는 칩이 자동으로 실용적인 대규모 배포 환경이 되는 것은 아니다.

Helios는 이러한 플릿 수준 요구에 대한 AMD의 답이다. 이 설계는 MI455X GPU 72개, EPYC “Venice” CPU 18개, Pensando 네트워킹, 그리고 스위치 기반 스케일업 패브릭을 결합한다. 스케일업 네트워킹은 랙 내부의 가속기들을 연결해 하나의 대형 워크로드에서 협력하게 한다.

AMD는 완전한 랙 하나가 31TB의 HBM4 메모리와 260TB/s의 총 스케일업 대역폭을 제공한다고 말한다. 또한 FP4 연산 성능 2.9엑사FLOPS, FP8 연산 성능 1.4엑사FLOPS를 제시한다. 이는 지속적인 애플리케이션 성능에 대한 독립 측정치가 아니라, 회사가 제시한 최고 사양이다.

물리적 설계 역시 중요한 아키텍처 전환을 의미한다. MI300X부터 MI355X까지는 8개 GPU의 포인트투포인트 토폴로지를 사용했다. Helios는 단일 계층의 올투올 네트워크에서 Broadcom Tomahawk 6 스위치 12개를 통해 72개의 GPU를 연결한다.

이로써 MI455X는 Nvidia의 72-GPU 시스템에 대한 AMD의 첫 본격적인 랙 스케일 대응책이 된다. 동시에 AMD는 전혀 다른 종류의 엔지니어링 문제에 노출된다. 이제 신호 무결성, 케이블링, 냉각, 스위치 통합, 제조 수율, 유지보수성은 가속기 자체만큼 성능에 영향을 미친다.

따라서 이번 행사는 핵심 질문을 바꿨다. 구매자는 더 이상 AMD가 빠른 AI 칩을 만들 수 있는지 묻기만 하면 되지 않는다. AMD가 예측 가능한 소프트웨어 동작을 갖춘 완전한 시스템을 제공할 수 있는지를 물어야 한다.

이 구분은 새 AMD SemiAnalysis 평가가 더 호의적이면서도 비판성을 잃지 않는 이유를 설명한다. 이 분석은 AMD가 점유율을 확보할 가능성을 이전보다 훨씬 높게 평가한다. 동시에 그 진전을 좌초시킬 수 있는 두 가지 위험도 짚는다.

한 가지 위험은 소프트웨어 시연의 기반에 있다. AMD의 내부 테스트 인프라는 여전히 불안정하다. 다른 위험은 물리적 랙 내부에 있다. 보도에 따르면 Helios는 느리고 복잡한 양산 전환을 겪고 있다.

이러한 위험은 직접 연결된다. AMD는 소프트웨어를 지속적으로 테스트할 신뢰할 수 있는 하드웨어 클러스터가 필요하고, 고객은 새로운 하드웨어를 대규모로 도입하기 전에 신뢰할 수 있는 소프트웨어를 원한다. 어느 한쪽의 약점도 전체 플랫폼을 늦춘다.

마침내 압박받기 시작한 Nvidia의 CUDA 해자

에이전트 기반 개발은 CUDA 뒤에 있는 인력 우위를 줄이지만, 검증된 시스템에서의 Nvidia 우위까지 없애지는 못한다.

CUDA가 해자가 된 이유는 개발자들이 모든 계층을 다시 구축하지 않고도 작동하는 성능에 도달할 수 있었기 때문이다. Nvidia는 컴파일러, 최적화 라이브러리, 디버깅 도구, 통신 소프트웨어, 널리 쓰이는 프레임워크와의 통합에 투자했다. 성공적인 배포가 거듭될수록 문서, 예제, 숙련된 엔지니어가 축적됐다.

이 축적은 피드백 루프를 만들었다. 더 많은 고객이 더 많은 소프트웨어 투자를 끌어들였고, 이는 다음 고객에게 Nvidia 하드웨어를 더 안전한 선택지로 만들었다. 경쟁 실리콘이 매력적인 사양을 제공할 때도 전환에는 기술적·조직적 비용이 따랐다.

AMD의 새 주장은 이 루프의 인력 요소를 겨냥한다. 코딩 에이전트는 리포지토리를 검색하고, 실패를 식별하며, 패치를 제안하고, 테스트를 실행하고, 성능 실험을 반복할 수 있다. 이들은 다수의 좁은 범위 작업을 병렬로 수행해 순수 엔지니어링 인력 규모의 중요성을 낮춘다.

SemiAnalysis는 소규모 팀이 코딩 에이전트를 활용해 vLLM과 SGLang 전반에서 새 모델을 지원하는 방식을 설명한다. 에이전트는 배포 레시피를 가져오고, 테스트 인프라를 구성하며, 물리적 러너를 모니터링하고, 엔진 오류를 진단하며, 업스트림 수정 사항을 제출한다. 보고서에 따르면 이 워크플로는 몇 달 전만 해도 같은 속도로는 실현하기 어려웠다.

이는 특히 커널에서 중요하다. GPU 커널은 수학 연산을 프로세서의 실행 유닛과 메모리 계층 구조에 매핑하는 저수준 코드다. 커널 품질은 강력한 하드웨어 사양이 유용한 애플리케이션 성능으로 이어지는지를 결정할 수 있다.

AMD는 이 작업의 일부를 자동화하기 위해 GEAK, 즉 Generating Efficient AI-Centric Kernels를 도입했다. 이 시스템은 워크로드를 프로파일링하고, 구현 방식을 제안하며, 실제 하드웨어에서 측정하고, 정확성을 검증한 뒤 성공적인 변경 사항을 유지한다.

AMD의 GEAK 프레임워크는 Triton, TileLang, FlyDSL, HIP, Composable Kernel 백엔드를 대상으로 할 수 있다. 네 번째 버전은 단일 커널에서 완전한 vLLM 또는 SGLang 서빙 워크로드로 범위를 확장한다.

이 차이는 중요하다. 애플리케이션이 단지 다른 지점에서 제약받게 된다면 하나의 연산을 가속해도 가치는 거의 없다. 엔드투엔드 최적화는 에이전트가 다음 병목을 찾아내고, 국소적 속도 향상이 전체 서빙 처리량을 개선하는지 판단하게 한다.

Hyperloom은 이 과정에 오케스트레이션을 더한다. 추론 서비스를 프로파일링하고, 병목을 선택하며, 최적화 에이전트를 실행하고, 엔드투엔드 비교를 통해 후보안을 검증한다. AMD는 이를 더 폭넓은 ROCm.AI 워크플로의 일부로 제시한다.

SemiAnalysis는 이 접근 방식이 측정 가능한 개선을 만들 수 있다는 증거를 확인했다. 보고서는 하나의 MI355X 밀집 선형 연산 재작성으로 약 21.8%의 엔드투엔드 개선이 있었다고 인용한다. 또한 개선 폭이 훨씬 낮은 한계치 근처에서 멈춘 워크로드도 언급한다.

이러한 단서는 생성된 코드가 벤치마크의 약점을 악용할 수 있기 때문에 중요하다. 에이전트가 테스트를 변경하거나, 금지된 최적화 라이브러리를 호출하거나, 실수로 변경되지 않은 기준선을 측정할 수 있다. 비교가 유효하지 않다면 더 빠른 결과는 아무 의미가 없다.

AMD는 이러한 동작에 대한 보호 장치를 추가했다. GEAK는 보호된 테스트 파일의 수정을 막을 수 있으며, 관련 평가 도구는 하드코딩된 성공 신호와 금지된 라이브러리 호출을 감지한다. 이러한 제어 장치는 에이전트 기반 최적화를 코드 생성 시연이 아닌 엔지니어링 시스템으로 바꾼다.

이는 CUDA의 해자를 약화하는 가장 강력한 메커니즘이다. 오픈 코드는 에이전트가 살펴보고, 수정하고, 테스트할 수 있는 더 많은 자료를 제공한다. AMD의 컴파일러 구성 요소, 커널, 프레임워크 기여물은 자동화된 개선을 위한 접근 가능한 표면을 제공한다.

하지만 개방적 접근만으로는 운영 환경 수준의 품질을 보장하지 않는다. 에이전트는 유용한 변경과 그럴듯한 실수를 모두 가속한다. 변경량이 늘어날수록 생성된 작업을 검증하는 플랫폼의 중요성도 커진다.

따라서 Nvidia는 자사 우위의 한 부분인 엔지니어링 처리량에서 압박을 받고 있다. 하지만 또 다른 부분인 검증과 배포된 시스템 경험의 깊이에서는 여전히 보호받는다.

AMD SemiAnalysis의 소프트웨어 평가는 개선됐지만 완전하지는 않다

ROCm은 측정 가능한 진전을 이뤘지만, AMD에는 기본적인 신뢰를 얻기 위해 필요한 지속적 테스트 규율이 여전히 부족하다.

가장 분명한 개선은 AMD가 업스트림 프레임워크와 더 긴밀하게 정렬됐다는 점이다. 업스트림 지원은 변경 사항이 AMD 전용 포크에 머무르지 않고 주요 vLLM 또는 SGLang 프로젝트에 포함된다는 뜻이다. 이는 유지보수 부담을 줄이고, 사용자에게 더 익숙한 배포 경로를 제공한다.

SemiAnalysis는 안정적인 ROCm 지원이 2026년 1월 업스트림 vLLM 릴리스에 들어갔고, 이후 야간 빌드가 뒤따랐다고 언급한다. 6월 변경 사항은 AMD 미러와 8개의 중요한 테스트 그룹을 위한 게이트를 추가했다. 여기에는 어텐션, 엔진, API 정확성, 멀티모달, 추측 디코딩 범위가 포함됐다.

SGLang 역시 분산형 MI355X 추론을 위한 야간 테스트를 추가했다. 테스트는 신흥 모델을 위한 분리형 서빙을 다뤘으며, 이후 어텐션, 전문가 병렬화, 추측 디코딩 조합도 포함했다. 이로써 일부 AMD 구성은 일회성 레시피에서 반복 검증의 영역으로 옮겨갔다.

분리형 추론은 모델 서빙의 단계를 서로 다른 리소스에 분산한다. 프리필은 입력 프롬프트를 처리하고, 디코드는 후속 토큰을 생성한다. 운영자는 이 단계를 독립적으로 조정할 수 있지만, 노드 간에 키-값 캐시 데이터를 안정적으로 이동시켜야 한다.

AMD의 MoRI 소프트웨어는 이 전송과 전문가 통신의 일부를 처리한다. ATOMesh는 라우팅, 캐시 인식 부하 분산, 오케스트레이션을 추가한다. 이들 구성 요소는 AMD가 운영 환경 추론이 향하는 방향을 이해하고 있음을 보여준다.

성능도 개선됐다. SemiAnalysis 리뷰는 업스트림 AITER 및 vLLM 수정 이후 하나의 Kimi K2.5 구성에서 상호작용성이 18배 향상됐다고 언급한다. AMD는 별도로 여러 기준 구성에서 더 완만한 처리량 증가를 보고한다.

중요한 것은 가장 큰 수치 하나가 아니다. 의미 있는 변화는 최적화가 점차 공개 프레임워크, 레시피, 지속적 통합에 나타나고 있다는 점이다. 고객은 비공개 시연에 의존하는 대신 그 경로를 직접 검토할 수 있다.

그럼에도 지속적 통합, 즉 CI는 AMD의 가장 눈에 띄는 소프트웨어 약점으로 남아 있다. CI는 변경 사항을 자동으로 빌드하고 테스트해 코드가 병합되기 전에 회귀를 잡아낸다. 병합 차단 테스트는 실패 시 변경 자체를 막기 때문에 더 강력한 보호를 제공한다.

SemiAnalysis는 AMD가 Advancing AI 2026까지 CUDA의 vLLM 게이팅 범위 중 최소 90%에 도달하겠다는 목표를 달성하지 못했다고 전한다. 이 보고서는 그 원인의 일부로 불안정한 내부 클러스터와 리더십이 vLLM 팀의 역량을 재배분한 점을 든다.

보고서는 또한 Pollara 네트워크 인터페이스를 활용한 Kubernetes 추론 테스트가 Nvidia의 ConnectX 범위보다 여전히 크게 뒤처져 있다고 말한다. Kubernetes는 많은 운영 환경 추론 서비스가 분산 워크로드를 스케줄링하고 관리하는 데 사용하기 때문에 중요하다.

이러한 주장은 AMD가 아니라 상세 분석에서 나온 것이다. AMD는 보도된 클러스터 재배치나 그 배경에 있는 내부 용량 결정에 대해 공개적으로 확인한 바 없다.

그럼에도 외부에서 드러나는 징후는 더 큰 우려를 뒷받침한다. 공개 대시보드는 아직 포괄적인 CUDA 동등성을 보여주지 못하고 있다. 일부 고가치 AMD 경로에는 자동 성능 게이트, 정확도 테스트 또는 하드웨어 러너가 없다.

에이전트가 더 많은 코드를 생성할수록 이 약점은 더욱 심각해진다. 패치 생성 속도가 빨라지면 테스트가 필요한 조합의 수도 늘어난다. 모델, 수치 형식, 배치 크기, 네트워크 토폴로지, 병렬화 전략은 예상치 못한 방식으로 상호작용할 수 있다.

한 구성은 그럴듯한 출력을 내면서도 잘못된 답을 반환할 수 있다. SemiAnalysis는 분산 어텐션 및 전문가 병렬 경로와 관련된 과거 정확도 실패 사례를 확인했다. 여러 문제는 수정됐지만, 출판 시점에도 적어도 하나의 배치별 정확도 저하 문제는 미해결 상태로 남아 있었다.

이 사례는 기능 제공 여부와 플랫폼 성숙도 간의 차이를 잘 보여준다. 특정 레시피에서는 최적화가 작동하더라도, 실제 운영 환경 전반에서 안정적으로 작동한다는 뜻은 아니다. CUDA의 해자는 일부 이런 화려하지 않은 엣지 케이스 안에 존재한다.

AMD는 소프트웨어 역량, 릴리스 주기, 문서화, 업스트림 참여를 개선해 왔다. 다음 단계는 조직 차원이다. 테스트 클러스터는 내부 수요 급증 때 팀이 잃게 되는 임시 용량이 아니라, 안정적인 인프라가 되어야 한다.

Helios MI455X는 칩 과제를 운영 과제로 바꾼다

Helios는 기술적으로 신뢰할 만하지만, 복잡한 랙 설계는 AMD가 이 규모에서 아직 겪지 않은 제조 테스트를 만들어낸다.

Helios 랙 설계는 랙, 스케일업 네트워크, 스케일아웃 네트워크 전반에 걸쳐 개방형 표준을 사용한다. 이는 엄격하게 독점적인 시스템보다 고객에게 더 많은 부품 선택권을 제공한다.

개방성은 조정 비용도 만든다. Nvidia는 GPU, NVLink 패브릭, NVSwitch 구성요소, 네트워크 제품, 레퍼런스 시스템을 하나의 수직 통합 플랫폼으로 설계한다. AMD는 상용 부품과 외부 제조 파트너에 더 크게 의존한다.

Helios는 스케일업 패브릭에 Broadcom Tomahawk 6 스위치를 사용한다. SemiAnalysis에 따르면 각 GPU는 200기가비트 이더넷 72레인을 통해 연결되며, 단방향 스케일업 대역폭은 1.8 TB/s에 이른다. 12개의 스위치 칩이 랙의 72개 가속기를 연결한다.

이 토폴로지는 AMD의 기존 8-GPU 시스템보다 상당히 개선된 형태다. 더 큰 워크로드가 하나의 스케일업 도메인 안에서 동작할 수 있게 할 것으로 보인다. 다만 상용 부품이 72개 GPU를 기준으로 특별히 설계된 것은 아니기 때문에, 일부 스위치 용량은 사용되지 않는다.

더 큰 우려는 물리적 신호 전달과 관련된다. SemiAnalysis는 많은 스케일업 링크에 긴 구리 경로에서 감쇠된 전기 신호를 복원하는 리타이머가 필요하다고 보고했다. 공급망 분석은 랙당 Broadcom 이더넷 리타이머가 550개를 넘을 것으로 추정한다.

보고서는 또한 계획된 한 배포 환경에서 관련 링크의 약 85%가 리타이밍을 필요로 한다고 말한다. 이는 부품, 전력 소비, 발열, 검증 작업, 잠재적 장애 지점을 늘린다. AMD는 이러한 추정을 독립적으로 확인하지 않았다.

Helios는 복잡한 구리 백플레인과 플라이오버 케이블도 사용한다. 플라이오버 케이블은 더 긴 회로기판 트레이스를 피함으로써 신호 무결성을 개선할 수 있다. 그러나 조립, 공기 흐름, 서비스 접근성, 대량 생산을 복잡하게 만들 수 있다.

SemiAnalysis는 한 랙이 스케일업 연결 전반에 걸쳐 10,368쌍의 차동 구리 페어를 포함한다고 추정한다. 각각의 연결이 모두 이해된 경우에도, 이 시스템을 반복적으로 조립하고 검증하는 일은 상당한 생산 과제다.

이것이 브리프가 말하는 “production ramp hell” 프레이밍의 의미다. 이 표현은 Helios가 실패했다는 사실을 입증하지 않는다. 여러 파트너가 조립하는 작동 가능한 레퍼런스 시스템을 반복 가능하고 대량 생산되는 시스템으로 전환하는 어려움을 설명한다.

AMD는 Helios를 AMD가 직접 판매하는 완제품이 아니라 레퍼런스 설계로 설명한다. OEM 및 ODM 파트너가 이 청사진을 바탕으로 브랜드 시스템을 구축하게 된다. 이 모델은 공급업체 기반을 넓히지만, 더 많은 조직에 책임을 분산시킨다.

회사는 2026년 하반기 동안 대규모 배포를 예상하고 있다. Microsoft의 약속은 플랫폼에 중요한 검증 기회를 제공한다. Anthropic 및 기타 발표된 파트너는 수요 신호를 더하지만, 발표된 용량이 설치 및 인수 완료된 용량을 의미하는 것은 아니다.

MI455X 자체는 강력한 사양을 갖췄다. AMD는 가속기당 432 GB의 HBM4 메모리, CDNA 5 아키텍처, 여러 저정밀 형식의 네이티브 지원을 제시한다. 이 아키텍처는 32스레드 웨이브 크기도 채택해, 실행 모델의 일부를 Nvidia에 더 가깝게 만들었다.

이러한 수렴은 커널 개발자의 마찰을 줄일 수 있다. 단순화된 메모리 계층과 익숙한 실행 폭은 기존 최적화 지식을 더 쉽게 이전하게 할 수 있다. 네이티브 NVFP4 지원 역시 Nvidia 형식을 중심으로 개발된 모델 체크포인트를 AMD에서 실행하는 데 도움이 된다.

이 기능들 가운데 어느 것도 랙 문제를 없애지는 못한다. 경쟁력 있는 가속기는 고객이 허용 가능한 수율로 시스템을 공급받고, 설치하고, 냉각하고, 네트워킹하고, 운영할 수 있어야 비로소 상업적 가치를 갖는다.

대형 약정에 수반되는 재무 조건은 또 다른 층위를 더한다. SemiAnalysis는 한 OpenAI 계약이 특정 조건 달성 시 최대 105%에 이르는 지분 기반 리베이트를 제공하는 것으로 특징지었다. 이러한 인센티브는 통상적인 시장 수요를 입증하지 않고도 도입을 촉진할 수 있다.

지분 연계 경제성은 직접적인 하드웨어 할인과 다르다. 그 가치는 계약상 발동 조건, 향후 주식 가치, 배포 이정표, 회계 처리에 따라 달라진다. 공개 보도는 최대 헤드라인 수치를 실현된 혜택으로 간주하기에 충분한 세부 정보를 제공하지 않는다.

이 구조는 경쟁 비교도 복잡하게 만든다. 고객의 실질 경제성은 가속기 비용이나 운영 효율성만이 아니라 전략적 자금 조달을 반영할 수 있다. 구매자는 계약상 인센티브와 달러당 측정 성능을 분리해 봐야 한다.

따라서 관련된 시험대는 물리적·운영적 측면이다. Helios는 파트너 공장을 떠나 인수 테스트를 통과하고, 프로덕션 클러스터에 도달하며, 지속적인 워크로드 아래에서 가동 시간을 유지해야 한다. 그때까지 사양은 설치된 역량이 아니라 잠재력을 설명할 뿐이다.

AMD는 어제의 벤치마크가 아니라 분산 추론에서 이겨야 한다

다음 해자는 취약한 특수 사례 없이 네트워킹, 스케줄링, 메모리 이동, 커널을 결합하는 능력이다.

한때 단일 노드 성능은 가속기 경쟁을 이해하는 유용한 약식 지표였다. 이제 이 비교가 포착하는 프로덕션 워크로드의 비중은 줄었다. 최전선 추론은 점점 더 모델 구성요소와 서빙 단계를 여러 노드에 분산한다.

희소 Mixture-of-Experts 모델은 이러한 변화를 강화한다. 이 모델들은 다수의 전문화된 전문가 네트워크를 포함하지만, 각 토큰마다 그중 일부만 활성화한다. 효율적인 서빙에는 토큰 라우팅, 데이터 교환, 전문가 간 부하 균형, 캐시를 위한 충분한 메모리 확보가 필요하다.

광범위한 전문가 병렬화는 이러한 전문가를 더 많은 GPU에 분산한다. 분리형 프리필과 디코드는 서로 다른 서빙 단계를 전문화된 리소스에 배치한다. 캐시 오프로딩은 저장된 컨텍스트를 HBM, 시스템 메모리, 스토리지 사이에서 이동시킨다.

각 기법은 개별적으로 매력적인 결과를 낼 수 있다. 진짜 과제는 조합이다. 양자화, 어텐션 커널, 추측적 디코딩, 전문가 라우팅, 캐시 전송, 네트워크 동작은 모델 전반에서 함께 작동해야 한다.

SemiAnalysis는 이러한 조합 가능성이 Nvidia의 새로운 해자라고 주장한다. CUDA는 여전히 중요하지만, 경쟁 단위는 프로그래밍 환경에서 분산 추론 시스템으로 확장됐다.

AMD에도 신뢰할 수 있는 구성요소가 있다. MoRI는 전문가 통신과 캐시 이동을 위한 원격 메모리 액세스를 지원한다. AITER는 최적화된 추론 커널을 제공한다. ATOM과 ATOMesh는 실행 및 라우팅 기능을 제공한다. SGLang과 vLLM은 고객이 기대하는 주류 서빙 환경을 제공한다.

문제는 통합의 불균일성이다. 일부 AMD 구성은 분리형 아키텍처, 분산 어텐션, 전문가 병렬화, 추측적 디코딩을 결합한다. 다른 구성은 그래프 캡처 비활성화, 모델별 패치 또는 특정 배치 크기를 요구한다.

Helios 소프트웨어는 특히 초기 단계에 머물러 있다. SemiAnalysis는 초기 PyTorch 아키텍처 활성화는 확인했지만, 가장 가치 높은 경로에 대한 테스트는 제한적이라고 판단했다. 일부 프레임워크 이미지는 MI455X용으로 빌드될 수 있었지만, 실제 MI455X 러너에서 완전한 정확도 또는 성능 게이트를 실행하지는 못했다.

보고서는 완전한 WideEP 통합 없이 키-값 캐시 전송에 대한 초기 지원도 확인했다. 이는 AMD가 분산 스택의 일부는 갖추고 있지만, 전체 랙을 아우르는 안정적인 기본 구성은 아직 갖추지 못했다는 의미다.

이것이 ROCm을 무의미하게 만드는 것은 아니다. 오히려 남은 작업을 더 정확하게 정의한다. AMD는 더 이상 모든 개별 구성요소가 존재한다는 점을 증명할 필요가 없다. 고객이 이들을 결합할 때도 구성요소들이 정확성을 유지한다는 점을 증명해야 한다.

Nvidia도 이 영역에서 압박을 받고 있다. 개방형 프레임워크는 중요한 기능을 독점 소프트웨어 안에 묶어두는 가치를 낮춘다. 업스트림 프로젝트는 여러 가속기, 네트워크 인터페이스, 캐시 전송 시스템에 대한 지원을 흡수할 수 있다.

SemiAnalysis는 AMD 기여분을 Nvidia의 분산 추론 작업과 연관된 라이브러리인 NIXL과 연결하는 데 도움을 주었다고 설명한다. 이후 AMD 지원이 업스트림 프로젝트에 포함되면서, 소프트웨어 경계의 일부가 공유 인프라가 될 수 있음을 보여줬다.

이러한 발전은 단순한 벤더 종속 서사를 약화시킨다. 전송 및 오케스트레이션 계층이 여러 하드웨어 백엔드를 수용하면 고객이 이익을 얻는다. AMD도 병렬 포크를 유지하는 데 필요한 엔지니어링 시간을 줄일 수 있어 혜택을 본다.

Nvidia는 여전히 자체 통합 플랫폼의 속도를 통제한다. 하드웨어와 소프트웨어 팀은 정의된 랙 아키텍처를 중심으로 조율할 수 있다. AMD는 개방성이 Nvidia의 내부 통합보다 더 빠른 집단적 개선을 만들어내도록 해야 한다.

에이전트 기반 커널 생성은 로컬 최적화에 도움이 된다. 프레임워크 오류를 진단하고 업스트림 패치를 만드는 데도 도움이 될 수 있다. 그러나 조직의 우선순위를 결정하거나, 안정적인 테스트 용량을 보장하거나, 복잡한 랙을 제조할 수는 없다.

따라서 경쟁 구도는 두 가지 서로 다른 실행 역량에 달려 있다. AMD는 하드웨어 생산을 산업화하는 동시에 소프트웨어 개선을 자동화해야 한다. Nvidia는 프로세스와 조직 규모가 대응 속도를 늦추지 않도록 하면서 통합 우위를 지켜야 한다.

AMD가 CUDA 해자를 약화시킬 수 있는지 보여줄 세 가지 신호

AMD의 발표는 테스트, 출하, 분산 워크로드가 함께 개선될 때에만 전략적 중요성을 갖는다.

첫 번째 신호는 공개 CI 커버리지다. AMD는 vLLM, SGLang, PyTorch, 네트워킹, 분산 추론 전반에 걸쳐 안정적인 MI455X 러너와 머지를 차단하는 테스트가 필요하다. 가시적인 게이팅 동등성은 불안정한 내부 클러스터에 대한 우려에 직접 답할 것이다.

더 강한 결과에는 여러 모델, 배치 크기, 수치 형식, 네트워크 토폴로지에 걸친 정확도 및 성능 게이트가 포함될 것이다. 데모 스크립트를 통과하는 것만으로는 충분하지 않다. 회귀는 변경 사항이 사용자에게 도달하기 전에 이를 막아야 한다.

AMD가 이러한 커버리지를 구축한다면, 에이전트 기반 소프트웨어 논지는 훨씬 강해진다. 검증 시스템이 잘못된 작업을 거부할 수 있기 때문에 에이전트는 코드를 빠르게 생성하고 최적화할 수 있다. 불안정성이 계속된다면, 더 높은 개발 속도는 더 큰 품질 위험으로 바뀔 것이다.

두 번째 신호는 2026년 하반기의 Helios 생산 램프다. 독자는 추가 용량 발표보다 파트너 출하, 고객 인수, 설치된 클러스터, 지속적인 운영을 지켜봐야 한다.

Microsoft의 배포는 주요 클라우드 환경 안에서 AMD 가속기, EPYC 프로세서, 네트워킹, ROCm을 결합한다는 점에서 특히 유용할 것이다. 실제 운영 환경에서의 제공은 MI455X 성능만이 아니라 전체 공급망과 소프트웨어 체인까지 검증하게 된다.

지연, 제한된 물량, 대규모 재설계가 발생한다면 리타이머, 케이블링, 파트너 조율을 둘러싼 우려에 힘이 실릴 것이다. 예측 가능한 출하가 이뤄진다면 AMD가 야심 찬 레퍼런스 설계를 반복 가능한 인프라로 전환했음을 보여줄 수 있다.

세 번째 신호는 MI455X에서의 조합형 분산 추론이다. AMD는 WideEP, 프리필-디코드 분리, 캐시 전송, 양자화, 추측 디코딩이 업스트림 프레임워크에서 함께 작동함을 입증해야 한다.

가장 좋은 근거는 정확도 검증과 현실적인 트래픽 조건의 결과를 포함한 재현 가능한 구성에서 나올 것이다. 에이전트형 워크로드에는 긴 컨텍스트, 반복적인 도구 호출, 캐시 재사용, 불규칙한 요청 타이밍이 포함된다. 단순한 합성 프롬프트로는 이러한 요구를 포착할 수 없다.

이러한 구성이 안정적으로 성능을 낸다면 AMD는 과거의 단일 노드 경쟁이 아니라 현재의 시스템 경쟁을 치르게 될 것이다. 반대로 모델별 최적화에 머문다면, 개별 ROCm 커널이 경쟁력 있어 보이더라도 CUDA의 우위는 지속될 것이다.

개발자들이 주목해야 하는 이유는 신뢰할 만한 두 번째 플랫폼이 이식성을 개선하고 단일 벤더의 로드맵 의존도를 낮출 수 있기 때문이다. Nvidia의 공급 여력이 계속 제한된 상황에서 메모리가 풍부한 가속기에 대한 접근성도 확대할 수 있다.

엔터프라이즈 구매자는 다른 이유로 관심을 가져야 한다. 발표된 할인, 최고 사양, 파트너 약속만으로 운영 리스크가 결정되지는 않는다. 구매자에게는 소프트웨어 회귀율, 배포 노력, 가동 시간, 워크로드 이식성에 관한 근거가 필요하다.

지식 노동자는 그 결과를 간접적으로 경험하게 될 것이다. 더 경쟁적인 추론 인프라는 모델 가용성, 지연 시간, 장기 실행 에이전트의 경제성에 영향을 줄 수 있다. 이러한 이점은 기조연설의 비교가 아니라 실제 운영 환경에서의 신뢰성에 달려 있다.

따라서 AMD에 대한 SemiAnalysis의 평가는 신중하지만 중요한 의미를 지닌다. AMD는 CUDA 격차의 일부를 좁힐 수 있는 신뢰할 만한 메커니즘을 찾아냈다. 오픈 소프트웨어와 코딩 에이전트는 수년간의 수동 최적화를 더 빠른 병렬 엔지니어링 루프로 압축할 수 있다.

남은 장벽은 덜 화려하지만 더 결정적이다. AMD에는 안정적인 테스트 클러스터, 신뢰할 수 있는 분산 조합, 제조 가능한 Helios 랙이 필요하다. 이러한 운영상 세부 사항이 계속 어려운 영역에서는 Nvidia의 해자가 유지된다.

먼저 공개 테스트 관문을, 다음으로 실제 Helios 설치를, 마지막으로 완전한 분산 워크로드를 지켜봐야 한다. 세 가지가 함께 진전된다면 AMD는 경쟁력 있는 가속기 그 이상을 구축하게 된다. 신뢰할 수 있는 대안 플랫폼을 구축하게 될 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page