top of page

EPYC 9996가 Vera와 Xeon에 도전하며 격화되는 AMD Nvidia 경쟁

AMD가 Nvidia Vera와 Intel Xeon에 도전하는 256코어 EPYC 9996 프로세서를 공개하며 이례적으로 공격적인 성능 주장을 내놨다. 이제 AMD Nvidia 경쟁은 가속기를 넘어 AI 워크로드를 조율하고 GPU에 데이터를 공급하며 에이전트 도구를 실행하는 CPU로까지 확장되고 있다.

코드명 Venice인 Zen 6 프로세서는 256개의 Zen 6c 코어, 512스레드, 1,024MB의 L3 캐시를 결합한다. AMD는 특정 AI 벤치마크에서 Intel의 128코어 Xeon 6980P보다 최대 3.4배 높은 성능을 제공한다고 밝혔다.

AMD는 예비 비교에서 코어당 성능도 Nvidia Vera보다 20% 높다고 주장한다. Nvidia가 Vera를 단순한 범용 서버 칩이 아니라 Rubin 시스템을 위한 AI 우선 호스트 CPU로 내세운다는 점에서 이 결과는 중요하다.

이 수치는 아직 광범위한 독립 검증을 거치지 않았다. AMD가 통제한 테스트와 선별된 워크로드, 때로는 서로 다른 Venice 구성을 사용한 비교에서 나온 결과다. 사양은 구체적이지만 경쟁 구도에 대한 결론은 아직 열려 있다.

EPYC 9996, Venice를 완전한 서버 포트폴리오로 확장

AMD는 하나의 대표 프로세서를 출시하는 것이 아니다. Venice를 고밀도 클라우드 컴퓨팅, 엔터프라이즈 서버, AI 호스트 시스템을 위한 개별 플랫폼으로 나누고 있다.

최상위 EPYC 9996는 256개의 Zen 6c 코어를 사용하며 512개의 동시 스레드를 지원한다. Zen 6c는 실용적인 소켓 및 전력 한도 내에 더 많은 코어를 배치하도록 설계된 AMD의 고밀도 코어 설계다.

공개된 사양에 따르면 이 프로세서의 기본 주파수는 2.55GHz이고 부스트 주파수는 4.1GHz다. 열 설계 전력은 600와트에 달해 고밀도 데이터센터 범주에 확실히 속한다.

이 전력 범위는 1,024MB의 네이티브 L3 캐시를 뒷받침한다. L3는 프로세서가 공유하는 최종 단계 캐시로, 자주 접근하는 데이터를 위해 더 느린 시스템 메모리로 이동하는 횟수를 줄인다.

이 캐시는 AMD의 수직 적층형 3D V-Cache가 아니다. 대신 AMD는 각 32코어 Zen 6c 칩렛에 코어당 4MB에 해당하는 128MB의 L3 캐시를 제공한다.

AMD는 Zen 6가 TSMC의 2나노미터급 N2 제조 공정을 사용한다고 확인했다. EPYC 9006 사양에 따르면 최대 16개의 메모리 채널과 12,800MT/s에 이르는 MRDIMM 속도를 지원한다.

MRDIMM, 즉 멀티플렉서 결합 랭크 메모리 모듈은 여러 메모리 랭크의 전송을 결합해 유효 데이터 전송률을 높인다. AMD는 이 구성으로 소켓당 1.6TB/s의 메모리 대역폭을 제공한다고 주장한다.

이는 EPYC Turin에서 크게 바뀐 아키텍처다. 인용된 비교에 따르면 Turin은 12개의 메모리 채널, 최대 6,400MT/s DDR5 속도, 약 576GB/s의 대역폭을 지원한다.

Venice는 단일 소켓 SP7 서버에 128개의 PCIe 6.0 레인도 도입한다. 듀얼 소켓 시스템은 160개 레인을 제공할 수 있어 시스템 구축업체에 가속기, 네트워킹, 고속 스토리지를 위한 더 큰 용량을 제공한다.

코어 밀도는 라인업의 한 부분일 뿐이다. 표준 Zen 6 모델은 최대 128코어에 이르고, 고주파 모델은 96코어에서 멈추는 대신 최대 5GHz까지 부스트된다.

96코어 EPYC 9686F와 64코어 EPYC 9586F는 모두 이 5GHz 최고 주파수에 도달한다. 이들 프로세서는 최대 스레드 밀도보다 지연 시간과 코어당 속도가 더 중요한 워크로드를 겨냥한다.

AMD는 8코어부터 128코어까지 구성할 수 있는 더 작은 SP8 플랫폼을 계획하고 있다. SP8은 메모리 지원을 8채널로 줄이지만 128개의 PCIe 6.0 레인은 유지한다.

Verano라는 별도 프로세서는 AI 호스트 노드 역할을 겨냥한다. AMD는 SOCAMM2 모듈을 사용하는 24채널 LPDDR5X 메모리와 최대 72코어, 5GHz 최고 클록을 결합할 것이라고 밝혔다.

Venice-X는 캐시 민감형 기술 워크로드를 위한 3D V-Cache를 탑재하고 이후 출시될 것으로 예상된다. 보도된 계획은 96코어, 총 1,152MB L3 캐시, 5.15GHz 부스트 주파수를 가리킨다.

이 세분화는 AMD의 더 큰 전략을 보여준다. 하나의 아키텍처로 클라우드 밀도, 전통적인 엔터프라이즈 애플리케이션, 고성능 컴퓨팅, AI 시스템의 CPU 집약적 영역을 아우르려는 것이다.

이러한 폭넓은 전략이 핵심 긴장을 만든다. Nvidia는 긴밀하게 통합된 AI 플랫폼을 중심으로 Vera를 최적화하는 반면, AMD는 유연한 x86 포트폴리오가 여전히 더 매력적일 것이라고 보고 있다.

AMD Nvidia 경쟁, 호스트 CPU로 이동

중요한 경쟁은 더 이상 어느 GPU가 더 많은 행렬 연산을 수행하는지에만 국한되지 않는다. 호스트 CPU는 고가의 가속기가 생산성을 유지할 수 있는지를 점점 더 좌우한다.

AI 에이전트는 모델 추론만 수행하지 않는다. Python 코드를 실행하고, 데이터베이스를 조회하며, 외부 도구를 호출하고, 벡터 인덱스를 검색하고, 소프트웨어를 컴파일하며, 다수의 동시 실행 환경을 관리한다.

이러한 단계는 흔히 CPU에서 일어난다. 호스트가 느리면 GPU는 데이터, 오케스트레이션 결정, 모델 외부 도구의 결과를 기다리게 될 수 있다.

Nvidia는 이 병목을 중심으로 Vera를 설계했다. 이 프로세서는 88개의 맞춤형 Olympus 코어를 사용하고 176스레드를 지원하며 최대 1.2TB/s의 LPDDR5X 메모리 대역폭을 제공한다.

이 메모리는 높은 대역폭과 낮은 전력을 위해 설계된 소형 메모리 패키지인 SOCAMM 모듈에 탑재된다. Nvidia는 또한 NVLink-C2C를 통해 Vera를 Rubin GPU에 직접 연결한다.

이 연결은 CPU와 GPU 사이에 최대 1.8TB/s의 일관성 보장 대역폭을 제공한다. 일관성 메모리를 사용하면 프로세서가 데이터 상태에 대한 일관된 관점을 유지하면서 데이터를 공유할 수 있다.

Nvidia는 Vera가 비교 대상 x86 프로세서보다 선별된 에이전트 워크로드를 1.8배 빠르게 완료한다고 밝힌다. Vera CPU 출시 발표는 특정 랙 스케일 구성에서 와트당 성능이 두 배라고도 주장한다.

AMD는 다른 강점으로 대응하고 있다. EPYC 9996는 Vera보다 거의 세 배 많은 코어와 소켓당 1.6TB/s의 주장된 메모리 대역폭을 갖춘다.

다만 AMD의 SP7 플랫폼은 Nvidia의 독자적인 CPU-GPU 패브릭이 아닌 PCIe를 통해 가속기를 연결한다. PCIe 6는 폭넓은 호환성을 제공하지만 NVLink-C2C가 내세우는 일관성 보장 대역폭에는 미치지 못한다.

이로써 뚜렷한 전략적 분기가 생긴다.

메모리 아키텍처

  • AMD: 최대 16개의 DDR5 채널, 12,800MT/s MRDIMM, 소켓당 1.6TB/s의 주장된 대역폭.

  • Nvidia: LPDDR5X SOCAMM 메모리, 1.2TB/s 대역폭, 코어당 효율성에 초점.

CPU 설계

  • AMD: 최대 256개의 x86 Zen 6c 코어와 주파수에 맞춰 조정된 저코어 모델.

  • Nvidia: 에이전트 처리와 AI 인프라를 중심으로 설계된 88개의 맞춤형 Arm 기반 Olympus 코어.

가속기 연결

  • AMD: PCIe 6 연결성은 여러 공급업체의 가속기를 지원한다.

  • Nvidia: NVLink-C2C는 일관성 인터페이스를 사용해 Vera와 Rubin GPU를 긴밀하게 결합한다.

배포 모델

  • AMD: 전통적 데이터베이스, 클라우드 서비스, HPC, AI를 포괄하는 폭넓은 서버 포트폴리오.

  • Nvidia: CPU, GPU, 네트워킹, 스토리지, 소프트웨어를 아우르는 통합 AI 팩토리.

Nvidia의 접근 방식은 완전한 플랫폼을 표준화하는 고객의 통합 마찰을 줄일 수 있다. 동일한 공급업체가 프로세서, 인터커넥트, 네트워크 어댑터, 시스템 설계, 소프트웨어 상당 부분을 통제한다.

AMD는 다른 종류의 유연성을 제공한다. 고객은 하나의 수직 통합 아키텍처를 채택하지 않고도 AMD Instinct 가속기, Nvidia GPU 또는 기타 PCIe 장치와 함께 EPYC를 배포할 수 있다.

이 선택은 혼합된 장비군을 운영하는 클라우드 제공업체와 기업에 중요하다. 기존 x86 애플리케이션은 명령어 세트를 바꾸거나 Arm용으로 전체 소프트웨어 환경을 재구축하지 않고도 Venice로 이전할 수 있다.

Vera 역시 상당한 지원을 받고 있다. Nvidia는 주요 클라우드 제공업체와 AI 기업이 Dell, HPE, Lenovo, Supermicro의 시스템과 함께 이를 배포할 계획이라고 밝혔다.

따라서 경쟁의 핵심은 벤치마크 속도를 넘어선다. 구매자는 개방형 서버 플랫폼과 통합 AI 스택 중 어느 쪽이 전체 워크로드에서 더 나은 결과를 내는지 판단해야 한다.

Zen 6, 코어 밀도를 대역폭 문제로 전환

EPYC 9996가 작동하는 이유는 AMD가 코어 수와 함께 메모리 처리량, 캐시 용량, 입출력 대역폭을 늘렸기 때문이다. 코어만 늘렸다면 혼잡하고 비효율적인 프로세서가 됐을 것이다.

256코어 서버 CPU는 이들 코어에 명령어와 데이터를 지속해서 공급해야 한다. 그렇지 않으면 많은 코어가 유용한 작업을 완료하는 대신 메모리를 기다리는 데 시간을 쓰게 된다.

AMD의 첫 번째 해법은 더 큰 메모리 서브시스템이다. 16개 채널은 Turin의 12채널 설계나 Intel Xeon 6980P의 12개 채널보다 메모리로 향하는 병렬 경로를 더 많이 제공한다.

두 번째 해법은 더 빠른 MRDIMM 지원이다. 이론상 12,800MT/s 데이터 전송률은 채널마다 더 큰 전송 용량을 제공하지만, 실제 애플리케이션이 홍보 수치의 최대치를 지속하는 경우는 드물다.

세 번째 해법은 캐시다. EPYC 9996의 1,024MB L3는 504MB를 탑재한 Intel Xeon 6980P보다 훨씬 큰 공유 작업 영역을 제공한다.

Intel의 Xeon 6980P 사양에는 128코어, 256스레드, 12개 메모리 채널, 96개 PCIe 5.0 레인, 500와트 TDP가 기재돼 있다.

Venice는 소켓 전력을 20% 높이면서 해당 Intel 프로세서의 코어 수를 두 배로 늘린다. 이 비교는 이론적 코어 밀도 측면에서 AMD에 유리하지만, 애플리케이션 수준의 효율성을 입증하는 것은 아니다.

소프트웨어는 256코어를 활용할 만큼 충분한 병렬 작업을 노출해야 한다. 데이터베이스, 웹 서비스, 가상 머신, 컴파일 팜, 클라우드 컨테이너는 종종 이를 효과적으로 수행할 수 있다.

다른 애플리케이션은 제한된 수의 빠른 스레드에 의존한다. 이런 워크로드는 최대 EPYC 구성보다 AMD의 5GHz 모델이나 Intel의 고주파 제품에서 더 큰 이점을 얻을 수 있다.

칩렛 설계도 또 다른 고려 사항을 더한다. AMD는 여러 컴퓨트 다이에 코어를 분산하고 이를 두 개의 입출력 다이에 연결한다.

이 구성은 제조 수율을 높이고 AMD가 재사용 가능한 구성 요소로 여러 제품을 만들 수 있게 해준다. 동시에 코어가 다른 위치에 있는 메모리나 캐시 리소스에 접근할 때 비균일한 지연 시간을 만들 수도 있다.

AMD의 벤치마크 선택은 이 아키텍처에 가장 적합한 워크로드를 반영한다. NGINX 웹 서버, Redis, 벡터 검색, 데이터베이스, 에이전트 샌드박스는 모두 상당한 동시성을 지원한다.

WRK 부하 생성기를 사용한 NGINX 테스트에서 AMD는 EPYC 9996가 초당 28,789,170건의 요청을 처리했다고 보고했다. 회사는 EPYC 9965가 24,320,476건, Intel Xeon 6980P가 10,162,179건을 기록했다고 측정했다.

이에 따라 AMD는 세대 간 1.2배 증가와 Intel 대비 2.8배 우위를 주장한다. 이는 중립적인 연구소의 결과가 아니라 공급업체가 제시한 결과다.

FAISS 벡터 검색 테스트도 유사한 양상을 보인다. FAISS는 유사한 항목을 찾기 위해 대규모 수치 임베딩 컬렉션을 검색하는 오픈소스 라이브러리다.

AMD는 EPYC 9996가 초당 751,453건의 쿼리를 처리했다고 보고했다. 자사 수치에 따르면 EPYC 9965는 472,079건, Xeon 6980P는 316,069건이었다.

벡터 검색은 검색 증강 생성 기능을 사용하는 AI 시스템과 관련이 있다. 애플리케이션이 언어 모델에 답변 생성을 요청하기 전에 문서나 레코드를 찾도록 돕는다.

이 프로세서는 코드 컴파일과 미디어 처리도 겨냥한다. 두 워크로드 모두 독립 작업을 다수의 코어에 분산할 수 있어, 고밀도 프로세서는 공유 인프라에 매력적이다.

클라우드 운영자는 활용률이 높게 유지될 때 각 소켓에 더 많은 서비스를 통합할 수 있다. 또한 고정된 워크로드에 필요한 라이선스 서버 수, 네트워크 연결, 메인보드 구성 요소 수를 줄일 수 있다.

하지만 통합은 하나의 서버 장애가 미치는 영향을 키운다. 냉각 밀도도 높아지고 메모리 용량, 네트워킹, 스토리지에 더 큰 요구를 제기한다.

따라서 EPYC 9996는 단순히 더 빠른 CPU가 아니다. 데이터센터가 설계를 정당화할 만큼 매우 고밀도인 소켓에 충분한 데이터와 냉각을 제공하고, 이를 지속적으로 바쁘게 유지할 수 있다는 데 거는 베팅이다.

AMD의 3.4배 주장은 더 많은 맥락이 필요하다

AMD의 벤치마크 결과는 신뢰할 만한 성능 근거를 제시하지만, Intel이나 Nvidia 대비 보편적인 3.4배 우위를 입증하는 데까지는 이르지 못한다.

가장 큰 Intel 비교는 데이터 과학 및 머신러닝 워크플로를 포괄하는 TPCx-AI에서 나왔다. 이 벤치마크의 주요 결과는 분당 처리되는 AI 사용 사례 수로 표현된다.

AMD는 EPYC 9996에서 5,982.91 AIUCpm을 기록했다고 발표했다. 같은 발표 자료에는 EPYC 9965가 3,458.79, EPYC 9755가 2,704.19, Xeon 6980P가 1,750.36을 기록한 것으로 제시됐다.

이 결과를 바탕으로 인용된 Intel 대비 3.4배 우위와 세대 간 1.7배 향상이라는 수치가 나온다. TPCx-AI benchmark는 공인된 프레임워크를 제공하지만, 구현 세부 사항은 여전히 모든 결과에 영향을 미친다.

컴파일러 설정, 메모리 구성, 소프트웨어 버전, 스토리지, 튜닝, 서버 펌웨어는 성능에 영향을 줄 수 있다. 벤더가 직접 수행한 비교는 대개 해당 벤더의 주장을 뒷받침하는 제품과 워크로드를 선택한다.

AMD는 여러 테스트의 실제 수치를 공개했으며, 이는 설명 없는 정규화 막대그래프보다 주장을 더 유용하게 만든다. 다만 일부 종합 점수는 여전히 해석하기 어렵다.

엔터프라이즈 도구 비교에서는 TPC-H, TPC-C 스타일, Redis 워크로드를 기하평균으로 결합했다. AMD는 Intel 처리량의 2.6배, EPYC 9965 성능의 1.6배를 주장한다.

또 다른 테스트에서는 다섯 개의 에이전트 페르소나를 재현해 종합 처리량 점수를 산출했다. AMD는 EPYC 9996이 4.451을 기록했으며, EPYC 9965는 2.97, Xeon 6980P는 1.779였다고 발표했다.

공개된 결과는 이 점수의 한 단위가 무엇을 의미하는지에 관한 세부 정보를 제한적으로만 제공한다. 재현 가능한 테스트 하니스가 없으면 구매자는 이 수치를 응답 시간이나 운영 용량으로 쉽게 환산할 수 없다.

Nvidia 비교에는 더욱 신중한 접근이 필요하다. AMD는 Nvidia가 공개한 SPEC CPU 2026 결과를 비교 기준으로 사용한 뒤, 동일한 GNU 15.2 컴파일러로 Venice를 실행했다.

AMD는 256코어 Zen 6c 모델이 Vera의 정수 처리량 대비 2.2배를 달성했다고 말한다. EPYC 구성은 256코어인 반면 Vera는 88코어이므로, 한 측면에서는 놀라운 결과가 아니다.

더 중요한 주장은 코어당 성능을 비교한다. AMD는 96코어 고주파 Venice 프로세서가 Vera의 코어당 결과보다 1.2배 높은 성능을 냈다고 말한다.

이 수치는 AMD의 우위가 전적으로 코어 수에서 비롯된 것은 아니라는 주장에 힘을 실어준다. 다만 독립적으로 테스트된 양산 시스템이 아니라, 예비 벤더 제출 결과를 비교한 것이다.

AMD는 두 Venice 구성 모두에 600와트 설정을 사용했다. Nvidia는 현재 플랫폼 정보에서 Vera CPU의 구성 가능한 전력 범위를 250~450와트로 제시한다.

전력 차이는 데이터센터가 랙 단위의 전력 및 냉각 한계 안에서 운영되기 때문에 중요하다. 소켓당 소비 전력이 더 높다면, 더 빠른 소켓이 자동으로 더 빠른 랙 성능으로 이어지지는 않는다.

Nvidia는 자체 Vera performance analysis에서 이 점을 강조한다. 회사는 지속적인 코어당 속도, 코어당 메모리 대역폭, 지연 시간, 최대 부하에서의 성능에 초점을 맞춘다.

AMD는 총 처리량, x86 호환성, 워크로드 통합을 강조한다. 각 관점은 타당하지만, 모두 자사 아키텍처에 가장 유리한 측정치를 부각한다.

이 비교에서는 여러 소유 비용 요인도 빠져 있다. 메모리 용량, 소프트웨어 라이선스, 서버 밀도, 냉각 설계, 가속기 활용률, 애플리케이션 마이그레이션은 벤치마크 우위보다 더 큰 영향을 미칠 수 있다.

EPYC 9996의 600와트 TDP는 평균 애플리케이션 전력을 측정한 값이 아니다. TDP는 냉각 설계를 위한 지침이며, 실제 소비 전력은 구성과 워크로드에 따라 달라진다.

Nvidia의 효율성 주장에도 같은 주의가 적용된다. Vera의 최종 결과는 출시 서버, 펌웨어, 컴파일러, 메모리 구성, 소프트웨어 성숙도에 따라 달라질 것이다.

Intel의 입지도 변할 수 있다. 최신 고밀도 Xeon 제품은 코어 수와 메모리 역량을 높이고 있으며, 향후 플랫폼은 Venice에 더 직접적으로 대응할 것이다.

AMD는 EPYC 9996을 강력한 경쟁자로 만들기에 충분한 세부 정보를 제공했다. 하지만 모든 Intel 또는 Nvidia 대안을 능가한다고 선언하기에는 독립적인 근거가 충분하지 않다.

Intel은 즉각적인 밀도 압박에 직면한다

Nvidia가 전략적 경쟁 구도를 정의하지만, AMD가 소켓당 두 배의 코어로 기존 x86 워크로드를 겨냥하기 때문에 Intel은 단기적으로 가장 뚜렷한 압박을 받는다.

Xeon 6980P는 128코어, 12개 메모리 채널, 최대 8,800 MT/s의 MRDIMM 지원을 갖춘 대형 서버 프로세서다. 504 MB 캐시와 500와트 TDP도 제공한다.

EPYC 9996은 코어 수를 두 배로 늘리고, 캐시를 대략 두 배로 확대하며, 메모리를 16개 채널로 확장하고, 입출력 지원을 PCIe 5.0에서 PCIe 6.0으로 옮긴다.

이 조합은 병렬성이 높은 워크로드에 필요한 서버 수를 줄일 수 있다. 또한 노후 x86 인프라를 교체하는 조직에 AMD의 매력적인 메시지를 제공한다.

다만 스레드 수가 적은 소프트웨어에서는 비교가 덜 결정적이다. 애플리케이션 튜닝, 가속기 지원, 데이터베이스 인증, 기존 플릿 관리가 더 큰 비중을 차지하는 환경에서는 Intel이 경쟁력을 유지할 수 있다.

Intel은 코어 수만으로 환원되지 않는 플랫폼 기능도 제공한다. 자사의 가속 엔진은 암호화, 압축, 데이터 이동, 분석, 네트워킹 워크로드를 겨냥한다.

고객은 하나의 차트만 보고 서버 플랫폼을 교체하는 경우가 드물다. 조달팀은 가용성, 지원 계약, 검증된 구성, 소프트웨어 라이선스, 보안 업데이트, 장기 공급을 평가한다.

AMD의 과제는 아키텍처상 이점을 광범위한 출하량으로 전환하는 것이다. 테스트에서 앞서는 프로세서라도 메인보드, 펌웨어, 메모리 인증, 클라우드 인스턴스, 안정적인 물량이 필요하다.

Nvidia는 시장에 다른 방식으로 접근한다. Vera는 모든 x86 서버를 대체하려는 것이 주목적이 아니다. Nvidia 가속기를 중심으로 구축된 AI 팩토리 내부에서 CPU의 역할을 통제하려는 것이다.

이는 두 기존 x86 벤더 모두에 압박을 만든다. Nvidia가 성공한다면 일부 CPU 구매 결정은 범용 서버팀에서 완성형 Nvidia 플랫폼 주문으로 이동한다.

AMD의 대응은 이러한 전환이 정착되기 전에 EPYC를 에이전트형 AI에 적합한 제품으로 만드는 것이다. AMD의 2026년 7월 메시지는 Venice를 웹 서빙, 벡터 검색, 데이터베이스, 코드 실행, 에이전트 오케스트레이션과 반복해서 연결한다.

이 포지셔닝은 의도적이다. 이러한 워크로드는 모델 주변에 위치하며, GPU가 주요 추론 연산을 수행하는 경우에도 상당한 CPU 리소스를 소비할 수 있다.

AWS는 Graviton을 통해 또 다른 경쟁 경로를 제공한다. AMD의 발표에는 웹 서빙, 벡터 검색, 데이터 집약적 AI, 엔터프라이즈 워크로드 전반의 Graviton5 결과가 포함됐다.

Graviton은 AWS 내부에서 경제성과 효율성 측면의 이점을 제공할 수 있지만, 고객이 자체 데이터센터 전반에 배포할 수는 없다. EPYC는 클라우드와 온프레미스 환경 전반에서 더 폭넓은 이식성을 제공한다.

Arm 서버 CPU는 소프트웨어 호환성이 무적의 장점이라는 x86의 역사적 전제를 이미 약화시키고 있다. 현재 많은 Linux 클라우드 애플리케이션은 두 명령어 세트에서 모두 원활히 실행된다.

Vera는 이러한 진전을 기반으로 Nvidia의 소프트웨어 및 가속기 관계를 더한다. 주요 시스템 제조사가 Vera를 채택하면서, 구매자는 Nvidia의 이전 고도로 패키징된 시스템보다 더 많은 선택지를 갖게 된다.

따라서 AMD는 두 전선에서 싸워야 한다. 범용 서버에서 x86의 역할을 지키는 동시에, Nvidia가 AI 호스트 CPU를 별도 카테고리로 규정하는 것을 막아야 한다.

EPYC 9996은 익숙한 소프트웨어와 극단적인 밀도를 결합하기 때문에 AMD에 신뢰할 만한 무기를 제공한다. 남은 의문은 이 광범위한 설계가 더 좁은 AI 환경에 맞춰 최적화된 프로세서를 능가할 수 있느냐는 점이다.

AMD Nvidia 주장 이후 구매자가 주시해야 할 점

다음 평가는 벤더가 선택한 또 한 차례의 슬라이드가 아니라 독립 시스템, 랙 수준 측정, 실제 소프트웨어 배포에서 나올 것이다.

첫 번째 신호는 출시된 EPYC 9996 서버에서 재현 가능한 벤치마크 데이터다. 독립 리뷰어와 클라우드 제공업체는 Venice, Vera, 현세대 Xeon 플랫폼에서 동일한 소프트웨어를 테스트해야 한다.

이러한 테스트는 컴파일러 설정, 메모리 구성, 전력 제한, 펌웨어, 냉각 환경을 공개해야 한다. 또한 총 처리량뿐 아니라 지연 시간 분포도 보고해야 한다.

데이터베이스, 컴파일, 벡터 검색, 웹 서비스 전반에서 강력한 결과가 나온다면 AMD의 광범위한 플랫폼 주장을 뒷받침할 수 있다. 워크로드별 편차가 크다면 보편적인 성능 주장은 약화될 것이다.

두 번째 신호는 랙 수준의 효율성이다. 구매자는 고정된 전력, 냉각, 바닥 공간 제약 안에서 완료된 작업량을 비교해야 한다.

600와트 프로세서도 여러 개의 저밀도 소켓을 대체한다면 랙 효율성을 높일 수 있다. 반대로 메모리, 네트워킹, 냉각이 완전한 활용을 막는다면 그 이점을 잃을 수 있다.

Nvidia의 수직 통합 시스템도 같은 수준의 검증을 받아야 한다. NVLink-C2C는 데이터 공유를 개선할 수 있지만, 고객에게는 그러한 이점이 전체 애플리케이션 처리량을 높인다는 증거가 필요하다.

세 번째 신호는 실제 배포다. 클라우드 인스턴스 가용성, OEM 출하량, 고객 사례, 프로덕션 소프트웨어 지원은 하드웨어가 통제된 시연을 넘어설 수 있는지 보여줄 것이다.

Vera의 하반기 공급은 모든 Venice 변형 제품이 시장에 도달하기 전에 Nvidia가 AI 중심 시스템을 확립할 기회를 제공한다. AMD의 기존 x86 생태계는 기존 애플리케이션에서 더 빠른 도입 경로를 제공한다.

구매자는 워크로드 배치도 신중히 검토해야 한다. CPU 비중이 높은 에이전트 시스템은 더 많은 코어의 이점을 얻을 수 있지만, GPU에 제약받는 서비스는 가장 큰 EPYC 모델에서 얻는 이득이 작을 수 있다.

최적의 선택은 하나의 AI 애플리케이션 안에서도 달라질 수 있다. 검색, 오케스트레이션, 코드 실행, 추론, 스토리지는 각각 다른 하드웨어 특성을 선호할 수 있다.

amd nvidia 경쟁을 평가하는 조직은 자체 프로덕션 워크로드의 트레이스부터 시작해야 한다. 요청률, 메모리 스톨, GPU 유휴 시간, 테일 레이턴시는 인프라가 실제로 어디에서 대기하는지 보여준다.

합성 벤치마크는 아키텍처 차이를 분리하기 때문에 여전히 유용하다. 하지만 고객이 중요하게 여기는 운영 지표를 정규화된 점수가 대체하면 오해를 부를 수 있다.

EPYC 9996은 256코어, 1 TB 캐시, 16개 메모리 채널을 하나의 소켓에 담아 서버 논의를 바꾼다. 이는 최종 경쟁 순위와 무관하게 중요한 엔지니어링 성과다.

AMD의 가장 대담한 주장은 여전히 주장에 머물러 있다. Nvidia의 효율성 서사 역시 더 폭넓은 독립 테스트를 기다리고 있으며, Intel은 기존 배포 기반과 또 다른 제품 대응책을 갖추고 있다.

유용한 질문은 AMD, Nvidia, Intel 중 누가 모든 벤치마크에서 이기느냐가 아니다. 특정 데이터센터에서 가장 비용이 큰 병목을 제거하는 플랫폼이 무엇이냐는 것이다.

시스템을 선택하기 전에 벤더에 전체 구성과 반복 가능한 테스트 방법을 요청해야 한다. 그런 다음 현실적인 부하에서 전체 워크로드 처리량, 랙 전력, 지연 시간, 가속기 활용률을 측정해야 한다.

그 증거가 EPYC 9996이 AI 인프라를 재편할지, 아니면 신중하게 선택된 차트 세트에서만 승리할지를 결정할 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page