AMD의 Google 표준 베팅, Vulcano의 AI 네트워킹 시험대에서 Nvidia와 맞붙다
AMD는 대규모 GPU 클러스터를 위한 긴밀하게 통합된 네트워킹에서 Nvidia가 앞서고 있는 가운데, 800 Gbps Pensando Vulcano AI NIC를 공개했다. AMD와 Google의 연결이 중요한 이유는 두 회사가 인프라 구매자에게 더 많은 하드웨어 선택지를 제공하려는 개방형 인터커넥트 표준을 지지하기 때문이다. 다만 Google은 Vulcano 배포 계획을 발표하지 않았다.
Vulcano는 AI 데이터 센터 내부의 비용 부담이 큰 문제를 겨냥한다. 네트워크 혼잡, 패킷 손실 또는 느린 복구로 서버 간 통신이 지연되면 가속기가 유휴 상태에 놓일 수 있다. AMD는 Vulcano 카드 3장이 GPU당 2.4테라비트/초의 스케일아웃 대역폭을 제공할 수 있다고 밝혔다.
이 수치는 AMD에 분명한 헤드라인을 제공하지만, 자동적인 승리를 뜻하지는 않는다. Nvidia는 이미 GPU, Spectrum-X Ethernet, InfiniBand, NVLink, 스위치 및 네트워킹 소프트웨어를 결합한 검증된 조합을 판매하고 있다. Vulcano는 단일 공급업체의 완전한 스택을 요구하지 않으면서도 개방형 프로그래머블 Ethernet 접근 방식이 이에 견줄 만한 운영 일관성을 제공할 수 있음을 입증해야 한다.
AMD Pensando Vulcano 800에서 달라진 점
Vulcano는 GPU 선택 후 덧붙이는 부속품이 아니라 AMD의 랙 스케일 AI 플랫폼에서 네트워킹을 핵심 요소로 끌어올린다.
AMD는 2026년 7월 23일 Pensando Vulcano 800 AI NIC의 세부 사항을 공개했다. 이 어댑터는 로컬 스케일업 링크가 실질적 한계에 도달한 뒤 서버와 랙 전반의 가속기를 연결하는 스케일아웃 네트워킹을 위해 설계됐다.
각 카드는 800 Gbps 네트워크 연결을 제공한다. AMD는 하나의 GPU에 최대 3개의 NIC를 할당하는 구성을 지원하며, 이를 통해 광고한 2.4 Tbps의 총 대역폭을 구현한다.
이 구성은 여러 가속기에 하나의 네트워크 어댑터를 공유 엔드포인트로 사용하는 방식과 다르다. 여러 개의 독립적인 링크는 가용 대역폭을 늘리는 동시에 클러스터 내 트래픽에 둘 이상의 경로를 제공할 수 있다.
AMD는 이를 멀티플레인 아키텍처라고 부른다. 네트워크 플레인은 자체 링크와 스위칭 리소스를 포함하는 독립적인 데이터 경로다. 트래픽을 여러 플레인으로 분산하면 장애가 발생한 링크나 혼잡한 경로의 영향을 제한할 수 있다.
회사는 Vulcano가 스위칭 비용을 최대 33%까지 줄일 수 있다고도 밝혔다. AMD는 이 추정치가 모든 배포 환경에서의 보편적 절감이 아니라, 자사 레퍼런스 구성에서 케이블과 트랜시버 수가 줄어든 데 따른 것이라고 설명했다.
성능 주장에도 같은 단서가 필요하다. AMD는 Vulcano가 AI 작업 완료 시간을 최대 13% 개선할 수 있다고 말한다. 이 결과는 특정 워크로드와 시스템 가정을 바탕으로 한 회사 벤치마크다.
어느 비율도 모든 클러스터에서 독립적으로 검증된 성능으로 받아들여서는 안 된다. 구매자는 스위치, 광학 장비, 토폴로지, 소프트웨어 버전, 장애 동작 및 가속기 활용률을 포함한 워크로드 수준의 테스트가 필요하다.
그럼에도 기반 메커니즘은 신뢰할 만하다. 분산 학습은 가속기 사이에서 모델 파라미터와 중간 결과를 반복적으로 교환한다. 하나의 경로가 지연되면 집단 연산 전체가 대기하게 되어 값비싼 GPU가 다른 GPU를 기다리는 상황이 발생할 수 있다.
분산 추론은 또 다른 트래픽 패턴을 만든다. 사용자 수요가 변하는 가운데 요청, 모델 상태 및 캐시된 데이터를 여러 시스템 간에 이동시킬 수 있다. 예측 가능한 지연 시간은 최고 처리량만큼 중요할 수 있다.
Vulcano는 프로그래머블 전송 로직, 혼잡 제어, 장애 격리 및 서비스 중 진단 기능으로 이러한 패턴을 다룬다. AMD는 네트워크 실리콘을 교체하지 않고도 운영자가 소프트웨어를 통해 이러한 동작의 일부를 업데이트할 수 있다고 밝혔다.
이 NIC는 3세대 프로그래머블 P4 엔진을 사용한다. P4는 네트워크 장치가 패킷을 처리하는 방식을 정의하기 위한 언어이자 아키텍처다. 이를 통해 공급업체는 하드웨어가 지원하는 범위 안에서 선택된 포워딩 및 전송 동작을 변경할 수 있다.
AMD의 Vulcano 설계에는 PCIe 및 UALink 연결 옵션도 포함된다. 이 유연성은 서로 다른 랙 설계에서 어댑터를 CPU 또는 가속기에 연결할 수 있게 한다.
따라서 이 제품은 단순히 더 빠른 Ethernet 포트 이상의 의미를 지닌다. AMD는 GPU, CPU, 네트워킹 실리콘, 개방형 전송 기술 및 관리 소프트웨어를 하나의 랙 스케일 시스템으로 조율하려 하고 있다.
AMD와 Google의 표준 연계가 중요한 이유
AMD와 Google의 관계는 표준 동맹이며, Google Cloud가 Vulcano를 프로덕션용으로 선택했다는 증거는 아니다.
AMD와 Google은 2024년 Ultra Accelerator Link 프로모터 그룹을 출범시킨 초기 기업들에 속했다. Broadcom, Cisco, Hewlett Packard Enterprise, Intel, Meta 및 Microsoft도 참여했다.
UALink는 컴퓨팅 포드 내부의 가속기 간 스케일업 통신을 겨냥한다. 스케일업 네트워킹은 긴밀하게 연결된 가속기 도메인을 구성하는 반면, 스케일아웃 네트워킹은 더 큰 패브릭 전반에서 여러 서버 또는 도메인을 연결한다.
이들 역할은 시스템 경계에서 겹치지만 서로 대체할 수는 없다. Vulcano는 주로 스케일아웃 및 스케일어크로스 트래픽을 처리한다. UALink 인터페이스는 신흥 개방형 랙 아키텍처에서 가속기에 직접 연결하는 데 도움을 준다.
따라서 AMD와 Google이라는 키워드는 오해를 불러일으킬 수 있다. Google이 Vulcano를 공동 설계했거나, 이 NIC를 구매했거나, Google Cloud 용량을 이에 할당하기로 했다는 검증된 발표는 없다.
Google의 중요성은 하이퍼스케일 운영자이자 표준 참여자로서의 위치에서 나온다. Google의 참여는 대규모 AI 시스템의 트래픽, 신뢰성 및 플릿 관리 요구를 이해하고 있기 때문에 개방형 인터커넥트 작업에 더 큰 의미를 부여한다.
UALink 컨소시엄은 하나의 포드 안에서 최대 1,024개의 가속기를 연결하기 위한 첫 번째 사양을 발표했다. 여러 클라우드 운영자와 칩 공급업체의 지원은 이 표준이 하나의 공급업체에 의존할 위험을 줄일 수 있다.
Vulcano는 시스템 간 통신을 위한 Ultra Ethernet도 지원한다. UEC 사양은 AI 및 대규모 고성능 컴퓨팅을 위한 Ethernet 기반 통신 스택을 정의한다.
Ultra Ethernet은 단순한 원시 링크 속도 이상의 변화를 가져온다. 이는 긴밀하게 동기화된 워크로드에 필요한 패킷 전달, 혼잡 관리, 멀티패싱, 보안 및 통신 의미론을 다룬다.
AMD는 Multipath Reliable Connection, 즉 MRC도 추진하고 있다. 이 전송 기술은 신뢰성 있는 전달을 유지하면서 여러 경로에 데이터를 분산하고, 혼잡이나 장애에 대응할 수 있다.
AMD는 대규모 학습 환경을 위해 OpenAI와 함께 MRC를 공동 개발했다고 밝혔다. 회사는 이전 Pollara 400 NIC에 이 전송 기술을 구현했으며, 최신 플랫폼이 정식 출시되면 Vulcano도 이를 지원할 것이라고 말한다.
AMD의 MRC 구현에 따르면, Pollara는 회사 연구실에서 Instinct MI350 및 MI355 클러스터와 함께 검증됐다. AMD는 OpenAI가 이 검증에 참여했다고 밝혔다.
MRC는 IPv6 기반 세그먼트 라우팅과 함께 작동할 수 있어 운영자에게 패킷 경로에 대한 명시적 제어권을 제공한다. 또한 동등 비용 멀티패스 라우팅 및 동적 부하 분산과 함께 사용할 수도 있다.
이러한 적응성은 AMD의 더 큰 주장을 뒷받침한다. 운영자는 가속기 클러스터 주변의 모든 스위치, 케이블 및 관리 프로세스를 교체하지 않고도 새로운 전송 동작을 도입할 수 있어야 한다.
Google의 표준 참여는 이 주장을 강화하지만, AMD의 제품 주장을 검증하지는 않는다. 사양은 공통 동작을 정의하지만, 프로덕션 배포는 구현 품질을 드러낸다.
문서화된 표준만으로는 혼잡 상황에서 안정적인 작업 시간을 보장할 수 없다. 진단 도구가 장애를 신속히 식별한다는 점이나 서로 다른 공급업체가 모든 선택 기능을 동일하게 해석한다는 점도 증명하지 못한다.
따라서 구매자에게 AMD와 Google의 이야기는 전략적 정렬에 관한 것이다. 두 회사 모두 폐쇄형 가속기 패브릭의 대안을 지지해 왔지만, Vulcano는 측정 가능한 클러스터 성능으로 채택을 이끌어내야 한다.
이 구분은 조달팀에 중요하다. 이들은 Vulcano를 Google이 보증한 네트워크 카드가 아니라, 새롭게 형성되는 멀티벤더 환경 속의 AMD 제품으로 평가해야 한다.
Vulcano의 핵심은 대역폭과 프로그래머블 기능의 결합
Vulcano의 가장 강력한 기술적 논거는 800 Gbps 자체가 아니라 다중 경로, 프로그래머블 전송 기술 및 신속한 장애 복구의 조합이다.
AI 네트워킹은 많은 엔드포인트 전반의 동기화된 통신을 수반한다. 학습 중 집단 연산은 참여하는 모든 가속기가 생성한 데이터를 결합하거나 재분배한다.
하나의 플로우가 혼잡에 부딪히면 전체 학습 단계가 느려질 수 있다. 나머지 GPU는 로컬 작업을 마칠 수 있지만, 집단 통신이 완료될 때까지 다음 단계로 진행할 수 없다.
기존 Ethernet은 흔히 식별 정보의 해시를 이용해 플로우를 여러 경로에 분산한다. 다른 경로에 사용되지 않은 용량이 있어도 대규모 플로우가 혼잡한 경로에 계속 갇힐 수 있다.
MRC는 여러 경로를 더욱 의도적으로 사용하도록 설계됐다. 트래픽을 여러 부분으로 나누고, 경로 상태에 반응하며, 애플리케이션이 전체 통신을 다시 시작하지 않고도 복구할 수 있다.
Vulcano의 프로그래머블 패킷 처리 엔진은 이러한 제어의 일부를 네트워크 엣지 가까이에 배치한다. NIC는 각 서버로 들어오고 나가는 트래픽을 관찰하기 때문에 이 위치는 중요하다.
이 카드는 클러스터가 작동하는 동안에도 장애를 격리하고 진단을 수행할 수 있다. AMD는 이러한 기능이 복구 시간을 단축하고 일부 클러스터 전반의 유지보수 기간을 피할 수 있다고 밝혔다.
클러스터 규모가 커질수록 이러한 기능의 가치는 커진다. 수천 개 구성 요소를 가진 시스템에서는 각 구성 요소의 개별 신뢰성이 높더라도 링크, 광학 장비, 펌웨어 및 스위치 장애가 일상적으로 발생한다.
네트워크는 하나의 장애를 멈춘 작업으로 키우기보다 예측 가능하게 성능을 저하시켜야 한다. 여러 플레인은 대체 경로를 제공하고, 전송 로직은 트래픽이 이들 경로를 어떻게 이동할지 결정한다.
GPU당 3개의 800 Gbps NIC는 상당한 물리적 용량을 제공한다. 그러나 총 대역폭이 모든 워크로드가 유용한 데이터 2.4 Tbps를 지속적으로 전송한다는 뜻은 아니다.
GPU, 호스트 인터페이스, 집단 라이브러리, 토폴로지 및 원격 엔드포인트 모두가 트래픽을 효율적으로 공급해야 한다. 프로토콜 오버헤드와 워크로드 동기화도 애플리케이션 수준의 처리량을 낮춘다.
AMD의 아키텍처는 PCIe와 UALink 호스트 연결을 모두 지원한다. PCIe는 CPU와 주변기기를 위한 익숙한 인터페이스로 남아 있다. UALink는 하나의 GPU 공급업체에 덜 의존하는 직접 가속기 연결을 겨냥한다.
Vulcano는 Instinct MI400 시리즈 가속기와 EPYC Venice 프로세서를 사용하는 AMD의 랙 스케일 설계 Helios와도 연계된다. AMD는 이 NIC를 Helios의 기본 스케일아웃 네트워킹 구성 요소로 배치했다.
이 통합은 AMD에 검증에 대한 더 많은 통제권을 제공한다. 회사는 펌웨어, ROCm 통신 라이브러리, 가속기 동작 및 네트워크 텔레메트리를 조율된 플랫폼으로 테스트할 수 있다.
그러나 프로그래머블 기능에는 운영 비용이 따른다. 변경 가능한 패킷 파이프라인은 엄격한 버전 관리, 테스트, 가시성 및 롤백 프로세스를 필요로 한다.
네트워크팀은 작업 실패 당시 어떤 펌웨어와 전송 설정이 활성화되어 있었는지 알아야 한다. 또한 혼잡 이벤트를 애플리케이션 성능과 연계하는 도구도 필요하다.
P4라는 명칭이 이러한 요구 사항을 없애지는 않는다. 이는 AMD와 승인된 운영자에게 지원되는 패킷 처리 기능의 동작 방식을 변경할 수 있는 더 많은 여지를 제공할 뿐이다.
개방형 표준은 또 다른 구현 과제를 낳는다. 두 제품이 동일한 사양 지원을 표방하더라도 선택 기능, 성능 한계 또는 관리 인터페이스에서는 차이를 보일 수 있다.
따라서 상호운용성 테스트가 결정적이다. 구매자는 Vulcano가 타사 스위치, 광 모듈, 라우팅 소프트웨어 및 모니터링 시스템과 안정적으로 작동한다는 근거를 필요로 한다.
AMD AI NIC 페이지는 하이퍼스케일러와 클라우드 공급업체를 강조한다. 이들 고객은 대규모 환경에서 복잡한 네트워크 동작을 테스트할 수 있는 엔지니어링 팀을 보유하고 있다.
기업 도입은 더 느리게 진행될 수 있다. 많은 기업은 가속기, NIC, 스위치, 펌웨어 및 전송 설정을 독자적으로 통합할 인력이 부족하기 때문에 완성형 시스템을 구매한다.
Vulcano는 검증된 Helios 시스템이나 클라우드 서비스를 통해서도 이러한 조직을 지원할 수 있다. 개방성의 수준은 얼마나 많은 공급업체가 지원되는 구성을 출시하는지에 달려 있다.
이것이 제품의 실질적 시험대다. 프로그래머블 기능은 과도한 통합 작업을 고객에게 전가하지 않으면서 네트워크 적응 비용을 낮춰야 한다.
Nvidia의 통합 스택이 여전히 주요 경쟁자
AMD는 단순히 또 다른 800 Gbps Ethernet 어댑터와 경쟁하는 것이 아니라, AI 시스템 아키텍처에 대한 Nvidia의 통제력에 도전하고 있다.
Nvidia는 스케일업 도메인 내에서 NVLink로 가속기를 연결할 수 있다. 이어 서버와 랙 전반의 통신을 위해 Quantum InfiniBand 또는 Spectrum-X Ethernet을 제공한다.
Spectrum-X는 Nvidia 스위치, SuperNIC, 혼잡 제어, 텔레메트리 및 소프트웨어를 결합한다. Nvidia는 자사 GPU 플랫폼과 밀접하게 연결된 엔드투엔드 시스템으로 이 구성 요소들을 테스트한다.
이러한 통합은 책임 소재를 단순화할 수 있다. AI 작업 성능이 기대에 미치지 못할 경우 고객은 하나의 공급업체에 가속기, 네트워크 어댑터, 스위치, 펌웨어 및 통신 라이브러리 점검을 요청할 수 있다.
Nvidia는 Spectrum-X Ethernet이 기존 Ethernet 대비 네트워크 성능을 1.6배 향상할 수 있다고 말한다. AMD의 수치와 마찬가지로 이는 특정 구성에 기반한 공급업체의 주장이다.
Spectrum-X는 SONiC를 비롯한 개방형 네트워크 운영체제도 지원한다. 따라서 경쟁 구도는 개방형 Ethernet과 완전히 폐쇄된 대안의 단순한 대결이 아니다.
실제 차이는 통제권과 구성 요소 선택에 있다. Nvidia는 자사 실리콘과 소프트웨어의 정해진 조합을 최적화하는 반면, AMD는 여러 공급업체에 걸친 프로그래머블 장치와 업계 사양을 강조한다.
긴밀한 통합은 일관된 동작을 만들 수 있지만 한 공급업체의 출시 일정에 대한 의존도를 높일 수 있다. 멀티벤더 설계는 선택지를 더 제공할 수 있지만 인증 작업은 더 어려워진다.
Vulcano는 개방형 접근 방식이 예측 가능한 성능을 희생하지 않는다는 점을 입증해야 한다. 최고 처리량만으로는 이 문제를 해결할 수 없다.
AI 클러스터 운영자는 작업 완료 시간, 테일 레이턴시, 장애 복구, 실질적인 GPU 활용률, 테넌트 간 성능 격리를 살핀다. 전력 사용량과 필요한 광 모듈 수 역시 추적한다.
AMD의 13퍼센트 완료 시간 주장은 애플리케이션 결과를 측정한다는 점에서 의미가 있다. 그러나 공개 자료만으로는 Spectrum-X 또는 InfiniBand 대비 보편적 우위를 입증하지 못한다.
33퍼센트 스위칭 비용 주장은 신중한 해석이 필요하다. 케이블과 트랜시버 수가 줄면 장비 지출, 설치 작업 및 장애 지점을 줄일 수 있다.
그러나 GPU당 NIC 3개 구성은 다른 측면에서 어댑터, 호스트 인터페이스 및 관리 복잡성을 늘릴 수 있다. 전체 결과는 토폴로지와 비교 기준에 따라 달라진다.
Nvidia는 이미 배포된 시스템을 통해 또 다른 이점을 지닌다. 자사 네트워킹 제품은 대규모 AI 클러스터에서 이미 운영되고 있어, 고객에게 구현 사례와 확립된 지원 관행을 제공한다.
AMD 역시 경험 없이 진입하는 것은 아니다. Pensando는 이전에 DPU와 Pollara AI NIC를 출시했으며, AMD는 클라우드 공급업체 및 시스템 공급업체와 데이터센터 네트워킹 분야에서 협력해 왔다.
그럼에도 Vulcano는 여러 다른 변화 요소와 함께 등장한다. Helios는 새로운 Instinct 가속기, EPYC 프로세서, UALink 연결 및 진화 중인 개방형 소프트웨어 스택을 도입한다.
어느 계층에서든 문제가 발생하면 인증이 지연될 수 있다. 고객은 다른 설계가 더 나은 구성 요소 유연성을 약속하더라도 성숙한 구성을 선택할 수 있다.
위험은 단기적인 학습 용량을 추구하는 조직에서 가장 크다. 이들의 우선순위는 미래의 공급업체 선택 폭을 극대화하는 것보다 클러스터를 신속히 가동하는 데 있는 경우가 많다.
장기적 관점의 구매자는 개방형 접근 방식을 더 높이 평가할 수 있다. 인프라는 여러 가속기 세대에 걸쳐 지속되는 반면, 모델과 통신 패턴은 훨씬 빠르게 변한다.
Vulcano의 P4 프로그래머블 기능은 AMD가 이러한 변화에 대응하는 데 도움이 될 수 있다. 새로운 혼잡 제어 또는 전송 동작은 하드웨어 역량 범위 내에서 소프트웨어를 통해 제공될 수 있다.
Nvidia도 자사 스택을 업데이트할 수 있다. 더 많은 구성 요소를 통제한다는 이점도 있어 시스템 전반의 조율된 변경을 가속할 수 있다.
따라서 핵심 경쟁은 운영 측면에 있다. AMD는 표준 기반의 선택지가 Nvidia 통합 플랫폼의 신뢰성, 도구 및 검증 수준에 필적할 수 있음을 보여야 한다.
개방형 인터커넥트 그룹에 Google이 참여한다는 점은 대안이 업계의 진지한 지원을 받고 있다는 신뢰를 높인다. 그러나 이는 Nvidia의 설치 기반이나 실행 우위를 없애지는 않는다.
AMD가 여전히 입증해야 할 것
가장 큰 불확실성은 Vulcano가 공개한 성과가 현실적인 멀티벤더 클러스터 전반의 독립 테스트에서도 유지되는지 여부다.
AMD의 공개 수치는 최대 역량과 선별된 비교 결과를 설명한다. 아직 학습, 분산 추론 및 혼합 워크로드 전반에 걸친 폭넓은 타사 결과를 제공하지는 않는다.
2.4 Tbps 수치는 3개의 800 Gbps NIC에서 나오는 총 스케일아웃 대역폭이다. 하나의 GPU 애플리케이션이 해당 데이터 전송률을 지속적으로 받는다는 보장은 아니다.
독립 리뷰는 혼잡 상황에서의 유효 처리량을 측정해야 한다. 또한 레이턴시 분포, 패킷 복구 동작 및 가속기 유휴 시간도 보고해야 한다.
장애 테스트는 정상 상태의 속도만큼 중요하다. 리뷰어는 분산 작업이 활성 상태로 유지되는 동안 링크를 비활성화하고, 패킷 손실을 유발하며, 스위치를 재시작하고, 경로 레이턴시를 바꿔야 한다.
그다음 MRC에는 상호운용성 근거가 필요하다. AMD는 전송 방식이 여러 포워딩 접근 방식을 지원한다고 말하지만, 고객은 NIC, 스위치, 펌웨어 및 라우팅 소프트웨어의 검증된 조합을 원할 것이다.
정식 출시도 또 다른 미해결 세부 사항이다. AMD는 Vulcano가 Instinct MI400-series 클러스터용으로 인증되고 있다고 밝혔으며, Helios는 2026년 중 제공될 것으로 예상된다.
인증은 광범위한 배포와 같지 않다. 제품이 설계 목표를 충족하더라도 시스템 공급업체, 클라우드 공급업체 및 기업은 여전히 수개월의 검증이 필요할 수 있다.
핵심 키워드가 직접적인 관계를 시사하기 때문에 Google 관련 문제는 특히 중요하다. Google은 UALink를 지원해 왔지만, Google Cloud가 Vulcano 기반 인스턴스를 제공할 것이라는 공개 근거는 없다.
Google의 배포는 의미 있는 도입 신호가 될 것이다. 이는 내부 네트워킹 전문성을 보유한 하이퍼스케일러가 Vulcano를 프로덕션 환경에 적합하다고 판단했음을 보여줄 것이다.
그러한 발표가 없다고 해서 제품에 불리한 증거가 되는 것은 아니다. 하이퍼스케일러는 여러 아키텍처를 평가하는 경우가 많고, 일부 배포만 공개한다.
소프트웨어 준비 상태도 면밀히 검토해야 한다. ROCm은 네트워크와 집단 통신을 조율하는 한편, 스케줄러와 운영 팀에 유용한 텔레메트리를 제공해야 한다.
빠른 NIC는 비효율적인 집단 통신 라이브러리나 부실한 워크로드 배치를 보완할 수 없다. 운영자가 일관된 작업 시간을 원한다면 네트워크 인식은 오케스트레이션 계층까지 도달해야 한다.
보안 역시 주목할 만하다. 프로그래머블 장치는 구성 가능성을 확대하며, 모든 펌웨어 경로에는 서명, 업데이트, 접근 및 롤백에 대한 통제가 필요하다.
개방형 사양이 자동으로 개방형 관리를 만들어 내는 것은 아니다. 고객은 어떤 기능에 AMD 도구가 필요한지, 그리고 타사 관측성 제품이 필수 텔레메트리에 접근할 수 있는지를 검토해야 한다.
비용 주장은 완전한 시스템 비용 산정이 필요하다. 공정한 비교에는 어댑터, 스위치, 케이블, 광 모듈, 랙 공간, 전력, 지원 및 엔지니어링 인력이 포함돼야 한다.
Vulcano를 평가하는 팀은 검색 가능한 engineering knowledge base를 통해 벤치마크 기록을 보존해야 한다. 펌웨어 버전과 토폴로지 세부 사항은 이후 비교 결과의 유용성을 좌우할 수 있다.
조달 팀은 스케일업과 스케일아웃 요구사항도 구분해야 한다. UALink, Ultra Ethernet, MRC 및 PCIe는 데이터 경로의 서로 다른 부분을 다룬다.
이러한 계층을 혼동하면 일관된 배포 없이 인상적인 사양만 만들 수 있다. 구매자는 한 가속기에서 관련된 모든 엔드포인트까지 트래픽이 어떻게 이동하는지 보여 주는 아키텍처를 필요로 한다.
AMD의 기술적 방향은 타당하다. 과제는 그 방향을 고객이 주문, 배포, 모니터링 및 복구할 수 있는 반복 가능한 시스템으로 전환하는 데 있다.
세 가지 신호가 Vulcano의 AI 네트워킹 경쟁력을 결정할 것
Vulcano의 입지는 독립적인 클러스터 결과, 실명으로 공개된 프로덕션 고객, 검증된 멀티벤더 상호운용성을 통해 더 분명해질 것이다.
첫 번째 신호는 완성된 Helios 시스템에서의 독립 테스트다. 결과는 여러 네트워크 조건에서 작업 완료 시간, GPU 활용률, 테일 레이턴시 및 복구 성능을 비교해야 한다.
유용한 테스트는 모든 구성 요소와 소프트웨어 버전을 식별할 것이다. 링크에서 측정된 대역폭과 AI 애플리케이션에 실제로 전달되는 처리량을 구분해야 한다.
여러 워크로드에서 강력한 결과가 나온다면 Vulcano가 통신 병목 현상을 제거한다는 AMD의 주장을 뒷받침할 수 있다. 결과가 약하거나 일관되지 않다면 주목받는 대역폭 수치의 가치는 낮아질 것이다.
두 번째 신호는 실명으로 공개된 하이퍼스케일 또는 클라우드 배포다. Oracle은 AMD 랙 스케일 인프라를 논의했으며, OpenAI는 MRC 검증 과정에서 AMD와 협력해 왔다.
amd google 검색 관심도와 개방형 인터커넥트 노력에서의 역할 때문에 Google은 특히 중요한 사례가 될 것이다. 그러나 독자는 직접적인 배포 발표를 기다려야 한다.
고객은 단순 평가 이상의 내용을 설명해야 한다. 프로덕션 제공 여부, 클러스터 규모, 지원 워크로드 및 서비스 수준 기대치는 더 강력한 근거를 제공할 것이다.
세 번째 신호는 올-AMD 레퍼런스 설계를 넘어선 상호운용성이다. Vulcano는 여러 스위치 공급업체, 네트워크 운영체제, 광 모듈 및 관리 플랫폼과 작동해야 한다.
성공적인 상호운용성은 개방형 AI 네트워킹의 경제적 근거를 강화할 것이다. 고객은 완전한 클러스터를 재설계하지 않고도 일부 구성 요소를 바꿀 수 있게 된다.
Helios가 폐쇄형 레퍼런스 구성으로 잘 작동하더라도 호환성이 제한적이라면 그 근거는 약화될 것이다. 개방형 사양에 의존하더라도 실제로는 통합형 시스템이 될 수 있다.
AMD가 이 검증을 완료하는 동안 Nvidia는 가만히 있지 않을 것이다. Spectrum-X는 이미 표준 기반 Ethernet과 주변 플랫폼에 대한 Nvidia의 통제를 결합한다.
따라서 향후 비교에는 두 회사의 최신 제품을 사용해야 한다. 구형 Ethernet을 상대로 한 승리는 Nvidia의 최신 패브릭 대비 우위를 입증하지 못한다.
개발자에게 미치는 즉각적인 영향은 여전히 간접적일 것이다. 대부분은 클라우드 인스턴스, 관리형 클러스터 또는 인프라 팀이 선택한 시스템을 통해 Vulcano를 접하게 된다.
그럼에도 네트워킹은 학습 시간, 추론 레이턴시, 용량 가용성 및 서비스 비용에 영향을 미친다. 패브릭 계층의 개선은 어떤 AI 워크로드가 경제적으로 실현 가능한지를 바꿀 수 있다.
기업 구매자는 포트 속도 요약이 아니라 워크로드 수준의 근거를 공급업체에 요구해야 한다. 또한 공급업체 전반에 걸친 장애 테스트와 명확한 지원 경계를 요청해야 한다.
핵심 질문은 더 이상 Ethernet이 AI 트래픽을 처리할 수 있는지 여부가 아니다. 지연된 경로 하나가 수천 개의 가속기를 낭비하게 되는 규모에서, 개방형 Ethernet 시스템이 일관된 결과를 제공할 수 있는지가 관건이다.
AMD는 이제 Vulcano, MRC, Ultra Ethernet, Helios를 통해 구체적인 답을 제시했다. Google과 다른 표준 파트너들은 개방형 경로의 신뢰도를 높이지만, AMD의 실행력을 보장하지는 않는다.
최초의 독립 Helios 벤치마크, 최초로 명명된 Vulcano 클라우드 배포, 그리고 최초의 광범위한 상호운용성 보고서를 지켜봐야 한다. 이 세 가지 신호가 AMD의 표준 중심 전략이 실제 운영 환경의 대안으로 자리 잡을지, 아니면 매력적인 사양에 머물지를 결정할 것이다.



