ClusterMAX 3.0 평가가 돌아오면서 저가 GPU 클라우드는 더 কঠ কঠ한 시험대에 올랐다
ClusterMAX 3.0 평가는 단순한 가용성과 비용 주장으로 인프라를 판매하는 업계 상황에서도 77개 GPU 클라우드 공급업체를 더 폭넓게 검증했다. SemiAnalysis는 관리형 클러스터를 테스트하고 200명 이상의 neocloud 사용자와 인터뷰한 뒤, 2026년 9월 23일 새 평가를 발표했다.
핵심 결론은 특정 공급업체가 가장 빠른 GPU를 보유하고 있다는 것이 아니다. 실제로 활용 가능한 컴퓨팅 용량은 GPU를 둘러싼 모든 요소에 달려 있다는 점이다. 네트워크, 스토리지, 스케줄러, 모니터링, 보안, 지원 체계가 고가의 가속기가 유용한 작업을 수행하게 할지, 아니면 유휴 상태로 남게 할지를 결정한다.
이러한 구분은 주로 낮은 임대 요금이나 부족한 하드웨어 접근성을 앞세워 경쟁하는 공급업체에 압박을 가한다. CoreWeave는 여전히 기술적 기준점으로 남아 있으며, Nebius도 최상위 등급에 합류했다. Google Cloud 역시 개선됐지만, 익숙한 여러 공급업체는 순위가 내려가거나 테스트 대상에서 제외됐다.
ClusterMAX 3.0 평가는 77개 공급업체의 기준을 높인다
ClusterMAX 3.0은 GPU 클라우드 평가를 가속기 이름과 광고된 요금의 비교가 아니라 운영 역량 시험으로 전환한다.
새 버전은 77개 등급 대상 공급업체를 다루며, SemiAnalysis의 더 넓은 시장 관찰 범위는 323개 기업으로 확대됐다. 이전 주요 릴리스는 209개 기업을 추적하면서 84개 공급업체에 등급을 매겼다. 최신 평가에서 메달 등급을 받은 공급업체는 19곳뿐이다.
이 수치는 신중하게 해석해야 한다. 등급 대상 그룹이 작아졌다고 해서 시장이 반드시 축소됐다는 뜻은 아니다. SemiAnalysis는 여전히 테스트할 수 없거나, 충분한 관련성이 없거나, 제한된 시장에 서비스를 제공하거나, 적격 관리형 서비스를 출시하지 않은 추가 기업을 추적한다.
평가는 관리형 클러스터에 초점을 맞춘다. 이는 공급업체가 물리 서버 제공을 넘어 중요한 운영 계층을 담당하는 환경이다. 이 작업에는 오케스트레이션, 모니터링, 장애 감지, 하드웨어 교체, 스토리지, 네트워크 관리, 지속적인 기술 지원이 포함될 수 있다.
평가 범위에서는 여러 인접 사업 영역이 제외된다. 단순 베어메탈 임대, 토큰 기반 추론 서비스, 사후 학습 플랫폼, 에이전트 샌드박스 서비스는 동등한 평가를 받지 않는다. 기업은 유용한 GPU 인프라를 운영하면서도 강력한 관리형 클러스터 공급업체 자격을 얻지 못할 수 있다.
이 경계가 중요한 이유는 이제 “GPU cloud”라는 용어가 매우 다른 제품들을 포괄하기 때문이다. 한 공급업체는 서버만 제공하고 고객이 모든 소프트웨어 계층을 관리하기를 기대할 수 있다. 다른 공급업체는 스케줄러를 유지하고, 장애 노드를 조사하며, 대체 용량을 상시 확보할 수 있다.
SemiAnalysis는 이러한 차이를 10개 범주로 평가한다. 보안, 라이프사이클 관리, 오케스트레이션, 스토리지, 네트워킹, 안정성, 모니터링, 가격, 파트너십, 가용성이 포함된다. 공개된 평가 기준에는 각 범주에서 기대되는 역량이 설명돼 있다.
그 결과 등급은 보편적 인증이 아니라 상대적 평가다. 공급업체는 현행 방법론에 따라 동종 업체보다 유리한 평가를 받아야 해당 위치를 얻는다. 따라서 서비스가 눈에 띄게 악화되지 않았더라도 기준이 높아지면 순위는 내려갈 수 있다.
ClusterMAX 3.0은 Bronze와 Underperforming 사이에 Participation Ribbon 범주를 추가했다. 15개 공급업체가 이 등급에 들어갔다. SemiAnalysis는 추천 관리형 클러스터에 기대되는 운영 성숙도에는 미치지 못하지만 기본 요구사항을 충족하는 서비스에 이 등급을 부여한다.
보고서는 최상위권에서도 눈에 띄는 변화를 보여줬다. Nebius는 CoreWeave와 함께 Gold에서 Platinum으로 올라섰다. Google Cloud는 Oracle과 함께 Gold에 합류했고, Azure는 Silver로 이동했다. GMI는 Bronze에서 Silver로 상승했다.
다른 변화는 덜 긍정적이었다. Crusoe는 Bronze로 내려갔고, Fluidstack은 SemiAnalysis가 충분한 검증을 완료하지 못해 Unavailable 범주에 들어갔다. Lambda, Firmus, TensorWave는 Silver를 유지했다.
이러한 변화는 보고서의 핵심 갈등을 보여준다. 공급업체는 새 GPU를 확보하고 대규모 시설을 발표할 수 있지만, 클러스터 생산성을 유지하는 덜 눈에 띄는 시스템에서는 여전히 뒤처질 수 있다.
전체 ClusterMAX 3.0 보고서는 순위표 이상의 의미를 갖는다. 기술 테스트를 고객 인터뷰, 계약상 기대치, 공급업체별 운영 결과와 연결한다.
이러한 조합은 최고 벤치마크 결과에 기반한 리더보드보다 구매자에게 더 강력한 출발점을 제공한다. 동시에 공급업체에는 고도화된 고객이 점점 더 기대하는 역량의 공개 체크리스트를 제시한다.
안정성은 최고 GPU 성능보다 더 중요하다
장애 부품이 계속 스케줄링되거나 작업이 반복적으로 재시작되거나 지원팀이 용량을 신속히 복구하지 못하면, 빠른 클러스터의 이점은 사라진다.
SemiAnalysis는 각 참가 공급업체에 GPU 32개를 요청했다. 선호 구성은 NVL72 배포 환경 내 8-GPU HGX 노드 4대 또는 4-GPU 노드 8대였다. 고대역폭 네트워킹과 두 가지 형태의 스토리지도 요청했다.
각 환경에는 최소 10테라바이트의 고성능 파일 스토리지와 최소 10테라바이트의 S3 호환 객체 스토리지가 필요했다. 공급업체에는 모니터링 대시보드 제공도 요청됐다.
테스트는 Slurm과 Kubernetes를 모두 다뤘다. Slurm은 대규모 컴퓨팅 작업에 널리 사용되는 스케줄러이며, Kubernetes는 클러스터 전반의 컨테이너화된 애플리케이션을 관리한다. SemiAnalysis는 각 환경에서 5일간의 사용 시간을 요청했지만, 공급업체는 해당 기간을 병렬로 운영할 수 있었다.
하드웨어 요구사항도 한 단계 진전됐다. SemiAnalysis는 Nvidia B200, B300, GB200, GB300 시스템과 AMD MI355X 인프라를 허용 가능한 것으로 간주했다. 이번 평가에서는 H100 시스템을 이전 세대로 취급했다.
절차는 구성 감사로 시작한다. 이 감사는 하드웨어 인벤토리, 펌웨어, 드라이버, 컨테이너 지원, 스케줄러 설정, 네트워킹, 스토리지, 모니터링, 보안을 점검한다. 공개된 클러스터 감사 도구는 통과, 경고, 실패, 건너뛴 검사를 보고한다.
이후 성능 테스트는 GPU 컴퓨팅, 네트워크 동작, 스토리지, 라이프사이클 운영, 학습, 추론을 검토한다. SemiAnalysis는 마이크로벤치마크와 클러스터 전반의 상호작용을 드러내기 위한 워크로드를 함께 사용한다.
학습 테스트에는 Llama 3.1 8B 사전학습과 mixture-of-experts 워크로드가 포함된다. mixture-of-experts 모델은 각 입력에 대해 선택된 구성 요소 네트워크를 활성화하므로, 가속기 간 통신 패턴에 높은 부담을 준다.
두 번째 워크로드는 독립된 GPU 벤치마크가 놓칠 수 있는 네트워크 문제를 드러내는 데 도움이 된다. 서버는 강력한 행렬 곱셈 결과를 낼 수 있지만, 클러스터는 노드 간 집단 통신 중 시간을 잃을 수 있다.
추론 테스트도 비슷한 목적을 수행한다. 컴퓨팅 중심, 메모리 중심, 통신 중심 조건을 검토한다. 네트워크가 지속적인 집단 테스트를 통과하지 못하면, 시스템은 대규모 환경에서 유효한 토큰 처리량을 유지할 수 없다.
ClusterMAX는 이후 속도를 넘어 안정성을 평가한다. SemiAnalysis는 GPU와 네트워크에 동시에 부하를 가하는 8시간 번인 테스트를 실행한다. 테스트는 온도, 전력, 클록 속도, 연산, 지연 시간, 대역폭, 연결성, 커널 오류를 추적한다.
동시 부하가 중요한 이유는 실제 워크로드가 여러 구성 요소를 함께 가열하기 때문이다. GPU와 네트워크를 따로 테스트하면 지속적인 클러스터 전체 부하에서 발생하는 열적 또는 전기적 상호작용에 따른 장애를 놓칠 수 있다.
평가자들은 장애도 주입한다. 합성 Nvidia 오류 메시지를 커널 로그에 넣거나 PCIe 브리지를 통해 실제 연결 장애를 유발할 수 있다. 이후 감지와 복구를 측정한다.
유능한 서비스는 장애 노드를 식별하고, 해당 노드에 작업을 스케줄링하는 것을 중단하며, 복구 절차를 시작해야 한다. 일반적인 HGX 클러스터의 경우 이상적인 대응에는 종종 영향을 받은 노드를 핫 스페어로 교체하는 작업이 포함된다.
랙 규모 NVL72 시스템은 더 어려운 문제를 만든다. GPU가 긴밀하게 연결된 NVLink 도메인을 공유하므로 운영자는 더 큰 랙에 영향을 주지 않고 작은 단위 하나만 교체할 수 없는 경우가 많다. 공급업체는 성능이 저하된 시스템을 위한 다른 운영 절차가 필요하다.
SemiAnalysis는 일반적으로 상태 점검이 2분 안에 비정상 노드를 발견할 것으로 기대한다. 이 목표는 “안정성”을 마케팅 문구에서 관찰 가능한 대응 프로세스로 전환한다.
장애 감지만으로는 충분하지 않다. 모니터링은 장애가 난 구성 요소, 영향을 받은 작업, 스케줄러 상태, 각 상태 점검의 최신성을 식별해야 한다. 기반 데이터가 오래됐는데도 녹색으로 표시되는 대시보드는 오히려 오도할 수 있다.
자동 복구는 또 다른 계층을 추가한다. 시스템은 노드를 격리하거나, GPU를 재설정하거나, 소프트웨어를 재시작하거나, 하드웨어 수리를 시작할 수 있다. 올바른 대응은 오류에 따라 달라지며, 무분별한 자동 재부팅은 정상 작업까지 파괴할 수 있다.
Nvidia는 다양한 장애 조건을 다루는 GPU 오류 코드를 문서화하고 있다. 중복되는 오류는 복구가 단순히 모니터링 소프트웨어를 설치하는 문제가 아니라 운영 판단의 문제임을 뜻한다.
이 때문에 최고 속도는 불완전한 구매 지표다. 구매자가 궁극적으로 얻는 것은 장애, 재시작, 운영 지연을 반영한 뒤 완료된 유용한 작업인 goodput이다.
연구자가 인프라 문제를 반복적으로 진단해야 한다면 더 저렴한 클러스터가 오히려 더 비싸질 수 있다. 손실 시간에는 유휴 GPU, 중단된 실험, 지연된 모델 출시, 제품 개발에서 이탈한 엔지니어링 노력이 포함된다.
저가 GPU 클라우드는 이제 총운영비와 경쟁한다
ClusterMAX 3.0은 구매 질문을 시간당 요금에서 신뢰할 수 있고 실제로 활용 가능한 컴퓨팅을 확보하는 비용으로 옮긴다.
공개 임대 요금은 여전히 비교하기 쉽다. 안정성, 지원 품질, 복구 시간은 조달 문서에 반영하기가 더 어렵다. 하지만 이러한 요인이 대규모 학습 작업의 최종 비용을 결정하는 경우가 많다.
모델 개발을 위해 멀티노드 클러스터를 임대하는 팀을 생각해 보자. GPU 하나의 장애는 동기화된 작업에 참여하는 모든 구성 요소의 속도를 늦출 수 있다. 흔히 straggler라고 불리는 하나의 지연 프로세스가 시스템의 나머지 부분을 기다리게 만든다.
성능이 떨어지는 동안에도 고객은 여전히 용량을 사용한다. 엔지니어는 로그를 검색하고, 노드를 격리하고, 테스트를 다시 실행하는 데 수 시간을 쓸 수 있다. 낮은 광고 요금은 이러한 낭비를 거의 막아주지 못한다.
CoreWeave는 SemiAnalysis가 핵심 범주 전반에서 클러스터의 강점을 확인했기 때문에 Platinum을 유지했다. 보고서는 상태 점검이 의도대로 작동했고, 대부분의 테스트가 광범위한 개입 없이 기대값에 도달했다고 설명한다.
이 회사는 GPU straggler 감지 기능도 추가했다. 모니터링 문서에 따르면, 이 기능은 통신 텔레메트리를 분석해 분산 작업을 늦추는 워커를 식별하는 데 도움을 준다.
이 기능은 프리미엄 서비스의 논리를 보여준다. 가치 있는 제품은 단순히 가속기에 접근하는 권한이 아니다. 사용자가 전체 플릿을 수동으로 검색하기 전에 미묘한 문제를 찾아내는 시스템이다.
Nebius는 이제 CoreWeave와 함께 Platinum에 합류했다. SemiAnalysis는 Nebius를 범주 전반에서 일관되게 강력하며 단기 클러스터 시장에서도 활발한 공급업체로 설명한다. 이러한 포지셔닝은 hyperscaler 규모의 약정을 할 수 없는 스타트업에 중요하다.
Google Cloud의 Gold 등급 진입은 또 다른 비교 지점을 제시한다. 하이퍼스케일러는 광범위한 인프라 경험, 더 폭넓은 보안 프로그램, 성숙한 서비스 포트폴리오를 갖추고 있다. 그러나 범용 플랫폼이 항상 모든 워크플로를 관리형 AI 클러스터에 맞춰 최적화하는 것은 아니다.
Oracle은 Gold 등급을 유지했으며 스케일아웃 네트워크 설계에 대한 평가를 받았다. 스케일아웃 네트워킹은 긴밀하게 통합된 단일 서버나 랙을 넘어 시스템을 연결해, 학습 작업이 훨씬 더 많은 GPU에 걸쳐 실행될 수 있도록 한다.
Azure는 Silver로 내려갔으며, 이 방법론에서는 기업 규모가 자동으로 최고의 관리형 클러스터 경험으로 이어지지 않음을 보여준다. ClusterMAX는 제공된 환경을 평가하며, 공급업체의 전체 엔지니어링 예산을 평가하지는 않는다.
이번 결과는 신생 네오클라우드에 관한 일반적인 가정에도 의문을 제기한다. 전문화는 AI 워크로드 중심의 서비스를 구축하는 데 도움이 될 수 있다. 하지만 그것이 우수한 오케스트레이션, 신뢰할 수 있는 스토리지, 최신 소프트웨어 또는 신속한 지원을 보장하지는 않는다.
일부 공급업체는 베어메탈 구매자에게 여전히 매력적이다. 대형 AI 연구소는 스케줄러, 모니터링, 복구를 관리할 수 있는 내부 팀을 보유한 경우가 많다. 이들 고객은 직접적인 제어를 선호하고 관리형 기능이 적은 환경을 감수할 수 있다.
소규모 연구소는 계산이 다르다. 이들은 네트워크 토폴로지, GPU 오류 처리, 분산 스토리지, 작업 스케줄링을 이해하는 전문가가 부족할 수 있다. 관리형 서비스는 이들이 쉽게 채용하기 어려운 전문성을 대신할 수 있다.
에이전트 기반 코딩은 이러한 구분을 복잡하게 만든다. SemiAnalysis는 코딩 에이전트가 누락된 문서와 반복적인 관리 업무를 처리하는 데 팀의 도움을 주었다고 밝혔다. 이는 경험 많은 운영자에게 관리 수준이 낮은 인프라를 더 수용 가능하게 만들 수 있다.
그러나 같은 에이전트는 잘못된 구성도 만들어냈다. 이들은 때때로 잘못된 네트워크를 선택하거나, 공유 스토리지 대신 로컬 스토리지를 테스트하거나, GPU 작업을 CPU 노드에 스케줄링했다.
따라서 AI 지원은 운영 지식의 가치를 없애지 않는다. 오히려 이미 원하는 결과를 이해하는 팀의 역량을 증폭한다. 경험이 부족한 사용자는 성능 테스트를 조용히 무효화하는 그럴듯한 지침을 받을 수 있다.
구매자 관점에서 실질적인 비교는 네 가지 층위로 나뉜다.
컴퓨팅 제공
공급업체는 약속한 가속기 세대와 구성을 제공하는가?
측정된 컴퓨팅 성능은 합리적인 기대치와 일치하는가?
클러스터 통합
네트워킹, 스토리지, Slurm, Kubernetes가 현실적인 부하에서 함께 제대로 작동하는가?
사용자는 광범위한 수동 튜닝 없이도 좋은 결과를 재현할 수 있는가?
운영 복구
플랫폼은 결함 있는 하드웨어를 감지해 스케줄링에서 제외하는가?
공급업체는 고객의 장기적인 개입 없이 사용 가능한 용량을 복원할 수 있는가?
상업적 책임성
계약은 다운타임, 인수 테스트, 서비스 크레딧, 해지 권리를 정의하는가?
물리적 수리가 필요할 때 공급업체는 명확하게 소통하는가?
이 프레임워크에서는 광고된 가격이 하나의 입력값일 뿐이다. 의미 있는 분모는 예약된 GPU 시간이 아니라 완료된 작업이다.
보안은 GPU 클라우드 성능의 일부다
구식 소프트웨어, 취약한 격리 또는 부실한 접근 제어가 가치 있는 모델과 데이터를 노출한다면, 클러스터를 프로덕션 준비 상태로 간주할 수 없다.
보안은 ClusterMAX 3.0에서 이례적으로 중요한 비중을 차지한다. SemiAnalysis는 많은 네오클라우드에서 AI 인프라 지출이 기본적인 방어 관행을 앞질렀다고 주장한다.
위험은 클러스터의 복잡성에서 시작된다. 관리형 환경은 운영체제, 드라이버, 스케줄러, 컨테이너, 스토리지, 고속 네트워크, 대시보드, 관리 도구를 결합한다. 각 계층은 운영자가 유지해야 할 자격 증명, 권한, 소프트웨어를 만들어낸다.
침해된 관리 노드는 한 대 이상의 머신을 노출할 수 있다. 인접 시스템, 공유 스토리지, 모델 체크포인트, 독점 데이터세트 또는 고객 환경의 다른 곳에서 사용되는 자격 증명으로 이어지는 경로를 제공할 수 있다.
고대역폭 클러스터 네트워크 역시 구성 요소 간 상당한 신뢰를 전제로 한다. 이 신뢰는 빠른 분산 컴퓨팅을 지원하지만, 부실한 세분화는 하나의 시스템이 침해됐을 때 발생하는 피해를 키울 수 있다.
따라서 보안은 여러 방식으로 사용 가능한 성능에 영향을 준다. 침해 사고는 작업을 중단시키고, 사고 대응을 촉발하며, 결과를 손상시키거나 긴급 패치를 강제할 수 있다. 취약한 통제는 벤치마크가 시작되기 전부터 공급업체를 부적합하게 만들 수도 있다.
SemiAnalysis는 초기 감사에 소프트웨어와 펌웨어 버전, 접근 구성, 컨테이너, 네트워크 설정, 모니터링을 포함한다. 이 과정은 완전한 침투 테스트를 대체하지는 않지만, 운영상의 경고 신호를 포착한다.
평가에서는 인증과 문서화된 통제도 검토한다. SOC 2나 ISO 27001 같은 인증이 모든 클러스터의 보안을 증명하지는 않는다. 그렇더라도 이러한 인증의 부재는 공급업체에 기본적인 조직 프로세스가 부족함을 시사할 수 있다.
구매자는 여러 경계에서의 격리를 살펴봐야 한다. 여기에는 고객 간 분리, 테넌트 내 권한, 공급업체 직원의 접근, 스토리지 스냅샷과 백업에 대한 통제가 포함된다.
자격 증명 처리도 동등한 주의가 필요하다. SSH 키, 클라우드 토큰, 서비스 계정, 스케줄러 권한은 의도한 것보다 오래 활성 상태로 남을 수 있다. 부실한 오프보딩은 일상적인 인력 변동을 지속적인 노출로 바꾼다.
모니터링은 자체적인 보안 절충을 만든다. 공급업체는 하드웨어 결함과 성능 이상을 식별하기 위해 상세한 텔레메트리가 필요하다. 이러한 수집은 민감한 작업 정보를 노출하거나 과도한 대시보드 접근 권한을 부여하지 않아야 한다.
AI 에이전트가 더 많은 운영 접근 권한을 얻으면서 압박은 커지고 있다. 사용자를 수정하고, 작업을 제출하거나, 노드를 문제 해결할 수 있는 에이전트는 시간을 절약할 수 있다. 하지만 가치 있는 인프라 전반에서 잘못된 명령을 실행할 수도 있다.
SemiAnalysis는 환경이 명확한 성공 기준과 상세한 맥락을 제공할 때 에이전트가 가장 유용했다고 보고한다. 이 관찰은 문서 품질을 보안과 연결한다. 좋은 지침은 즉흥적인 대응을 줄이고 자동화된 작업을 더 쉽게 검토할 수 있게 한다.
보고서의 비판에도 한계는 필요하다. ClusterMAX는 모든 보안 테스트나 모든 공급업체 결과를 공개하지 않는다. 구매자는 해당 티어 시스템을 자체 위협 모델의 대체재로 여겨서는 안 된다.
공급업체는 서로 다른 요구 사항을 지닌 고객을 지원한다. 연구 프로토타입, 규제를 받는 엔터프라이즈 워크로드, 프런티어 모델 학습 작업은 동일한 위험을 수반하지 않는다. 하나의 순위로는 모든 조직의 허용 수준을 담아낼 수 없다.
그럼에도 광범위한 결론을 무시하기는 어렵다. GPU 클라우드는 집중된 컴퓨팅 성능, 가치 있는 지식재산, 점점 더 자율화되는 소프트웨어를 호스팅한다. 보안 실패는 낮은 비용이나 높은 벤치마크 성능으로 얻은 모든 이점을 없앨 수 있다.
이 순위는 유용하지만 보편적인 판정은 아니다
ClusterMAX는 이례적으로 상세한 근거를 제공하지만, 그 결과는 범위, 접근성, 방법론에 따라 형성된 테스트 시점의 스냅샷으로 남는다.
첫 번째 한계는 구성 규모다. SemiAnalysis는 일반적으로 32개의 GPU를 요청했지만, 주요 고객은 훨씬 더 많은 머신으로 구성된 클러스터를 운영할 수 있다. 성능과 신뢰성 문제는 시스템 규모가 커짐에 따라 달라지는 경우가 많다.
4개 노드에서 우수한 성능을 보이는 공급업체도 수백 개 노드에서는 다른 혼잡, 스케줄러 또는 수리 과제에 직면할 수 있다. SemiAnalysis가 고객 인터뷰로 테스트를 보완하는 이유 중 하나는 단일 평가가 모든 배포 환경을 재현할 수 없기 때문이다.
두 번째 한계는 시간이다. 보고서는 특정 테스트 기간의 환경을 포착한다. 공급업체는 드라이버를 업데이트하고, 하드웨어를 교체하며, 스토리지 시스템을 변경하고, 오케스트레이션 도구를 다시 작성한다.
SemiAnalysis는 시장 변화에 따라 평가 등급을 업데이트한다고 말한다. 그럼에도 구매자는 검토된 구성이 자신에게 제공되는 리전, 하드웨어 세대, 소프트웨어 스택과 일치하는지 확인해야 한다.
세 번째 한계는 접근성이다. 일부 공급업체는 적합한 클러스터를 제공할 수 없었거나 제공하지 않았다. Unavailable 분류는 제한된 용량, 지리적 제약, 지연된 출시 또는 서비스 검증 불가를 나타낼 수 있다.
이 범주는 Underperforming과 동일하지 않다. 하나는 근거의 부재를, 다른 하나는 관찰된 결함을 반영한다. 조달팀은 이 구분을 유지해야 한다.
네 번째 한계는 공급업체의 협조와 관련된다. SemiAnalysis는 테스트 중 기업들과 소통하며, 특히 장애 주입에 호환 가능한 모니터링이 필요한 경우에 그러하다. 이는 유효한 결과를 만드는 데 도움이 되지만 익명 구매와는 다르다.
공급업체는 평가자가 환경을 점검하고 있음을 안다. 이들은 유리한 구성을 제공하고 신속하게 대응할 유인을 갖는다. 일반 고객에게는 비슷한 대우를 보장하는 계약과 레퍼런스가 필요하다.
다섯 번째 한계는 상업적 범위다. ClusterMAX는 관리형 클러스터를 평가하므로, 의도적으로 베어메탈에 특화된 공급업체를 낮게 평가할 수 있다. 그러한 서비스는 강력한 인프라 인력을 보유한 팀에 여전히 적합할 수 있다.
반대의 문제도 존재한다. 정교한 포털이나 신속한 온보딩 프로세스는 지속적인 워크로드가 시작되기 전에 신뢰감을 줄 수 있다. 장기적인 신뢰성은 다듬어진 초기 경험보다 검증하기 어렵다.
고객 인터뷰는 방법론을 강화하지만 또 다른 불확실성을 도입한다. 일반 독자는 모든 인터뷰, 불만 또는 가중치 결정 사항을 독립적으로 검토할 수 없다. 최종 종합 판단은 SemiAnalysis가 통제한다.
“업계 표준”이라는 제목은 눈에 띄는 업계 사용 사례에 뒷받침된 발행사의 포지셔닝으로 이해해야 한다. 이는 정부 표준이나 공식 인증 프레임워크가 아니다.
그럼에도 이 방법론은 비교가 어려운 시장의 투명성을 높인다. 공개된 평가 개요는 이 과정이 실무 테스트, 문서 검토, 사용자 피드백을 결합한다고 설명한다.
상대적 평가 구조는 지속적인 개선도 장려한다. 경쟁업체가 더 나은 모니터링, 더 빠른 복구 조치 또는 더 명확한 계약을 추가할 때, 공급업체는 어제의 구성이 여전히 경쟁력 있다고 가정할 수 없다.
고객에게 올바른 대응은 순위를 구매 결정에 그대로 복사하는 것이 아니다. 이 보고서를 공급업체가 근거와 함께 답해야 할 질문 목록으로 활용하는 것이다.
공급업체는 고객이 의도한 워크로드에서 성능을 재현할 수 있는가? 최근 복구 데이터를 제시할 수 있는가? 계약은 노드, 랙, 클러스터, 사이트 수준에서 다운타임을 측정하는가?
장비가 코로케이션 시설에 있을 때 물리적 수리는 누가 통제하는가? 핫 스페어는 준비되어 있는가? 네트워크 장애가 완전한 중단이 아닌 간헐적인 성능 저하를 일으키면 어떻게 되는가?
공급업체는 정의되지 않은 다운타임을 만들지 않고 보안 패치를 어떻게 처리하는가? 지원 직원은 어떤 접근 권한을 얻을 수 있는가? 고객은 독립적인 검토를 위해 로그와 모니터링 데이터를 내보낼 수 있는가?
이 질문들은 구매자가 더 낮은 티어의 공급업체를 선택하더라도 순위가 중요한 이유를 보여준다. ClusterMAX는 고객이 포괄적인 약속을 받아들이는 대신 보호 장치를 협상할 수 있는 어휘를 제공한다.
ClusterMAX 3.0은 지원과 계약을 기술적 기능으로 만든다
가장 중요한 변화는 지원 의무를 클러스터 아키텍처의 측정 가능한 부분으로 다룬다는 점이다.
GPU 클라우드 계약은 기술 사양과 상업적 보호 장치를 분리하는 경우가 많다. 계약에는 하드웨어, 용량, 가용성이 나열되지만 운영 세부 사항은 모호하게 남는다.
ClusterMAX 3.0은 이 격차를 좁힌다. SemiAnalysis는 기존 HGX 시스템과 랙 스케일 아키텍처를 위한 표준화된 서비스 수준 개념을 개발했다. 이는 노드, 랙, 클러스터, 사이트를 다룬다.
이 프레임워크는 해석에 맡겨두지 않고 다운타임을 정의한다. 또한 고객이 제공 환경을 인수하기 전에 GPU 컴퓨팅, 네트워킹, 스토리지, 소프트웨어 전반에 걸친 인수 테스트를 설명한다.
인수 기준은 중요합니다. 클러스터는 전원을 켤 수는 있어도 프로덕션 환경에 준비된 상태는 아닐 수 있기 때문입니다. 잘못 구성된 네트워킹, 접근할 수 없는 스토리지, 오래된 드라이버 또는 망가진 스케줄러 통합은 과금이 시작된 뒤에도 실제 작업 착수를 지연시킬 수 있습니다.
신뢰할 수 있는 계약은 서비스가 언제 인수 가능한 상태가 되는지 명시해야 합니다. 또한 제공업체가 그 시점을 지키지 못할 때 어떤 일이 발생하는지도 설명해야 합니다.
SemiAnalysis는 서비스 수준 성과를 정기적으로 검토할 것을 권고합니다. 이렇게 하면 신뢰성은 대규모 분쟁 후에만 평가되는 약속이 아니라 지속적인 의무가 됩니다.
이 프레임워크는 정당한 제외 사유도 인정합니다. 계획된 업그레이드, 보안 패치, 물리적 유지보수에는 다운타임이 필요할 수 있습니다. 계약은 모든 중단이 포괄적인 유지보수 조항 속으로 사라지도록 두지 말고 이러한 예외를 정의해야 합니다.
지원 품질은 탐지부터 복구까지의 경로를 통해 측정 가능해집니다. 제공업체는 어떤 구성 요소에 장애가 발생했는지 파악하고, 새 작업이 해당 구성 요소로 전달되지 않도록 막으며, 복구 계획을 전달할 수 있어야 합니다.
시설의 소유 구조는 이 경로에 영향을 줍니다. 자체 데이터센터를 통제하는 운영업체는 기술자, 부품, 절차를 직접 관리할 수 있습니다. 코로케이션을 이용하는 제공업체는 다른 회사의 원격 지원 일정에 의존할 수 있습니다.
어느 모델도 자동으로 더 낫지는 않습니다. 중요한 질문은 운영 방식이 약속된 시간 내에 복구를 제공하는지 여부입니다.
이 구분은 Grace Blackwell 랙 시스템에서 더욱 뚜렷해집니다. 직접 액체 냉각, 높은 랙 전력, Arm 기반 호스트 프로세서, 랙 규모의 NVLink는 기존 GPU 배포 환경에는 없던 의존성을 더합니다.
구성 요소 하나의 장애가 더 큰 용량 단위에 영향을 줄 수 있습니다. 복구 절차는 모든 8-GPU 서버를 상호 교체 가능한 것으로 취급하기보다 긴밀하게 연결된 트레이와 랙을 고려해야 합니다.
다가오는 Vera Rubin 세대는 전력 및 네트워크 요구 사항을 다시 높일 것입니다. SemiAnalysis는 아키텍처 전환이 Hopper에서 Grace Blackwell로의 이동만큼 큰 혼란을 일으키지는 않을 것으로 예상하지만, 제공업체들은 여전히 운영 측면의 과제를 안고 있습니다.
따라서 구매자에게 지원은 기술 평가의 일부입니다. 지식 있는 대응 팀, 검증된 절차, 이용 가능한 교체 부품, 정확한 텔레메트리가 시간이 지나며 제공되는 성능을 결정합니다.
같은 원칙은 가격에도 적용됩니다. 유용한 지원을 제외한 요금은 운영 리스크를 고객에게 전가합니다. 엔지니어링 시간을 보호하고 작업 완료를 보장한다면 더 높은 요금이 더 나은 가치를 제공할 수 있습니다.
ClusterMAX는 협상을 없애지 않습니다. 대신 그 협상에 숨겨진 요소를 더 쉽게 파악하게 합니다.
GPU 클라우드 구매자가 다음으로 주목해야 할 사항
다음 시험대는 ClusterMAX의 선도 업체들이 하드웨어, 워크로드, 구매 모델이 함께 변화하는 상황에서도 우위를 유지할 수 있는지 여부입니다.
첫 번째 신호는 새 평가 결과가 독립적으로 재현되는지입니다. 고객은 자체 인수 테스트와 장기간 실행되는 작업을 SemiAnalysis의 조사 결과와 비교해야 합니다. 일관된 결과가 나온다면 단일 평가 기간을 넘어 이 순위의 가치를 강화할 것입니다.
두 번째 신호는 Vera Rubin 배포 과정에서의 제공업체 움직임입니다. 신뢰성 있는 Grace Blackwell 시스템을 유지해 온 기업은 앞서 출발할 수 있습니다. 새로운 전력, 네트워킹, 냉각 요구 사항은 여전히 용량 계획과 지원 체계의 약점을 드러낼 수 있습니다.
제공업체가 명확한 제공 일정과 운영 목표를 공개하는지 지켜보세요. 마케팅 발표보다 고객 워크로드를 안정적으로 실행하는 클러스터가 더 중요합니다. 지연, 구성 변경, 제한적인 지역 접근성은 각 배포가 실제로 얼마나 성숙했는지 보여줄 것입니다.
세 번째 신호는 ClusterMAX가 추론 엔드포인트, 강화학습 인프라, 에이전트 샌드박스로 확장하는 것입니다. 이러한 제품은 전통적인 학습 클러스터와 다른 병목 현상을 만듭니다.
추론 서비스는 지연 시간, 처리량, 모델 로딩, 예측하기 어려운 수요의 균형을 맞춰야 합니다. 강화학습 시스템은 생성, 샌드박스 실행, 학습, 빈번한 모델 업데이트를 조율합니다. 어느 단계에서든 약점이 있으면 GPU가 유휴 상태로 남을 수 있습니다.
이 확장은 AI 팀이 오늘날 인프라를 소비하는 방식을 반영함으로써 ClusterMAX를 강화할 수 있습니다. 반면 관리형 클러스터와 토큰 기반 서비스는 서로 다른 문제를 해결하므로 프레임워크를 해석하기 더 어렵게 만들 수도 있습니다.
구매자는 보안 공개 내용도 주시해야 합니다. 격리, 패치, 자격 증명, 사고 대응에 관한 더 상세한 증거는 제공업체 비교의 근거를 강화할 것입니다. 심각한 사고는 성능 테스트로 포착할 수 없는 공백을 드러낼 것입니다.
마지막으로 관리형 서비스와 베어메탈 간의 격차를 살펴보세요. 대규모 연구소는 더 많은 소프트웨어 스택을 직접 운영하면서 광범위한 용량을 구매하고 있습니다. 소규모 팀은 여전히 제공업체가 그 복잡성을 흡수해 주어야 합니다.
AI 에이전트는 일부 관리 업무를 더 쉽게 만들겠지만, 신뢰성 있는 시스템의 필요성을 없애지는 못할 것입니다. 보고서 자체 테스트는 자동화가 일상적인 문제를 해결하는 동시에 자신 있게 새로운 문제를 만들 수도 있음을 보여줍니다.
궁극적으로 ClusterMAX 3.0 평가는 구매자에게 제품을 재정의하라고 요구합니다. 구매자는 칩을 개별적으로 임대하는 것이 아닙니다. 완료된 컴퓨팅, 복구 절차, 보안 통제, 숙련된 운영자에 대한 접근 권한을 임대하는 것입니다.
다음 GPU 클라우드 계약에 서명하기 전에 제공업체에 장애 상황에서 이러한 계층을 입증해 달라고 요청하세요. 워크로드별 벤치마크, 최신 보안 증거, 복구 기록, 정확한 인수 조건을 요구하세요. 그런 다음 각 옵션이 약속하는 용량만이 아니라 실제로 제공할 수 있는 완료된 작업을 비교하세요.



