top of page

NVIDIA AI Factory Production, 전력 한계를 스케줄링 문제로 전환하다

1일 전
14분 분량

NVIDIA는 더 빠른 칩을 넘어 AI 팩토리 생산 방식을 확장하며, 시설 전력 예산을 늘리지 않고도 토큰 처리량을 24% 높였다고 주장했다. 새롭게 제시한 논지는 단순하지만 중요한 의미를 지닌다. 전기는 각 서버가 독립적으로 한계까지 접근하는 고정된 상한이 아니라, 관리되는 컴퓨팅 자원이 되어야 한다는 것이다.

이 변화는 데이터 센터 운영자가 통상 별개로 다루는 두 문제를 연결한다. NVIDIA DSX MaxLPS는 GPU 클러스터 내부에서 전력을 재분배하고, DSX Flex는 시설 외부의 상황에 대응한다. 두 기술을 결합하면 메가와트는 워크로드, 서비스 우선순위, 전력회사의 요청에 맞춰 소프트웨어가 스케줄할 수 있는 자원이 된다.

이제 대립 구도는 NVIDIA와 다른 칩 제조사 간의 경쟁이 아니다. 유연 컴퓨팅과 데이터 센터를 지속적이고 협상 불가능한 전력 부하로 간주해 온 오랜 관행의 충돌이다. 이 모델이 초기 도입을 넘어 작동한다면 전력회사는 제어 가능한 자원을 확보하고, 운영자는 기존 전력 연결에서 더 많은 수익 창출 작업을 끌어낼 수 있다.

NVIDIA AI Factory Production, 새로운 효율성 단위를 얻다

중요한 변화는 NVIDIA가 인프라 구매자에게 단순한 GPU 속도나 시설 효율이 아니라 메가와트당 유용한 토큰 수를 측정하라고 요구한다는 점이다.

NVIDIA는 완전한 AI 시설을 위한 레퍼런스 설계, 시뮬레이션 도구, 운영 소프트웨어, 전력 제어 기능의 묶음으로 DSX를 도입했다. 회사는 AI 팩토리를 전기와 데이터를 토큰, 모델 및 기타 컴퓨팅 결과물로 전환하는 인프라로 설명한다.

이 표현은 홍보성으로 들릴 수 있지만, 실제 제약을 짚어낸다. 데이터 센터는 건물에 서버를 더 설치할 공간이 있더라도 전력망 연결을 통해 공급받을 수 있는 전력을 초과할 수 없다. 신규 발전 및 송전 설비 구축에는 수년이 걸릴 수 있다.

NVIDIA DSX MaxLPS는 시설 내부의 제약을 다룬다. 이 소프트웨어는 GPU, 서버, 랙 전반의 전력 소비를 모니터링한 뒤 각 워크로드의 특성에 맞춰 사용되지 않은 전력 여유분을 재배분한다.

전통적인 프로비저닝은 모든 서버가 동시에 설정된 최대치에 도달할 수 있다고 가정한다. 이에 따라 운영자는 설치된 장비와 시설 전력 한도 사이에 안전 여유를 둔다. 이는 안정성을 보호하지만, 정상 운영 중 일부 용량은 사용되지 않은 채 남는다.

학습 작업, 추론 서비스, 네트워킹 장비, 냉각 시스템도 서로 다른 수요 패턴을 만든다. 이들의 피크가 항상 동시에 발생하지는 않는다. 고정된 한도로는 이러한 차이를 충분히 활용할 수 없다.

동적 할당은 이렇게 묶여 있던 여유분을 되찾으려는 시도다. 한계 이하로 작동하는 노드는 더 많은 전력이 필요한 다른 노드에 용량을 넘길 수 있다. 팩토리는 전체 전력 한도를 계속 준수하면서도 더 많은 장비가 유용한 작업을 수행하게 할 수 있다.

Lambda는 NVIDIA HGX B200 노드 19대로 구성된 5랙 클러스터에서 이 접근법을 시험했다. DSX 결과에 따르면 Lambda는 이들 노드를 85% 전력 정책으로 운영했다.

비교 대상은 동일한 시설 예산 내에서 전체 설정 전력으로 작동하는 16개 노드였다. Lambda는 19노드 구성에서 클러스터 처리량이 초당 약 400만 토큰에서 500만 토큰으로 증가했다고 보고했다.

양사는 이것이 토큰 처리량 24% 증가와 와트당 성능 23% 향상에 해당한다고 밝혔다. 이 결과가 모든 클러스터에서 동일한 이득을 보장하는 것은 아니다. 워크로드 구성, 활용률, 네트워킹 및 열 조건 모두가 사용 가능한 전력 여유에 영향을 미친다.

그럼에도 이 테스트는 구매 논의를 바꾼다. 운영자들은 역사적으로 가속기 성능, 인터커넥트 대역폭, 메모리, 총비용을 비교해 왔다. 전력 인지형 스케줄링은 또 다른 질문을 더한다. 고정된 전력 연결 뒤에서 설치된 컴퓨팅 자원 중 얼마나 많은 부분을 생산적으로 가동할 수 있는가?

이 질문은 사용되지 않는 GPU에도 자본비와 감가상각 비용이 계속 발생하기 때문에 중요하다. 시설은 추가 수요를 처리할 만큼의 가속기를 보유하고도 더 많은 전력을 끌어올 권한이 없을 수 있다. 따라서 내부 전력 여유를 회수하면 추가 변전소 없이도 상업적 용량을 만들어낼 수 있다.

NVIDIA는 MaxLPS가 적합한 Vera Rubin NVL72 배포 환경에서 최대 40% 더 많은 GPU 용량을 지원할 수 있다고 말한다. 이 수치는 검증된 전체 플릿 결과가 아니라 전망치다. MaxLPS가 더 폭넓은 데이터 센터 전력 계획과 함께 작동하는지에 달려 있다.

회사는 향후 DSX 레퍼런스 설계에 800볼트 직류 아키텍처도 통합할 계획이다. NVIDIA는 2027년에 도입될 Vera Rubin 시스템에서 저전압 배전 대비 종단 간 효율이 3%~5% 개선될 것으로 전망한다.

고전압 배전은 변환 단계를 줄이고 주어진 전력량을 전달하는 데 필요한 전류를 낮출 수 있다. 동시에 새로운 장비, 운영 및 안전 요건도 수반한다. 따라서 소프트웨어 최적화와 전기 설계 변경은 동일한 제약의 서로 다른 계층을 다룬다.

즉각적인 근거는 오늘날의 클러스터 관리에서 나온다. 더 큰 목표는 컴퓨팅, 네트워킹, 냉각, 전력 시스템이 하나의 조율된 기계처럼 반응하는 시설이다.

이것이 NVIDIA의 메가와트당 토큰 전략의 기반이다. 그러나 내부 효율만으로는 문제의 절반만 해결된다. 광범위한 전력망이 한계에 가까워질 때 전력회사 역시 시설이 행동을 바꾸기를 필요로 한다.

4메가와트 팩토리, 디스패치 가능한 전력망 자원이 되다

NVIDIA의 Santa Clara 테스트가 중요한 이유는 우선순위 추론을 계속 운영하면서도 시설 수요를 자동으로 줄였기 때문이다.

무더운 8월 저녁, Silicon Valley Power는 캘리포니아 Santa Clara에 있는 NVIDIA의 Eos AI 팩토리에 수요 신호를 보냈다. 해가 지면서 전력회사의 서비스 지역 전반에서 냉방 수요가 증가하고 있었다.

Emerald AI의 Conductor 플랫폼은 신호를 받아 사전 정의된 워크로드 계층 구조를 적용했다. 우선순위가 낮은 컴퓨팅 작업은 속도가 줄거나 이동했고, 우선순위가 높은 서비스는 계속 운영됐다. 운영자 개입 없이 시설 수요는 4메가와트에서 3메가와트로 감소했다.

1메가와트 감소는 시작 부하의 25%에 해당한다. NVIDIA는 별도로 이 이벤트를 1분 이내에 최대 40% 감축에 도달한 대응 역량의 일부로 설명한다. 이 수치는 서로 다른 측정값을 반영하므로 같은 의미로 간주해서는 안 된다.

NVIDIA에 따르면 Silicon Valley Power는 초기 이벤트 이후 시설에 200회 이상 신호를 보냈다. 회사는 팩토리가 매번 성공적으로 대응했다고 말한다. 다만 각 이벤트에 대한 독립적인 운영 데이터는 공개되지 않았다.

전력회사는 2026년 4월 Santa Clara 파일럿을 발표했다. 명시된 목표는 유연한 데이터 센터가 신뢰성을 지원하고 기존 인프라 활용도를 개선할 수 있는지 시험하는 것이었다.

Silicon Valley Power는 Santa Clara에 서비스를 제공하는 지방자치단체 소유 전력회사다. 이 지역은 신규 컴퓨팅 프로젝트가 한정된 송전 및 배전 용량을 두고 경쟁하는, 데이터 센터가 유난히 밀집한 시장에 속한다.

이 프로그램은 전력회사와 대형 고객 간의 다른 관계를 제시한다. 시설이 항상 최대 연결 용량을 필요로 한다고 가정하는 대신, 전력회사는 제약이 발생한 기간에 일시적인 감축을 요청할 수 있다.

수요반응은 전력망 상태, 가격 또는 신뢰성 요구가 변할 때 전력 사용을 바꾸는 관행이다. 산업 현장은 수년간 이러한 프로그램에 참여해 왔다. 이를 AI에 적용하려면 컴퓨팅 서비스 수준과 더 긴밀한 조율이 필요하다.

알루미늄 제련소나 저온 저장 창고는 한계가 알려진 물리적 공정을 관리한다. AI 팩토리는 긴급성, 체크포인팅 요구, 고객 약정이 서로 다른 작업을 관리한다. 이 작업들을 상호 교환 가능하다고 취급하면 서비스 목표를 놓치거나 학습 진행 상황을 잃을 위험이 있다.

Conductor는 유연한 작업과 우선순위 작업을 분리한다. 배치 추론, 평가 실행, 일부 학습 프로세스는 지연을 감수할 수 있다. 대화형 추론과 엄격하게 일정이 잡힌 작업은 더 강한 보호가 필요하다.

이 플랫폼은 어떤 워크로드가 양보할 수 있는지 식별하고, 필요한 감축량을 계산하며, 사이트의 총 전력 목표를 유지해야 한다. 또한 전력망 이벤트가 끝나면 이러한 변경을 되돌려야 한다.

바로 이 지점에서 전력 관리가 스케줄링 문제가 된다. 메가와트 감축은 단순한 전기적 명령이 아니다. 어떤 작업을 늦추고, 일시 중지하고, 마이그레이션하거나, 계속할지에 관한 일련의 컴퓨팅 결정이 된다.

NVIDIA는 현재 배포의 정체성을 신중하게 설명한다. Eos 설치 환경은 Emerald AI Conductor를 사용하며, 아직 전용 DSX Flex 설치 환경은 아니다. 이는 DSX Flex가 일반화하려는 동작의 초기 구현 사례다.

이 구분은 중요하다. 파일럿은 기술 개념을 뒷받침하지만, DSX Flex 자체가 같은 규모의 상업 배포를 완료했음을 입증하지는 않는다.

이전 테스트는 추가 근거를 제공한다. 2025년 Phoenix 현장 시험에는 GPU 256개를 갖춘 상업용 데이터 센터 클러스터가 참여했다. 연구진은 정의된 서비스 품질 보장을 유지하면서 3시간 동안 전력을 25% 줄였다고 보고했다.

NVIDIA와 Emerald AI는 두 대륙의 상업용 데이터 센터에서 5회의 라이브 시연을 완료했다고 말한다. Silicon Valley Power의 프로그램은 이 모델을 시연 단계에서 반복 가능한 전력회사 디스패치로 발전시킨다.

더 넓은 목표는 데이터 센터의 전력 소비를 적게 만드는 것이 아니다. 이 시설들은 계속해서 대규모 부하로 남을 것이다. 목표는 수요의 일부를 예측 가능하고, 측정 가능하며, 일시적으로 조정 가능한 형태로 만드는 것이다.

이 역량은 전력회사에 운영상 가치 있는 무언가를 제공한다. 또한 운영자에게는 더 크거나 더 빠른 연결을 확보할 수 있는 경로를 제시한다. 이 거래는 양측이 약속된 감축을 검증할 수 있을 때만 성립한다.

진정한 상대는 상시 부하 모델이다

유연 컴퓨팅은 모든 AI 시설이 매 시간 최대 전력망 수요를 확보해야 한다는 가정에 도전한다.

전력회사는 장비가 가장 까다로운 조건에서도 작동해야 하므로 피크 수요를 기준으로 네트워크를 계획한다. 하지만 이러한 피크는 연중 제한된 기간만 차지한다. 송전선과 변전소는 제약이 덜한 기간에 사용되지 않는 용량을 보유할 수 있다.

대규모 데이터 센터는 이 계획을 복잡하게 만든다. 제안된 시설은 실제 부하 프로필에 관한 과거 근거를 거의 제시하지 않은 채 수백 메가와트를 요청할 수 있다. 전력회사는 신뢰성을 낮추지 않고 기존 장비가 이를 공급할 수 있는지 결정해야 한다.

가장 안전한 답은 대개 긴 계통 연계 절차와 그에 이은 신규 인프라 구축이다. 이 접근법은 위험을 제한하지만 AI 기업의 개발 일정과 충돌한다. 가속기와 모델 시장은 송전 건설보다 빠르게 움직인다.

NVIDIA와 Emerald AI는 조건부 대안을 제안한다. 시설은 가용 용량에 접근할 수 있지만, 전력회사가 적격 명령을 내릴 경우 소비를 줄이는 데 동의한다.

이 아이디어는 중단 가능 산업 요금제와 유사하지만, 소프트웨어는 대응을 더 선택적으로 만든다. 팩토리가 완전히 중단될 필요는 없다. 긴급한 작업을 보호하면서 가치가 낮은 작업을 줄일 수 있다.

이로써 워크로드 우선순위는 계통 연계 계약의 일부가 된다. 전력회사는 사이트의 총 대응량에 관심을 두고, 운영자는 수천 개의 가속기 전반에서 그 대응을 어떻게 만들어낼지 결정한다.

NVIDIA의 2026년 3월 에너지 협력에는 AES, Constellation, Invenergy, NextEra Energy, Nscale Energy & Power, Vistra가 참여했다. 이 그룹은 유연한 시설, 현장 발전, 배터리, 더 빠른 계통 연결을 검토하고 있다.

이들 참여사는 전력 시스템의 서로 다른 영역을 대표한다. 이들의 참여는 유연성이 좁은 범위의 기술 실험을 넘어가고 있음을 시사한다. 개발사, 발전 사업자, 유틸리티 기업들은 이것이 프로젝트 설계와 상업 계약에 어떤 영향을 미칠지 평가하고 있다.

이 접근 방식은 분리된 계량기 후단(behind-the-meter) 전력과도 경쟁한다. 일부 데이터센터 개발사는 계통 연결이 충분히 빨리 이뤄지지 않기 때문에 전용 발전 설비를 계획한다. 가스 터빈, 배터리 및 기타 현장 자원은 이러한 지연을 메울 수 있다.

현장 발전은 프로젝트를 앞당길 수 있지만, 영구적인 분리에는 단점이 있다. 컴퓨팅 수요가 줄면 장비가 활용되지 않은 채 남을 수 있다. 주변 전력망 역시 자체적인 수요 압박 시기에 이러한 자원에 의존할 수 없다.

NVIDIA가 선호하는 설계는 컴퓨팅을 발전 및 저장 설비와 조율한다. 시설은 요청된 계통 목표를 충족하기 위해 워크로드 수요를 낮추거나, 배터리를 방전하거나, 현장 발전량을 조정할 수 있다.

이것이 신규 발전소나 송전망의 필요성을 없애지는 않는다. 유연한 수요는 주로 제약이 발생하는 구간에서 도움이 된다. 지속적인 연간 성장에는 여전히 추가적인 에너지 생산 및 송전 인프라가 필요하다.

NVIDIA가 인용한 Duke University 분석은 제한적인 부하 유연성으로도 기존 시스템에서 상당한 신규 수요를 수용할 수 있다고 추정했다. 이러한 모델링은 송전 조건, 위치, 감축 지속 시간에 따라 달라진다.

전국 단위의 용량 추정치를 개별 유틸리티에 직접 적용해서는 안 된다. 전력 병목은 지역적이다. 발전량이 부족한 지역이 마주하는 제약은 변전소가 과부하된 지역의 제약과 다르다.

그럼에도 NVIDIA의 포지셔닝은 이 회사가 받는 상업적 압박을 드러낸다. 고객은 전력이 없는 가속기를 배치할 수 없다. 더 빠른 GPU도 계통 연계 대기열에서 기다리는 동안에는 매출을 만들지 못한다.

따라서 회사는 서버 랙을 넘어 영향력을 확대할 유인이 있다. DSX는 시설 설계, 워크로드 스케줄링, 전력 제어를 NVIDIA 컴퓨팅 플랫폼의 일부로 만든다.

이 전략은 NVIDIA를 유틸리티 운영에 더 가깝게 위치시킨다. 계통 운영자는 응답 실패가 다른 고객에게 영향을 줄 수 있기 때문에 엄격한 기준을 사용한다. 소프트웨어 공급업체의 성능 주장은 텔레메트리, 테스트, 강제 가능한 의무 없이 충분하지 않다.

새롭게 재출범한 AI Energy Management Alliance는 이러한 정책 계층을 구축하는 것을 목표로 한다. 20개 참여사에는 NVIDIA, Google, Emerald AI, Anthropic, National Grid, AES, Constellation, NRG, RWE가 포함된다.

Google은 중요한 역사적 참고 사례를 제공한다. 이 회사는 이미 전력 조건에 따라 일부 데이터센터 워크로드를 조정해 왔다. Google의 참여는 유연한 컴퓨팅이 NVIDIA 하드웨어만의 기능이 아님을 보여준다.

유연성 연합에 관한 보도에 따르면, Google은 미국 전역의 유틸리티 계약을 통해 감축 가능한 수요 1기가와트를 약정했다. 이 규모는 다른 운영자들의 경쟁 기준을 높인다.

핵심 경쟁은 여전히 Google 대 NVIDIA보다 더 광범위하다. 이는 적응형 시설과 대규모 디지털 부하가 전력망과 협상할 수 없다는 가정 사이의 경쟁이다.

메가와트당 더 많은 토큰도 어려운 선택을 요구한다

전력 유연성은 작업의 우선순위를 정해 용량을 만들어내며, 이는 누군가 어떤 컴퓨팅 작업이 기다릴 수 있는지 결정해야 한다는 뜻이다.

"작업을 하나도 포기하지 않고"라는 표현은 실제 트레이드오프를 가릴 수 있다. 우선순위가 낮은 작업은 더 느리게 계속되거나, 일시 중단되거나, 나중에 재개될 수 있다. 취소되지 않더라도 완료 시간은 달라질 수 있다.

이러한 결과는 일부 작업에서는 수용 가능하다. 오프라인 추론, 데이터 전처리, 모델 평가, 장애 허용형 학습은 스케줄링 유연성을 제공할 수 있다. 실시간 애플리케이션은 흔히 엄격한 지연 시간 요건을 가진다.

운영자는 계통 이벤트가 시작되기 전에 정확한 분류를 갖춰야 한다. 스케줄러는 유틸리티 명령을 받은 뒤 우선순위를 안전하게 즉흥적으로 정할 수 없다. 고객 계약, 마감 시한, 기술적 종속성이 이미 반영돼 있어야 한다.

혼합 워크로드는 이를 더 어렵게 만든다. 학습 작업은 많은 GPU 간의 동기화된 통신에 의존할 수 있다. 전력을 불균등하게 줄이면 전체 작업이 느려지거나, 고가의 자원이 대기 상태에 놓일 수 있다.

체크포인팅은 진행 상황을 보존할 수 있지만 모델 상태를 기록하려면 시간과 저장 대역폭이 필요하다. 대규모 작업을 재개하는 과정도 오버헤드를 유발한다. 짧은 계통 이벤트는 마이그레이션이나 체크포인팅이 이점을 내기 전에 끝날 수 있다.

추론은 다른 문제를 제기한다. 사용자 대상 수요는 전력 수요와 동시에 증가할 수 있다. 무더운 저녁에는 냉방 부하와 소비자 활동이 모두 급증할 수 있다.

따라서 스케줄러는 지연 시간에 민감한 용량을 보존하면서 다른 곳에서 감축분을 찾아야 한다. 시설 대부분이 인터랙티브 트래픽을 처리할 때는 더 어려워진다.

NVIDIA의 Lambda 테스트는 하나의 통제된 구성에서 더 나은 클러스터 활용도를 보여준다. 이것이 모든 모델 아키텍처, 테넌트 구성, 네트워크 설계에서 같은 이득을 입증하는 것은 아니다.

24% 처리량 결과는 85% 전력 정책에서 19개 노드를 운용한 경우와 최대 전력에서 16개 노드를 운용한 경우를 비교한다. 이는 유용한 시설 전력 예산 비교다. 기존 클러스터를 제한하면 어떤 경우에나 자동으로 처리량이 증가한다는 증거는 아니다.

와트당 성능은 절대 성능과 충돌할 수도 있다. 더 많은 노드를 최대치 이하로 운용하면 총 처리량은 개선될 수 있지만, 개별 요청은 더 오래 걸릴 수 있다. 운영자는 어떤 지표가 서비스 의무를 뒷받침하는지 결정해야 한다.

토큰의 정의 역시 또 다른 한계를 만든다. 토큰은 모델, 언어, 워크로드에 따라 다르다. 소형 모델의 토큰 100만 개는 대형 모델의 토큰 100만 개와 동일한 경제적 또는 계산적 가치를 나타내지 않는다.

메가와트당 토큰은 일관된 워크로드에 대한 내부 지표로 가장 적합하다. 서로 관련 없는 서비스를 비교할 때는 정보성이 떨어진다. 매출, 지연 시간, 모델 품질, 완료된 작업은 여전히 중요하다.

유틸리티 검증은 또 다른 과제를 만든다. 계통은 디스패치가 없었다면 시설이 소비했을 전력을 보여주는 안정적인 기준선을 필요로 한다. 그렇지 않으면 운영자는 어차피 발생했을 감축에 대해 크레딧을 받을 수 있다.

시설은 같은 제약 구간에 수요가 단지 다른 인근 사이트로 이동하지 않았다는 점도 입증해야 한다. 지리적 마이그레이션은 한 유틸리티에는 도움이 될 수 있지만 다른 시장의 상황을 악화시킬 수 있다.

명확한 측정 규칙은 유연성이 더 빠른 연결이나 금전적 보상을 받을 수 있는지를 결정할 것이다. AI Energy Management Alliance는 감축분이 검증 가능하고 강제 가능해야 한다고 말한다. 규제 당국은 여전히 그 용어들을 정의해야 한다.

지역사회 수용성은 별도의 시험대다. 유연한 시설도 총 전력 소비량, 물 사용량, 건설 활동, 지역 인프라 요구를 늘릴 수 있다.

대중의 우려는 이미 상당하다. Axios가 인용한 2026년 9월 여론조사에 따르면, 미국인의 84%는 데이터센터가 지역 전력 요금에 미치는 영향을 우려했다. 초당적 대다수는 개발사가 필요한 계통 업그레이드 비용을 부담하도록 하는 방안을 지지했다.

수요 반응은 일부 피크 투자 비용을 줄일 수 있지만, 더 낮은 요금을 보장하지는 않는다. 결과는 요금 체계, 인프라 소유권, 디스패치 빈도, 비용 배분 방식에 따라 달라진다.

따라서 NVIDIA와 파트너사는 한 시설의 성공적인 응답을 광범위한 경제성의 증거로 취급하지 않아야 한다. Santa Clara 이벤트는 자동화된 감축이 작동할 수 있음을 보여준다. 그러나 누가 재정적으로 혜택을 받는지는 결론짓지 못한다.

NVIDIA의 미래 GPU 용량 최대 40% 전망에도 같은 주의가 적용된다. "최대"는 유리한 경우를 뜻한다. 실제 배치에는 여러 워크로드 패턴에 걸친 투명한 결과가 필요하다.

기술적 신뢰성은 드문 이벤트에서도 유지돼야 한다. 일상적인 테스트에서 완벽하게 응답하는 시스템도 통신 장애, 갑작스러운 워크로드 급증, 극한의 계통 조건에서 여전히 작동해야 한다.

사이버보안은 위험의 일부가 된다. 유틸리티 신호와 워크로드 제어에 연결된 플랫폼은 핵심 인프라와 가치 높은 컴퓨팅 자산 사이에 놓인다. 인증과 장애 처리 기능은 악의적이거나 우발적인 명령을 막아야 한다.

가장 안전한 설계에는 명시적인 폴백 동작이 필요하다. 계통 신호가 끊겨도 시설이 위험한 전력 상태에 놓여서는 안 된다. 스케줄러 장애로 우선순위 서비스가 통제되지 않는 스로틀링에 노출돼서도 안 된다.

이러한 우려가 유연한 AI 인프라의 타당성을 부정하는 것은 아니다. 이는 유망한 운영 파일럿과 신뢰할 수 있는 시장 표준 사이의 거리를 규정한다.

DSX는 GPU를 넘어 NVIDIA의 통제 범위를 확장한다

NVIDIA는 모델 워크로드부터 유틸리티 디스패치까지 이르는 시스템 효율성을 플랫폼 전략으로 전환하고 있다.

DSX 포트폴리오는 AI 팩토리의 수명 주기 중 여러 단계를 포괄한다. DSX Sim은 건설 전에 제안된 설계를 모델링한다. 레퍼런스 설계는 컴퓨팅, 네트워킹, 스토리지, 전력, 냉각의 검증된 조합을 규정한다.

DSX OS는 수명 주기 관리, 시스템 상태, 런타임 일관성, 복원력을 위한 모듈형 운영 계층을 제공한다. MaxLPS는 클러스터 내부의 가용 전력을 할당한다. DSX Flex는 시설의 동작을 외부 계통 조건과 연결한다.

각 구성 요소는 서로 다른 생산성 손실 원인을 다룬다. 시뮬레이션은 자본이 투입되기 전에 설계 병목을 식별할 수 있다. 런타임 관리는 복구 시간을 단축할 수 있다. 동적 전력 제어는 정적 계획이라면 유휴 상태로 남을 장비를 가동할 수 있다.

이 결합된 전략은 과거에 별도 공급업체가 처리했던 의사결정에서 NVIDIA에 역할을 부여한다. 랙 규모의 고밀도 환경에서는 칩 선택, 네트워킹, 냉각, 작업 스케줄링, 전기 설계가 점점 더 서로에게 영향을 미친다.

NVIDIA에 따르면 GB200 NVL72 랙은 직접 액체 냉각 시스템을 통해 약 120킬로와트의 열을 처리한다. 그 열을 제거하는 일은 프로세서에 전력을 공급하는 일과 분리될 수 없다.

향후 Vera Rubin NVL72 시스템은 조율된 설계의 중요성을 더욱 높일 것이다. 더 높은 밀도는 버스웨이, 스위치기어, 냉각 루프, 건물 레이아웃을 바꾼다. 운영자는 서버를 독립된 상자로 취급할 수 없다.

이는 NVIDIA의 핵심 메커니즘을 뒷받침한다. 각 구성 요소를 개별적으로 극대화하기보다 전체 팩토리를 최적화하는 것이다. 개별 최고 성능으로 작동하는 GPU는 다른 곳에서 전기적 한계를 촉발한다면 시설 전체에는 더 나쁜 결과를 낼 수 있다.

이 전략은 전력 가용성이 가속기 판매를 제한하는 시장으로부터 NVIDIA를 보호하기도 한다. 하나의 연결 뒤에서 더 많은 GPU를 사용할 수 있게 하는 소프트웨어는 자사 하드웨어의 활용 가능한 시장을 확장한다.

클라우드 제공업체도 비슷한 유인을 가진다. 제공업체는 명판상 GPU 용량이 아니라 완료된 컴퓨팅 작업에서 매출을 얻는다. 새 데이터센터가 문을 열기 전에도 더 높은 클러스터 활용도는 경제성을 개선할 수 있다.

유틸리티는 다른 이점을 얻는다. 디스패치 가능한 데이터센터는 통제할 수 없는 예측치가 아니라 계획 수단이 될 수 있다. 이것이 데이터센터를 발전소와 동등하게 만드는 것은 아니지만, 핵심 기간의 수요를 줄일 수 있다.

에너지 기업은 유연성을 신규 발전 설비와 결합할 수 있다. 하이브리드 프로젝트는 계통 연계 과정에서 현장 자원을 활용한 뒤, 이후 이를 더 넓은 전력망과 조율할 수 있다.

이 아키텍처는 경쟁 인프라 플랫폼에도 유사한 제어 기능을 제공하라는 압력을 가한다. AMD 기반 클러스터, 맞춤형 가속기, 독립적인 오케스트레이션 시스템은 전력 용량이 빠듯해질수록 신뢰할 수 있는 전력 관리 방안을 제시해야 한다.

오픈 스케줄링 시스템은 이미 워크로드 우선순위와 리소스 한도를 관리할 수 있다. NVIDIA의 강점은 이러한 제어 기능을 상세한 가속기 텔레메트리 및 레퍼런스 아키텍처와 통합하는 데 있다.

반면 잠재적인 플랫폼 집중은 약점이다. 운영자는 이기종 하드웨어, 여러 클라우드, 다양한 스케줄링 시스템 전반에서 작동하는 제어 기능을 선호할 수 있다. 전력망 유연성이 모든 시설에서 단일 가속기 공급업체를 사용한다는 전제에 의존해서는 안 된다.

Emerald AI의 역할은 이러한 우려를 일부 해소한다. Conductor는 전력회사의 요청과 컴퓨팅 운영 사이에서 작동한다. 그러나 공개된 사례는 NVIDIA 시스템을 중심으로 하며, 더 폭넓은 상호운용성은 여전히 중요한 과제로 남아 있다.

Google의 연합 참여 역시 범위를 넓힌다. Google은 맞춤형 가속기, 글로벌 인프라, 탄소 인지형 컴퓨팅 경험을 제공한다. 공통 전력회사 프레임워크는 다양한 기술 구현 방식을 수용해야 할 것이다.

따라서 승리하는 표준은 시설 내부의 공급업체별 최적화와 전력망 경계에서의 공급업체 중립적 검증을 결합할 가능성이 높다. 전력회사에 필요한 것은 모든 내부 스케줄링 세부 사항에 대한 접근이 아니라 신뢰할 수 있는 메가와트 단위의 대응이다.

엔터프라이즈 AI 구매자에게 미치는 영향은 간접적으로 나타난다. 클라우드 용량, 서비스 가용성, 모델 비용은 공급업체가 제약된 시설을 얼마나 효율적으로 활용하는지에 따라 달라진다.

클러스터 처리량 24% 향상이 고객 혜택 24%로 기계적으로 이어지지는 않는다. 공급업체는 그 이득을 더 많은 고객에게 서비스를 제공하거나, 마진을 유지하거나, 배포 지연을 줄이는 데 사용할 수 있다.

개발자는 대신 서비스 수준의 동작을 지켜봐야 한다. 유연한 인프라는 눈에 띄는 지연 시간 급증, 작업 중단, 예측 불가능한 가용성 없이 전력 수요를 바꿀 때 성공한다.

공급업체를 평가하는 기술팀에게 전력 관리는 더 긴 운영 질문 목록에 추가된다. 워크로드 이식성, 체크포인트 지원, 지역별 용량, 큐 동작, 지연 시간 보장은 모두 출력 제한에 대한 노출도를 좌우한다.

새로운 경쟁 단위는 단순히 가장 빠른 가속기가 아니다. 이는 희소하고 점점 더 조건부가 되는 전력 공급으로부터 생산되는 유용하고 신뢰할 수 있는 컴퓨팅이다.

유연한 AI 팩토리의 확장 여부를 보여줄 세 가지 신호

다음 시험대는 DSX가 선별된 시연을 넘어 반복 가능한 배포, 전력회사 규칙, 측정 가능한 고객 성과로 나아갈 수 있는지다.

첫 번째 신호는 버지니아주 매너서스에 NVIDIA가 계획 중인 96메가와트 AI Factory Research Center다. 이 프로젝트에는 Digital Realty, Emerald AI, Electric Power Research Institute, PJM Interconnection이 참여한다.

NVIDIA는 이를 최초의 전용 상업 규모 DSX Flex 배포라고 설명한다. Vera Rubin 인프라를 사용하고 파트너들의 이전 시연을 기반으로 구축될 것으로 예상된다.

그 중요성은 규모와 기간에서 나온다. 96메가와트 시설은 소규모 테스트 클러스터보다 더 다양한 워크로드, 장비, 운영 상태를 갖는다. 반복적인 전력 디스패치는 성능이 예측 가능하게 유지되는지를 보여줄 것이다.

독자는 측정된 응답 시간, 감축 폭, 복구 동작, 서비스 수준 영향을 지켜봐야 한다. 공개된 기준선은 또 하나의 성공적인 시연 발표보다 더 중요하다.

매너서스 시설이 실제 운영 조건 전반에서 검증된 감축을 제공한다면 NVIDIA의 주장은 상당한 지지를 얻게 된다. 지연이나 제한적인 공개 데이터는 이 모델이 파트너의 주장에 의존하게 만들 것이다.

두 번째 신호는 규제 도입이다. Silicon Valley Power의 유연한 접속 방식은 참여 시설에 디스패치 가능한 수요를 제공하는 대가로 더 많은 전력망 접근 권한을 부여한다.

다른 전력회사와 지역 송전 기관은 유사한 방식을 제공할지 결정해야 한다. 규칙에는 적격성 테스트, 기준선 산정 방식, 벌칙, 텔레메트리 요건, 출력 제한 한도가 필요하다.

연방 규제기관은 지역 전력망 운영자들에게 대규모 유연 부하를 연결하기 위한 새로운 접근법을 검토하도록 지시했다. 이는 기회를 만들지만, 전국적인 패스트 레인을 보장하지는 않는다.

전력 시장은 주와 전력망 지역마다 다르다. 산타클라라에 적합한 구조가 PJM, ERCOT 또는 다른 지역의 수직 통합형 전력회사에 맞지 않을 수 있다.

규제기관이 집행 가능한 유연 부하 요금제를 만든다면 상업적 유인은 강화될 것이다. 운영자는 전력 접근을 더 빠르게 얻는 대가로 제한된 스케줄링 자율성을 교환할 수 있다.

규칙이 맞춤형으로 남는다면 배포는 전력회사별로 진행될 것이다. 이는 거래 비용을 높이고 DSX Flex의 공략 가능한 시장을 제한한다.

세 번째 신호는 독립적인 워크로드 증거다. NVIDIA와 Lambda는 유용한 초기 수치를 제공했지만, 구매자에게는 다양한 모델과 운영 환경 전반의 결과가 필요하다.

향후 공개 자료는 학습, 배치 추론, 인터랙티브 추론을 구분해야 한다. 또한 총체적 효율성과 애플리케이션 수준의 지연 시간을 모두 보고해야 한다.

결과는 전력회사 이벤트의 빈도와 지속 시간도 보여줘야 한다. 드문 감축 상황에서 우수한 성능을 보이는 시스템은 반복적이거나 장기적인 제약 아래에서는 다르게 동작할 수 있다.

독립적인 평가는 메가와트당 더 많은 토큰이 지속 가능한 생산성을 의미하는지, 아니면 유리한 벤치마크 구성의 결과인지를 명확히 할 것이다. 또한 유연성을 거의 제공하지 않는 워크로드도 드러낼 것이다.

이 세 가지 신호는 연결돼 있다. 시설이 신뢰할 수 있는 대응을 제공할 때에만 전력회사는 유연성에 보상할 것이다. 고객 워크로드가 보호될 때에만 운영자는 참여할 것이다.

NVIDIA AI 팩토리 생산은 이제 전력을 소프트웨어가 시간, 장비, 비즈니스 우선순위에 따라 할당할 수 있는 변수로 취급한다. 이는 전기를 배경 입력값에서 컴퓨팅 아키텍처의 능동적 구성 요소로 재정의한다.

산타클라라 배포는 수 메가와트 규모의 AI 시설이 전력회사의 명령에 자동으로 대응할 수 있음을 보여준다. Lambda의 클러스터는 고정된 전력 예산 내에서 동적 할당이 처리량을 높일 수 있음을 보여준다.

어느 결과도 업계 전반 도입의 근거를 완성하지는 않는다. 상업적 규모, 중립적 검증, 명확한 전력회사 규칙은 여전히 해결되지 않은 과제다.

인프라 팀에게 실질적인 질문은 더 이상 전력 제한이 AI 배포에 영향을 미치는지 여부가 아니다. 이미 영향을 미치고 있다. 핵심 결정은 서비스 보장을 약화시키지 않으면서 워크로드가 더 많은 용량을 확보할 만큼 유연해질 수 있는지다.

매너서스를 지켜보고, 접속 규칙을 지켜보고, 애플리케이션 수준의 성능을 지켜봐야 한다. 이러한 결과가 NVIDIA가 새로운 운영 표준을 만들었는지, 아니면 초기 배포의 좁은 집합을 최적화했는지를 결정할 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page