Pat Gelsinger의 GPU 비판이 드러낸 AI 하드웨어의 진짜 문제
- Martin Chen

- 8월 6일
- 7분 분량
Pat Gelsinger는 인공지능 분야에서 압도적인 역할을 하는 GPU도 일부 워크로드에서는 제대로 작동하지 않는다고 주장하며 Google News의 직설적인 헤드라인을 촉발했다. 전 Intel 최고경영자는 GPU 컴퓨팅이 쓸모없다고 일축한 것이 아니다. 그는 점점 복잡해지는 AI 시스템의 모든 단계를 하나의 프로세서 아키텍처가 처리해야 한다는 가정에 이의를 제기했다.
이 구분은 이야기를 바꾼다. Gelsinger는 학습 부문에서 Nvidia가 이룬 진전을 높이 평가하면서도, 범용 GPU 인프라가 막대한 규모에서 합리적인 비용의 추론을 제공할 수 있는지에는 의문을 제기했다. 추론은 사용자가 답변, 이미지, 예측 또는 행동을 요청할 때마다 학습된 모델을 실행하는 과정이다.
그의 비판에는 Intel에 불편한 인정도 담겨 있다. CPU가 데이터 센터를 지배하던 시절, 이 회사는 Nvidia의 GPU 전략을 과소평가했다. 이후 Nvidia는 CUDA를 구축하고 개발자 생태계를 육성하며 병렬 처리를 현대 AI 학습의 기반으로 만들었다.
이제 논의는 Intel 대 Nvidia를 넘어섰다. CPU, GPU, 네트워킹 프로세서, 특수 가속기가 각자의 강점에 따라 작업을 분담하는 GPU 대 이기종 컴퓨팅의 문제다.
눈에 띄는 반전은 Nvidia 역시 이러한 시스템 수준의 전제를 상당 부분 받아들이는 것으로 보인다는 점이다. 최신 플랫폼은 GPU에 맞춤형 CPU, 네트워킹 실리콘, 데이터 처리 장치, 추론 중심 기술을 결합한다. 논쟁은 GPU가 갑자기 사라지는지 여부가 아니라, 누가 그 조합을 가장 효율적으로 구성할 수 있는지에 관한 것이다.
Google News 헤드라인은 Gelsinger의 실제 주장을 빠뜨린다
Gelsinger의 비판은 모든 GPU나 모든 AI 워크로드가 아니라 GPU만을 생각하는 방식에 향한다.
“GPUs suck”이라는 헤드라인 문구는 더 긴 기술적 논의를 절대적인 판단으로 압축한다. 그의 실제 발언은 훨씬 구체적이었으며 데이터 센터 구매자에게 더 유용하다.
반도체 분석가 Ian Cutress는 상세한 Gelsinger 인터뷰에서 점점 다양해지는 컴퓨팅 아키텍처에 관해 질문했다. Gelsinger는 워크로드가 아키텍처를 결정해야 한다고 주장했다.
그는 문제에 대규모 병렬 연산이 포함될 때 GPU가 매우 뛰어난 성능을 낸다고 말했다. 현대 AI 학습은 프로세서가 많은 데이터 요소에 걸쳐 행렬 연산을 반복 실행하기 때문에 이 패턴에 부합한다.
그러나 제어 흐름 연산은 다르게 작동한다. 여기에는 조건 분기, 오케스트레이션, 도구 실행, 운영체제 기능, 그리고 예측하기 어려운 경로를 지닌 분석 작업이 포함된다.
Gelsinger는 의도적으로 도발적인 표현을 제시했다. “GPU에서 형편없이 실행되는 것들이 있다.” 이어 그는 기본적인 if-then-else 로직이 긴 GPU 파이프라인에는 잘 맞지 않는다고 지적했다.
이 말은 모든 GPU가 나쁘다는 의미와 동등하지 않다. 병렬 처리량을 위해 설계된 아키텍처는 워크로드가 반복적으로 분기하고, 멈추고, 방향을 바꿀 때 효율을 잃는다는 뜻이다.
Agentic AI는 이 차이를 더욱 뚜렷하게 만든다. AI 에이전트는 데이터베이스를 호출하고, 코드를 실행하고, 결과를 검토하고, 다른 도구를 선택하고, 계획을 업데이트할 수 있다. 이 가운데 GPU에 유리한 고밀도 행렬 계산이 포함되는 단계는 일부에 불과하다.
나머지 단계도 여전히 프로세서 시간, 메모리 대역폭, 네트워킹 용량, 에너지를 소비한다. GPU는 이들 중 다수를 실행할 수 있지만, 기술적 호환성이 경제적 효율을 보장하지는 않는다.
Gelsinger는 자신이 선호하는 모델을 “컴퓨팅의 삼위일체”라고 부른다. 전통적인 프로세서는 제어 중심 작업을 처리하고, AI 가속기는 데이터 집약적 알고리즘을 처리하며, 양자 머신은 궁극적으로 실용적인 고전 컴퓨팅의 범위를 넘어선 일부 문제를 다룬다.
양자 구성 요소는 일상적인 AI 인프라에서는 여전히 추측적이다. CPU와 가속기의 분업은 이미 출시되었거나 발표된 데이터 센터 시스템에서 확인할 수 있다.
따라서 Google News의 프레이밍은 출발점으로는 유용하지만 결론으로는 불완전하다. Gelsinger는 현재 AI 붐을 가능하게 한 아키텍처를 부정하는 것이 아니라 업계의 배포 모델에 의문을 제기하고 있다.
그의 주장은 학습과 추론도 구분한다. 학습은 대규모 데이터셋을 처리해 모델을 만들거나 업데이트하는 과정이다. 추론은 학습된 모델을 실시간 요청에 적용하는 과정이다.
GPU는 두 단계 모두에서 여전히 핵심적이다. 하지만 추론은 응답 시간, 토큰 비용, 전력 소비, 메모리 용량, 예측 가능한 서비스 수준 등 다른 우선순위를 제시한다.
inference chip market에는 이미 AMD, Intel, Cerebras, Groq, d-Matrix 및 기타 전문 업체가 참여하고 있다. 이들의 기회는 Nvidia의 전체 학습 플랫폼을 재현하는 대신 이러한 우선순위를 최적화하는 데서 나온다.
Gelsinger의 표현은 단정적으로 들린다. 그러나 그의 기술적 입장은 워크로드별로 다르다.
AI 추론 칩이 데이터 센터 경제성에 압박을 가하는 이유
하드웨어 논쟁의 중심은 이제 학습에 드는 막대한 비용만이 아니라 AI 사용의 반복적 비용이다.
모델은 대규모 학습을 제한된 횟수만 수행할 수 있다. 이후 수십억 건의 프롬프트, 검색, 생성 이미지, 에이전트 작업, 내부 비즈니스 요청을 처리할 수 있다.
각 요청은 추론 작업을 추가한다. 더 고도화된 추론 모델은 답변을 반환하기 전에 여러 처리 단계를 거칠 수 있다. 에이전트는 도구를 호출하고 계획을 수정하면서 추가 단계를 더한다.
이 패턴은 최고 학습 성능에서 유용한 출력 단위당 비용으로 관심을 옮긴다. 데이터 센터 운영자는 시스템이 와트, 서버, 랙, 자본 단위당 얼마나 많은 토큰을 제공하는지 고려해야 한다.
Gelsinger는 검색과 광범위한 에이전트 사용 규모에 접근하려면 추론 효율이 10,000배 향상되어야 한다고 주장해 왔다. 그는 이 수치가 컴퓨팅, 에너지, 비용 가정에 기반한 추정치라고 인정했다.
이는 독립적으로 입증된 업계 요구사항이 아니다. 따라서 검증된 벤치마크가 아니라 과제의 규모를 보여 주는 발언으로 읽어야 한다.
그럼에도 근본적인 압박은 현실이다. 유용한 엔터프라이즈 에이전트는 모든 문서 조회, 소프트웨어 작업, 고객 상호작용에 무제한의 컴퓨팅을 쓸 수 없다.
지연 시간도 중요하다. 많은 토큰을 빠르게 생성하는 모델이라도 주변 시스템이 데이터베이스, 네트워크 전송, 보안 검사 또는 애플리케이션 코드를 기다린다면 느리게 느껴질 수 있다.
여기서 GPU 활용률이 중요해진다. 고가의 가속기는 적합한 작업을 처리하는 동안 가치를 창출한다. 데이터 이동이나 직렬 작업 대기로 멈춰 있을 때는 경제적 부담이 된다.
AI 추론 칩은 더 좁은 범위에 최적화된 설계로 이 방정식을 개선하려 한다. 일부는 컴퓨팅 가까이에 더 많은 메모리를 배치한다. 다른 일부는 데이터플로 아키텍처, 더 낮은 수치 정밀도, 결정론적 실행 또는 특정 모델에 맞춘 소프트웨어를 사용한다.
이러한 접근법에는 절충이 따른다. 특수 칩은 선택된 워크로드에서 GPU를 능가할 수 있지만, 지원하는 모델, 라이브러리 또는 배포 도구는 더 적을 수 있다.
통합 과정은 이론적 절감 효과를 없앨 수도 있다. 기업에는 모니터링, 보안, 오케스트레이션, 모델 지원, 그리고 플랫폼을 이해하는 엔지니어가 필요하다.
이것이 Nvidia의 소프트웨어 입지가 여전히 중요한 이유 중 하나다. CUDA는 개발자에게 성숙한 프로그래밍 환경을 제공하며, Nvidia의 라이브러리는 모델 학습, 추론, 네트워킹, 데이터 처리를 아우른다.
경쟁사는 유리한 칩 벤치마크를 공개하는 것만으로 승리하지 못한다. 고객이 설치하고, 프로그래밍하고, 운영하고, 업데이트할 수 있는 신뢰할 만한 시스템을 제공해야 한다.
추론 경제성은 애플리케이션에 따라 달라진다. 대화형 채팅은 낮은 지연 시간을 요구한다. 오프라인 문서 처리는 처리량을 우선시할 수 있다. 비디오 생성은 추천 시스템과 다른 메모리 및 컴퓨팅 패턴을 요구한다.
배치 크기도 결과를 바꾼다. 많은 동시 요청을 처리하는 공급자는 소규모 엔터프라이즈 배포보다 대형 가속기를 더 바쁘게 유지할 수 있다.
이러한 변동성은 GPU가 본질적으로 지나치게 비싸다는 보편적 주장을 약화시킨다. 반면 아키텍처 선택은 워크로드에서 시작해야 한다는 Gelsinger의 더 좁은 주장은 강화한다.
이해관계는 칩 공급업체를 넘어선다. 클라우드 제공업체는 어떤 프로세서를 구매하고 어떻게 가격을 책정할지 결정해야 한다. 소프트웨어 기업은 이식성과 하드웨어별 최적화 사이에서 선택해야 한다.
엔터프라이즈 구매자는 또 다른 질문에 직면한다. 용량을 임대할 수도, 사설 인프라를 운영할 수도, 기초 하드웨어를 감추는 관리형 모델 서비스를 이용할 수도 있다.
올바른 선택은 활용률, 데이터 통제, 지연 시간, 인력 구성에 달려 있다. 유행하는 프로세서 이름이 이러한 요구사항을 해결해 주지는 않는다.
Google은 현재의 생성형 AI 주기가 시작되기 수년 전 이 구분을 인식했다. 초기 Tensor Processing Unit은 도메인 특화 설계로 신경망 워크로드를 겨냥했다.
Google의 최신 Ironwood TPU는 추론과 대규모 추론 모델을 위해 명시적으로 포지셔닝됐다. 이 제품은 Gelsinger의 논지를 시험하는 또 하나의 사례다.
따라서 시장은 여러 종류의 가속기로 이동하고 있다. 어려운 부분은 이들이 하나의 신뢰할 수 있는 컴퓨팅 환경처럼 작동하게 만드는 것이다.
Nvidia의 CPU 전략은 이기종 컴퓨팅 주장을 뒷받침한다
GPU의 한계에 대한 Nvidia의 대응은 GPU를 포기하는 것이 아니다. 목적에 맞게 설계된 프로세서와 긴밀히 통합된 소프트웨어로 GPU를 둘러싸는 것이다.
이 전략은 에이전트 워크로드용 Nvidia 맞춤형 CPU인 Vera에서 확인할 수 있다. Nvidia는 Vera가 AI 가속기 주변의 오케스트레이션, 분석, 데이터 처리 및 기타 CPU 종속 작업을 처리한다고 말한다.
Vera는 Nvidia가 설계한 Olympus 코어 88개와 LPDDR5X 메모리 하위 시스템을 포함한다. Nvidia는 이 프로세서가 초당 최대 1.2테라바이트의 메모리 대역폭을 제공한다고 말한다.
이 CPU는 NVLink-C2C를 통해 Rubin GPU와 연결된다. Nvidia는 이 연결에서 최대 초당 1.8테라바이트의 일관성 대역폭을 제공한다고 보고한다.
이는 회사가 제시한 사양이지 독립적인 성능 결과가 아니다. 그럼에도 이 아키텍처가 중요한 이유는 Nvidia가 문제를 어떻게 정의하는지 보여 주기 때문이다.
이 회사는 더 이상 GPU를 독립적인 부품으로 판매하지 않는다. CPU, GPU, 네트워킹, 스토리지 프로세서, 스위치, 라이브러리, 랙 수준 설계를 포함한 가속 컴퓨팅 플랫폼을 설명한다.
Nvidia의 Vera CPU 발표는 이 프로세서가 Python 런타임, 샌드박스 코드, 분석, 에이전트 오케스트레이션을 겨냥한다고 밝힌다. 이는 Gelsinger의 비판 배경이 된 바로 그 분기형 워크로드다.
이 겹침은 이 글의 핵심적인 반전을 만든다. Gelsinger는 GPU의 한계를 지적하는 반면, Nvidia는 그 한계를 보완하는 데 필요한 구성 요소에 대규모로 투자하고 있다.
Nvidia는 이 투자를 후퇴로 설명하지 않는다. CPU-GPU 통합을 가속 컴퓨팅의 확장으로 제시한다.
Gelsinger는 Nvidia의 2026년 3월 GTC 컨퍼런스 이후 비슷한 결론에 도달했다. Reuters 영상에서 그는 CPU-GPU 연결성이 시스템 설계에 중요하다고 말했다.
그는 또한 Nvidia의 기술 발표를 높이 평가하면서도 회사가 여전히 성과를 입증해야 한다고 경고했다. 이 반응은 바이럴 헤드라인이 시사하는 것보다 훨씬 균형 잡혀 있다.
Nvidia의 입지는 주변 플랫폼에 대한 통제력 덕분에 더욱 강해진다. Nvidia는 프로세서 설계를 NVLink, 네트워킹, 소프트웨어 라이브러리, 완성형 랙과 조율할 수 있다.
이러한 조율은 통신 오버헤드를 줄이고 배포를 간소화할 수 있다. 동시에 고객이 한 공급업체의 아키텍처에 더 의존하게 만들기도 한다.
이 플랫폼 전략은 경쟁사에 어려운 목표를 제시한다. 경쟁 칩이 와트당 성능에서는 더 나을 수 있지만, 동등한 네트워킹이나 소프트웨어 지원이 부족할 수 있다.
Nvidia는 여러 계층에 걸쳐 동시에 경제성을 개선할 수도 있다. 더 빠른 인터커넥트는 GPU의 연산 유닛을 바꾸지 않고도 GPU 활용률을 높일 수 있다.
소프트웨어 최적화는 메모리 사용량을 줄일 수 있다. 새로운 수치 형식은 처리량을 높일 수 있다. 특화된 추론 프로세서는 기존 GPU에 적합하지 않은 워크로드를 처리할 수 있다.
이는 Pat Gelsinger의 GPU 비판이 Nvidia의 쇠퇴를 자동으로 예측하지는 않는다는 뜻이다. Nvidia는 Nvidia 시스템의 기준 자체를 바꿔 대응할 수 있다.
이 회사는 이미 자신을 단순한 GPU 제조업체가 아니라 가속 컴퓨팅 플랫폼으로 설명한다. 하드웨어 로드맵도 이러한 특성을 뒷받침한다.
그럼에도 고객은 이런 주장을 자사 애플리케이션을 기준으로 검증해야 한다. 긴밀히 통합된 플랫폼은 대규모 환경에서는 효율적일 수 있지만, 더 작은 배포 환경에는 과도할 수 있다.
또한 운영상 집중 위험을 초래할 수 있다. 한 공급업체의 하드웨어 일정, 네트워킹 계층 또는 소프트웨어 스택에 영향을 주는 문제는 전체 시스템에 영향을 미칠 수 있다.
그러나 고객이 배포 속도를 우선시할 때 통합은 분명한 상업적 이점을 제공한다. 구매자는 여러 미성숙 구성 요소를 직접 조립하지 않기 위해 어느 정도의 종속을 받아들이는 경우가 많다.
따라서 당면한 경쟁은 GPU 대 CPU가 아니다. Nvidia의 통합 플랫폼과 여러 공급업체의 프로세서를 더 개방적으로 조합한 방식의 경쟁이다.
Intel은 Gelsinger의 논지에 가장 কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ কঠ
계획은 배포가 아니다. 구매자는 시스템이 더 넓은 범위에서 서비스에 들어간 뒤 측정된 활용률, 토큰 경제성, 제공 일정, 신뢰성을 살펴봐야 한다.
Vera가 제어 흐름 작업을 효율적으로 처리해 GPU를 계속 가동 상태로 유지한다면, Nvidia는 자사 플랫폼 내 이기종 컴퓨팅을 검증하게 된다. 이는 Gelsinger의 메커니즘을 뒷받침하는 동시에 Nvidia의 상업적 입지도 강화하는 결과다.
세 번째 신호는 경쟁 AI 추론 칩 전반의 워크로드 이식성이다. 고객은 전체 애플리케이션을 다시 구축하지 않고도 Nvidia, Intel, AMD, Google, 그리고 특수 목적 가속기 사이에서 모델을 옮길 수 있어야 한다.
컴파일러, 추론 런타임, 개방형 모델 형식의 발전은 Nvidia의 소프트웨어 우위를 약화할 수 있다. 반면 파편화나 일관되지 않은 결과는 기존 선도 업체의 지위를 유지하게 할 것이다.
다음 Google News 헤드라인은 아마 벤치마크, 파트너십, 또는 극적인 경영진 발언을 강조할 것이다. 독자는 그 이면에서 완전한 시스템에 관한 증거를 찾아야 한다.
각 단계를 어떤 프로세서가 처리했는지, 구성 요소 사이에서 얼마나 많은 데이터가 이동했는지, 그리고 소프트웨어의 유지보수성이 유지됐는지를 물어야 한다. 그다음 지속적인 프로덕션 수요 환경에서 결과를 검토해야 한다.
AI 인프라에 대한 의존도가 커지는 동시에 그 구성이 더욱 다양해지고 있기 때문에 Gelsinger의 주장은 중요하다. 그의 표현이 검증을 대신해서는 안 된다.
개발자와 기업 구매자가 취할 실질적인 조치는 명확하다. 워크로드를 문서화하고, 여러 아키텍처를 테스트하며, 요청부터 유용한 결과에 이르는 전체 경로를 측정하라.
승리하는 시스템은 가장 큰 목소리로 주장하는 시스템이 아니다. 실제 전력, 지연 시간, 소프트웨어, 운영 제약 안에서 신뢰할 수 있는 작업을 제공하는 시스템이다.


