top of page

중국의 저가 AI 모델이 실리콘밸리의 컴퓨팅 사업을 강화할 수 있는 이유

8월 11일
12분 분량

DeepSeek는 유능한 인공지능의 가격을 낮췄지만, 그에 따른 가격 압박이 실리콘밸리의 컴퓨팅 인프라 확충을 멈추게 하지는 못했다.

이러한 표면적 모순은 현재 Google News 전반에서 나타나는 제번스 역설 논쟁의 핵심이다. 자원을 사용하는 비용이 낮아지면 사람들은 흔히 그 자원을 더 많이 소비한다. 개별 작업에 필요한 자원은 줄어들더라도 전체 수요는 증가할 수 있다.

AI에 적용하면, 이 주장은 Nvidia, 클라우드 플랫폼, 데이터센터 운영업체에는 안심이 되는 이야기처럼 들린다. 효율적인 중국 AI 모델은 하나의 답변에 필요한 컴퓨팅 자원을 줄이지만, 동시에 훨씬 더 많은 애플리케이션을 경제적으로 실현 가능하게 만든다.

그러나 독점 모델에 대한 접근권을 판매하는 기업들에는 같은 변화가 훨씬 불편하게 다가온다. DeepSeek, Alibaba, Moonshot AI 및 기타 중국 개발사들은 성능 좋은 모델을 저렴하고 서로 대체 가능한 구성 요소로 바꾸고 있다. 이는 프리미엄 가격 정책을 약화시키고 전환을 더 쉽게 만든다.

따라서 AI 시장의 모든 영역에서 핵심 경쟁 구도는 중국 대 미국이 아니다. 이는 저렴하고 풍부한 모델 출력과 선도적 미국 연구소들이 선호하는 프리미엄 모델 경제성 간의 경쟁이다.

실리콘밸리는 모든 실리콘밸리 기업이 승리하지 않더라도 이 경쟁에서 이익을 얻을 수 있다. 인프라 제공업체는 더 많은 작업량을 처리할 수 있는 반면, 모델 개발업체는 낮은 마진, 더 치열한 경쟁, 줄어든 고객 충성도에 직면한다.

중국의 저가 AI는 경고를 넘어 시장 동력이 됐다

중국 AI 모델은 더 이상 기술적 도전만을 의미하지 않는다. 이들은 일상적인 소프트웨어에 지능을 탑재하는 데 드는 예상 비용을 바꾸고 있다.

DeepSeek는 2025년 1월 R1 추론 모델을 통해 이 방향성을 보여줬다. 이 모델의 출시는 경쟁력 있는 추론 시스템에는 선도적인 미국 모델과 동일한 지출 패턴이 필요하다는 가정에 도전했다.

초기 시장 반응은 희소성에 초점을 맞췄다. 모델이 더 적은 고급 칩을 필요로 한다면 기술 기업들이 인프라 지출을 줄일 수 있다고 투자자들은 판단했다. 효율적인 소프트웨어가 하드웨어 수요를 약화시킬 수 있는지를 시장이 의문시하면서 Nvidia 주가는 급락했다.

이 해석은 절감된 모든 연산을 매출 손실로 간주했다. 모델 사용 비용이 지나치게 높거나, 너무 느리거나, 확장하기 어렵다는 이유로 기업들이 포기했던 애플리케이션은 고려하지 않았다.

DeepSeek는 2026년에도 효율성 주장을 계속 강화했다. 회사의 V4 release notes에 따르면 V4 제품군에는 100만 토큰 컨텍스트 윈도우를 갖춘 Pro 및 Flash 모델이 포함됐다. 컨텍스트 윈도우는 모델이 하나의 요청 동안 고려할 수 있는 정보의 양이다.

DeepSeek는 V4가 스파스 어텐션을 사용한다고 밝힌다. 이는 컨텍스트 중 어느 부분에 집중적 처리를 적용할지를 제한하는 방식이다. 회사는 이 설계가 긴 요청에서 메모리 및 컴퓨팅 요구량을 줄이는 방법이라고 설명한다.

이러한 주장은 실제 워크로드 전반에서 독립적인 평가가 필요하다. 모델 개발업체가 제공하는 벤치마크 결과만으로는 신뢰성, 지연 시간, 안전 통제 또는 프로덕션 서비스 운영 비용을 포착하기 어렵다.

그럼에도 상업적 신호는 분명하다. DeepSeek는 V4-Flash를 대량 처리 용도로 포지셔닝하고, 계정 동시성 한도를 최대 2,500개의 동시 연결까지 설정했다. 이는 단순한 연구 시연이 아니다. 저렴한 모델 출력을 기반으로 고객 대면 서비스를 구축하라는 제안이다.

다른 중국 개발사들도 같은 방향을 강화하고 있다. Alibaba의 Qwen 제품군은 공개 릴리스, 폭넓은 언어 지원, 여러 규모로 제공되는 모델을 통해 개발자들을 끌어모았다. Moonshot AI는 긴 컨텍스트와 에이전트형 작업을 중심으로 Kimi 모델을 홍보해 왔다.

에이전트형 시스템은 모델이 단계를 계획하고, 소프트웨어 도구를 호출하며, 목표를 향해 계속 작업하도록 하는 애플리케이션이다. 하나의 사용자 요청이 다수의 내부 상호작용을 유발할 수 있기 때문에, 기존 챗봇보다 훨씬 많은 모델 출력을 소비할 수 있다.

최근 Google News 보도는 이러한 출시를 확대되는 가격 전쟁으로 다뤘다. 이 설명은 사건의 한 측면을 포착하지만, 더 큰 변화를 놓친다. 비용 하락은 하루 종일 AI를 경제적으로 실행할 수 있는 소프트웨어의 범위를 넓히고 있다.

과거의 지원 봇은 고객이 티켓을 제출한 뒤 하나의 답변만 생성했을 수 있다. 더 저렴한 에이전트는 티켓을 분류하고, 문서를 검색하고, 답변 초안을 작성하고, 계정 이력을 검토하며, 문제가 재발하는지 모니터링할 수 있다.

각 단계에는 더 효율적인 모델을 사용할 수 있다. 그러나 전체 워크플로는 여전히 기존의 더 단순한 상호작용보다 더 많은 총연산을 소비할 수 있다.

이 구분은 중국 AI의 효율성을 단순한 하드웨어 위협이 아니라 수요의 문제로 바꾼다.

Google News는 AI 비용 급락을 추적하고 있다

유용한 모델 출력의 비용은 개발자들이 기존 애플리케이션에 지불하는 비용만이 아니라, 무엇을 구축할 수 있는지를 바꿀 만큼 빠르게 떨어졌다.

이 추세는 DeepSeek가 세계적인 이름이 되기 전부터 시작됐다. Stanford의 2025 AI Index는 GPT-3.5 수준의 벤치마크 성능을 가진 모델을 쿼리하는 비용이 2022년 11월부터 2024년 10월 사이 280배 이상 하락했다고 밝혔다.

Stanford는 또한 일반적인 언어 이해 기준을 넘는 가장 작은 모델이 2022년 5,400억 개 파라미터에서 2024년 38억 개로 줄었다고 분석했다. 파라미터는 모델이 입력을 출력으로 변환하도록 돕는 학습된 값이다.

AI Index findings에 요약된 이 수치는 모델 효율성이 한 회사만의 고립된 성과가 아님을 보여준다. 하드웨어 개선, 소프트웨어 최적화, 모델 압축, 더 강력한 훈련 방법이 함께 작동하고 있다.

중국 AI 연구소들은 서로 다른 제약에 직면하기 때문에 이러한 추세를 강화한다. 미국의 수출 통제는 이들의 특정 고급 프로세서 접근을 제한해 왔다. 이러한 압박은 가용 하드웨어에서 더 많은 성능을 끌어낼 강한 유인을 제공한다.

전문가 혼합 아키텍처는 이에 대한 한 가지 대응이다. 이 모델들은 많은 특화 구성 요소를 포함하지만, 각 토큰마다 그중 일부만 활성화한다. 토큰은 모델이 처리하는 작은 텍스트 단위다.

스파스 어텐션은 또 다른 경로를 제시한다. 이전 컨텍스트 중 전체 세부 사항을 검토하는 양을 줄여, 긴 요청을 느리게 만들 수 있는 메모리 트래픽을 줄인다.

모델 증류는 더 큰 시스템의 동작을 더 작은 모델로 이전할 수도 있다. 작은 모델은 보통 일부 성능을 희생하지만 운영 비용은 훨씬 낮아질 수 있다.

이 방법들 가운데 어느 것도 컴퓨팅의 필요성을 없애지는 않는다. 각 작업에 필요한 양과 유형을 바꿀 뿐이다.

이 차이는 AI 수요가 점차 훈련에서 추론으로 이동하고 있기 때문에 중요하다. 훈련은 모델을 만들거나 업데이트한다. 추론은 완성된 모델이 텍스트를 작성하고, 이미지를 분석하고, 코드를 생성하거나, 행동을 선택할 때마다 발생한다.

훈련 비용은 크고 눈에 띄는 프로젝트 형태로 발생한다. 추론은 반복적인 사용을 통해 누적된다. 성공한 소비자 제품, 코딩 에이전트 또는 기업용 어시스턴트는 수백만 사용자 전반에서 지속적으로 요청을 생성할 수 있다.

모델 비용 하락에 관한 Google News 기사가 데이터센터 확장 헤드라인과 나란히 놓이는 이유가 여기에 있다. AI 사용량이 고정돼 있다고 가정할 때에만 이 두 현상은 모순처럼 보인다.

사용량은 고정돼 있지 않다. 비용 하락은 개발자들이 더 많은 모델 호출을 추가하고, 더 긴 컨텍스트를 유지하며, 여러 후보 답변을 생성하고, 첫 번째 응답을 점검하는 검증 모델을 사용하도록 장려한다.

추론 모델은 또 다른 승수를 더한다. 이들은 눈에 보이는 답변을 반환하기 전에 문제를 풀어가는 과정에서 내부 토큰을 생성하는 경우가 많다. 사용자는 시스템이 훨씬 긴 연산을 마친 뒤 짧은 응답만 볼 수 있다.

에이전트는 이 순환을 다시 확장한다. 코딩 에이전트는 리포지토리를 검토하고, 변경 사항을 계획하고, 파일을 편집하고, 테스트를 실행하고, 실패 내용을 읽고, 작업을 수정할 수 있다. 하나의 지시가 수십 번의 추론 작업으로 이어질 수 있다.

이 때문에 저렴한 토큰이 자동으로 더 작은 컴퓨팅 청구서로 이어지지는 않는다. 개발자들은 흔히 절감분을 더 유능한 동작에 다시 투입한다.

경제적 핵심 질문은 작업당 비용 하락보다 수요가 더 빠르게 증가하느냐이다. 제번스 역설은 사용량 증가가 효율성 향상을 상쇄하고도 남을 때에만 적용된다.

현재 증거는 그 방향을 가리키지만, 모든 모델, 고객 또는 칩 공급업체에 대해 이 문제가 해결됐다는 뜻은 아니다.

제번스 역설은 모델 공급업체보다 컴퓨팅에 더 유리하다

더 저렴한 지능은 인프라 시장을 확대하는 동시에 모델 자체를 만드는 기업들의 경제성을 약화시킬 수 있다.

William Stanley Jevons는 19세기 영국의 석탄 사용을 중심으로 원래의 주장을 전개했다. 더 효율적인 증기기관은 작업 단위당 필요한 석탄량을 줄였지만, 동시에 더 많은 산업에서 증기력을 유용하게 만들었다.

그 결과 총석탄 소비는 줄지 않고 늘어났다. 현대의 반등 효과가 AI에서 역사를 완벽히 반복할 필요는 없다. 더 낮은 비용에 대한 반응이 충분히 강하면 된다.

클라우드 플랫폼에서는 그 메커니즘을 쉽게 볼 수 있다. 이전에는 비용이 높은 요청 하나만 보냈던 고객이 이제는 더 저렴한 요청을 여러 번 보내거나, 더 많은 사용자를 서비스하거나, 모델을 지속적으로 실행할 수 있다.

Amazon Web Services, Microsoft Azure, Google Cloud, Oracle는 이러한 추가 활동이 자사의 데이터센터 안에 머무를 때 이익을 얻을 수 있다. 이들은 모델을 둘러싼 컴퓨팅, 스토리지, 네트워킹 및 관리형 서비스에서 매출을 올린다.

총추론 수요가 더 많은 가속기를 필요로 할 만큼 빠르게 증가하면 Nvidia도 이익을 얻을 수 있다. 회사의 2026 회계연도 실적은 효율성이 아직 인프라 성장을 멈추게 하지는 못했다는 관점을 뒷받침한다.

Nvidia는 연간 데이터센터 매출이 1,937억 달러로 68% 증가했다고 보고했다. fiscal 2026 results에 따르면 4분기 데이터센터 매출은 전년 대비 75% 증가한 623억 달러에 달했다.

회사는 또한 Rubin 플랫폼이 Blackwell과 비교해 추론 토큰 비용을 최대 10분의 1까지 낮출 수 있다고 설명했다. Nvidia는 토큰당 비용 하락을 더 적은 시스템을 판매해야 할 이유로 보지 않는다. 차세대 제품 구매 논리의 일부로 효율성을 내세우고 있다.

이 전략은 고객들이 절감분을 더 높은 사용량에 재투자할 것이라는 가정에 기반한다. 또한 Nvidia가 그에 따른 워크로드에서 의미 있는 점유율을 유지한다는 가정도 필요하다.

첫 번째 가정은 점점 더 그럴듯해 보인다. AI 제품은 선택 사항인 채팅 창에서 코딩, 광고, 고객 지원, 보안 분석, 문서 처리 및 과학 연구로 이동하고 있다.

두 번째 가정은 덜 확실하다. 효율적인 모델은 AMD의 가속기, 목적형 추론 칩, 클라우드 제공업체가 설계한 시스템을 포함해 더 폭넓은 하드웨어에서 실행될 수 있다.

중국 AI 개발사들은 Huawei 하드웨어나 기타 국내 프로세서에 맞춰 최적화할 수도 있다. 전 세계 AI 추론의 증가는 추가 작업 하나하나가 Nvidia 칩에서 실행된다는 보장은 아니다.

제번스 논리는 전체 컴퓨팅 시장에 가장 직접적으로 적용된다. 이를 특정 공급업체의 시장 점유율에 관한 약속으로 사용할 때는 설득력이 약해진다.

모델 연구소들은 다른 문제에 직면한다. OpenAI, Anthropic, Google DeepMind 및 기타 프런티어 개발사들은 훈련, 연구자, 데이터, 안전성 작업 및 인프라에 막대한 비용을 지출한다.

이들은 전통적으로 고급 기능이 프리미엄 이용을 뒷받침할 것으로 기대해 왔다. 저렴한 중국 AI 모델은 일상적인 작업에 사용할 만한 대안을 개발자들에게 제공함으로써 이러한 프리미엄을 압축한다.

기업은 가장 어려운 요청에는 선도적인 독점 모델을 배정하는 한편, 요약, 분류, 추출, 간단한 코드 변경은 더 저렴한 시스템으로 보낼 수 있다.

이러한 관행을 모델 라우팅이라고 한다. 소프트웨어가 각 요청을 평가한 뒤, 해당 작업에 충분하다고 판단되는 모델로 보낸다.

라우팅은 요청 단위에서 모델들이 경쟁하게 만든다. 사용자가 특정 단계를 어떤 모델이 처리했는지 보지 못할 때는 브랜드 충성도의 중요성이 줄어든다.

Axios는 이러한 변화를 범용화된 지능을 향한 경쟁으로 설명하며, 라우팅이 모델 위에서 가치 있는 계층이 될 가능성을 제시했다. Axios의 AI 가격 전쟁 분석은 Anthropic도 프리미엄 가격을 지키는 대표적 기업으로 지목했다.

여기서 핵심적인 역전이 발생한다. 저렴한 중국 AI는 Silicon Valley의 인프라 지출을 정당화할 수 있는 반면, 그 지출의 일부를 뒷받침해야 할 프리미엄 모델 수익은 약화시킬 수 있다.

승자와 패자는 서로 다른 계층에 있다

제번스 역설은 AI 산업 전체를 구제하지 않는다. 대신 수요, 유통, 희소한 인프라를 통제하는 계층으로 가치를 재분배한다.

여러 모델 중에서 선택하는 개발자는 결과물의 품질, 신뢰성, 지연 시간, 프라이버시, 비용을 고려한다. 여러 시스템이 최소 요구 사항을 충족하면 모델 자체는 대체하기 쉬워진다.

오픈 웨이트는 이 과정을 가속한다. 오픈 웨이트 모델은 다른 사람이 학습된 파라미터를 내려받아 운영할 수 있게 하지만, 학습 데이터와 전체 개발 과정은 여전히 비공개일 수 있다.

기업은 이러한 모델을 자체 인프라에 배포하고, 동작을 수정하며, 하나의 API 제공업체에 대한 의존을 피할 수 있다. 또한 상업적 공급업체와 더 유리한 위치에서 협상할 수 있다.

이는 모델 접근권을 주력 상품으로 삼는 연구소들을 위협한다. 프런티어 모델은 기술적으로 우수한 상태를 유지할 수 있지만, 일상적인 추론 수요에서는 제한적인 점유율만 확보할 수 있다.

수요가 여러 모델로 분산될 때 인프라 제공업체는 더 강한 위치를 차지한다. 어떤 선택지든 결국 어딘가에서 프로세서, 메모리, 스토리지, 네트워킹, 전력이 필요하다.

클라우드 제공업체는 하나의 관리형 플랫폼을 통해 경쟁 모델들도 제공할 수 있다. 따라서 고객이 기반 모델을 바꾸더라도 워크로드 수익을 확보할 수 있다.

애플리케이션 기업은 또 다른 이점을 얻을 수 있다. 모델 비용이 하락하면 고객 관계, 독점 데이터, 워크플로 설계, 유통에 지출을 집중할 수 있다.

예를 들어 회계 보조 도구는 모델이 추론할 수 있다는 이유만으로 유용해지지 않는다. 기록에 연결되고, 권한을 준수하며, 감사 추적을 보존하고, 사람의 검토가 필요한 시점을 파악해야 한다.

코딩 보조 도구는 리포지터리를 이해하고, 도구를 안전하게 실행하며, 프로젝트 관례를 따르고, 무엇이 변경됐는지 개발자에게 보여줘야 한다. 이러한 주변 역량은 벤치마크 점수로 측정할 수 없는 가치를 만든다.

따라서 저렴한 중국 AI 모델은 협상력을 모델 연구소에서 애플리케이션 쪽으로 이동시킬 수 있다. 모델은 더 큰 시스템 안의 하나의 구성 요소가 된다.

이러한 결과는 과거 클라우드 시장과 닮았다. 오픈소스 데이터베이스와 범용 서버는 기술 지출을 없애지 않았다. 대신 관리형 서비스, 개발자 경험, 운영 복잡성을 줄이는 플랫폼으로 가치를 옮겼다.

이 비유에는 한계가 있다. 모델은 일관되지 않은 답변을 낼 수 있고, 데이터 편향을 물려받을 수 있으며, 민감한 정보를 노출할 수 있다. 조직은 이를 완전히 상호교환 가능한 전기처럼 취급할 수 없다.

안전성과 거버넌스 요구 사항은 프리미엄 제공업체의 여지를 보존할 수 있다. 은행은 최저 운영 비용보다 계약상 보호, 지역별 호스팅, 모니터링, 예측 가능한 모델 동작을 더 중시할 수 있다.

기업들은 전환 비용도 마주한다. 프롬프트, 평가 시스템, 검색 파이프라인, 안전 규칙은 기반 모델이 바뀔 때 조정이 필요한 경우가 많다.

그럼에도 전환은 쉬워지고 있다. 많은 제공업체가 호환 가능한 인터페이스를 지원하며, 독립 플랫폼은 여러 모델 사이에서 요청을 라우팅할 수 있다.

DeepSeek의 문서는 OpenAI 스타일과 Anthropic 스타일의 인터페이스를 모두 명시적으로 지원한다. 동작상 차이가 남아 있더라도, 인터페이스 호환성은 대안을 시험하는 데 필요한 엔지니어링 작업을 줄인다.

이 압력은 미국 연구소들에 서로 다르게 작용한다.

Google은 검색, Android, Workspace, Google Cloud를 통해 Gemini를 유통할 수 있다. Microsoft는 모델을 Azure, Microsoft 365, GitHub, 기업용 ID 시스템과 결합할 수 있다. Amazon은 특정 모델 하나가 지배적인 위치를 차지하지 않아도 인프라와 관리형 접근권을 판매할 수 있다.

OpenAI와 Anthropic은 강력한 제품과 개발자 인지도를 보유하고 있지만, 운영체제, 업무용 소프트웨어, 퍼블릭 클라우드 인프라에 대한 통제력은 더 약하다. 이들의 모델은 상업적 부담을 더 많이 짊어져야 한다.

Nvidia는 정반대의 노출 구조를 가진다. 특정 모델 하나가 승리할 필요는 없다. 전체 가속 컴퓨팅 수요가 증가하고, 자사의 플랫폼이 해당 작업을 실행하는 선호 환경으로 남으면 된다.

Peterson Institute for International Economics의 DeepSeek 이후 평가는 컴퓨팅 공급망 전반의 수익 증가가 제번스 해석을 뒷받침한다고 주장한다.

이 결론이 효율성이 수익을 보장한다는 포괄적 주장으로 확대되어서는 안 된다. 수요는 증가해도 마진은 하락할 수 있다. 매출은 늘어도 자본 요구량은 더 빠르게 증가할 수 있다.

시장도 과잉 구축될 수 있다. 애플리케이션이 충분한 유료 사용량을 창출하기 전에 데이터센터가 들어서면, 운영업체는 장기 수요 성장에도 불구하고 낮은 수익률을 마주할 수 있다.

제번스 역설은 소비를 설명한다. 그 소비를 뒷받침하는 자산에서 어떤 기업이 가장 높은 수익을 얻는지는 결정하지 않는다.

제번스 논증이 증명하지 못하는 것

강세론적 인프라 전망은 벤치마크 개선이나 광고된 요금 인하만이 아니라 실제 사용량에 달려 있다.

첫 번째 불확실성은 품질이다. 오류 때문에 사람들이 작업을 반복하거나, 모든 답변을 점검하거나, 손상된 데이터를 복구해야 한다면 저렴한 모델은 가치가 거의 없다.

개발자들은 광범위한 리더보드보다 특정 작업에서 모델을 평가하는 경우가 늘고 있다. 코딩 벤치마크에서 좋은 성능을 내는 모델도 기업의 비공개 코드베이스나 흔치 않은 프로그래밍 언어에서는 어려움을 겪을 수 있다.

긴 컨텍스트도 또 다른 사례다. 큰 컨텍스트 윈도우를 지원한다고 해서 모델이 그 컨텍스트의 모든 부분을 정확하게 활용한다는 뜻은 아니다. 핵심 정보가 관련 없는 문서들 사이에 묻히면 검색 품질은 저하될 수 있다.

두 번째 불확실성은 수요 탄력성, 즉 가격 변화에 소비가 얼마나 강하게 반응하는지를 뜻한다. 제번스 역설이 성립하려면 사용량이 효율성 절감분을 넘을 정도로 증가해야 한다.

이는 소프트웨어가 반복 요청을 생성할 수 있는 코딩 에이전트, 연구 도구, 콘텐츠 시스템에서 발생할 수 있다. 그러나 인간의 주의력에 제약을 받는 애플리케이션에서는 그렇지 않을 수 있다.

요약이 더 저렴해졌다고 해서 사람이 무제한의 보고서를 읽을 수는 없다. 법무팀은 무한한 계약을 승인할 수 없다. 기업은 프라이버시, 거버넌스, 운영 리스크 때문에 사용량을 제한할 수 있다.

세 번째 불확실성은 수익의 질이다. 제공업체는 더 많은 토큰을 처리하면서도 토큰당 수익은 더 적게 벌 수 있다. 인프라 활용률은 높아져도 매력적인 마진으로 이어지지 않을 수 있다.

경쟁은 이 위험을 더 날카롭게 만든다. Nvidia, AMD, 클라우드 자체 설계 칩, 추론 스타트업, 중국 가속기 업체 모두 확대되는 수요의 몫을 원한다.

워크로드는 더 작은 로컬 시스템으로도 이동할 수 있다. 효율적인 모델을 실행하는 노트북이나 스마트폰은 모든 요청마다 대형 데이터센터를 호출하지 않고도 작업을 처리한다.

온디바이스 추론은 AI 사용을 확대하지만, 그에 따른 가치를 누가 확보하는지는 바꾼다. 퍼블릭 클라우드 플랫폼보다 기기 제조업체와 엣지 칩 공급업체에 유리할 수 있다.

네 번째 불확실성은 에너지다. 더 효율적인 컴퓨팅은 작업당 전력 사용량을 줄이지만, 제번스식 수요 증가는 총 전력 소비량을 늘릴 수 있다.

Stanford의 2026 AI Index는 AI 데이터센터 용량이 29.6기가와트에 도달했다고 추정한다. 이 규모에서는 전력 공급, 전력망 연결, 냉각, 물 접근성이 전략적 제약이 된다.

효율성은 데이터센터가 고정된 전력 한도 안에서 더 많은 요청을 처리하도록 도울 수 있다. 동시에 운영업체가 가용한 모든 메가와트를 채우도록 장려할 수도 있다.

환경적 결과는 에너지원과 반등의 규모에 달려 있다. 요청당 탄소 발자국이 낮아졌다고 해서 총배출량이 줄어드는 것은 아니다.

다섯 번째 불확실성은 칩 접근성에 관한 것이다. 미국의 수출 통제는 중국 모델 개발을 형성했고, Nvidia가 중국 고객에게 서비스를 제공하는 능력을 제한했다.

Nvidia는 2027회계연도 1분기 전망에서 중국 데이터센터 컴퓨팅 수익을 제외했다. 저렴한 중국 모델은 글로벌 추론 수요를 만들 수 있지만, 지정학적 규칙 때문에 미국 공급업체는 그 일부를 확보하지 못할 수 있다.

검증 문제도 있다. 모델 개발자들은 서로 다른 조건에서 벤치마크 점수를 발표하며, 전체 학습 비용이나 운영 비용은 좀처럼 공개되지 않는다.

DeepSeek의 효율성 주장은 기술적 방향에 관한 귀중한 증거를 제공한다. 그러나 이는 모든 미국 모델과의 완전하고 독립적으로 감사된 비교를 제공하지는 않는다.

따라서 Google News 독자들은 흔히 함께 제시되는 세 가지 진술을 구분해야 한다.

첫째, 중국 연구소들은 점점 더 유능하고 저렴한 모델을 출시해 왔다. 출시된 제품과 문서는 이 진술을 뒷받침한다.

둘째, 더 낮은 비용은 더 폭넓은 AI 도입을 장려하고 있다. 하락하는 추론 비용과 확대되는 에이전트 사용은 이러한 방향을 뒷받침하지만, 정확한 반등 규모는 애플리케이션마다 다르다.

셋째, Silicon Valley의 모든 주요 투자는 매력적인 수익을 낼 것이다. 제번스 역설도 현재의 매출 성장도 이 주장을 증명하지 않는다.

이 구분은 중요하다. 기술 붐은 막대한 소비를 만들어내면서도 일부 공급업체의 가치를 파괴할 수 있기 때문이다.

저렴한 AI 가설을 시험할 세 가지 신호

다음 단계는 또 한 차례의 헤드라인용 벤치마크가 아니라, 측정된 추론 성장, 모델 라우팅, 인프라 수익률에 의해 결정될 것이다.

첫 번째 신호는 클라우드 및 칩 기업이 보고하는 추론 물량이다. 투자자들은 배포된 워크로드, 가속기 활용률, 토큰 처리량의 지속적인 성장을 살펴봐야 한다.

단위 비용 하락과 함께 인프라 수익이 증가한다면 제번스 사례는 더 강해질 것이다. 이는 새로운 수요가 고객 청구서를 줄이는 데 그치지 않고 효율성 개선을 흡수하고 있음을 보여줄 것이다.

낮은 요금과 사용량 정체가 결합되면 이 가설은 약화될 것이다. 그 결과는 기업들이 효율성을 주로 기존 작업의 비용 절감에 활용하고 있음을 시사할 것이다.

두 번째 신호는 모델 라우팅의 도입이다. 개발자들은 이제 단순 작업은 저렴한 시스템으로 보내고, 프런티어 모델은 어려운 작업에 남겨둘 강한 유인을 갖고 있다.

라우팅이 늘어난다면 모델 출력이 저가 영역에서 범용재가 되고 있음을 확인하게 된다. 또한 가치가 어디로 이동하는지도 보여줄 것이다. 즉, 클라우드 플랫폼, 애플리케이션 개발업체, 모델 중에서 선택하는 소프트웨어 쪽이다.

주요 엔터프라이즈 플랫폼이 라우팅 제어 기능, 자동 평가, 폴백 모델을 제공하는지 지켜봐야 한다. 이러한 기능은 전환을 예외적인 일이 아니라 일상적인 절차로 만들 것이다.

그 결과 프리미엄 제공업체는 더 나은 신뢰성, 보안 또는 추론 능력이 자신의 위치를 정당화한다는 점을 입증해야 하는 압박을 받게 된다. 벤치마크 우위만으로는 상업적 의미가 줄어들 것이다.

세 번째 신호는 신규 데이터센터가 창출하는 수익률이다. 자본 지출은 기술 기업들이 미래 수요를 얼마나 강하게 믿는지 보여준다. 활용률과 수익은 그 믿음이 옳았는지를 드러낸다.

Nvidia의 최근 성장세는 최초의 DeepSeek 충격 이후에도 인프라 사이클이 강하게 유지됐음을 보여준다. 또한 추론 비용을 낮추겠다는 약속은 미국 하드웨어 기업들 역시 같은 효율성 경쟁에 참여하고 있음을 시사한다.

관건은 애플리케이션이 새 시스템을 충분히 가동 상태로 유지할 만큼 빠르게 성장하는지다. 데이터센터 프로젝트 지연, 낮은 가동률, 클라우드 마진 하락은 가장 낙관적인 해석을 약화시킬 수 있다.

지속적인 매출 성장, 더 높은 추론 용량, 더 많은 에이전트 배포는 이를 뒷받침할 것이다. 이런 결과는 저렴한 AI가 단위 지출을 압축하는 속도보다 더 빠르게 시장을 확대하고 있음을 보여줄 것이다.

개발자와 기업 구매자에게 당장의 교훈은 실용적이다. 모델 선택은 영구적인 충성이 아니라 워크로드에 따른 결정이 되어야 한다.

팀은 자체 데이터에서 정확도, 지연 시간, 개인정보 보호, 전체 워크플로 비용을 평가해야 한다. 또한 시장 변화에 따라 제공업체를 바꿀 수 있는 유연성도 유지해야 한다.

지식 근로자도 비슷한 변화를 맞이한다. 모델 비용이 낮아지면 애플리케이션은 더 많은 회의, 문서, 프로젝트 이력을 분석할 수 있게 된다. 어려운 부분은 유용한 맥락과 신뢰할 수 있는 소스 자료를 유지하는 일이다.

구조화된 AI 지식 베이스는 에이전트가 여러 차례의 검색, 비교, 검증 단계를 부담 없이 수행할 수 있게 될수록 더 가치가 커진다.

따라서 Google News 전반에서 제기되는 질문은 중국의 저렴한 AI 모델이 Silicon Valley에 해를 끼치는지, 아니면 도움이 되는지가 아니다. 어느 계층을 보느냐에 따라 둘 다 해당한다.

이들은 프리미엄 모델의 마진을 위협하고, 구매자의 협상력을 강화하며, 애플리케이션 기업의 기술적 진입장벽을 낮춘다. 동시에 칩, 클라우드, 네트워크, 데이터센터에 더 많은 수요를 만들 수 있다.

다음 10억 건의 모델 호출이 어디에서 실행되는지, 어떤 시스템이 이를 라우팅하는지, 그리고 고객이 그 기반 인프라를 뒷받침할 만큼 충분히 비용을 지불하는지 지켜봐야 한다. 그 답은 AI 버전의 Jevons 역설이 지속 가능한 가치를 만들고 있는지, 아니면 소비만 늘리고 있는지를 드러낼 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page