top of page

AI 추론이 훈련을 대체하며 데이터센터 인프라의 핵심 시험대가 되다

9월 3일
11분 분량

Google 인프라 책임자 아나히타 무로(Anahita Mouro)는 최근 google news 이면의 새로운 충돌을 지적했다. AI 인프라의 중심이 모델 훈련에서 지속적인 추론으로 이동하고 있다는 것이다. 기술적인 변화처럼 들리지만, 이는 최근 데이터센터 투자에 깔린 많은 가정을 뒤집는다. 훈련은 일정에 따라 실행되는 대규모 클러스터에 유리하다. 반면 추론은 예측하기 어려운 규모의 요청에도 사용자에게 신뢰성 있고 신속하게 응답해야 한다.

무로는 Google의 하이퍼스케일 인프라를 위한 현장 성능 및 프로세스 우수성 분야를 전문으로 한다. 개인 자격으로 W.Media와 인터뷰한 그는 인프라가 AI 발전의 속도를 좌우하는 요인이 되었다고 말했다. 더 빠른 칩만으로는 지연된 전력망 연결, 부족한 냉각 용량, 취약한 페일오버 시스템, 신뢰할 수 없는 운영 문제를 해결할 수 없다.

이 경고가 중요한 이유는 추론이 AI의 상업적 중심으로 부상하고 있기 때문이다. Gartner는 전 세계 AI 최적화 인프라 서비스 지출이 2026년 423억 달러에 이를 것으로 예상한다. 또한 추론 지출은 233억 달러로, 훈련에 배정되는 190억 달러를 넘어설 것으로 전망했다.

이 변화는 이 글의 핵심 긴장을 만든다. AI 기업은 더 빠른 배포와 반응성이 높은 제품을 원하지만, 물리적 인프라는 여전히 유틸리티, 건설, 인허가 일정에 따라 움직인다. 호주는 매력적인 부지, 에너지 자원, 기술 인력, 아시아태평양 시장 접근성을 갖추고 있다. 그러나 이러한 강점은 프로젝트가 전력에 연결되고 신뢰할 수 있는 프로덕션 서비스로 운영될 때에만 의미가 있다.

Google 뉴스 이면에서 바뀐 것

핵심 AI 인프라 워크로드는 개별 훈련 프로젝트의 연속이 아니라 항상 가동되는 서비스로 바뀌고 있다.

훈련은 방대한 데이터 컬렉션을 사용해 모델을 생성하거나 업데이트하는 과정이다. 운영자는 이러한 워크로드를 일정에 맞춰 실행하거나, 일시 중지하거나, 장애 후 저장된 체크포인트에서 재시작할 수 있다. 이 과정은 상당한 컴퓨팅 용량을 소비하지만, 대부분의 훈련 장애는 최종 사용자에게 드러나지 않는다.

추론은 다르다. 훈련된 모델이 답변을 생성하거나, 정보를 분류하거나, 이미지를 만들거나, 행동을 추천하거나, 소프트웨어를 작동시킬 때마다 발생한다. 추론 요청이 지연되거나 실패하면 곧바로 제품 문제가 된다.

무로의 인프라 인터뷰는 이러한 전환을 훈련 캠퍼스에서 실제 서비스 배포로의 이동으로 설명한다. 그는 추론에는 중요한 소비자 대상 서비스에 요구되는 수준의 프로덕션 운영 규율이 필요하다고 주장한다.

시장 데이터도 이 방향을 뒷받침한다. Gartner의 추론 지출 전망에 따르면, 2026년 추론은 AI 최적화 인프라 서비스 지출의 55%를 차지할 전망이다. 이 비중은 2027년 59%에 이를 것으로 예상된다.

이 수치는 무로가 인용한 전망보다 보수적이다. 해당 전망은 2028년까지 추론이 AI 인프라 지출의 80%를 넘을 것으로 본다. 전망의 정의가 서로 다르므로, 이 비율들을 동일한 기준으로 취급해서는 안 된다. 그럼에도 두 전망 모두 프로덕션 사용이 인프라 우선순위를 바꾸고 있음을 보여준다.

이 변화는 수요 양상도 바꾼다. 훈련 클러스터는 계획된 실행 기간 동안 비교적 안정적인 높은 부하로 작동할 수 있다. 반면 소비자용 AI 서비스는 주간 피크, 갑작스러운 트래픽 급증, 지역별 차이, 인기 기능에서 발생하는 예기치 못한 수요에 대응해야 한다.

하나의 모델은 한 번의 훈련 이후 수십억 건의 추론 작업을 생성할 수 있다. 각 챗봇 답변에는 검색, 추론, 안전성 검사, 응답 생성 등을 포함한 여러 번의 모델 호출이 필요할 수 있다. 에이전틱 시스템은 하나의 사용자 요청을 완료하는 동안 훨씬 더 많은 호출을 생성할 수 있다.

에이전틱 AI는 여러 종속 작업을 계획하고 실행하는 시스템을 뜻한다. 에이전트는 데이터베이스를 검색하고, 애플리케이션을 호출하고, 결과를 확인한 뒤, 다음 단계를 수정할 수 있다. 모든 작업은 또 다른 지연 시간 및 안정성 의존성을 더한다.

이로 인해 전체 응답 시간을 제어하기가 더 어려워진다. 테일 레이턴시라고 불리는 가장 느린 요청의 지연은 체인 전반에 누적되므로 더욱 중요하다. 각각은 허용 가능한 단계들로 구성된 워크플로도 가장 느린 응답들이 겹치면 사용할 수 없게 느껴질 수 있다.

따라서 최신 google news는 단순히 더 많은 서버 용량을 구축하는 문제만이 아니다. 이는 컴퓨팅을 공급하는 방식에서 벗어나 AI를 신뢰할 수 있는 대화형 서비스로 운영하는 방식으로의 전환을 의미한다. 이 차이가 어떤 시설, 네트워크, 운영 모델이 경쟁력을 유지하는지를 결정한다.

추론은 순수 클러스터 규모보다 안정성을 우선시한다

훈련은 집중된 컴퓨팅 성능을 보상하지만, 추론은 시스템의 모든 계층에서 일관된 서비스를 보상한다.

최근 인프라 경쟁은 가속기, 랙 밀도, 훈련 클러스터 규모에 집중되어 왔다. 이러한 지표는 여전히 중요하다. 그러나 실제 고객 트래픽 환경에서 AI 제품이 예측 가능하게 응답할 수 있는지를 보여주지는 못한다.

추론 서비스는 가속기만으로 구성되지 않는다. 요청은 네트워크 장비, 스토리지 시스템, 모델 서버, 로드 밸런서, 안전성 서비스, 외부 애플리케이션을 거친다. 냉각, 전력 분배, 모니터링, 페일오버 시스템은 전체 체인을 뒷받침해야 한다.

무로는 프로덕션 수준의 추론을 로드 밸런서 뒤의 이중화 서버와 상태 점검, 모니터링, 검증된 페일오버, 재해 복구가 뒷받침하는 구조로 설명한다. 이는 익숙한 웹 서비스 운영 방식이지만, AI는 이에 새로운 운영 조건을 더한다.

AI 가속기는 집중된 열을 발생시키며 전력 수요를 급격히 변화시킬 수 있다. 액체 냉각은 높은 랙 밀도에서 많은 기존 공랭 시스템보다 열을 더 효율적으로 옮긴다. 동시에 펌프, 분배 장비, 제어 장치, 잠재적 장애 지점도 추가한다.

가변적인 추론 트래픽은 시설 계획을 더욱 복잡하게 만든다. 운영자는 한산한 시간대에 지나치게 많은 에너지를 낭비하지 않으면서 피크 수요를 감당할 만큼의 전기 및 열 용량을 확보해야 한다. 동적 전력 관리는 선택적 효율화 프로젝트가 아니라 운영 요건이 된다.

네트워킹도 마찬가지로 중요해진다. 훈련은 대개 긴밀하게 연결된 하나의 클러스터 내부에서 초고속 통신에 의존한다. 추론은 사용자, 지역 시설, 데이터베이스, 클라우드 서비스, 외부 도구 사이의 신속한 연결을 요구한다.

고객 대상 어시스턴트는 지연 시간이나 데이터 레지던시 문제로 현지 처리가 필요할 수 있다. 모델은 한 지역에서 실행되는 반면, 비즈니스 정보는 다른 환경에 남아 있을 수 있다. 이러한 아키텍처는 속도, 주권, 비용, 운영 통제를 둘러싼 트레이드오프를 만든다.

Uptime Institute의 2025년 운영자 설문조사는 현재 전략이 얼마나 불확실한지 보여준다. 설문에 참여한 운영자 가운데 거의 3분의 1이 AI 훈련과 추론을 모두 지원한다고 답했다. 응답자 95명 중 64%는 두 워크로드에 동일한 인프라를 사용했다.

공유 인프라는 유연성을 제공하지만, 상충하는 요구사항을 감출 수 있다. 훈련은 가속기 활용률과 클러스터 처리량을 중시한다. 추론은 가용성, 예측 가능한 지연 시간, 지리적 도달 범위, 불규칙한 수요 처리 능력에 더 큰 비중을 둔다.

설문조사는 다양한 복원력 관행도 확인했다. 추론 인프라를 운영한다고 답한 조직 가운데 48%는 이중화 구성 요소를 갖춘 동시 유지보수 가능 시스템을 사용했다. 2N+1 이중화를 갖춘 완전한 내결함 구성이라고 답한 비율은 23%에 그쳤다.

이 결과가 현재 시설이 부적절하다는 것을 증명하는 것은 아니다. 워크로드마다 서비스 요구사항이 다르고, 추가 이중화는 비용과 에너지 오버헤드를 만든다. 다만 업계가 하나의 추론 아키텍처에 아직 합의하지 못했음을 보여준다.

운영자는 어려운 균형을 마주한다. 과도한 이중화는 AI 서비스를 불필요하게 비싸게 만들 수 있다. 복원력이 너무 낮으면 사용자가 장애를 겪게 되고, 인프라 장애가 눈에 보이는 제품 장애로 이어진다.

이 때문에 무로의 경고는 경쟁력의 측정 기준을 바꾼다. 승자가 되는 시설이 반드시 최신 가속기나 가장 큰 공간을 갖춘 곳은 아니다. 중요한 것은 이용 가능한 하드웨어, 전력, 냉각, 네트워크를 신뢰할 수 있는 사용자 대상 결과물로 전환하는 능력이다.

진짜 충돌은 실리콘의 속도와 인프라의 시간 사이에 있다

칩 성능은 제품 주기에 맞춰 발전하지만, 전력망, 변전소, 인허가, 데이터센터 건물은 물리적 개발 일정에 따라 진전된다.

무로의 핵심 주장은 인프라가 AI 발전의 속도를 좌우하는 요인이 되었다는 것이다. 각 가속기 세대는 처리량이나 와트당 성능을 개선할 수 있다. 그러나 시설에 전력, 냉각 용량, 또는 제때 연결되는 전력망이 없다면 이러한 개선의 가치는 제한적이다.

전력 수요는 이미 국가 차원의 계획을 바꾸고 있다. 미국 에너지부의 전력 수요 전망은 데이터센터가 2023년에 176테라와트시를 소비한 것으로 추정했다. 이는 미국 전체 전력 사용량의 약 4.4%에 해당한다.

미 에너지부는 2028년 소비량이 325~580테라와트시에 이를 것으로 전망했다. 이 범위에 따르면 데이터센터는 미국 전력의 약 6.7~12%를 사용할 수 있다. 넓은 범위는 배포와 효율성을 둘러싼 상당한 불확실성도 드러낸다.

글로벌 전망도 같은 방향을 가리킨다. 국제에너지기구의 에너지 분석은 확대되는 AI 배포와 관련된 전력 수요, 전력망 영향, 에너지 안보, 배출량을 살펴본다. 핵심 관찰은 단순하다. AI 서비스에는 물리적인 전력 인프라가 필요하다.

전력 생산은 문제의 일부일 뿐이다. 한 지역이 풍부한 재생에너지 자원을 보유하고 있어도 특정 부지에 필요한 송전선, 변전소, 연결 용량이 부족할 수 있다. 이용 가능한 에너지가 자동으로 공급 가능한 전력을 의미하지는 않는다.

대규모 고객은 운영 개시 수년 전부터 유틸리티 기업과 협력해야 하는 경우가 많다. 개발업체에는 토지, 인허가, 물 또는 대체 냉각 시스템, 변압기, 백업 장비, 고용량 광섬유도 필요하다. 구성 요소 하나라도 지연되면 전체 프로젝트가 미뤄질 수 있다.

AI의 변화하는 하드웨어 주기는 또 다른 위험을 높인다. 하나의 가속기 세대를 중심으로 설계된 건물은 고객 요구사항이 바뀐 뒤에 개장할 수 있다. 따라서 냉각 및 전력 시스템은 불필요하게 비싸지지 않으면서도 적응성을 갖춰야 한다.

이 충돌은 모듈형 전기 시스템, 유연한 냉각 설계, 서로 다른 가속기 유형을 지원할 수 있는 시설에 유리하게 작용한다. 또한 전력, 온도, 용량, 서비스 요구사항에 따라 워크로드를 배분할 수 있는 소프트웨어의 필요성을 강화한다.

하드웨어 조달도 이미 워크로드별로 분화되고 있다. 선도적인 가속기는 모델 훈련에 여전히 가치가 높다. 추론에는 새로운 GPU, 이전 세대 하드웨어, 애플리케이션 특화 집적회로(ASIC)를 포함한 더 폭넓은 조합을 사용할 수 있다.

ASIC는 더 좁은 범위의 작업을 위해 설계된 칩이다. 특화된 추론 하드웨어는 적합한 모델에서 매력적인 와트당 성능을 제공할 수 있다. 그러나 소프트웨어 요구사항이나 모델 아키텍처가 바뀔 때 유연성을 낮출 수도 있다.

따라서 인프라 과제는 하나의 칩을 선택한다고 해결되지 않는다. 운영업체에는 일관된 전력, 냉각, 네트워킹, 모니터링, 신뢰성 기준을 유지하면서도 하드웨어 다양성을 수용할 수 있는 시설이 필요하다.

이것이 이 Google 뉴스의 더 깊은 의미다. Google의 하드웨어 전문성도 중요하지만, Mouro의 주장은 관심을 특정 프로세서 하나에서 멀어지게 한다. 더 어려운 과제는 여러 기술 세대에 걸쳐 상호 의존적인 수백 개 시스템을 조율하는 일이다.

실리콘 발전은 연산당 에너지 사용량을 줄일 수 있다. 그러나 비용 하락이 더 많은 AI 활동을 부추기면 사용량 증가는 총 전력 수요를 여전히 끌어올릴 수 있다. 인프라 계획은 효율 개선과 증가하는 요청량을 모두 고려해야 한다.

효율 향상이 용량 위험을 없애지는 않는다

더 나은 추론 효율은 요청당 부담을 줄일 수 있지만, 총수요 감소나 운영 단순화를 보장하지는 않는다.

Google은 소프트웨어, 하드웨어, 시설 개선이 개별 AI 상호작용의 환경 비용을 크게 줄일 수 있다는 근거를 공개했다. 2025년 프롬프트당 연구에서는 12개월 동안 Gemini Apps 텍스트 프롬프트의 중앙값 기준 에너지 사용량이 33배 감소했다고 보고했다.

회사는 이 개선의 대부분을 모델 효율성과 더 나은 장비 활용도에 돌렸다. Google은 또한 전체 플릿의 전력사용효율(PUE)이 1.09라고 보고했다. 전력사용효율은 시설 전체 에너지와 컴퓨팅 장비에 공급되는 에너지를 비교하는 지표다.

이 수치는 효율이 고정된 값이 아니라는 유용한 근거를 제공한다. 다만 여전히 회사가 자체 보고한 측정치이며, 모든 모델, 워크로드, 데이터센터를 대표하지는 않는다. 프롬프트당 결과만으로는 사용량 규모 없이는 총수요를 알 수 없다.

더 효율적인 서비스는 추가 고객을 유치하고 더 복잡한 작업을 지원할 수 있다. 에이전틱 워크플로는 기존 챗봇이 한 번 호출하던 상황에서 여러 번의 모델 호출을 수행할 수 있다. 더 긴 컨텍스트, 멀티모달 입력, 반복적인 도구 사용도 연산량을 늘릴 수 있다.

이로 인해 반등 효과가 발생한다. 각 연산의 비용은 낮아지지만 연산 횟수는 늘어난다. 각 응답의 효율이 높아지는 동안에도 총수요는 계속 증가할 수 있다.

이 효과는 인프라 수요 예측도 복잡하게 만든다. 개발자는 도입률, 모델 효율, 트래픽 패턴, 작업당 모델 호출 횟수를 추정해야 한다. 이러한 가정의 작은 변화도 매우 다른 용량 요구사항으로 이어질 수 있다.

정부 전력 전망의 넓은 범위는 이러한 불확실성을 반영한다. 공격적인 수요를 전제로 계획한 시설은 효율이 예상보다 빠르게 개선되면 활용도가 떨어질 수 있다. 보수적인 계획은 에이전트 도입이 가속될 때 고객에게 충분한 용량을 제공하지 못할 수 있다.

운영 복잡성도 또 다른 불확실성을 제시한다. Mouro는 디지털 트윈이 운영업체가 실제 시설을 변경하기 전에 전기, 열, 네트워크 동작을 모델링하는 데 도움이 될 수 있다고 말한다. 디지털 트윈은 물리적 시스템과 그 운영 조건을 소프트웨어로 표현한 것이다.

디지털 트윈은 냉각 조정이나 갑작스러운 부하 증가가 연결된 장비에 어떤 영향을 미칠지 시험할 수 있다. 예측 모니터링은 사고로 이어지기 전에 열 불균형과 페일오버 위험을 식별할 수 있다. 이러한 역량은 의사결정을 개선할 수 있지만 물리적 한계를 없애지는 못한다.

모델은 정확한 텔레메트리와 검증된 가정에 의존한다. 비정상적인 장비 동작을 놓치는 시뮬레이션은 잘못된 확신을 만들 수 있다. 운영업체에는 여전히 시운전, 유지보수, 사고 분석, 검증된 복구 절차, 경험 있는 인력이 필요하다.

인력 문제에도 비슷한 주의가 필요하다. 고밀도 AI 시설에는 전기, 열, 토목, 네트워크, 소프트웨어, 안전, 운영 전문가가 필요하다. 신속한 건설은 시스템 복잡성이 더욱 신중한 검증을 요구하는 바로 그 시점에 테스트 일정을 압축할 수 있다.

Mouro는 배포가 가속되더라도 운영 규율은 유지되어야 한다고 주장한다. 이 입장은 자동화가 늘어나면 자동으로 더 빠른 제공이 가능해진다는 익숙한 업계 가정에 이의를 제기한다. 자동화는 팀이 그 한계를 이해하고 인간의 책임성을 보존할 때에만 도움이 된다.

따라서 이 Google 뉴스를 회의적으로 읽는 관점이 중요하다. 추론 성장은 신뢰할 만하지만, 정확한 워크로드 구성과 용량 수요는 여전히 불확실하다. 투자자들은 제안된 모든 기가와트를 보장된 수요로 간주해서는 안 된다.

호주에는 기회가 있지만, 전력망 접근성이 조건을 정한다

호주의 전략적 강점은 개발업체가 시의적절한 전력, 연결성, 인허가, 예측 가능한 운영 조건을 확보할 때에만 투자 가능한 가치가 된다.

Mouro는 호주의 여러 강점을 지적한다. 이 나라는 안정적인 거버넌스, 기술 인력, 성장하는 아시아태평양 시장과의 근접성, 적합한 토지, 상당한 재생에너지 개발 역량을 제공한다. 이러한 특성은 지역 추론과 대규모 인프라 프로젝트 모두를 뒷받침할 수 있다.

추론은 현지 용량 확보의 필요성을 강화할 수 있다. 고객 대면 애플리케이션은 낮은 지연 시간의 혜택을 받으며, 규제 대상 조직은 데이터 위치에 대한 더 강한 통제를 필요로 하는 경우가 많다. 호주 시설은 모든 상호작용을 먼 지역으로 라우팅하지 않고도 국내 사용자를 지원할 수 있다.

정부, 보건, 금융, 핵심 인프라 워크로드에서는 주권도 중요하다. 현지 처리는 일부 데이터 상주 요건을 단순화하고 국제 네트워크 장애에 대한 노출을 줄일 수 있다. 그러나 이것이 보안, 규정 준수, 운영 독립성을 자동으로 보장하는 것은 아니다.

제약은 전력망 연결에서 시작된다. Mouro는 프로젝트가 수년간의 연결 대기열에 직면한다면 발전 용량은 상업적 가치가 거의 없다고 말한다. 개발업체에는 충분한 전력과 이를 공급받을 신뢰할 만한 일정이 모두 필요하다.

이 구분은 부지 선택을 바꾼다. 지도상 가장 좋은 부지는 더 빠른 계통 연계, 기존 변전소, 적합한 광섬유, 더 명확한 계획 규정을 갖춘 덜 눈에 띄는 위치에 밀릴 수 있다. 전력 공급까지 걸리는 시간은 경쟁 지표가 된다.

계량기 후단 발전은 하나의 가능한 대응책이다. 이 방식은 일부 전력 발전 설비를 공공사업 계량기의 고객 측에 둔다. 지연된 연결에 대한 의존도를 낮출 수 있지만, 연료, 인허가, 배출, 신뢰성, 자금 조달에 관한 문제는 남는다.

유연한 부하 아키텍처도 또 다른 선택지다. 일부 워크로드는 전력망 조건이 바뀔 때 시간대나 위치를 옮길 수 있다. 학습 작업은 일반적으로 고객이 필요할 때 응답해야 하는 사용자 대면 추론보다 일정 조정의 유연성이 크다.

이 차이는 수요 반응이 해결할 수 있는 범위를 제한한다. 추론 서비스는 사용자에게 영향을 주지 않고 전력망 제약 기간에 일상적으로 사라질 수 없다. 운영업체에는 워크로드 분류, 백업 용량, 유연한 컴퓨팅과 핵심 서비스를 구분하는 계약이 필요하다.

호주의 계획 과제는 개별 프로젝트를 넘어선다. 데이터센터 성장의 집중은 송전 투자, 지역 전력 시장, 토지 이용, 물 정책, 지역사회 수용성에 영향을 줄 수 있다. 명확한 규칙은 개발업체, 공공사업자, 주민이 각 비용을 누가 부담하는지 이해하는 데 도움이 된다.

인프라 자본은 수년간 투입된 상태로 유지되므로 안정적인 정책이 중요하다. 단기 인센티브는 예측 불가능한 인허가나 불확실한 연결 조건을 보상할 수 없다. 투자자들은 시설이 여러 하드웨어 및 정치 주기를 거쳐 운영될 수 있다는 확신이 필요하다.

기회는 실재하지만 호주만의 것은 아니다. 다른 아시아태평양 시장도 클라우드 리전, 주권 AI 용량, 인프라 투자를 원한다. 이들은 에너지 가용성, 개발 속도, 연결성, 인센티브, 규제 확실성을 통해 경쟁한다.

따라서 호주의 이점은 실행에 달려 있다. 발표된 발전 설비, 가용 토지, 야심 찬 캠퍼스 계획은 운영 중인 용량과 같지 않다. 연결된 메가와트, 완료된 시운전, 지속적인 서비스 신뢰성이 더 강력한 근거를 제공한다.

기업 구매자에게 이 구분은 공급업체 평가에 영향을 준다. 공급업체의 가속기 재고는 제공 일정이 해결되지 않은 전력 또는 건설 작업에 달려 있다면 중요성이 낮아진다. 구매자는 용량이 어디에서 운영되는지, 어떻게 연결되는지, 어떤 복원력 기준이 적용되는지 물어야 한다.

Google 뉴스는 호주를 글로벌 경쟁 안에 위치시키지만, 성공의 정의도 좁힌다. 호주는 가장 많은 프로젝트를 승인한다고 이기는 것이 아니다. 에너지와 엔지니어링 자원을 신뢰할 수 있고 실제 운영 준비가 된 인프라로 전환할 때 승리한다.

추론 전환이 현실인지 보여줄 세 가지 신호

다음 단계는 인프라 발표만이 아니라 지출, 연결된 용량, 측정된 서비스 성능을 통해 평가해야 한다.

첫 번째 신호는 추론에 배정되는 AI 인프라 지출의 비중이다. Gartner는 2026년 중 AI 최적화 인프라 서비스에서 추론이 학습을 넘어설 것으로 예상한다. 업데이트된 전망과 클라우드 기업 공시는 이 역전이 계속되는지 보여줄 것이다.

추론 비중의 상승은 프로덕션 워크로드가 이제 투자 우선순위를 결정한다는 Mouro의 주장을 강화할 것이다. 반전이 발생한다면 최첨단 모델 학습이 현재 전망이 시사하는 것보다 더 지배적이라는 의미가 될 수 있다.

이 구분은 신중하게 측정해야 한다. 클라우드 공급업체는 혼합 클러스터를 다르게 분류할 수 있으며, 같은 하드웨어가 두 워크로드를 모두 지원할 수도 있다. 유용한 공시는 가능하다면 학습, 미세 조정, 배치 추론, 인터랙티브 추론을 구분해야 한다.

두 번째 신호는 운영 가능한 전력망 연결을 받는 신규 용량의 규모다. 프로젝트 발표는 종종 미래의 메가와트 또는 기가와트를 인용한다. 이러한 수치는 야심을 보여주지만, 고객이 실제로 언제 해당 용량을 사용할 수 있는지는 보여주지 않는다.

투자자와 구매자는 공공사업자 연결 계약, 완료된 변전소, 시운전 일정, 전력이 공급된 건물을 살펴봐야 한다. 지연은 물리적 인프라가 AI 배포 속도를 결정한다는 주장을 강화할 것이다. 더 빠른 연결은 단기 병목 현상이라는 주장을 약화할 것이다.

호주 프로젝트는 특히 유용한 시험 사례를 제공한다. 이 시장은 상당한 개발 관심과 함께 전력망, 인허가, 송전 문제를 결합하고 있다. 제안된 용량이 연결된 용량으로 전환되는 진척은 전략적 이점이 실행으로 이어지고 있는지 보여줄 것이다.

세 번째 신호는 에이전틱 워크로드에서의 프로덕션 신뢰성이다. 공급업체들은 점점 토큰, 가속기 성능, 모델 벤치마크를 논의한다. 하지만 이러한 지표는 다단계 에이전트의 전체 경험을 포착하지 못한다.

더 유용한 지표에는 엔드투엔드 지연 시간, 테일 레이턴시, 가용성, 실패한 도구 호출, 복구 시간, 트래픽 급증 시 성능이 포함된다. 고객은 공급업체가 완전한 워크플로에 대한 서비스 수준 목표를 공개하는지도 살펴봐야 한다.

서비스 수준 목표는 측정 가능한 신뢰성 또는 성능 목표를 정의한다. 에이전트의 경우 이 목표는 하나의 모델 응답이 아니라 전체 작업을 포괄해야 한다. 그렇지 않으면 개별 구성 요소가 목표를 달성하더라도 사용자의 워크플로는 여전히 실패할 수 있다.

대규모에서 안정적인 에이전틱 서비스가 제공된다는 증거는 분산형 프로덕션급 추론 용량에 대한 투자를 뒷받침할 것이다. 모델 역량이 계속 개선되더라도 지속적인 지연과 신뢰할 수 없는 워크플로는 즉각적인 수요에 대한 기대를 약화할 것이다.

이러한 신호는 구조적 변화와 홍보성 언어를 구분하는 데도 도움이 된다. 지출은 고객이 무엇을 구매하는지 보여준다. 전력망 연결은 개발업체가 무엇을 제공할 수 있는지 보여준다. 신뢰성은 인프라가 사용 가능한 서비스를 만들어내는지 보여준다.

더 큰 교훈은 데이터센터 운영업체를 넘어선다. 개발자는 여러 종속성 전반의 지연 시간과 장애를 고려해 애플리케이션을 설계해야 한다. 기업 구매자는 모델 품질과 함께 위치, 복원력, 워크로드 경제성을 평가해야 한다.

지식 노동자들이 이에 주목해야 하는 이유는 인프라 결정이 AI의 가용성, 속도, 프라이버시, 환경 영향에 직접적인 영향을 미치기 때문이다. 시연에서는 잘 작동하는 기능도 수천 명의 사용자가 하루 종일 의존하기 시작하면 전혀 다르게 작동할 수 있다.

최근 google news는 업계의 하드웨어 집착을 바로잡는 데 유용한 관점을 제시한다. 현재 세대 모델을 만든 것은 학습 역량이지만, 이들 모델이 신뢰할 수 있는 서비스가 될 수 있는지를 결정하는 것은 추론이다.

앞으로 몇 달간 투자 구성, 연결 전력, 엔드투엔드 신뢰성을 지켜볼 필요가 있다. 세 가지 모두 프로덕션 추론을 향해 움직인다면, Mouro의 경고는 예측이라기보다 운영 원칙에 더 가까워 보일 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page