top of page

Cloudflare Auto Router, AI 비용 절감하지만 품질이 한계 정한다

10월 2일
13분 분량

Cloudflare는 내부 코딩 워크플로에서 최첨단 모델만 사용하는 방식과 비교해 최대 30%를 절감했다고 밝힌 뒤 Cloudflare Auto Router를 퍼블릭 베타로 출시했다. 이 기능은 AI Gateway 안에서 작동하며 요청마다 모델을 선택한다. 사용자는 더 비싼 최첨단 모델이 필요한 작업인지 더 이상 직접 판단할 필요가 없다.

이 변화로 모델 선택은 사용자 선호의 문제가 아니라 인프라 의사결정이 된다. Cloudflare는 각 요청을 평가해 어떤 모델이 처리할 수 있는지 추정하고, 예상 품질과 토큰 비용의 균형을 맞춘다. 단순한 작업은 더 작은 모델로 옮길 수 있고, 어렵거나 중요한 요청에는 더 강력한 옵션이 배정된다.

쟁점은 비용과 성능의 균형이지 Cloudflare와 특정 모델 제공업체 간의 경쟁이 아니다. 조직은 코딩, 리서치, 지원 업무 및 기타 지식 노동에서 눈에 띄지 않는 실패를 초래하지 않으면서 추론 비용을 낮추고자 한다. Cloudflare는 이제 자사 게이트웨이가 직원들이 수동으로 모델을 선택하는 것보다 이 균형을 더 일관되게 관리할 수 있다고 주장한다.

Cloudflare Auto Router, 게이트웨이로 모델 선택 이동

Cloudflare는 개별 사용자에게 맡겨졌던 중요한 AI 의사결정을 요청을 처리하는 공유 제어 계층으로 옮기고 있다.

Cloudflare는 2026년 9월 30일 AI Gateway 내 퍼블릭 베타 기능으로 Auto Router를 출시했다. 회사의 Auto Router 발표에 따르면 개발자는 요청 모델을 cloudflare/auto로 설정해 이를 활성화한다.

이 작은 구성 변경은 애플리케이션이 AI 모델에 도달하는 방식을 바꾼다. 애플리케이션은 하나의 모델을 지정하는 대신 Cloudflare에 요청별로 적합한 옵션을 선택하도록 맡긴다. 게이트웨이는 요청을 업스트림으로 보내기 전에 작업을 평가한다.

라우터는 먼저 요청을 처리할 수 없는 모델을 제거한다. 호환성은 요청 형식, 실행 모드, 사용 가능한 자격 증명, 과금 구성, 액세스 정책, 지출 한도에 따라 달라진다. Cloudflare는 복구될 때까지 상태가 좋지 않은 제공업체도 고려 대상에서 제외한다.

이러한 필터는 모델 선택이 지능과 토큰 비용 이상의 문제임을 보여준다. 이론적으로 적합한 모델도 요청 형식을 처리할 수 없다면 쓸모가 없다. 조직이 해당 제공업체를 승인하지 않았거나 제공업체가 충족할 수 없는 정책을 요구하는 경우도 마찬가지다.

이후 Cloudflare는 대화의 압축된 표현을 분석한다. 전체 세션을 라우팅 분류기에 전달하는 대신 최근 메시지에 중점을 둔다. 이 분류기는 Cloudflare의 엣지 네트워크 전반에 배치된 GPU에서 Workers AI를 통해 실행된다.

분류기는 14개 작업 범주에 걸쳐 확률을 할당한다. Cloudflare는 코딩, 계획 수립, 리서치, 데이터 분석을 예시로 든다. 또한 복잡성, 모호성, 중요도, 이전 맥락에 대한 의존도를 1점에서 5점까지 평가한다.

이 신호들은 각 후보 모델의 벤치마크 기반 가중치를 포함하는 별도의 점수 행렬에 입력된다. 따라서 Cloudflare는 성능 가중치를 추가하는 방식으로 새 모델을 추가할 수 있다. 회사는 이용 가능한 모델 풀이 바뀔 때마다 분류기를 재학습할 필요가 없다고 말한다.

이 아키텍처는 Cloudflare의 기존 규칙 기반 라우팅과 다르다. 동적 라우팅 도구를 사용하면 팀은 조건, 할당량, 예산, 폴백 경로, 점진적 롤아웃을 만들 수 있다. 그러나 이 경로들은 여전히 관리자가 작성한 규칙에 의존한다.

반면 Auto Router는 예측 기반 선택을 수행한다. 관리자가 경계를 정의하지만, 분류기가 개별 요청에 가장 적합한 적격 모델을 결정한다. 게이트웨이는 단순한 관측 및 정책 계층을 넘어 능동적인 의사결정자가 된다.

이 차이가 이번 베타의 중요성을 설명한다. 대시보드는 비용이 어디에 쓰였는지 보여줄 수 있고, 예산 규칙은 추가 지출을 막을 수 있다. 그러나 어느 도구도 더 작은 모델이 요청을 성공적으로 완료할 수 있었는지는 판단하지 못한다.

Auto Router는 비용이 많이 드는 작업이 시작되기 전에 이 결정을 내리려 한다. 먼저 조직 차원의 제어를 적용한 뒤, 남은 모델 가운데 선택한다. 이 시스템은 하나의 추론 경로 안에서 거버넌스와 모델 선택을 결합한다.

Cloudflare는 초기에는 다양한 지식 노동 환경을 겨냥하고 있다. 예시에는 이메일, 캘린더, 업무 메시지, 파일, 여행 워크플로, 금융 작업, 코딩, 디버깅이 포함된다. 이런 환경은 라우팅이 실질적인 역할을 할 만큼 충분한 변화를 만들어낸다.

모든 요청을 하나의 최첨단 모델로 보내는 기업은 일관성을 얻지만, 사용하지 않는 성능에도 비용을 지불한다. 모든 작업을 더 작은 모델로 처리하게 하는 기업은 다른 위험을 감수한다. 어려운 작업은 실패하거나, 재시도가 필요하거나, 예상보다 많은 출력 토큰을 소비할 수 있다.

Cloudflare Auto Router는 이 두 극단 사이에 분류기를 삽입한다. 그 가치는 기본 모델이 작업을 시작하기 전에 분류기가 차이를 인식할 수 있는지에 달려 있다.

수동 모델 선택이 이제 비용 문제가 됐다

가장 직접적인 압박은 모든 직원과 에이전트에게 기본적으로 가장 강력한 모델을 제공하는 최첨단 모델 전용 전략에 가해진다.

대부분의 AI 인터페이스는 사용자에게 모델 선택지를 보여준다. 코딩 어시스턴트, 에이전트 하니스, 채팅 도구는 여러 옵션이 담긴 메뉴를 제공하는 경우가 많다. 사용자는 모호한 모델 이름을 품질, 속도, 비용에 관한 결정으로 해석해야 한다.

이 방식은 유연해 보이지만, 다른 업무를 수행하는 사람들에게 인프라 최적화를 떠넘긴다. 보안 취약점을 조사하는 엔지니어에게 필요한 것은 메시지 스레드를 요약하는 직원의 필요와 다르다. 그럼에도 둘 다 가장 익숙한 강력한 모델을 선택할 수 있다.

이러한 행동은 이해할 만하다. 사용자는 오류, 수정, 시간 손실을 통해 낮은 품질의 답변 비용을 즉시 경험한다. 모델을 선택하는 동안 조직 전체의 추론 비용 청구서를 보는 경우는 드물다.

관리자는 제한을 두는 방식으로 대응할 수 있지만, 고정된 제한은 가변적인 업무에 잘 맞지 않는다. 최첨단 모델을 차단하면 일상적인 요청의 지출은 줄일 수 있다. 그러나 어려운 코딩, 계획 수립, 보안 작업에 실제로 필요할 때 최선의 옵션까지 제거할 수 있다.

모델 라우팅은 세 번째 경로를 제시한다. 분류기는 어떤 요청에 더 강한 모델이 필요한지 추정하는 한편, 더 저렴한 모델이 일상적인 업무를 처리하도록 한다. 선호도 기반 라우팅에 관한 학술 연구는 학습된 라우터가 측정된 품질을 자동으로 희생하지 않으면서 비용을 줄일 수 있음을 이미 보여줬다.

Cloudflare의 강점은 위치에 있다. AI Gateway는 이미 애플리케이션과 여러 모델 제공업체 사이에 자리하고 있다. 요청 메타데이터를 관찰하고, 액세스 제어를 적용하며, 제공업체 상태를 추적하고, 조직이 사용할 수 있는 자격 증명을 관리할 수 있다.

이 위치는 독립형 라우팅 벤더와 제공업체별 도구에도 압박을 만든다. 조직은 정책, 안정성, 관측성, 모델 선택을 하나의 제어 계층에서 처리하고 싶어 할 수 있다. 다만 Cloudflare는 통합이 더 나은 라우팅 결정을 만든다는 점을 여전히 입증해야 한다.

더 큰 변화는 AI 조달에 영향을 미친다. 구매자들은 종종 개별 벤치마크 점수와 공개된 토큰 요율을 통해 모델을 비교해 왔다. 자동 라우팅은 하나의 모델이 아니라 모델 포트폴리오를 배포 가능한 단위로 만든다.

어려운 코딩 작업에서 뛰어난 결과를 내는 모델은 모든 이메일 요약을 처리하지 않으면서도 풀에 남을 수 있다. 더 작은 모델은 조직 전체의 보편적 기본값이 되지 않고도 일상적인 요청을 처리할 수 있다. 조달 팀은 영구적인 단 하나의 승자를 찾는 대신 워크로드 전반의 커버리지를 평가할 수 있다.

이 접근법은 모델 제공업체와의 협상도 바꾼다. 사용량은 라우터가 제공업체 모델을 얼마나 자주 선택하느냐에 따라 달라진다. 특정 작업 범주에서 우수한 성능을 보이는 모델은 모든 경쟁 모델을 대체하지 않고도 트래픽을 확보할 수 있다.

따라서 라우팅 계층은 수요에 대한 영향력을 얻는다. 어느 제공업체가 요청을 받는지, 어떤 역량이 더 높은 비용을 정당화하는지, 어떤 모델의 약점이 운영 환경에서 중요한지를 결정한다. 이 역할은 트래픽 관리와 닮았지만, 의사결정에는 예상 답변 품질에 대한 판단도 포함된다.

개발자들도 적응해야 한다. 고정 모델은 테스트와 디버깅을 위한 비교적 안정적인 대상을 제공한다. 자동 라우터는 요청, 세션 또는 모델 풀의 변화에 따라 서로 다른 동작을 만들 수 있다.

이러한 변동성에는 더 나은 평가 기록이 필요하다. 팀은 어떤 모델이 요청을 처리했는지, 왜 선택됐는지, 결과가 애플리케이션 요구사항을 충족했는지를 알아야 한다. Cloudflare는 2단계 설계를 통해 분류와 모델 선택을 검토 가능하게 유지한다고 말한다.

검토 가능성은 중요하지만 운영 작업을 없애지는 않는다. 팀은 사용자들을 대표하는 평가 세트가 여전히 필요하다. 또한 사고, 라우팅 결정, 모델별 발견 사항을 검색 가능한 엔지니어링 지식에 보존할 방법도 필요하다.

따라서 핵심 압박은 단순히 비싼 모델에만 가해지는 것이 아니다. 조직 규모에서 사람이 모델을 선택하는 것이 의미 있는 통제를 제공한다는 가정 자체가 압박을 받고 있다. Cloudflare는 정책으로 경계를 정한 자동화가 더 나은 평균 의사결정을 낼 것이라고 보고 있다.

Cloudflare Auto Router가 품질과 비용의 균형을 맞추는 방식

Cloudflare Auto Router는 단순히 토큰 요율이 가장 낮은 모델을 고르는 것이 아니라, 전체 작업 경로를 완료하는 비용을 추정한다.

점수 산정 과정은 예상 품질에서 시작한다. Cloudflare는 분류기의 작업 확률과 네 가지 난이도 차원을 벤치마크 기반 모델 가중치와 결합한다. 이 계산은 각 적격 모델이 현재 요청에 얼마나 잘 맞는지 추정한다.

라우터는 이후 입력 및 출력 토큰 비용을 고려한다. 여러 모델이 충분히 처리할 수 있는 단순한 요청일수록 비용의 가중치가 커진다. 난이도가 올라갈수록 비용 패널티는 줄어들며, 더 강력한 모델이 선택될 여지가 커진다.

Cloudflare는 이 결정을 예상 품질에서 적응형 비용 패널티를 뺀 값으로 요약한다. 공식은 단순하지만, 구현은 불확실한 두 가지 수량을 추정해야 한다. 모델이 낼 가능성이 높은 결과와 그 결과에 도달하는 데 필요한 자원을 모두 예측해야 한다.

이 두 번째 예측은 작업 경로 비용을 공개된 토큰 요율과 구분한다. 비용이 낮은 모델은 긴 답변을 생성하거나, 더 많은 도구를 호출하거나, 실패한 단계를 반복하거나, 추가 시도를 요구할 수 있다. 따라서 완료된 작업은 단가가 더 높은 모델보다 더 많은 자원을 소비할 수 있다.

에이전트 워크플로는 문제를 더 어렵게 만든다. 사용자 요청은 계획 수립, 검색, 도구 호출, 코드 변경, 검증, 최종 응답을 유발할 수 있다. 첫 프롬프트만으로 모델을 선택하면 나중에 드러나는 요구를 놓칠 수 있다.

Cloudflare의 현재 라우터는 최근 메시지와 의존도 점수를 통해 대화 맥락을 고려한다. 또한 제공업체가 재사용을 위해 처리된 맥락을 보존하는 프롬프트 캐싱도 다룬다. 캐시된 세션에서는 모델을 바꾸는 것보다 같은 모델을 계속 사용하는 편이 더 저렴할 수 있다.

전환에는 비용이 든다. 새 모델은 전체 맥락을 자신의 캐시에 다시 기록해야 할 수 있다. 또한 이전 모델이 생성한 추론 토큰을 읽지 못해 이전 작업을 반복해야 할 수도 있다.

Auto Router는 활성 맥락이 커질수록 증가하는 전환 패널티를 적용한다. 하나의 사용자 턴 안에서는 일반적으로 워밍업된 캐시를 가진 모델을 유지하는 편을 선호한다. 턴과 턴 사이에는 다른 모델이 맥락을 다시 기록할 만큼 충분한 예상 가치를 제공해야 한다.

이 메커니즘은 특히 긴 코딩 세션에서 중요합니다. 피상적인 비교는 각각의 간단한 단계를 가장 저렴한 모델로 보낼 수 있습니다. 하지만 반복적인 전환은 캐시 쓰기, 중복된 추론, 일관성 없는 가정으로 인해 그 절감 효과를 지워버릴 수 있습니다.

Cloudflare는 라우터가 캐시 읽기 비용을 기준으로 현재 모델의 비용을 산정한다고 말합니다. 다른 후보 모델은 컨텍스트를 다시 구축하는 비용을 부담합니다. 세션이 깊어질수록 현재 모델을 유지해야 할 근거는 더 강해집니다.

이는 프롬프트를 서로 분리된 메시지로 취급하는 방식보다 더 현실적인 모델 라우팅 접근법입니다. 한 에이전트의 상태가 경제적 가치를 지닌다는 점을 인식합니다. 한 제공업체가 이미 처리한 컨텍스트는 일종의 일시적 종속 효과가 됩니다.

이 설계에는 여전히 한계가 있습니다. Cloudflare는 대부분의 모델이 다른 모델이 생성한 추론 토큰을 소비할 수 없다고 말합니다. 전환 시 모델 패밀리를 고려할 계획이지만, 이 선호도는 아직 출시된 시스템의 일부로 설명되지 않았습니다.

라우터는 대안 없이 하나의 모델을 선택하는 대신 후보의 순위를 매기기도 합니다. AI Gateway는 가장 높은 순위의 옵션을 먼저 시도합니다. 제공업체가 요청을 처리할 수 없으면 다른 적격 모델로 진행할 수 있습니다.

이러한 폴백 동작은 품질과 신뢰성을 결합합니다. 정상 상황에서는 특정 모델이 우선 선택지일 수 있지만, 제공업체 장애 중에는 사용할 수 없을 수 있습니다. 비정상 후보를 제거하면 라우터가 실패한 엔드포인트로 트래픽을 반복 전송하는 일을 막을 수 있습니다.

Cloudflare의 접근 방식은 더 광범위한 기술적 흐름을 따릅니다. 모델 라우터는 무조건 가장 저렴한 옵션이 아니라, 필요한 역량을 갖춘 가장 저렴한 옵션을 찾습니다. 차이는 각 요청에 필요한 역량을 정의하고 오류를 측정하는 방식에 있습니다.

분류기 자체도 작업을 추가하지만, Cloudflare는 이 베타 버전에 대한 상세한 지연 시간 측정치를 공개하지 않았습니다. 엣지에서 실행하면 네트워크 거리를 줄일 수 있지만, 배포 위치만으로 전체 라우팅 지연 시간이 확정되지는 않습니다.

팀은 라우팅 오버헤드를 전체 작업 지속 시간과 비교해 측정해야 합니다. 긴 리서치 에이전트 실행 중에는 작은 분류 지연이 무시할 만할 수 있습니다. 그러나 짧은 응답으로 이루어진 대규모 인터랙티브 기능에서는 같은 지연도 중요할 수 있습니다.

또한 원시 토큰 요금이 아니라 완료된 작업의 비용을 비교해야 합니다. 실패한 작업, 재시도, 도구 루프, 캐시 재구축도 계산에 포함됩니다. Cloudflare의 자체 설명은 궤적을 경제적 단위로 취급한다는 점에서 타당합니다.

이 아이디어는 Cloudflare Auto Router 작동 방식에서 가장 중요한 부분입니다. 라우터는 가장 저렴한 모델을 찾는 것이 아닙니다. 조직적·기술적 제약 안에서 가장 높은 기대 효용을 찾고 있습니다.

Cloudflare의 벤치마크는 절감 효과를 보여주지만, 확실성을 보장하지는 않는다

Cloudflare의 결과는 라우팅 가설을 뒷받침하지만, 모든 워크로드나 조직에서 동일한 품질을 입증하지는 않습니다.

Cloudflare는 97개 작업으로 구성된 내부 일반 지식 업무 벤치마크에서 라우터를 평가했습니다. 각 모델은 작업당 세 번의 시험을 받았고, 평가된 각 옵션마다 총 291회의 시험이 이루어졌습니다.

이 벤치마크는 이메일, 캘린더, 업무용 메시지, 파일, 여행, 금융 전반의 시뮬레이션된 워크스페이스 도구를 사용했습니다. 작업은 모델이 검증 가능한 답변을 반환하거나 작업을 완료하도록 요구했습니다. 이 설계는 서로 분리된 상식 질문 모음보다 에이전트 배포 환경과 더 관련성이 높습니다.

Cloudflare Auto Router는 252회의 시험을 성공적으로 완료해 86.6%의 성공률을 기록했습니다. GPT-6 Sol은 245회, 즉 84.2%를 완료했습니다. Claude Opus 5.5는 281회, 즉 96.6%를 완료했습니다.

이 결과는 중요한 경계를 보여줍니다. 라우터는 벤치마크 전반에서 Sol의 측정 성공률을 소폭 웃돌면서도 비용은 80% 수준이었습니다. 하지만 해당 모델 비용의 35%로 작동했음에도 Opus와 같은 수준에는 도달하지 못했습니다.

Cloudflare는 10,000개의 작업 수준 부트스트랩 샘플에서 생성한 95% 신뢰구간도 보고했습니다. 라우터와 Sol 주변의 구간은 상당히 겹칩니다. 독자는 이 차이를 자동 라우팅이 더 높은 품질을 만든다는 증거로 받아들여서는 안 됩니다.

Opus 결과는 더 명확한 트레이드오프를 보여줍니다. 동일한 291회 시도에서 Auto Router보다 29회를 더 성공했습니다. 조직은 추가로 성공한 결과가 자신들의 워크로드에서 추가 리소스를 정당화하는지 판단해야 합니다.

정답은 작업에 따라 다릅니다. 놓친 캘린더 세부 정보와 결함 있는 보안 분석은 동일한 결과를 낳지 않습니다. Cloudflare의 분류기에는 중요도 점수가 포함되지만, 회사는 범주별 오류 분석을 공개하지 않았습니다.

이 누락된 분석은 집계 평균보다 더 중요합니다. 구매자는 라우터가 어느 지점에서 성능이 떨어지는지, 어떤 모델을 선택했는지, 오류가 어렵거나 중대한 작업에 집중됐는지를 알아야 합니다.

이 평가 역시 독립 기관이 아니라 Cloudflare가 수행했습니다. Cloudflare는 벤치마크를 설계하고, 라우터를 구성하고, 모델 풀을 선택하고, 결과를 보고했습니다. 그 결과는 유용한 증거이지만, 여전히 공급업체 평가입니다.

벤치마크는 혼합형 엔터프라이즈 지식 업무를 대표합니다. 절감액은 고객의 트래픽 분포에 따라 달라집니다. 일상적 요약 작업이 대부분인 조직은 어려운 리서치나 보안 분석에 초점을 둔 조직보다 소형 모델을 활용할 기회가 더 많을 것입니다.

Cloudflare는 이러한 의존성을 명시합니다. 비프런티어 작업의 비중이 클수록 절감 효과가 커진다고 말합니다. 따라서 보고된 결과는 보편적 할인으로 보지 말고, 특정 워크로드에 한정된 결과로 해석해야 합니다.

모델 풀은 또 다른 변수를 도입합니다. 라우팅 품질은 의미 있게 다른 모델을 사용할 수 있는지에 달려 있습니다. 역량이 겹치고 경제성이 비슷한 모델 풀은 라우터에 유용한 선택지를 적게 제공합니다.

모델의 변화도 결과를 바꿀 수 있습니다. Cloudflare는 분류기를 재학습하지 않고도 벤치마크 기반 가중치를 업데이트할 수 있어 새 모델을 더 쉽게 추가할 수 있습니다. 이는 또한 해당 가중치나 후보 모델이 바뀔 때 고객이 동작을 모니터링해야 함을 의미합니다.

라우터는 두 방향으로 실패할 수 있습니다. 과도한 라우팅은 일상적인 작업을 비싼 모델로 보내 절감 효과를 줄입니다. 과소 라우팅은 어려운 작업을 부적절한 모델로 보내 부정확한 결과의 위험을 높입니다.

두 번째 실패는 대체로 감지하기가 더 어렵습니다. 애플리케이션은 비용을 즉시 측정할 수 있지만, 출력 품질에는 사람의 검토나 작업별 평가기가 필요할 수 있습니다. 유창한 응답은 누락된 사실, 약한 추론, 불완전한 작업을 숨길 수 있습니다.

라우터 조작에 관한 연구는 적대적 토큰 시퀀스가 학습된 라우터가 더 강력한 모델을 선택하도록 영향을 줄 수 있음을 보여줍니다. 공격자는 이 동작을 악용해 애플리케이션 비용을 증가시킬 수 있습니다.

이 연구가 Cloudflare Auto Router의 취약점을 입증하는 것은 아닙니다. 논문은 다른 오픈소스 및 상용 라우터를 평가했으며, Cloudflare는 직접 비교를 위한 충분한 구현 세부 정보를 공개하지 않았습니다.

다만 라우팅 분류기가 왜 애플리케이션의 위협 모델에 포함되어야 하는지는 보여줍니다. 분류기는 잠재적으로 악의적인 입력을 처리하며 더 비싼 리소스에 대한 접근을 제어합니다. 자동 선택이 잘 작동하더라도 속도 제한과 예산 정책은 여전히 필요합니다.

개인정보 보호 정책은 또 다른 미해결 문제를 제기합니다. Cloudflare는 향후 필터링이 무데이터 보존 요구사항을 고려할 것이라고 말합니다. 로드맵은 공개 베타가 아직 이러한 요구사항을 완전한 모델 선택 제약 조건으로 사용하지 않는다는 점을 시사합니다.

이 공백은 규제를 받거나 민감한 워크로드에서 중요할 수 있습니다. 보존 조건이 조직 정책과 충돌한다면 기술적으로 적합한 모델이라도 요청을 받아서는 안 됩니다. 구매자는 광범위한 모델 풀을 활성화하기 전에 제공업체의 처리 규칙을 확인해야 합니다.

Cloudflare의 벤치마크는 헤드라인 약속보다 더 제한적인 결론을 뒷받침합니다. 자동 라우팅은 Cloudflare의 테스트에서 측정된 비용을 낮추면서 한 프런티어 모델에 가까운 성능을 유지했습니다. 하지만 근본적인 품질 트레이드오프를 없애지는 못했습니다.

프로덕션 구매자에게 이 벤치마크는 평가의 끝이 아니라 시작점이어야 합니다. 유용한 질문은 모델 라우팅이 일반적으로 비용을 절감하는지가 아닙니다. 이 라우터가 허용할 수 없는 범주로 실패를 옮기지 않으면서 자신의 트래픽에서 비용을 절감하는지입니다.

AI Gateway는 의사결정 엔진으로 진화하고 있다

경쟁의 변화는 고정 규칙에 따라 트래픽을 라우팅하는 것에서, 각 요청에 어떤 모델이 적합한지 예측하는 것으로 옮겨가고 있습니다.

AI Gateway는 처음에 API 정규화, 로깅, 캐싱, 속도 제한, 제공업체 폴백에 집중했습니다. 이러한 기능은 분절된 모델 시장을 더 쉽게 운영하게 해주므로 여전히 가치가 있습니다.

예측적 모델 선택은 더 야심 찬 역할을 추가합니다. 이제 게이트웨이는 작업을 해석하고, 품질을 추정하며, 추론 전에 경제적 결정을 내립니다. 이는 게이트웨이를 애플리케이션의 추론 과정에 더 가깝게 위치시킵니다.

Cloudflare가 이 기본 아이디어를 처음 도입한 것은 아닙니다. RouteLLM 같은 학술 프로젝트는 더 강력한 모델과 약한 모델 사이의 학습 기반 선택을 탐구해 왔습니다. Martian과 Not Diamond를 포함한 상용 서비스도 지능형 모델 라우팅을 홍보해 왔습니다.

규칙 기반 게이트웨이는 다른 문제를 해결합니다. 고객 세그먼트를 특정 모델로 보내거나, 예산을 강제하거나, 장애 후 페일오버할 수 있습니다. 이러한 결정은 명시적이고 예측 가능하지만, 관리자는 조건을 미리 예상해야 합니다.

예측적 라우터는 관리자가 개별적으로 분류하지 않은 요청 전반에 걸쳐 일반화하려 합니다. 더 적은 유지보수와 더 세분화된 선택을 약속합니다. 그 대가로 팀은 실수를 관찰하고 수정해야 하는 또 하나의 학습 시스템을 받아들입니다.

Cloudflare는 두 접근 방식을 결합합니다. 팀은 게이트웨이 정책을 사용해 허용된 제공업체, 자격 증명, 지출 경계, 액세스 규칙을 정의할 수 있습니다. 이후 Auto Router가 그 결과로 형성된 풀 안에서 최적화합니다.

이 조합은 전략적으로 중요합니다. 게이트웨이 맥락이 없는 라우팅 공급업체는 프롬프트를 이해할 수는 있어도 조직의 정체성, 정책, 제공업체 상태 신호가 부족할 수 있습니다. 예측 선택이 없는 게이트웨이는 규칙을 강제할 수는 있어도 개별 작업을 최적화할 수 없습니다.

Cloudflare에는 엣지 컴퓨팅 측면의 강점도 있습니다. 이 분류기는 네트워크 전반의 Workers AI를 통해 실행됩니다. 이 아키텍처는 라우팅 단계를 사용자와 애플리케이션 가까이에 배치할 수 있지만, 프로덕션 지연 시간은 여전히 독립적인 측정이 필요합니다.

회사가 밝힌 로드맵은 경쟁의 향방을 보여줍니다. Cloudflare는 모델 풀을 확대하고, 제공업체 용량을 통합하며, 개별 요청에 맞는 추론 수준을 선택할 계획입니다. 또한 더 폭넓은 Responses API 및 WebSocket 지원도 계획하고 있습니다.

추론 수준 선택은 경제성을 크게 바꿀 수 있습니다. 일부 모델에서는 애플리케이션이 사용할 추론 노력의 양을 선택할 수 있습니다. 모델과 추론 설정을 함께 라우팅하면 불필요한 연산 비용을 피할 또 다른 방법이 생깁니다.

제공업체 용량 인식은 효용 계산에 신뢰성과 지연 시간을 더하게 됩니다. 명목상 가장 좋은 모델이 혼잡 상황에서도 최선의 선택인 것은 아닐 수 있습니다. 제공업체 상태를 파악하는 라우터는 실패가 발생하기 전에 작업을 재지정할 수 있습니다.

Cloudflare는 동일한 비용 페널티를 적용하지 않고 가장 높은 기대 품질을 선택하는 프로필인 cloudflare/auto-best도 계획하고 있습니다. 이 옵션은 자동화된 역량 매칭과 비용 최적화를 분리하게 됩니다.

조직마다 목표가 다르기 때문에 이 구분은 중요합니다. 고객 지원 문안 작성 도구는 효율성을 강조할 수 있습니다. 보안 조사나 법률 검토는 자동 모델 선택의 이점을 누리면서도 기대 품질을 강조할 수 있습니다.

여러 라우팅 프로필은 팀이 특정 모델을 선택하지 않고도 이러한 목표를 표현하게 해줍니다. 원하는 결과가 곧 구성 방식이 됩니다. 라우터는 어떤 제공업체와 모델이 이를 가장 잘 제공할 수 있는지 결정합니다.

이는 모델 충성도가 애플리케이션 아키텍처를 형성해야 한다는 생각을 위협합니다. 애플리케이션이 추상화된 라우팅 프로필을 호출하면 제공업체는 요청 수준에서 트래픽을 두고 경쟁합니다. 전환은 제품 마이그레이션이 아니라 인프라 기능이 됩니다.

그러나 추상화에는 대가가 따른다. 모델마다 어조, 도구 동작, 구조화된 출력의 신뢰성, 안전 관련 응답, 지시사항 처리 방식이 다르다. 한 모델을 기준으로 테스트한 애플리케이션은 게이트웨이가 다른 모델을 선택할 때 다르게 동작할 수 있다.

따라서 개발자는 모델 상호교환성을 이미 확립된 사실로 취급해서는 안 된다. 구조화된 출력, 도구 호출, 안전 규칙, 작업 완료 여부를 위한 계약 테스트가 필요하다. 공통 API 형식이 공통된 동작을 보장하지는 않는다.

성공하는 게이트웨이에는 영리한 분류기 이상이 필요하다. 의사결정을 설명 가능하게 만들고, 정책 경계를 유지하며, 변동성을 통제하고, 고객이 결과를 평가하도록 도와야 한다. Cloudflare는 이러한 목표를 설명했지만, 이제 공개 베타에서 실제 고객 트래픽을 통해 이를 입증해야 한다.

공개 베타 이후 주목할 점

세 가지 신호가 Cloudflare Auto Router가 신뢰할 수 있는 인프라가 될지, 아니면 유망한 비용 실험에 머물지를 보여줄 것이다.

첫 번째 신호는 독립적인 워크로드 데이터다. Cloudflare의 벤치마크는 신뢰할 만한 출발점을 제공하지만, 고객에게는 자체 애플리케이션에서 나온 결과가 필요하다. 유용한 보고서에는 완료된 작업당 비용, 성공률, 지연 시간, 모델 선택 분포가 포함되어야 한다.

단일 절감률보다 카테고리별 결과가 더 중요하다. 팀은 일상적인 요약, 코딩 변경, 리서치 작업, 도구 호출, 고위험 요청을 각각 분리해 검토해야 한다. 이들 그룹 전반에서 안정적인 성능이 나타난다면 Cloudflare의 주장은 더욱 설득력을 얻을 것이다.

눈에 띄지 않는 품질 저하의 증거는 이러한 주장을 약화할 수 있다. 여기에는 작업이 불완전하게 수행됐는데도 성공으로 표시되는 사례, 특정 카테고리에 집중되는 라우팅 오류, 또는 주로 더 낮은 완료율을 감수해 만들어진 비용 절감이 포함된다.

두 번째 신호는 정책 인식형 라우팅이다. Cloudflare는 후보 필터링에 데이터 보존 금지 요건과 제공업체 용량을 반영할 계획이다. 이러한 제어 기능이 제공된다면 Auto Router는 민감한 엔터프라이즈 배포에 더욱 적합해질 것이다.

구매자는 어떤 이유로 모델이 적격 판정을 받았는지, 어떤 정책이 적용됐는지, 최종 선택이 왜 우선했는지를 보여주는 명확한 기록을 찾아야 한다. 또한 구성 또는 모델 업데이트가 동작을 바꿀 경우 즉각적인 롤백도 기대해야 한다.

더 많은 요청 형식 지원도 중요하다. Responses API 및 WebSocket 호환성은 동일한 라우터를 통과할 수 있는 워크로드를 확대할 것이다. 형식 지원 범위가 제한되면 많은 에이전트 배포는 고정 모델이나 맞춤형 라우팅 코드에 계속 의존하게 된다.

세 번째 신호는 경쟁사들의 대응 방식이다. 다른 게이트웨이와 모델 제공업체도 분류기, 라우팅 프로필, 작업 인식형 모델 제품군을 추가할 수 있다. 경쟁사의 대응은 Cloudflare의 네트워크 위치가 지속적인 우위를 만드는지 시험하게 될 것이다.

한 제공업체는 자체 모델 제품군 내에서 더 나은 라우팅을 제공할 수 있다. 독립 게이트웨이는 여러 벤더에 걸쳐 더 폭넓은 중립성을 제공할 수 있다. 오픈소스 라우터는 프롬프트와 점수 산정 로직에 대한 로컬 제어가 필요한 조직을 끌어들일 수 있다.

Cloudflare의 단기적인 모델 확장은 이러한 긴장을 드러낼 것이다. 더 큰 모델 풀은 라우터에 더 많은 성능 및 비용 선택지를 제공한다. 동시에 평가 복잡성을 높이고 라우팅 동작의 예측 가능성을 낮춘다.

고객은 섀도 평가 또는 제한된 트래픽으로 시작해야 한다. 모든 프로덕션 요청을 즉시 변경하지 않고도 Auto Router를 고정 모델 기준선과 비교할 수 있다. 고위험 카테고리에는 더 엄격한 모델 및 검토 정책을 유지해야 한다.

팀은 개별 호출이 아니라 전체 작업을 기준으로 결과를 측정해야 한다. 재시도, 캐시 재구축, 도구 루프, 지연 시간, 사람의 수정도 포함해야 한다. 이러한 비용이 더 저렴한 경로가 실제로 효율적이었는지를 결정한다.

Cloudflare Auto Router는 사용자가 모든 요청마다 모델을 선택해서는 안 된다는 점을 설득력 있게 보여준다. 공개 베타는 모든 부적절한 선택에 대한 책임도 게이트웨이에 부여한다. 진정한 시험대는 바로 그 책임성이다.

조직에서 여러 모델을 사용한다면, 혼합되어 있으면서도 측정 가능한 워크플로 하나를 선정해 자동 라우팅을 현재 기준선과 비교해 보라. 품질과 완료된 작업당 비용을 함께 추적해야 한다. 그 결과로 얻는 근거는 Cloudflare AI Gateway 라우팅이 낭비를 줄이는지, 아니면 단순히 트레이드오프를 보이지 않는 곳으로 옮기는지를 보여줄 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page