top of page

Cloudflare Clef 의사결정 모델, 오픈 웨이트와 RL 플랫폼으로 Jev에 도전

15시간 전
12분 분량

Cloudflare는 10월 1일 두 가지 의사결정 모델을 출시했으며, 더 큰 모델은 이미 벤치마크에서 Jev를 앞섰다고 주장한다. Cloudflare Clef 의사결정 모델인 Clef와 Clef-flash는 제한 없는 텍스트를 생성하는 대신 타입이 지정된 확률을 반환한다. 두 모델은 Workers AI를 통해 제공되며 Apache 2.0 라이선스 웨이트로도 공개된다.

이 조합은 불과 몇 주 전 Jev와 System One 모델 카테고리를 선보인 TypeSafe AI에 대한 직접적인 도전이다. Cloudflare는 Jev의 API 형식을 채택하고 경쟁 벤치마크 결과를 공개했으며 이미지 지원을 추가했다. 또한 이 모델들을 새롭게 부상하는 강화학습 서비스와 연결했다.

이번 출시는 단순한 또 하나의 오픈 모델 공개가 아니다. Cloudflare는 제한된 의사결정이 에이전트를 위한 인프라 계층이 되고, 자사 네트워크가 추론, 데이터 수집, 학습, 재배포를 처리하기를 원한다. Jev가 제품 패턴을 확립했다면, Cloudflare는 그 패턴을 완전한 플랫폼으로 전환하려 하고 있다.

이 차이는 중요하다. 에이전트는 완성도 높은 답변을 생성하는 것보다 훨씬 더 많은 의사결정을 내린다. 요청을 분류하고, 도구를 선택하고, 위험을 평가하고, 레코드를 라우팅하며, 언제 도움을 요청할지 결정한다. 이러한 선택을 빠르게 처리하는 모델은 모든 자동화 워크플로의 운영 경로 안에 자리할 수 있다.

Cloudflare의 초기 수치는 추가 테스트를 뒷받침하지만 시장의 승패를 결정하지는 않는다. 평가는 모델을 출시한 회사가 수행했으며, 고객 맞춤형 파인튜닝 플랫폼은 여전히 일부가 수동 방식이고 일부는 계획 단계에 머물러 있다. 진정한 경쟁은 비공개로 계속 변하는 워크로드 전반에서 누가 보정된 의사결정을 제공할 수 있는지에 달려 있다.

Cloudflare Clef 의사결정 모델, 선택을 인프라로 전환하다

Clef는 소프트웨어가 한 번의 순전파로 사전 정의된 선택지의 확률을 받을 수 있도록 자유 형식 생성을 포기한다.

의사결정 모델은 상태, 질문 모음, 그리고 각 질문에 가능한 답변을 입력으로 받는다. 상태는 지원 요청, 청구서, 문서, 웹사이트 또는 제안된 에이전트 작업을 설명할 수 있다. 이후 모델은 허용된 선택지에 확률을 할당한다.

이 인터페이스는 일반적인 챗봇과 다르다. 범용 대규모 언어 모델은 토큰을 예측하고 응답을 구성한다. 반면 의사결정 모델은 애플리케이션 개발자가 선택한 제한된 답변 공간을 평가한다.

예를 들어 지원 시스템은 어떤 부서가 요청을 처리해야 하는지 물을 수 있다. 허용된 선택지에는 청구, 기술 지원, 계정 접근, 사기 검토 등이 포함될 수 있다. 또 다른 질문은 해당 요청에 긴급한 에스컬레이션이 필요한지 물을 수 있다.

출력은 코드에 직접 연결할 수 있다. 높은 신뢰도의 답변은 요청을 자동으로 라우팅하고, 불확실한 사례는 더 강력한 모델이나 인간 검토자에게 전달할 수 있다.

Cloudflare는 두 모델 모두를 Qwen 백본 위에 구축했다. Clef는 Qwen3.8-27B를, Clef-flash는 Qwen3.5-9B를 사용한다. 더 큰 모델은 정밀도를 겨냥하고, 더 작은 버전은 지연 시간에 민감한 워크플로를 겨냥한다.

두 모델은 모두 기본 모델의 비전 인코더를 유지한다. 사용 가능한 선택지를 평가하기 전에 텍스트, JSON, 이미지 또는 비디오를 처리할 수 있다. Cloudflare의 비교에 따르면 Jev는 현재 텍스트에 집중한다.

모델은 64,000토큰 컨텍스트 윈도도 제공한다. Cloudflare는 이 용량을 Jev의 32,000토큰 윈도와 비교하지만, 더 긴 컨텍스트만으로 더 나은 의사결정이 보장되는 것은 아니다.

이 아키텍처는 모델이 토큰을 하나씩 생성하는 일반적인 자기회귀 디코딩을 피한다. Cloudflare는 Clef가 Qwen 백본을 통해 prefill 전용 패스를 수행한 뒤, 모든 유효한 스키마 옵션을 병렬로 평가한다고 설명한다.

특화된 라우팅 헤드는 입력 상태를 각 질문 및 그 선택지와 연결한다. 모델이 최종 점수를 산출하기 전 질문들끼리도 정보를 교환할 수 있다. 이 설계는 여러 관련 의사결정이 동일한 인코딩 컨텍스트를 공유하도록 한다.

공개된 Clef 모델 웨이트에는 백본, 공동 스키마 헤드, 구성 및 지원 코드가 포함된다. 더 작은 Clef-flash 모델도 같은 기본 구조를 따르며 Apache 2.0 라이선스를 적용한다.

오픈 웨이트는 경쟁 구도를 바꾼다. 개발자는 파일을 검사하고, 자체 인프라에서 모델을 실행하며, 양자화 버전을 만들고, 모든 입력을 Cloudflare로 전송하지 않고도 민감한 워크로드를 테스트할 수 있다.

하지만 로컬 운영에는 여전히 상당한 하드웨어가 필요하다. Cloudflare의 모델 카드는 Clef-flash를 단일 H200 GPU에서 테스트했다고 밝힌다. 따라서 이번 출시는 자체 호스팅을 지원하지만, 90억 파라미터 멀티모달 모델을 모든 조직에 가볍게 만들어 주지는 않는다.

Workers AI는 관리형 경로를 제공한다. Cloudflare는 두 모델을 호스팅하고 Jev의 System One API와 호환되는 인터페이스를 제공한다. 따라서 기존 Jev 실험은 전체 요청 형식을 재설계하지 않고도 Clef를 테스트할 수 있다.

이 호환성은 전략적으로 중요하다. Cloudflare는 개발자에게 완전히 새로운 카테고리나 프로그래밍 모델을 채택하라고 요구하지 않는다. 최근 Jev가 정의한 카테고리에 진입하면서 제공업체 비교에 필요한 작업을 줄이고 있다.

Cloudflare는 구체적인 내부 사용 사례도 제시한다. 자사 Threat Intelligence 팀은 모델이 평가하기 전에 웹페이지를 가져와 렌더링하는 Browser Run을 통해 웹사이트 분류에 Clef를 테스트했다.

Cloudflare의 사례에서 Clef는 패션, ecommerce, 피싱 같은 카테고리에 대한 확률을 반환했다. 전체 워크플로는 2.2초가 걸렸으며, gpt-oss-120b의 4.7초와 비교된다.

범용 모델은 해당 테스트에서 두 가지 분류만 반환한 반면, Clef는 사전 정의된 카테고리를 평가했다. 이 비교는 의도된 장점을 보여주지만, 모든 워크로드에서 보편적인 속도 비율을 입증하지는 않는다.

두 시스템은 서로 다른 출력 메커니즘으로 작업을 해결했다. 입력 크기, 스키마 설계, 서빙 조건, 요청된 출력은 모두 결과에 영향을 줄 수 있다.

방어 가능한 결론은 더 제한적이다. 제한된 옵션을 평가하도록 설계된 모델은 불필요한 설명문 생성을 피할 수 있다. 따라서 추가 지연이 누적되는 반복적 의사결정에서 신뢰할 만한 구성 요소가 될 수 있다.

Clef와 Jev의 대결은 에이전트 제어 계층을 둘러싼 싸움이다

Cloudflare는 Jev의 인터페이스를 복제하는 동시에 개방성, 멀티모달 입력, 벤치마크 점수, 인프라 배포를 앞세워 Jev를 압박하고 있다.

TypeSafe AI는 9월 15일 Jev를 첫 번째 System One 모델로 소개했다. 이 회사는 대화형 응답 대신 타입이 지정된 출력과 보정된 신뢰도를 제공하는, 소프트웨어를 위한 빠른 의사결정 엔진이라고 모델을 설명했다.

Jev는 이제 Cloudflare가 사용하는 어휘를 정립하는 데 기여했다. Jev의 API는 구조화된 질문을 받아 선택지, 점수 또는 확률을 반환한다. 활용 사례에는 분류, 라우팅, 평가, 자동화된 분기가 포함된다.

TypeSafe의 Jev 발표는 범용 언어 모델이 인간 대상 응답에 최적화돼 있다고 주장한다. 반면 Jev는 자유 형식 생성이 지연과 파싱 문제를 만드는 빈번한 소프트웨어 의사결정을 겨냥한다.

Cloudflare는 그 영향을 명시적으로 인정한다. 자사 모델은 호환 가능한 API를 구현하며, 벤치마크 모음에는 Jev Decision Index와 TypeSafe의 워크플로 평가가 포함된다.

따라서 Jev는 범용 대규모 언어 모델의 집합이 아니라 주된 경쟁 상대다. Clef와 Jev는 결정론적 규칙과 개방형 추론 사이에서 같은 위치를 추구한다.

결정을 정밀하게 표현할 수 있을 때 규칙은 잘 작동한다. 계획, 설명 또는 종합이 필요한 작업에는 범용 모델이 도움이 된다. 의사결정 모델은 언어 이해는 유용하지만 출력 선택지는 이미 알려진 모호한 중간 영역을 겨냥한다.

Cloudflare는 BFCL case-exact 평가에서 Clef가 98.47, Clef-flash가 98.76, Jev가 95.75를 기록했다고 밝혔다. API-Bank 정확도에서는 Clef가 91.93, Clef-flash가 93.11, Jev가 88.19를 기록했다.

결과는 테스트마다 달랐다. Clef는 보고된 청구서 처리 워크플로에서 Jev의 61.8과 비교해 64.7로 앞섰다. Clef-flash는 고객 서비스에서 77을 기록해 Jev의 76을 근소하게 앞섰다.

Jev는 에이전트 트레이스 관측 가능성에서 여전히 앞섰다. Jev는 71.6을 기록했고, Clef-flash는 69.8, Clef는 68.5를 기록했다. 모든 워크로드에서 단일 모델이 선두를 차지한 것은 아니다.

지연 시간은 가장 뚜렷하게 주장된 차이를 만들었다. Cloudflare는 43개 평가 전반에서 Clef의 중앙값 지연 시간이 209.3밀리초, Clef-flash가 38.8밀리초라고 보고했다. Jev는 524.1밀리초로 측정했다.

따라서 Clef-flash는 빠른 제어 모델로서 특히 공격적인 성능을 보이는 듯하다. Cloudflare가 평가 환경을 통제하고 비교 결과를 공개했지만, 보고된 중앙값은 Jev의 10분의 1 미만이었다.

Laya는 보고된 5.8밀리초로 더 빨랐지만, 여러 나열된 테스트에서 품질 점수는 훨씬 낮았다. 이 결과는 카테고리의 핵심 트레이드오프를 강화한다. 모델의 확률이 신뢰할 수 있을 때만 지연 시간이 유용하다.

Cloudflare는 인프라 우위도 주장한다. Workers AI는 자사 네트워크에서 실행되는 애플리케이션 가까이에 추론을 배치해 모델 호출 전후의 이동 시간을 줄일 수 있다.

네트워크 근접성이 계산 시간, 콜드 스타트, 혼잡, 지역별 하드웨어 제약을 없애지는 않는다. 그럼에도 의사결정이 인터랙티브 제품의 핵심 경로에 있을 때는 중요할 수 있다.

청구서를 처리하는 에이전트를 생각해 보자. 이 에이전트는 문서를 분류하고, 담당 팀을 식별하며, 정책 예외를 표시하고, 인간 승인이 필요한지 결정할 수 있다. 워크플로가 눈에 보이는 작업을 수행하기 전에 여러 모델 호출이 발생할 수 있다.

보안에서도 같은 패턴이 나타난다. 에이전트는 도구 요청이 사용자의 목표와 일치하는지, 민감한 정보를 다루는지, 승인된 경계 밖으로 데이터를 전송하는지를 확인할 수 있다.

각 검사는 제한적이지만 총횟수는 많아질 수 있다. 빠른 모델은 모든 단계에 프런티어 추론 모델을 사용하는 것보다 지속적인 검토를 더 실용적으로 만든다.

그렇다고 Clef가 Jev를 대체하거나 오픈 웨이트의 승리를 증명하는 것은 아니다. TypeSafe는 모델, 학습 데이터, 서빙 스택을 개선할 수 있다. 또한 소프트웨어가 신뢰도 임계값에 따라 행동할 때 원시 정확도보다 더 중요한 보정을 통해 차별화할 수 있다.

Cloudflare의 API 호환성은 양방향 전환 비용을 낮춘다. 개발자는 동일한 개념적 워크플로를 여러 제공업체에서 실행하고, 비공개 데이터로 결과를 측정할 수 있다.

이러한 이식성은 Jev에 압박을 가한다. 동시에 고객이 애플리케이션을 재구축하지 않고도 의사결정 품질을 비교할 수 있기 때문에, Cloudflare가 배포력만으로 의존하는 것도 막는다.

OpenAI와 AWS는 보조적인 맥락을 더한다. OpenAI는 사전 정의된 선택지를 위한 제한적 프리뷰 Decisions API를 도입했고, AWS는 실험적 Strands Decider 모델을 출시했다.

이러한 진입은 별도의 의사결정 계층에 대한 수요를 뒷받침한다. 그러나 Clef와 Jev의 비교는 두 제품이 밀접하게 정렬된 인터페이스를 통해 타입이 지정된 확률을 제공하기 때문에 가장 명확한 경쟁 구도다.

승자는 출시 첫 주의 벤치마크 평균으로 결정되지 않을 것이다. 실제 구매자는 잘못된 승인, 불필요한 에스컬레이션, 응답 일관성, 하드웨어 요구 사항, 도메인별 학습 이후의 행동을 중요하게 볼 것이다.

RL 파인튜닝은 Cloudflare의 더 큰 베팅이다

모델이 주목을 끌지만, Cloudflare의 더 큰 목표는 워크플로 데이터에서 맞춤형 의사결정 모델까지 이르는 전체 경로를 통제하는 것이다.

범용 의사결정 모델은 피할 수 없는 한계에 직면한다. 공개 모델은 특정 기업의 승인 규칙, 악용 패턴, 고객 분류 또는 운영 예외를 알지 못한다.

소매업체와 보안 제공업체는 같은 단어를 서로 다르게 사용할 수 있다. 한 조직에서는 긴급해 보이는 요청이 다른 조직에서는 일상적인 업무일 수 있다. 잘 보정된 공개 확률조차도 이러한 분포 변화 이후에는 신뢰하기 어려워질 수 있다.

Cloudflare의 해답은 Clef를 위한 강화학습 서비스다. 초기 버전에서는 고객과 현장 배치형 엔지니어링 팀을 연결한다. Cloudflare는 이러한 협업을 활용해 셀프서비스 플랫폼을 개발할 계획이다.

이 구분은 주목할 만하다. 모델은 현재 이용할 수 있지만, 완전 자동화된 학습 제품은 아직 성숙한 셀프서비스 제품이 아니다. Cloudflare는 여러 부분이 진행 중인 작업이라고 설명한다.

제안된 시스템은 회사가 이미 운영 중인 서비스를 연결한다. AI Gateway는 요청과 응답을 수집해 고객이 실제 트래픽으로부터 워크로드 데이터세트를 구성할 수 있게 한다.

Workers AI는 기본 모델을 대상으로 롤아웃을 생성한다. 강화학습에서 롤아웃은 보상 또는 원하는 결과를 기준으로 점수를 매길 수 있는 모델 행동의 연속이다.

Cloudflare Containers는 행동을 재현하고 해당 점수를 계산할 수 있는 격리 환경을 제공한다. Trainer라는 새 구성 요소는 모델의 가중치를 업데이트한다.

Workers AI와 Bring Your Own Model은 이후 의도된 배포 대상지를 제공한다. Cloudflare는 고객이 데이터를 수집하고, 특화 모델을 학습한 뒤, 자사 플랫폼을 벗어나지 않고 이를 프로덕션으로 되돌릴 수 있기를 바란다.

따라서 완전한 RL 서비스 설계는 관측 가능성, 컴퓨팅, 격리 실행, 가중치 업데이트 및 서빙을 연결한다. Clef는 이 스택을 위한 첫 번째 집중 워크로드다.

Cloudflare는 자사의 학습 목표를 Reinforcement Learning for Calibrated Decisions, 즉 RLCD라고 부른다. TypeSafe는 Jev의 학습 접근 방식에도 같은 이름을 사용하며, 이는 경쟁 관계를 더욱 직접적으로 만든다.

Cloudflare는 예측이 올바른 서수형 선택지에 근접할 때 부분 점수를 부여한다고 말한다. 목표가 critical일 경우, 심각도 등급이 major인 예측은 모델이 no impact를 선택한 경우보다 더 많은 점수를 받을 수 있다.

학습 과정은 완전히 올바른 구조화 레코드에도 보상을 준다. 참조 페널티는 원래 모델의 행동에서 지나치게 멀어지는 것을 제한하기 위한 것이다.

RL 단계 이전에 Cloudflare는 레이블 스무딩 교차 엔트로피와 Brier loss로 모델을 학습했다. Brier loss는 예측 확률과 관측 결과 사이의 차이를 측정하므로 보정과 관련이 있다.

회사는 rank-256 저랭크 어댑터와 라우팅 헤드를 최적화하는 동안 주요 Qwen 백본을 동결했다. 저랭크 적응은 모든 모델 가중치를 업데이트하는 대신 더 적은 수의 추가 파라미터를 변경한다.

Cloudflare는 프롬프트 표현, 필드 순서 및 스키마 구조를 달리한 합성 데이터도 사용했다. 이러한 순열은 모델이 하나의 고정된 요청 레이아웃에 의존하지 않도록 하기 위한 것이다.

이 접근 방식은 기술적으로 일관성이 있지만, 공개된 근거는 여전히 불완전하다. Cloudflare는 미세 조정 후 보고된 신뢰도가 실제 환경의 정확성과 얼마나 잘 부합하는지 보여 주는 독립 감사 결과를 공개하지 않았다.

이 서비스는 데이터 거버넌스 문제도 제기한다. AI Gateway는 학습에 유용한 정확한 트래픽을 수집할 수 있지만, 그러한 요청에는 기밀 문서, 고객 메시지, 보안 이벤트 또는 개인정보가 포함될 수 있다.

Cloudflare는 일반적인 Clef 요청과 응답을 읽거나 저장하거나 학습에 사용하지 않는다고 말한다. 미세 조정에 참여하는 고객은 자신의 예시가 학습 자료가 되어야 하므로 필연적으로 다른 데이터 경로가 필요하다.

조직에는 동의, 보존, 접근, 삭제 및 지역별 처리에 대한 정밀한 통제가 필요하다. 또한 허용 가능한 학습 예시와 절대로 재현해서는 안 되는 사고를 구분해야 한다.

Cloudflare의 네트워크 운영 이력은 관련 경험을 제공한다. 회사는 악용, 봇, 지원 및 위협 인텔리전스 등의 영역에서 15년 이상 축적한 레이블된 의사결정 데이터를 보유하고 있다고 말한다.

이 내부 데이터가 고객 워크로드로 자동 이전되는 것은 아니다. 하지만 Cloudflare가 레이블 수집과 특화 모델 재배포의 운영 메커니즘을 시험할 수 있는 환경을 제공한다.

회사는 신뢰 및 안전성 검토, 지원 분류, 그리고 정상 봇 분류를 내부 후보 사례로 제시한다. 이들은 알려진 분류 체계에 대해 반복적인 판단을 수반하므로 강력한 의사결정 모델 활용 사례다.

미세 조정에는 상충 관계가 따른다. 모델은 한 도메인 안에서 정확도를 높이는 대신 일부 범용 성능을 잃을 수 있다. 배포 경계가 명확하고 측정된다면 이러한 교환은 수용할 수 있다.

특화 모델이 조용히 새로운 책임을 맡게 되면 위험해진다. 두 작업 모두 확률을 반환한다는 이유만으로 봇 분류기가 접근 제어 권한자가 되어서는 안 된다.

팀에는 버전 관리된 데이터세트, 평가 게이트 및 롤백 계획이 필요하다. 검색 가능한 기술 지식 베이스는 각 모델 버전을 정책, 테스트 및 알려진 한계와 연결하는 데 도움이 될 수 있다.

따라서 RL 플랫폼은 이번 발표에서 더 중대한 부분이다. Cloudflare가 특화 학습을 반복 가능하게 만든다면, Clef는 지속적인 인프라 관계로 진입하는 관문이 된다.

서비스가 컨설팅 의존도가 높은 상태로 남는다면, 학습 플랫폼보다 오픈 모델이 더 많이 채택될 수 있다. 향후 몇 달은 개발자들이 출시의 어느 측면을 가장 가치 있게 여기는지 보여줄 것이다.

벤치마크는 보정과 통제에 대한 답을 남긴다

빠른 타입형 출력은 형식 오류를 줄이지만, 에이전트가 선택된 행동을 신뢰해야 한다는 것을 증명하지는 않는다.

의사결정 모델은 제공된 스키마 밖의 값을 만들어낼 수 없다. 이 특성은 잘못된 JSON, 예상치 못한 레이블, 그리고 코드가 짧은 답변을 기대하는 상황에서의 긴 설명을 방지한다.

그러나 모델이 허용된 답변 중 잘못된 것을 선택하는 일까지 막지는 못한다. 완벽하게 구조화된 실수도 여전히 실수다.

신뢰도가 자동화를 제어할 때 이 차이는 결정적이다. 워크플로가 신뢰도 90% 이상의 행동을 실행하고 나머지는 모두 에스컬레이션한다고 가정해 보자. 이 임계값은 유사한 예측이 열 번 중 약 아홉 번 정확하다는 사실이 입증될 때만 의미가 있다.

전체 정확도는 그러한 관계를 확립하지 못한다. 모델은 강력한 평균 성과를 낼 수 있지만, 드물고 중대한 사례에서는 여전히 과신할 수 있다.

공개된 Clef 평가는 여러 작업에 걸쳐 품질과 지연 시간을 비교한다. 실험을 위한 유용한 근거를 제공하지만, 고객 도메인 전반에서 각 모델의 보정 곡선을 모두 드러내지는 않는다.

Cloudflare 자체 결과도 편차를 보여 준다. Clef-flash는 일부 작업에서 더 큰 모델을 앞섰고, Jev는 에이전트 추적 관측 가능성에서 선두를 차지했다. 이러한 차이는 모델 크기가 보편적인 순위를 만들어내지 않는다는 점을 시사한다.

비공개 워크플로는 더 많은 변화를 도입할 것이다. 업계 용어, 다국어 메시지, 모호한 분류 및 적대적 입력은 모두 성능을 공개 결과에서 멀어지게 할 수 있다.

스키마 설계도 또 다른 오류 원천을 더한다. 두 선택지가 겹치면 모델은 그 사이에 확률을 나눌 수 있다. 올바른 선택지가 없다면, 남은 선택지들에 확률을 분배해야 한다.

명시적인 기권 경로가 도움이 될 수 있다. 개발자는 unknown, insufficient context 또는 require human review 같은 선택지를 포함한 다음, 모델이 이를 적절히 사용하는지 시험할 수 있다.

주변 애플리케이션은 행동의 심각도도 평가해야 한다. 공개 웹페이지를 읽는 작업은 레코드를 삭제하거나 비공개 정보를 전송하는 작업과 같은 신뢰도 임계값을 요구하지 않는다.

결정론적 통제는 여전히 필요하다. 권한, 지출 한도, 대상 제한 및 되돌릴 수 없는 작업은 학습된 확률에만 의존해서는 안 된다.

의사결정 모델은 정책 시스템 내부의 신호로서 가장 잘 작동한다. 복잡한 입력을 해석하고 불확실성을 라우팅할 수 있지만, 코드는 변해서는 안 되는 경계를 강제한다.

프롬프트 인젝션도 여전히 관련이 있다. 에이전트는 자신을 읽는 모델을 조작하려는 문서를 마주할 수 있다. Clef의 제한된 출력은 응답 형식을 제한하지만, 악성 콘텐츠는 여전히 어떤 선택지가 가장 높은 점수를 받을지에 영향을 줄 수 있다.

신뢰할 수 있는 지시, 신뢰할 수 없는 콘텐츠, 제안된 행동 및 도구 메타데이터는 구조적으로 분리되어 있어야 한다. 영향력이 큰 의사결정에는 적대적 예시를 포함한 평가가 필요하다.

멀티모달 입력은 유용성과 공격 표면을 모두 확장한다. Clef는 스크린샷, 문서 및 동영상을 분류할 수 있지만, 시각적 지시에도 오해를 유도하거나 숨겨진 콘텐츠가 포함될 수 있다.

Cloudflare의 64,000토큰 컨텍스트 윈도우는 더 큰 상태를 허용한다. 더 긴 입력은 필요한 근거를 제공할 수 있지만, 모델의 주의를 결정적인 사실에서 분산시키는 관련 없는 자료를 추가할 수도 있다.

오픈 릴리스는 개발자가 이러한 문제를 조사하는 데 도움을 준다. 개발자는 구현을 검토하고, 비공개 평가를 만들며, 로컬 결과를 호스팅된 추론과 비교할 수 있다.

오픈 가중치가 완전한 학습 투명성을 제공하는 것은 아니다. Cloudflare는 목표와 합성 데이터 전략을 설명했지만, 모든 행동을 재현하는 데 필요한 전체 학습 데이터세트는 공개하지 않았다.

셀프 호스팅은 책임도 이전한다. 조직은 모델 서버를 보호하고, 하드웨어를 선택하며, 지연 시간을 모니터링하고, 업데이트를 관리하며, 양자화된 변형을 검증해야 한다.

관리형 Workers AI는 이러한 운영 부담을 줄인다. 대신 고객은 Cloudflare의 서빙 환경과 가용성 보장을 신뢰해야 한다.

어느 선택지도 평가 필요성을 없애지는 않는다. 팀은 입력 상태, 스키마, 모델 버전, 확률, 선택된 행동, 에스컬레이션 경로 및 최종 결과를 기록해야 한다.

이러한 로그는 드리프트 탐지를 지원한다. 배포 당시에는 성과가 좋았던 모델도 제품, 정책 또는 사용자 행동이 변함에 따라 신뢰도가 낮아질 수 있다.

미세 조정은 드리프트를 수정할 수 있지만, 최근 예시에 과적합될 수도 있다. 평가 세트는 학습 데이터와 분리된 상태를 유지해야 하며, 일반 트래픽이 충분히 대표하지 못하는 드문 실패 사례를 포함해야 한다.

따라서 Cloudflare의 벤치마크 선두는 출발 가설이다. 회사는 Clef가 Jev와 비교할 가치가 있음을 보여줬지만, 모든 에이전트 행동을 통제할 준비가 됐다는 점까지 증명한 것은 아니다.

가장 안전한 초기 배포는 되돌릴 수 있는 선택을 포함한다. 티켓 라우팅, 문서 분류, 관련성 필터링 및 모델 선택은 분류기에 되돌릴 수 없는 권한을 부여하지 않으면서 측정 가능한 결과를 제공한다.

Cloudflare Clef에서 다음으로 주목할 점

세 가지 신호가 Clef가 지속 가능한 에이전트 인프라가 될지, 아니면 또 하나의 단명한 모델 출시로 끝날지를 보여줄 것이다.

첫 번째 신호는 독립적인 벤치마크 재현이다. 연구자와 개발자는 보지 못한 데이터, 일관된 하드웨어 및 동일한 요청 스키마에서 비교를 다시 실행해야 한다.

이 작업은 평균 정확도 이상을 측정해야 한다. 보정 오류, 잘못된 승인, 에스컬레이션 비율, 다국어 성능 및 적대적 입력에서의 행동은 운영 활용에 더 중요하다.

안정적인 결과는 Clef가 더 나은 품질과 지연 시간 균형을 제공한다는 Cloudflare의 주장을 강화할 것이다. 회사가 공개한 평가 세트 밖에서 큰 하락이 나타난다면, 학습 품질이 여전히 어려운 경쟁 우위라는 Jev의 주장에 힘이 실릴 것이다.

두 번째 신호는 현장 배치형 지원에서 셀프서비스 RL 플랫폼으로의 전환이다. Cloudflare는 고객이 장기간의 컨설팅 프로젝트 없이 데이터세트를 만들고, 보상을 정의하며, 안전하게 학습하고, 버전을 평가하고, 재배포할 수 있음을 보여줘야 한다.

신뢰할 수 있는 플랫폼은 데이터 계보, 평가 게이트, 개인정보 보호 통제, 롤백 지원 및 모델 버전 이력을 제공해야 한다. 결과 확률이 비즈니스 행동을 통제할 때 학습을 단일 버튼처럼 취급해서는 안 된다.

고객 사례 연구는 중요하지만, 측정 가능한 결과를 포함해야 합니다. 유용한 근거는 파인튜닝 전후의 오류율, 지연 시간, 에스컬레이션 건수, 성능을 비교하는 방식일 것입니다.

세 번째 신호는 경쟁사의 대응입니다. TypeSafe는 더 강력한 캘리브레이션 근거, 더 빠른 서빙, 향상된 멀티모달 지원 또는 프라이빗 배포 옵션으로 Jev를 방어할 수 있습니다.

OpenAI와 AWS 역시 Cloudflare의 기회를 좁힐 수 있습니다. 다른 모델이 개별 벤치마크에서 더 나은 성능을 보이더라도, 주요 에이전트 플랫폼에 직접 통합된 의사결정 서비스는 개발자를 끌어들일 수 있습니다.

Cloudflare의 강점은 수직 통합입니다. AI Gateway는 워크플로를 관찰할 수 있고, Containers는 통제된 롤아웃을 지원하며, Trainer는 가중치를 업데이트하고, Workers AI는 결과를 서빙할 수 있습니다.

그러나 이러한 통합은 동시에 집중 리스크를 만듭니다. 고객은 트래픽 수집, 학습, 배포, 그리고 에이전트를 통제하는 런타임 의사결정까지 하나의 공급자에 의존하게 될 수 있습니다.

오픈 모델은 탈출 경로를 제공하지만, 조직이 이를 효과적으로 운영할 수 있을 때에만 그렇습니다. 따라서 파인튜닝된 가중치의 실질적인 이식성은 기본 릴리스에 적용된 Apache 2.0 라벨만큼 중요할 것입니다.

개발자는 결정적인 승자를 기다릴 필요가 없습니다. 반복적이면서 되돌릴 수 있는 하나의 의사결정을 선택해 Clef, Clef-flash, Jev, 기존 분류기, 소형 생성형 모델을 동일한 비공개 사례로 테스트할 수 있습니다.

유용한 파일럿에는 명시적인 에스컬레이션 옵션과 더 강력한 폴백 모델이 포함되어야 합니다. 팀은 카테고리 변경, 누락된 맥락, 오해를 유도하는 입력, 제공된 답변 중 어느 것도 맞지 않는 사례를 테스트해야 합니다.

Cloudflare Clef decision models는 호스팅 경로와 오픈 가중치 경로를 모두 제공하므로 이러한 실험을 더 쉽게 만듭니다. 이들의 더 큰 중요성은 Cloudflare가 유망한 확률을 신뢰할 수 있는 운영 성과로 전환할 수 있는지에 달려 있습니다.

여러분의 에이전트 워크플로에서 특화 모델을 정당화할 만큼 자주 발생하는 의사결정은 무엇이며, 그 확률이 행동을 촉발하도록 허용하기 전에 어떤 근거를 요구하시겠습니까?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page