DeepSeek H200 테스트, '80배 더 저렴' 주장에 도전
The Call Center Doctors가 모델의 “80배 더 저렴”하다는 주장을 검토하기 위해 Nvidia H200 GPU 4대를 임대하면서 DeepSeek는 실질적인 비용 테스트를 맞이했다.
이 컨설팅 업체는 Claude Code를 통해 Claude Opus 5.5를 사용하는 대신 코딩 에이전트에 DeepSeek V4.1 Flash를 제공하려 했다. 이들의 원래 테스트는 저렴한 모델 가중치가 저렴한 운영 시스템을 의미하지는 않는다는 결론을 내렸다.
DeepSeek H200 테스트는 토큰 가격과 실제 소프트웨어 작업을 완료하는 비용 사이의 격차를 드러냈다. 임대한 서버는 합성 워크로드를 빠르게 처리했지만, 팀이 실제 코딩 트래픽을 재현하자 경제성은 악화됐다.
일반 온디맨드 임대 요금 기준으로 서버 비용은 같은 워크로드를 DeepSeek 자체 API로 전송하는 것보다 약 두 배 높았다. 이 컨설팅 업체는 토큰 가격이 아니라 완료된 코드 변경을 기준으로 측정했을 때 기존 Claude Code 구독도 경쟁력을 유지한다고 결론지었다.
이 결과는 한 기업의 워크로드, 구성 및 내부 측정치에서 나온 것이다. 어느 모델에 대해서도 보편적인 벤치마크는 아니다. 테스트 중 DeepSeek에는 프로덕션 코드를 작성할 권한이 주어지지 않았으므로, 완료된 작업을 직접 비교하는 데에는 한계가 있다.
그럼에도 이 실험은 고립된 벤치마크가 아니라 실제 배포된 코딩 에이전트의 트래픽을 사용했다는 점에서 중요하다. 반복 컨텍스트, 동시성, 지연 시간, 운영 인력, 자율 코드 실행을 둘러싼 보안 경계를 측정했다.
핵심적인 반전은 단순하다. DeepSeek의 낮은 API 요금은 여전히 매력적이었지만, 프리미엄 GPU에서 같은 모델을 자체 호스팅하면 이 특정 워크로드에서는 경제성이 더 나빠졌다.
이 결과는 구매자들이 공급자를 바꾸기 전에 “더 저렴하다”는 말의 의미를 정의하도록 압박한다. 낮은 출력 토큰 요금은 의미 있을 수 있지만 처리량, 신뢰성, 엔지니어링 노력 또는 성공적인 배포를 설명하지는 않는다.
DeepSeek H200 테스트는 가격 주장을 워크로드 테스트로 바꿨다
이 컨설팅 업체는 토큰 100만 개 옆에 표시된 숫자만이 아니라 완전한 추론 시스템을 테스트했다.
The Call Center Doctors는 다른 기업을 위한 콜센터 환경을 구축하고 운영한다. 또한 이러한 업무를 지원하는 소프트웨어를 유지하기 위해 코딩 에이전트를 사용한다.
9월 27일, 이 회사는 Nvidia H200 가속기 4개가 탑재된 서버를 임대했다. DeepSeek V4.1 Flash를 내려받아 일반적으로 Claude Code에 연결되는 에이전트의 백엔드로 구성했다.
이 테스트는 오픈 웨이트 모델에 관한 두 가지 흔한 주장을 겨냥했다. 첫째는 더 낮은 토큰 요금이 곧바로 더 낮은 운영 비용으로 이어진다는 주장이다. 둘째는 조직이 GPU를 임대하고 모델을 직접 제공함으로써 공급자 마진을 피할 수 있다는 주장이다.
DeepSeek는 구매자가 이러한 주장을 검토할 이유를 제공한다. DeepSeek의 모델 출시는 V4.1 Flash를 더 빠른 추론과 높은 처리량을 위해 설계된 전문가 혼합 모델로 설명한다.
전문가 혼합 모델은 각 토큰에 대해 네트워크의 일부만 활성화한다. 이 설계는 모든 요청에서 모든 파라미터를 실행하는 방식과 비교해 연산량을 줄일 수 있다.
DeepSeek는 자사 아키텍처가 입력과 출력을 처리하면서 더 적은 파라미터를 활성화한다고 말한다. 또한 이 모델은 이전 세대보다 키-값 캐시에 필요한 고대역폭 메모리가 적다고 설명한다.
키-값 캐시는 이전 토큰의 중간 어텐션 데이터를 저장한다. 이 데이터를 재사용하면 전체 시퀀스를 새로운 입력으로 처리하는 것보다 반복 컨텍스트를 더 저렴하게 처리할 수 있다.
따라서 이 컨설팅 업체는 메모리 집약적 추론에 적합한 하드웨어를 선택했다. Nvidia의 H200 사양에 따르면 H200 하나에는 141GB의 고대역폭 메모리가 포함된다.
GPU 4개를 합친 용량은 여러 구성 변경 후 모델을 로드하고 제공하기에 충분했다. 그러나 안정적인 서비스를 구축하는 데는 다섯 번의 시작이 필요했다.
재시작할 때마다 모델을 다시 로드하는 시간이 필요했다. 한 최적화는 예상치 못한 메모리를 소비했고, 다른 실행은 멈췄으며, 이후 구성은 더 높은 동시성에서 실패했다.
다섯 번째 시도는 더 낮은 동시성 상한과 사용 가능한 메모리 대부분을 할당한 상태에서 안정화됐다. 이 운영 과정은 경제성 결과의 일부가 됐다.
호스팅 API는 모델 다운로드, 메모리 할당, 서빙 소프트웨어, 용량 계획 및 실패한 시작을 숨긴다. 임대한 장비는 각 작업을 고객에게 노출한다.
안정화된 뒤 서버는 고립된 1분 테스트에서 좋은 성능을 보였다. 특히 캐시된 입력을 빠르게 처리했고, 장비 전체에서 초당 수천 개의 토큰을 생성했다.
이 결과는 처음에는 자체 호스팅의 근거를 뒷받침했다. H200 4대는 상당한 원시 처리량을 제공했고, DeepSeek의 캐시 중심 설계도 예상대로 작동했다.
문제는 팀이 한 번에 하나의 토큰 범주를 테스트하는 것을 멈췄을 때 나타났다. 코딩 에이전트는 새로운 입력, 캐시된 입력, 출력이 균형을 이루는 시퀀스를 전송하지 않았다.
에이전트는 긴 대화, 도구 결과, 파일 컨텍스트 및 이전 추론을 반복적으로 제공했다. 각 요청의 대부분은 모델이 이미 본 텍스트였다.
이 워크로드는 테스트를 이론적 출력 속도에서 벗어나게 했다. 다음 답변을 생성하기 전에 필요한 컨텍스트를 처리하는 데 장비가 거의 모든 시간을 쓰게 만들었다.
따라서 이 사례는 일반적인 모델 경쟁이 아니었다. 매력적인 추론 요금이 에이전트 시스템의 실제 트래픽과 맞닥뜨린 뒤에도 유지되는지를 시험한 것이었다.
에이전트 컨텍스트가 H200 4대를 소모한 이유
코딩 에이전트는 다음 유용한 토큰을 쓰는 것보다 자신의 이력을 읽는 데 훨씬 더 많은 연산을 쓰는 경우가 많다.
이 컨설팅 업체의 9월 로그에는 읽은 토큰 3,885억 개와 쓴 토큰 3억9,300만 개가 기록됐다. 입력 중 3,742억 토큰은 캐시된 재읽기였다.
이는 기록된 입력의 96% 이상이 이전 컨텍스트를 반복한 것이었음을 뜻한다. 출력 토큰 하나당 에이전트는 약 41.6개의 새 입력 토큰과 1,042개의 캐시된 토큰을 제공했다.
평균 요청은 약 19만6,000개의 토큰을 다시 읽었다. 이 패턴은 캐시된 입력이 토큰당 저렴하지만 연산 비용이 전혀 없는 것은 아니기 때문에 중요하다.
임대한 서버는 새 토큰보다 캐시된 토큰을 더 빠르게 처리했다. 그러나 에이전트가 매우 많은 캐시 토큰을 제공했기 때문에 이 작은 비용들이 누적되어 지배적인 워크로드가 됐다.
이 회사는 캐시된 토큰 하나에 약 1.9마이크로초의 서버 시간이 필요하다고 측정했다. 새 입력 토큰에는 약 60마이크로초, 출력 토큰에는 약 189마이크로초가 필요했다.
이 측정치를 프로덕션 트래픽 구성에 적용하자 초당 출력 토큰 약 213개라는 통합 상한이 나왔다. 이는 GPU 4개를 공유하는 모든 에이전트의 총합 결과였다.
컨설팅 업체에 따르면 이 공식은 실제 테스트와 3% 이내로 일치했다. 독립 기관이 이를 재현하지는 않았지만, 이 일치는 워크로드 모델의 신뢰도를 높였다.
이 회사는 이 구성에서 장비가 하루에 총 약 200억 토큰을 처리할 수 있다고 추정했다. 9월 중 가장 바빴던 날에는 510억 토큰에 도달했다.
따라서 용량은 두 번째 제약 조건이 됐다. 일반 임대 경제성이 유리했더라도 서버 한 대로는 기록된 피크 수요를 감당할 수 없었다.
고립된 테스트와 혼합 테스트의 대비는 헤드라인 처리량이 왜 오해를 불러일으킬 수 있는지 설명한다. 출력만 측정했을 때 장비는 초당 5,000개가 넘는 토큰을 생성했다.
실제 에이전트는 출력만으로 작동할 수 없다. 지침, 코드, 파일, 로그, 도구 응답 및 이전 메시지를 계속 제공해야 한다.
장기 실행 에이전트는 대화가 시간이 지날수록 커지기 때문에 이러한 불균형을 증폭시킨다. 이후 호출마다 같은 이력의 상당 부분과 소량의 새 정보가 포함될 수 있다.
캐시 할인은 반복 토큰의 요금을 낮춘다. 하지만 메모리 대역폭, 스케줄링 지연 또는 서버를 점유하는 기회비용을 없애지는 않는다.
이 구분은 모델 간 비교도 복잡하게 만든다. 더 유능한 모델은 더 적은 시도, 더 짧은 프롬프트 또는 더 적은 검토로 작업을 완료할 수 있다.
더 저렴한 모델도 유사한 컨텍스트를 사용하고 비슷한 결과를 낸다면 여전히 우위를 차지할 수 있다. 하지만 더 많은 재시도, 더 긴 설명 또는 다른 모델의 검증이 필요하다면 불리할 수 있다.
DeepSeek H200 테스트는 DeepSeek가 주로 읽기 전용 검토자로 제공됐기 때문에 이 품질 문제에 완전히 답하지는 못했다. 다만 출력 토큰 요금만으로는 이 질문에 답할 수 없는 이유를 보여줬다.
중요한 지표는 작업에 따라 달라진다. 배치 요약 시스템은 총 처리량을 우선할 수 있는 반면, 대화형 에이전트에는 낮은 지연 시간과 신뢰할 수 있는 도구 사용도 필요하다.
코딩 운영에서는 완료된 변경, 검토 시간, 회귀, 보안 및 개발자의 대기 시간이 중요하다. 토큰 효율성은 그 결과를 구성하는 하나의 요소일 뿐이다.
이 컨설팅 업체의 로그는 다른 구매자에게 유용한 경고를 제공했다. 하드웨어를 선택하기 전에 팀은 새 입력, 캐시된 컨텍스트, 생성된 출력의 비율을 프로파일링해야 한다.
그 비율이 없다면 벤치마크는 워크로드의 가장 작은 부분을 최적화할 수 있다. 빠른 생성 테스트는 대부분의 시간을 읽는 데 쓰는 에이전트에 대해서는 거의 말해주지 못할 수 있다.
DeepSeek 자체 호스팅은 DeepSeek API에 밀렸다
가장 명확한 결과는 DeepSeek 대 Claude가 아니라, 임대한 DeepSeek 인프라 대 DeepSeek 관리형 서비스였다.
일반 온디맨드 서버 요금은 같은 트래픽을 DeepSeek API로 처리하는 비용의 약 2~2.4배에 해당하는 일일 비용을 만들었다. 이 계산은 지속적인 가동률을 가정했다.
실험에 사용된 스팟 임대는 훨씬 저렴했다. 이 일시적 요금에서는 서버가 최대 부하로 작동할 때만 DeepSeek 관리형 서비스와 거의 동등한 수준에 도달했다.
스팟 용량에는 가용성의 대가가 따른다. 수요가 변하면 제공업체가 회수할 수 있기 때문에 신뢰할 수 있는 프로덕션 인프라로 간주하기 어렵다.
실험 직후 실제로 그런 일이 일어났다. 제공업체는 최종 테스트 후 수분 안에 장비를 회수했다.
온디맨드 대안은 이러한 중단 위험을 피했지만 경제성은 악화됐다. 모델 로딩, 재시작, 트래픽 대기 또는 최대 가동률 미만 상태에도 비용을 청구했다.
DeepSeek의 관리형 API는 이러한 유휴 시간을 많은 고객에게 분산한다. 제공업체는 요청을 배치 처리하고, 하드웨어를 풀링하며, 더 큰 규모로 자체 서빙 스택을 운영할 수 있다.
DeepSeek의 API 요금표도 캐시된 입력, 새 입력 및 출력을 구분한다. 비피크 트래픽에는 평일 피크 시간 트래픽보다 낮은 요금이 적용된다.
이 일정은 구매자에게 또 다른 최적화 경로를 제공한다. 유연한 배치 워크로드는 전용 장비 없이도 피크 시간을 피해서 실행할 수 있다.
임대한 서버에는 이에 상응하는 수요 조정이 없었다. 에이전트가 유용한 작업을 생산하는지와 관계없이 시간당 과금은 계속됐다.
이 비교가 자체 호스팅이 항상 비경제적이라는 사실을 입증하는 것은 아니다. 조직은 감가상각이 끝난 하드웨어를 보유하거나, 더 낮은 용량 요금을 협상하거나, 여러 워크로드에서 안정적인 가동률을 유지할 수 있다.
대규모 배포는 짧은 실험이 달성한 수준을 넘어 커널, 양자화, 라우팅 및 배치 스케줄링을 최적화할 수도 있다. DeepSeek 역시 매우 큰 규모의 배포를 계획하는 조직에 추가 옵션을 논의해 보라고 권한다.
호스팅 추론이 더 저렴하더라도 개인정보 보호는 로컬 운영을 정당화할 수 있다. 규제 대상 워크로드는 직접적인 연산 비용보다 더 중요한 데이터 통제를 요구할 수 있다.
예측 가능한 용량도 중요할 수 있다. 지속적인 수요가 있는 기업은 특히 외부 API에 제한이나 가용성 위험이 있을 때 자신이 통제하는 인프라를 선호할 수 있다.
하지만 이러한 장점에는 안정적인 장비, 숙련된 운영자, 모니터링, 장애 조치, 보안 통제가 필요하다. 오픈 웨이트만으로는 그 어떤 것도 자동으로 제공되지 않는다.
이 테스트는 전문성 비용도 드러냈다. 엔지니어들은 실제 유용한 워크로드를 실행하기 전에 메모리 사용량, 시작 실패, 동시성 한계, 서빙 동작을 진단해야 했다.
이러한 노동은 단순한 장비 비교에 포함되지 않았다. 이를 포함했다면 단기적인 자체 호스팅 실험은 더욱 불리해졌을 것이다.
이는 DeepSeek 자체 호스팅 배포를 고려하는 기업이 얻어야 할 핵심 교훈이다. 비교 대상은 하나의 완전한 서비스와 또 다른 완전한 서비스여야 한다.
모델 웨이트는 하나의 구성 요소일 뿐이다. 하드웨어 임대, 유휴 용량, 오케스트레이션, 관측 가능성, 인시던트 대응, 전력, 스토리지, 인력 시간이 시스템을 완성한다.
DeepSeek API는 다운로드 가능한 모델과 동일한 아키텍처 효율성을 누린다. 또한 DeepSeek가 다수 고객을 대상으로 운영할 수 있는 인프라의 이점도 얻는다.
자체 호스팅은 이 두 가지 장점을 모두 극복해야 한다. API 제공업체가 더 높은 활용률과 서빙 전문성을 갖췄다면, API 마진을 피하는 것만으로는 충분하지 않다.
이 워크로드에서는 이를 극복하지 못했다. 오픈 웨이트 옵션은 통제권을 제공했지만, 더 저렴한 DeepSeek 경험을 제공한 것은 DeepSeek의 클라우드였다.
“80배 저렴”이라는 주장은 서로 다른 구매 모델을 비교했다
이 헤드라인 비교는 공개 API 요금과 고사용량 구독 액세스를 나란히 놓았기 때문에 설득력이 약해졌다.
“80배 저렴”이라는 주장은 특정 가정 아래의 토큰 요금을 비교한다. 모든 Claude Code 사용자가 실제로 지불하는 금액을 자동으로 설명하지는 않는다.
이 컨설팅사는 Anthropic의 계량형 API가 아니라 구독을 통해 Claude에 접근했다. Anthropic은 적격 플랜이 공유 사용량 한도를 전제로 Claude Code에 대한 구독 액세스를 제공한다고 확인한다.
구독과 API는 서로 다른 구매 패턴을 지원한다. 구독은 정해진 한도 안에서 액세스를 묶어 제공하는 반면, API는 측정된 사용량에 따라 과금한다.
이 컨설팅사는 자사의 구독 사용량이 공개 API 요금에서 큰 할인을 받는 것과 같았다고 말했다. 이 차이가 이론상 80배 격차의 대부분을 흡수했다.
9월 트래픽을 기준으로 이 회사는 DeepSeek API 비용이 Claude 구독보다 다소 저렴할 수도, 더 비쌀 수도 있다고 계산했다. 사용량이 피크 요금과 비피크 요금 사이 어디에 위치하는지는 시점에 따라 결정됐다.
보도된 결과는 Claude의 공개 API 요금이라면 훨씬 더 큰 청구서가 나왔을 것이라고도 추정했다. 그러나 그것은 이 회사가 구매한 제품이 아니었다.
모든 제품을 명목 토큰 요금으로 축소하면 이 구분을 놓치기 쉽다. 동일한 모델도 구독, 엔터프라이즈 계약, 클라우드 플랫폼 또는 직접 API를 통해 판매될 수 있다.
각 채널은 서로 다른 한도와 경제적 유인을 갖는다. 구독은 일관된 개인 사용에 유리할 수 있고, API는 프로그래밍 가능한 확장성과 세부적인 사용량 집계를 제공한다.
엔터프라이즈 계약에는 협상된 용량, 서비스 약정 또는 통제가 추가될 수 있다. 자체 호스팅은 공급업체의 서비스 마진을 인프라와 운영 책임으로 대체한다.
단일 요금으로 이 네 가지 방식을 모두 포착할 수는 없다. 구매자는 실제로 구매하고 운영할 수 있는 경로를 비교해야 한다.
이 컨설팅사는 병합된 코드 변경 하나의 비용도 계산했다. Claude 에이전트는 측정 기간 동안 5,610건의 변경을 병합했으며, 이 중 5건은 이후 되돌려졌다.
이들은 DeepSeek가 추가 토큰, 재시도, Claude 기반 검증을 필요로 할 것이라고 추정했다. 이러한 가정 아래에서는 승인된 변경 하나당 DeepSeek를 통한 비용이 더 높아진다.
이 추정은 신중하게 봐야 한다. DeepSeek는 동일한 쓰기 권한 작업을 수행하지 않았기 때문에, 이 연구는 실제 성공률이나 총 토큰 사용량을 관찰할 수 없었다.
더 나은 프롬프팅, 서빙 소프트웨어 또는 에이전트 설계가 DeepSeek의 결과물을 개선한다면 가정이 지나치게 엄격했을 수 있다. 반대로 검토 과정에서 더 많은 결함이 발견된다면 지나치게 낙관적이었을 수도 있다.
그럼에도 승인된 변경당 비용은 출력 토큰당 비용보다 더 유용한 목표 지표다. 이는 추론 비용을 검토를 통과하는 소프트웨어와 연결한다.
가장 적합한 단위는 워크플로에 따라 다르다. 고객 서비스 팀은 해결된 사례를 측정할 수 있고, 연구자는 검증된 발견을 측정할 수 있다.
모델들이 이러한 결과에 도달하기 위해 비슷한 작업량을 요구한다면 낮은 토큰 요금은 여전히 가치가 있다. 역량, 지연 시간 또는 검토 부담이 다르면 그 결정력은 약해진다.
따라서 “80배” 수치는 보편적인 절감액이 아니라 좁은 범위의 비교를 설명한다. Call Center Doctors는 DeepSeek의 공개 요금을 반박한 것이 아니다.
대신 제품, 워크로드, 결과물 품질이 다르면 요금표 산술이 무너질 수 있음을 보여줬다.
보안 문제로 DeepSeek는 프로덕션 코드 작성에서 제외됐다
이 실험의 가장 강력한 제약은 동시에 가장 중요한 운영상 경고이기도 했다. DeepSeek는 의도된 코딩 과제를 끝내 완료하지 못했다.
이 회사는 DeepSeek를 코드 작성 에이전트에 활용할 계획이었다. 그러나 검토자들은 생성된 코드가 의도된 샌드박스에서 벗어날 수 있는 가능성 있는 경로를 발견했다.
샌드박스는 신뢰할 수 없는 코드가 접근할 수 있는 대상을 제한하는 격리된 실행 환경이다. 에이전트가 민감한 파일, 자격 증명, 네트워크 또는 관리자 권한에 접근하지 못하도록 막아야 한다.
보고된 취약점 중 하나는 공유 임시 디렉터리에 있는 설정 파일과 관련됐다. 이 회사는 그곳의 조작된 콘텐츠가 생성된 코드가 상승된 권한으로 실행되도록 할 수 있다고 판단했다.
이에 따라 이 컨설팅사는 빌더 에이전트를 오프라인 상태로 유지했다. DeepSeek는 읽기 전용 검토 에이전트 48~64개를 통해서만 작동했다.
이 검토자들은 2,377개의 코드 폴더를 검사하고 32건의 버그 보고서를 작성했다. 이 활동은 유용한 처리량을 보여줬지만, 자율적인 구현을 시험한 것은 아니었다.
보안 문제는 DeepSeek 모델 웨이트의 결함으로 제시되지 않았다. 이는 컨설팅사의 주변 에이전트 환경과 실행 통제에 관한 문제였다.
이 구분은 중요하다. 명령을 생성할 수 있는 어떤 모델이든, 제대로 격리되지 않은 도구 체인의 취약점을 노출할 수 있다.
에이전트가 파일시스템과 셸 액세스를 받으면 Claude, DeepSeek 또는 다른 모델 모두 안전하지 않은 작업을 만들어낼 수 있다. 보안 경계는 모델 출력을 신뢰할 수 없는 것으로 가정해야 한다.
그 결과 이 테스트는 두 개의 별도 질문을 혼합했다. 하나는 DeepSeek 추론의 경제성에 관한 것이었다. 다른 하나는 해당 기업의 에이전트 샌드박스가 쓰기 권한 자동화를 수용할 준비가 되었는지에 관한 것이었다.
직접적인 워크로드 측정은 첫 번째 질문에만 이뤄졌다. 두 번째 질문 때문에 의도했던 정면 코딩 비교 시험은 중단됐다.
따라서 동일한 실험에서 Claude가 더 나은 코드를 생성했다는 강한 주장을 할 수 없다. Claude가 9월에 완료한 작업은 과거의 프로덕션 데이터였지만, DeepSeek의 작업은 제한된 테스트였다.
또한 DeepSeek의 병합된 변경당 비용을 공정하게 측정하는 것도 불가능하다. 이 모델은 검토와 배포를 위한 변경을 생성할 기회를 받지 못했다.
이 회사는 Opus가 역량 우위를 지녔다고 주장하기 위해 공개 코딩 벤치마크를 인용했다. 벤치마크는 맥락을 제공할 수 있지만, 동일한 내부 작업 세트를 대체하지는 못한다.
엄격한 후속 실험이라면 두 모델에 동일한 저장소, 도구, 보안 제약, 프롬프트, 승인 테스트를 제공해야 한다. 검토자들은 모델의 정체를 알지 못한 상태를 유지해야 한다.
이 연구는 성공한 변경, 회귀, 재시도, 지연 시간, 토큰 사용량, 사람의 검토 시간, 보안 위반을 기록해야 한다. 그래야만 총 제공 비용을 직접 비교할 수 있다.
이러한 한계에도 불구하고, 중단된 배포는 실질적인 교훈을 남긴다. 실행 계층이 모델의 의도된 도구를 안전하게 노출할 수 없다면 인프라 비용은 거의 의미가 없다.
에이전트 시스템은 확률적인 모델 출력을 결정론적 작업과 연결하기 때문에 공격 표면을 확장한다. 단 하나의 안전하지 않은 경로가 수천 개의 저렴한 토큰보다 더 중요할 수 있다.
따라서 기업은 자율 작업으로 인한 절감액을 계산하기 전에 격리 성능을 시험해야 한다. 읽기 전용 분석과 쓰기 권한 에이전트는 매우 다른 위험 범주에 속한다.
보안은 경제성에도 영향을 준다. 더 강력한 격리에는 일회용 환경, 제한된 자격 증명, 네트워크 통제, 로깅, 승인 점검 지점이 필요할 수 있다.
이러한 통제는 엔지니어링 시간을 소비하고 지연 시간을 추가한다. 또한 동시성을 낮추거나 별도의 인프라를 요구할 수 있다.
추론 요금이 가장 낮은 모델이 안전하게 제공되는 비용까지 가장 낮게 만들지는 않을 수 있다. 관련 시스템에는 그 출력을 신뢰하는 데 필요한 모든 통제가 포함된다.
DeepSeek H200 테스트가 AI 구매자에게 의미하는 것
다음 비교는 단일 토큰 가격이 아니라 승인된 작업, 지속적인 활용률, 안전한 실행에 초점을 맞춰야 한다.
첫 번째로 주목할 신호는 통제된 쓰기 권한 재실행이다. DeepSeek에는 이전에 Claude와 함께 사용된 것과 동일한 도구, 저장소, 프롬프트, 승인 기준이 필요하다.
제한적인 검토만으로 비슷한 수준의 변경을 완료한다면 컨설팅사의 부정적인 결론은 약해질 것이다. 재시도와 수정이 계속 많다면 결과 기반 비용 주장은 더 강해질 것이다.
두 번째 신호는 수 주에 걸친 지속적인 활용률이다. 유용한 수요가 하루 종일 용량에 가깝게 유지될 때 자체 호스팅 서버는 더 매력적이 된다.
Call Center Doctors는 한 대의 장비 용량을 초과하는 피크를 측정했다. 그러나 변동하는 트래픽은 이러한 피크 밖의 시간대에 여전히 비용이 큰 유휴 구간을 남길 수 있다.
더 긴 테스트는 시간대별 활용률, 큐 깊이, 첫 토큰 지연 시간, 중단, 로딩 또는 복구에 소요된 시간 비율을 보고해야 한다.
또한 캐시된 입력, 신규 입력, 출력을 분리해야 한다. 이 범주들은 메모리 대역폭 및 배칭과 서로 다르게 상호작용한다.
세 번째 신호는 DeepSeek V4.1-Pro다. DeepSeek는 현재 Flash 아키텍처가 더 큰 모델로 확장될 것이라고 밝혔지만, 확정된 출시일은 제시하지 않았다.
더 강력한 모델은 더 적은 재시도로 더 많은 작업을 완료한다면 경제성을 바꿀 수 있다. 반대로 더 많은 메모리를 요구하거나 더 낮은 처리량을 제공할 수도 있다.
구매자는 역량과 서빙 요구사항을 모두 지켜봐야 한다. 벤치마크 개선이 더 낮은 프로덕션 비용을 보장하지는 않는다.
DeepSeek의 현재 성과는 여전히 중요하다. 공식 요금은 대규모 실험을 접근 가능하게 만들고, 다운로드 가능한 웨이트는 배포 유연성을 제공한다.
이번 테스트가 이러한 장점을 없앤 것은 아니다. 다만 이점이 절감으로 이어지는 조건을 좁혔다.
간헐적이거나 불확실한 수요에는 전용 4-GPU 서버를 임대하는 것보다 DeepSeek의 관리형 API가 더 합리적으로 보인다. 이는 인프라 운영을 고객에게 넘기지 않으면서 낮은 토큰 요금을 유지한다.
민감한 데이터, 예측 가능하고 지속적인 수요 또는 특화된 최적화가 필요한 경우에는 자체 호스팅도 여전히 평가할 가치가 있다. 비즈니스 사례에는 인력, 안정성, 보안, 미사용 용량이 포함돼야 한다.
Claude Code는 다른 가치를 제안한다. 구독 한도 아래에서 모델 액세스, 코딩 인터페이스, 제공업체 운영 인프라를 묶어 제공한다.
이러한 패키징은 개인의 고사용량 환경에서 토큰 기반 비교보다 더 나은 성과를 낼 수 있다. 반면 조직이 프로그래밍 가능한 용량이나 중앙집중식 통제를 필요로 할 때는 제약이 될 수도 있다.
따라서 부담은 조달팀과 엔지니어링 리더에게 돌아간다. 이들은 “API”, “구독”, “자체 호스팅”을 상호 교환 가능한 구매 단위로 취급하는 일을 멈춰야 한다.
대신 공급업체 사례가 아니라 프로덕션 추적 데이터에서 시작해야 한다. 가장 유용한 추적 데이터에는 컨텍스트 길이, 캐시 적중, 출력, 지연 시간, 실패, 승인된 결과가 기록된다.
그런 다음 팀은 경쟁 시스템을 통해 대표적인 워크로드를 재실행할 수 있다. 이 테스트에는 성공적인 데모 이후 실제로 중요한 운영 조건이 포함돼야 한다.
그 조건에는 동시성, 트래픽 변동, 재시작, 큐잉, 모델 업데이트, 모니터링, 복구가 포함된다. 에이전트에 쓰기 권한을 부여하기 전에 보안 테스트를 수행해야 한다.
성과 지표는 조직의 목표와 일치해야 한다. 코딩 에이전트의 경우 머지된 변경 사항, 결함, 되돌림, 검토 시간, 완료까지의 시간이 이에 포함된다.
지원 에이전트에는 해결된 사례, 에스컬레이션, 고객 만족도, 정책 위반 등이 유용한 지표다. 리서치 에이전트의 경우 생성된 페이지 수보다 검증된 발견이 더 중요하다.
DeepSeek H200 테스트가 가치 있는 이유는 이러한 기준에 한 걸음 다가갔기 때문이다. 추상적인 요금 비교를 실제 컨텍스트 분포와 실제 인프라로 대체했다.
그 한계 또한 시사하는 바가 크다. 짧은 실행 시간, 단일 조직, 미완성인 보안 작업, 불균등한 프로덕션 접근성 때문에 보편적인 결론을 내릴 수는 없다.
적절한 결론은 더 제한적이다. 임대한 H200 네 대는 이 에이전트 워크로드에서 DeepSeek의 API를 앞서지 못했고, API 역시 구독 서비스 대비 명확한 80배의 이점을 제공하지 못했다.
이는 단순화된 주장을 반박하기에는 충분하다. 그러나 DeepSeek, 오픈 웨이트, 또는 자체 호스팅 추론을 일축하기에는 충분하지 않다.
AI 스택을 바꾸기 전에 대표적인 트래픽을 일주일간 수집하고, 승인된 결과당 비용을 계산하라. 그런 다음 보안 통제를 활성화한 상태에서 비교를 반복하라.
가장 저렴한 토큰이 인상적으로 보이는지가 아니라, 모델이 동일한 작업을 끝까지 수행하는지를 물어야 한다. 다음 DeepSeek H200 테스트는 그 더 어려운 질문에 답해야 한다.



