top of page

OpenRouter Agent 토큰 사용량은 인간 트래픽의 5배지만, 대부분은 캐시된 컨텍스트

5일 전
13분 분량

OpenRouter의 에이전트 토큰 사용량은 8월 7조 3,000억 토큰에 도달해 인간에 귀속된 플랫폼 트래픽 1조 4,000억 토큰의 5배를 넘었다. 그러나 이 에이전트 토큰의 85% 이상은 새로 처리된 지시문이나 생성된 답변이 아니라 캐시된 프롬프트에서 비롯된 것으로 전해진다.

이 차이는 이제 AI가 사람보다 더 많은 AI를 사용한다는 주장에 복잡성을 더한다. 에이전트가 작업당 훨씬 많은 모델 트래픽을 만들어내는 것은 분명하다. 하지만 이 차트가 측정하는 것은 하나의 플랫폼을 통해 라우팅된 토큰일 뿐, 전 세계 AI 도입, 지출, 생산적 작업 또는 경제적 가치는 아니다.

Futurum Group의 CEO인 Daniel Newman은 9월 30일 X 게시물에서 이 수치를 확산시켰다. 그는 이 비율이 5배에서 10배로 상승한 뒤 계속 높아질 것이라고 예측했다. 5배 수치는 관측된 OpenRouter 트래픽에서 나온 것이다. 10배 수치는 명시된 시점이나 뒷받침하는 모델이 없는 전망으로 남아 있다.

따라서 진짜 경쟁 구도는 에이전트 대 인간이 아니다. 순수 토큰 볼륨과 유용한 작업의 대결이다. 이 구분은 에이전트 루프를 관리하는 개발자, 수익을 평가하는 기업, 메모리 용량을 계획하는 인프라 제공업체에 중요하다.

OpenRouter Agent 토큰 사용량, 명확한 임계점 돌파

8월 데이터는 모델 트래픽의 큰 변화를 보여주지만, 이는 OpenRouter가 측정한 환경 안에서만 해당한다.

OpenRouter는 모델과 추론 제공업체 전반에 걸쳐 요청을 라우팅하는 게이트웨이를 운영한다. 이 위치 덕분에 회사는 직접 대화, 코딩 도구, 자율 워크플로를 포함한 다양한 애플리케이션 트래픽을 파악할 수 있다.

보도된 차트는 2026년 8월 10일까지의 7일 평균 토큰 사용량을 제시한다. 에이전트 트래픽은 약 7조 3,000억 토큰에 달했으며, 인간 트래픽은 1조 4,000억 토큰이었다.

이에 따른 비율은 약 5.2 대 1이다. 이는 해당 측정 기간 동안 OpenRouter에서 에이전트가 인간보다 5배 많은 토큰 트래픽을 생성했다는 더 제한적인 주장에 근거를 제공한다.

이는 ChatGPT, Claude, Gemini, 프라이빗 클라우드 배포 또는 로컬 호스팅 모델 전반에서 같은 비율이 성립한다는 점을 입증하지는 않는다. 이들 시스템은 OpenRouter가 관측할 수 없는 상당한 트래픽을 차지한다.

OpenRouter는 또한 에이전트 사용량이 2월 6일 이후 약 14배 증가했다고 보고했다. 같은 기간 인간 토큰 사용량은 약 2.8배 늘었다. 인간과 에이전트형 행동을 결합한 혼합 트래픽은 약 4.7배 증가한 것으로 전해진다.

2월 6일은 데이터세트에서 인간 트래픽이 에이전트 트래픽을 웃돈 마지막 관측일이었다. 이 때문에 8월 결과는 하루 단위 급증보다 더 의미가 크다. 에이전트는 약 6개월 동안 선두를 유지하고 격차를 확대했다.

OpenRouter는 각 API 키를 에이전트형, 인간, 혼합으로 분류했다. 이 시스템은 도구 호출 비율, 턴 수, 응답 간 시간 간격을 포함한 7개의 가중 신호를 사용한 것으로 전해진다.

이 접근법은 애플리케이션 이름에만 의존하는 것보다 더 많은 정보를 제공한다. 범용 API 클라이언트도 자율 루프를 실행할 수 있는 반면, 에이전트로 마케팅되는 애플리케이션은 직접적인 인간 통제 아래에 머물 수 있다.

그러나 행동 기반 분류는 불확실성을 초래한다. API 키는 여러 제품, 팀 또는 사용 사례를 지원할 수 있다. 워크로드는 자격 증명을 바꾸지 않고도 인간 주도 행동과 자동화된 행동 사이를 오갈 수 있다.

혼합 카테고리는 이러한 모호성을 인정하지만 제거하지는 않는다. 해당 트래픽의 일부를 재분류하면 에이전트와 인간 간 비율은 달라질 수 있다.

또 다른 중요한 의미론적 문제가 있다. 에이전트는 일반적인 경제적 의미에서 독립적인 고객이 아니다. 인간과 조직이 에이전트를 배포하고, 목표를 정의하며, 요청 비용을 부담하고, 출력물에 가치가 있는지 결정한다.

에이전트는 자동화된 중개자로 이해하는 편이 더 적절하다. 하나의 인간 요청이 계획, 검색, 도구 실행, 검증, 수정 및 반복적인 모델 호출을 시작할 수 있다.

이러한 증폭 효과가 핵심 사건이다. AI 수요는 더 이상 얼마나 많은 사람이 채팅 창을 여는지로만 결정되지 않는다. 각 인간 요청이 얼마나 많은 기계 활동을 유발하는지에 점점 더 좌우된다.

OpenRouter의 이전 100조 토큰 연구도 같은 구조적 변화를 확인했다. 이 연구는 에이전트형 추론을 계획, 도구, 수정 및 반복적인 모델 상호작용을 포함하는 확장된 시퀀스로 설명했다.

이 연구는 프로그래밍이 프롬프트 성장의 주요 원천이 되었다고 밝혔다. 2025년 말에는 프로그래밍 프롬프트의 평균 길이도 범용 프롬프트보다 몇 배 더 길었다.

이러한 패턴은 에이전트가 왜 임계점을 넘어섰는지 설명하는 데 도움이 된다. 사람은 하나의 코딩 요청을 제출할 수 있다. 에이전트는 반복적으로 파일을 검사하고, 도구를 호출하며, 테스트 결과를 검토하고, 작업 컨텍스트를 다시 전송할 수 있다.

8월 차트는 이러한 증폭을 플랫폼 규모에서 포착한다. 자율 소프트웨어가 인간 수요를 대체했다는 점을 증명하지는 않는다. 인간 수요가 많은 하위 요청을 생성하는 시스템을 통해 점점 더 유입되고 있음을 보여준다.

하나의 인간 지시가 수천 번의 모델 작업을 유발할 수 있다

에이전트는 단일 요청을 지속적인 계산 프로세스로 전환하기 때문에 더 많은 토큰을 소비한다.

일반적인 챗봇 상호작용은 대개 눈에 보이는 리듬을 따른다. 사람이 프롬프트를 작성하고, 답변을 받으며, 계속할지 결정한다. 각각의 새 턴은 또 다른 인간의 행동에 의존한다.

에이전트는 그 멈춤 없이 계속할 수 있다. 목표를 해석하고, 단계를 만들고, 도구를 선택하고, 결과를 평가하며, 다른 시도가 필요한지 결정한다.

소프트웨어 마이그레이션을 생각해 보자. 개발자는 에이전트에게 애플리케이션을 한 클라우드 서비스에서 다른 서비스로 옮겨 달라고 요청할 수 있다.

첫 번째 모델 호출은 요청을 검토하고 계획을 수립할 수 있다. 이후 호출에서는 구성 파일을 검사하고, 문서를 검색하고, 코드를 수정하고, 테스트를 실행하고, 실패를 진단하고, 구현을 수정할 수 있다.

각 호출에는 가장 최근의 지시문 이상이 포함되는 경우가 많다. 시스템 규칙, 도구 정의, 리포지터리 세부 정보, 이전 메시지, 명령 출력, 에이전트의 이전 결정이 함께 실릴 수 있다.

이렇게 축적된 자료가 컨텍스트 윈도우다. 이는 한 번의 요청에서 모델이 이용할 수 있는 텍스트와 구조화된 데이터를 뜻한다. 작업이 계속될수록 이 컨텍스트는 원래의 인간 프롬프트보다 훨씬 커질 수 있다.

도구 사용은 트래픽을 더욱 늘린다. 모델은 데이터베이스 쿼리를 생성하고 결과를 검사한 뒤, 다음 단계를 결정하기 위해 다시 모델을 호출할 수 있다.

병렬 에이전트는 이 과정을 다시 증폭할 수 있다. 한 조정자가 조사, 코딩, 테스트, 검토를 별도의 작업자에게 위임할 수 있다. 각 작업자는 자체 지시문과 작업 이력을 유지한다.

이는 토큰 볼륨이 사용자 수보다 훨씬 빠르게 증가할 수 있는 이유를 설명한다. 기본 단위가 대화 턴에서 워크플로 단계로 이동했다.

OpenRouter의 데이터는 추론 및 프로그래밍 워크로드의 성장도 반영한다. 이러한 작업은 중간 상태, 외부 도구, 반복적인 검증을 수반하기 때문에 본질적으로 더 긴 상호작용을 지원한다.

학술적 증거는 이러한 증폭이 극단적으로 커질 수 있음을 시사한다. 2026년 에이전트형 코딩 연구 한 건에서는 실험 환경에서 에이전트 작업이 코드 채팅보다 약 1,000배 많은 토큰을 소비한 것으로 나타났다.

에이전트 비용 연구는 반복 실행 간에도 큰 편차가 있음을 발견했다. 연구자들의 테스트에서 동일한 작업의 토큰 사용량은 최대 30배까지 달랐다.

중요하게도, 더 많은 토큰이 일관되게 더 나은 결과를 만들지는 않았다. 성능은 추가 소비가 상응하는 개선을 더 이상 제공하지 못하기 전에 중간 수준에서 정점에 이르는 경우가 많았다.

이 발견은 OpenRouter 에이전트 토큰 사용량을 둘러싼 핵심 긴장을 강화한다. 증가하는 수치는 생산적인 자동화, 불필요한 반복 또는 둘의 혼합을 나타낼 수 있다.

따라서 에이전트 구축자는 생성된 활동이 아니라 완료된 작업을 측정해야 한다는 압박을 받는다. 유용한 지표에는 승인된 코드 변경, 해결된 지원 사례, 성공적인 거래, 사람의 수정 없이 완료된 작업이 포함된다.

토큰은 텍스트 처리의 단위일 뿐이다. 정확성, 난이도, 새로움 또는 비즈니스 가치에 대한 내재적 척도를 갖고 있지 않다.

두 워크플로는 같은 수의 토큰을 소비하면서도 매우 다른 결과를 낼 수 있다. 하나는 어려운 엔지니어링 문제를 해결할 수 있다. 다른 하나는 제한 장치가 멈출 때까지 실패한 계획을 반복할 수 있다.

어떤 결과가 더 나올 가능성이 큰지는 주변 시스템의 설계가 결정한다. 명확한 완료 테스트는 에이전트가 성공을 인식하도록 돕는다. 제한된 재시도 정책은 실패한 작업이 무기한 실행되는 것을 방지한다.

좋은 도구는 긴 텍스트 추론의 필요성도 줄인다. 구조화된 API는 그렇지 않았다면 반복적인 탐색과 해석이 필요했을 정확한 결과를 반환할 수 있다.

같은 이유로 메모리 아키텍처도 중요하다. 에이전트는 매 단계마다 모든 과거 세부 정보를 필요로 하지 않는다. 현재 결정과 관련성이 남아 있는 일부만 필요하다.

이 지점에서 검색 가능한 개인 지식 베이스는 인간 주도 워크플로를 지원할 수 있다. 시스템이 컨텍스트를 신중하게 선택한다면, 검색된 증거가 무차별적인 이력을 대체할 수 있다.

압박은 개발자를 넘어 확장된다. 이제 기업 구매자는 제품이 루프를 통제하고, 컨텍스트를 검색하며, 소비량을 보고하는 방식을 평가해야 한다.

제품은 짧은 데모에서는 효율적으로 보일 수 있지만, 장기 실행 워크로드에서는 다르게 작동할 수 있다. 실제 운영 작업에서는 누락된 권한, 모호한 목표, 변경되는 데이터, 예상치 못한 도구 응답을 마주한다.

이런 조건은 재시도를 발생시킨다. 또한 에이전트에 신뢰할 수 있는 중지 규칙이 있는지, 아니면 그저 그럴듯한 다음 단계를 계속 생성하는지를 드러낸다.

인간의 도입은 여전히 중요하지만, 더는 추론 수요를 단독으로 예측하지 못한다. 더 유용한 공식에는 사용자, 위임된 작업, 작업당 모델 호출 수, 호출당 토큰 수가 포함된다.

이 공식은 원칙적으로 10배 비율을 그럴듯하게 만든다. 그러나 Newman의 전망을 필연적으로 만들지는 않는다. 이 비율은 최적화, 모델 행동, 애플리케이션 설계, OpenRouter 외부 트래픽에도 좌우될 것이다.

캐시된 프롬프트가 토큰 폭증의 대부분을 설명한다

에이전트 우위의 가장 큰 부분은 완전히 새로운 추론이나 출력이 아니라 반복된 컨텍스트로 보인다.

a16z 발표 자료에서 에이전트 토큰의 85% 이상은 캐시된 프롬프트에서 나왔다고 전해진다. 캐시된 프롬프트는 이후 요청이 일치하는 내용으로 시작할 때 제공업체가 재사용할 수 있는, 이전에 처리된 입력 세그먼트다.

에이전트는 안정적인 자료를 반복 전송하는 경우가 많다. 여기에는 시스템 지시문, 도구 설명, 프로젝트 파일, 정책, 이전 대화 이력이 포함될 수 있다.

매 호출마다 동일한 접두사를 처음부터 처리하면 계산이 낭비된다. 프롬프트 캐싱을 사용하면 제공업체는 해당 접두사와 연관된 중간 결과를 재사용할 수 있다.

OpenRouter의 캐시 텔레메트리는 캐시된 토큰과 새로 처리된 프롬프트 토큰을 구분한다. 또한 향후 재사용을 위해 캐시에 기록된 토큰도 식별할 수 있다.

이는 7조 3,000억 토큰을 7조 3,000억 단위의 새로운 모델 작업으로 해석해서는 안 된다는 뜻이다. 상당 부분은 시스템이 이전에 이미 접한 정보를 나타낸다.

이 구분은 비용에 영향을 미친다. 제공업체는 일반적으로 캐시 읽기에 대해 새 입력을 처리하는 것보다 낮은 비용을 청구한다. 초기 계산의 상당 부분이 이미 수행됐기 때문이다.

하지만 캐시되었다고 해서 공짜는 아니다. 시스템은 캐시 항목을 식별하고, 그 데이터를 가져오며, 추론 중 관련 모델 상태를 사용할 수 있게 해야 한다.

이 관련 모델 상태는 흔히 키-값 캐시, 즉 KV 캐시라고 불린다. 이전 토큰에서 파생된 어텐션 정보를 저장해, 모델이 그보다 앞선 모든 위치를 다시 계산하지 않고도 작업을 이어갈 수 있게 한다.

프롬프트가 길어질수록 KV 캐시도 커진다. 동시에 실행되는 에이전트 세션이 많아질수록 캐시 수도 늘어난다. 장기간 지속되는 워크플로는 상당한 규모로 저장된 컨텍스트에 반복적으로 접근해야 할 수도 있다.

이로 인해 인프라 병목 지점도 달라진다. 컴퓨팅은 여전히 중요하지만, 메모리 용량과 메모리 대역폭, 데이터 이동의 중요성은 갈수록 커진다.

따라서 캐시 비중이 높다고 해서 OpenRouter 데이터가 무의미해지는 것은 아니다. 데이터가 의미하는 바가 달라질 뿐이다.

이 차트는 새로운 추론 수요의 증거로서는 설득력이 약하다. 반면 에이전트 시스템이 다수의 모델 호출에 걸쳐 대규모 이력을 반복적으로 유지한다는 증거로서는 더 강하다.

이는 같은 대형 프로젝트 바인더를 계속 참조하는 상황과 비슷하다. 익숙한 페이지를 다시 읽는 데는 새로운 페이지를 분석하는 것보다 준비가 덜 필요하지만, 바인더 자체는 계속 이용 가능해야 한다.

캐싱은 비효율적인 에이전트 설계를 재정적으로 감당 가능하게 만들 수도 있다. 할인된 캐시 읽기 비용이 일부 비용을 가리기 때문에, 워크플로가 거대한 시스템 프롬프트를 계속 다시 보낼 수 있다.

그러나 그런 설계도 여전히 용량을 소비한다. 지연 시간을 늘리고, 라우팅을 복잡하게 하며, 안정적인 프롬프트 접두사에 대한 의존성을 만들 수 있다.

캐시 적중은 모든 구성에서 보장되지 않는다. 프롬프트의 앞부분을 변경하면 뒤쪽의 캐시된 자료가 무효화될 수 있다. 요청을 제공업체 간에 라우팅하는 방식도 재사용에 영향을 줄 수 있다.

동적 데이터는 또 다른 과제를 제시한다. 타임스탬프, 검색된 문서, 도구 결과 또는 사용자별 세부 정보가 시작 부분 근처에 나타나면 접두사의 안정성이 낮아질 수 있다.

따라서 에이전트 개발자는 의도적으로 컨텍스트를 구성해야 한다. 안정적인 지침은 앞부분에 배치하고, 변경되는 정보는 제공업체의 동작 방식이 허용하는 경우 재사용 가능한 섹션 뒤에 배치해야 한다.

세션 친화성도 중요할 수 있다. 호환 가능한 제공업체와 계속 연결된 요청은 예측 불가능하게 라우팅되는 요청보다 이전 컨텍스트를 재사용할 가능성이 높다.

85%라는 수치 역시 신중한 출처 표기가 필요하다. 원문 보고서에 따르면 이 수치는 OpenRouter 데이터를 a16z가 제시하는 과정에서 등장했다. OpenRouter의 원래 분석은 다른 계산 방식에서는 더 낮은 비중을 보였다고도 전해진다.

분모가 다르면 비율도 달라질 수 있다. 한 방법은 전체 토큰 볼륨을 합산할 수 있고, 다른 방법은 요청별 캐시 비중을 평균낼 수 있다.

극소수의 대형 워크플로는 일반적인 요청을 대표하지 못하면서도 전체 볼륨을 지배할 수 있다. 반대로 요청당 평균 비율은 가장 큰 워크로드의 영향을 과소평가할 수 있다.

두 측정값은 서로 다른 질문에 답하면서 모두 정확할 수 있다. 공개 차트에는 보고된 모든 캐시 비율을 독립적으로 조정할 만큼 충분한 방법론적 세부 정보가 없다.

따라서 가장 안전한 결론은 방향성에 관한 것이다. 캐시된 컨텍스트는 에이전트 토큰 트래픽의 분명한 다수를 차지하지만, 정확한 비중은 플랫폼이 요청을 집계하는 방식에 따라 달라진다.

이는 “AI가 AI를 사용하고 있다”는 표현에도 이의를 제기한다. 에이전트가 반드시 수조 건의 독립적인 추론 행위를 수행하는 것은 아니다. 트래픽의 상당 부분은 위임된 작업을 이어 가기 위해 필요한 컨텍스트를 복원하는 과정에 관련된다.

그런 동작도 실제 가치를 만들 수 있다. 코딩 에이전트는 매 도구 호출 후 처음부터 다시 시작하지 않으려면 리포지토리 상태와 이전 결정을 알아야 한다.

효율성의 핵심 질문은 선택에 있다. 에이전트가 최소한의 유용한 컨텍스트를 다시 불러오는가, 아니면 구현이 더 쉽다는 이유로 모든 것을 반복 전송하는가?

토큰 볼륨이 증가할수록 이 차이는 실질적인 엔지니어링 선택이 된다. 효율적인 컨텍스트 관리는 작업 성능을 약화시키지 않으면서 메모리 수요를 줄일 수 있다.

토큰이 다섯 배라고 해서 ROI도 다섯 배는 아니다

토큰 볼륨은 활용도를 측정하지만, 투자수익률은 성공적인 결과와 총운영비에 따라 결정된다.

Newman은 기업들이 AI 수익을 평가할 때 인간의 도입에 지나치게 집중한다고 주장했다. 채팅 기반 도입 지표가 보여 주는 것보다 한 명의 사용자가 훨씬 많은 추론을 시작할 수 있다는 점에서, 그의 더 넓은 문제 제기는 타당하다.

월간 활성 사용자 수는 인프라 수요를 과소평가할 수 있다. 좌석 수 역시 직원이 자리를 떠난 뒤에도 계속 실행되는 자동화 작업을 놓칠 수 있다.

하지만 사용자 수를 토큰 수로 대체하는 것 역시 불완전한 측정 방식이다. 토큰은 활동을 보여 주지만, 그 활동이 수익을 창출했는지, 노동을 줄였는지, 품질을 개선했는지, 또는 위험을 키웠는지는 알려 주지 않는다.

다섯 배 비율은 또한 두 경제 주체가 아니라 두 트래픽 범주를 비교한다. 에이전트 요청은 여전히 인간이나 조직의 의사결정에 뒤따른다.

기업은 에이전트가 더 많은 토큰을 소비한다고 해서 수익을 얻는 것이 아니다. 에이전트가 수용 가능한 비용과 위험 수준에서 가치 있는 작업을 완료할 때 수익을 얻는다.

유용한 평가는 작업 성공에서 시작된다. 팀은 워크플로가 의도한 작업을 완료했는지, 그리고 사람이 그 결과를 받아들였는지 물어야 한다.

다음 질문은 개입에 관한 것이다. 감독 없이 작업을 마치는 에이전트는 반복적인 수정이 필요한 에이전트와 다른 운영 특성을 보인다.

지연 시간도 중요하다. 결국 성공하는 워크플로라도 고객이 너무 오래 기다려야 하거나 피크 부하에서 인프라 대기열이 늘어난다면 사업적으로는 실패할 수 있다.

그다음은 총비용이다. 토큰 요금은 한 요소일 뿐이다. 도구 호출, 검색 서비스, 데이터베이스, 샌드박스, 관측성, 보안 검토, 사람의 사후 조치는 상당한 비용을 더할 수 있다.

위험 조정 결과도 중요하다. 프로덕션 시스템을 수정하는 에이전트는 공개 문서를 요약하는 에이전트보다 더 강력한 통제가 필요하다.

OpenRouter 차트는 이 질문들 어느 것에도 답할 수 없다. 이 차트는 기업 수익이 아니라 트래픽을 설명하기 위해 설계됐다.

같은 한계는 Newman의 10배 예측에도 적용된다. 이 비율을 외삽하려면 에이전트 트래픽이 그에 상응하는 효율성 개선 없이 인간 트래픽보다 계속 빠르게 증가한다고 가정해야 한다.

그 가정은 여러 이유로 성립하지 않을 수 있다. 애플리케이션은 컨텍스트를 압축하고, 일상적인 단계에는 더 작은 모델을 사용하며, 반복 추론을 결정론적 소프트웨어로 대체하고, 루프를 더 일찍 중단할 수 있다.

모델 개선은 재시도를 줄일 수 있다. 더 나은 도구 인터페이스 역시 더 정제된 정보를 반환해, 작업 완료에 필요한 호출 횟수를 낮출 수 있다.

경제적 압력은 이러한 변화를 촉진할 것이다. 캐시 읽기가 상대적으로 저렴하더라도, 기업에는 결과를 개선하지 않는 호출을 제거할 유인이 있다.

루프 수렴에 관한 a16z의 논의는 같은 문제를 부각한다. 에이전트는 이용 가능한 가치 대부분이 이미 나타난 뒤에도 추가 작업을 계속 생성할 수 있다.

외부 완료 테스트가 없는 루프는 지속적인 활동을 진전으로 혼동할 수 있다. 문서를 반복 편집하거나, 실패한 명령을 다시 실행하거나, 이미 수용 가능한 답변을 계속 다듬을 수 있다.

이러한 동작은 개별 호출이 각각 합리적으로 보일 때 특히 발견하기 어렵다. 낭비는 하나의 응답 안이 아니라 전체 궤적을 따라 나타난다.

따라서 관측성은 작업 수준에서 작동해야 한다. 개발자에게는 각 모델 호출을 도구 사용, 상태 변화, 오류 및 최종 결과와 연결하는 추적 정보가 필요하다.

예산도 작업 가치를 반영해야 한다. 고위험 조사는 일상적인 서식 지정 요청보다 더 많은 반복을 정당화할 수 있다.

에스컬레이션 규칙은 또 다른 경계를 만든다. 에이전트가 반복적인 실패나 불확실한 권한에 부딪히면, 사람에게 제어권을 넘기는 편이 더 저렴하고 안전할 수 있다.

OpenRouter의 트래픽에는 선택 효과도 있다. 이 플랫폼은 의도적으로 모델 게이트웨이를 사용하는 개발자에게 서비스를 제공하므로, 소비자 애플리케이션보다 더 기술적인 워크로드 구성을 보일 수 있다.

따라서 프로그래밍과 에이전트 프레임워크는 전체 AI 시장에서보다 OpenRouter에서 더 큰 비중을 차지할 수 있다.

그럼에도 OpenRouter의 규모는 이 추세를 중요하게 만든다. 데이터는 여러 모델과 제공업체에 걸친 상당한 규모의 실제 트래픽을 포괄한다. 다만 결과는 그 범위 안에서 해석되어야 한다.

플랫폼의 관계는 또 다른 고려 사항을 낳는다. Andreessen Horowitz는 OpenRouter에 투자했으며, 이 때문에 a16z는 토큰 라우팅 인프라의 성장에 이해관계를 가진다.

그렇다고 수치가 무효화되는 것은 아니다. 특히 데이터가 AI 경제에 관한 광범위한 주장을 뒷받침할 때, 투명한 방법론과 독립적 재현이 더 중요해진다는 뜻이다.

가장 강력한 해석은 양극단을 모두 피한다. 이 차트는 자율 기계가 AI의 주요 고객이 됐다는 증거도 아니며, 캐싱으로 인한 공허한 산물도 아니다.

이는 에이전트 아키텍처가 추론 수요를 증폭한다는 증거다. 또한 이 증폭이 현재는 오래된 컨텍스트를 전송하고 불러오는 데 크게 의존한다는 점을 보여 준다.

구매자에게 핵심 질문은 에이전트가 많은 토큰을 사용하는지가 아니다. 추가 라운드마다 성공적이고 가치 있는 결과가 나올 확률을 높이는지다.

메모리 제공업체와 에이전트 플랫폼은 즉각적인 압박에 직면한다

트래픽 변화는 컨텍스트를 효율적으로 관리하는 시스템에는 보상을 주고, 토큰 소비를 진전의 대리 지표로 취급하는 제품에는 압박을 가한다.

모델 제공업체는 일반적인 요청-응답형 채팅보다 더 복잡한 워크로드에 직면한다. 에이전트 세션은 더 오래 활성 상태를 유지하고, 도구를 반복 호출하며, 계속 늘어나는 이력을 유지할 수 있다.

이 워크로드는 스케줄러와 라우팅 시스템에 압박을 가한다. 제공업체는 변동하는 수요 속에서 캐시 지역성, 모델 가용성, 지연 시간 및 안정성의 균형을 맞춰야 한다.

OpenRouter와 같은 게이트웨이 플랫폼은 애플리케이션이 여러 모델을 점점 더 많이 사용함에 따라 전략적 중요성을 얻는다. 하나의 워크플로는 계획, 코딩, 검증, 요약을 서로 다른 엔드포인트로 라우팅할 수 있다.

동적 라우팅은 비용을 줄이거나 성능을 개선할 수 있지만, 캐싱을 방해할 수도 있다. 다른 제공업체로 전송된 요청은 이전에 구축된 캐시에 접근하지 못할 수 있다.

명확한 캐시 지표를 제공하는 업체는 고도화된 구매자에게 우위를 가질 것이다. 팀은 새 토큰, 캐시된 토큰, 생성된 토큰, 저장소에 기록된 토큰이 각각 얼마나 되는지 알아야 한다.

메모리 제조업체 역시 더 큰 컨텍스트와 더 많은 동시 세션으로 인한 수요에 직면한다. 고대역폭 메모리는 모델 가속기에 데이터를 공급하며, 일반 메모리와 스토리지는 주변 시스템을 지원한다.

그러나 이 차트는 미래 메모리 구매량을 정량화하지 않는다. 토큰 트래픽을 보여 줄 뿐, 각 토큰과 신규 하드웨어 용량 사이의 정확한 대응 관계를 보여 주지는 않는다.

하드웨어 수요는 모델 아키텍처, 데이터 유형, 배치 처리, 캐시 축출, 압축, 동시 세션 수에 따라 달라진다. 소프트웨어 개선은 이러한 관계 각각을 바꿀 수 있다.

에이전트 플랫폼은 다른 방향의 압박에 직면한다. 고객은 단순히 유능한 모델에 접근할 수 있는지보다 토큰당 유용한 작업량을 점점 더 비교하게 될 것이다.

광범위한 사용량 주장 뒤에 소비량을 숨기는 제품은 기업 재무팀이 작업 수준의 경제성을 요구할 때 어려움을 겪을 수 있다. 구매자는 자신의 워크로드 전반에서 재현 가능한 증거를 원할 것이다.

코딩 에이전트는 빌드, 테스트, 검토 및 배포 결과로 산출물을 평가할 수 있기 때문에 초기 시험대가 된다. 이러한 신호는 측정 가능한 중단 조건을 만든다.

다른 분야는 여전히 더 어렵다. 연구, 전략, 글쓰기는 종종 단일한 객관적 테스트가 없다. 에이전트는 명확한 완료 시점 없이 산출물을 계속 다듬을 수 있다.

이 불확실성은 에이전트가 대부분의 중간 작업을 수행하더라도 사람의 검토를 더 중요하게 만든다. 또한 공급업체 간 토큰 효율성을 비교하기 어렵게 만든다.

인프라 공급업체는 컨텍스트 압축, 접두사 캐싱, 상태 유지 세션 및 검색 시스템으로 대응할 수 있다. 각 접근 방식은 불필요한 이력 재전송을 피하려는 시도다.

애플리케이션 개발자는 지속 메모리와 작업 컨텍스트를 분리할 수 있습니다. 지속 메모리는 잠재적으로 유용한 정보를 저장하고, 작업 컨텍스트에는 현재 단계에 필요한 내용만 담깁니다.

이러한 분리는 반복되는 텍스트를 줄이고 관련 없는 정보를 제한합니다. 또한 활성 프롬프트에서 방해 요소를 제외함으로써 모델 정확도를 높일 수 있습니다.

결정론적 작업은 결정론적 소프트웨어가 처리해야 합니다. 신뢰할 수 있는 코드가 직접 수행할 수 있는 계산, 스키마 검증 또는 접근 권한 확인을 에이전트가 추론할 필요는 없습니다.

가장 효율적인 시스템은 아마도 모델과 기존 소프트웨어를 결합할 것입니다. 모델은 모호성과 계획 수립을 처리하고, 코드는 규칙을 강제하며 안정적인 작업을 수행합니다.

이러한 하이브리드 설계는 에이전트 트래픽이 끝없이 증가해야 한다는 가정을 약화시킵니다. 더 나은 시스템은 작업당 토큰을 줄이면서도 더 많은 작업을 완료할 수 있습니다.

동시에 단위 비용 하락은 전체 수요를 늘릴 수 있습니다. 각 워크플로의 비용이 낮아지면 개발자는 더 많은 곳에 에이전트를 배포하고 더 자주 실행할 수 있습니다.

그에 따른 반등 효과는 개별 작업의 효율성이 높아지더라도 인프라 성장을 유지할 수 있습니다. 이 가능성은 Newman의 전망 방향을 뒷받침하지만, 그 정확한 비율까지 뒷받침하지는 않습니다.

인간 트래픽도 증가할 수 있습니다. 더 나은 소비자 제품, 새로운 인터페이스, 더 폭넓은 기업 도입은 에이전트 트래픽과 함께 직접 사용량을 늘릴 수 있습니다.

향후 비율은 어느 곡선이 더 빠르게 성장하느냐에 달려 있습니다. 이는 에이전트 성능 향상만으로 결정되는 문제가 아닙니다.

OpenAI, Anthropic, Google, 오픈 웨이트 모델 개발자, 전문 추론 제공업체 간의 경쟁이 그 곡선을 형성할 것입니다. 이들의 캐싱 규칙과 도구 기능은 서로 다릅니다.

워크플로 중에 모델 선택도 달라질 수 있습니다. 작은 모델이 요청을 분류하고, 더 큰 모델이 어려운 의사결정을 처리할 수 있습니다.

이러한 아키텍처에서는 단일 집계 토큰 수의 중요성이 줄어듭니다. 경량 모델이 처리하는 토큰은 프런티어 모델이 처리하는 토큰과 다른 리소스 프로필을 가집니다.

기업에는 모델 선택, 토큰 유형, 지연 시간, 에너지, 작업 성공을 결합한 정규화된 측정 기준이 필요합니다. 현재 전체 그림을 포착하는 널리 합의된 표준은 없습니다.

그러한 표준이 마련되기 전까지 OpenRouter 에이전트 토큰 사용량은 여전히 유용한 선행 지표입니다. 이는 재무 보고가 그 가치를 설명하기 전에 수요의 형태를 보여줍니다.

세 가지 신호가 10배 예측을 검증할 것이다

다음 단계는 분류 안정성, 신규 토큰 증가, 추론 단위당 완료 작업으로 평가해야 합니다.

첫 번째 신호는 OpenRouter의 에이전트 대 인간 비율이 8월 이후에도 계속 상승하는지 여부입니다. 지속적인 증가는 자율 워크플로가 직접 상호작용보다 더 빠르게 확장되고 있다는 주장을 뒷받침할 것입니다.

비교에는 동일한 분류 방식과 측정 기간을 사용해야 합니다. 방법 변경은 행동의 동등한 변화 없이도 성장처럼 보이는 결과를 만들 수 있습니다.

혼합 트래픽은 특별한 주의가 필요합니다. 이것이 두 범주보다 더 빠르게 증가한다면, 인간 사용과 에이전트 사용의 경계는 더욱 신뢰하기 어려워질 것입니다.

두 번째 신호는 에이전트 토큰의 구성입니다. 캐시 비중이 높아진다면 신규 모델 처리보다 컨텍스트 반복이 여전히 주요 성장 동력이라는 뜻입니다.

총량 증가와 함께 캐시 비중이 낮아진다면 이야기는 달라집니다. 이는 에이전트가 기존 컨텍스트를 주로 재생하는 것이 아니라 더 많은 새로운 추론을 수행하고 있음을 시사합니다.

공개 보고는 신규 입력, 캐시 읽기, 캐시 쓰기, 추론 토큰, 출력을 구분해야 합니다. 이를 하나의 숫자로 합치면 비용과 인프라 수요의 주요 차이가 가려집니다.

세 번째 신호는 작업 효율성입니다. 에이전트 공급업체와 기업 사용자는 모델 호출당 완료 작업, 성공한 작업당 토큰, 완료당 인간 개입 횟수를 보고해야 합니다.

총 에이전트 트래픽이 증가하는 가운데 이러한 지표가 개선된다면 성장 논거는 더 강해집니다. 이는 도입과 성공적인 자동화가 함께 확대되고 있음을 보여줄 것입니다.

성공률이 제자리인데 토큰 사용량만 늘어난다면, 이 차트는 점점 더 운영상 낭비를 설명하게 될 것입니다. 그 경우 더 높은 비율은 ROI 주장을 강화하기보다 약화시킬 것입니다.

독립적인 데이터세트도 신뢰도를 높일 수 있습니다. 직접 모델 API, 클라우드 플랫폼, 프라이빗 배포에서 나온 트래픽은 OpenRouter가 더 넓은 시장을 반영하는지 보여줄 수 있습니다.

현재로서는 증거가 바이럴 주장의 범위보다 더 좁은 결론을 뒷받침합니다. 에이전트는 2026년 8월 OpenRouter에서 관측된 인간 토큰 트래픽의 5배가 넘는 트래픽을 생성했습니다.

그 트래픽의 대부분은 캐시된 컨텍스트와 관련된 것으로 보입니다. 해당 컨텍스트에도 메모리, 라우팅, 세심한 관리가 필요하지만, 동일한 양의 새로운 추론과 혼동해서는 안 됩니다.

10배로의 이동은 확정된 결과가 아니라 전망입니다. 그 중요성은 추가 토큰이 무엇을 달성하는지에 달려 있습니다.

개발자는 각 루프에 명확한 목적, 예산, 종료 조건이 있는지 살펴봐야 합니다. 기업 구매자는 소비량을 도입으로 간주하기 전에 작업 수준의 증거를 요구해야 합니다.

이제 유용한 질문은 에이전트가 사람보다 더 많은 트래픽을 생성할지 여부가 아닙니다. OpenRouter 데이터는 이미 그렇다고 시사합니다. 다음 1조 개의 토큰이 더 많은 작업을 완료할지, 아니면 과거의 내용을 더 많이 다시 읽을지가 핵심 질문입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page