top of page

OpenAI의 Codex Agents가 이제 내부 AI 토큰 사용량을 지배한다

8월 13일
11분 분량

OpenAI는 Codex가 현재 자사의 내부 주간 출력 토큰 중 99.8%를 생성한다고 밝혔다. 이는 엔터프라이즈 AI 지출을 다룬 최근 Google News 기사에서 부각된 반전이다.

이 수치는 지출, 매출 또는 생산성을 보여주지 않는다. 이는 해당 기술을 판매하는 회사 내부에서 모델이 생성한 텍스트 조각인 출력 토큰을 측정한 것이다. 그럼에도 이는 OpenAI 직원들이 AI를 사용하는 방식에 중대한 변화가 일어났음을 포착한다.

한때는 ChatGPT가 대부분의 내부 AI 업무를 처리했다. 이제 더 긴 작업을 실행하고 도구를 사용할 수 있는 에이전트인 Codex가 엔지니어링, 법무, 재무, 채용 전반의 활동을 지배하고 있다.

중요한 경쟁 구도는 더 이상 OpenAI와 다른 모델 제공업체 간의 대결이 아니다. 채팅 기반 지원과 위임된 에이전트 작업 간의 대결이다. 챗봇은 요청에 답하지만, 에이전트는 파일을 검사하고, 도구를 호출하며, 접근 방식을 수정하고, 수 분 또는 수 시간 동안 작업할 수 있다.

OpenAI는 이 전환을 생산적인 업무가 에이전트로 이동하고 있다는 증거로 제시한다. 동시에 이 전환은 AI 사용량을 예측하고, 귀속하며, 보호하고, 평가하기 더 어렵게 만든다.

따라서 엔터프라이즈 구매자는 Google News 헤드라인이 시사하는 것보다 더 날카로운 질문에 직면한다. 증가하는 토큰 사용이 가치 있는 위임 업무를 의미하는지, 아니면 상응하는 성과 없이 활동만 만들어내는 값비싼 반복인지 판단해야 한다.

OpenAI의 토큰 전환이 실제로 보여주는 것

OpenAI의 내부 데이터는 결정적인 행동 변화를 보여주지만, 모든 엔터프라이즈가 같은 결과를 얻을 수 있음을 입증하지는 않는다.

OpenAI는 2026년 8월 12일 분석을 공개했다. 회사는 개인 고객, 조직 사용자 및 자사 직원 사이의 Codex 활동을 조사했다.

2025년 8월까지 평균적인 OpenAI 직원은 토큰의 10% 미만을 Codex에 할당했다. 이 기간 동안 ChatGPT는 내부 AI 사용의 기본 인터페이스로 남아 있었다.

Codex가 더 긴 실행 기능, 더 나은 모델, 병렬 작업 지원을 갖추면서 균형이 바뀌었다. OpenAI는 이제 평균적인 직원이 출력 토큰의 85% 이상을 Codex를 통해 생성한다고 말한다.

OpenAI의 agent adoption data에 따르면, Codex는 회사 전체의 주간 출력 토큰 중 99.8%를 차지한다. 이 두 수치 사이의 차이는 중요하다.

첫 번째 수치는 평균 직원의 Codex 및 ChatGPT 활동 구성 비율을 설명한다. 두 번째 수치는 생성된 토큰의 전체 풀을 반영하며, 집중적으로 에이전트를 사용하는 사용자들의 영향이 크게 작용한다.

에이전트는 일반적인 채팅보다 자연스럽게 더 많은 토큰을 생성한다. 반복적으로 컨텍스트를 읽고, 행동을 계획하며, 결과를 검사하고, 도구를 호출하고, 작업을 수정하기 때문이다.

한 명의 직원도 여러 에이전트를 동시에 실행할 수 있다. 따라서 출력 토큰 비중은 근로자 수나 완료된 업무의 직접적인 집계가 아니라 계산 활동의 척도다.

OpenAI의 가장 활발한 내부 사용자는 그 차이를 보여준다. 2026년 6월까지 99백분위수에 속한 직원들은 하루에 60시간이 넘는 Codex 에이전트 턴을 정기적으로 생성했다.

이 수치는 한 사람이 60시간 동안 일했다는 뜻이 아니다. 인간 운영자가 업무를 지시하거나 검토하는 동안 여러 에이전트가 병렬로 작동했음을 반영한다.

표본으로 조사된 개인 사용자들 사이에서는 더 긴 작업도 일반화됐다. 2026년 5월까지 80.6%는 OpenAI가 인간의 작업 시간 30분 이상에 해당한다고 추정한 Codex 요청을 최소 한 번 제출했다.

추가로 70.2%는 한 시간 이상으로 추정된 요청을 제출했다. 또 다른 25.6%는 여덟 시간 이상으로 추정된 요청을 최소 한 번 제출했다.

이 추정치는 에이전트의 실행 시간이나 제거된 노동량이 아니라 작업과 연관된 인간의 노력에 관한 것이다. OpenAI의 분류 방식 역시 생성된 모든 결과가 채택됐거나 유용했음을 증명할 수는 없다.

이러한 한계에도 방향은 분명하다. 사용자는 개별 답변을 요청하는 대신 더 큰 업무 단위를 AI에 맡기고 있다.

채팅 상호작용은 요약, 초안 또는 코드 조각을 만들어낼 수 있다. 에이전트는 저장소를 검토하고, 여러 파일을 수정하며, 테스트를 실행하고, 실패를 해석하고, 수정을 시도할 수 있다.

이 차이는 엔터프라이즈 AI 활동이 직원 수나 메시지 양보다 훨씬 빠르게 증가할 수 있는 이유를 설명한다. 위임된 각 업무에는 하나의 사용자 요청 뒤에 숨겨진 여러 모델 상호작용이 포함된다.

이것이 이 사건의 핵심적인 반전이다. 눈에 보이는 프롬프트가 업무에서 차지하는 비중은 줄어들고, 자율 실행이 계산의 더 큰 몫을 소비하고 있다.

조직에 있어 이는 AI 도입의 의미를 바꾼다. 라이선스와 메시지 수를 세는 것만으로는 모델이 운영 업무에 얼마나 깊이 참여하는지 더 이상 설명할 수 없다.

위험 경계도 바뀐다. 챗봇은 대체로 답변을 제안하지만, 에이전트는 연결된 시스템 전반에서 행동을 수행할 수 있다.

이처럼 더 넓어진 권한은 권한 설계, 감사 기록, 검토 게이트 및 비용 통제를 배포의 일부로 만든다. 이는 더 이상 부차적인 관리 세부 사항이 아니다.

Google News 신호가 챗봇 너머를 가리키는 이유

Google News 기사가 중요한 이유는 OpenAI의 데이터가 증가하는 토큰 수요를 소프트웨어 엔지니어링을 넘어 확산되는 에이전트와 연결하기 때문이다.

Codex는 처음에는 코딩과 연관된 제품으로 출발했다. 엔지니어들은 OpenAI 사용량의 대부분을 ChatGPT에서 에이전트로 옮긴 최초의 직원들이었다.

평균적인 OpenAI 엔지니어는 2025년 12월까지 그 임계점을 넘었다. OpenAI는 이제 평균 엔지니어가 ChatGPT가 아닌 Codex를 통해 출력 토큰의 99%를 생성한다고 말한다.

더 드러나는 전환은 다른 곳에서 일어났다. 엔지니어들이 이미 패턴을 확립한 뒤인 2026년 4월경 법무, 재무 및 채용 부문이 Codex 다수 사용으로 이동했다.

OpenAI는 현재 평균적인 변호사 또는 채용 담당자가 출력 토큰의 85% 이상을 Codex를 통해 생성한다고 보고한다. 그렇다고 이 직원들이 하루 대부분을 프로그래밍에 쓴다는 뜻은 아니다.

대신 Codex는 범용 실행 환경이 됐다. 비기술 사용자는 이를 자동화, 구조화된 분석, 데이터 변환, 디버깅 및 내부 도구 제작에 활용한다.

OpenAI의 직무별 분석은 이러한 해석을 뒷받침한다. 비즈니스 기능 부서 직원들이 생성한 Codex 작업의 4분의 1 이상이 엔지니어링 또는 코딩 범주에 속했다.

재무 및 비즈니스 운영 부문에서는 엔지니어링 또는 코딩이 분류된 Codex 출력의 31%를 차지했다. 지식 업무는 34%, 재무 분석은 16%를 차지했다.

제품, 마케팅 및 운영 직원의 경우 지식 업무가 분류된 출력의 51%를 차지했다. 엔지니어링 또는 코딩은 추가로 25%를 차지했다.

이 범주는 에이전트가 기술 작업을 요청하는 것과 직접 시도하는 것 사이의 실질적 장벽을 낮추고 있음을 시사한다. 전문 인력이 더 이상 필요하지 않다는 것을 보여주지는 않는다.

채용 담당자는 여러 소스의 데이터를 내부 워크플로로 변환하도록 에이전트에 요청할 수 있다. 재무 담당자는 파일을 대조하고, 반복 가능한 분석을 구축하거나, 작은 도구를 테스트하도록 할 수 있다.

직원은 컨텍스트, 판단, 권한 부여 및 검토에 대한 책임을 계속 진다. 그러나 기존의 소프트웨어 프로젝트를 요구하지 않으면서도 실행 경로에는 코드가 포함될 수 있다.

OpenAI가 조사한 세 집단 모두에서 비개발자 도입은 빠르게 증가했다. 2025년 8월부터 2026년 6월 초까지 개인 사용자 중 주간 비개발자 사용자는 137배 증가했다.

OpenAI는 조직 사용자 사이에서 189배 증가했으며, 자사 직원 내에서는 12배 증가했다고 보고했다. 이 배수는 서로 다른 기준선에서 출발했으므로 동일한 도입 수준으로 비교해서는 안 된다.

그럼에도 같은 방향의 결론을 뒷받침한다. 에이전트 사용은 Codex를 처음 도입한 기술 중심 사용자층을 넘어 확산되고 있다.

이 패턴은 OpenAI의 더 광범위한 엔터프라이즈 보고와도 부합한다. enterprise usage study에 따르면 ChatGPT 메시지 양은 8배 증가한 반면, API 조직당 추론 토큰 소비는 전년 대비 약 320배 증가했다.

이전 연구는 Codex만을 다룬 것이 아니었다. OpenAI의 엔터프라이즈 제품에서 집계된 사용량과 약 100개 조직에 걸친 9,000명의 근로자 설문조사가 포함됐다.

OpenAI는 또한 100만 명 이상의 비즈니스 고객과 700만 개 이상의 업무용 좌석을 보고했다. 거의 200개 조직은 각각 1조 개 이상의 토큰을 처리했다.

이 수치들은 함께 두 개의 도입 곡선을 보여준다. 사람을 향한 메시지 양은 증가하고 있지만, 통합된 다단계 워크플로 내부의 계산량은 훨씬 더 빠르게 증가하고 있다.

이 때문에 채팅은 엔터프라이즈 AI를 측정하는 불완전한 단위가 되고 있다. 하나의 메시지가 추론, 검색, 도구 사용, 검증 및 수정으로 이어지는 긴 순서를 시작할 수 있다.

이 변화는 여러 집단에 동시에 압박을 가한다. 재무팀은 가변적인 소비량을 예측해야 한다. 보안팀은 시스템 접근을 관리해야 한다. 관리자는 어떤 업무가 지속적인 용량 투입에 가치가 있는지 결정해야 한다.

직원들도 새로운 형태의 운영 책임에 직면한다. 많은 에이전트를 실행하는 것은 생산적으로 보일 수 있지만, 병렬 활동은 완료되고 승인된 업무와 같지 않다.

조직은 에이전트 실행 중 무슨 일이 일어났는지에 대한 공통의 증거를 필요로 한다. 검색 가능한 AI knowledge base는 관련 컨텍스트를 보존할 수 있지만, 권한 관리나 공식적인 평가를 대체할 수는 없다.

기회는 실재한다. 에이전트는 근로자가 기술적 경계를 넘고, 이전에는 다른 팀의 대기열에서 지연되던 작업을 완료하도록 도울 수 있다.

관리 과제 역시 실재한다. 엔터프라이즈는 이러한 자율성이 반복 가능한 가치를 만들어내는 곳과 단지 모델 호출만 늘리는 곳을 식별해야 한다.

채팅 지원과 에이전트 실행은 서로 다른 경제성을 따른다

에이전트는 엔터프라이즈 AI를 주로 사용자 속도에 맞춰 제공되는 서비스에서 실행 행동에 따라 소비량이 달라지는 가변적 워크로드로 바꾼다.

전통적인 채팅에는 활동량에 자연스러운 한계가 있다. 사람이 질문을 하고, 답변을 기다리고, 이를 평가한 뒤 계속할지 결정한다.

에이전트 실행은 이러한 중단 일부를 없앤다. 시스템은 다음 행동을 선택하고, 이전 결과를 다시 컨텍스트에 가져오며, 중단 조건에 도달할 때까지 계속할 수 있다.

에이전트가 지시문, 파일, 도구 응답 및 누적된 기록을 다시 읽을 때마다 각 주기는 입력 토큰을 추가할 수 있다. 출력 토큰은 전체 워크로드의 일부만 포착한다.

긴 작업은 또한 분기를 마주한다. 에이전트는 한 구현을 시도하고, 오류를 검사하고, 계획을 수정한 뒤, 또 다른 테스트를 실행할 수 있다.

실제 업무는 좀처럼 완벽한 첫 계획을 따르지 않기 때문에 이러한 재시도는 생산적일 수 있다. 그러나 에이전트가 완료에 필요한 정보, 권한 또는 역량을 갖추지 못했다면 낭비가 될 수도 있다.

이 때문에 가장 저렴한 모델만으로는 비용 통제에 대한 완전한 답이 될 수 없다. 역량이 낮은 모델은 호출당 더 적은 자원을 사용할 수 있지만, 더 많은 시도와 더 많은 인간의 수정을 요구할 수 있다.

OpenAI는 AI investment guidance에서 이 주장을 제시한다. 완료된 작업, 절감된 시간, 개선된 의사결정 및 확장 준비가 된 워크플로를 측정할 것을 권고한다.

회사는 GPT-4와 GPT-5.4 사이에 100만 토큰당 가격이 97% 하락했다고 말한다. 또한 GPT-5.6이 코딩 에이전트 지수에서 출력 토큰을 54% 적게 사용하고 작업을 57% 더 빠르게 완료했다고 말한다.

이는 각 고객 워크로드에 대한 보장이 아니라 OpenAI가 보고한 벤치마크 결과다. 기업 자체의 컨텍스트, 도구, 평가 기준 및 실패 비용은 결과를 바꿀 수 있다.

단위 비용 하락이 반드시 총지출 감소로 이어지는 것은 아니다. 특히 에이전트가 더 오래 실행되고 동시에 작동할 때는 사용량이 효율성 개선보다 더 빠르게 늘어날 수 있다.

이러한 역학은 기존 소프트웨어 라이선스보다 클라우드 컴퓨팅에 더 가깝다. 수요는 런타임 동작, 워크로드 설계, 모델 선택, 컨텍스트 크기, 반복 실행에 따라 달라진다.

이는 측정 문제도 야기한다. 높은 토큰 수는 가치 있는 자동화, 어려운 과제, 불필요한 컨텍스트, 반복된 실패 또는 효율적으로 종료되지 않는 에이전트를 의미할 수 있다.

독립 연구는 구매자가 사용량을 신중하게 다뤄야 할 근거를 제공한다. 2026년 코딩 과제를 검토한 한 논문은 에이전트형 워크로드가 코드 채팅이나 코드 추론보다 훨씬 많은 토큰을 사용한다는 사실을 발견했다.

연구진은 실험 환경에서 사용량 차이가 최대 1,000배에 이르렀다고 보고했다. 동일 과제의 실행 결과도 최대 30배까지 차이가 났다.

토큰 사용량이 많다고 해서 정확도가 일관되게 높아지지는 않았다. 성능은 종종 중간 수준에서 정점을 찍은 뒤 사용량이 증가해도 평탄해졌다.

이 연구는 모델이 자체 토큰 요구량을 예측하는 데 어려움을 겪는다는 점도 확인했다. 보고된 상관관계는 최대 0.39에 그쳤고, 추정치는 실제 사용량을 체계적으로 낮게 잡았다.

이러한 결과는 특정 코딩 과제와 모델 집합에서 나온 것이다. 이를 모든 엔터프라이즈 에이전트에 적용되는 보편적 배수로 일반화해서는 안 된다.

다만 단순한 프롬프트당 예산이 왜 신뢰하기 어려워지는지는 보여준다. 동일한 요청도 실질적으로 다른 실행 경로와 자원 수요를 낳을 수 있다.

엔터프라이즈의 대응은 이미 나타나고 있다. OpenAI는 2026년 6월 ChatGPT와 Codex 크레딧 사용량을 통합해 볼 수 있는 기능을 Global Admin Console에 추가했다.

관리자는 사용자, 제품, 모델별 사용량을 확인할 수 있다. 또한 회사의 지출 제어 도구를 통해 워크스페이스 기본값, 그룹 한도, 개인별 예외 설정을 지정할 수 있다.

Databricks도 Unity AI Gateway에 유사한 제어 기능을 도입했다. 이 시스템은 한도를 적용하고, 통제 불가능한 사용량을 감지하며, 적합한 작업에 더 저렴한 모델을 추천할 수 있다.

이제 막 형성되는 제어 계층은 시장이 향하는 방향을 보여준다. 모델 접근권만으로는 엔터프라이즈 배포에 충분하지 않게 되고 있다.

조직에는 그 접근권을 둘러싼 귀속 관리, 정책, 평가, 개입이 필요하다. 사용량을 책임 있는 팀 및 정의된 비즈니스 프로세스와 연결해야 한다.

따라서 가장 강력한 측정 단위는 토큰이 아니다. 합의된 품질, 위험, 검토 요건 아래 완료된 결과다.

코딩 에이전트라면 테스트와 보안 검토를 통과한 승인된 변경 사항이 이에 해당할 수 있다. 재무에서는 추적 가능한 입력값을 갖춘 대사 완료 보고서가 될 수 있다.

채용에서는 후보자에 대해 승인되지 않은 결정을 내리지 않으면서 관리 업무를 줄이는 워크플로가 될 수 있다. 각 결과에는 서로 다른 증거가 필요하다.

이 경제 모델은 자주 반복되고 명확하게 평가할 수 있는 워크플로를 선호한다. 성공 여부가 주관적 인상에 좌우되는 모호한 과제에는 불리하게 작용한다.

에이전트 전환이 토큰 측정을 무용하게 만드는 것은 아니다. 토큰 수를 비즈니스 가치의 대리 지표가 아니라 여러 운영 신호 중 하나로 만든다.

토큰 수치가 입증하지 못하는 것

OpenAI의 극적인 내부 도입 수치는 수요와 강도를 보여주지만, 생산성, 품질, 보안 결과는 여전히 미해결로 남는다.

첫 번째 한계는 표본 선택이다. OpenAI는 Codex의 개발사이며, 실험적 AI에 익숙한 인력을 고용하고 있고, 이들에게 이례적으로 직접적인 제품 지원을 제공할 수 있다.

OpenAI의 인력은 은행, 병원, 정부 기관, 제조업체 또는 소규모 기업을 대표하는 표본이 아니다. 이들 조직은 서로 다른 기술적·규제적 제약 아래 운영된다.

OpenAI는 고객이 높은 사용량을 더 깊은 도입의 증거로 해석할 때에도 이익을 얻는다. 해당 데이터는 주목할 가치가 있지만, 독자는 측정된 행동과 회사의 더 광범위한 예측을 구분해야 한다.

두 번째 한계는 성공 지표로서의 토큰에 관한 것이다. 출력량은 모델이 텍스트나 코드를 생성했음을 보여준다. 사용자가 얼마나 많은 결과를 채택했는지는 보여주지 않는다.

에이전트는 개발자가 거부하는 대규모 패치를 만들 수 있다. 직원이 다시 작성해야 하는 분석을 생성하거나, 실제 운영 환경에 도달하지 못하는 자동화를 만들 수도 있다.

OpenAI의 장기 과제 추정치에도 비슷한 주의점이 따른다. 사람의 작업 시간 8시간으로 분류된 과제가 자동으로 8시간을 절약해 주는 것은 아니다.

사용자는 여전히 입력을 준비하고, 실행을 모니터링하며, 출처를 확인하고, 오류를 해결하고, 결과를 통합하는 데 시간을 쓸 수 있다. 일부 작업은 에이전트가 없었다면 애초에 발생하지 않았을 수도 있다.

그렇게 확장된 출력도 여전히 가치 있을 수 있다. 그러나 절감된 노동은 가능한 이점 중 하나일 뿐이며, 직접적인 측정이 필요하다.

세 번째 한계는 신뢰성이다. 더 긴 과제는 실수, 오래된 가정, 잘못된 도구 선택 또는 이후 단계에 영향을 미치는 초기 오류가 발생할 기회를 더 많이 만든다.

엔터프라이즈 시스템에 접근할 수 있는 에이전트는 보안 경계도 더 넓힌다. 잘못된 답변은 해롭지만, 승인되지 않은 행동은 되돌리기가 훨씬 더 어려울 수 있다.

따라서 권한은 에이전트의 최대 역량이 아니라 과제에 맞춰야 한다. 읽기 권한, 쓰기 권한, 외부 커뮤니케이션, 되돌릴 수 없는 작업은 별도의 통제가 필요하다.

보안팀에는 사람의 요청을 각 도구 작업과 연결하는 기록도 필요하다. 이러한 연결고리가 없으면 사고 대응과 책임 추궁이 어려워진다.

비용 모니터링은 또 다른 긴장을 만들 수 있다. 기업은 낭비와 탈취된 자격 증명을 식별할 수 있을 만큼의 가시성이 필요하지만, 상세한 직원 감시는 신뢰를 약화시킬 수 있다.

관리자는 워크플로가 비싼 모델을 반복 호출한다는 사실을 알아야 할 수 있다. 그렇다고 민감한 콘텐츠에 제한 없이 접근할 필요까지 있는 것은 아니다.

좋은 거버넌스는 가능한 경우 운영 메타데이터와 비즈니스 콘텐츠를 분리한다. 또한 각 계층을 누가 어떤 상황에서 검사할 수 있는지도 정의한다.

네 번째 한계는 코딩을 넘어선 일반화와 관련된다. Codex는 비개발자도 지원할 수 있지만, OpenAI의 데이터는 여전히 코딩과 엔지니어링이 주요 범주임을 보여준다.

구조화된 기술 업무는 상대적으로 명확한 검증을 제공한다. 테스트를 실행할 수 있고, 파일을 비교할 수 있으며, 오류가 발생하면 다시 시도할 수 있다.

법률 분석, 채용 지원, 전략, 재무 해석에는 종종 더 주관적인 요건이 포함된다. 자동화된 검증이 약하기 때문에 오류가 더 오래 남아 있을 수 있다.

이 차이는 에이전트가 비즈니스 기능으로 이동할수록 결과 평가를 더욱 중요하게 만든다. 기업은 도입 속도가 곧 준비 상태를 의미한다고 가정해서는 안 된다.

대중의 인식도 이미 그 구분을 향해 이동했다. 7월에 발표된 AI 지출 분석은 높은 사용량을 성취로 여기는 관행인 “tokenmaxxing”에 대한 저항이 커지고 있다고 설명했다.

Moody's의 애널리스트 Vincent Gusdorf는 AI가 조직에 필요하지 않은 일을 쉽게 만들어낼 수 있다고 경고했다. 이 비판은 토큰 기반 지위 신호의 약점을 정면으로 겨냥한다.

에이전트가 가치 있는 결과를 낸다면 높은 사용량은 합리적일 수 있다. 하지만 어떤 책임자도 그 활동을 승인된 결과와 연결할 수 없을 때는 정당화하기가 더 어려워진다.

올바른 회의적 입장은 에이전트가 단지 낭비적인 챗봇이라는 것이 아니다. OpenAI의 도입 데이터는 그렇게 일축하기에는 너무 크다.

더 설득력 있는 결론은 더 좁다. 에이전트는 AI가 시도할 수 있는 업무의 양과 범위를 확장하지만, 실현된 엔터프라이즈 가치에 관한 증거는 여전히 고르지 않다.

따라서 기업은 자사 환경에서 OpenAI의 주장을 검증해야 한다. 이를 위해서는 기준선, 평가 세트, 검토 비용, 실패율, 측정 가능한 결과가 필요하다.

또한 에이전트 워크플로를 현실적인 대안과 비교해야 한다. 그러한 대안에는 인간의 직접 수행, 기존 소프트웨어, 더 짧은 채팅 상호작용, 더 작은 모델이 포함된다.

그래야만 리더들은 증가하는 토큰 사용량이 레버리지인지 마찰인지 판단할 수 있다. OpenAI의 내부 비율만으로는 그 질문에 답할 수 없다.

엔터프라이즈 구매자가 다음으로 주목해야 할 세 가지 신호

다음 단계는 또 다른 기록적 토큰 수가 아니라 결과 보고, 비기술 직군의 지속 사용, 보안 통제에 의해 결정될 것이다.

첫 번째 신호는 공급업체가 에이전트 사용량을 완료된 비즈니스 결과와 연결하는지 여부다. 현재 사용량 대시보드는 크레딧, 사용자, 모델, 추세를 강조한다.

이러한 화면은 관리자가 예상치 못한 수요를 파악하는 데 도움이 된다. 하지만 워크플로가 승인된 결과를 만들었는지까지 보여주지는 못한다.

구매자는 승인된 코드 변경, 해결된 지원 사례, 완료된 분석 또는 기타 도메인별 산출물과 연결된 보고를 찾아야 한다. 승인된 결과당 비용은 비교를 더 의미 있게 만들 것이다.

공급업체가 신뢰할 수 있는 결과 귀속을 제공한다면 OpenAI의 주장은 더 강해진다. 기업은 그에 따른 가치가 보일 때 높은 사용량의 워크플로에 자금을 투입할 수 있다.

보고가 토큰과 추정 시간에 계속 머문다면 회의론은 커질 것이다. 조직은 집약적이지만 생산적인 작업과 집약적이지만 실패한 작업을 구분하기 어려워질 것이다.

두 번째 신호는 엔지니어링 외부에서 Codex 사용이 지속되는지 여부다. OpenAI는 법무, 재무, 채용, 마케팅, 운영 직원 사이에서 눈에 띄는 성장세를 보고한다.

다음 질문은 초기 실험 이후에도 이 사용자들이 계속 사용하는지다. 작은 출발점에서 빠르게 증가하는 것보다 유지율이 더 중요하다.

기업은 어떤 비기술 업무가 반복 가능한 워크플로가 되는지 지켜봐야 한다. 또한 전문가가 에이전트 생성 작업을 구제하거나 다시 만들어야 하는 빈도도 추적해야 한다.

안정적인 품질과 함께 사용이 지속된다면, 에이전트가 직원들이 기능적 경계를 넘도록 돕는다는 OpenAI의 주장을 뒷받침할 것이다. 유지율이 떨어진다면 가장 강한 가치는 여전히 기술 팀에 집중돼 있음을 시사할 것이다.

세 번째 신호는 에이전트 행동을 둘러싼 통제의 성숙도다. 지출 한도는 빠르게 도입되고 있지만, 비용은 운영 위험의 한 부분일 뿐이다.

조직에는 과제 수준 권한, 승인 체크포인트, 감사 가능한 도구 호출, 자격 증명 격리, 행동이 정의된 경계를 벗어날 때의 신뢰할 수 있는 종료 기능도 필요하다.

이러한 보호장치는 여러 모델과 도구에서 작동해야 한다. 기업은 모든 워크플로를 영원히 하나의 공급업체에 표준화하는 경우가 드물다.

이 분야의 진전은 특히 규제 산업에서 더 폭넓은 위임을 정당화하기 쉽게 만들 것이다. 통제가 약하거나 파편화돼 있다면 모델 역량과 무관하게 도입은 늦어질 것이다.

이 세 가지 신호는 연결돼 있다. 결과 보고는 에이전트가 왜 자원을 받을 만한지 설명한다. 유지율은 새로움이 사라진 뒤에도 직원들이 이를 유용하게 여기는지 보여준다.

보안과 거버넌스는 조직이 해당 에이전트에게 중요한 업무를 수행하도록 허용할 수 있는지를 결정한다. 세 가지 중 하나라도 빠지면 성공적인 배포를 막을 수 있다.

Google News의 헤드라인은 채팅에서 에이전트로의 실제 전환을 포착하지만, 토큰 점유율은 이야기의 시작일 뿐이다. 최종 성적표는 아니다.

OpenAI는 직원들이 점점 더 길고 복잡한 업무를 Codex에 위임한다는 점을 보여줬다. 그러나 출력 토큰의 99.8%가 조직 가치에서 동등한 비중을 제공한다는 점까지 보여준 것은 아니다.

엔터프라이즈 구매자는 그러한 사용량을 기념하거나 제한하기 전에 실용적인 질문을 던져야 한다. 어떤 완료된 결과가 가능해졌으며, 어떤 증거가 그 결과가 위험을 감수할 가치가 있었음을 입증하는가?

이 질문은 토큰 양만으로 판단하는 것보다 더 나은 지침을 제공한다. 조직은 효과적인 워크플로를 확장하고, 표류하는 워크플로를 제한하며, 활동이 아니라 결과로 에이전트 도입을 평가할 수 있다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page