장기 AI 에이전트의 비용은 치솟고 있으며, 가치 방정식은 복잡하다
- Aisha Washington

- 8월 3일
- 11분 분량
Google News는 8월 2일 장기 AI 에이전트에 관한 직설적인 경고를 포착했다. “미터기는 계속 돌아간다(The Meter’s Running).” 이 제목은 AI: Reset to Zero 1166호에 실렸다. 갈등의 지점은 분명하다. 에이전트가 더 오래 작업할수록 계획 단계, 도구 호출, 재시도, 평가 하나하나가 모두 자원을 소비한다.
이 경고는 주요 AI 기업들이 고객에게 짧은 챗봇 대화를 넘어설 것을 권하는 시점에 나왔다. Google, Anthropic, OpenAI는 이제 여러 애플리케이션에 걸쳐 작동하고, 작업 상태를 유지하며, 사용자가 자리를 떠난 뒤에도 계속 일할 수 있는 에이전트를 설명하고 있다.
더 긴 운영은 새로운 가치를 만들지만, 구매 판단의 기준도 바꾼다. 구매자는 인상적인 시연이나 개별 모델 호출이 아니라 완료된 결과를 측정해야 한다. 이제 핵심 경쟁은 자율성과 책임성 사이에서 벌어진다.
이 경쟁이 중요한 이유는 AI의 경제적 단위가 바뀌고 있기 때문이다. 챗봇은 사람이 즉시 검토하는 답변을 내놓는다. 반면 에이전트는 여러 프로세스를 시작하고, 작업을 위임하며, 결과를 점검하고, 실패한 단계를 반복할 수 있다.
추가 행동 하나하나는 비용이나 오류가 증폭될 수 있는 또 하나의 지점을 만든다. 미터기는 지능만 측정하지 않는다. 유용한 결과를 내놓기 전까지 시스템이 시도한 모든 것을 기록한다.
Google News 헤드라인이 실제로 시사하는 것
중요한 변화는 뉴스레터 제목 하나가 아니다. 에이전트 운영 비용이 주류 기술 이슈로 떠오르고 있다는 점이다.
Google News는 AI 모델 관련 보도 아래에 AI: Reset to Zero 항목을 집계했다. 이 배치는 Google이 해당 저자의 주장을 지지한다는 뜻은 아니다. Google News는 원 발행자가 아니라 발견과 집계를 위한 서비스다.
그럼에도 집계에는 의미가 있다. 어떤 질문이 전문 영역을 벗어나고 있는지 보여주기 때문이다. 토큰 소비는 한때 주로 API 문서와 엔지니어링 대시보드의 영역이었다. 이제는 인력 계획, 소프트웨어 예산, 엔터프라이즈 구매 논의에 영향을 미치고 있다.
CO/AI라는 별도 뉴스레터도 비용 논지에서 같은 미터기 비유를 사용했다. 그 핵심 주장은 AI 사용량이 가시화되고 측정 가능해지면서 보조금이 지급된 지능의 시대가 끝나고 있다는 것이었다. 이 글은 계량형 AI를 인간 노동과의 경제적 비교 대상으로 제시했다.
그 비교는 도발적이지만 오해를 부를 수도 있다. 실행 중인 에이전트가 자동으로 직원과 동등한 것은 아니다. 에이전트는 조직적 책임을 독립적으로 지지 못하며, 명시되지 않은 모든 제약을 이해하거나 잘못된 결정의 결과를 감당하지도 못한다.
에이전트는 인간 노동과의 비교에서 흔히 빠지는 인프라에도 의존한다. 모델, 도구 통합, ID 제어, 데이터 접근 권한, 모니터링, 평가, 에스컬레이션 경로가 필요하다. 진지한 계산에는 이러한 지원 시스템이 포함돼야 한다.
따라서 이 헤드라인은 이야기의 절반만 포착한다. 그렇다. 미터기는 돌아가고 있다. 하지만 그것이 생산적인 작업, 실패한 탐색, 중복된 노력, 혹은 이 세 가지 모두를 측정하는지는 아직 답이 나오지 않았다.
이 구분은 유용한 에이전트와 비용만 드는 루프를 가른다. 시스템은 지속적인 가치를 거의 만들지 못하면서도 몇 시간 동안 활성 상태를 유지할 수 있다. 반면 다른 시스템은 검증된 행동을 짧게 수행해 며칠치 수작업 조율을 없앨 수 있다.
지속 시간만으로 생산성이 증명되지는 않는다. 토큰량도 품질을 보장하지 않는다. 완료된 작업조차 산출물을 점검하고 수정하는 데 자동화로 절감한 것보다 더 많은 노력이 든다면 경제적으로는 손해일 수 있다.
Google News는 이러한 긴장을 더 넓은 대중에게 드러내는 데 일조하고 있다. 논의는 에이전트가 장기 작업을 수행할 수 있는지에서, 조직이 그러한 작업을 경제적으로 관리할 수 있는지로 옮겨가고 있다.
장기 AI 에이전트는 실제 워크플로로 자리 잡고 있다
장기 실행 에이전트는 실험실 시연을 넘어, 일시 중지와 재개가 가능하고 조직의 경계를 넘나드는 워크플로로 이동하고 있다.
Google의 Agent Development Kit는 이러한 전환을 보여준다. 2026년 5월 에이전트 워크플로 가이드는 상태를 보존하면서 수주 동안 계속될 수 있는 프로세스를 설명했다.
사례의 중심은 직원 온보딩이었다. 에이전트는 문서를 보내고, 서명을 기다리며, 기술 프로비저닝을 위임하고, 하드웨어 배송을 추적하며, 첫 출근일 일정을 준비한다.
이는 하나의 긴 모델 응답이 아니다. 활성 작업, 저장된 상태, 비활성 기간으로 이뤄진 지속형 워크플로다. 에이전트는 무엇이 완료됐고, 무엇이 여전히 막혀 있으며, 어떤 작업에 승인이 필요한지 알아야 한다.
이 아키텍처는 운영 비용을 이해하는 방식도 바꾼다. 서명을 기다리는 에이전트는 모델 리소스를 계속 소비해서는 안 된다. 상태를 저장하고 실행을 중단한 뒤, 검증된 이벤트가 발생하면 재개해야 한다.
설계가 부실한 에이전트는 반대로 작동할 수 있다. 불필요하게 시스템을 폴링하거나, 중단될 때마다 컨텍스트를 다시 구축하거나, 변하지 않은 정보를 모델에 반복적으로 해석하도록 요청할 수 있다. 이런 패턴은 경과 시간을 피할 수 있는 사용량으로 바꾼다.
코딩에서도 같은 문제가 나타난다. Anthropic은 상당한 규모의 소프트웨어 프로젝트는 하나의 세션에 담을 수 없기 때문에 에이전트가 여러 컨텍스트 윈도에 걸쳐 작업한다고 설명한다. 각각의 새 세션에는 이전 세션의 신뢰할 수 있는 인계가 필요하다.
Anthropic의 장기 에이전트 연구는 초기화 도구와 점진적 코딩 프로세스를 사용한다. 에이전트는 완료된 작업을 설명하고 이후 세션을 안내하는 산출물을 남긴다.
이 산출물은 단순한 행정적 장식이 아니다. 경제적 통제 수단이다. 명확한 작업 원장은 새 세션이 분석을 반복하거나, 이미 결정된 사안을 다시 열거나, 완료된 구성 요소를 재구축할 가능성을 낮춘다.
장기 실행 작업은 명시적인 테스트의 도움도 받는다. 코딩 에이전트에는 변경 사항이 제대로 작동하는지를 알려주는 객관적 신호가 필요하다. 이 신호가 없으면 모델은 올바른 답을 계속 수정하거나, 망가진 결과를 자신 있게 받아들일 수 있다.
과학 컴퓨팅은 또 다른 구체적 사례를 제공한다. Anthropic은 약 2,000개 세션에 걸쳐 작동한 컴파일러 프로젝트를 보고했다. 이후 지침은 다일간 연구 작업을 위한 진행 파일, 테스트 오라클, 구조화된 오케스트레이션을 강조했다.
이러한 사례는 실제 역량을 보여준다. 동시에 미터기가 빨라질 수 있는 이유도 드러낸다. 연속성을 유지하려면 반복적인 컨텍스트 구성, 검증, 조율이 필요하다. 에이전트는 시간에 걸쳐 일관성을 유지하기 위한 운영 비용을 치르고 있다.
이 비용은 때로 정당화된다. 그렇지 않았다면 전문 인력의 수주간 투입이 필요했을 프로젝트는 상당한 컴퓨팅 및 검토 비용을 감당할 수 있다. 일상적인 행정 작업의 허용 범위는 훨씬 좁다.
따라서 “장기 AI 에이전트”라는 표현은 두 가지 서로 다른 차원을 포괄한다. 하나는 대기 시간을 포함한 경과 시간이다. 다른 하나는 추론, 도구 사용, 재시도를 포함한 실제 계산 깊이다.
엔터프라이즈 구매자는 이 둘을 분리해야 한다. 2주 동안 지속되는 워크플로도 의미 있는 이벤트에서만 깨어난다면 효율적일 수 있다. 반면 10분짜리 프로세스도 통제되지 않은 루프에 빠지면 낭비가 될 수 있다.
에이전트 비용은 왜 단순하게 예측하기 어려운가
모델이 고정된 순서를 따르지 않고 스스로 경로를 선택하면 에이전트 지출은 예측하기 어려워진다.
전통적인 소프트웨어는 실행 패턴이 비교적 안정적이다. 요청이 들어오면 알려진 코드가 실행되고, 시스템은 결과를 반환한다. 엔지니어는 트래픽과 벤치마크 데이터로 자원 사용량을 추정할 수 있다.
에이전트는 다르게 작동한다. 계획하고, 행동하고, 관찰하고, 수정한다. 유사한 두 요청도 모델 호출, 도구 호출, 위임 작업, 검증 단계의 수가 서로 다를 수 있다.
이러한 변동은 유용한 유연성에서 비롯된다. 에이전트는 웹사이트가 바뀌거나, 데이터베이스가 불완전한 정보를 반환하거나, 첫 시도가 실패했을 때 복구할 수 있다. 고정형 자동화는 같은 상황에서 흔히 멈춘다.
하지만 유연성은 변동성도 만든다. 에이전트가 잘못된 도구를 선택하거나, 오류를 오해하거나, 접근 방식을 바꾸지 않은 채 행동을 재시도할 수 있다. 잘못된 계획 결정 하나가 이후의 모든 단계에 영향을 미칠 수 있다.
Google Cloud는 Agent Development Kit의 관측 가능성을 논의하면서 이러한 위험을 강조했다. 모니터링 지침은 루프, 재시도, 인계 실패, 예기치 않은 비용, 보안 문제를 지목했다.
루프는 특히 많은 것을 보여준다. 모델은 실패한 도구 호출을 일시적 문제로 해석해 다시 시도할 수 있다. 근본 원인이 권한 부족이라면, 반복만으로는 해결되지 않는다.
사람 운영자는 패턴을 알아차리고 에스컬레이션한다. 제약이 충분하지 않은 에이전트는 더 많은 실패 데이터를 생성하면서 자원을 계속 소비한다. 자율성은 작은 구성 문제를 가변적인 운영 비용으로 바꾼다.
멀티 에이전트 시스템은 이 효과를 키운다. 계획자가 리서처에게 작업을 위임하고, 리서처는 자료를 작성자에게 보내며, 작성자는 결과물을 평가자에게 넘긴다. 모든 인계는 컨텍스트와 지연 시간을 추가하고, 오해가 발생할 또 하나의 기회를 만든다.
평가자는 품질을 높일 수 있지만 자원도 소비한다. 피드백이 모호하면 생산 에이전트는 한 가지 결함을 고치는 대신 전체 산출물을 수정할 수 있다. 그러면 평가 루프는 그에 비례한 개선 없이 확장된다.
Anthropic은 장기 실행 애플리케이션 개발에서 이 절충을 시험했다. 멀티 에이전트 하니스는 수시간 세션에 걸쳐 계획자, 생성자, 평가자 역할을 사용했다. 시스템은 더 짧은 단독 실행보다 더 나은 애플리케이션을 만들었다.
하지만 Anthropic은 더 완전한 프로세스의 비용이 20배를 넘었다고 보고했다. 이 결과를 보편적 비율로 받아들여서는 안 된다. 이는 오케스트레이션이 단일 작업의 비용 구조를 얼마나 크게 바꿀 수 있는지 보여준다.
핵심 비교는 완전한 하니스와 단독 에이전트를 분리해서 비교하는 것이 아니다. 구매자는 실제로 쓸 수 있는 결과를 비교해야 한다. 사용할 수 없는 소프트웨어를 만드는 저렴한 실행은 경제적 가치가 거의 없으며, 비용이 많이 드는 실행도 수작업 프로젝트보다 나을 수 있다.
이 때문에 토큰당 효율성만으로 논쟁을 끝낼 수 없다. 더 유능한 모델은 더 빨리 올바른 경로에 도달해 토큰을 더 적게 소비할 수 있다. 더 저렴한 모델은 추가 재시도, 평가자, 사람의 수정 작업을 필요로 할 수 있다.
OpenAI는 2026년 7월 AI 투자 관리 지침에서 이 점을 언급했다. 가장 낮은 토큰 가격이 반드시 가장 낮은 총비용으로 이어지지는 않는다고 주장했다.
이러한 관찰은 모델 라우터와 엔터프라이즈 플랫폼에 압박을 가한다. 모든 단계를 가장 저렴한 모델로 라우팅하면, 약한 판단이 더 큰 후속 작업을 만들 때 역효과가 날 수 있다.
반대 전략 역시 자원을 낭비한다. 모든 분류, 검색, 포맷팅 단계에 가장 유능한 모델을 배정하는 것은 더 작은 시스템이 신뢰성 있게 처리할 수 있는 작업을 무시하는 셈이다.
효율적인 오케스트레이션에는 작업 민감형 라우팅이 필요하다. 복잡한 계획에는 더 강한 추론이 정당화될 수 있다. 결정론적 변환에는 생성형 모델이 전혀 필요하지 않을 수 있다. 고위험 행동은 되돌릴 수 있는 리서치 단계보다 더 많은 검증이 필요하다.
문제는 팀이 충분한 프로덕션 데이터를 갖기 전에 이러한 정책을 설계해야 한다는 점이다. 초기 배포는 종종 벤치마크 정확도에 의존하지만, 벤치마크는 실제 도구 실패, 오래된 권한, 모호한 내부 지침을 거의 재현하지 못한다.
그 결과 엔터프라이즈에는 예측의 공백이 남는다. 개별 모델 호출의 비용은 알고 있다. 그러나 수용 가능한 비즈니스 결과의 안정적인 비용은 아직 알지 못한다.
자율성과 책임성의 대결이 진짜 경쟁이다
조직이 모든 행동을 담당자, 목적, 예산, 결과와 연결할 수 있을 때에만 장기 실행 AI 에이전트는 경제적으로 유용해진다.
AI: Reset to Zero 헤드라인은 이 문제를 계속 올라가는 계량기로 비유한다. 팀이 무엇이 계량기를 움직였는지, 그리고 왜 그랬는지를 추적할 수 있을 때 이 비유는 실행 가능한 관점이 된다.
Google Cloud의 현재 agent observability 모델은 로그, 메트릭, 트레이스를 강조한다. 로그는 이벤트와 오류를 포착한다. 메트릭은 지연 시간과 토큰 사용량을 요약한다.
트레이스는 실행 경로를 재구성한다. 얼마나 많은 모델 호출이 발생했는지, 어떤 도구가 선택됐는지, 워크플로가 어디에서 분기됐는지를 보여줄 수 있다. 이런 세부 정보는 동작뿐 아니라 비용을 디버깅하는 데도 필수적이다.
월간 총액만으로는 낭비의 원인을 파악할 수 없다. 같은 총액이 가치 있는 조사 열 건을 의미할 수도, 사소한 재시도 수천 건을 의미할 수도 있다. 총지출은 사후적으로만 통제력을 제공한다.
워크플로별 트레이싱은 더 나은 질문을 가능하게 한다. 어떤 순서가 승인된 결과물을 만들어냈는가? 그러면 팀은 성공 실행, 실패 실행, 중단된 실행을 리소스 사용량이 동일한 것으로 취급하지 않고 비교할 수 있다.
경제적 단위는 검증된 결과가 되어야 한다. 코딩에서는 테스트를 통과한 병합 변경일 수 있다. 고객 운영에서는 재개되지 않는 해결된 사례일 수 있다.
리서치에서는 인용이 검토를 통과한 의사결정 메모가 결과일 수 있다. 온보딩에서는 모든 승인이 기록된 완료된 직원 기록일 수 있다.
이 결과 중심 접근법은 내부 인센티브도 바꾼다. 토큰 사용량을 줄이는 데 보상받는 팀은 더 많은 사람의 후처리를 유발하는 약한 모델을 배포할 수 있다. 작업 완료에만 보상받는 팀은 과도한 재시도를 무시할 수 있다.
유용한 지표는 품질, 비용, 시간을 결합한다. 또한 위험을 반영해야 한다. 잘못된 내부 요약을 보내는 에이전트는 결제를 승인하거나 프로덕션 인프라를 변경하는 에이전트와 다르다.
자율성은 증거가 뒷받침되는 범위에서만 높아져야 한다. 저위험 작업은 더 넓은 탐색을 허용할 수 있다. 중대한 행동에는 권한 경계, 확인 절차, 그리고 가능한 경우 되돌릴 수 있는 실행이 필요하다.
Anthropic은 에이전트를 자신의 프로세스와 도구 사용을 스스로 지시하는 모델로 정의한다. 자사의 agent governance framework는 행동이 모델, 하네스, 도구, 환경에 좌우된다고 강조한다.
이 더 넓은 관점은 비용 통제에도 중요하다. 강력한 모델도 잘못 구성된 하네스 안에서는 리소스를 낭비할 수 있다. 올바른 계획도 도구가 불명확한 오류를 노출하면 실패할 수 있다.
환경은 위험도를 결정한다. 문서 컬렉션에 대한 읽기 전용 접근 권한을 가진 에이전트는 안전하게 탐색할 수 있다. 같은 에이전트가 이메일, 재무, 배포 시스템에 연결되면 훨씬 더 엄격한 제한이 필요하다.
책임성에는 지속 가능한 메모리도 필요하다. 워크플로는 의사결정, 승인, 출처, 미해결 의무를 유지해야 한다. 그러나 영속 메모리는 오래된 지침과 잘못 격상된 가정 등 자체적인 위험도 초래한다.
긴 컨텍스트만으로는 이 문제가 해결되지 않는다. 전체 이력을 모델 윈도에 넣으면 중요한 사실을 찾기 더 어렵게 만들면서 처리량을 늘릴 수 있다. 더 많은 텍스트를 보존하는 것이 더 잘 관리되는 상태를 의미하지는 않는다.
구조화된 지식 계층은 검증된 의사결정과 원시 대화를 분리하는 데 도움이 될 수 있다. 지식 근로자에게 personal knowledge base는 매 에이전트 실행마다 모든 내용을 다시 읽게 하지 않으면서 원본 자료를 보존할 수 있다.
에이전트는 현재 단계에 필요한 정보만 검색해야 한다. 또한 각 중대한 의사결정을 뒷받침한 출처를 기록해야 한다. 이 접근법은 컨텍스트 부담을 줄이고 감사 가능성을 높인다.
따라서 책임성은 자율성의 제동 장치가 아니다. 자율성을 상업적으로 정당화할 수 있게 하는 인프라다. 그것이 없다면 더 긴 실행은 각 결과를 둘러싼 불확실성을 대체로 키울 뿐이다.
계량기가 여전히 구매자에게 알려주지 못하는 것
사용량 데이터는 리소스가 어디로 갔는지는 보여줄 수 있지만, 에이전트가 가치를 창출했는지 또는 더 큰 권한을 받을 자격이 있는지는 증명할 수 없다.
Anthropic의 2026년 6월 Economic Index는 사용 패턴이 얼마나 빠르게 변화하는지를 보여준다. Claude 세션에는 Claude Code와 Cowork를 통한 장기 실행 작업이 점점 더 많이 포함되고 있다.
보고서는 복잡한 결과물이 단순한 응답보다 더 많은 토큰을 소비하는 경향이 있음을 발견했다. 애플리케이션 구축에 관한 대화는 중앙값 대화보다 세 배 이상 많은 토큰을 사용했다.
또한 토큰 사용량과 매핑된 직업의 경제적 가치 사이의 관계도 발견했다. 더 높은 급여를 받는 업무와 연관된 대화는 더 많은 출력, 더 높은 사용자 참여, 그리고 약간 더 긴 추론을 포함하는 경향이 있었다.
이러한 결과는 합리적인 직관을 뒷받침한다. 더 어려운 작업에는 더 많은 연산이 필요한 경우가 많다. 작업 복잡성을 고려하지 않고 사용량을 줄이면 효율성을 높이기보다 가치를 훼손할 수 있다.
그러나 상관관계는 생산성의 증거가 아니다. 고임금 직업에 매핑된 대화가 그 직업의 시장 가치와 동등한 작업을 자동으로 만들어내는 것은 아니다.
모델은 유용한 초안, 잘못된 산출물, 또는 전문가 검증이 필요한 그럴듯한 답변을 만들 수 있다. 토큰 소비는 활동을 설명한다. 사용자에게 얼마나 많은 책임이 남았는지는 측정하지 않는다.
Anthropic의 보고서 자체가 중요한 단서를 제공한다. Claude가 더 많은 출력을 생성했음에도 사용자는 고가치 작업에 더 많이 관여했다. 이 패턴은 완전한 노동 대체보다는 증강에 더 가깝다.
이 발견은 에이전트 좌석을 인간의 직위와 직접 비교하려는 시도를 복잡하게 만든다. 에이전트는 전문가의 산출량을 높일 수 있지만, 여전히 그 전문가의 지시, 판단, 책임성에 의존할 수 있다.
따라서 최선의 배포 방식은 사람이 깊이 관여하는 형태일 수 있다. 도메인 전문가는 승인 기준을 정의하고, 미묘한 오류를 식별하며, 추가 탐색이 더 이상 비용을 정당화하지 못하는 시점을 결정할 수 있다.
더 긴 자율성을 무조건적인 목표로 취급해서는 안 된다. Anthropic의 2월 연구에 따르면 가장 긴 Claude Code 세션은 3개월 사이 25분 미만에서 45분 이상으로 늘어났다.
거의 두 배가 된 이 지속 시간은 역량 확대와 사용자 신뢰를 시사한다. 그러나 매 추가 시간이 결과를 개선했는지는 보여주지 않는다. 긴 세션에는 생산적인 지속성과 비생산적인 방황이 모두 포함될 수 있다.
선별 문제도 있다. 사용자는 소프트웨어 컴파일처럼 테스트가 명확한 작업에 더 긴 실행을 허용할 수 있다. 협상, 전략, 모호한 취향이 수반되는 작업은 중단 신호가 더 약하다.
테스트 스위트를 가진 에이전트는 소프트웨어가 실패한 시점을 안다. 전략 문서를 작성하는 에이전트는 멈추라고 알려주는 이진 오라클이 없기 때문에 문체 변경을 계속할 수 있다.
평가자 에이전트는 하나의 해답을 제공하지만, 그 판단은 생성기의 약점을 공유할 수 있다. Anthropic은 특히 주관적 작업에서 모델이 자신의 작업을 지나치게 관대하게 평가하는 경우가 많다고 지적했다.
생성과 평가를 분리하면 설계가 개선된다. 그렇다고 평가가 객관적이 되는 것은 아니다. 두 에이전트 모두 사실적 깊이보다 매끄러운 문장을 보상하거나 동일한 숨은 가정을 받아들일 수 있다.
오류가 의미 있는 결과를 초래하는 영역에서는 사람의 검토가 여전히 필요하다. 검토 부담은 경제성 계산에 포함돼야 한다. 그렇지 않으면 조직은 모델 출력을 완료된 작업으로 계산하면서, 이를 검증하는 데 필요한 노동을 숨기게 된다.
보안은 또 다른 가격 미반영 변수다. 장기 실행 에이전트는 더 많은 문서, 메시지, 웹사이트, 도구 응답을 접한다. 각 추가 입력에는 오도하는 지침이나 프롬프트 인젝션 시도가 담길 수 있다.
도구 접근 권한이 많아질수록 잠재적 피해도 커진다. 통제되지 않는 리서치 루프는 연산 자원을 낭비한다. 침해된 운영 에이전트는 누군가 알아차리기 전에 데이터를 노출하거나, 메시지를 보내거나, 시스템을 변경할 수 있다.
비용 한도는 유용하지만 불완전한 안전장치다. 워크플로는 예산 내에 머물면서도 심각한 피해를 초래할 수 있다. 권한 설계, 행동 확인, 이상 탐지는 리소스 통제와 함께 작동해야 한다.
따라서 계량기만으로는 가장 중요한 관리 질문에 답할 수 없다. 에이전트가 무엇을 소비했는지는 보여줄 수 있다. 조직이 그 에이전트에게 더 많은 일을 맡겨야 하는지는 판단할 수 없다.
Google News 독자가 다음으로 주목해야 할 것
다음 단계는 결과 회계, 지속 가능한 실행, 실제 프로덕션 장애 상황에서도 작동하는 엄격한 한계에 의해 결정될 것이다.
첫 번째 신호는 공급업체가 검증된 결과당 비용을 공개하는지 여부다. 토큰 총량과 모델 호출 횟수는 유용한 엔지니어링 데이터지만, 구매자에게는 승인된 결과와 연결된 워크플로 수준의 측정치가 필요하다.
플랫폼은 성공, 실패, 재시도, 사람의 개입으로 복구된 실행을 구분해야 한다. 또한 어떤 모델, 도구, 분기가 최종 비용에 가장 크게 기여했는지도 보여줘야 한다.
이러한 통제가 표준이 된다면 Google News 헤드라인 뒤의 주장은 생산적인 방식으로 강화된다. 계량기는 경고등이 아니라 최적화 도구가 된다.
공급업체가 계속해서 광범위한 사용량 총계만 강조한다면, 엔터프라이즈 팀은 배포를 비교하기 어려워질 것이다. 어떤 워크플로가 가치를 만드는지 식별할 수 없기 때문에 접근 권한을 무차별적으로 줄일 수 있다.
두 번째 신호는 지속 가능한 실행 패턴의 도입이다. Google의 일시 중지 및 재개 아키텍처가 한 가지 예다. 에이전트는 유휴 기간 동안 상태를 보존하고 검증된 이벤트를 기반으로 재개해야 한다.
이 아키텍처는 장애도 견뎌야 한다. 다시 시작된 프로세스는 어떤 행동이 이미 발생했는지 알아야 한다. 같은 메시지를 두 번 보내거나, 완료된 티켓을 다시 열거나, 외부 거래를 반복해서는 안 된다.
진행 원장, 멱등성 도구, 명시적인 승인 기록은 모델 지능보다 눈에 덜 띈다. 그러나 장기 실행 AI 에이전트가 운영 혼란 없이 며칠간 작동할 수 있는지를 결정할 요소들이다.
이러한 패턴이 더 널리 쓰이면 장기 실행 자율성의 근거가 강화될 것이다. 지속적인 실패와 중복된 행동은 벤치마크 개선과 무관하게 그 근거를 약화시킬 것이다.
세 번째 신호는 강제 가능한 리소스 및 권한 경계의 등장이다. 완료 후 과도한 소비를 보고하는 대시보드는 엄격한 한계가 아니다.
팀에는 워크플로가 예상 단계 수를 초과하거나, 도구 호출을 반복하거나, 계획을 너무 자주 바꾸거나, 정의된 리소스 예산에 근접할 때 이를 일시 중지하는 통제가 필요하다.
일시 중지는 검토를 위한 증거를 보존해야 한다. 운영자는 에이전트의 마지막 검증 상태, 미해결 목표, 최근 도구 응답, 에스컬레이션 사유를 확인할 수 있어야 한다.
권한 경계도 같은 방식으로 작동해야 한다. 에이전트는 구매를 실행하지 않고 조사할 수 있다. 이메일을 보내지 않고 준비할 수 있다. 프로덕션을 변경하지 않고 배포를 제안할 수 있다.
플랫폼이 이러한 경계를 간단하고 신뢰성 있게 만든다면, 기업은 자율성을 점진적으로 부여할 수 있다. 통제가 계속 맞춤형 엔지니어링 프로젝트로 남는다면, 도입은 대규모 인프라 팀을 보유한 조직에 집중될 것이다.
Google News에는 작업을 대체하고, 수시간 동안 일하며, 여러 소프트웨어에 걸쳐 작동하는 에이전트에 관한 기사가 더 많이 실릴 가능성이 크다. 독자는 지속 시간만 보지 말고 무엇이 워크플로를 멈췄는지 물어봐야 한다.
목표가 검증돼서 멈췄는가, 사람이 결과를 승인해서 멈췄는가, 아니면 예산이 소진돼서 멈췄는가? 이는 실질적으로 서로 다른 결과다.
계량기 비유는 숨겨진 소비를 보이게 한다는 점에서 유용하다. 약점은 복잡한 작업을 하나의 누적 숫자로 축소한다는 데 있다.
성숙한 에이전트 시장에는 여러 개의 계량기가 필요하다. 하나는 리소스를 추적해야 한다. 또 하나는 승인된 결과를 추적해야 한다. 세 번째는 위험, 개입, 되돌릴 수 있는 정도를 추적해야 한다.
지식 노동자는 모든 작업마다 맥락을 다시 구축하는 대신, 에이전트가 필요로 하는 원본 자료와 의사결정을 보존함으로써 대비할 수 있습니다. 검색 가능한 세컨드 브레인은 이러한 인수인계를 더 선별적이고 감사 가능하게 만들 수 있습니다.
이제 실질적인 질문은 장시간 작동하는 AI 에이전트가 계속 일할 수 있는지 여부가 아닙니다. Google News는 더 어려운 질문을 공론장으로 끌어냈습니다. 과금이 멈추기 전에 에이전트가 무엇을 해냈는지 누구라도 설명할 수 있는가?


