Agentes de IA longos estão elevando os custos, e a equação de valor é complicada
- Olivia Johnson

- há 5 dias
- 15 min de leitura
O Google News trouxe um alerta direto sobre agentes de IA longos em 2 de agosto: “The Meter’s Running.” A manchete apareceu na edição 1166 da AI: Reset to Zero. O conflito é claro. Os agentes trabalham por mais tempo, mas cada etapa de planejamento, chamada de ferramenta, nova tentativa e avaliação consome recursos.
O alerta surge enquanto as principais empresas de IA incentivam clientes a ir além de interações curtas com chatbots. Google, Anthropic e OpenAI agora descrevem agentes capazes de operar entre aplicações, manter o estado das tarefas e continuar trabalhando depois que o usuário sai.
Operações mais longas criam novo valor, mas também mudam a questão de compra. Os compradores precisam medir resultados concluídos, não demonstrações impressionantes ou chamadas isoladas de modelo. A disputa central agora é entre autonomia e responsabilização.
Essa disputa importa porque a unidade econômica da IA está mudando. Um chatbot produz uma resposta que uma pessoa revisa imediatamente. Já um agente pode iniciar vários processos, delegar trabalho, inspecionar resultados e repetir etapas que falharam.
Cada ação adicional cria outro ponto em que custos ou erros podem se multiplicar. O medidor não mensura apenas inteligência. Ele registra tudo o que o sistema tentou antes de entregar algo útil.
O que a manchete do Google News realmente sinaliza
O desenvolvimento importante não é a manchete de uma newsletter. É a chegada dos custos operacionais dos agentes como tema central das notícias de tecnologia.
O Google News agregou o item da AI: Reset to Zero em sua cobertura de modelos de IA. Essa inclusão não significa que o Google endossou o argumento do autor. O Google News é uma superfície de descoberta e agregação, não o veículo original.
Ainda assim, a agregação importa porque mostra quais questões estão saindo dos círculos especializados. O consumo de tokens antes pertencia principalmente à documentação de APIs e aos painéis de engenharia. Agora, ele molda discussões sobre planejamento de força de trabalho, orçamentos de software e compras empresariais.
Uma newsletter separada, chamada CO/AI, usou a mesma metáfora do medidor em seu argumento sobre custos. Sua tese era que a inteligência subsidiada está chegando ao fim à medida que o uso de IA se torna visível e mensurável. O texto enquadrou a IA medida por uso como uma comparação econômica com o trabalho humano.
Essa comparação é provocativa, mas também pode induzir ao erro. Um agente em execução não equivale automaticamente a um funcionário. Ele não assume de forma independente a responsabilidade organizacional, não entende todas as restrições implícitas nem arca com as consequências de uma decisão ruim.
Os agentes também dependem de infraestrutura que comparações com trabalho humano frequentemente omitem. Eles precisam de modelos, integrações de ferramentas, controles de identidade, acesso a dados, monitoramento, avaliações e caminhos de escalonamento. Um cálculo sério deve incluir esses sistemas de suporte.
Portanto, a manchete captura apenas a primeira metade da história. Sim, o medidor está rodando. A questão sem resposta é se ele mede trabalho produtivo, exploração malsucedida, esforço duplicado ou os três ao mesmo tempo.
Essa distinção separa um agente útil de um ciclo caro. Um sistema pode permanecer ativo por horas e produzir pouco valor duradouro. Outro pode executar uma curta sequência de ações verificadas que elimina dias de coordenação manual.
A duração, por si só, não comprova produtividade. O volume de tokens não comprova qualidade. Até uma tarefa concluída pode ter resultado econômico negativo quando verificar e corrigir a saída consome mais esforço do que a automação poupou.
O Google News está ajudando a expor essa tensão a um público mais amplo. A conversa está mudando de se os agentes conseguem executar tarefas longas para se as organizações conseguem governar essas tarefas economicamente.
Agentes de IA longos estão se tornando fluxos de trabalho reais
Agentes de longa execução estão saindo das demonstrações de laboratório e entrando em fluxos de trabalho que pausam, retomam e atravessam fronteiras organizacionais.
O Agent Development Kit do Google ilustra essa transição. Um guia de fluxos de trabalho com agentes de maio de 2026 descreveu processos que podem continuar por semanas preservando o estado.
O exemplo se concentrou na integração de funcionários. O agente envia documentos, espera assinaturas, delega o provisionamento de tecnologia, acompanha a entrega de hardware e prepara uma agenda para o primeiro dia.
Não se trata de uma única resposta longa do modelo. É um fluxo de trabalho durável que contém trabalho ativo, estado armazenado e períodos de inatividade. O agente precisa saber o que foi concluído, o que continua bloqueado e qual ação requer aprovação.
Essa arquitetura muda a forma como os custos operacionais devem ser entendidos. Um agente esperando uma assinatura não deveria consumir recursos do modelo continuamente. Ele deve salvar seu estado, suspender a execução e retomar após um evento verificado.
Agentes mal projetados podem fazer o contrário. Podem consultar sistemas desnecessariamente, reconstruir contexto após cada interrupção ou pedir repetidamente a um modelo que interprete informações inalteradas. Esses padrões transformam tempo decorrido em uso evitável.
O mesmo problema aparece na programação. A Anthropic descreve agentes trabalhando em muitas janelas de contexto porque projetos substanciais de software não cabem em uma única sessão. Cada nova sessão exige uma transferência confiável da sessão anterior.
A pesquisa sobre agentes longos da Anthropic utiliza um inicializador e um processo incremental de programação. Os agentes deixam artefatos que explicam o trabalho concluído e orientam sessões posteriores.
Esses artefatos não são mera decoração administrativa. São um controle econômico. Um registro claro de tarefas reduz a chance de que uma sessão nova repita análises, reabra decisões já resolvidas ou reconstrua componentes já concluídos.
O trabalho de longa duração também se beneficia de testes explícitos. Um agente de programação precisa de um sinal objetivo que indique se sua alteração funciona. Sem esse sinal, o modelo pode continuar revisando uma resposta correta ou aceitar com confiança uma resposta quebrada.
A computação científica oferece outro caso concreto. A Anthropic relatou um projeto de compilador que operou em cerca de 2.000 sessões. Suas orientações posteriores enfatizaram arquivos de progresso, oráculos de teste e orquestração estruturada para tarefas de pesquisa de vários dias.
Esses exemplos mostram capacidade real. Também revelam por que o medidor pode acelerar. A continuidade exige construção repetida de contexto, verificação e coordenação. O agente paga um imposto operacional para permanecer coerente ao longo do tempo.
Esse imposto às vezes se justifica. Um projeto que, de outra forma, exigiria semanas de atenção de especialistas pode justificar custos substanciais de computação e revisão. Uma tarefa administrativa rotineira tem uma tolerância muito menor.
A expressão “agente de IA longo” abrange, portanto, duas dimensões diferentes. Uma é a duração transcorrida, incluindo o tempo gasto esperando. A outra é a profundidade computacional ativa, incluindo raciocínio, uso de ferramentas e novas tentativas.
Os compradores empresariais precisam separá-las. Um fluxo de trabalho que dura duas semanas pode ser eficiente se só for ativado por eventos significativos. Um processo de dez minutos pode ser desperdiçador se entrar em um ciclo descontrolado.
Por que os custos dos agentes resistem a previsões simples
Os gastos com agentes se tornam imprevisíveis quando o modelo escolhe seu próprio caminho em vez de seguir uma sequência fixa.
O software tradicional tem padrões de execução relativamente estáveis. Uma solicitação entra, um código conhecido é executado e o sistema retorna um resultado. Os engenheiros podem estimar o uso de recursos a partir de tráfego e dados de benchmark.
Um agente se comporta de forma diferente. Ele planeja, age, observa e revisa. Duas solicitações semelhantes podem produzir números diferentes de chamadas de modelo, invocações de ferramentas, tarefas delegadas e etapas de validação.
A variação vem de uma flexibilidade útil. Um agente pode se recuperar quando um site muda, um banco de dados retorna informações incompletas ou uma primeira tentativa falha. A automação fixa frequentemente para sob essas mesmas condições.
A flexibilidade também cria variância. Um agente pode escolher a ferramenta errada, interpretar mal um erro ou repetir uma ação sem mudar sua abordagem. Uma única decisão equivocada de planejamento pode então afetar todas as etapas posteriores.
O Google Cloud destacou esses riscos ao discutir observabilidade para seu Agent Development Kit. Suas orientações de monitoramento identificaram ciclos, novas tentativas, falhas de transferência, custos inesperados e problemas de segurança.
Um ciclo é particularmente revelador. O modelo pode interpretar uma chamada de ferramenta que falhou como um problema temporário e tentar novamente. Se a causa subjacente for uma permissão ausente, nenhuma quantidade de repetição resolverá a situação.
Um operador humano reconhece o padrão e escala o problema. Um agente com restrições insuficientes continua gastando recursos enquanto gera mais dados de falha. A autonomia transforma um pequeno problema de configuração em uma conta operacional variável.
Sistemas multiagente ampliam esse efeito. Um planejador delega a um pesquisador, que envia material a um redator, que repassa a produção a um avaliador. Cada transferência pode acrescentar contexto, latência e mais uma oportunidade de mal-entendido.
O avaliador pode melhorar a qualidade, mas também consome recursos. Se fornecer feedback vago, o agente de produção pode revisar o artefato inteiro em vez de corrigir um defeito. O ciclo de avaliação então se expande sem melhoria proporcional.
A Anthropic testou essa troca em desenvolvimento de aplicações de longa duração. Sua estrutura multiagente usou papéis de planejador, gerador e avaliador durante uma sessão de várias horas. O sistema produziu uma aplicação melhor do que uma execução individual mais curta.
No entanto, a Anthropic relatou que o processo mais completo foi mais de 20 vezes mais caro. Esse resultado não deve ser tratado como uma proporção universal. Ele demonstra o quanto a orquestração pode alterar o perfil de custos de uma tarefa.
A comparação crítica não é entre uma estrutura completa e um agente individual de forma isolada. Os compradores precisam comparar resultados utilizáveis. Uma execução barata que cria software inutilizável tem pouco valor econômico, enquanto uma execução cara ainda pode superar um projeto manual.
É por isso que a eficiência por token não pode encerrar o debate. Um modelo mais capaz pode consumir menos tokens porque encontra o caminho correto mais cedo. Um modelo mais barato pode exigir novas tentativas, avaliadores e correções humanas adicionais.
A OpenAI destacou esse ponto em suas orientações de julho de 2026 para gestão de investimentos em IA. A empresa argumentou que o menor preço por token não produz necessariamente o menor custo total.
Essa observação pressiona roteadores de modelos e plataformas empresariais. Encaminhar cada etapa ao modelo mais barato pode sair pela culatra quando decisões mais fracas criam cargas de trabalho maiores posteriormente.
A estratégia oposta também desperdiça recursos. Atribuir o modelo mais capaz a cada etapa de classificação, recuperação ou formatação ignora tarefas que sistemas menores conseguem executar com confiabilidade.
Uma orquestração eficiente exige roteamento sensível à tarefa. O planejamento complexo pode justificar raciocínio mais robusto. Transformações determinísticas podem não precisar de nenhum modelo generativo. Ações de alto risco exigem mais verificação do que etapas reversíveis de pesquisa.
O desafio é que as equipes precisam projetar essas políticas antes de dispor de muitos dados de produção. As primeiras implantações frequentemente se apoiam na precisão de benchmarks, mas os benchmarks raramente reproduzem falhas reais de ferramentas, permissões desatualizadas ou instruções internas ambíguas.
Isso deixa as empresas com uma lacuna de previsão. Elas conhecem o custo de uma chamada individual de modelo. Ainda não conhecem o custo estável de um resultado empresarial aceito.
A Autonomia Versus a Responsabilização É a Verdadeira Disputa
Agentes de IA de longa duração só se tornam economicamente úteis quando as organizações conseguem vincular cada ação a um responsável, propósito, orçamento e resultado.
A manchete AI: Reset to Zero enquadra a questão como um medidor em funcionamento. Esse enquadramento se torna acionável quando as equipes conseguem rastrear o que fez o medidor avançar e por quê.
O atual modelo de observabilidade de agentes do Google Cloud enfatiza logs, métricas e rastreamentos. Os logs registram eventos e erros. As métricas resumem a latência e o uso de tokens.
Os rastreamentos reconstroem o caminho de execução. Eles podem mostrar quantas chamadas ao modelo ocorreram, quais ferramentas foram selecionadas e onde o fluxo de trabalho se ramificou. Esse nível de detalhe é essencial para depurar tanto custos quanto comportamentos.
Um total mensal não consegue identificar a causa do desperdício. O mesmo total pode representar dez investigações valiosas ou milhares de novas tentativas triviais. O gasto agregado oferece controle apenas depois do ocorrido.
O rastreamento por fluxo de trabalho permite uma pergunta melhor: qual sequência produziu uma saída aceita? As equipes podem então comparar execuções bem-sucedidas, malsucedidas e abandonadas sem tratar seu uso de recursos como equivalente.
A unidade econômica deveria se tornar um resultado verificado. Em programação, isso pode ser uma alteração integrada que passa nos testes. Em operações de atendimento ao cliente, pode ser um caso resolvido que não é reaberto.
Em pesquisa, o resultado pode ser um memorando de decisão cujas citações resistem à revisão. Em integração de novos funcionários, pode ser um cadastro concluído com todas as aprovações registradas.
Essa abordagem orientada a resultados também altera os incentivos internos. Uma equipe recompensada por reduzir o volume de tokens pode adotar modelos mais fracos que geram mais retrabalho humano. Uma equipe recompensada apenas pela conclusão de tarefas pode ignorar novas tentativas excessivas.
A métrica útil combina qualidade, custo e tempo. Ela também deve refletir o risco. Um agente que envia um resumo interno incorreto é diferente de um que aprova um pagamento ou modifica a infraestrutura de produção.
A autonomia deve aumentar apenas onde as evidências a sustentem. Tarefas de baixo risco podem tolerar uma exploração mais ampla. Ações consequentes exigem limites de permissão, etapas de confirmação e execução reversível sempre que possível.
A Anthropic define um agente como um modelo que direciona seus próprios processos e uso de ferramentas. Seu framework de governança de agentes enfatiza que o comportamento depende do modelo, do harness, das ferramentas e do ambiente.
Essa visão mais ampla é importante para o controle de custos. Um modelo forte ainda pode desperdiçar recursos dentro de um harness mal configurado. Um plano correto ainda pode falhar quando uma ferramenta expõe erros pouco claros.
O ambiente determina o que está em jogo. Um agente com acesso somente de leitura a uma coleção de documentos pode explorar com segurança. O mesmo agente conectado a sistemas de e-mail, finanças e implantação precisa de limites muito mais rígidos.
A responsabilização também exige memória durável. Um fluxo de trabalho deve reter decisões, aprovações, fontes e obrigações não resolvidas. Ainda assim, a memória persistente introduz seus próprios riscos, incluindo instruções desatualizadas e premissas promovidas incorretamente.
Um contexto longo não resolve esse problema por si só. Colocar todo um histórico dentro da janela de um modelo pode aumentar o processamento e, ao mesmo tempo, dificultar a localização de fatos importantes. Mais texto retido não é o mesmo que um estado melhor governado.
Uma camada estruturada de conhecimento pode ajudar a separar decisões verificadas de conversas brutas. Para trabalhadores do conhecimento, uma base de conhecimento pessoal pode preservar o material-fonte sem obrigar cada execução do agente a reler tudo.
O agente deve recuperar apenas o que a etapa atual exige. Ele também deve registrar qual fonte sustentou cada decisão consequente. Essa abordagem reduz a carga de contexto e melhora a auditabilidade.
A responsabilização, portanto, não é um freio à autonomia. É a infraestrutura que torna a autonomia comercialmente defensável. Sem ela, uma operação mais longa apenas amplia a incerteza em torno de cada resultado.
O Que o Medidor Ainda Não Consegue Dizer aos Compradores
Os dados de uso podem revelar para onde os recursos foram, mas não conseguem provar que um agente criou valor ou mereceu maior autoridade.
O Economic Index de junho de 2026 da Anthropic reflete a rapidez com que os padrões de uso estão mudando. As sessões do Claude incluem cada vez mais tarefas de longa duração por meio do Claude Code e do Cowork.
O relatório constatou que saídas mais complexas tendem a consumir mais tokens do que respostas mais simples. Conversas sobre a criação de aplicações usaram mais de três vezes os tokens da conversa mediana.
Também identificou uma relação entre o uso de tokens e o valor econômico das ocupações mapeadas. Conversas associadas a trabalhos mais bem remunerados tendiam a incluir mais saída, maior envolvimento do usuário e um pouco mais de raciocínio prolongado.
Essas conclusões sustentam uma intuição razoável. Trabalhos mais difíceis frequentemente exigem mais computação. Reduzir o uso sem considerar a complexidade da tarefa pode destruir valor em vez de melhorar a eficiência.
No entanto, correlação não é prova de produtividade. Uma conversa mapeada para uma ocupação altamente remunerada não gera automaticamente trabalho equivalente ao valor de mercado dessa ocupação.
O modelo pode produzir um rascunho útil, um artefato incorreto ou uma resposta plausível que exige verificação especializada. O consumo de tokens descreve atividade. Ele não mede quanta responsabilidade permaneceu com o usuário.
O próprio relatório da Anthropic oferece uma pista importante. Os usuários permaneceram mais envolvidos em tarefas de maior valor, mesmo quando o Claude gerava mais saída. Esse padrão se parece mais com ampliação de capacidades do que com substituição completa de trabalho humano.
Essa descoberta complica as tentativas de comparar diretamente uma licença de agente com uma posição humana. O agente pode aumentar a produção de um especialista enquanto ainda depende desse especialista para orientação, julgamento e responsabilização.
A melhor implantação pode, portanto, manter uma pessoa profundamente envolvida. Um especialista de domínio pode definir critérios de aceitação, reconhecer erros sutis e decidir quando uma exploração adicional deixa de justificar seu custo.
Uma autonomia mais longa não deve ser tratada como um objetivo incondicional. O estudo de fevereiro da Anthropic constatou que as sessões mais longas do Claude Code cresceram de menos de 25 minutos para mais de 45 minutos em três meses.
Essa duração quase duplicada indica expansão de capacidade e confiança dos usuários. Ela não revela se cada minuto adicional melhorou o resultado. Sessões mais longas podem conter tanto persistência produtiva quanto exploração improdutiva.
Há também uma questão de seleção. Os usuários podem conceder execuções mais longas a tarefas com testes mais claros, como a compilação de software. Trabalhos que envolvem negociação, estratégia ou preferências ambíguas fornecem sinais de parada mais fracos.
Um agente com uma suíte de testes sabe quando o software falha. Um agente redigindo um documento de estratégia pode continuar fazendo alterações de estilo porque nenhum oráculo binário lhe diz para parar.
Agentes avaliadores oferecem uma resposta, mas seu julgamento pode compartilhar as fraquezas do gerador. A Anthropic observou que os modelos frequentemente avaliam seu próprio trabalho com generosidade excessiva, especialmente em tarefas subjetivas.
Separar geração e avaliação melhora o desenho. Isso não torna a avaliação objetiva. Ambos os agentes ainda podem recompensar uma linguagem polida em vez de profundidade factual ou aceitar a mesma premissa oculta.
A revisão humana continua necessária onde os erros têm consequências relevantes. A carga de revisão deve aparecer no cálculo econômico. Caso contrário, as organizações contabilizam a saída do modelo como trabalho concluído enquanto ocultam o trabalho necessário para validá-la.
A segurança acrescenta outra variável sem preço definido. Um agente de longa duração encontra mais documentos, mensagens, sites e respostas de ferramentas. Cada entrada adicional pode conter instruções enganosas ou tentativas de injeção de prompt.
Mais acesso a ferramentas aumenta o dano potencial. Um ciclo de pesquisa descontrolado desperdiça computação. Um agente operacional comprometido pode expor dados, enviar mensagens ou alterar sistemas antes que alguém perceba.
Limites de custo são salvaguardas úteis, mas incompletas. Um fluxo de trabalho pode causar danos graves permanecendo dentro do orçamento. O desenho de permissões, a confirmação de ações e a detecção de anomalias devem operar junto aos controles de recursos.
Portanto, o medidor não consegue responder sozinho à mais importante questão de gestão. Ele pode mostrar o que um agente consumiu. Não consegue determinar se a organização deve confiar a esse agente mais trabalho.
O Que os Leitores do Google News Devem Observar em Seguida
A próxima fase será definida pela contabilização de resultados, execução durável e limites rígidos que funcionem sob falhas reais de produção.
O primeiro sinal é se os fornecedores expõem o custo por resultado verificado. Totais de tokens e contagens de chamadas ao modelo são dados úteis de engenharia, mas os compradores precisam de medidas no nível do fluxo de trabalho vinculadas a resultados aceitos.
As plataformas devem distinguir execuções bem-sucedidas, malsucedidas, repetidas e resgatadas por humanos. Elas também devem mostrar qual modelo, ferramenta ou ramificação contribuiu mais para o custo final.
Se esses controles se tornarem padrão, o argumento por trás da manchete do Google News se fortalecerá de maneira produtiva. O medidor se tornará um instrumento de otimização em vez de uma luz de alerta.
Se os fornecedores continuarem enfatizando totais amplos de uso, as equipes empresariais terão dificuldade para comparar implantações. Elas podem reduzir o acesso de forma indiscriminada porque não conseguem identificar quais fluxos de trabalho criam valor.
O segundo sinal é a adoção de padrões de execução durável. A arquitetura de pausa e retomada do Google oferece um exemplo. Os agentes devem persistir o estado durante períodos ociosos e retomar a partir de eventos verificados.
Essa arquitetura também precisa sobreviver a falhas. Um processo reiniciado deve saber quais ações já ocorreram. Ele não deve enviar a mesma mensagem duas vezes, reabrir um ticket concluído ou repetir uma transação externa.
Registros de progresso, ferramentas idempotentes e registros explícitos de aprovação são menos visíveis do que a inteligência do modelo. Eles determinarão se agentes de IA de longa duração podem operar por dias sem criar confusão operacional.
O uso mais amplo desses padrões sustentaria o argumento a favor da autonomia de longa duração. Falhas persistentes e ações duplicadas o enfraqueceriam, independentemente de melhorias em benchmarks.
O terceiro sinal é o surgimento de limites aplicáveis de recursos e autoridade. Um painel que reporta consumo excessivo após a conclusão não é um limite rígido.
As equipes precisam de controles que pausem um fluxo de trabalho quando ele exceder o número esperado de etapas, repetir uma chamada de ferramenta, mudar seu plano com muita frequência ou se aproximar de um orçamento de recursos definido.
A pausa deve preservar evidências para revisão. Os operadores precisam ver o último estado verificado do agente, o objetivo não resolvido, as respostas recentes das ferramentas e o motivo da escalada.
Os limites de autoridade devem funcionar da mesma forma. Um agente pode pesquisar uma compra sem efetuá-la. Pode preparar um e-mail sem enviá-lo. Pode propor uma implantação sem modificar a produção.
Se as plataformas tornarem esses limites simples e confiáveis, as empresas poderão conceder autonomia gradualmente. Se os controles continuarem sendo projetos de engenharia personalizados, a adoção se concentrará entre organizações com grandes equipes de infraestrutura.
O Google News provavelmente trará mais histórias sobre agentes substituindo tarefas, trabalhando por horas e operando em diferentes softwares. Os leitores devem olhar além da duração e perguntar o que interrompeu o fluxo de trabalho.
Ele parou porque o objetivo foi verificado, porque uma pessoa aprovou o resultado ou porque o orçamento expirou? Esses são resultados materialmente diferentes.
A metáfora do medidor é útil porque torna visível o consumo oculto. Sua fraqueza é reduzir um trabalho complexo a um único número acumulado.
Um mercado maduro de agentes precisa de vários medidores. Um deve acompanhar recursos. Outro deve acompanhar resultados aceitos. Um terceiro deve acompanhar risco, intervenção e reversibilidade.
Os profissionais do conhecimento podem se preparar preservando o material de origem e as decisões de que os agentes precisam, em vez de reconstruir o contexto para cada tarefa. Um segundo cérebro pesquisável pode tornar essas transferências mais seletivas e auditáveis.
A questão prática já não é se um agente de IA de longa duração consegue continuar trabalhando. O Google News ajudou a trazer uma pergunta mais difícil ao debate público: alguém consegue explicar o que o agente realizou antes de o medidor parar?


