Uso de Tokens por Agentes no OpenRouter É 5x Maior que o Tráfego Humano, mas a Liderança É Principalmente de Contexto em Cache
O uso de tokens por agentes no OpenRouter alcançou 7,3 trilhões de tokens em agosto, mais de cinco vezes os 1,4 trilhão atribuídos a humanos na plataforma. Ainda assim, mais de 85% desses tokens de agentes teriam vindo de prompts em cache, e não de instruções recém-processadas ou respostas geradas.
Essa distinção complica a afirmação de que a IA agora usa mais IA do que as pessoas. Os agentes claramente geram muito mais tráfego de modelos por tarefa. No entanto, o gráfico mede tokens roteados por uma única plataforma, não a adoção global de IA, gastos, trabalho produtivo ou valor econômico.
Daniel Newman, CEO do Futurum Group, ampliou os números em uma publicação no X em 30 de setembro. Ele previu que a proporção subiria de cinco vezes para 10 vezes e continuaria aumentando. O número de cinco vezes vem do tráfego observado no OpenRouter. O número de 10 vezes continua sendo uma previsão sem cronograma declarado ou modelo de apoio.
A verdadeira disputa, portanto, não é entre agentes e humanos. É entre volume bruto de tokens e trabalho útil. A distinção importa para desenvolvedores que gerenciam loops de agentes, empresas que avaliam retornos e provedores de infraestrutura que planejam capacidade de memória.
O Uso de Tokens por Agentes no OpenRouter Cruzou um Limite Claro
Os dados de agosto mostram uma grande mudança no tráfego de modelos, mas apenas no ambiente medido pelo OpenRouter.
O OpenRouter opera um gateway que roteia solicitações entre modelos e provedores de inferência. Sua posição dá à empresa visibilidade sobre tráfego de aplicações diversas, incluindo conversas diretas, ferramentas de programação e fluxos de trabalho autônomos.
O gráfico reportado apresenta o uso médio de tokens em sete dias até 10 de agosto de 2026. O tráfego de agentes alcançou aproximadamente 7,3 trilhões de tokens, em comparação com 1,4 trilhão para o tráfego humano.
A proporção resultante é de cerca de 5,2 para um. Ela sustenta a afirmação mais restrita de que os agentes geraram cinco vezes mais tráfego de tokens do que os humanos no OpenRouter durante esse período de medição.
Isso não estabelece a mesma proporção no ChatGPT, Claude, Gemini, implantações em nuvem privada ou modelos hospedados localmente. Esses sistemas representam um tráfego substancial que o OpenRouter não consegue observar.
O OpenRouter também informou que o uso por agentes havia crescido cerca de catorze vezes desde 6 de fevereiro. O uso de tokens por humanos aumentou aproximadamente 2,8 vezes no mesmo período. O tráfego misto, que combina comportamento humano e semelhante ao de agentes, teria crescido aproximadamente 4,7 vezes.
6 de fevereiro foi a última data observada em que o tráfego humano permaneceu acima do tráfego de agentes no conjunto de dados. Isso torna o resultado de agosto mais significativo do que um único pico diário. Os agentes mantiveram e ampliaram sua liderança por cerca de seis meses.
O OpenRouter classificou cada chave de API como agentiva, humana ou mista. O sistema teria usado sete sinais ponderados, incluindo taxas de chamadas de ferramentas, contagens de turnos e intervalos de tempo entre respostas.
Essa abordagem é mais informativa do que depender apenas dos nomes das aplicações. Um cliente de API genérico pode executar um loop autônomo, enquanto uma aplicação comercializada como agente pode permanecer sob controle humano direto.
No entanto, a classificação comportamental introduz incerteza. Chaves de API podem atender a vários produtos, equipes ou casos de uso. Uma carga de trabalho também pode alternar entre comportamento conduzido por humanos e automatizado sem mudar as credenciais.
A categoria mista reconhece essa ambiguidade, mas não a elimina. Reatribuir parte desse tráfego alteraria a proporção entre agentes e pessoas.
Há outra questão semântica importante. Agentes não são clientes independentes no sentido econômico usual. Humanos e organizações os implantam, definem objetivos, financiam suas solicitações e decidem se suas saídas têm valor.
Os agentes são mais bem compreendidos como intermediários automatizados. Uma solicitação humana pode iniciar planejamento, recuperação de informações, execução de ferramentas, validação, correção e chamadas repetidas ao modelo.
Esse efeito de multiplicação é o evento central. A demanda por IA já não é determinada apenas por quantas pessoas abrem uma janela de chat. Ela depende cada vez mais de quanta atividade de máquina cada solicitação humana desencadeia.
O anterior estudo de 100 trilhões de tokens do OpenRouter identificou a mesma mudança estrutural. Ele descreveu a inferência agentiva como uma sequência estendida que envolve planejamento, ferramentas, revisões e interação repetida com o modelo.
O estudo constatou que a programação havia se tornado uma fonte importante de crescimento de prompts. Os prompts de programação também tinham, em média, várias vezes o comprimento dos prompts de uso geral até o fim de 2025.
Esses padrões ajudam a explicar por que os agentes cruzaram o limite. Uma pessoa pode enviar uma solicitação de programação. Um agente pode inspecionar arquivos repetidamente, chamar ferramentas, revisar resultados de testes e reenviar seu contexto de trabalho.
O gráfico de agosto captura essa amplificação em escala de plataforma. Ele não prova que o software autônomo substituiu a demanda humana. Mostra que a demanda humana chega cada vez mais por meio de sistemas que criam muitas solicitações subsequentes.
Uma Instrução Humana Pode Acionar Milhares de Operações de Modelo
Os agentes consomem mais tokens porque transformam uma única solicitação em um processo computacional contínuo.
Uma interação convencional com chatbot normalmente segue um ritmo visível. Uma pessoa escreve um prompt, recebe uma resposta e decide se continua. Cada novo turno depende de outra ação humana.
Um agente pode continuar sem essa pausa. Ele interpreta uma meta, cria etapas, escolhe ferramentas, avalia resultados e decide se é necessária outra tentativa.
Considere uma migração de software. Um desenvolvedor pode pedir a um agente que mova uma aplicação de um serviço de nuvem para outro.
A primeira chamada ao modelo pode examinar a solicitação e elaborar um plano. Chamadas posteriores podem inspecionar arquivos de configuração, pesquisar documentação, editar código, executar testes, diagnosticar falhas e revisar a implementação.
Cada chamada frequentemente inclui mais do que a instrução mais recente. Ela pode transportar regras de sistema, definições de ferramentas, detalhes do repositório, mensagens anteriores, saída de comandos e decisões anteriores do agente.
Esse material acumulado é a janela de contexto, ou seja, o texto e os dados estruturados disponíveis para o modelo durante uma solicitação. À medida que a tarefa continua, esse contexto pode se tornar muito maior do que o prompt humano original.
O uso de ferramentas aumenta ainda mais o tráfego. Um modelo pode gerar uma consulta de banco de dados, inspecionar o resultado e então chamar o modelo novamente para decidir o que vem em seguida.
Agentes paralelos podem multiplicar o processo novamente. Um coordenador pode delegar pesquisa, programação, testes e revisão a trabalhadores separados. Cada trabalhador mantém suas próprias instruções e histórico de tarefas.
Isso explica por que o volume de tokens pode crescer muito mais rápido do que o número de usuários. A unidade básica mudou de um turno de conversa para uma etapa de fluxo de trabalho.
Os dados do OpenRouter também refletem crescimento em cargas de trabalho de raciocínio e programação. Essas tarefas naturalmente favorecem interações mais longas porque envolvem estado intermediário, ferramentas externas e validação repetida.
Evidências acadêmicas sugerem que a amplificação pode se tornar extrema. Um estudo de 2026 sobre programação agentiva constatou que tarefas de agentes consumiram aproximadamente 1.000 vezes mais tokens do que chats de código em seu ambiente experimental.
A pesquisa sobre custo de agentes também encontrou ampla variação entre execuções repetidas. O uso de tokens para a mesma tarefa diferiu em até trinta vezes nos testes dos pesquisadores.
Fundamentalmente, mais tokens não produziram resultados melhores de forma consistente. O desempenho frequentemente atingiu o pico em um nível intermediário antes de o consumo adicional deixar de proporcionar ganhos correspondentes.
Essa constatação reforça a tensão central por trás do uso de tokens por agentes no OpenRouter. Uma contagem crescente pode representar automação produtiva, repetição desnecessária ou uma combinação das duas.
Os criadores de agentes, portanto, enfrentam pressão para medir o trabalho concluído, e não apenas a atividade gerada. Indicadores úteis incluem alterações de código aceitas, casos de suporte resolvidos, transações bem-sucedidas e tarefas concluídas sem reparo humano.
Um token é apenas uma unidade de processamento de texto. Ele não traz nenhuma medida intrínseca de precisão, dificuldade, novidade ou valor comercial.
Dois fluxos de trabalho podem consumir o mesmo número de tokens e produzir resultados muito diferentes. Um pode resolver um problema complexo de engenharia. O outro pode repetir um plano fracassado até que um limite o interrompa.
O projeto do sistema ao redor determina qual resultado é mais provável. Testes claros de conclusão ajudam um agente a reconhecer o sucesso. Políticas de repetição limitadas evitam que uma tarefa com falha seja executada indefinidamente.
Boas ferramentas também reduzem a necessidade de raciocínio textual extenso. Uma API estruturada pode retornar um resultado preciso que, de outra forma, exigiria navegação e interpretação repetidas.
A arquitetura de memória importa pelo mesmo motivo. Um agente não precisa de cada detalhe antigo em todas as etapas. Ele precisa do subconjunto que permanece relevante para a decisão atual.
É aqui que uma base de conhecimento pessoal pesquisável pode apoiar fluxos de trabalho conduzidos por humanos. Evidências recuperadas podem substituir um histórico indiscriminado quando o sistema seleciona o contexto com cuidado.
A pressão se estende além dos desenvolvedores. Compradores empresariais agora precisam avaliar como os produtos controlam loops, recuperam contexto e relatam consumo.
Um produto pode parecer eficiente durante uma demonstração curta, mas se comportar de modo diferente em cargas de trabalho de longa duração. Tarefas de produção encontram permissões ausentes, metas ambíguas, dados em mudança e respostas inesperadas de ferramentas.
Essas condições geram novas tentativas. Elas também revelam se o agente tem regras de parada confiáveis ou se apenas continua produzindo próximos passos plausíveis.
A adoção humana continua importante, mas já não prevê a demanda de inferência por si só. A fórmula mais útil inclui usuários, tarefas delegadas, chamadas de modelo por tarefa e tokens por chamada.
Essa fórmula torna uma proporção de dez vezes plausível em princípio. Ela não torna inevitável a previsão de Newman. A proporção também dependerá de otimização, comportamento dos modelos, projeto das aplicações e tráfego fora do OpenRouter.
Prompts em Cache Explicam a Maior Parte da Explosão de Tokens
A maior parte da liderança dos agentes parece ser contexto repetido, não raciocínio ou saída inteiramente novos.
Mais de 85% dos tokens de agentes na apresentação da a16z teriam vindo de prompts em cache. Prompts em cache são segmentos de entrada processados anteriormente que um provedor pode reutilizar quando uma solicitação posterior começa com conteúdo correspondente.
Um agente frequentemente reenvia material estável. Esse material pode incluir instruções de sistema, descrições de ferramentas, arquivos de projeto, políticas e histórico anterior de conversas.
Processar o mesmo prefixo do zero em cada chamada desperdiçaria computação. O cache de prompts permite que o provedor reutilize resultados intermediários associados a esse prefixo.
A telemetria de cache do OpenRouter separa tokens em cache de tokens de prompt recém-processados. Ela também pode identificar tokens gravados em um cache para reutilização futura.
Isso significa que 7,3 trilhões de tokens não devem ser interpretados como 7,3 trilhões de unidades de trabalho novo do modelo. Uma grande parcela representa informações que o sistema já encontrou antes.
A distinção afeta o custo. Em geral, os provedores cobram menos por uma leitura de cache do que pelo processamento de nova entrada, pois grande parte da computação anterior já ocorreu.
No entanto, o cache não significa que seja gratuito. O sistema precisa identificar a entrada de cache, recuperar seus dados e disponibilizar o estado de modelo associado durante a inferência.
O estado de modelo relevante costuma ser chamado de cache de chave-valor, ou cache KV. Ele armazena informações de atenção derivadas de tokens anteriores, permitindo que o modelo continue sem recalcular todas as posições precedentes.
Prompts mais longos criam caches KV maiores. Mais sessões simultâneas de agentes criam mais deles. Fluxos de trabalho de longa duração também podem exigir acesso repetido a um contexto armazenado substancial.
Isso desloca o gargalo de infraestrutura. A computação continua importante, mas a capacidade de memória, a largura de banda de memória e a movimentação de dados tornam-se cada vez mais relevantes.
É por isso que a parcela em cache não torna os dados da OpenRouter irrelevantes. Ela muda o significado dos dados.
O gráfico é uma evidência mais fraca de demanda por raciocínio novo. É uma evidência mais forte de que sistemas de agentes transportam repetidamente históricos extensos em muitas chamadas de modelo.
A diferença se assemelha a consultar repetidamente a mesma grande pasta de projeto. Reler páginas conhecidas exige menos preparação do que analisar novas páginas, mas a pasta precisa permanecer disponível.
O cache também pode tornar financeiramente tolerável um design ineficiente de agentes. Um fluxo de trabalho pode reenviar um enorme prompt de sistema porque a leitura de cache com desconto oculta parte do custo.
Esse design ainda consome capacidade. Ele pode aumentar a latência, complicar o roteamento e criar dependência de prefixos de prompt estáveis.
Acertos de cache não são garantidos em todas as configurações. Alterar uma parte inicial do prompt pode invalidar material armazenado posteriormente no cache. Encaminhar solicitações entre provedores também pode afetar a reutilização.
Dados dinâmicos apresentam outro desafio. Se carimbos de data e hora, documentos recuperados, resultados de ferramentas ou detalhes específicos do usuário aparecem perto do início, podem reduzir a estabilidade do prefixo.
Desenvolvedores de agentes precisam, portanto, estruturar o contexto de forma deliberada. Instruções estáveis devem ficar perto do início, enquanto informações variáveis devem aparecer após seções reutilizáveis, quando o comportamento do provedor permitir.
A afinidade de sessão também pode ser importante. Solicitações que permanecem associadas a um provedor compatível têm maior probabilidade de reutilizar contexto anterior do que solicitações encaminhadas de forma imprevisível.
O número de 85% também merece atribuição cuidadosa. Segundo a reportagem de origem, ele apareceu no enquadramento da a16z sobre dados da OpenRouter. A análise original da OpenRouter também foi descrita como mostrando uma parcela menor sob outro cálculo.
Denominadores diferentes podem produzir percentuais diferentes. Um método pode agregar todo o volume de tokens, enquanto outro calcula a média da parcela em cache entre as solicitações.
Alguns poucos fluxos de trabalho enormes podem dominar o volume total sem representar a solicitação típica. Por outro lado, uma porcentagem média por solicitação pode subestimar a influência das maiores cargas de trabalho.
Ambas as medições podem estar corretas enquanto respondem a perguntas diferentes. O gráfico público não fornece detalhes metodológicos suficientes para conciliar de forma independente todos os percentuais de cache divulgados.
A conclusão mais segura é, portanto, direcional. O contexto em cache representa a clara maioria do tráfego de tokens dos agentes, enquanto a parcela exata depende de como a plataforma agrega as solicitações.
Isso também desafia a expressão “a IA está usando IA”. Os agentes não estão necessariamente realizando trilhões de atos independentes de raciocínio. Grande parte de seu tráfego envolve restaurar o contexto necessário para continuar um trabalho delegado.
Esse comportamento ainda pode gerar valor real. Um agente de programação precisa do estado do repositório e de decisões anteriores para evitar recomeçar do zero após cada chamada de ferramenta.
A questão da eficiência está na seleção. O agente recarrega o menor contexto útil ou reenvia repetidamente tudo porque essa abordagem é mais fácil de implementar?
À medida que o volume de tokens aumenta, essa diferença se torna uma escolha relevante de engenharia. Uma gestão eficiente de contexto pode reduzir a demanda por memória sem enfraquecer o desempenho da tarefa.
Cinco Vezes Mais Tokens Não Significa Cinco Vezes Mais ROI
O volume de tokens mede a utilização, enquanto o retorno sobre o investimento depende de resultados bem-sucedidos e do custo operacional total.
Newman argumentou que as empresas se concentram demais na adoção humana ao avaliar os retornos da IA. Seu ponto mais amplo tem mérito, pois um único usuário agora pode iniciar muito mais inferência do que uma métrica de adoção baseada em chat revela.
Usuários ativos mensais podem subestimar a demanda por infraestrutura. A contagem de assentos também pode deixar de captar trabalho automatizado que continua sendo executado depois que os funcionários deixam suas mesas.
Ainda assim, substituir a contagem de usuários pela contagem de tokens cria outra métrica incompleta. Os tokens revelam atividade, mas não mostram se essa atividade gerou receita, reduziu trabalho, melhorou a qualidade ou aumentou o risco.
A proporção de cinco vezes também compara duas categorias de tráfego, e não dois atores econômicos. As solicitações dos agentes continuam sendo consequência de decisões humanas ou organizacionais.
Uma empresa não obtém retorno porque um agente consumiu mais tokens. Ela obtém retorno quando o agente conclui trabalho valioso com um nível aceitável de custo e risco.
Uma avaliação útil começa pelo sucesso da tarefa. As equipes devem perguntar se o fluxo de trabalho concluiu a ação pretendida e se uma pessoa aceitou o resultado.
A próxima questão diz respeito à intervenção. Um agente que termina sem supervisão tem um perfil operacional diferente de outro que exige correções repetidas.
A latência também importa. Um fluxo de trabalho que acaba tendo sucesso ainda pode fracassar comercialmente se os clientes precisarem esperar demais ou se as filas de infraestrutura crescerem sob carga máxima.
Em seguida vem o custo total. As cobranças por tokens são apenas um componente. Chamadas de ferramentas, serviços de busca, bancos de dados, sandboxes, observabilidade, revisões de segurança e remediação humana podem acrescentar despesas substanciais.
Resultados ajustados ao risco também importam. Um agente que modifica sistemas de produção precisa de controles mais robustos do que um agente que resume documentos públicos.
O gráfico da OpenRouter não pode responder a nenhuma dessas perguntas. Ele foi projetado para descrever tráfego, não retornos empresariais.
A mesma limitação se aplica à previsão de 10 vezes de Newman. Extrapolar a proporção pressupõe que o tráfego dos agentes continue crescendo mais rápido do que o tráfego humano sem uma correção de eficiência comparável.
Essa suposição pode falhar por vários motivos. Aplicações podem comprimir o contexto, usar modelos menores em etapas rotineiras, substituir raciocínio repetido por software determinístico e interromper loops mais cedo.
Melhorias nos modelos podem reduzir novas tentativas. Interfaces de ferramentas melhores também podem retornar informações mais limpas, reduzindo o número de chamadas necessárias para concluir uma tarefa.
A pressão econômica incentivará essas mudanças. As empresas têm incentivo para eliminar chamadas que não melhoram os resultados, mesmo quando leituras em cache são relativamente baratas.
A discussão da a16z sobre convergência de loops destaca o mesmo problema. Um agente pode continuar produzindo trabalho adicional depois que a maior parte do valor disponível já surgiu.
Um loop sem um teste externo de conclusão pode confundir atividade contínua com progresso. Ele pode editar repetidamente um documento, executar novamente um comando que falhou ou refinar uma resposta que já é aceitável.
Esse comportamento é especialmente difícil de detectar quando cada chamada individual parece razoável. O desperdício surge ao longo da trajetória completa, e não dentro de uma única resposta.
A observabilidade deve, portanto, operar no nível da tarefa. Os desenvolvedores precisam de rastreamentos que conectem cada chamada de modelo ao uso de ferramentas, mudanças de estado, erros e resultados finais.
Os orçamentos também devem refletir o valor da tarefa. Uma investigação de alto impacto pode justificar mais iterações do que uma solicitação rotineira de formatação.
Regras de escalonamento criam outro limite. Quando o agente encontra falhas repetidas ou permissões incertas, transferir o controle para uma pessoa pode ser mais barato e mais seguro.
Também há um efeito de seleção no tráfego da OpenRouter. A plataforma atende desenvolvedores que usam deliberadamente um gateway de modelos, o que pode produzir uma combinação de cargas de trabalho mais técnica do que as aplicações de consumo.
Programação e frameworks de agentes podem, portanto, ocupar uma parcela maior da OpenRouter do que ocupam em todo o mercado de IA.
A escala da OpenRouter ainda torna a tendência importante. Seus dados abrangem tráfego substancial do mundo real entre muitos modelos e provedores. Os resultados simplesmente devem permanecer vinculados a esse escopo.
As relações da plataforma introduzem outra consideração. A Andreessen Horowitz investiu na OpenRouter, o que dá à a16z interesse no crescimento da infraestrutura de roteamento de tokens.
Isso não invalida os números. Torna uma metodologia transparente e a replicação independente mais importantes, especialmente quando os dados apoiam afirmações amplas sobre a economia da IA.
A interpretação mais forte evita os dois extremos. O gráfico não é nem uma prova de que máquinas autônomas se tornaram os principais clientes da IA nem um artefato vazio do cache.
Ele é evidência de que arquiteturas de agentes ampliam a demanda por inferência. Também mostra que essa amplificação atualmente depende fortemente do transporte e da recuperação de contexto antigo.
Para compradores, a questão central não é se um agente usa muitos tokens. É se cada rodada adicional aumenta a probabilidade de um resultado bem-sucedido e valioso.
Provedores de Memória e Plataformas de Agentes Enfrentam a Pressão Imediata
A mudança no tráfego recompensa sistemas que gerenciam o contexto de forma eficiente e pressiona produtos que tratam o consumo de tokens como um indicador de progresso.
Provedores de modelos enfrentam uma carga de trabalho mais complexa do que o chat comum de solicitação e resposta. Sessões de agentes podem permanecer ativas por mais tempo, chamar ferramentas repetidamente e manter históricos crescentes.
Essa carga de trabalho pressiona programadores e sistemas de roteamento. Os provedores precisam equilibrar localidade de cache, disponibilidade de modelos, latência e confiabilidade diante de uma demanda variável.
Plataformas de gateway como a OpenRouter ganham importância estratégica porque as aplicações usam cada vez mais vários modelos. Um fluxo de trabalho pode encaminhar planejamento, programação, validação e sumarização para diferentes endpoints.
O roteamento dinâmico pode reduzir custos ou melhorar o desempenho, mas também pode interferir no cache. Uma solicitação enviada a outro provedor pode perder acesso a um cache estabelecido anteriormente.
Provedores que expõem métricas claras de cache terão vantagem junto a compradores sofisticados. As equipes precisam saber quantos tokens eram novos, estavam em cache, foram gerados ou foram gravados em armazenamento.
Fabricantes de memória também enfrentam demanda de contextos maiores e mais sessões simultâneas. A memória de alta largura de banda alimenta aceleradores de modelos, enquanto a memória e o armazenamento convencionais sustentam os sistemas ao redor.
No entanto, o gráfico não quantifica futuras compras de memória. Ele mostra tráfego de tokens, não um mapeamento exato entre cada token e nova capacidade de hardware.
A demanda por hardware depende da arquitetura do modelo, dos tipos de dados, do batching, da remoção de cache, da compressão e do número de sessões simultâneas. Melhorias de software podem alterar cada uma dessas relações.
As plataformas de agentes enfrentam pressão de outra direção. Os clientes compararão cada vez mais trabalho útil por token, e não apenas acesso a modelos capazes.
Produtos que ocultam o consumo por trás de alegações amplas de uso podem ter dificuldades quando equipes financeiras empresariais exigirem métricas econômicas no nível da tarefa. Os compradores desejarão evidências reproduzíveis em suas próprias cargas de trabalho.
Agentes de programação oferecem um teste inicial porque seus resultados podem ser avaliados com builds, testes, revisões e resultados de implantação. Esses sinais criam condições mensuráveis de interrupção.
Outros domínios continuam mais difíceis. Pesquisa, estratégia e redação frequentemente não têm um único teste objetivo. Os agentes podem continuar refinando resultados sem um momento claro de conclusão.
Essa incerteza torna a revisão humana mais importante, mesmo quando os agentes realizam a maior parte do trabalho intermediário. Ela também torna mais difícil comparar a eficiência de tokens entre fornecedores.
Fornecedores de infraestrutura podem responder com compressão de contexto, cache de prefixo, sessões com estado e sistemas de recuperação. Cada abordagem busca evitar o reenvio de histórico desnecessário.
Os desenvolvedores de aplicações podem separar a memória durável do contexto de trabalho. A memória durável armazena informações potencialmente úteis, enquanto o contexto de trabalho contém apenas o que a etapa atual exige.
Essa separação reduz a repetição de texto e limita informações irrelevantes. Ela também pode melhorar a precisão do modelo ao manter distrações fora do prompt ativo.
Softwares determinísticos devem lidar com trabalhos determinísticos. Um agente não precisa raciocinar sobre um cálculo, validação de esquema ou verificação de acesso quando um código confiável pode executá-lo diretamente.
Os sistemas mais eficientes provavelmente combinarão modelos com software convencional. Os modelos lidam com ambiguidade e planejamento, enquanto o código aplica regras e executa operações estáveis.
Esse design híbrido enfraquece a premissa de que o tráfego de agentes precisa crescer sem limites. Sistemas melhores podem concluir mais tarefas enquanto reduzem os tokens por tarefa.
Ao mesmo tempo, a queda dos custos unitários pode aumentar a demanda total. Quando cada fluxo de trabalho se torna mais barato, os desenvolvedores podem implantar agentes em mais lugares e executá-los com maior frequência.
O efeito rebote resultante pode preservar o crescimento da infraestrutura mesmo quando tarefas individuais se tornam mais eficientes. Essa possibilidade sustenta a direção da previsão de Newman, embora não sua proporção exata.
O tráfego humano também pode crescer. Produtos de consumo melhores, novas interfaces e uma adoção empresarial mais ampla podem elevar o uso direto ao lado do tráfego de agentes.
A proporção futura depende de qual curva cresce mais rapidamente. Ela não é apenas uma função da melhoria dos agentes.
A concorrência entre OpenAI, Anthropic, Google, desenvolvedores de modelos de pesos abertos e provedores especializados de inferência moldará essa curva. Suas regras de cache e capacidades de ferramentas diferem.
A escolha do modelo também pode mudar durante um fluxo de trabalho. Um modelo pequeno pode classificar uma solicitação, enquanto um modelo maior lida com uma decisão difícil.
Essa arquitetura reduz a relevância de uma única contagem agregada de tokens. Um token processado por um modelo compacto tem um perfil de recursos diferente de um processado por um modelo de fronteira.
As empresas precisarão de métricas normalizadas que combinem escolha de modelo, tipo de token, latência, energia e sucesso da tarefa. Atualmente, não há um padrão amplamente aceito que capture todo o cenário.
Até que um seja desenvolvido, o uso de tokens de agentes do OpenRouter continua sendo um indicador antecedente útil. Ele revela a forma da demanda antes que os relatórios financeiros possam explicar seu valor.
Três Sinais Colocarão à Prova a Previsão de 10x
A próxima fase deve ser avaliada pela estabilidade da classificação, pelo crescimento de tokens novos e pelo trabalho concluído por unidade de inferência.
O primeiro sinal é se a proporção entre agentes e humanos do OpenRouter continua crescendo após agosto. Um aumento sustentado apoiaria a ideia de que os fluxos de trabalho autônomos estão se expandindo mais rapidamente do que a interação direta.
A comparação deve usar o mesmo método de classificação e a mesma janela de medição. Mudanças de método poderiam criar um crescimento aparente sem uma mudança equivalente no comportamento.
O tráfego misto merece atenção especial. Se crescer mais rapidamente do que ambas as categorias, a fronteira entre o uso humano e o de agentes se tornará menos confiável.
O segundo sinal é a composição dos tokens de agentes. Uma parcela crescente de tokens em cache indicaria que a repetição de contexto, e não o novo processamento pelo modelo, continua sendo o principal motor de crescimento.
Uma parcela menor de tokens em cache, acompanhada por um volume total crescente, contaria uma história diferente. Isso sugeriria que os agentes estão realizando mais inferência nova, em vez de principalmente reproduzir contextos já estabelecidos.
Os relatórios públicos devem distinguir entrada nova, leituras de cache, gravações em cache, tokens de raciocínio e saída. Combiná-los em um único número oculta diferenças importantes de custo e demanda de infraestrutura.
O terceiro sinal é a eficiência das tarefas. Fornecedores de agentes e usuários empresariais devem informar o trabalho concluído por chamada de modelo, tokens por tarefa bem-sucedida e intervenções humanas por conclusão.
Se essas métricas melhorarem enquanto o tráfego total de agentes cresce, o argumento de crescimento se torna mais forte. Isso indicaria que a adoção e a automação bem-sucedida estão se expandindo juntas.
Se o uso de tokens aumentar enquanto o sucesso permanecer estável, o gráfico passará a descrever cada vez mais desperdício operacional. Uma proporção maior, nesse caso, enfraqueceria, em vez de fortalecer, o argumento de ROI.
Conjuntos de dados independentes também aumentariam a confiança. O tráfego de APIs diretas de modelos, plataformas de nuvem e implantações privadas poderia mostrar se o OpenRouter reflete o mercado mais amplo.
Por enquanto, as evidências sustentam uma conclusão mais restrita do que a alegação viral. Os agentes geraram mais de cinco vezes o tráfego de tokens humanos observado no OpenRouter durante agosto de 2026.
A maior parte desse tráfego parece envolver contexto em cache. Esse contexto ainda exige memória, roteamento e gestão cuidadosa, mas não deve ser confundido com uma quantidade equivalente de novo raciocínio.
A transição para 10 vezes é uma previsão, não um resultado estabelecido. Sua importância dependerá do que os tokens adicionais realizam.
Os desenvolvedores devem examinar se cada loop tem um propósito claro, um orçamento e uma condição de parada. Compradores empresariais devem exigir evidências no nível da tarefa antes de tratar o consumo como adoção.
A pergunta útil já não é se os agentes gerarão mais tráfego do que as pessoas. Os dados do OpenRouter sugerem que eles já geram. A questão é se o próximo trilhão de tokens concluirá mais trabalho ou simplesmente relerá uma parcela maior do passado.



