top of page

Os Agentes Codex da OpenAI Agora Dominam Seu Uso Interno de Tokens de IA

13 de ago.
15 min de leitura

A OpenAI afirma que o Codex agora gera 99,8% de seus tokens de saída semanais internos, uma inversão destacada por uma notícia recente do Google News sobre gastos empresariais com IA.

Esse número não demonstra gastos, receita ou produtividade. Ele mede tokens de saída — as unidades de texto geradas por um modelo — dentro da empresa que vende a tecnologia. Ainda assim, revela uma mudança significativa na forma como os funcionários da OpenAI usam IA.

O ChatGPT já foi responsável pela maior parte do trabalho interno com IA. O Codex, um agente capaz de executar tarefas mais longas e usar ferramentas, agora domina as atividades de engenharia, jurídico, finanças e recrutamento.

A disputa importante já não é entre a OpenAI e outro fornecedor de modelos. É entre a assistência baseada em chat e o trabalho delegado a agentes. Um chatbot responde a uma solicitação, enquanto um agente pode inspecionar arquivos, chamar ferramentas, revisar sua abordagem e operar por minutos ou horas.

A OpenAI apresenta essa transição como evidência de que o trabalho produtivo está migrando para agentes. A mesma transição também torna o consumo de IA mais difícil de prever, atribuir, proteger e avaliar.

Por isso, compradores empresariais enfrentam uma questão mais incisiva do que a manchete do Google News sugere. Eles precisam determinar se o aumento no uso de tokens representa trabalho delegado valioso ou um ciclo caro que gera atividade sem um resultado equivalente.

O Que a Mudança de Tokens da OpenAI Realmente Mostra

Os dados internos da OpenAI mostram uma mudança comportamental decisiva, mas não comprovam que todas as empresas alcançarão os mesmos resultados.

A OpenAI publicou sua análise em 12 de agosto de 2026. A empresa examinou a atividade do Codex entre clientes individuais, usuários organizacionais e sua própria força de trabalho.

Até agosto de 2025, o funcionário médio da OpenAI direcionava menos de 10% de seus tokens ao Codex. O ChatGPT continuava sendo a interface padrão para o uso interno de IA nesse período.

O equilíbrio mudou à medida que o Codex passou a contar com execução de maior duração, modelos melhores e suporte a tarefas paralelas. A OpenAI afirma que o funcionário médio agora produz mais de 85% dos tokens de saída por meio do Codex.

O Codex representa 99,8% dos tokens de saída semanais em toda a empresa, segundo os dados de adoção de agentes da OpenAI. A diferença entre esses dois números é relevante.

O primeiro número descreve a combinação média de atividades no Codex e no ChatGPT por funcionário. O segundo reflete o conjunto total de tokens gerados, fortemente influenciado por usuários intensivos de agentes.

Agentes naturalmente geram mais tokens do que conversas convencionais. Eles leem repetidamente o contexto, planejam ações, inspecionam resultados, chamam ferramentas e revisam seu trabalho.

Um funcionário também pode executar vários agentes ao mesmo tempo. Isso faz da participação dos tokens de saída uma medida de atividade computacional, e não uma contagem direta de trabalhadores ou tarefas concluídas.

Os usuários internos mais intensivos da OpenAI ilustram a diferença. Em junho de 2026, funcionários no percentil 99 produziam regularmente mais de 60 horas de turnos de agentes Codex por dia.

Esse número não significa que uma pessoa trabalhou por 60 horas. Ele reflete vários agentes operando em paralelo enquanto seu operador humano orientava ou revisava o trabalho.

Tarefas mais longas também se tornaram comuns entre os usuários individuais avaliados. Em maio de 2026, 80,6% haviam enviado ao menos uma solicitação ao Codex que, segundo a estimativa da OpenAI, representava mais de 30 minutos de trabalho humano.

Outros 70,2% enviaram uma solicitação estimada em mais de uma hora. Mais 25,6% enviaram ao menos uma solicitação estimada em mais de oito horas.

Essas estimativas dizem respeito ao esforço humano associado a uma tarefa, não necessariamente ao tempo de execução do agente ou à quantidade de trabalho eliminada. O método de classificação da OpenAI também não pode comprovar que todo resultado gerado foi aceito ou útil.

Mesmo com essas limitações, a direção é clara. Os usuários estão pedindo à IA que lide com unidades maiores de trabalho, em vez de solicitar respostas isoladas.

Uma interação de chat pode produzir um resumo, rascunho ou trecho de código. Um agente pode examinar um repositório, modificar vários arquivos, executar testes, interpretar falhas e tentar correções.

A distinção explica por que a atividade de IA empresarial pode crescer muito mais rápido do que o número de funcionários ou o volume de mensagens. Cada tarefa delegada contém várias interações com o modelo que permanecem ocultas por trás de uma única solicitação do usuário.

Esta é a inversão central do evento. O prompt visível está se tornando uma parte menor do trabalho, enquanto a execução autônoma consome uma parcela maior da computação.

Para as organizações, isso muda o significado da adoção de IA. Contar licenças e mensagens já não descreve a profundidade da participação dos modelos no trabalho operacional.

Também muda o limite de risco. Um chatbot normalmente propõe uma resposta, enquanto um agente pode executar ações em sistemas conectados.

Essa autoridade mais ampla faz do desenho de permissões, dos registros de auditoria, dos pontos de revisão e dos controles de custo partes da implantação. Eles já não são detalhes administrativos secundários.

Por Que os Sinais do Google News Vão Além dos Chatbots

A reportagem do Google News é relevante porque os dados da OpenAI conectam a crescente demanda por tokens a agentes que se espalham além da engenharia de software.

O Codex começou como um produto associado à programação. Os engenheiros foram os primeiros funcionários a transferir a maior parte de seu uso da OpenAI do ChatGPT para o agente.

O engenheiro médio da OpenAI cruzou esse limiar em dezembro de 2025. A OpenAI agora afirma que o engenheiro médio gera 99% dos tokens de saída por meio do Codex, em vez do ChatGPT.

A transição mais reveladora ocorreu em outras áreas. Jurídico, finanças e recrutamento passaram a usar o Codex de forma majoritária por volta de abril de 2026, depois que os engenheiros já haviam estabelecido o padrão.

A OpenAI informa que o advogado ou recrutador médio agora gera mais de 85% dos tokens de saída por meio do Codex. Isso não significa que esses funcionários passam a maior parte do dia programando.

Em vez disso, o Codex se tornou um ambiente geral de execução. Usuários não técnicos o empregam para automação, análise estruturada, transformação de dados, depuração e ferramentas internas.

A divisão ocupacional da OpenAI reforça essa interpretação. Mais de um quarto do trabalho no Codex gerado por funcionários em funções de negócios se enquadrou em categorias de engenharia ou programação.

Em finanças e operações de negócios, engenharia ou programação representou 31% da produção classificada do Codex. Trabalho do conhecimento representou 34%, enquanto a análise financeira respondeu por 16%.

Para funcionários de produto, marketing e operações, o trabalho do conhecimento representou 51% da produção classificada. Engenharia ou programação correspondeu a outros 25%.

Essas categorias sugerem que os agentes estão reduzindo a barreira prática entre solicitar trabalho técnico e tentar executá-lo diretamente. Elas não demonstram que especialistas deixaram de ser necessários.

Um recrutador pode pedir a um agente que transforme dados de várias fontes em um fluxo de trabalho interno. Um funcionário de finanças pode pedir que ele reconcilie arquivos, construa uma análise repetível ou teste uma pequena ferramenta.

O funcionário continua responsável pelo contexto, julgamento, autorização e revisão. No entanto, o caminho de execução pode incluir código sem exigir um projeto convencional de software.

A adoção por não desenvolvedores cresceu rapidamente nas três populações estudadas pela OpenAI. De agosto de 2025 ao início de junho de 2026, os usuários semanais não desenvolvedores aumentaram 137 vezes entre usuários individuais.

A OpenAI relatou um aumento de 189 vezes entre usuários organizacionais e de 12 vezes em sua própria força de trabalho. Esses múltiplos partem de bases diferentes, portanto não devem ser comparados como níveis equivalentes de adoção.

Ainda assim, eles sustentam a mesma constatação direcional. O uso de agentes está se expandindo além do público técnico que primeiro adotou o Codex.

O padrão também se encaixa nos relatórios empresariais mais amplos da OpenAI. Seu estudo sobre uso empresarial afirma que o volume de mensagens do ChatGPT cresceu oito vezes, enquanto o consumo de tokens de raciocínio por organização de API aumentou aproximadamente 320 vezes em relação ao ano anterior.

Esse estudo anterior abrangeu mais do que o Codex. Incluiu uso agregado dos produtos empresariais da OpenAI e uma pesquisa com 9.000 trabalhadores de quase 100 organizações.

A OpenAI também relatou mais de um milhão de clientes empresariais e mais de sete milhões de assentos no ambiente de trabalho. Quase 200 organizações haviam processado, cada uma, mais de um trilhão de tokens.

Juntos, esses números descrevem duas curvas de adoção. O volume de mensagens voltadas a humanos está aumentando, mas a computação dentro de fluxos de trabalho integrados e de múltiplas etapas está crescendo muito mais rápido.

É por isso que o chat está se tornando uma unidade incompleta para medir a IA empresarial. Uma mensagem pode iniciar uma longa sequência de inferência, recuperação, uso de ferramentas, validação e revisão.

A mudança pressiona vários grupos ao mesmo tempo. Equipes financeiras precisam prever o consumo variável. Equipes de segurança precisam governar o acesso aos sistemas. Gestores precisam decidir qual trabalho merece capacidade contínua.

Os funcionários também enfrentam uma nova forma de responsabilidade operacional. Executar muitos agentes pode parecer produtivo, mas a atividade paralela não é o mesmo que trabalho concluído e aceito.

As organizações precisarão de evidências compartilhadas sobre o que ocorreu durante uma execução de agente. Uma base de conhecimento de IA pesquisável pode preservar o contexto relevante, mas não pode substituir permissões ou avaliação formal.

A oportunidade é real. Os agentes podem ajudar trabalhadores a cruzar fronteiras técnicas e concluir tarefas que antes ficavam paradas na fila de outra equipe.

O desafio de gestão é igualmente real. As empresas precisam identificar onde essa autonomia produz valor repetível e onde ela apenas multiplica chamadas ao modelo.

Assistência por Chat e Execução por Agentes Seguem Economias Diferentes

Os agentes transformam a IA empresarial de um serviço majoritariamente ditado pelo ritmo do usuário em uma carga de trabalho variável, cujo consumo depende do comportamento de execução.

O chat tradicional impõe um limite natural à atividade. Uma pessoa faz uma pergunta, espera uma resposta, avalia-a e decide se continua.

A execução por agentes remove algumas dessas pausas. O sistema pode escolher a próxima ação, trazer resultados anteriores de volta ao contexto e continuar até alcançar uma condição de parada.

Cada ciclo pode adicionar tokens de entrada à medida que o agente relê instruções, arquivos, respostas de ferramentas e seu histórico acumulado. Os tokens de saída capturam apenas parte dessa carga de trabalho total.

Tarefas longas também encontram ramificações. Um agente pode tentar uma implementação, inspecionar um erro, revisar seu plano e executar outro teste.

Essas tentativas podem ser produtivas, porque o trabalho real raramente segue um plano perfeito na primeira vez. Elas também podem se tornar desperdício quando o agente não tem a informação, a permissão ou a capacidade necessária para concluir a tarefa.

Isso faz do modelo mais barato uma resposta incompleta para o controle de custos. Um modelo menos capaz pode usar menos recursos por chamada, mas exigir mais tentativas e mais correção humana.

A OpenAI apresenta esse argumento em sua orientação sobre investimentos em IA. Ela recomenda medir tarefas concluídas, tempo economizado, decisões aprimoradas e fluxos de trabalho prontos para escalar.

A empresa afirma que o preço por milhão de tokens caiu 97% entre GPT-4 e GPT-5.4. Também afirma que o GPT-5.6 usou 54% menos tokens de saída em um índice de agentes de programação e concluiu tarefas 57% mais rápido.

Esses são resultados de benchmark relatados pela OpenAI, não uma garantia para a carga de trabalho de cada cliente. O contexto, as ferramentas, os critérios de avaliação e os custos de falha de uma empresa podem alterar o resultado.

A queda dos custos unitários não reduz necessariamente o gasto total. O uso pode se expandir mais rapidamente do que a eficiência melhora, sobretudo quando os agentes executam tarefas por mais tempo e operam simultaneamente.

Essa dinâmica se assemelha mais à computação em nuvem do que ao licenciamento convencional de software. A demanda depende do comportamento em tempo de execução, do design da carga de trabalho, da seleção de modelos, do tamanho do contexto e da execução repetida.

Ela também introduz um problema de medição. Uma alta contagem de tokens pode indicar automação valiosa, uma tarefa difícil, contexto desnecessário, falhas repetidas ou um agente que não para de forma eficiente.

Pesquisas independentes dão aos compradores motivos para tratar o consumo com cautela. Um artigo de 2026 que examinou tarefas de programação concluiu que cargas de trabalho agênticas usavam muito mais tokens do que chats ou raciocínios sobre código.

Os pesquisadores relataram diferenças de consumo que chegaram a 1.000 vezes em seu ambiente experimental. Execuções da mesma tarefa variaram em até 30 vezes.

O maior uso de tokens não produziu consistentemente maior precisão. O desempenho frequentemente atingiu o pico em um nível intermediário e depois se estabilizou à medida que o consumo aumentava.

O estudo também constatou que os modelos tiveram dificuldade para prever suas próprias necessidades de tokens. As correlações relatadas chegaram apenas a 0,39, e as estimativas subestimavam sistematicamente o uso real.

Essas conclusões vêm de um conjunto específico de tarefas e modelos de programação. Elas não devem ser generalizadas como um multiplicador universal para todos os agentes empresariais.

Elas demonstram, porém, por que um orçamento simples por prompt se torna pouco confiável. A mesma solicitação pode produzir caminhos de execução e demandas de recursos substancialmente diferentes.

A resposta empresarial já é visível. A OpenAI adicionou, em junho de 2026, uma visão consolidada do consumo de créditos do ChatGPT e do Codex ao seu Global Admin Console.

Administradores podem examinar o uso por usuário, produto e modelo. Também podem definir padrões para o espaço de trabalho, limites por grupo e substituições individuais por meio das ferramentas de controle de gastos da empresa.

A Databricks introduziu controles semelhantes em seu Unity AI Gateway. O sistema pode impor limites, detectar consumo descontrolado e recomendar modelos menos caros para trabalhos adequados.

Essa camada emergente de controle revela para onde o mercado está caminhando. O acesso a modelos, por si só, está se tornando insuficiente para a implantação empresarial.

As organizações precisam de atribuição, políticas, avaliação e intervenção em torno desse acesso. Elas precisam conectar o consumo a uma equipe responsável e a um processo de negócios definido.

Portanto, a unidade de medida mais forte não é o token. É o resultado concluído sob requisitos acordados de qualidade, risco e revisão.

Para um agente de programação, isso pode ser uma alteração aceita que passa por testes e revisão de segurança. Para finanças, pode ser um relatório conciliado com entradas rastreáveis.

Para recrutamento, pode ser um fluxo de trabalho que reduz o esforço administrativo sem tomar decisões não autorizadas sobre candidatos. Cada resultado exige evidências diferentes.

Esse modelo econômico favorece fluxos de trabalho que se repetem com frequência e podem ser avaliados com clareza. Ele penaliza tarefas vagas cujo sucesso depende de impressões subjetivas.

A mudança para agentes não torna inútil a medição de tokens. Ela faz das contagens de tokens um sinal operacional entre vários, em vez de um substituto para o valor de negócios.

O Que os Números de Tokens Não Comprovam

Os números dramáticos de adoção interna da OpenAI demonstram demanda e intensidade, mas deixam sem resposta os resultados de produtividade, qualidade e segurança.

A primeira limitação é a seleção. A OpenAI é a desenvolvedora do Codex, emprega pessoas confortáveis com IA experimental e pode oferecer a elas um suporte de produto incomumente direto.

Sua força de trabalho não é uma amostra representativa de bancos, hospitais, órgãos governamentais, fabricantes ou pequenas empresas. Essas organizações operam sob restrições técnicas e regulatórias diferentes.

A OpenAI também se beneficia quando clientes interpretam um uso maior como evidência de adoção mais profunda. Seus dados merecem atenção, mas os leitores devem distinguir o comportamento medido da previsão mais ampla da empresa.

A segunda limitação diz respeito aos tokens como métrica de sucesso. O volume de saída mostra que os modelos geraram texto ou código. Ele não revela quanto os usuários aproveitaram.

Um agente pode produzir um grande patch que um desenvolvedor rejeita. Pode gerar uma análise que um funcionário reescreve ou criar uma automação que nunca chega à produção.

As estimativas da OpenAI para tarefas de longa duração trazem uma ressalva semelhante. Uma tarefa classificada como oito horas de trabalho humano não economiza automaticamente oito horas.

O usuário ainda pode gastar tempo preparando entradas, monitorando a execução, verificando fontes, resolvendo erros e integrando o resultado. Parte do trabalho talvez não tivesse acontecido sem o agente.

Essa produção ampliada ainda pode ser valiosa. No entanto, o trabalho evitado é apenas um possível benefício e exige medição direta.

A terceira limitação é a confiabilidade. Tarefas mais longas criam mais oportunidades para erros, suposições desatualizadas, escolhas incorretas de ferramentas ou falhas iniciais que afetam etapas posteriores.

Agentes com acesso a sistemas empresariais também criam uma fronteira de segurança mais ampla. Uma resposta defeituosa é prejudicial, mas uma ação não autorizada pode ser muito mais difícil de reverter.

As permissões devem, portanto, corresponder à tarefa, e não à capacidade máxima do agente. Acesso de leitura, acesso de escrita, comunicação externa e ações irreversíveis merecem controles separados.

As equipes de segurança também precisam de registros que conectem uma solicitação humana a cada ação de ferramenta. Sem essa cadeia, a resposta a incidentes e a responsabilização se tornam difíceis.

O monitoramento de custos pode criar outra tensão. As empresas precisam de visibilidade suficiente para identificar desperdícios e credenciais comprometidas, mas a vigilância detalhada de funcionários pode enfraquecer a confiança.

Um administrador pode precisar saber que um fluxo de trabalho chama repetidamente um modelo caro. Ele não precisa necessariamente de acesso irrestrito a conteúdo sensível.

Uma boa governança separa metadados operacionais de conteúdo de negócios sempre que possível. Ela também define quem pode inspecionar cada camada e em quais circunstâncias.

A quarta limitação envolve a generalização além da programação. O Codex pode ajudar pessoas que não são desenvolvedoras, mas os dados da OpenAI ainda mostram programação e engenharia como categorias importantes.

O trabalho técnico estruturado oferece validação relativamente clara. Testes podem ser executados, arquivos podem ser comparados e erros podem disparar outra tentativa.

Análise jurídica, apoio à contratação, estratégia e interpretação financeira frequentemente contêm requisitos mais subjetivos. Os erros podem persistir por mais tempo porque a validação automatizada é mais fraca.

Essa diferença torna a avaliação de resultados mais importante à medida que os agentes passam a atuar em funções de negócios. As empresas não devem presumir que velocidade de adoção equivale a prontidão.

O sentimento público já mudou em direção a essa distinção. Uma análise sobre gastos com IA, publicada em julho, descreveu uma resistência crescente ao "tokenmaxxing", a prática de tratar alto consumo como uma conquista.

O analista da Moody's Vincent Gusdorf alertou que a IA pode facilitar a criação de trabalho de que uma organização não precisa. Essa crítica vai diretamente à fraqueza dos sinais de status baseados em tokens.

O consumo elevado pode ser racional quando um agente produz um resultado valioso. Torna-se mais difícil de defender quando nenhum responsável consegue conectar a atividade a um resultado aceito.

A posição cética correta não é a de que os agentes são meramente chatbots desperdiçadores. Os dados de adoção da OpenAI são substanciais demais para serem descartados dessa forma.

A conclusão mais defensável é mais restrita. Os agentes ampliam a quantidade e o escopo de trabalho que a IA pode tentar realizar, enquanto as evidências sobre o valor empresarial efetivamente obtido continuam desiguais.

Portanto, uma empresa deve testar a tese da OpenAI em seu próprio ambiente. Isso exige linhas de base, conjuntos de avaliação, custos de revisão, taxas de falha e resultados mensuráveis.

Ela também deve comparar um fluxo de trabalho com agente a alternativas realistas. Essas alternativas incluem execução humana, software convencional, uma interação de chat mais curta e um modelo menor.

Somente então os líderes poderão identificar se o uso crescente de tokens representa alavancagem ou atrito. Os índices internos da OpenAI não podem responder a essa pergunta por eles.

Três Sinais que Compradores Empresariais Devem Acompanhar em Seguida

A próxima fase será decidida por relatórios de resultados, retenção de usuários não técnicos e controles de segurança, e não por mais um recorde de contagem de tokens.

O primeiro sinal é se os fornecedores conectam o consumo dos agentes a resultados de negócios concluídos. Os painéis de uso atualmente enfatizam créditos, usuários, modelos e tendências.

Essas visualizações ajudam administradores a encontrar demandas inesperadas. Ainda assim, não mostram se um fluxo de trabalho produziu um resultado aceito.

Os compradores devem procurar relatórios vinculados a alterações de código aprovadas, casos de suporte resolvidos, análises concluídas ou outras saídas específicas de domínio. O custo por resultado aceito tornaria as comparações mais significativas.

Se os fornecedores entregarem uma atribuição de resultados confiável, o argumento da OpenAI se fortalecerá. As empresas poderão financiar fluxos de trabalho de alto consumo quando o valor resultante estiver visível.

Se os relatórios continuarem centrados em tokens e tempo estimado, o ceticismo crescerá. As organizações terão dificuldade para separar trabalho produtivo intensivo de trabalho fracassado intensivo.

O segundo sinal é o uso sustentado do Codex fora da engenharia. A OpenAI relata um crescimento marcante entre funcionários de jurídico, finanças, recrutamento, marketing e operações.

A próxima pergunta é se esses usuários continuam após a experimentação inicial. A retenção importa mais do que um aumento rápido a partir de uma base inicial pequena.

As empresas devem observar quais tarefas não técnicas se tornam fluxos de trabalho repetíveis. Também devem acompanhar com que frequência especialistas precisam resgatar ou reconstruir trabalhos gerados por agentes.

O uso contínuo com qualidade estável sustentaria a afirmação da OpenAI de que os agentes permitem que funcionários atravessem fronteiras funcionais. A queda na retenção sugeriria que o valor mais forte continua concentrado em equipes técnicas.

O terceiro sinal é a maturidade dos controles em torno da ação dos agentes. Os limites de gastos estão chegando rapidamente, mas o custo representa apenas uma parte do risco operacional.

As organizações também precisam de permissões no nível da tarefa, pontos de aprovação, chamadas de ferramentas auditáveis, isolamento de credenciais e encerramento confiável quando o comportamento sai dos limites definidos.

Essas salvaguardas devem funcionar em vários modelos e ferramentas. As empresas raramente padronizam todos os fluxos de trabalho em um único fornecedor para sempre.

O progresso nesse ponto tornaria mais fácil justificar uma delegação mais ampla, especialmente em setores regulados. Controles fracos ou fragmentados desacelerariam a adoção, independentemente da capacidade do modelo.

Esses três sinais estão conectados. Os relatórios de resultados explicam por que um agente merece recursos. A retenção mostra se os funcionários o consideram útil depois que a novidade passa.

Segurança e governança determinam se a organização pode permitir que esse agente realize trabalho consequente. A ausência de qualquer um dos três pode impedir uma implantação bem-sucedida.

A manchete do Google News captura uma mudança real do chat para os agentes, mas a participação de tokens é o início da história. Não é o placar final.

A OpenAI mostrou que seus funcionários delegam cada vez mais tarefas longas e complexas ao Codex. Ela não mostrou que 99,8% dos tokens de saída entregam uma parcela equivalente de valor organizacional.

Antes de celebrar ou restringir esse consumo, os compradores empresariais devem fazer uma pergunta prática: quais resultados concluídos se tornaram possíveis e quais evidências provam que eles valeram o risco?

Essa pergunta oferece um guia melhor do que o volume de tokens isoladamente. Ela permite que as organizações ampliem os fluxos de trabalho que funcionam, restrinjam aqueles que se desviam e avaliem a adoção de agentes pelos resultados, e não pela atividade.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page