Anthropic reduz preços de cache do Claude Sonnet 5.5, igualando a OpenAI em US$ 0,10
A Anthropic reduziu em 50% o preço de cache do Claude Sonnet 5.5, baixando as leituras de cache de US$ 0,20 para US$ 0,10 por milhão de tokens. A empresa afirma que a mudança torna o Sonnet 5.5 cerca de 20% mais barato para a maioria dos trabalhos com agentes, nos quais aplicações reutilizam repetidamente instruções extensas e contexto.
Essa ressalva importa. A Anthropic não reduziu as tarifas padrão de entrada ou saída do modelo. Ela alterou um componente que se torna importante quando um agente envia repetidamente o mesmo prompt de sistema, definições de ferramentas, contexto de repositório ou material de referência.
A medida também alinha a tarifa de leitura de cache do Sonnet 5.5 à do GPT-6.1 Sol, da OpenAI. Ambos os modelos agora exibem os mesmos preços para entrada padrão, entrada em cache e saída. Isso desloca a competição das tarifas de tokens em destaque para uma questão mais difícil: qual modelo conclui uma tarefa confiável com menos solicitações, menos tokens gerados e menos retrabalho?
O preço de cache do Claude Sonnet 5.5 cai pela metade
A mudança imediata é limitada, mas mira um dos maiores custos recorrentes em fluxos de trabalho de agentes de longa duração.
A Anthropic anunciou a redução em 7 de outubro de 2026, juntamente com o lançamento do Claude Haiku 5.5. Seu anúncio do modelo afirma que as leituras de cache do Sonnet 5.5 agora custam US$ 0,10 por milhão de tokens, em vez de US$ 0,20, com vigência a partir daquele dia.
Uma leitura de cache ocorre quando uma aplicação reutiliza conteúdo de prompt armazenado anteriormente. Em vez de processar esse conteúdo novamente pela tarifa integral de entrada, o provedor recupera o prefixo correspondente e cobra a tarifa menor de leitura de cache.
O recurso é mais relevante quando as solicitações contêm um prefixo grande e estável. Um agente de programação pode enviar repetidamente instruções do repositório, descrições de ferramentas, padrões de código e arquivos-fonte selecionados. Um sistema de pesquisa pode reutilizar um manual extenso de políticas ou uma coleção de documentos em muitas perguntas.
Agentes de atendimento ao cliente podem seguir o mesmo padrão. Eles frequentemente levam para cada interação um prompt de sistema estável, catálogo de produtos, regras de escalonamento e esquemas de ferramentas. Apenas a mensagem mais recente do cliente e o estado de trabalho mais recente do agente mudam.
Nos preços atuais do Sonnet 5.5, a Anthropic lista a entrada padrão a US$ 2 por milhão de tokens e a saída a US$ 10 por milhão. Um acerto de cache agora custa 5% da tarifa padrão de entrada, abaixo dos 10% anteriores.
As gravações de cache continuam mais caras do que a entrada comum porque o conteúdo reutilizável precisa primeiro ser armazenado. A Anthropic lista gravações de cache de cinco minutos a US$ 2,50 por milhão de tokens e gravações de uma hora a US$ 4 por milhão. O preço menor de leitura só compensa quando uma aplicação reutiliza o prefixo armazenado vezes suficientes.
Considere uma carga de trabalho simplificada que envia 100.000 tokens estáveis em 100 solicitações. Sem cache, esses tokens repetidos representam 10 milhões de tokens de entrada padrão. Com um cache efetivo, a primeira solicitação grava o prefixo, enquanto as solicitações posteriores recuperam a maior parte dele pela tarifa de leitura de cache.
A nova tarifa reduz pela metade a parcela de leitura desse exemplo. Ela não reduz o custo de novas entradas, criação de cache, saída do modelo, ferramentas externas, tentativas repetidas ou tarefas que falharam.
A redução estimada de 20% pela Anthropic, portanto, descreve o que a empresa chama de “a maioria dos trabalhos com agentes”. Não se trata de um desconto universal em todas as solicitações ao Sonnet 5.5. Prompts curtos, baixas taxas de acerto de cache ou cargas de trabalho intensivas em saída terão uma redução menor.
O corte de preço segue o lançamento do Sonnet 5.5 em 28 de setembro. Em seu lançamento original do Sonnet 5.5, a Anthropic precificou leituras de cache em US$ 0,20 e afirmou que o modelo normalmente exigia menos tokens do que o Sonnet 5.
Essa alegação no lançamento já posicionava a eficiência no nível da tarefa, e não apenas no nível dos tokens. A Anthropic afirmou que o Sonnet 5.5 poderia custar até 30% menos por tarefa do que seu antecessor e gerar saídas mais de 30% mais rápido.
O ajuste de cache adiciona outra alavanca de eficiência menos de duas semanas depois. Ele também reforça a mensagem da Anthropic de que agentes persistentes, e não respostas isoladas de chatbots, estão se tornando a unidade relevante.
Por que agentes de longa duração tornam os acertos de cache mais valiosos
Os agentes consomem repetidamente o mesmo contexto, portanto a economia do cache pode importar mais do que uma pequena mudança no preço da entrada comum.
Uma solicitação convencional a um chatbot pode incluir uma instrução breve e uma mensagem do usuário. Uma aplicação baseada em agentes geralmente leva muito mais estrutura para cada chamada ao modelo.
Essa estrutura pode incluir uma política operacional, dezenas de definições de ferramentas, histórico da tarefa, registros recuperados, documentação de software e um plano montado em etapas anteriores. Muitos componentes permanecem inalterados enquanto o agente pesquisa, edita arquivos, chama serviços e verifica seu resultado.
O cache de prompts armazena um prefixo reutilizável dessa solicitação. Chamadas posteriores podem recuperar o conteúdo correspondente por uma tarifa reduzida, em vez de cobrar cada token como entrada nova.
O cache não significa que o modelo se lembre de informações permanentemente. Trata-se de um mecanismo de cobrança e processamento para conteúdo de prompt correspondente dentro de um período definido de duração do cache. Se o prefixo mudar, expirar ou não atender às regras de cache do provedor, a aplicação precisa gravá-lo novamente.
Essa distinção cria três variáveis práticas.
Primeiro, os desenvolvedores precisam de uma alta taxa de acerto de cache. Instruções e ferramentas estáveis devem aparecer antes das mensagens que mudam com frequência. Alterações desnecessárias no prefixo armazenado em cache podem invalidar a reutilização.
Segundo, a aplicação precisa de chamadas repetidas suficientes para recuperar o custo adicional da gravação em cache. Um prefixo usado uma vez não oferece economia de leitura. Um prefixo usado centenas de vezes pode tornar a tarifa de leitura um componente importante do custo.
Terceiro, a geração de saída continua importando. A saída do Sonnet 5.5 custa US$ 10 por milhão de tokens, 100 vezes sua nova tarifa de leitura de cache. Um agente que gera explicações longas, se repete ou entra em ciclos de novas tentativas pode anular os ganhos do contexto armazenado em cache mais barato.
É por isso que a redução percentual varia conforme a aplicação. O valor de 20% da Anthropic implica uma carga de trabalho em que leituras de cache representam uma parcela substancial, mas não dominante, da fatura original.
Um modelo simples de custos torna essa relação mais clara. Suponha que leituras de cache anteriormente representassem 40% dos gastos de uma carga de trabalho com o modelo. Cortar esse componente pela metade reduz o total em 20%. Se leituras de cache representassem apenas 10%, a mesma mudança de preço reduziria o gasto total em 5%.
Nenhum dos exemplos prevê a fatura de um cliente específico. Eles mostram o que precisa ser verdade para que a alegação média da Anthropic se sustente.
Os maiores beneficiários provavelmente serão sistemas com prefixos longos e reutilizáveis, além de muitas chamadas sequenciais. Agentes de programação se encaixam nesse padrão porque instruções de repositório e definições de ferramentas costumam persistir durante toda uma tarefa.
A análise de documentos também pode se beneficiar. Uma equipe pode colocar um contrato extenso, uma especificação técnica ou um pacote de pesquisa em um prefixo armazenado em cache e, em seguida, fazer uma série de perguntas focadas.
Agentes para trabalho intelectual têm necessidades semelhantes. Eles podem consultar repetidamente políticas estáveis da empresa, registros de reuniões ou documentação de projeto enquanto produzem um relatório. As equipes que desenvolvem esses sistemas ainda precisam de uma seleção disciplinada de contexto, semelhante à manutenção de uma base de conhecimento de engenharia pesquisável.
Armazenar em cache um contexto mal organizado não o torna útil. Apenas torna sua transmissão repetida mais barata. Uma recuperação de informações deficiente ainda pode preencher o prompt com material irrelevante e fazer o modelo gastar tokens de saída resolvendo ambiguidades.
A própria documentação de cache de prompts da Anthropic recomenda colocar conteúdo estático perto do início de um prompt e conteúdo dinâmico mais adiante. Essa estrutura aumenta a probabilidade de solicitações posteriores corresponderem a um prefixo armazenado.
Os desenvolvedores também devem monitorar separadamente os contadores de criação e leitura de cache. Uma baixa proporção entre leituras e gravações pode revelar durações curtas de cache, prefixos instáveis, mudanças de roteamento ou solicitações que nunca reutilizam seu contexto armazenado.
O novo preço de cache do Claude Sonnet 5.5 torna essas decisões de engenharia mais valiosas. Ele não elimina a necessidade de medi-las.
Anthropic e OpenAI agora compartilham as mesmas tarifas principais
O corte neutraliza uma vantagem visível de preço da OpenAI e força os compradores a comparar o custo de concluir tarefas inteiras.
A OpenAI apresentou o GPT-6.1 Sol com as mesmas tarifas de US$ 2 para entrada e US$ 10 para saída cobradas pela Anthropic no Sonnet 5.5. No entanto, o GPT-6.1 Sol foi lançado com entrada em cache a US$ 0,10 por milhão de tokens.
Antes da redução da Anthropic, uma aplicação que comparasse apenas esses três campos da tabela de preços veria uma diferença clara. A entrada em cache do Sonnet 5.5 custava o dobro.
Essa diferença agora desapareceu. O Sonnet 5.5 e o GPT-6.1 Sol listam ambos:
Entrada padrão a US$ 2 por milhão de tokens
Entrada em cache a US$ 0,10 por milhão de tokens
Gravações de cache a US$ 2,50 por milhão de tokens para a duração básica de cache
Saída a US$ 10 por milhão de tokens
A OpenAI afirma que a entrada em cache do GPT-6.1 Sol custa 5% de sua tarifa padrão de entrada. Sua documentação do modelo também lista uma janela de contexto de 1,05 milhão de tokens e suporte para várias configurações de esforço de raciocínio.
As tarifas equivalentes tornam uma comparação simples de preços menos útil. Dois agentes podem usar modelos com preços de tokens idênticos e ainda gerar faturas muito diferentes.
Um modelo pode resolver um problema de programação em oito chamadas. Outro pode precisar de 15 chamadas, gerar mais tokens de raciocínio, invocar ferramentas adicionais ou repetir um patch malsucedido. O segundo sistema pode custar mais, apesar de uma tabela de preços idêntica.
A confiabilidade muda novamente o cálculo. Uma primeira tentativa barata oferece pouco valor se uma pessoa precisar identificar um erro, restaurar trabalho danificado e executar a tarefa novamente. A medida economicamente relevante é o custo de um resultado aceito.
A latência também tem um custo. Um agente que conclui o trabalho com menos etapas sequenciais pode liberar capacidade computacional e reduzir o tempo de espera do usuário. Isso pode importar mais do que uma pequena diferença nos gastos com tokens em produtos interativos.
A Anthropic busca enquadrar o Sonnet 5.5 em torno dessa medida no nível da tarefa. A empresa reporta um resultado de 70,6% no Terminal-Bench 4.0, que avalia tarefas profissionais de múltiplas etapas em um ambiente de linha de comando.
A Anthropic também afirma que o Sonnet 5.5 é mais de 30% mais rápido que o Sonnet 5 e pode usar menos tokens para o mesmo trabalho. Esses são resultados reportados pela empresa, e o desempenho em produção depende da estrutura do agente, dos prompts, das ferramentas e da distribuição de tarefas.
A OpenAI faz suas próprias alegações de desempenho e eficiência para o GPT-6.1 Sol. Seu anúncio de lançamento descreve o modelo como próximo das capacidades do GPT-6 Astra, com tarifas padrão de tokens mais baixas.
O conjunto de benchmarks de nenhuma das empresas apresenta um vencedor universal. Os testes da Anthropic usam configurações específicas de esforço e de agentes. As avaliações da OpenAI usam seu próprio ambiente de pesquisa e reconhecem que o comportamento da API pode variar.
Para compradores corporativos, a comparação prática agora exige um conjunto de avaliação representativo. As equipes precisam medir a conclusão bem-sucedida, a aceitação humana, as chamadas de ferramentas, os tokens em cache, a entrada sem cache, a saída, a latência e as novas tentativas.
Elas também devem testar as mesmas restrições operacionais. Dar a um modelo ferramentas adicionais, um pacote de contexto diferente ou uma configuração de raciocínio mais generosa torna a comparação de custos pouco confiável.
A principal disputa já não é o preço de cache do Sonnet contra o da OpenAI. É a alegação da Anthropic de conclusão eficiente de tarefas diante da realidade da carga de trabalho em produção de cada cliente.
A Alegação de Economia de 20% Tem Limites Importantes
A estimativa da Anthropic é plausível para agentes com uso intenso de cache, mas não deve ser tratada como uma redução automática dos custos operacionais totais.
A primeira limitação é a elegibilidade para cache. As aplicações só recebem o preço mais baixo quando as solicitações geram acertos reais de cache. Conteúdo semelhante não é necessariamente conteúdo idêntico.
Mover uma definição de ferramenta, alterar um carimbo de data e hora, reordenar documentos recuperados ou modificar uma instrução inicial do sistema pode invalidar o prefixo reutilizável. Pequenas decisões de arquitetura podem, portanto, determinar se a tarifa anunciada se aplica.
A segunda limitação é a duração do cache. A Anthropic oferece diferentes períodos de armazenamento com preços de gravação distintos. Um sistema com longas pausas entre solicitações pode precisar gravar o cache repetidamente, reduzindo sua economia líquida.
A terceira limitação é o custo de saída. As leituras de cache agora são baratas, mas os tokens gerados continuam muito mais caros. Longas cadeias de raciocínio, respostas prolixas e correções repetidas podem dominar a conta final.
A quarta limitação é a sobrecarga de orquestração. Os agentes frequentemente chamam sistemas de busca, navegadores, bancos de dados, ambientes de execução de código ou APIs de terceiros. A redução no preço do modelo da Anthropic não diminui essas cobranças.
A quinta limitação é a revisão humana. Um modelo que produz trabalho barato, mas pouco confiável, pode aumentar os custos de mão de obra. Esse risco é especialmente importante para alterações de software, fluxos de trabalho regulados e ações que afetam dados de clientes.
Até o anúncio original do Sonnet 5.5 pela Anthropic alerta que benchmarks capturam apenas um aspecto da capacidade de um modelo. A empresa afirma que o Opus 5.5 continua mais forte para tarefas complexas e abertas que exigem julgamento sustentado.
Isso cria uma escolha de roteamento. Os desenvolvedores podem atribuir trabalhos rotineiros e bem delimitados ao Sonnet 5.5, reservando decisões mais difíceis para um modelo maior. No entanto, o roteamento incorreto pode fazer o Sonnet falhar repetidamente antes que o sistema escale o caso.
Um roteador mal projetado pode desperdiçar mais dinheiro do que o desconto de cache economiza. As equipes devem medir a rota completa, incluindo tentativas malsucedidas e chamadas de escalonamento.
A comparação com o GPT-6.1 Sol traz outra complicação. Preços de destaque equivalentes não significam que os provedores implementem o cache de forma idêntica.
O guia de cache da OpenAI informa que os modelos mais recentes oferecem pontos de interrupção explícitos ou implícitos, dependendo do modelo. Também descreve comprimentos mínimos de prompt e regras de relatório que afetam quais tokens se qualificam.
A Anthropic usa seus próprios controles de cache, durações, pontos de interrupção e relatórios de uso. Migrar um agente entre provedores pode exigir a reestruturação dos prompts antes que sua taxa de acerto de cache se torne comparável.
A distribuição em nuvem pode complicar ainda mais o cenário. O Sonnet 5.5 está disponível pela Anthropic e por plataformas parceiras, mas preços, disponibilidade regional e cronograma de recursos podem variar conforme o provedor.
A tarifa anunciada de US$ 0,10 deve, portanto, ser verificada no endpoint específico usado em produção. Uma empresa que opera por meio de um marketplace de nuvem não deve presumir que todos os serviços regionais adotaram a mudança simultaneamente.
Há também uma questão de medição por trás da alegação de 20%. A Anthropic não publicou uma distribuição detalhada que mostre o consumo de cache entre as cargas de trabalho dos clientes. “A maior parte do trabalho agêntico” reúne programação, pesquisa, uso de navegador, suporte ao cliente e outros padrões com perfis de tokens diferentes.
A interpretação mais segura é simples. A Anthropic reduziu pela metade um preço unitário verificado. Sua porcentagem mais ampla representa a combinação de cargas de trabalho modelada ou observada pela empresa, não um resultado garantido para o cliente.
As equipes podem validar a alegação comparando várias semanas de uso. As métricas úteis incluem tokens de acerto de cache por solicitação, frequência de gravação de cache, entrada sem cache, saída, tarefas bem-sucedidas e gasto total por tarefa aceita.
Uma queda nos gastos com cache sem uma queda semelhante no custo por tarefa sinalizaria outro gargalo. Esse gargalo pode ser o comprimento da saída, tentativas malsucedidas, ferramentas externas ou o tempo de correção humana.
O Que Desenvolvedores e Compradores de IA Devem Observar em Seguida
A próxima fase testará se tarifas menores de cache melhoram a economia de produção ou simplesmente se tornam a nova referência para plataformas de agentes concorrentes.
O primeiro sinal são os dados de cobrança atualizados da Anthropic. Os desenvolvedores devem confirmar que suas solicitações ao Sonnet 5.5 recebem a nova tarifa de leitura de cache e que as plataformas parceiras expõem a mesma mudança.
Isso fortalece o argumento da Anthropic se os clientes observarem menor gasto por tarefa concluída sem alterar suas aplicações. Enfraquece a alegação mais ampla de 20% se a maioria das cargas de trabalho mostrar apenas uma pequena redução.
O segundo sinal é a precificação competitiva. A tarifa equivalente do GPT-6.1 Sol da OpenAI já parece ter eliminado a margem para a Anthropic cobrar o dobro por contexto em cache.
O Google e outros provedores de modelos enfrentam agora a mesma pressão. Os compradores esperam cada vez mais que entradas em cache custem uma pequena fração das entradas comuns, sobretudo para agentes projetados em torno de contexto persistente.
Uma nova resposta de preços mostraria que a reutilização barata de contexto se tornou um recurso competitivo padrão. A ausência de resposta sugeriria que os provedores ainda se diferenciam pela qualidade do modelo, infraestrutura ou sistemas de cache distintos.
O terceiro sinal são testes independentes no nível das tarefas. Os preços de tokens revelam como os provedores calculam uma conta, mas não mostram quanto trabalho um modelo precisa para concluir uma tarefa.
Avaliações úteis devem informar o custo por resultado aceito, e não apenas a precisão em benchmarks ou o preço por milhão de tokens. Também devem divulgar configurações de esforço, acesso a ferramentas, políticas de repetição, taxas de acerto de cache e critérios de revisão humana.
Para desenvolvedores, a ação imediata é inspecionar o uso real em vez de multiplicar preços de tokens por um tamanho teórico de prompt. Segmente leituras de cache, gravações de cache, entrada sem cache e saída para tarefas representativas.
Em seguida, conecte esses números aos resultados. Acompanhe se o agente concluiu a tarefa, se uma pessoa a aceitou e se o sistema precisou de escalonamento ou reparo.
A otimização de cache deve começar pelos maiores prefixos estáveis. Mantenha instruções do sistema e definições de ferramentas consistentes, coloque conteúdo dinâmico mais adiante e evite inserir metadados variáveis antes do material reutilizável.
As equipes também devem testar o comportamento de expiração do cache. Um cache de cinco minutos pode funcionar bem para ciclos intensos de agentes, mas mal para fluxos de trabalho com longas pausas de aprovação. A opção mais cara de uma hora pode reduzir os custos totais quando evita gravações repetidas.
A decisão final de compra deve comparar pelo menos dois modelos no mesmo conjunto interno de tarefas. A equivalência entre os preços de cache do Claude Sonnet 5.5 e do GPT-6.1 Sol torna esse experimento mais fácil de interpretar, mas não decide o vencedor.
A redução da Anthropic é significativa porque cargas de trabalho de agentes reutilizam contexto com muito mais frequência do que sessões comuns de chat. Ela também confirma que os fornecedores de modelos agora veem o contexto em cache como um campo de batalha competitivo.
A questão em aberto é se preços menores de cache produzem trabalho bem-sucedido mais barato. Meça sua taxa de acerto de cache, tentativas repetidas, volume de saída e resultados aceitos ao longo do próximo mês. Se o custo total por tarefa concluída cair próximo da estimativa da Anthropic, a redução mudou sua economia. Caso contrário, a parte cara do seu agente está em outro lugar.



