Anthropic réduit le tarif du cache de Claude Sonnet 5.5, s’alignant sur OpenAI à 0,10 $
Anthropic a réduit de 50 % le tarif du cache de Claude Sonnet 5.5, faisant passer les lectures de cache de 0,20 $ à 0,10 $ par million de tokens. L’entreprise affirme que ce changement rend Sonnet 5.5 environ 20 % moins cher pour la plupart des charges de travail agentiques, où les applications réutilisent à plusieurs reprises de longues instructions et du contexte.
Cette précision est importante. Anthropic n’a pas réduit les tarifs standard d’entrée ou de sortie du modèle. L’entreprise a modifié une composante qui devient importante lorsqu’un agent renvoie à répétition le même prompt système, les mêmes définitions d’outils, le même contexte de dépôt ou les mêmes documents de référence.
Cette évolution aligne également le tarif de lecture de cache de Sonnet 5.5 sur celui de GPT-6.1 Sol d’OpenAI. Les deux modèles affichent désormais les mêmes tarifs pour l’entrée standard, l’entrée mise en cache et la sortie. La concurrence ne se joue donc plus sur les tarifs affichés par token, mais sur une question plus difficile : quel modèle accomplit une tâche fiable avec moins de requêtes, moins de tokens générés et moins de reprises ?
Le tarif du cache de Claude Sonnet 5.5 est réduit de moitié
Le changement immédiat est ciblé, mais il vise l’un des coûts récurrents les plus importants des workflows agentiques de longue durée.
Anthropic a annoncé cette réduction le 7 octobre 2026, parallèlement à la sortie de Claude Haiku 5.5. Son annonce de modèle indique que les lectures de cache de Sonnet 5.5 coûtent désormais 0,10 $ par million de tokens au lieu de 0,20 $, avec effet immédiat ce jour-là.
Une lecture de cache se produit lorsqu’une application réutilise du contenu de prompt précédemment stocké. Au lieu de traiter à nouveau ce contenu au tarif d’entrée complet, le fournisseur récupère le préfixe correspondant et facture le tarif réduit de lecture de cache.
Cette fonctionnalité est particulièrement utile lorsque les requêtes comportent un préfixe volumineux et stable. Un agent de programmation peut renvoyer de façon répétée les instructions du dépôt, les descriptions d’outils, les normes de codage et des fichiers sources sélectionnés. Un système de recherche peut réutiliser un long manuel de politiques ou une collection de documents pour de nombreuses questions.
Les agents de support client peuvent suivre le même schéma. Ils intègrent souvent à chaque tour un prompt système stable, un catalogue de produits, des règles d’escalade et des schémas d’outils. Seuls le dernier message du client et l’état de travail le plus récent de l’agent changent.
Selon la tarification actuelle de Sonnet 5.5, Anthropic affiche l’entrée standard à 2 $ par million de tokens et la sortie à 10 $ par million. Un accès au cache coûte désormais 5 % du tarif d’entrée standard, contre 10 % auparavant.
Les écritures de cache restent plus coûteuses qu’une entrée ordinaire, car le contenu réutilisable doit d’abord être stocké. Anthropic affiche les écritures de cache de cinq minutes à 2,50 $ par million de tokens et celles d’une heure à 4 $ par million. La baisse du prix de lecture n’est avantageuse que si une application réutilise suffisamment souvent le préfixe stocké.
Considérons une charge de travail simplifiée qui envoie 100 000 tokens stables sur 100 requêtes. Sans mise en cache, ces tokens répétés représentent 10 millions de tokens d’entrée standard. Avec un cache efficace, la première requête écrit le préfixe, tandis que les requêtes suivantes en récupèrent la majeure partie au tarif de lecture de cache.
Le nouveau tarif réduit de moitié la part liée aux lectures dans cet exemple. Il ne réduit pas le coût des nouvelles entrées, de la création du cache, des sorties du modèle, des outils externes, des nouvelles tentatives ou des tâches échouées.
La réduction estimée de 20 % par Anthropic décrit donc ce que l’entreprise appelle « la plupart des travaux agentiques ». Il ne s’agit pas d’une remise universelle sur chaque requête Sonnet 5.5. Les prompts courts, les faibles taux d’accès au cache ou les charges de travail dominées par la sortie connaîtront une baisse plus limitée.
La réduction de prix fait suite au lancement de Sonnet 5.5 le 28 septembre. Dans sa version initiale de Sonnet 5.5, Anthropic facturait les lectures de cache à 0,20 $ et indiquait que le modèle nécessitait généralement moins de tokens que Sonnet 5.
Cette affirmation de lancement positionnait déjà l’efficacité au niveau de la tâche, et non uniquement au niveau du token. Anthropic affirmait que Sonnet 5.5 pouvait coûter jusqu’à 30 % de moins par tâche que son prédécesseur et générer des sorties plus de 30 % plus rapidement.
L’ajustement du cache ajoute un autre levier d’efficacité moins de deux semaines plus tard. Il renforce également le message d’Anthropic selon lequel les agents persistants, plutôt que les réponses isolées de chatbots, deviennent l’unité qui compte.
Pourquoi les agents de longue durée valorisent davantage les accès au cache
Les agents consomment à répétition le même contexte, de sorte que l’économie du cache peut compter davantage qu’une légère modification du tarif d’entrée ordinaire.
Une requête de chatbot classique peut contenir une brève instruction et un message utilisateur. Une application agentique intègre généralement beaucoup plus de mécanismes à chaque appel de modèle.
Ces mécanismes peuvent inclure une politique opérationnelle, des dizaines de définitions d’outils, l’historique des tâches, des enregistrements récupérés, de la documentation logicielle et un plan élaboré lors d’étapes antérieures. De nombreux composants restent inchangés tandis que l’agent recherche, modifie des fichiers, appelle des services et vérifie son résultat.
La mise en cache des prompts stocke un préfixe réutilisable de cette requête. Les appels ultérieurs peuvent récupérer le contenu correspondant à un tarif réduit au lieu de facturer chaque token comme une nouvelle entrée.
La mise en cache ne signifie pas que le modèle mémorise les informations de façon permanente. Il s’agit d’un mécanisme de facturation et de traitement pour du contenu de prompt correspondant, au sein d’une durée de vie de cache définie. Si le préfixe change, expire ou ne respecte pas les règles de mise en cache du fournisseur, l’application doit l’écrire à nouveau.
Cette distinction crée trois variables pratiques.
Premièrement, les développeurs ont besoin d’un taux d’accès au cache élevé. Les instructions et les outils stables doivent apparaître avant les messages qui changent fréquemment. Des modifications inutiles du préfixe mis en cache peuvent invalider sa réutilisation.
Deuxièmement, l’application doit effectuer suffisamment d’appels répétés pour compenser le surcoût d’écriture du cache. Un préfixe utilisé une seule fois n’offre aucune économie de lecture. Un préfixe utilisé des centaines de fois peut faire du tarif de lecture une composante majeure du coût.
Troisièmement, la génération de sortie reste importante. La sortie de Sonnet 5.5 coûte 10 $ par million de tokens, soit 100 fois son nouveau tarif de lecture de cache. Un agent qui génère de longues explications, se répète ou entre dans des boucles de nouvelles tentatives peut annuler les gains apportés par un contexte mis en cache moins cher.
C’est pourquoi le pourcentage de réduction varie selon l’application. Le chiffre de 20 % d’Anthropic implique une charge de travail où les lectures de cache représentent une part importante, mais non dominante, de la facture initiale.
Un modèle de coût simple clarifie cette relation. Supposons que les lectures de cache représentaient auparavant 40 % des dépenses de modèle d’une charge de travail. Réduire cette composante de moitié diminue le total de 20 %. Si les lectures de cache ne représentaient que 10 %, le même changement de tarif réduirait les dépenses totales de 5 %.
Aucun de ces exemples ne prédit la facture d’un client particulier. Ils montrent ce qui doit être vrai pour que l’affirmation moyenne d’Anthropic se vérifie.
Les principaux bénéficiaires seront probablement les systèmes dotés de longs préfixes réutilisables et de nombreux appels séquentiels. Les agents de programmation correspondent à ce profil, car les instructions du dépôt et les définitions d’outils persistent souvent durant toute une tâche.
L’analyse de documents peut également en bénéficier. Une équipe peut placer un contrat volumineux, une spécification technique ou un dossier de recherche dans un préfixe mis en cache, puis poser une série de questions ciblées.
Les agents dédiés au travail intellectuel ont des besoins similaires. Ils peuvent consulter à répétition des politiques d’entreprise stables, des comptes rendus de réunions ou une documentation de projet lors de la production d’un rapport. Les équipes qui construisent ces systèmes ont toujours besoin d’une sélection rigoureuse du contexte, à l’image de la maintenance d’une base de connaissances d’ingénierie consultable.
Mettre en cache un contexte mal organisé ne le rend pas utile. Cela rend seulement sa transmission répétée moins coûteuse. Une récupération médiocre peut toujours remplir le prompt de contenu non pertinent et conduire le modèle à dépenser des tokens de sortie pour résoudre des ambiguïtés.
La propre documentation sur le prompt caching d’Anthropic recommande de placer le contenu statique au début d’un prompt et le contenu dynamique plus loin. Cette structure augmente la probabilité que les requêtes ultérieures correspondent à un préfixe stocké.
Les développeurs doivent également surveiller séparément les compteurs de création de cache et de lectures. Un faible ratio lectures/écritures peut révéler des durées de cache courtes, des préfixes instables, des changements de routage ou des requêtes qui ne réutilisent jamais leur contexte stocké.
La nouvelle tarification du cache de Claude Sonnet 5.5 rend ces décisions d’ingénierie plus précieuses. Elle ne supprime pas la nécessité de les mesurer.
Anthropic et OpenAI affichent désormais les mêmes tarifs de référence
La réduction neutralise un avantage tarifaire visible d’OpenAI et oblige les acheteurs à comparer le coût d’exécution de tâches complètes.
OpenAI a introduit GPT-6.1 Sol avec les mêmes tarifs de 2 $ pour l’entrée et de 10 $ pour la sortie qu’Anthropic facture pour Sonnet 5.5. Toutefois, GPT-6.1 Sol a été lancé avec une entrée mise en cache à 0,10 $ par million de tokens.
Avant la réduction d’Anthropic, une application ne comparant que ces trois champs tarifaires observait une différence nette. L’entrée mise en cache de Sonnet 5.5 coûtait deux fois plus cher.
Cette différence a désormais disparu. Sonnet 5.5 et GPT-6.1 Sol affichent tous deux :
Une entrée standard à 2 $ par million de tokens
Une entrée mise en cache à 0,10 $ par million de tokens
Des écritures de cache à 2,50 $ par million de tokens pour la durée de cache de base
Une sortie à 10 $ par million de tokens
OpenAI indique que l’entrée mise en cache de GPT-6.1 Sol coûte 5 % de son tarif d’entrée standard. Sa documentation du modèle mentionne également une fenêtre de contexte de 1,05 million de tokens et la prise en charge de plusieurs réglages d’effort de raisonnement.
L’alignement des tarifs rend une simple comparaison de prix moins utile. Deux agents peuvent utiliser des modèles aux tarifs identiques par token et produire malgré tout des factures très différentes.
Un modèle peut résoudre un problème de programmation en huit appels. Un autre peut nécessiter 15 appels, générer davantage de tokens de raisonnement, invoquer des outils supplémentaires ou répéter un correctif infructueux. Le second système peut coûter davantage malgré une grille tarifaire identique.
La fiabilité modifie encore le calcul. Une première tentative bon marché a peu de valeur si une personne doit identifier une erreur, restaurer un travail endommagé et relancer la tâche. La mesure économiquement pertinente est le coût d’un résultat accepté.
La latence a également un coût. Un agent qui achève le travail avec moins d’étapes séquentielles peut libérer de la capacité de calcul et réduire le temps d’attente des utilisateurs. Cela peut compter davantage qu’une faible différence dans les dépenses de tokens pour les produits interactifs.
Anthropic cherche à positionner Sonnet 5.5 autour de cette mesure au niveau de la tâche. L’entreprise rapporte un résultat de 70,6 % sur Terminal-Bench 4.0, qui évalue des tâches professionnelles en plusieurs étapes dans un environnement en ligne de commande.
Anthropic affirme également que Sonnet 5.5 fonctionne plus de 30 % plus rapidement que Sonnet 5 et peut utiliser moins de tokens pour le même travail. Ces résultats sont rapportés par l’entreprise, et les performances en production dépendent de l’architecture de l’agent, des prompts, des outils et de la répartition des tâches.
OpenAI formule ses propres affirmations concernant les performances et l’efficacité de GPT-6.1 Sol. Son annonce de lancement décrit le modèle comme se rapprochant des capacités de GPT-6 Astra, à des tarifs standard par token inférieurs.
Aucune des suites de benchmarks des deux entreprises ne désigne un gagnant universel. Les tests d’Anthropic utilisent des paramètres d’effort et des configurations d’agents particuliers. Les évaluations d’OpenAI reposent sur son propre environnement de recherche et reconnaissent que le comportement de l’API peut différer.
Pour les acheteurs en entreprise, la comparaison pratique exige désormais un ensemble d’évaluation représentatif. Les équipes doivent mesurer la réussite des tâches, l’acceptation humaine, les appels d’outils, les tokens mis en cache, les entrées non mises en cache, la sortie, la latence et les nouvelles tentatives.
Elles doivent également tester les mêmes contraintes opérationnelles. Donner à un modèle des outils supplémentaires, un paquet de contexte différent ou un réglage de raisonnement plus généreux rend la comparaison des coûts peu fiable.
Le principal enjeu n’est plus le prix du cache de Sonnet face à celui d’OpenAI. Il s’agit de l’affirmation d’Anthropic selon laquelle les tâches sont exécutées efficacement, confrontée à la réalité de la charge de production de chaque client.
L’affirmation de 20 % d’économies comporte d’importantes limites
L’estimation d’Anthropic est plausible pour les agents utilisant fortement le cache, mais elle ne doit pas être considérée comme une baisse automatique des coûts d’exploitation globaux.
La première limite concerne l’éligibilité au cache. Les applications ne bénéficient du tarif réduit que lorsque les requêtes génèrent de véritables accès au cache. Un contenu similaire n’est pas nécessairement un contenu identique.
Déplacer une définition d’outil, modifier un horodatage, réorganiser les documents récupérés ou changer une instruction système initiale peut invalider le préfixe réutilisable. De petits choix architecturaux peuvent donc déterminer si le tarif annoncé s’applique.
La deuxième limite concerne la durée de vie du cache. Anthropic prend en charge différentes durées de stockage avec des prix d’écriture différents. Un système connaissant de longues pauses entre les requêtes peut devoir réécrire le cache à plusieurs reprises, ce qui réduit ses économies nettes.
La troisième limite concerne le coût de sortie. Les lectures de cache sont désormais peu coûteuses, mais les tokens générés restent bien plus onéreux. De longues traces de raisonnement, des réponses verbeuses et des corrections répétées peuvent dominer la facture finale.
La quatrième limite concerne les frais d’orchestration. Les agents font souvent appel à des systèmes de recherche, des navigateurs, des bases de données, des environnements d’exécution de code ou des API tierces. La réduction du prix des modèles d’Anthropic ne diminue pas ces coûts.
La cinquième limite concerne la révision humaine. Un modèle qui produit un travail peu coûteux mais peu fiable peut augmenter les coûts de main-d’œuvre. Ce risque est particulièrement important pour les modifications logicielles, les workflows réglementés et les actions affectant les données des clients.
Même l’annonce originale d’Anthropic sur Sonnet 5.5 avertit que les benchmarks ne capturent qu’un aspect des capacités d’un modèle. L’entreprise indique qu’Opus 5.5 reste plus performant pour les tâches complexes et ouvertes nécessitant un jugement soutenu.
Cela crée un compromis de routage. Les développeurs peuvent attribuer les tâches routinières et bien définies à Sonnet 5.5 tout en réservant les décisions plus difficiles à un modèle plus grand. Cependant, un routage incorrect peut conduire Sonnet à échouer à répétition avant que le système ne procède à une escalade.
Un routeur mal conçu peut gaspiller davantage d’argent que la remise sur le cache n’en économise. Les équipes devraient mesurer l’ensemble du parcours, y compris les tentatives échouées et les appels d’escalade.
La comparaison avec GPT-6.1 Sol présente une autre complication. Des prix affichés équivalents ne signifient pas que les fournisseurs mettent en œuvre le cache de manière identique.
Le guide de cache d’OpenAI indique que les modèles récents prennent en charge des points d’arrêt explicites ou implicites, selon le modèle. Il décrit également des longueurs minimales de prompts et des règles de reporting qui influencent les tokens éligibles.
Anthropic utilise ses propres contrôles de cache, durées, points d’arrêt et mécanismes de reporting d’utilisation. Migrer un agent d’un fournisseur à l’autre peut nécessiter de restructurer les prompts avant que son taux de réussite du cache devienne comparable.
La distribution via le cloud peut encore compliquer la situation. Sonnet 5.5 est disponible via Anthropic et des plateformes partenaires, mais les prix, la disponibilité régionale et le calendrier des fonctionnalités peuvent varier selon le fournisseur.
Le tarif annoncé de 0,10 $ doit donc être vérifié sur le point de terminaison précis utilisé en production. Une entreprise passant par une marketplace cloud ne devrait pas supposer que chaque service régional a adopté le changement simultanément.
Une question de mesure se cache également derrière l’affirmation de 20 %. Anthropic n’a pas publié de distribution détaillée montrant la consommation de cache à travers les charges de travail de ses clients. Le terme « la plupart des travaux agentiques » regroupe le codage, la recherche, l’usage du navigateur, le support client et d’autres schémas aux profils de tokens différents.
L’interprétation la plus prudente est simple. Anthropic a réduit de moitié un prix unitaire vérifié. Son pourcentage plus large représente la combinaison de charges de travail modélisée ou observée par l’entreprise, et non un résultat garanti pour les clients.
Les équipes peuvent valider cette affirmation en comparant plusieurs semaines d’utilisation. Les mesures utiles comprennent les tokens touchant le cache par requête, la fréquence d’écriture dans le cache, les entrées non mises en cache, les sorties, les tâches réussies et les dépenses totales par tâche acceptée.
Une baisse des dépenses de cache sans baisse similaire du coût par tâche signalerait un autre goulot d’étranglement. Il pourrait s’agir de la longueur des sorties, des tentatives échouées, des outils externes ou du temps de correction humaine.
Ce que les développeurs et acheteurs d’IA devraient surveiller ensuite
La prochaine phase déterminera si des tarifs de cache plus faibles améliorent l’économie de production ou deviennent simplement la nouvelle référence pour les plateformes d’agents concurrentes.
Le premier signal concerne les données de facturation mises à jour d’Anthropic. Les développeurs devraient confirmer que leurs requêtes Sonnet 5.5 bénéficient du nouveau tarif de lecture du cache et que les plateformes partenaires appliquent le même changement.
Cela renforce la position d’Anthropic si les clients constatent une réduction des dépenses par tâche terminée sans modifier leurs applications. Cela affaiblit l’affirmation plus large de 20 % si la plupart des charges de travail n’affichent qu’une faible réduction.
Le deuxième signal concerne les prix de la concurrence. Le tarif équivalent de GPT-6.1 Sol d’OpenAI semble déjà avoir supprimé la possibilité pour Anthropic de facturer deux fois plus pour le contexte mis en cache.
Google et les autres fournisseurs de modèles font désormais face à la même pression. Les acheteurs s’attendent de plus en plus à ce que les entrées mises en cache coûtent une petite fraction des entrées ordinaires, en particulier pour les agents conçus autour d’un contexte persistant.
Une nouvelle réaction sur les prix montrerait que la réutilisation bon marché du contexte est devenue une fonctionnalité concurrentielle standard. L’absence de réaction suggérerait que les fournisseurs se différencient encore par la qualité des modèles, l’infrastructure ou des systèmes de cache distincts.
Le troisième signal concerne les tests indépendants au niveau des tâches. Les prix des tokens révèlent comment les fournisseurs calculent une facture, mais ils n’indiquent pas la quantité de travail dont un modèle a besoin pour terminer une tâche.
Les évaluations utiles devraient rapporter le coût par résultat accepté, et pas seulement la précision des benchmarks ou le prix par million de tokens. Elles devraient également divulguer les paramètres d’effort, l’accès aux outils, les politiques de nouvelle tentative, les taux de réussite du cache et les critères de révision humaine.
Pour les développeurs, l’action immédiate consiste à examiner l’utilisation réelle plutôt qu’à multiplier les prix des tokens par une taille théorique de prompt. Segmentez les lectures de cache, les écritures de cache, les entrées non mises en cache et les sorties pour des tâches représentatives.
Reliez ensuite ces chiffres aux résultats. Suivez si l’agent a terminé la tâche, si une personne l’a acceptée et si le système a nécessité une escalade ou une correction.
L’optimisation du cache devrait commencer par les préfixes stables les plus importants. Maintenez des instructions système et des définitions d’outils cohérentes, placez le contenu dynamique plus tard et évitez d’injecter des métadonnées changeantes avant le matériel réutilisable.
Les équipes devraient également tester le comportement à l’expiration du cache. Un cache de cinq minutes peut bien fonctionner pour des boucles d’agents denses, mais moins bien pour des workflows avec de longues pauses d’approbation. L’option d’une heure, plus coûteuse, peut réduire les coûts totaux lorsqu’elle évite des écritures répétées.
La décision finale d’achat devrait comparer au moins deux modèles sur le même ensemble de tâches internes. L’alignement des prix de cache de Claude Sonnet 5.5 et de GPT-6.1 Sol rend cette expérience plus facile à interpréter, mais il ne désigne pas le gagnant.
La réduction d’Anthropic est significative parce que les charges de travail agentiques réutilisent le contexte bien plus souvent que les sessions de chat ordinaires. Elle confirme également que les fournisseurs de modèles considèrent désormais le contexte mis en cache comme un terrain de concurrence.
La question ouverte est de savoir si des prix de cache plus bas produisent un travail réussi moins coûteux. Mesurez votre taux de réussite du cache, les nouvelles tentatives, le volume de sortie et les résultats acceptés au cours du prochain mois. Si le coût total par tâche terminée se rapproche de l’estimation d’Anthropic, la réduction a changé votre économie. Dans le cas contraire, la partie coûteuse de votre agent se trouve ailleurs.



