Anthropic reduce el precio de caché de Claude Sonnet 5.5 e iguala a OpenAI con $0.10
Anthropic ha reducido en un 50% el precio de caché de Claude Sonnet 5.5, bajando las lecturas de caché de $0.20 a $0.10 por millón de tokens. La empresa afirma que el cambio hace que Sonnet 5.5 sea aproximadamente un 20% más barato para la mayoría del trabajo agéntico, donde las aplicaciones reutilizan repetidamente instrucciones y contexto extensos.
Esa precisión es importante. Anthropic no redujo las tarifas estándar de entrada ni de salida del modelo. Modificó un componente que cobra relevancia cuando un agente envía repetidamente el mismo prompt de sistema, definiciones de herramientas, contexto del repositorio o material de referencia.
La medida también alinea la tarifa de lectura de caché de Sonnet 5.5 con la de GPT-6.1 Sol de OpenAI. Ambos modelos ahora indican los mismos precios para entrada estándar, entrada almacenada en caché y salida. Eso aleja la competencia de las tarifas de tokens más llamativas y la lleva hacia una pregunta más difícil: ¿qué modelo completa una tarea fiable con menos solicitudes, menos tokens generados y menos retrabajo?
El precio de caché de Claude Sonnet 5.5 se reduce a la mitad
El cambio inmediato es acotado, pero apunta a uno de los mayores costes recurrentes de los flujos de trabajo de agentes de larga duración.
Anthropic anunció la reducción el 7 de octubre de 2026, junto con el lanzamiento de Claude Haiku 5.5. Su anuncio del modelo indica que las lecturas de caché de Sonnet 5.5 ahora cuestan $0.10 por millón de tokens en lugar de $0.20, con efecto desde ese mismo día.
Una lectura de caché ocurre cuando una aplicación reutiliza contenido de prompt almacenado previamente. En lugar de procesar de nuevo ese contenido a la tarifa completa de entrada, el proveedor recupera el prefijo coincidente y cobra la tarifa reducida de lectura de caché.
La función resulta más relevante cuando las solicitudes contienen un prefijo grande y estable. Un agente de programación puede enviar repetidamente instrucciones del repositorio, descripciones de herramientas, estándares de código y archivos fuente seleccionados. Un sistema de investigación puede reutilizar un extenso manual de políticas o una colección de documentos en muchas consultas.
Los agentes de atención al cliente pueden seguir el mismo patrón. A menudo incorporan en cada turno un prompt de sistema estable, catálogo de productos, reglas de escalado y esquemas de herramientas. Solo cambian el mensaje más reciente del cliente y el estado de trabajo más reciente del agente.
Con los precios actuales de Sonnet 5.5, Anthropic fija la entrada estándar en $2 por millón de tokens y la salida en $10 por millón. Un acierto de caché ahora cuesta el 5% de la tarifa estándar de entrada, frente al 10% anterior.
Las escrituras de caché siguen siendo más caras que la entrada ordinaria porque el contenido reutilizable debe almacenarse primero. Anthropic fija las escrituras de caché de cinco minutos en $2.50 por millón de tokens y las de una hora en $4 por millón. El menor precio de lectura solo compensa cuando una aplicación reutiliza el prefijo almacenado suficientes veces.
Consideremos una carga de trabajo simplificada que envía 100.000 tokens estables en 100 solicitudes. Sin caché, esos tokens repetidos representan 10 millones de tokens de entrada estándar. Con una caché efectiva, la primera solicitud escribe el prefijo, mientras que las solicitudes posteriores recuperan la mayor parte de él a la tarifa de lectura de caché.
La nueva tarifa reduce a la mitad la parte de lectura de ese ejemplo. No reduce el coste de nueva entrada, creación de caché, salida del modelo, herramientas externas, reintentos o tareas fallidas.
Por tanto, la reducción estimada del 20% por Anthropic describe lo que la empresa denomina “la mayoría del trabajo agéntico”. No es un descuento universal para cada solicitud de Sonnet 5.5. Los prompts cortos, las bajas tasas de acierto de caché o las cargas de trabajo intensivas en salida verán un cambio menor.
La rebaja de precio sigue al lanzamiento de Sonnet 5.5 el 28 de septiembre. En su lanzamiento original de Sonnet 5.5, Anthropic fijó las lecturas de caché en $0.20 y afirmó que el modelo normalmente requería menos tokens que Sonnet 5.
Esa afirmación de lanzamiento ya situaba la eficiencia en el nivel de la tarea, no únicamente en el nivel del token. Anthropic afirmó que Sonnet 5.5 podía costar hasta un 30% menos por tarea que su predecesor y generar salida más de un 30% más rápido.
El ajuste de caché añade otra palanca de eficiencia menos de dos semanas después. También refuerza el mensaje de Anthropic de que los agentes persistentes, en lugar de respuestas aisladas de chatbots, se están convirtiendo en la unidad relevante.
Por qué los agentes de larga duración hacen más valiosos los aciertos de caché
Los agentes consumen repetidamente el mismo contexto, por lo que la economía de la caché puede importar más que un cambio modesto en el precio de entrada ordinaria.
Una solicitud convencional de chatbot puede incluir una instrucción breve y un mensaje de usuario. Una aplicación agéntica suele incorporar mucha más infraestructura en cada llamada al modelo.
Esa infraestructura puede incluir una política operativa, decenas de definiciones de herramientas, historial de tareas, registros recuperados, documentación de software y un plan elaborado en pasos anteriores. Muchos componentes permanecen sin cambios mientras el agente busca, edita archivos, llama a servicios y verifica su resultado.
El almacenamiento en caché de prompts guarda un prefijo reutilizable de esa solicitud. Las llamadas posteriores pueden recuperar el contenido coincidente a una tarifa reducida, en lugar de facturar cada token como entrada nueva.
El almacenamiento en caché no significa que el modelo recuerde información permanentemente. Es un mecanismo de facturación y procesamiento para contenido de prompt coincidente dentro de una vida útil de caché definida. Si el prefijo cambia, caduca o no cumple las reglas de caché del proveedor, la aplicación debe escribirlo de nuevo.
Esa distinción crea tres variables prácticas.
Primero, los desarrolladores necesitan una alta tasa de aciertos de caché. Las instrucciones y herramientas estables deben aparecer antes que los mensajes que cambian con frecuencia. Las modificaciones innecesarias al prefijo almacenado en caché pueden invalidar su reutilización.
Segundo, la aplicación necesita suficientes llamadas repetidas para recuperar el sobrecoste de escritura de caché. Un prefijo utilizado una sola vez no ofrece ahorro de lectura. Un prefijo utilizado cientos de veces puede convertir la tarifa de lectura en un componente importante del coste.
Tercero, la generación de salida sigue importando. La salida de Sonnet 5.5 cuesta $10 por millón de tokens, 100 veces su nueva tarifa de lectura de caché. Un agente que genera explicaciones largas, se repite o entra en bucles de reintentos puede eliminar las ganancias del contexto almacenado en caché más barato.
Por ello, la reducción porcentual varía según la aplicación. La cifra del 20% de Anthropic implica una carga de trabajo en la que las lecturas de caché representan una parte considerable, pero no dominante, de la factura original.
Un modelo de costes sencillo aclara esta relación. Supongamos que las lecturas de caché representaban previamente el 40% del gasto de modelo de una carga de trabajo. Reducir ese componente a la mitad baja el total un 20%. Si las lecturas de caché representaban solo el 10%, el mismo cambio de precio reduciría el gasto total un 5%.
Ninguno de los ejemplos predice la factura de un cliente concreto. Muestran qué debe ser cierto para que se cumpla la afirmación media de Anthropic.
Los mayores beneficiarios probablemente serán sistemas con prefijos largos y reutilizables y muchas llamadas secuenciales. Los agentes de programación encajan en ese patrón porque las instrucciones del repositorio y las definiciones de herramientas suelen persistir durante toda una tarea.
El análisis de documentos también puede beneficiarse. Un equipo podría incluir un contrato extenso, una especificación técnica o un paquete de investigación en un prefijo almacenado en caché y luego plantear una serie de preguntas concretas.
Los agentes de trabajo del conocimiento tienen necesidades similares. Pueden consultar repetidamente políticas estables de la empresa, registros de reuniones o documentación de proyectos mientras elaboran un informe. Los equipos que construyen estos sistemas aún necesitan una selección disciplinada del contexto, muy similar al mantenimiento de una base de conocimientos de ingeniería con capacidad de búsqueda.
Almacenar en caché contexto débilmente organizado no lo vuelve útil. Solo abarata su transmisión repetida. Una recuperación deficiente aún puede llenar el prompt de material irrelevante y hacer que el modelo gaste tokens de salida resolviendo ambigüedades.
La propia documentación de almacenamiento en caché de prompts de Anthropic recomienda colocar contenido estático cerca del comienzo de un prompt y contenido dinámico después. Esa estructura aumenta la probabilidad de que las solicitudes posteriores coincidan con un prefijo almacenado.
Los desarrolladores también deberían supervisar por separado los contadores de creación y lectura de caché. Una baja relación entre lecturas y escrituras puede revelar vidas útiles de caché cortas, prefijos inestables, cambios de enrutamiento o solicitudes que nunca reutilizan su contexto almacenado.
El nuevo precio de caché de Claude Sonnet 5.5 hace más valiosas esas decisiones de ingeniería. No elimina la necesidad de medirlas.
Anthropic y OpenAI ahora comparten las mismas tarifas principales
La rebaja neutraliza una ventaja de precio visible de OpenAI y obliga a los compradores a comparar el coste de completar tareas completas.
OpenAI presentó GPT-6.1 Sol con las mismas tarifas de $2 para entrada y $10 para salida que Anthropic cobra por Sonnet 5.5. Sin embargo, GPT-6.1 Sol se lanzó con la entrada almacenada en caché a $0.10 por millón de tokens.
Antes de la reducción de Anthropic, una aplicación que comparara únicamente esos tres campos de la tabla de precios veía una diferencia clara. La entrada almacenada en caché de Sonnet 5.5 costaba el doble.
Esa diferencia ha desaparecido. Sonnet 5.5 y GPT-6.1 Sol ahora indican:
Entrada estándar a $2 por millón de tokens
Entrada almacenada en caché a $0.10 por millón de tokens
Escrituras de caché a $2.50 por millón de tokens para la duración básica de caché
Salida a $10 por millón de tokens
OpenAI afirma que la entrada almacenada en caché de GPT-6.1 Sol cuesta el 5% de su tarifa de entrada estándar. Su documentación del modelo también indica una ventana de contexto de 1,05 millones de tokens y compatibilidad con varias configuraciones de esfuerzo de razonamiento.
Las tarifas coincidentes hacen menos útil una comparación simple de precios. Dos agentes pueden usar modelos con precios de tokens idénticos y aun así generar facturas muy diferentes.
Un modelo podría resolver un problema de programación en ocho llamadas. Otro podría necesitar 15 llamadas, generar más tokens de razonamiento, invocar herramientas adicionales o repetir un parche fallido. El segundo sistema puede costar más pese a tener una tabla de precios idéntica.
La fiabilidad vuelve a modificar el cálculo. Un primer intento barato ofrece poco valor si una persona debe identificar un error, restaurar trabajo dañado y volver a ejecutar la tarea. La medida económicamente relevante es el coste de un resultado aceptado.
La latencia también tiene un coste. Un agente que completa el trabajo con menos pasos secuenciales puede liberar capacidad de cómputo y reducir el tiempo de espera del usuario. Eso puede importar más que una pequeña diferencia en gasto de tokens para productos interactivos.
Anthropic intenta enmarcar Sonnet 5.5 en torno a esa medida a nivel de tarea. La empresa informa un resultado del 70,6% en Terminal-Bench 4.0, que evalúa tareas profesionales de varios pasos en un entorno de línea de comandos.
Anthropic también afirma que Sonnet 5.5 funciona más de un 30% más rápido que Sonnet 5 y puede usar menos tokens para el mismo trabajo. Son resultados comunicados por la empresa, y el rendimiento en producción depende del entorno del agente, los prompts, las herramientas y la distribución de tareas.
OpenAI formula sus propias afirmaciones de rendimiento y eficiencia para GPT-6.1 Sol. Su anuncio de lanzamiento describe el modelo como cercano a las capacidades de GPT-6 Astra con tarifas estándar de tokens más bajas.
Ningún conjunto de pruebas de las dos empresas proporciona un ganador universal. Las pruebas de Anthropic usan configuraciones de esfuerzo y agentes concretas. Las evaluaciones de OpenAI emplean su propio entorno de investigación y reconocen que el comportamiento de la API puede diferir.
Para los compradores empresariales, la comparación práctica ahora requiere un conjunto de evaluación representativo. Los equipos deben medir la finalización satisfactoria, la aceptación humana, las llamadas a herramientas, los tokens almacenados en caché, la entrada sin caché, la salida, la latencia y los reintentos.
También deberían probar las mismas restricciones operativas. Dar a un modelo herramientas adicionales, un paquete de contexto diferente o una configuración de razonamiento más generosa hace que la comparación de costes deje de ser fiable.
La competencia principal ya no es el precio de caché de Sonnet frente al de OpenAI. Es la afirmación de Anthropic sobre una finalización eficiente de tareas frente a la realidad de la carga de trabajo de producción de cada cliente.
La afirmación de un ahorro del 20% tiene límites importantes
La estimación de Anthropic es plausible para agentes con un uso intensivo de caché, pero no debe considerarse una reducción automática de los costes operativos totales.
La primera limitación es la elegibilidad para la caché. Las aplicaciones solo reciben el precio más bajo cuando las solicitudes generan aciertos reales de caché. Un contenido similar no es necesariamente contenido idéntico.
Mover una definición de herramienta, cambiar una marca de tiempo, reordenar documentos recuperados o modificar una instrucción inicial del sistema puede romper el prefijo reutilizable. Por tanto, pequeñas decisiones arquitectónicas pueden determinar si se aplica la tarifa anunciada.
La segunda limitación es la duración de la caché. Anthropic admite diferentes periodos de almacenamiento con distintos precios de escritura. Un sistema con pausas prolongadas entre solicitudes puede necesitar escrituras de caché repetidas, lo que reduce su ahorro neto.
La tercera limitación es el coste de salida. Las lecturas de caché ahora son económicas, pero los tokens generados siguen siendo mucho más costosos. Los rastros de razonamiento largos, las respuestas extensas y las correcciones repetidas pueden dominar la factura final.
La cuarta limitación es la sobrecarga de orquestación. Los agentes suelen llamar a sistemas de búsqueda, navegadores, bases de datos, entornos de ejecución de código o API de terceros. La reducción del precio del modelo de Anthropic no reduce esos cargos.
La quinta limitación es la revisión humana. Un modelo que produce trabajo económico pero poco fiable puede aumentar los costes laborales. Este riesgo es especialmente importante para cambios de software, flujos de trabajo regulados y acciones que afectan a datos de clientes.
Incluso el anuncio original de Sonnet 5.5 de Anthropic advierte que los benchmarks capturan solo un aspecto de la capacidad de un modelo. La empresa afirma que Opus 5.5 sigue siendo más sólido para tareas complejas y abiertas que requieren juicio sostenido.
Esto genera una disyuntiva de enrutamiento. Los desarrolladores pueden asignar trabajo rutinario y bien delimitado a Sonnet 5.5, reservando las decisiones más difíciles para un modelo más grande. Sin embargo, un enrutamiento incorrecto puede hacer que Sonnet falle repetidamente antes de que el sistema escale.
Un enrutador mal diseñado puede desperdiciar más dinero del que ahorra el descuento de caché. Los equipos deben medir la ruta completa, incluidos los intentos fallidos y las llamadas de escalado.
La comparación con GPT-6.1 Sol tiene otra complicación. Que los precios principales coincidan no significa que los proveedores implementen la caché de forma idéntica.
La guía de caché de OpenAI indica que los modelos más recientes admiten puntos de corte explícitos o implícitos, según el modelo. También describe longitudes mínimas de prompt y reglas de informes que afectan a qué tokens cumplen los requisitos.
Anthropic utiliza sus propios controles de caché, duraciones, puntos de corte e informes de uso. Migrar un agente entre proveedores puede requerir reestructurar el prompt antes de que su tasa de aciertos de caché sea comparable.
La distribución en la nube puede complicar aún más el panorama. Sonnet 5.5 está disponible a través de Anthropic y plataformas asociadas, pero los precios, la disponibilidad regional y el calendario de funciones pueden variar según el proveedor.
Por tanto, la tarifa anunciada de $0.10 debe verificarse en el endpoint específico utilizado en producción. Una empresa que opera a través de un marketplace de nube no debería asumir que todos los servicios regionales adoptaron el cambio simultáneamente.
También existe una cuestión de medición detrás de la afirmación del 20%. Anthropic no ha publicado una distribución detallada que muestre el consumo de caché entre las cargas de trabajo de los clientes. “La mayor parte del trabajo agéntico” agrupa programación, investigación, uso del navegador, atención al cliente y otros patrones con perfiles de tokens distintos.
La interpretación más segura es sencilla. Anthropic redujo a la mitad un precio unitario verificado. Su porcentaje más amplio representa la combinación de cargas de trabajo modelada u observada por la empresa, no un resultado garantizado para los clientes.
Los equipos pueden validar la afirmación comparando varias semanas de uso. Las métricas útiles incluyen tokens de aciertos de caché por solicitud, frecuencia de escritura de caché, entrada sin caché, salida, tareas exitosas y gasto total por tarea aceptada.
Una caída en el gasto de caché sin una reducción similar en el coste de la tarea señalaría otro cuello de botella. Ese cuello de botella podría ser la longitud de la salida, intentos fallidos, herramientas externas o el tiempo de corrección humana.
Qué deberían vigilar los desarrolladores y compradores de IA a continuación
La próxima fase pondrá a prueba si unas tarifas de caché más bajas mejoran la economía de producción o simplemente se convierten en la nueva referencia para las plataformas de agentes competidoras.
La primera señal son los datos de facturación actualizados de Anthropic. Los desarrolladores deben confirmar que sus solicitudes de Sonnet 5.5 reciben la nueva tarifa de lectura de caché y que las plataformas asociadas muestran el mismo cambio.
Esto refuerza el argumento de Anthropic si los clientes observan un menor gasto por tarea completada sin modificar sus aplicaciones. Debilita la afirmación más amplia del 20% si la mayoría de las cargas de trabajo muestran solo una reducción pequeña.
La segunda señal son los precios competitivos. La tarifa equivalente de GPT-6.1 Sol de OpenAI ya parece haber eliminado el margen para que Anthropic cobre el doble por contexto almacenado en caché.
Google y otros proveedores de modelos afrontan ahora la misma presión. Los compradores esperan cada vez más que la entrada almacenada en caché cueste una pequeña fracción de la entrada ordinaria, especialmente para agentes diseñados en torno a contexto persistente.
Una nueva respuesta de precios demostraría que la reutilización económica de contexto se ha convertido en una característica competitiva estándar. La ausencia de respuesta sugeriría que los proveedores aún se diferencian mediante la calidad del modelo, la infraestructura o sistemas de caché distintos.
La tercera señal son las pruebas independientes a nivel de tarea. Los precios de tokens revelan cómo calculan la factura los proveedores, pero no muestran cuánto trabajo necesita un modelo para terminar un encargo.
Las evaluaciones útiles deberían informar del coste por resultado aceptado, no solo de la precisión de los benchmarks o del precio por millón de tokens. También deberían revelar configuraciones de esfuerzo, acceso a herramientas, políticas de reintento, tasas de aciertos de caché y criterios de revisión humana.
Para los desarrolladores, la acción inmediata es inspeccionar el uso real en lugar de multiplicar precios de tokens por un tamaño teórico de prompt. Segmente lecturas de caché, escrituras de caché, entrada sin caché y salida para tareas representativas.
Después, conecte esas cifras con los resultados. Haga seguimiento de si el agente completó la tarea, si una persona la aceptó y si el sistema necesitó escalado o reparación.
La optimización de caché debería comenzar con los prefijos estables más grandes. Mantenga coherentes las instrucciones del sistema y las definiciones de herramientas, coloque el contenido dinámico después y evite insertar metadatos cambiantes antes del material reutilizable.
Los equipos también deberían probar el comportamiento de expiración de la caché. Una caché de cinco minutos puede funcionar bien para bucles de agentes intensivos, pero mal para flujos de trabajo con largas pausas de aprobación. La opción más costosa de una hora puede reducir los costes totales cuando evita escrituras repetidas.
La decisión final de compra debería comparar al menos dos modelos con el mismo conjunto interno de tareas. La coincidencia entre los precios de caché de Claude Sonnet 5.5 y GPT-6.1 Sol hace que ese experimento sea más fácil de interpretar, pero no determina al ganador.
La reducción de Anthropic es significativa porque las cargas de trabajo de agentes reutilizan contexto mucho más a menudo que las sesiones de chat ordinarias. También confirma que los proveedores de modelos ven ahora el contexto almacenado en caché como un campo de batalla competitivo.
La pregunta abierta es si unos precios de caché más bajos producen trabajo exitoso más económico. Mida durante el próximo mes su tasa de aciertos de caché, reintentos, volumen de salida y resultados aceptados. Si el coste total por tarea completada se acerca a la estimación de Anthropic, el recorte cambió su economía. Si no es así, la parte costosa de su agente se encuentra en otro lugar.



