Anthropic dimezza i prezzi della cache di Claude Sonnet 5.5, eguagliando OpenAI a $0.10
Anthropic ha ridotto del 50% i prezzi della cache di Claude Sonnet 5.5, abbassando le letture della cache da $0.20 a $0.10 per milione di token. L'azienda afferma che il cambiamento rende Sonnet 5.5 circa il 20% meno costoso per la maggior parte del lavoro agentico, in cui le applicazioni riutilizzano ripetutamente istruzioni e contesto estesi.
Questa precisazione è importante. Anthropic non ha ridotto le tariffe standard di input o output del modello. Ha modificato una componente che diventa rilevante quando un agente invia ripetutamente lo stesso prompt di sistema, le definizioni degli strumenti, il contesto del repository o materiale di riferimento.
La mossa porta inoltre la tariffa per la lettura della cache di Sonnet 5.5 in linea con GPT-6.1 Sol di OpenAI. Entrambi i modelli riportano ora gli stessi prezzi per input standard, input memorizzato nella cache e output. Questo sposta la competizione dalle tariffe headline per token a una domanda più complessa: quale modello completa un'attività affidabile con meno richieste, meno token generati e meno rielaborazioni?
I prezzi della cache di Claude Sonnet 5.5 si dimezzano
Il cambiamento immediato è circoscritto, ma punta a uno dei maggiori costi ricorrenti nei flussi di lavoro agentici a lunga esecuzione.
Anthropic ha annunciato la riduzione il 7 ottobre 2026, insieme al rilascio di Claude Haiku 5.5. Il suo annuncio del modello afferma che le letture della cache di Sonnet 5.5 costano ora $0.10 per milione di token anziché $0.20, con effetto da quel giorno.
Una lettura della cache avviene quando un'applicazione riutilizza contenuti di prompt memorizzati in precedenza. Anziché elaborare nuovamente quei contenuti alla tariffa piena di input, il fornitore recupera il prefisso corrispondente e applica la tariffa inferiore di lettura della cache.
La funzionalità è più rilevante quando le richieste contengono un prefisso ampio e stabile. Un agente di coding potrebbe inviare ripetutamente istruzioni del repository, descrizioni degli strumenti, standard di programmazione e file sorgente selezionati. Un sistema di ricerca potrebbe riutilizzare un lungo manuale di policy o una raccolta di documenti per molte domande.
Gli agenti di assistenza clienti possono seguire lo stesso schema. Spesso portano in ogni turno un prompt di sistema stabile, il catalogo prodotti, regole di escalation e schemi degli strumenti. Cambiano solo il messaggio più recente del cliente e l'ultimo stato operativo dell'agente.
Con i prezzi attuali di Sonnet 5.5, Anthropic indica $2 per milione di token per l'input standard e $10 per milione per l'output. Un cache hit costa ora il 5% della tariffa di input standard, in calo dal 10%.
Le scritture della cache restano più costose dell'input ordinario perché il contenuto riutilizzabile deve prima essere memorizzato. Anthropic indica $2.50 per milione di token per scritture in cache di cinque minuti e $4 per scritture di un'ora. Il prezzo inferiore di lettura conviene solo quando un'applicazione riutilizza abbastanza volte il prefisso memorizzato.
Si consideri un carico di lavoro semplificato che invia 100.000 token stabili in 100 richieste. Senza caching, quei token ripetuti rappresentano 10 milioni di token di input standard. Con una cache efficace, la prima richiesta scrive il prefisso, mentre le richieste successive ne recuperano la maggior parte alla tariffa di lettura della cache.
La nuova tariffa dimezza la componente di lettura di questo esempio. Non riduce il costo di nuovo input, creazione della cache, output del modello, strumenti esterni, tentativi ripetuti o attività non riuscite.
La riduzione stimata del 20% da Anthropic descrive quindi ciò che l'azienda definisce “la maggior parte del lavoro agentico”. Non è uno sconto universale su ogni richiesta a Sonnet 5.5. Prompt brevi, bassi tassi di cache hit o carichi di lavoro con molto output vedranno un cambiamento minore.
Il taglio dei prezzi segue il lancio di Sonnet 5.5 del 28 settembre. Nel suo rilascio originale di Sonnet 5.5, Anthropic aveva fissato le letture della cache a $0.20 e affermato che il modello richiedeva in genere meno token rispetto a Sonnet 5.
Questa affermazione al lancio già posizionava l'efficienza a livello di attività, non solo a livello di token. Anthropic ha dichiarato che Sonnet 5.5 poteva costare fino al 30% in meno per attività rispetto al suo predecessore e generare output oltre il 30% più velocemente.
L'aggiustamento della cache aggiunge un'altra leva di efficienza meno di due settimane dopo. Rafforza inoltre il messaggio di Anthropic secondo cui gli agenti persistenti, anziché risposte isolate dei chatbot, stanno diventando l'unità che conta.
Perché gli agenti a lunga esecuzione rendono più preziosi i cache hit
Gli agenti consumano ripetutamente lo stesso contesto, quindi l'economia della cache può contare più di una modesta variazione dei prezzi dell'input ordinario.
Una richiesta convenzionale a un chatbot può includere una breve istruzione e un messaggio dell'utente. Un'applicazione agentica normalmente porta molta più struttura in ogni chiamata al modello.
Questa struttura può includere una policy operativa, decine di definizioni di strumenti, cronologia dell'attività, record recuperati, documentazione software e un piano assemblato nei passaggi precedenti. Molti componenti restano invariati mentre l'agente effettua ricerche, modifica file, chiama servizi e verifica il risultato.
Il prompt caching memorizza un prefisso riutilizzabile di quella richiesta. Le chiamate successive possono recuperare il contenuto corrispondente a una tariffa ridotta anziché fatturare ogni token come nuovo input.
Il caching non significa che il modello ricordi le informazioni in modo permanente. È un meccanismo di fatturazione ed elaborazione per contenuti di prompt corrispondenti entro una durata di cache definita. Se il prefisso cambia, scade o non soddisfa le regole di caching del fornitore, l'applicazione deve scriverlo di nuovo.
Questa distinzione crea tre variabili pratiche.
In primo luogo, gli sviluppatori necessitano di un alto tasso di cache hit. Istruzioni e strumenti stabili dovrebbero comparire prima dei messaggi che cambiano frequentemente. Modifiche non necessarie al prefisso memorizzato nella cache possono invalidarne il riutilizzo.
In secondo luogo, l'applicazione necessita di un numero sufficiente di chiamate ripetute per recuperare il sovrapprezzo di scrittura della cache. Un prefisso usato una sola volta non offre risparmi di lettura. Un prefisso usato centinaia di volte può rendere la tariffa di lettura una componente di costo importante.
In terzo luogo, la generazione dell'output continua a essere rilevante. L'output di Sonnet 5.5 costa $10 per milione di token, 100 volte la sua nuova tariffa di lettura della cache. Un agente che genera spiegazioni lunghe, si ripete o entra in cicli di tentativi può annullare i guadagni derivanti da un contesto memorizzato nella cache meno costoso.
Ecco perché la riduzione percentuale varia a seconda dell'applicazione. La cifra del 20% di Anthropic implica un carico di lavoro in cui le letture della cache rappresentano una quota sostanziale, ma non dominante, della fattura originale.
Un semplice modello di costo rende più chiara questa relazione. Si supponga che in precedenza le letture della cache rappresentassero il 40% della spesa di un carico di lavoro per il modello. Dimezzare quella componente riduce il totale del 20%. Se le letture della cache rappresentassero solo il 10%, lo stesso cambiamento di prezzo ridurrebbe la spesa totale del 5%.
Nessuno dei due esempi prevede la fattura di un cliente specifico. Mostrano cosa deve essere vero affinché valga l'affermazione media di Anthropic.
I maggiori beneficiari saranno probabilmente i sistemi con prefissi lunghi e riutilizzabili e molte chiamate sequenziali. Gli agenti di coding corrispondono a questo schema perché le istruzioni del repository e le definizioni degli strumenti spesso persistono per l'intera attività.
Anche l'analisi dei documenti può trarne vantaggio. Un team potrebbe inserire un grande contratto, una specifica tecnica o un pacchetto di ricerca in un prefisso memorizzato nella cache, quindi porre una serie di domande mirate.
Gli agenti per il lavoro della conoscenza hanno esigenze analoghe. Possono consultare ripetutamente policy aziendali stabili, verbali di riunioni o documentazione di progetto durante la produzione di un report. I team che costruiscono questi sistemi necessitano comunque di una selezione disciplinata del contesto, proprio come quando si mantiene una base di conoscenza tecnica ricercabile.
Memorizzare nella cache un contesto debolmente organizzato non lo rende utile. Rende solo meno costosa la sua trasmissione ripetuta. Un recupero inadeguato può comunque riempire il prompt di materiale irrilevante e costringere il modello a spendere token di output per risolvere ambiguità.
La documentazione sul prompt caching di Anthropic raccomanda di posizionare il contenuto statico vicino all'inizio di un prompt e quello dinamico successivamente. Questa struttura aumenta la probabilità che le richieste successive corrispondano a un prefisso memorizzato.
Gli sviluppatori dovrebbero inoltre monitorare separatamente i contatori di creazione e lettura della cache. Un basso rapporto tra letture e scritture può rivelare durate brevi della cache, prefissi instabili, modifiche al routing o richieste che non riutilizzano mai il contesto memorizzato.
I nuovi prezzi della cache di Claude Sonnet 5.5 rendono più preziose queste decisioni ingegneristiche. Non eliminano la necessità di misurarle.
Anthropic e OpenAI ora condividono le stesse tariffe headline
Il taglio neutralizza un vantaggio di prezzo visibile di OpenAI e costringe gli acquirenti a confrontare il costo del completamento di intere attività.
OpenAI ha introdotto GPT-6.1 Sol con le stesse tariffe di $2 per l'input e $10 per l'output applicate da Anthropic a Sonnet 5.5. Tuttavia, GPT-6.1 Sol è stato lanciato con input memorizzato nella cache a $0.10 per milione di token.
Prima della riduzione di Anthropic, un'applicazione che confrontava soltanto questi tre campi del listino vedeva una differenza netta. L'input memorizzato nella cache di Sonnet 5.5 costava il doppio.
Questa differenza è ora scomparsa. Sonnet 5.5 e GPT-6.1 Sol riportano entrambi:
Input standard a $2 per milione di token
Input memorizzato nella cache a $0.10 per milione di token
Scritture della cache a $2.50 per milione di token per la durata base della cache
Output a $10 per milione di token
OpenAI afferma che l'input memorizzato nella cache di GPT-6.1 Sol costa il 5% della sua tariffa di input standard. La sua documentazione del modello indica inoltre una finestra di contesto di 1,05 milioni di token e il supporto per molteplici impostazioni dell'effort di ragionamento.
Le tariffe corrispondenti rendono meno utile un semplice confronto dei prezzi. Due agenti possono utilizzare modelli con prezzi dei token identici e produrre comunque fatture molto diverse.
Un modello potrebbe risolvere un problema di coding in otto chiamate. Un altro potrebbe richiederne 15, generare più token di ragionamento, invocare strumenti aggiuntivi o ripetere una patch non riuscita. Il secondo sistema può costare di più nonostante un listino identico.
L'affidabilità modifica nuovamente il calcolo. Un primo tentativo economico offre poco valore se una persona deve individuare un errore, ripristinare il lavoro danneggiato e rieseguire l'attività. La misura economicamente rilevante è il costo di un risultato accettato.
Anche la latenza ha un costo. Un agente che completa il lavoro con meno passaggi sequenziali può liberare capacità di calcolo e ridurre il tempo di attesa degli utenti. Per i prodotti interattivi questo può contare più di una piccola differenza nella spesa per token.
Anthropic cerca di inquadrare Sonnet 5.5 attorno a questa misura a livello di attività. L'azienda riporta un risultato del 70,6% su Terminal-Bench 4.0, che valuta attività professionali multi-step in un ambiente a riga di comando.
Anthropic afferma inoltre che Sonnet 5.5 funziona oltre il 30% più velocemente di Sonnet 5 e può utilizzare meno token per lo stesso lavoro. Si tratta di risultati riportati dall'azienda, e le prestazioni in produzione dipendono dall'harness dell'agente, dai prompt, dagli strumenti e dalla distribuzione delle attività.
OpenAI presenta proprie affermazioni sulle prestazioni e l'efficienza di GPT-6.1 Sol. Il suo annuncio di lancio descrive il modello come vicino alle capacità di GPT-6 Astra a tariffe standard per token più basse.
Nessuna suite di benchmark delle due aziende fornisce un vincitore universale. I test di Anthropic utilizzano specifiche impostazioni di effort e configurazioni di agenti. Le valutazioni di OpenAI usano il proprio ambiente di ricerca e riconoscono che il comportamento dell'API può differire.
Per gli acquirenti enterprise, il confronto pratico richiede ora un insieme di valutazione rappresentativo. I team devono misurare il completamento riuscito, l'accettazione umana, le chiamate agli strumenti, i token memorizzati nella cache, l'input non memorizzato, l'output, la latenza e i tentativi ripetuti.
Dovrebbero inoltre testare gli stessi vincoli operativi. Offrire a un modello strumenti aggiuntivi, un pacchetto di contesto diverso o un'impostazione di ragionamento più generosa rende il confronto dei costi inaffidabile.
La principale sfida non è più il prezzo della cache di Sonnet contro quello di OpenAI. È l’affermazione di Anthropic sull’efficienza nel completamento delle attività contro la realtà dei carichi di lavoro in produzione di ciascun cliente.
L’affermazione di un risparmio del 20% presenta limiti importanti
La stima di Anthropic è plausibile per gli agenti che fanno largo uso della cache, ma non dovrebbe essere considerata una riduzione automatica dei costi operativi complessivi.
Il primo limite è l’idoneità alla cache. Le applicazioni ricevono il prezzo inferiore soltanto quando le richieste producono effettivi cache hit. Contenuti simili non sono necessariamente contenuti identici.
Spostare una definizione di strumento, modificare un timestamp, riordinare i documenti recuperati o cambiare una delle prime istruzioni di sistema può interrompere il prefisso riutilizzabile. Piccole scelte architetturali possono quindi determinare se si applica la tariffa pubblicizzata.
Il secondo limite è la durata della cache. Anthropic supporta diverse durate di archiviazione con differenti prezzi di scrittura. Un sistema con lunghe pause tra le richieste potrebbe dover ripetere le scritture in cache, riducendo il risparmio netto.
Il terzo limite è il costo dell’output. Le letture dalla cache sono ora economiche, ma i token generati restano molto più costosi. Lunghe tracce di ragionamento, risposte prolisse e correzioni ripetute possono dominare il conto finale.
Il quarto limite è il sovraccarico di orchestrazione. Gli agenti chiamano spesso sistemi di ricerca, browser, database, ambienti di esecuzione del codice o API di terze parti. La riduzione del prezzo del modello di Anthropic non abbassa tali costi.
Il quinto limite è la revisione umana. Un modello che produce lavoro economico ma inaffidabile può aumentare i costi del personale. Questo rischio è particolarmente rilevante per modifiche software, flussi di lavoro regolamentati e azioni che interessano i dati dei clienti.
Persino l’annuncio originale di Anthropic su Sonnet 5.5 avverte che i benchmark catturano soltanto un aspetto delle capacità di un modello. L’azienda afferma che Opus 5.5 resta più efficace per attività complesse e aperte che richiedono un giudizio continuo.
Questo crea un compromesso nel routing. Gli sviluppatori possono assegnare il lavoro di routine e ben circoscritto a Sonnet 5.5, riservando le decisioni più difficili a un modello più grande. Tuttavia, un routing errato può portare Sonnet a fallire ripetutamente prima che il sistema effettui l’escalation.
Un router progettato male può sprecare più denaro di quanto faccia risparmiare lo sconto sulla cache. I team dovrebbero misurare l’intero percorso, inclusi i tentativi falliti e le chiamate di escalation.
Il confronto con GPT-6.1 Sol presenta un’altra complicazione. Prezzi di riferimento equivalenti non significano che i fornitori implementino la cache in modo identico.
La guida alla cache di OpenAI afferma che i modelli più recenti supportano breakpoint espliciti o impliciti, a seconda del modello. Descrive inoltre lunghezze minime dei prompt e regole di rendicontazione che influenzano quali token risultano idonei.
Anthropic utilizza i propri controlli della cache, durate, breakpoint e report di utilizzo. Migrare un agente tra fornitori può richiedere una ristrutturazione dei prompt prima che il suo tasso di cache hit diventi comparabile.
La distribuzione cloud può complicare ulteriormente il quadro. Sonnet 5.5 è disponibile tramite Anthropic e piattaforme partner, ma prezzi, disponibilità regionale e tempistiche delle funzionalità possono variare a seconda del fornitore.
La tariffa annunciata di $0.10 dovrebbe quindi essere verificata sullo specifico endpoint usato in produzione. Un’azienda che opera tramite un marketplace cloud non dovrebbe presumere che ogni servizio regionale abbia adottato il cambiamento contemporaneamente.
Dietro l’affermazione del 20% c’è anche una questione di misurazione. Anthropic non ha pubblicato una distribuzione dettagliata che mostri il consumo della cache nei carichi di lavoro dei clienti. “La maggior parte del lavoro agentico” raggruppa coding, ricerca, uso del browser, assistenza clienti e altri modelli con profili di token differenti.
L’interpretazione più prudente è semplice. Anthropic ha dimezzato un prezzo unitario verificato. La sua percentuale più ampia rappresenta il mix di carichi di lavoro modellato o osservato dall’azienda, non un risultato garantito per il cliente.
I team possono convalidare l’affermazione confrontando diverse settimane di utilizzo. Le misure utili includono token di cache hit per richiesta, frequenza di scrittura nella cache, input non memorizzato nella cache, output, attività completate con successo e spesa totale per attività accettata.
Una diminuzione della spesa per la cache senza una riduzione simile del costo per attività segnalerebbe un altro collo di bottiglia. Potrebbe trattarsi della lunghezza dell’output, di tentativi falliti, di strumenti esterni o del tempo di correzione umana.
Cosa dovrebbero osservare sviluppatori e acquirenti di AI
La prossima fase verificherà se le tariffe di cache più basse migliorano l’economia della produzione o diventano semplicemente il nuovo standard per le piattaforme agentiche concorrenti.
Il primo segnale sono i dati di fatturazione aggiornati di Anthropic. Gli sviluppatori dovrebbero confermare che le loro richieste Sonnet 5.5 ricevano la nuova tariffa di lettura della cache e che le piattaforme partner espongano lo stesso cambiamento.
Questo rafforza la posizione di Anthropic se i clienti vedono una minore spesa per attività completata senza modificare le proprie applicazioni. Indebolisce l’affermazione più ampia del 20% se la maggior parte dei carichi di lavoro mostra soltanto una piccola riduzione.
Il secondo segnale è il prezzo della concorrenza. La tariffa equivalente di GPT-6.1 Sol di OpenAI sembra aver già eliminato il margine per Anthropic di far pagare il doppio per il contesto memorizzato nella cache.
Google e altri fornitori di modelli affrontano ora la stessa pressione. Gli acquirenti si aspettano sempre più che l’input memorizzato nella cache costi una piccola frazione dell’input ordinario, soprattutto per gli agenti progettati attorno a un contesto persistente.
Un’ulteriore risposta sui prezzi dimostrerebbe che il riutilizzo economico del contesto è diventato una caratteristica competitiva standard. L’assenza di risposta suggerirebbe che i fornitori continuano a differenziarsi attraverso qualità del modello, infrastruttura o sistemi di cache distinti.
Il terzo segnale sono test indipendenti a livello di attività. I prezzi dei token rivelano come i fornitori calcolano una fattura, ma non mostrano quanto lavoro un modello debba svolgere per completare un incarico.
Le valutazioni utili dovrebbero riportare il costo per risultato accettato, non solo l’accuratezza nei benchmark o il prezzo per milione di token. Dovrebbero inoltre indicare impostazioni di sforzo, accesso agli strumenti, politiche di nuovo tentativo, tassi di cache hit e criteri di revisione umana.
Per gli sviluppatori, l’azione immediata è esaminare l’utilizzo effettivo anziché moltiplicare i prezzi dei token per una dimensione teorica del prompt. Segmentate letture della cache, scritture della cache, input non memorizzato nella cache e output per attività rappresentative.
Poi collegate queste cifre ai risultati. Monitorate se l’agente ha completato l’attività, se una persona l’ha accettata e se il sistema ha richiesto escalation o correzioni.
L’ottimizzazione della cache dovrebbe iniziare dai prefissi stabili più grandi. Mantenete coerenti le istruzioni di sistema e le definizioni degli strumenti, collocate i contenuti dinamici più avanti ed evitate di inserire metadati variabili prima del materiale riutilizzabile.
I team dovrebbero anche testare il comportamento alla scadenza della cache. Una cache di cinque minuti può funzionare bene per cicli agentici intensi ma male per flussi di lavoro con lunghe pause di approvazione. L’opzione più costosa di un’ora può ridurre i costi totali quando evita scritture ripetute.
La decisione finale di acquisto dovrebbe confrontare almeno due modelli sullo stesso insieme di attività interne. L’equivalenza tra i prezzi della cache di Claude Sonnet 5.5 e di GPT-6.1 Sol rende quell’esperimento più facile da interpretare, ma non determina il vincitore.
La riduzione di Anthropic è significativa perché i carichi di lavoro agentici riutilizzano il contesto molto più spesso delle normali sessioni di chat. Conferma inoltre che i fornitori di modelli considerano ora il contesto memorizzato nella cache un campo di battaglia competitivo.
La domanda aperta è se prezzi della cache più bassi producano lavoro completato con successo a costi inferiori. Misurate per il prossimo mese il vostro tasso di cache hit, i tentativi ripetuti, il volume dell’output e i risultati accettati. Se il costo totale per attività completata scende vicino alla stima di Anthropic, il taglio ha cambiato la vostra economia. In caso contrario, la parte costosa del vostro agente si trova altrove.



