Anthropic halbiert Cache-Preise für Claude Sonnet 5.5 und zieht mit OpenAI bei 0,10 US-Dollar gleich
Anthropic hat die Cache-Preise für Claude Sonnet 5.5 um 50 % gesenkt und reduziert die Kosten für Cache-Lesevorgänge von 0,20 auf 0,10 US-Dollar pro Million Tokens. Das Unternehmen erklärt, Sonnet 5.5 werde dadurch bei den meisten agentischen Workloads etwa 20 % günstiger, bei denen Anwendungen lange Anweisungen und Kontext wiederholt nutzen.
Diese Einschränkung ist wichtig. Anthropic hat weder die regulären Eingabe- noch die Ausgaberaten des Modells gesenkt. Geändert wurde eine Komponente, die relevant wird, wenn ein Agent denselben Systemprompt, Tool-Definitionen, Repository-Kontext oder Referenzmaterial wiederholt übermittelt.
Der Schritt bringt zudem den Preis für Cache-Lesevorgänge bei Sonnet 5.5 auf das Niveau von OpenAIs GPT-6.1 Sol. Beide Modelle weisen nun dieselben Preise für Standardeingaben, zwischengespeicherte Eingaben und Ausgaben aus. Damit verlagert sich der Wettbewerb weg von den nominellen Tokenpreisen hin zu einer schwierigeren Frage: Welches Modell erledigt eine verlässliche Aufgabe mit weniger Anfragen, weniger generierten Tokens und weniger Nacharbeit?
Die Cache-Preise für Claude Sonnet 5.5 halbieren sich
Die unmittelbare Änderung ist eng umrissen, zielt jedoch auf einen der größten wiederkehrenden Kostenpunkte in langlebigen Agenten-Workflows.
Anthropic kündigte die Senkung am 7. Oktober 2026 zusammen mit der Veröffentlichung von Claude Haiku 5.5 an. In seiner Modellankündigung heißt es, Cache-Lesevorgänge für Sonnet 5.5 kosteten ab diesem Tag 0,10 statt 0,20 US-Dollar pro Million Tokens.
Ein Cache-Lesevorgang findet statt, wenn eine Anwendung zuvor gespeicherte Prompt-Inhalte wiederverwendet. Statt diese Inhalte erneut zum vollständigen Eingabepreis zu verarbeiten, ruft der Anbieter den passenden Präfix ab und berechnet den niedrigeren Cache-Lesepreis.
Die Funktion ist besonders relevant, wenn Anfragen einen großen, stabilen Präfix enthalten. Ein Coding-Agent könnte wiederholt Repository-Anweisungen, Tool-Beschreibungen, Coding-Standards und ausgewählte Quelldateien senden. Ein Recherche-System könnte ein umfangreiches Richtlinienhandbuch oder eine Dokumentensammlung über viele Fragen hinweg wiederverwenden.
Auch Kundensupport-Agenten können diesem Muster folgen. Sie führen häufig einen stabilen Systemprompt, einen Produktkatalog, Eskalationsregeln und Tool-Schemas in jeder Runde mit. Nur die jüngste Nachricht des Kunden und der aktuelle Arbeitszustand des Agenten ändern sich.
Nach der aktuellen Preisgestaltung für Sonnet 5.5 führt Anthropic Standardeingaben mit 2 US-Dollar pro Million Tokens und Ausgaben mit 10 US-Dollar pro Million Tokens auf. Ein Cache-Treffer kostet nun 5 % des regulären Eingabepreises, gegenüber zuvor 10 %.
Cache-Schreibvorgänge bleiben teurer als gewöhnliche Eingaben, weil die wiederverwendbaren Inhalte zunächst gespeichert werden müssen. Anthropic führt Cache-Schreibvorgänge mit fünf Minuten Laufzeit mit 2,50 US-Dollar pro Million Tokens und mit einer Stunde Laufzeit mit 4 US-Dollar auf. Der niedrigere Lesepreis zahlt sich nur aus, wenn eine Anwendung den gespeicherten Präfix oft genug wiederverwendet.
Betrachten wir einen vereinfachten Workload, der 100.000 stabile Tokens über 100 Anfragen hinweg sendet. Ohne Caching entsprechen diese wiederholten Tokens 10 Millionen Standard-Eingabe-Tokens. Bei einem wirksamen Cache schreibt die erste Anfrage den Präfix, während spätere Anfragen den Großteil davon zum Cache-Lesepreis abrufen.
Der neue Tarif halbiert in diesem Beispiel den Leseanteil. Er senkt nicht die Kosten für neue Eingaben, Cache-Erstellung, Modellausgaben, externe Tools, Wiederholungsversuche oder fehlgeschlagene Aufgaben.
Die von Anthropic geschätzte Senkung um 20 % beschreibt daher das, was das Unternehmen als „die meisten agentischen Workloads“ bezeichnet. Sie ist kein pauschaler Rabatt auf jede Sonnet-5.5-Anfrage. Kurze Prompts, niedrige Cache-Trefferraten oder ausgabelastige Workloads werden eine geringere Veränderung sehen.
Die Preissenkung folgt auf den Start von Sonnet 5.5 am 28. September. In der ursprünglichen Veröffentlichung von Sonnet 5.5 setzte Anthropic den Preis für Cache-Lesevorgänge auf 0,20 US-Dollar und erklärte, das Modell benötige üblicherweise weniger Tokens als Sonnet 5.
Diese Behauptung zur Einführung positionierte Effizienz bereits auf Aufgabenebene und nicht nur auf Tokenebene. Anthropic erklärte, Sonnet 5.5 könne pro Aufgabe bis zu 30 % weniger kosten als sein Vorgänger und Ausgaben mehr als 30 % schneller generieren.
Die Cache-Anpassung ergänzt weniger als zwei Wochen später einen weiteren Effizienzhebel. Sie schärft zugleich Anthropics Botschaft, dass beständige Agenten statt isolierter Chatbot-Antworten zunehmend zur entscheidenden Einheit werden.
Warum langlebige Agenten Cache-Treffer wertvoller machen
Agenten verarbeiten denselben Kontext wiederholt, sodass die Cache-Ökonomie wichtiger sein kann als eine moderate Änderung beim regulären Eingabepreis.
Eine herkömmliche Chatbot-Anfrage kann aus einer kurzen Anweisung und einer Nutzernachricht bestehen. Eine agentische Anwendung bringt üblicherweise deutlich mehr Mechanik in jeden Modellaufruf ein.
Dazu können eine Betriebsrichtlinie, Dutzende Tool-Definitionen, Aufgabenverlauf, abgerufene Datensätze, Softwaredokumentation und ein in früheren Schritten erstellter Plan gehören. Viele Komponenten bleiben unverändert, während der Agent sucht, Dateien bearbeitet, Dienste aufruft und sein Ergebnis überprüft.
Prompt-Caching speichert einen wiederverwendbaren Präfix aus dieser Anfrage. Spätere Aufrufe können die passenden Inhalte zu einem reduzierten Preis abrufen, statt jedes Token als neue Eingabe abzurechnen.
Caching bedeutet nicht, dass das Modell Informationen dauerhaft behält. Es ist ein Abrechnungs- und Verarbeitungsmechanismus für übereinstimmende Prompt-Inhalte innerhalb einer definierten Cache-Laufzeit. Wenn sich der Präfix ändert, abläuft oder die Caching-Regeln des Anbieters nicht erfüllt, muss die Anwendung ihn erneut schreiben.
Diese Unterscheidung schafft drei praktische Variablen.
Erstens benötigen Entwickler eine hohe Cache-Trefferrate. Stabile Anweisungen und Tools sollten vor häufig wechselnden Nachrichten stehen. Unnötige Änderungen am zwischengespeicherten Präfix können die Wiederverwendung ungültig machen.
Zweitens benötigt die Anwendung genügend wiederholte Aufrufe, um den Aufpreis für das Schreiben in den Cache auszugleichen. Ein einmal genutzter Präfix bietet keine Einsparungen bei Lesevorgängen. Ein Präfix, der Hunderte Male verwendet wird, kann den Lesepreis zu einem wesentlichen Kostenfaktor machen.
Drittens bleibt die Ausgabeerzeugung wichtig. Die Ausgabe von Sonnet 5.5 kostet 10 US-Dollar pro Million Tokens, das Hundertfache seines neuen Cache-Lesepreises. Ein Agent, der lange Erklärungen generiert, sich wiederholt oder in Wiederholungsschleifen gerät, kann die Gewinne durch günstigeren zwischengespeicherten Kontext zunichtemachen.
Deshalb variiert die prozentuale Senkung je nach Anwendung. Anthropics Wert von 20 % impliziert einen Workload, bei dem Cache-Lesevorgänge einen erheblichen, aber nicht dominanten Anteil der ursprünglichen Rechnung ausmachen.
Ein einfaches Kostenmodell verdeutlicht diese Beziehung. Angenommen, Cache-Lesevorgänge machten zuvor 40 % der Modellausgaben eines Workloads aus. Wenn diese Komponente halbiert wird, sinken die Gesamtkosten um 20 %. Läge ihr Anteil bei nur 10 %, würde dieselbe Preisänderung die Gesamtausgaben um 5 % reduzieren.
Keines der Beispiele prognostiziert die Rechnung eines bestimmten Kunden. Sie zeigen, was zutreffen muss, damit Anthropics durchschnittliche Aussage Bestand hat.
Die größten Nutznießer dürften Systeme mit langen, wiederverwendbaren Präfixen und vielen aufeinanderfolgenden Aufrufen sein. Coding-Agenten passen zu diesem Muster, weil Repository-Anweisungen und Tool-Definitionen häufig während einer Aufgabe bestehen bleiben.
Auch die Dokumentenanalyse kann profitieren. Ein Team könnte einen großen Vertrag, eine technische Spezifikation oder ein Recherchepaket in einem zwischengespeicherten Präfix platzieren und anschließend eine Reihe gezielter Fragen stellen.
Agenten für Wissensarbeit haben ähnliche Anforderungen. Sie können beim Erstellen eines Berichts wiederholt stabile Unternehmensrichtlinien, Besprechungsprotokolle oder Projektdokumentation heranziehen. Teams, die solche Systeme entwickeln, benötigen weiterhin eine disziplinierte Kontextauswahl – ähnlich wie bei der Pflege einer durchsuchbaren Engineering-Wissensdatenbank.
Das Caching schwach organisierter Inhalte macht sie nicht nützlich. Es verbilligt lediglich ihre wiederholte Übertragung. Schlechte Retrieval-Prozesse können den Prompt weiterhin mit irrelevanten Materialien füllen und das Modell dazu zwingen, Ausgabe-Tokens zur Auflösung von Mehrdeutigkeiten aufzuwenden.
Anthropics eigene Dokumentation zum Prompt-Caching empfiehlt, statische Inhalte nahe am Anfang eines Prompts und dynamische Inhalte später zu platzieren. Diese Struktur erhöht die Wahrscheinlichkeit, dass spätere Anfragen mit einem gespeicherten Präfix übereinstimmen.
Entwickler sollten außerdem Kennzahlen für Cache-Erstellung und Lesevorgänge getrennt überwachen. Ein niedriges Verhältnis von Lese- zu Schreibvorgängen kann auf kurze Cache-Laufzeiten, instabile Präfixe, Routing-Änderungen oder Anfragen hinweisen, die ihren gespeicherten Kontext nie wiederverwenden.
Die neue Cache-Preisgestaltung für Claude Sonnet 5.5 macht diese technischen Entscheidungen wertvoller. Sie ersetzt nicht die Notwendigkeit, sie zu messen.
Anthropic und OpenAI weisen nun dieselben nominalen Preise aus
Die Senkung neutralisiert einen sichtbaren Preisvorteil von OpenAI und zwingt Käufer dazu, die Kosten für die vollständige Erledigung von Aufgaben zu vergleichen.
OpenAI führte GPT-6.1 Sol mit denselben Eingabe- und Ausgaberaten von 2 beziehungsweise 10 US-Dollar ein, die Anthropic für Sonnet 5.5 verlangt. GPT-6.1 Sol startete jedoch mit einem Preis von 0,10 US-Dollar pro Million Tokens für zwischengespeicherte Eingaben.
Vor Anthropics Senkung ergab sich für eine Anwendung, die nur diese drei Felder der Preisliste verglich, ein klarer Unterschied. Zwischengespeicherte Eingaben bei Sonnet 5.5 kosteten doppelt so viel.
Dieser Unterschied ist nun verschwunden. Sonnet 5.5 und GPT-6.1 Sol führen beide auf:
Standardeingaben zu 2 US-Dollar pro Million Tokens
Zwischengespeicherte Eingaben zu 0,10 US-Dollar pro Million Tokens
Cache-Schreibvorgänge zu 2,50 US-Dollar pro Million Tokens für die grundlegende Cache-Laufzeit
Ausgaben zu 10 US-Dollar pro Million Tokens
OpenAI erklärt, dass zwischengespeicherte Eingaben für GPT-6.1 Sol 5 % des regulären Eingabepreises kosten. Die Modelldokumentation nennt außerdem ein Kontextfenster von 1,05 Millionen Tokens sowie Unterstützung für mehrere Einstellungen des Reasoning-Aufwands.
Die übereinstimmenden Preise machen einen einfachen Preisvergleich weniger aussagekräftig. Zwei Agenten können Modelle mit identischen Tokenpreisen nutzen und dennoch sehr unterschiedliche Rechnungen erzeugen.
Ein Modell könnte ein Coding-Problem in acht Aufrufen lösen. Ein anderes könnte 15 Aufrufe benötigen, mehr Reasoning-Tokens generieren, zusätzliche Tools aufrufen oder einen erfolglosen Patch wiederholen. Das zweite System kann trotz identischer Preisliste mehr kosten.
Zuverlässigkeit verändert die Rechnung erneut. Ein günstiger erster Versuch bietet wenig Wert, wenn eine Person einen Fehler identifizieren, beschädigte Arbeit wiederherstellen und die Aufgabe erneut ausführen muss. Wirtschaftlich relevant ist der Preis eines akzeptierten Ergebnisses.
Auch Latenz verursacht Kosten. Ein Agent, der Arbeit mit weniger aufeinanderfolgenden Schritten erledigt, kann Rechenkapazität freigeben und die Wartezeit für Nutzer verkürzen. Für interaktive Produkte kann das wichtiger sein als ein kleiner Unterschied bei den Token-Ausgaben.
Anthropic versucht, Sonnet 5.5 anhand dieses Maßstabs auf Aufgabenebene zu positionieren. Das Unternehmen berichtet ein Ergebnis von 70,6 % bei Terminal-Bench 4.0, das mehrstufige professionelle Aufgaben in einer Kommandozeilenumgebung bewertet.
Anthropic erklärt außerdem, Sonnet 5.5 arbeite mehr als 30 % schneller als Sonnet 5 und könne für dieselbe Arbeit weniger Tokens verwenden. Dies sind vom Unternehmen berichtete Ergebnisse; die Leistung in der Produktion hängt vom Agenten-Framework, den Prompts, Tools und der Aufgabenverteilung ab.
OpenAI erhebt für GPT-6.1 Sol eigene Leistungs- und Effizienzansprüche. Seine Ankündigung zur Einführung beschreibt das Modell als eines, das sich den Fähigkeiten von GPT-6 Astra bei niedrigeren regulären Tokenpreisen annähert.
Die Benchmark-Suites beider Unternehmen liefern keinen universellen Sieger. Anthropics Tests verwenden bestimmte Einstellungen für den Aufwand und Agenten-Konfigurationen. OpenAIs Bewertungen nutzen die eigene Forschungsumgebung und räumen ein, dass sich das API-Verhalten unterscheiden kann.
Für Unternehmenskäufer erfordert der praktische Vergleich nun ein repräsentatives Evaluierungsset. Teams müssen erfolgreiche Abschlüsse, menschliche Akzeptanz, Tool-Aufrufe, zwischengespeicherte Tokens, nicht zwischengespeicherte Eingaben, Ausgaben, Latenz und Wiederholungsversuche messen.
Sie sollten zudem dieselben betrieblichen Einschränkungen testen. Einem Modell zusätzliche Tools, ein anderes Kontextpaket oder eine großzügigere Reasoning-Einstellung zu geben, macht den Kostenvergleich unzuverlässig.
Der wichtigste Wettbewerb dreht sich nicht mehr um den Cache-Preis von Sonnet gegenüber dem von OpenAI. Entscheidend ist vielmehr Anthropics Behauptung effizienter Aufgabenerledigung im Vergleich zur Realität der Produktions-Workloads jedes Kunden.
Die 20%-Ersparnis hat wichtige Grenzen
Anthropics Schätzung ist für cache-intensive Agenten plausibel, sollte jedoch nicht als automatische Senkung der gesamten Betriebskosten verstanden werden.
Die erste Einschränkung betrifft die Cache-Eignung. Anwendungen erhalten den niedrigeren Preis nur, wenn Anfragen tatsächlich Cache-Treffer erzeugen. Ähnliche Inhalte sind nicht zwangsläufig identische Inhalte.
Das Verschieben einer Tool-Definition, das Ändern eines Zeitstempels, das Umordnen abgerufener Dokumente oder das Anpassen einer frühen Systemanweisung kann den wiederverwendbaren Präfix aufbrechen. Kleine Architekturentscheidungen können daher darüber entscheiden, ob der beworbene Tarif greift.
Die zweite Einschränkung ist die Cache-Laufzeit. Anthropic unterstützt unterschiedliche Speicherdauern mit unterschiedlichen Schreibpreisen. Ein System mit langen Pausen zwischen Anfragen kann wiederholte Cache-Schreibvorgänge benötigen, was die Nettoersparnis reduziert.
Die dritte Einschränkung sind die Ausgabekosten. Cache-Lesevorgänge sind inzwischen günstig, erzeugte Tokens bleiben jedoch deutlich teurer. Lange Reasoning-Traces, ausführliche Antworten und wiederholte Korrekturen können die endgültige Rechnung dominieren.
Die vierte Einschränkung ist der Orchestrierungsaufwand. Agenten rufen häufig Suchsysteme, Browser, Datenbanken, Code-Ausführungsumgebungen oder APIs von Drittanbietern auf. Die Senkung von Anthropics Modellpreisen reduziert diese Gebühren nicht.
Die fünfte Einschränkung ist die menschliche Prüfung. Ein Modell, das günstig, aber unzuverlässig arbeitet, kann die Arbeitskosten erhöhen. Dieses Risiko ist besonders relevant bei Softwareänderungen, regulierten Workflows und Aktionen, die Kundendaten betreffen.
Sogar Anthropics ursprüngliche Ankündigung zu Sonnet 5.5 weist darauf hin, dass Benchmarks nur einen Aspekt der Modellfähigkeit abbilden. Das Unternehmen sagt, Opus 5.5 bleibe bei komplexen, offenen Aufgaben, die dauerhaftes Urteilsvermögen erfordern, stärker.
Daraus entsteht ein Routing-Kompromiss. Entwickler können routinemäßige, klar abgegrenzte Arbeit Sonnet 5.5 zuweisen und schwierigere Entscheidungen einem größeren Modell vorbehalten. Falsches Routing kann jedoch dazu führen, dass Sonnet wiederholt scheitert, bevor das System eskaliert.
Ein schlecht konzipierter Router kann mehr Geld verschwenden, als der Cache-Rabatt einspart. Teams sollten den gesamten Pfad messen, einschließlich fehlgeschlagener Versuche und Eskalationsaufrufe.
Der Vergleich mit GPT-6.1 Sol bringt eine weitere Komplikation mit sich. Übereinstimmende Listenpreise bedeuten nicht, dass die Anbieter Caching identisch implementieren.
OpenAIs Caching-Leitfaden erklärt, dass neuere Modelle je nach Modell explizite oder implizite Breakpoints unterstützen. Er beschreibt außerdem Mindestlängen für Prompts und Reporting-Regeln, die beeinflussen, welche Tokens qualifiziert sind.
Anthropic verwendet eigene Cache-Kontrollen, Laufzeiten, Breakpoints und Nutzungsberichte. Die Migration eines Agenten zwischen Anbietern kann eine Umstrukturierung des Prompts erfordern, bevor seine Cache-Trefferquote vergleichbar wird.
Auch die Cloud-Distribution kann das Bild weiter verkomplizieren. Sonnet 5.5 ist über Anthropic und Partnerplattformen verfügbar, doch Preise, regionale Verfügbarkeit und Zeitpunkt neuer Funktionen können je nach Anbieter variieren.
Der angekündigte Preis von 0,10 US-Dollar sollte daher am konkreten Produktionsendpunkt überprüft werden. Ein Unternehmen, das über einen Cloud-Marktplatz arbeitet, sollte nicht davon ausgehen, dass jeder regionale Dienst die Änderung gleichzeitig übernommen hat.
Hinter der 20%-Behauptung steht zudem eine Messfrage. Anthropic hat keine detaillierte Verteilung veröffentlicht, die den Cache-Verbrauch über Kunden-Workloads hinweg zeigt. „Die meiste agentische Arbeit“ fasst Coding, Recherche, Browser-Nutzung, Kundensupport und andere Muster mit unterschiedlichen Token-Profilen zusammen.
Die sicherste Interpretation ist einfach. Anthropic hat einen verifizierten Stückpreis halbiert. Der weitergehende Prozentsatz repräsentiert den modellierten oder beobachteten Workload-Mix des Unternehmens, nicht ein garantiertes Kundenergebnis.
Teams können die Behauptung prüfen, indem sie mehrere Wochen Nutzung vergleichen. Nützliche Kennzahlen sind Cache-Treffer-Tokens pro Anfrage, Häufigkeit von Cache-Schreibvorgängen, nicht gecachter Input, Output, erfolgreiche Aufgaben und Gesamtausgaben pro akzeptierter Aufgabe.
Ein Rückgang der Cache-Ausgaben ohne vergleichbaren Rückgang der Aufgabenkosten würde auf einen anderen Engpass hindeuten. Dieser Engpass könnte die Ausgabelänge, fehlgeschlagene Versuche, externe Tools oder die Zeit für menschliche Korrekturen sein.
Worauf Entwickler und KI-Einkäufer als Nächstes achten sollten
Die nächste Phase wird zeigen, ob niedrigere Cache-Tarife die Produktionsökonomie verbessern oder lediglich zum neuen Standard für konkurrierende Agentenplattformen werden.
Das erste Signal sind Anthropics aktualisierte Abrechnungsdaten. Entwickler sollten bestätigen, dass ihre Sonnet-5.5-Anfragen den neuen Cache-Lesetarif erhalten und dass Partnerplattformen dieselbe Änderung anbieten.
Dies stärkt Anthropics Argumentation, wenn Kunden niedrigere Ausgaben pro abgeschlossener Aufgabe sehen, ohne ihre Anwendungen zu verändern. Die weitergehende 20%-Behauptung wird geschwächt, wenn die meisten Workloads nur eine geringe Reduzierung zeigen.
Das zweite Signal ist die wettbewerbliche Preisgestaltung. Der entsprechende Tarif für GPT-6.1 Sol scheint Anthropic bereits den Spielraum genommen zu haben, für gecachten Kontext das Doppelte zu verlangen.
Google und andere Modellanbieter stehen nun unter demselben Druck. Käufer erwarten zunehmend, dass gecachter Input nur einen kleinen Bruchteil gewöhnlichen Inputs kostet – insbesondere bei Agenten, die auf persistentem Kontext basieren.
Eine weitere Preisreaktion würde zeigen, dass günstige Kontextwiederverwendung zu einem wettbewerblichen Standardmerkmal geworden ist. Keine Reaktion würde darauf hindeuten, dass sich Anbieter weiterhin über Modellqualität, Infrastruktur oder unterschiedliche Caching-Systeme differenzieren.
Das dritte Signal sind unabhängige Tests auf Aufgabenebene. Tokenpreise zeigen, wie Anbieter eine Rechnung berechnen, aber nicht, wie viel Arbeit ein Modell benötigt, um eine Aufgabe abzuschließen.
Sinnvolle Bewertungen sollten Kosten pro akzeptiertem Ergebnis berichten, nicht nur Benchmark-Genauigkeit oder Preis pro Million Tokens. Sie sollten außerdem Aufwandsparameter, Tool-Zugriff, Wiederholungsrichtlinien, Cache-Trefferquoten und Kriterien für menschliche Prüfung offenlegen.
Für Entwickler besteht die unmittelbare Maßnahme darin, die tatsächliche Nutzung zu prüfen, statt Tokenpreise mit einer theoretischen Prompt-Größe zu multiplizieren. Segmentieren Sie Cache-Lesevorgänge, Cache-Schreibvorgänge, nicht gecachten Input und Output für repräsentative Aufgaben.
Verknüpfen Sie diese Zahlen anschließend mit den Ergebnissen. Erfassen Sie, ob der Agent die Aufgabe abgeschlossen hat, ob eine Person sie akzeptiert hat und ob das System Eskalation oder Nachbesserung benötigte.
Die Cache-Optimierung sollte bei den größten stabilen Präfixen beginnen. Halten Sie Systemanweisungen und Tool-Definitionen konsistent, platzieren Sie dynamische Inhalte später und vermeiden Sie, sich ändernde Metadaten vor wiederverwendbarem Material einzufügen.
Teams sollten auch das Verhalten bei Cache-Ablauf testen. Ein Fünf-Minuten-Cache kann für dichte Agentenzyklen gut funktionieren, aber für Workflows mit langen Freigabepausen schlecht. Die teurere Ein-Stunden-Option kann die Gesamtkosten senken, wenn sie wiederholte Schreibvorgänge verhindert.
Die endgültige Kaufentscheidung sollte mindestens zwei Modelle anhand desselben internen Aufgabensatzes vergleichen. Die übereinstimmenden Cache-Preise von Claude Sonnet 5.5 und GPT-6.1 Sol erleichtern die Interpretation dieses Experiments, entscheiden jedoch nicht über den Gewinner.
Anthropics Senkung ist bedeutsam, weil Agenten-Workloads Kontext weit häufiger wiederverwenden als gewöhnliche Chat-Sitzungen. Sie bestätigt auch, dass Modellanbieter gecachten Kontext inzwischen als wettbewerbliches Schlachtfeld betrachten.
Die offene Frage lautet, ob niedrigere Cache-Preise tatsächlich zu günstigerer erfolgreicher Arbeit führen. Messen Sie im nächsten Monat Ihre Cache-Trefferquote, Wiederholungen, das Output-Volumen und akzeptierte Ergebnisse. Wenn die Gesamtkosten pro abgeschlossener Aufgabe nahe an Anthropics Schätzung sinken, hat die Preissenkung Ihre Wirtschaftlichkeit verändert. Wenn nicht, liegt der teure Teil Ihres Agenten an anderer Stelle.



