Anthropic obniża ceny cache dla Claude Sonnet 5.5, zrównując je z OpenAI na poziomie 0,10 USD
Anthropic obniżył o 50% ceny cache dla Claude Sonnet 5.5, redukując koszt odczytów cache z 0,20 USD do 0,10 USD za milion tokenów. Firma twierdzi, że zmiana sprawia, iż Sonnet 5.5 jest o około 20% tańszy w większości zadań agentowych, w których aplikacje wielokrotnie wykorzystują długie instrukcje i kontekst.
To zastrzeżenie jest istotne. Anthropic nie obniżył standardowych stawek za wejście ani wyjście modelu. Zmienił jeden komponent, który zyskuje na znaczeniu, gdy agent wielokrotnie wysyła ten sam prompt systemowy, definicje narzędzi, kontekst repozytorium lub materiały referencyjne.
Ruch ten zrównuje również stawkę za odczyty cache Sonnet 5.5 z OpenAI GPT-6.1 Sol. Oba modele mają teraz takie same ceny za standardowe wejście, wejście z cache i wyjście. Konkurencja przestaje więc dotyczyć nagłówkowych stawek za tokeny, a skupia się na trudniejszym pytaniu: który model niezawodnie kończy zadanie przy mniejszej liczbie żądań, mniejszej liczbie wygenerowanych tokenów i mniejszej ilości poprawek?
Ceny cache Claude Sonnet 5.5 spadają o połowę
Bezpośrednia zmiana jest wąska, ale dotyczy jednego z największych powtarzalnych kosztów w długo działających przepływach pracy agentów.
Anthropic ogłosił obniżkę 7 października 2026 r., wraz z premierą Claude Haiku 5.5. W swoim ogłoszeniu modelu firma podaje, że odczyty cache Sonnet 5.5 kosztują teraz 0,10 USD za milion tokenów zamiast 0,20 USD, ze skutkiem od tego dnia.
Odczyt cache występuje, gdy aplikacja ponownie wykorzystuje wcześniej zapisane treści promptu. Zamiast ponownie przetwarzać je według pełnej stawki wejściowej, dostawca pobiera pasujący prefiks i nalicza niższą stawkę za odczyt cache.
Funkcja ma największe znaczenie, gdy żądania zawierają duży, stabilny prefiks. Agent programistyczny może wielokrotnie wysyłać instrukcje dotyczące repozytorium, opisy narzędzi, standardy kodowania i wybrane pliki źródłowe. System badawczy może ponownie wykorzystywać obszerny podręcznik zasad lub zbiór dokumentów w wielu pytaniach.
Agenci obsługi klienta mogą działać według podobnego schematu. Często w każdej turze przenoszą stabilny prompt systemowy, katalog produktów, zasady eskalacji i schematy narzędzi. Zmienia się jedynie najnowsza wiadomość klienta oraz aktualny stan pracy agenta.
Według obecnych cen Sonnet 5.5 Anthropic podaje stawkę standardowego wejścia na poziomie 2 USD za milion tokenów, a wyjścia — 10 USD za milion. Trafienie w cache kosztuje teraz 5% standardowej stawki wejściowej, wobec wcześniejszych 10%.
Zapisy do cache pozostają droższe od zwykłego wejścia, ponieważ treść przeznaczona do ponownego wykorzystania musi najpierw zostać zapisana. Anthropic podaje stawkę 2,50 USD za milion tokenów dla pięciominutowych zapisów cache oraz 4 USD dla zapisów godzinnych. Niższa cena odczytu przynosi korzyści tylko wtedy, gdy aplikacja wystarczająco często ponownie wykorzystuje zapisany prefiks.
Rozważmy uproszczone obciążenie, które przesyła 100 000 stabilnych tokenów w ramach 100 żądań. Bez cache te powtarzane tokeny stanowią 10 milionów tokenów standardowego wejścia. Przy skutecznym cache pierwsze żądanie zapisuje prefiks, a późniejsze żądania pobierają jego większość po stawce odczytu cache.
Nowa stawka zmniejsza o połowę część odczytową tego przykładu. Nie obniża kosztu nowych danych wejściowych, tworzenia cache, wyjścia modelu, zewnętrznych narzędzi, ponownych prób ani nieudanych zadań.
Szacowana przez Anthropic redukcja o 20% opisuje więc to, co firma określa jako „większość pracy agentowej”. Nie jest to uniwersalna zniżka na każde żądanie Sonnet 5.5. Krótkie prompty, niski współczynnik trafień cache lub obciążenia zdominowane przez wyjście przyniosą mniejszą zmianę.
Obniżka cen następuje po premierze Sonnet 5.5 z 28 września. W pierwotnej informacji o premierze Sonnet 5.5 Anthropic wycenił odczyty cache na 0,20 USD i stwierdził, że model zazwyczaj wymaga mniej tokenów niż Sonnet 5.
To twierdzenie już wtedy pozycjonowało efektywność na poziomie zadania, a nie wyłącznie tokena. Anthropic podał, że Sonnet 5.5 może kosztować do 30% mniej na zadanie niż jego poprzednik i generować odpowiedzi ponad 30% szybciej.
Korekta cen cache dodaje kolejny element efektywności niespełna dwa tygodnie później. Wzmacnia też przekaz Anthropic, że kluczową jednostką stają się trwałe agenty, a nie pojedyncze odpowiedzi chatbota.
Dlaczego długo działające agenty czerpią większą wartość z trafień cache
Agenty wielokrotnie korzystają z tego samego kontekstu, dlatego ekonomika cache może mieć większe znaczenie niż niewielka zmiana zwykłych cen wejściowych.
Typowe żądanie do chatbota może zawierać krótką instrukcję i jedną wiadomość użytkownika. Aplikacja agentowa zwykle wnosi do każdego wywołania modelu znacznie więcej mechanizmów.
Mogą one obejmować politykę działania, dziesiątki definicji narzędzi, historię zadania, pobrane rekordy, dokumentację oprogramowania oraz plan opracowany we wcześniejszych etapach. Wiele komponentów pozostaje niezmienionych, gdy agent wyszukuje informacje, edytuje pliki, wywołuje usługi i weryfikuje rezultat.
Cache promptów zapisuje prefiks, który można ponownie wykorzystać z tego żądania. Kolejne wywołania mogą pobrać pasującą treść po obniżonej stawce zamiast naliczać koszt każdego tokena jako świeżego wejścia.
Cache nie oznacza, że model trwale zapamiętuje informacje. To mechanizm rozliczeniowy i przetwarzania pasujących treści promptu w zdefiniowanym czasie życia cache. Jeśli prefiks się zmieni, wygaśnie lub nie spełni zasad cache dostawcy, aplikacja musi zapisać go ponownie.
To rozróżnienie tworzy trzy praktyczne zmienne.
Po pierwsze, deweloperzy potrzebują wysokiego współczynnika trafień cache. Stabilne instrukcje i narzędzia powinny pojawiać się przed często zmieniającymi się wiadomościami. Niepotrzebne zmiany w prefiksie przechowywanym w cache mogą unieważnić możliwość jego ponownego użycia.
Po drugie, aplikacja potrzebuje wystarczającej liczby powtórzonych wywołań, aby odzyskać dodatkowy koszt zapisu do cache. Prefiks użyty raz nie daje oszczędności na odczytach. Prefiks użyty setki razy może sprawić, że stawka odczytu stanie się istotnym składnikiem kosztów.
Po trzecie, nadal znaczenie ma generowanie wyjścia. Wyjście Sonnet 5.5 kosztuje 10 USD za milion tokenów, czyli 100 razy więcej niż jego nowa stawka odczytu cache. Agent, który generuje długie wyjaśnienia, powtarza się lub wpada w pętle ponownych prób, może zniwelować korzyści z tańszego kontekstu cache.
Dlatego procentowa redukcja zależy od aplikacji. Wartość 20% podawana przez Anthropic sugeruje obciążenie, w którym odczyty cache stanowią istotną, lecz nie dominującą część pierwotnego rachunku.
Prosty model kosztowy lepiej pokazuje tę zależność. Załóżmy, że odczyty cache stanowiły wcześniej 40% wydatków modelowych danego obciążenia. Obniżenie tego komponentu o połowę zmniejsza całkowity koszt o 20%. Gdyby odczyty cache stanowiły jedynie 10%, ta sama zmiana ceny obniżyłaby łączne wydatki o 5%.
Żaden z tych przykładów nie przewiduje rachunku konkretnego klienta. Pokazują one, co musi być prawdą, aby średnie twierdzenie Anthropic miało zastosowanie.
Największymi beneficjentami będą prawdopodobnie systemy z długimi, wielokrotnie używanymi prefiksami i wieloma sekwencyjnymi wywołaniami. Agenci programistyczni pasują do tego wzorca, ponieważ instrukcje repozytorium i definicje narzędzi często utrzymują się przez całe zadanie.
Analiza dokumentów również może na tym skorzystać. Zespół może umieścić dużą umowę, specyfikację techniczną lub pakiet badawczy w prefiksie cache, a następnie zadawać serię konkretnych pytań.
Agenty do pracy z wiedzą mają podobne potrzeby. Mogą wielokrotnie konsultować stabilne polityki firmowe, zapisy spotkań lub dokumentację projektu podczas tworzenia raportu. Zespoły budujące takie systemy nadal potrzebują zdyscyplinowanego doboru kontekstu, podobnie jak przy utrzymywaniu przeszukiwalnej bazy wiedzy inżynierskiej.
Cache słabo zorganizowanego kontekstu nie czyni go użytecznym. Jedynie obniża koszt jego wielokrotnego przesyłania. Słabe wyszukiwanie nadal może wypełniać prompt nieistotnym materiałem i zmuszać model do zużywania tokenów wyjściowych na rozwiązywanie niejednoznaczności.
Własna dokumentacja cache promptów Anthropic zaleca umieszczanie statycznej treści blisko początku promptu, a dynamicznej — później. Taka struktura zwiększa szansę, że późniejsze żądania dopasują się do zapisanego prefiksu.
Deweloperzy powinni także osobno monitorować liczniki tworzenia cache i odczytów. Niski stosunek odczytów do zapisów może ujawniać krótki czas życia cache, niestabilne prefiksy, zmiany routingu lub żądania, które nigdy nie wykorzystują ponownie zapisanego kontekstu.
Nowe ceny cache Claude Sonnet 5.5 zwiększają wartość tych decyzji inżynierskich. Nie eliminują jednak potrzeby ich mierzenia.
Anthropic i OpenAI mają teraz takie same stawki nagłówkowe
Obniżka neutralizuje widoczną przewagę cenową OpenAI i zmusza nabywców do porównywania kosztu wykonania całych zadań.
OpenAI wprowadziło GPT-6.1 Sol z takimi samymi stawkami 2 USD za wejście i 10 USD za wyjście, jakie Anthropic pobiera za Sonnet 5.5. GPT-6.1 Sol zadebiutował jednak z ceną wejścia z cache na poziomie 0,10 USD za milion tokenów.
Przed obniżką Anthropic aplikacja porównująca wyłącznie te trzy pola cennika widziała wyraźną różnicę. Wejście z cache Sonnet 5.5 kosztowało dwukrotnie więcej.
Ta różnica właśnie zniknęła. Sonnet 5.5 i GPT-6.1 Sol podają obecnie:
Standardowe wejście po 2 USD za milion tokenów
Wejście z cache po 0,10 USD za milion tokenów
Zapisy do cache po 2,50 USD za milion tokenów dla podstawowego czasu trwania cache
Wyjście po 10 USD za milion tokenów
OpenAI podaje, że wejście z cache GPT-6.1 Sol kosztuje 5% jego standardowej stawki wejściowej. Dokumentacja modelu wskazuje również okno kontekstowe o długości 1,05 miliona tokenów oraz obsługę wielu ustawień intensywności rozumowania.
Zrównane stawki czynią proste porównanie cen mniej użytecznym. Dwa agenty mogą używać modeli o identycznych cenach tokenów, a mimo to generować bardzo różne rachunki.
Jeden model może rozwiązać problem programistyczny w ośmiu wywołaniach. Inny może potrzebować 15 wywołań, wygenerować więcej tokenów rozumowania, uruchomić dodatkowe narzędzia lub powtórzyć nieudaną poprawkę. Drugi system może kosztować więcej mimo identycznego cennika.
Niezawodność ponownie zmienia rachunek. Tania pierwsza próba ma niewielką wartość, jeśli człowiek musi wykryć błąd, przywrócić uszkodzoną pracę i ponownie uruchomić zadanie. Ekonomicznie istotną miarą jest koszt zaakceptowanego rezultatu.
Opóźnienie również ma koszt. Agent, który kończy pracę przy mniejszej liczbie sekwencyjnych kroków, może zwolnić zasoby obliczeniowe i skrócić czas oczekiwania użytkownika. W przypadku produktów interaktywnych może to mieć większe znaczenie niż niewielka różnica w wydatkach na tokeny.
Anthropic próbuje przedstawiać Sonnet 5.5 właśnie przez pryzmat tej miary na poziomie zadania. Firma raportuje wynik 70,6% w Terminal-Bench 4.0, który ocenia wieloetapowe zadania zawodowe w środowisku wiersza poleceń.
Anthropic podaje również, że Sonnet 5.5 działa o ponad 30% szybciej niż Sonnet 5 i może zużywać mniej tokenów przy tej samej pracy. Są to wyniki raportowane przez firmę, a wydajność produkcyjna zależy od platformy agentowej, promptów, narzędzi i rozkładu zadań.
OpenAI przedstawia własne twierdzenia dotyczące wydajności i efektywności GPT-6.1 Sol. W swoim ogłoszeniu premiery opisuje model jako zbliżający się możliwościami do GPT-6 Astra przy niższych standardowych stawkach tokenowych.
Żaden zestaw benchmarków tych firm nie wskazuje uniwersalnego zwycięzcy. Testy Anthropic wykorzystują określone ustawienia wysiłku i konfiguracje agentów. Oceny OpenAI używają własnego środowiska badawczego i przyznają, że zachowanie API może się różnić.
Dla nabywców korporacyjnych praktyczne porównanie wymaga teraz reprezentatywnego zestawu ewaluacyjnego. Zespoły muszą mierzyć skuteczne ukończenie, akceptację przez człowieka, wywołania narzędzi, tokeny z cache, wejście bez cache, wyjście, opóźnienia i ponowne próby.
Powinny także testować te same ograniczenia operacyjne. Zapewnienie jednemu modelowi dodatkowych narzędzi, innego pakietu kontekstu lub bardziej hojnego ustawienia rozumowania sprawia, że porównanie kosztów staje się niewiarygodne.
Główna konkurencja nie dotyczy już ceny cache Sonnet w porównaniu z OpenAI. Chodzi o deklarację Anthropic dotyczącą efektywnego wykonywania zadań w zestawieniu z realiami produkcyjnych obciążeń każdego klienta.
Deklaracja 20% oszczędności ma istotne ograniczenia
Szacunek Anthropic jest wiarygodny w przypadku agentów intensywnie korzystających z cache, lecz nie należy traktować go jako automatycznej redukcji całkowitych kosztów operacyjnych.
Pierwszym ograniczeniem jest kwalifikowalność do cache. Aplikacje otrzymują niższą cenę tylko wtedy, gdy żądania faktycznie generują trafienia cache. Podobna treść nie musi być treścią identyczną.
Przeniesienie definicji narzędzia, zmiana znacznika czasu, przestawienie kolejności pobranych dokumentów lub modyfikacja wczesnej instrukcji systemowej mogą przerwać wielokrotnie używany prefiks. Niewielkie decyzje architektoniczne mogą więc decydować o tym, czy reklamowana stawka ma zastosowanie.
Drugim ograniczeniem jest czas życia cache. Anthropic obsługuje różne okresy przechowywania przy różnych cenach zapisu. System z długimi przerwami między żądaniami może wymagać wielokrotnych zapisów do cache, co zmniejsza jego oszczędności netto.
Trzecim ograniczeniem jest koszt danych wyjściowych. Odczyty z cache są obecnie niedrogie, ale wygenerowane tokeny pozostają znacznie droższe. Długie ślady rozumowania, rozwlekłe odpowiedzi i powtarzane korekty mogą zdominować końcowy rachunek.
Czwartym ograniczeniem jest narzut orkiestracji. Agenci często wywołują systemy wyszukiwania, przeglądarki, bazy danych, środowiska wykonywania kodu lub API firm trzecich. Obniżka cen modeli Anthropic nie zmniejsza tych opłat.
Piątym ograniczeniem jest weryfikacja przez człowieka. Model, który generuje tanią, lecz niewiarygodną pracę, może zwiększać koszty pracy. To ryzyko jest szczególnie ważne w przypadku zmian w oprogramowaniu, regulowanych procesów i działań wpływających na dane klientów.
Nawet pierwotne ogłoszenie Anthropic dotyczące Sonnet 5.5 zastrzega, że benchmarki ujmują tylko jeden aspekt możliwości modelu. Firma twierdzi, że Opus 5.5 pozostaje silniejszy w złożonych, otwartych zadaniach wymagających trwałej oceny sytuacji.
Tworzy to kompromis w routingu. Programiści mogą przydzielać rutynową, dobrze określoną pracę Sonnet 5.5, rezerwując trudniejsze decyzje dla większego modelu. Jednak nieprawidłowy routing może powodować wielokrotne niepowodzenia Sonnet, zanim system dokona eskalacji.
Źle zaprojektowany router może zmarnować więcej pieniędzy, niż pozwala zaoszczędzić rabat na cache. Zespoły powinny mierzyć całą ścieżkę, w tym nieudane próby i wywołania eskalacyjne.
Porównanie z GPT-6.1 Sol wiąże się z kolejną komplikacją. Zbieżne ceny nagłówkowe nie oznaczają, że dostawcy implementują cache w identyczny sposób.
Przewodnik OpenAI dotyczący cache wskazuje, że nowsze modele obsługują jawne lub niejawne punkty przerwania, zależnie od modelu. Opisuje też minimalne długości promptów oraz zasady raportowania wpływające na to, które tokeny się kwalifikują.
Anthropic stosuje własne mechanizmy kontroli cache, okresy przechowywania, punkty przerwania i raportowanie użycia. Migracja agenta między dostawcami może wymagać restrukturyzacji promptów, zanim jego współczynnik trafień cache stanie się porównywalny.
Dystrybucja chmurowa może dodatkowo komplikować obraz sytuacji. Sonnet 5.5 jest dostępny przez Anthropic i platformy partnerskie, ale ceny, dostępność regionalna oraz terminy udostępniania funkcji mogą różnić się między dostawcami.
Ogłoszoną stawkę $0.10 należy zatem zweryfikować na konkretnym punkcie końcowym używanym w środowisku produkcyjnym. Firma korzystająca z rynku usług chmurowych nie powinna zakładać, że każda usługa regionalna wdrożyła zmianę jednocześnie.
Za deklaracją 20% kryje się także kwestia pomiaru. Anthropic nie opublikował szczegółowego rozkładu pokazującego zużycie cache w obciążeniach klientów. „Większość pracy agentowej” łączy programowanie, badania, korzystanie z przeglądarki, obsługę klienta i inne wzorce o odmiennych profilach tokenowych.
Najbezpieczniejsza interpretacja jest prosta. Anthropic obniżył o połowę jedną zweryfikowaną cenę jednostkową. Szerszy odsetek odzwierciedla modelowany lub zaobserwowany przez firmę miks obciążeń, a nie gwarantowany wynik klienta.
Zespoły mogą zweryfikować tę deklarację, porównując kilka tygodni użycia. Przydatne miary obejmują tokeny trafień cache na żądanie, częstotliwość zapisów do cache, niebuforowane dane wejściowe, dane wyjściowe, udane zadania oraz całkowite wydatki na zaakceptowane zadanie.
Spadek wydatków na cache bez podobnego spadku kosztu zadania sygnalizowałby inne wąskie gardło. Mogłaby nim być długość danych wyjściowych, nieudane próby, zewnętrzne narzędzia lub czas potrzebny na korektę przez człowieka.
Co programiści i nabywcy AI powinni obserwować dalej
Kolejny etap pokaże, czy niższe stawki cache poprawiają ekonomię produkcyjną, czy po prostu stają się nową normą dla konkurujących platform agentowych.
Pierwszym sygnałem będą zaktualizowane dane rozliczeniowe Anthropic. Programiści powinni potwierdzić, że ich żądania Sonnet 5.5 otrzymują nową stawkę za odczyt cache oraz że platformy partnerskie udostępniają tę samą zmianę.
Wzmacnia to argumentację Anthropic, jeśli klienci widzą niższe wydatki na ukończone zadanie bez zmiany aplikacji. Osłabia szerszą deklarację 20%, jeśli większość obciążeń wykazuje jedynie niewielką redukcję.
Drugim sygnałem są konkurencyjne ceny. Dopasowana stawka GPT-6.1 Sol najwyraźniej już ograniczyła Anthropic możliwość pobierania dwukrotnie wyższej opłaty za kontekst z cache.
Google i inni dostawcy modeli stoją teraz przed taką samą presją. Kupujący coraz częściej oczekują, że dane wejściowe z cache będą kosztować niewielką część zwykłych danych wejściowych, zwłaszcza w przypadku agentów projektowanych wokół trwałego kontekstu.
Kolejna reakcja cenowa pokazałaby, że tanie ponowne wykorzystanie kontekstu stało się standardową cechą konkurencyjną. Brak reakcji sugerowałby, że dostawcy nadal różnicują się jakością modeli, infrastrukturą lub odmiennymi systemami cache.
Trzecim sygnałem są niezależne testy na poziomie zadań. Ceny tokenów pokazują, jak dostawcy wyliczają rachunek, lecz nie wskazują, ile pracy model potrzebuje, aby ukończyć zadanie.
Przydatne oceny powinny raportować koszt na zaakceptowany wynik, a nie wyłącznie dokładność benchmarków lub cenę za milion tokenów. Powinny też ujawniać ustawienia wysiłku, dostęp do narzędzi, zasady ponawiania prób, współczynniki trafień cache i kryteria weryfikacji przez człowieka.
Dla programistów natychmiastowym działaniem jest analiza rzeczywistego użycia zamiast mnożenia cen tokenów przez teoretyczny rozmiar promptu. Segmentuj odczyty cache, zapisy cache, niebuforowane dane wejściowe i dane wyjściowe dla reprezentatywnych zadań.
Następnie połącz te wartości z wynikami. Śledź, czy agent ukończył zadanie, czy człowiek je zaakceptował oraz czy system wymagał eskalacji lub naprawy.
Optymalizację cache należy rozpocząć od największych stabilnych prefiksów. Utrzymuj instrukcje systemowe i definicje narzędzi w spójnej formie, umieszczaj dynamiczną treść później i unikaj wstrzykiwania zmieniających się metadanych przed materiałem wielokrotnego użytku.
Zespoły powinny również testować zachowanie po wygaśnięciu cache. Pięciominutowy cache może dobrze sprawdzać się w intensywnych pętlach agentowych, ale słabo w procesach z długimi przerwami na zatwierdzenia. Droższa opcja jednogodzinna może obniżyć całkowite koszty, gdy zapobiega wielokrotnym zapisom.
Ostateczna decyzja zakupowa powinna porównywać co najmniej dwa modele na tym samym wewnętrznym zestawie zadań. Zrównanie cen cache Claude Sonnet 5.5 i GPT-6.1 Sol ułatwia interpretację takiego eksperymentu, ale nie przesądza zwycięzcy.
Obniżka Anthropic ma znaczenie, ponieważ obciążenia agentowe wykorzystują kontekst ponownie znacznie częściej niż zwykłe sesje czatu. Potwierdza też, że dostawcy modeli traktują obecnie kontekst z cache jako pole konkurencji.
Otwarte pozostaje pytanie, czy niższe ceny cache prowadzą do tańszej skutecznej pracy. Mierz przez następny miesiąc współczynnik trafień cache, ponowne próby, wolumen danych wyjściowych i zaakceptowane wyniki. Jeśli całkowity koszt ukończonego zadania spadnie do poziomu zbliżonego do szacunku Anthropic, obniżka zmieniła twoją ekonomię. Jeśli nie, kosztowna część twojego agenta znajduje się gdzie indziej.



