Wykorzystanie tokenów przez agentów OpenRouter jest 5 razy większe niż ruch generowany przez ludzi, ale przewaga wynika głównie z pamięci podręcznej kontekstu
Wykorzystanie tokenów przez agentów OpenRouter osiągnęło w sierpniu 7,3 biliona tokenów, czyli ponad pięć razy więcej niż 1,4 biliona przypisane użytkownikom będącym ludźmi. Jednak według doniesień ponad 85% tych tokenów agentów pochodziło z buforowanych promptów, a nie z nowo przetworzonych instrukcji lub wygenerowanych odpowiedzi.
To rozróżnienie komplikuje twierdzenie, że AI korzysta dziś z AI częściej niż ludzie. Agenci wyraźnie tworzą znacznie większy ruch modeli na jedno zadanie. Wykres mierzy jednak tokeny kierowane przez jedną platformę, a nie globalną adopcję AI, wydatki, produktywną pracę ani wartość ekonomiczną.
Daniel Newman, CEO Futurum Group, nagłośnił te liczby w poście na X z 30 września. Przewidział, że wskaźnik wzrośnie z pięciokrotności do dziesięciokrotności, a potem będzie rósł dalej. Wartość pięciokrotna wynika z zaobserwowanego ruchu OpenRouter. Wartość dziesięciokrotna pozostaje prognozą bez wskazanego harmonogramu ani modelu ją uzasadniającego.
Prawdziwa rywalizacja nie toczy się więc między agentami a ludźmi. Chodzi o surowy wolumen tokenów kontra użyteczna praca. To rozróżnienie ma znaczenie dla deweloperów zarządzających pętlami agentów, przedsiębiorstw oceniających zwrot oraz dostawców infrastruktury planujących pojemność pamięci.
Wykorzystanie tokenów przez agentów OpenRouter przekroczyło wyraźny próg
Dane z sierpnia pokazują dużą zmianę w ruchu modeli, ale wyłącznie w środowisku mierzalnym przez OpenRouter.
OpenRouter działa jako brama kierująca żądania do różnych modeli i dostawców inferencji. Ta pozycja daje firmie wgląd w zróżnicowany ruch aplikacyjny, w tym bezpośrednie rozmowy, narzędzia programistyczne i autonomiczne przepływy pracy.
Opublikowany wykres przedstawia siedmiodniową średnią wykorzystania tokenów do 10 sierpnia 2026 roku. Ruch agentowy osiągnął około 7,3 biliona tokenów, wobec 1,4 biliona dla ruchu generowanego przez ludzi.
Wynikający z tego stosunek wynosi około 5,2 do jednego. Uzasadnia to węższe stwierdzenie, że agenci wygenerowali pięć razy większy ruch tokenów niż ludzie w OpenRouter w tym okresie pomiarowym.
Nie ustanawia to jednak takiego samego stosunku w ChatGPT, Claude, Gemini, prywatnych wdrożeniach chmurowych ani modelach hostowanych lokalnie. Systemy te reprezentują znaczny ruch, którego OpenRouter nie może obserwować.
OpenRouter podał również, że wykorzystanie agentowe wzrosło około czternastokrotnie od 6 lutego. Wykorzystanie tokenów przez ludzi zwiększyło się w tym samym okresie około 2,8 raza. Ruch mieszany, łączący zachowania ludzkie i podobne do agentowych, miał wzrosnąć około 4,7 raza.
6 lutego był ostatnią zaobserwowaną datą, w której ruch generowany przez ludzi pozostawał w zbiorze danych wyższy niż ruch agentowy. To sprawia, że sierpniowy wynik jest bardziej znaczący niż pojedynczy dzienny skok. Agenci utrzymywali i powiększali przewagę przez około sześć miesięcy.
OpenRouter klasyfikował każdy klucz API jako agentowy, ludzki lub mieszany. System miał wykorzystywać siedem ważonych sygnałów, w tym wskaźniki wywołań narzędzi, liczbę tur oraz odstępy czasowe między odpowiedziami.
Takie podejście jest bardziej informacyjne niż opieranie się wyłącznie na nazwach aplikacji. Ogólny klient API może uruchamiać autonomiczną pętlę, podczas gdy aplikacja reklamowana jako agent może pozostawać pod bezpośrednią kontrolą człowieka.
Klasyfikacja behawioralna wprowadza jednak niepewność. Klucze API mogą obsługiwać wiele produktów, zespołów lub przypadków użycia. Obciążenie może także przechodzić między zachowaniem kierowanym przez człowieka a zautomatyzowanym bez zmiany poświadczeń.
Kategoria mieszana uznaje tę niejednoznaczność, ale jej nie eliminuje. Przypisanie części tego ruchu inaczej zmieniłoby stosunek między agentami a ludźmi.
Istnieje też inna ważna kwestia semantyczna. Agenci nie są niezależnymi klientami w zwykłym sensie ekonomicznym. Ludzie i organizacje ich wdrażają, określają cele, finansują ich żądania i decydują, czy ich wyniki mają wartość.
Agenci są lepiej rozumiani jako zautomatyzowani pośrednicy. Jedno żądanie człowieka może zainicjować planowanie, pobieranie informacji, wykonywanie narzędzi, walidację, korektę i powtarzane wywołania modelu.
Ten efekt mnożnikowy jest kluczowym wydarzeniem. Popyt na AI nie jest już określany wyłącznie przez liczbę osób otwierających okno czatu. Coraz bardziej zależy od tego, ile aktywności maszynowej wyzwala każde żądanie człowieka.
Wcześniejsze badanie 100 bilionów tokenów OpenRouter wskazało tę samą zmianę strukturalną. Opisało inferencję agentową jako rozbudowaną sekwencję obejmującą planowanie, narzędzia, poprawki i powtarzaną interakcję z modelem.
Badanie wykazało, że programowanie stało się głównym źródłem wzrostu promptów. Pod koniec 2025 roku prompty programistyczne były także średnio kilkukrotnie dłuższe niż prompty ogólnego przeznaczenia.
Te wzorce pomagają wyjaśnić, dlaczego agenci przekroczyli próg. Osoba może wysłać jedno żądanie programistyczne. Agent może wielokrotnie sprawdzać pliki, wywoływać narzędzia, analizować wyniki testów i ponownie przesyłać swój kontekst roboczy.
Sierpniowy wykres ujmuje to wzmocnienie w skali platformy. Nie dowodzi, że autonomiczne oprogramowanie zastąpiło popyt generowany przez ludzi. Pokazuje, że popyt ludzki coraz częściej trafia do systemów tworzących wiele dalszych żądań.
Jedna instrukcja człowieka może uruchomić tysiące operacji modelu
Agenci zużywają więcej tokenów, ponieważ przekształcają pojedyncze żądanie w ciągły proces obliczeniowy.
Tradycyjna interakcja z chatbotem zwykle przebiega w widocznym rytmie. Osoba pisze prompt, otrzymuje odpowiedź i decyduje, czy kontynuować. Każda nowa tura zależy od kolejnego działania człowieka.
Agent może kontynuować bez tej przerwy. Interpretuje cel, tworzy kroki, wybiera narzędzia, ocenia wyniki i decyduje, czy potrzebna jest kolejna próba.
Rozważmy migrację oprogramowania. Deweloper może poprosić agenta o przeniesienie aplikacji z jednej usługi chmurowej do innej.
Pierwsze wywołanie modelu może przeanalizować żądanie i stworzyć plan. Kolejne wywołania mogą sprawdzać pliki konfiguracyjne, przeszukiwać dokumentację, edytować kod, uruchamiać testy, diagnozować błędy i poprawiać implementację.
Każde wywołanie często obejmuje więcej niż najnowszą instrukcję. Może przenosić reguły systemowe, definicje narzędzi, szczegóły repozytorium, wcześniejsze wiadomości, dane wyjściowe poleceń i wcześniejsze decyzje agenta.
Ten zgromadzony materiał to okno kontekstowe, czyli tekst i ustrukturyzowane dane dostępne dla modelu podczas jednego żądania. W miarę trwania zadania kontekst ten może stać się znacznie większy niż pierwotny prompt człowieka.
Użycie narzędzi dodatkowo zwiększa ruch. Model może wygenerować zapytanie do bazy danych, sprawdzić wynik, a następnie ponownie wywołać model, by zdecydować, co dalej.
Równoległe agenty mogą ponownie zwielokrotnić ten proces. Jeden koordynator może delegować badania, programowanie, testowanie i przegląd oddzielnym pracownikom. Każdy pracownik utrzymuje własne instrukcje i historię zadania.
Wyjaśnia to, dlaczego wolumen tokenów może rosnąć znacznie szybciej niż liczba użytkowników. Podstawowa jednostka przesunęła się z tury rozmowy do kroku przepływu pracy.
Dane OpenRouter odzwierciedlają również wzrost obciążeń związanych z rozumowaniem i programowaniem. Zadania te naturalnie sprzyjają dłuższym interakcjom, ponieważ obejmują stan pośredni, zewnętrzne narzędzia i powtarzaną walidację.
Dowody akademickie sugerują, że to wzmocnienie może stać się skrajne. Jedno badanie z 2026 roku dotyczące programowania agentowego wykazało, że zadania agentów zużywały w warunkach eksperymentalnych około 1000 razy więcej tokenów niż czat dotyczący kodu.
Badanie kosztów agentów wykazało również dużą zmienność między powtarzanymi uruchomieniami. W testach badaczy wykorzystanie tokenów dla tego samego zadania różniło się nawet trzydziestokrotnie.
Co kluczowe, większa liczba tokenów nie zapewniała konsekwentnie lepszych wyników. Wydajność często osiągała szczyt na poziomie pośrednim, zanim dodatkowe zużycie przestawało przynosić odpowiadające mu korzyści.
To ustalenie wzmacnia główne napięcie stojące za wykorzystaniem tokenów przez agentów OpenRouter. Rosnąca liczba może oznaczać produktywną automatyzację, niepotrzebne powtórzenia albo mieszankę obu zjawisk.
Twórcy agentów odczuwają więc presję, aby mierzyć ukończoną pracę, a nie tylko generowaną aktywność. Przydatne wskaźniki obejmują zaakceptowane zmiany kodu, rozwiązane sprawy wsparcia, udane transakcje oraz zadania ukończone bez poprawek człowieka.
Token jest jedynie jednostką przetwarzania tekstu. Nie niesie wbudowanej miary dokładności, trudności, nowości ani wartości biznesowej.
Dwa przepływy pracy mogą zużyć tę samą liczbę tokenów, dając bardzo różne wyniki. Jeden może rozwiązać trudny problem inżynieryjny. Drugi może powtarzać nieudany plan, aż limit go zatrzyma.
Projekt otaczającego systemu determinuje, który wynik jest bardziej prawdopodobny. Jasne testy ukończenia pomagają agentowi rozpoznać sukces. Ograniczone zasady ponawiania prób zapobiegają niekończącemu się wykonywaniu nieudanego zadania.
Dobre narzędzia ograniczają także potrzebę długiego rozumowania tekstowego. Ustrukturyzowane API może zwrócić precyzyjny wynik, który w przeciwnym razie wymagałby wielokrotnego przeglądania i interpretacji.
Architektura pamięci ma znaczenie z tego samego powodu. Agent nie potrzebuje każdego starego szczegółu na każdym etapie. Potrzebuje podzbioru, który pozostaje istotny dla bieżącej decyzji.
W tym miejscu przeszukiwalna osobista baza wiedzy może wspierać przepływy pracy prowadzone przez ludzi. Pobrane dowody mogą zastąpić bezrefleksyjne gromadzenie historii, gdy system starannie wybiera kontekst.
Presja wykracza poza deweloperów. Nabywcy korporacyjni muszą teraz oceniać, jak produkty kontrolują pętle, pobierają kontekst i raportują zużycie.
Produkt może wyglądać na wydajny podczas krótkiej demonstracji, lecz zachowywać się inaczej w długotrwałych obciążeniach. Zadania produkcyjne napotykają brakujące uprawnienia, niejednoznaczne cele, zmieniające się dane i nieoczekiwane odpowiedzi narzędzi.
Warunki te generują ponowienia prób. Ujawniają też, czy agent ma niezawodne reguły zatrzymywania, czy jedynie nadal tworzy wiarygodnie brzmiące kolejne kroki.
Adopcja przez ludzi nadal ma znaczenie, ale sama w sobie nie przewiduje już popytu na inferencję. Bardziej użyteczna formuła obejmuje użytkowników, delegowane zadania, wywołania modelu na zadanie i tokeny na wywołanie.
Ta formuła sprawia, że stosunek dziesięciokrotny jest zasadniczo możliwy. Nie czyni jednak prognozy Newmana nieuniknioną. Stosunek będzie zależał również od optymalizacji, zachowania modeli, projektu aplikacji i ruchu poza OpenRouter.
Buforowane prompty wyjaśniają większość eksplozji tokenów
Największa część przewagi agentów wydaje się wynikać z powtarzanego kontekstu, a nie całkowicie nowego rozumowania lub wyników.
Według doniesień ponad 85% tokenów agentów w prezentacji a16z pochodziło z buforowanych promptów. Buforowane prompty to wcześniej przetworzone segmenty wejściowe, które dostawca może ponownie wykorzystać, gdy późniejsze żądanie zaczyna się od pasującej treści.
Agent często ponownie wysyła stabilny materiał. Może on obejmować instrukcje systemowe, opisy narzędzi, pliki projektu, polityki i wcześniejszą historię rozmowy.
Przetwarzanie tego samego prefiksu od początku przy każdym wywołaniu byłoby marnowaniem zasobów obliczeniowych. Buforowanie promptów pozwala dostawcy ponownie wykorzystać wyniki pośrednie powiązane z tym prefiksem.
Telemetria pamięci podręcznej OpenRouter oddziela buforowane tokeny od nowo przetworzonych tokenów promptów. Może także identyfikować tokeny zapisane w pamięci podręcznej do przyszłego ponownego użycia.
Oznacza to, że 7,3 biliona tokenów nie należy interpretować jako 7,3 biliona jednostek świeżej pracy modelu. Duża część reprezentuje informacje, z którymi system zetknął się już wcześniej.
To rozróżnienie wpływa na koszt. Dostawcy zazwyczaj pobierają mniej za odczyt z pamięci podręcznej niż za przetwarzanie nowego wejścia, ponieważ znaczna część wcześniejszych obliczeń już się odbyła.
Jednak pamięć podręczna nie oznacza braku kosztów. System musi zidentyfikować wpis w pamięci podręcznej, pobrać jego dane i udostępnić powiązany stan modelu podczas inferencji.
Istotny stan modelu jest często nazywany pamięcią podręczną klucz-wartość, czyli KV cache. Przechowuje ona informacje o mechanizmie uwagi pochodzące z wcześniejszych tokenów, dzięki czemu model może kontynuować pracę bez ponownego obliczania każdej poprzedzającej pozycji.
Dłuższe prompty tworzą większe pamięci podręczne KV. Większa liczba równoczesnych sesji agentów tworzy ich więcej. Długotrwałe procesy robocze mogą również wymagać wielokrotnego dostępu do znacznej ilości przechowywanego kontekstu.
To przesuwa wąskie gardło infrastruktury. Moc obliczeniowa pozostaje ważna, lecz coraz większego znaczenia nabierają pojemność pamięci, przepustowość pamięci i przemieszczanie danych.
Dlatego udział danych z pamięci podręcznej nie czyni danych OpenRouter bez znaczenia. Zmienia natomiast ich znaczenie.
Wykres stanowi słabszy dowód na zapotrzebowanie na nowe rozumowanie. Jest mocniejszym dowodem na to, że systemy agentowe wielokrotnie przenoszą obszerne historie między wieloma wywołaniami modeli.
Różnicę tę można porównać do wielokrotnego sięgania po ten sam obszerny segregator projektu. Ponowne czytanie znanych stron wymaga mniej przygotowań niż analizowanie nowych, ale segregator musi pozostać dostępny.
Buforowanie może również sprawiać, że nieefektywny projekt agenta staje się finansowo akceptowalny. Proces roboczy może ponownie wysyłać ogromny prompt systemowy, ponieważ obniżony koszt odczytu z pamięci podręcznej ukrywa część wydatków.
Taki projekt nadal zużywa zasoby. Może zwiększać opóźnienia, komplikować routing i tworzyć zależność od stabilnych prefiksów promptów.
Trafienia w pamięć podręczną nie są gwarantowane w każdej konfiguracji. Zmiana wczesnej części promptu może unieważnić późniejszy materiał z pamięci podręcznej. Przekierowywanie żądań między dostawcami może również wpływać na możliwość ponownego wykorzystania danych.
Dane dynamiczne stanowią kolejne wyzwanie. Jeśli sygnatury czasowe, pobrane dokumenty, wyniki narzędzi lub szczegóły specyficzne dla użytkownika pojawiają się na początku, mogą zmniejszać stabilność prefiksu.
Twórcy agentów potrzebują więc świadomej struktury kontekstu. Stabilne instrukcje powinny znajdować się na początku, a zmieniające się informacje — po sekcjach, które można wykorzystać ponownie, gdy pozwala na to zachowanie dostawcy.
Istotne może być także przypisanie do sesji. Żądania pozostające powiązane z kompatybilnym dostawcą mają większą szansę ponownie wykorzystać wcześniejszy kontekst niż żądania kierowane w nieprzewidywalny sposób.
Wartość 85% również wymaga ostrożnego przypisania. Według raportu źródłowego pojawiła się ona w ujęciu a16z dotyczącym danych OpenRouter. Oryginalną analizę OpenRouter opisywano także jako wskazującą niższy udział przy zastosowaniu innej metody obliczeń.
Różne mianowniki mogą prowadzić do różnych procentów. Jedna metoda może agregować cały wolumen tokenów, a inna uśredniać udział danych z pamięci podręcznej między żądaniami.
Kilka ogromnych procesów roboczych może dominować w całkowitym wolumenie, nie reprezentując typowego żądania. Z kolei średni odsetek na żądanie może zaniżać wpływ największych obciążeń.
Oba pomiary mogą być trafne, odpowiadając jednak na różne pytania. Publiczny wykres nie zawiera wystarczających szczegółów metodologicznych, by niezależnie uzgodnić każdy raportowany odsetek użycia pamięci podręcznej.
Najbezpieczniejszy wniosek ma zatem charakter kierunkowy. Buforowany kontekst stanowi wyraźną większość ruchu tokenowego agentów, choć dokładny udział zależy od sposobu agregowania żądań przez platformę.
Kwestionuje to również sformułowanie „AI używa AI”. Agenci niekoniecznie wykonują biliony niezależnych aktów rozumowania. Duża część ich ruchu polega na odtwarzaniu kontekstu potrzebnego do kontynuowania delegowanej pracy.
Takie zachowanie nadal może tworzyć realną wartość. Agent programistyczny potrzebuje stanu repozytorium i wcześniejszych decyzji, aby po każdym wywołaniu narzędzia nie zaczynać od zera.
Pytanie o efektywność dotyczy doboru. Czy agent ponownie ładuje najmniejszy użyteczny kontekst, czy też wielokrotnie wysyła wszystko, ponieważ takie podejście jest łatwiejsze do wdrożenia?
Wraz ze wzrostem wolumenu tokenów różnica ta staje się istotnym wyborem inżynieryjnym. Efektywne zarządzanie kontekstem może ograniczyć zapotrzebowanie na pamięć bez osłabiania jakości realizacji zadań.
Pięć razy więcej tokenów nie oznacza pięć razy wyższego ROI
Wolumen tokenów mierzy wykorzystanie, podczas gdy zwrot z inwestycji zależy od skutecznych rezultatów i całkowitego kosztu operacyjnego.
Newman argumentował, że firmy zbyt mocno koncentrują się na adopcji przez ludzi przy ocenie zwrotów z AI. Jego szersza teza ma sens, ponieważ jeden użytkownik może obecnie inicjować znacznie więcej inferencji, niż wynika z metryki adopcji opartej na czacie.
Miesięczna liczba aktywnych użytkowników może zaniżać zapotrzebowanie infrastrukturalne. Liczba stanowisk może również nie uwzględniać zautomatyzowanej pracy działającej nieprzerwanie po odejściu pracowników od biurek.
Jednak zastąpienie liczby użytkowników liczbą tokenów tworzy kolejną niepełną miarę. Tokeny pokazują aktywność, ale nie wskazują, czy aktywność ta wygenerowała przychód, ograniczyła nakład pracy, poprawiła jakość lub zwiększyła ryzyko.
Współczynnik pięciu razy porównuje też dwie kategorie ruchu, a nie dwa podmioty gospodarcze. Żądania agentów pozostają konsekwencją ludzkich lub organizacyjnych decyzji.
Przedsiębiorstwo nie osiąga zwrotu dlatego, że agent zużył więcej tokenów. Osiąga go wtedy, gdy agent wykonuje wartościową pracę przy akceptowalnym poziomie kosztów i ryzyka.
Użyteczna ocena zaczyna się od powodzenia zadania. Zespoły powinny pytać, czy proces roboczy wykonał zamierzone działanie i czy człowiek zaakceptował wynik.
Kolejne pytanie dotyczy interwencji. Agent, który kończy pracę bez nadzoru, ma inny profil operacyjny niż taki, który wymaga wielokrotnych poprawek.
Liczy się również opóźnienie. Proces roboczy, który ostatecznie odnosi sukces, może mimo to ponieść komercyjną porażkę, jeśli klienci muszą czekać zbyt długo lub kolejki infrastrukturalne rosną przy szczytowym obciążeniu.
Następnie pojawia się całkowity koszt. Opłaty za tokeny to tylko jeden składnik. Wywołania narzędzi, usługi wyszukiwania, bazy danych, piaskownice, obserwowalność, przeglądy bezpieczeństwa i naprawy wykonywane przez ludzi mogą generować znaczne wydatki.
Znaczenie mają również rezultaty skorygowane o ryzyko. Agent modyfikujący systemy produkcyjne potrzebuje silniejszych zabezpieczeń niż agent streszczający publiczne dokumenty.
Wykres OpenRouter nie może odpowiedzieć na żadne z tych pytań. Został zaprojektowany do opisu ruchu, a nie zwrotów przedsiębiorstw.
To samo ograniczenie dotyczy prognozy Newmana zakładającej wzrost dziesięciokrotny. Ekstrapolacja tego współczynnika zakłada, że ruch agentów będzie nadal rósł szybciej niż ruch generowany przez ludzi, bez porównywalnej korekty efektywności.
Założenie to może zawieść z kilku powodów. Aplikacje mogą kompresować kontekst, wykorzystywać mniejsze modele do rutynowych etapów, zastępować powtarzane rozumowanie deterministycznym oprogramowaniem i wcześniej zatrzymywać pętle.
Ulepszenia modeli mogą ograniczać liczbę ponowień. Lepsze interfejsy narzędzi mogą również zwracać bardziej uporządkowane informacje, zmniejszając liczbę wywołań potrzebnych do ukończenia zadania.
Presja ekonomiczna będzie sprzyjać tym zmianom. Firmy mają motywację, by usuwać wywołania, które nie poprawiają rezultatów, nawet jeśli odczyty z pamięci podręcznej są relatywnie niedrogie.
Dyskusja a16z o zbieżności pętli podkreśla ten sam problem. Agent może nadal wykonywać dodatkową pracę, gdy większość dostępnej wartości już się pojawiła.
Pętla bez zewnętrznego testu ukończenia może mylić dalszą aktywność z postępem. Może wielokrotnie edytować dokument, ponownie uruchamiać nieudane polecenie albo dopracowywać już akceptowalną odpowiedź.
To zachowanie jest szczególnie trudne do wykrycia, gdy każde pojedyncze wywołanie wydaje się uzasadnione. Marnotrawstwo ujawnia się w całej trajektorii, a nie w obrębie jednej odpowiedzi.
Obserwowalność musi więc działać na poziomie zadania. Twórcy potrzebują śladów łączących każde wywołanie modelu z użyciem narzędzi, zmianami stanu, błędami i ostatecznymi rezultatami.
Budżety powinny również odzwierciedlać wartość zadania. Dochodzenie o wysokiej stawce może uzasadniać więcej iteracji niż rutynowe żądanie formatowania.
Reguły eskalacji tworzą kolejną granicę. Gdy agent napotyka powtarzające się niepowodzenia lub niepewne uprawnienia, przekazanie kontroli człowiekowi może być tańsze i bezpieczniejsze.
W ruchu OpenRouter występuje również efekt selekcji. Platforma obsługuje deweloperów, którzy świadomie korzystają z bramki modeli, co może prowadzić do bardziej technicznego profilu obciążeń niż w aplikacjach konsumenckich.
Programowanie i frameworki agentowe mogą zatem zajmować większy udział w OpenRouter niż w całym rynku AI.
Skala OpenRouter nadal sprawia, że trend jest istotny. Jego dane obejmują znaczny ruch rzeczywisty w wielu modelach i u wielu dostawców. Wyniki powinny po prostu pozostawać powiązane z tym zakresem.
Relacje platformy wprowadzają kolejną kwestię. Andreessen Horowitz zainwestował w OpenRouter, co daje a16z interes w rozwoju infrastruktury routingu tokenów.
Nie unieważnia to tych danych. Sprawia jednak, że przejrzysta metodologia i niezależna replikacja są ważniejsze, zwłaszcza gdy dane wspierają szerokie twierdzenia dotyczące gospodarki AI.
Najmocniejsza interpretacja unika obu skrajności. Wykres nie jest ani dowodem, że autonomiczne maszyny stały się głównymi klientami AI, ani pustym artefaktem buforowania.
Jest dowodem, że architektury agentowe wzmacniają zapotrzebowanie na inferencję. Pokazuje również, że to wzmocnienie obecnie w dużej mierze opiera się na przenoszeniu i pobieraniu starego kontekstu.
Dla nabywców kluczowe pytanie nie brzmi, czy agent zużywa wiele tokenów. Brzmi ono: czy każda dodatkowa runda zwiększa prawdopodobieństwo skutecznego, wartościowego rezultatu?
Dostawcy pamięci i platformy agentowe stają przed natychmiastową presją
Zmiana w ruchu nagradza systemy, które efektywnie zarządzają kontekstem, i wywiera presję na produkty traktujące zużycie tokenów jako wskaźnik postępu.
Dostawcy modeli mierzą się z bardziej złożonym obciążeniem niż zwykły czat oparty na schemacie żądanie-odpowiedź. Sesje agentów mogą pozostawać aktywne dłużej, wielokrotnie wywoływać narzędzia i utrzymywać rosnące historie.
Takie obciążenie wywiera presję na harmonogramy i systemy routingu. Dostawcy muszą równoważyć lokalność pamięci podręcznej, dostępność modeli, opóźnienia i niezawodność przy zmiennym popycie.
Platformy bramkowe, takie jak OpenRouter, zyskują strategiczne znaczenie, ponieważ aplikacje coraz częściej wykorzystują kilka modeli. Proces roboczy może kierować planowanie, programowanie, walidację i streszczanie do różnych punktów końcowych.
Dynamiczny routing może obniżać koszty lub poprawiać wydajność, ale może też zakłócać działanie pamięci podręcznej. Żądanie wysłane do innego dostawcy może utracić dostęp do wcześniej utworzonej pamięci podręcznej.
Dostawcy udostępniający jasne metryki pamięci podręcznej będą mieć przewagę wśród zaawansowanych nabywców. Zespoły muszą wiedzieć, ile tokenów było nowych, buforowanych, wygenerowanych lub zapisanych w pamięci.
Producenci pamięci również odczuwają popyt wynikający z większych kontekstów i większej liczby równoczesnych sesji. Pamięć o wysokiej przepustowości zasila akceleratory modeli, podczas gdy pamięć konwencjonalna i magazyny danych wspierają systemy towarzyszące.
Wykres nie określa jednak ilościowo przyszłych zakupów pamięci. Pokazuje ruch tokenowy, a nie dokładne przyporządkowanie każdego tokenu do nowej pojemności sprzętowej.
Popyt na sprzęt zależy od architektury modelu, typów danych, grupowania, usuwania wpisów z pamięci podręcznej, kompresji i liczby jednoczesnych sesji. Ulepszenia oprogramowania mogą zmienić każdą z tych zależności.
Platformy agentowe odczuwają presję z innej strony. Klienci będą coraz częściej porównywać użyteczną pracę na token, a nie tylko dostęp do wydajnych modeli.
Produkty ukrywające zużycie za szerokimi deklaracjami wykorzystania mogą mieć trudności, gdy zespoły finansowe przedsiębiorstw zażądają ekonomiki na poziomie zadań. Nabywcy będą oczekiwać powtarzalnych dowodów w ramach własnych obciążeń.
Agenci programistyczni stanowią wczesny test, ponieważ ich wyniki można oceniać za pomocą kompilacji, testów, przeglądów i rezultatów wdrożeń. Sygnały te tworzą mierzalne warunki zatrzymania.
Inne dziedziny pozostają trudniejsze. Badania, strategia i pisanie często nie mają jednego obiektywnego testu. Agenci mogą nadal dopracowywać wyniki bez wyraźnego momentu ukończenia.
Ta niepewność zwiększa znaczenie kontroli człowieka, nawet gdy agenci wykonują większość pracy pośredniej. Utrudnia również porównywanie efektywności tokenowej między dostawcami.
Dostawcy infrastruktury mogą odpowiedzieć kompresją kontekstu, buforowaniem prefiksów, sesjami stanowym i systemami wyszukiwania. Każde z tych podejść ma na celu uniknięcie ponownego wysyłania niepotrzebnej historii.
Twórcy aplikacji mogą oddzielić pamięć trwałą od kontekstu roboczego. Pamięć trwała przechowuje potencjalnie użyteczne informacje, podczas gdy kontekst roboczy zawiera wyłącznie to, czego wymaga bieżący etap.
Taki podział ogranicza powtarzanie tekstu i zmniejsza ilość nieistotnych informacji. Może też poprawić dokładność modeli, utrzymując czynniki rozpraszające poza aktywnym promptem.
Oprogramowanie deterministyczne powinno wykonywać pracę deterministyczną. Agent nie musi rozumować nad obliczeniem, walidacją schematu ani kontrolą dostępu, gdy niezawodny kod potrafi wykonać te zadania bezpośrednio.
Najwydajniejsze systemy prawdopodobnie połączą modele z konwencjonalnym oprogramowaniem. Modele radzą sobie z niejednoznacznością i planowaniem, a kod egzekwuje reguły i wykonuje stabilne operacje.
Taka hybrydowa architektura osłabia założenie, że ruch generowany przez agentów musi rosnąć bez ograniczeń. Lepsze systemy mogą realizować więcej zadań, jednocześnie zmniejszając liczbę tokenów przypadających na zadanie.
Jednocześnie spadające koszty jednostkowe mogą zwiększać całkowity popyt. Gdy każdy przepływ pracy staje się tańszy, deweloperzy mogą wdrażać agentów w większej liczbie miejsc i uruchamiać ich częściej.
Wynikający z tego efekt odbicia może podtrzymać wzrost infrastruktury, nawet gdy pojedyncze zadania stają się wydajniejsze. Ta możliwość wspiera kierunek prognozy Newmana, choć nie jej dokładną proporcję.
Ruch generowany przez ludzi także może rosnąć. Lepsze produkty konsumenckie, nowe interfejsy i szersze wdrożenia w przedsiębiorstwach mogą zwiększyć bezpośrednie wykorzystanie równolegle z ruchem agentów.
Przyszła proporcja zależy od tego, która krzywa będzie rosła szybciej. Nie jest wyłącznie funkcją doskonalenia agentów.
Konkurencja między OpenAI, Anthropic, Google, twórcami modeli open-weight oraz wyspecjalizowanymi dostawcami inferencji będzie kształtować tę krzywą. Różnią się oni zasadami buforowania i możliwościami narzędzi.
Wybór modelu może również zmieniać się w trakcie przepływu pracy. Mniejszy model może klasyfikować żądanie, podczas gdy większy obsługuje trudną decyzję.
Taka architektura zmniejsza znaczenie pojedynczej zagregowanej liczby tokenów. Token przetwarzany przez kompaktowy model ma inny profil wykorzystania zasobów niż token przetwarzany przez model frontierowy.
Przedsiębiorstwa będą potrzebować znormalizowanych miar łączących wybór modelu, typ tokenów, opóźnienia, energię i powodzenie zadania. Obecnie nie istnieje powszechnie akceptowany standard, który obejmowałby cały ten obraz.
Dopóki taki standard nie powstanie, wykorzystanie tokenów agentów w OpenRouter pozostaje użytecznym wskaźnikiem wyprzedzającym. Pokazuje kształt popytu, zanim sprawozdawczość finansowa będzie mogła wyjaśnić jego wartość.
Trzy sygnały sprawdzą prognozę 10x
Kolejny etap należy oceniać na podstawie stabilności klasyfikacji, wzrostu liczby świeżych tokenów oraz ilości ukończonej pracy na jednostkę inferencji.
Pierwszym sygnałem będzie to, czy stosunek ruchu agentów do ruchu ludzi w OpenRouter będzie nadal rósł po sierpniu. Utrzymujący się wzrost wspierałby tezę, że autonomiczne przepływy pracy rozwijają się szybciej niż bezpośrednia interakcja.
Porównanie powinno wykorzystywać tę samą metodę klasyfikacji i to samo okno pomiarowe. Zmiany metodologii mogłyby stworzyć pozory wzrostu bez odpowiadającej mu zmiany zachowania.
Na szczególną uwagę zasługuje ruch mieszany. Jeśli będzie rósł szybciej niż obie kategorie, granica między wykorzystaniem przez ludzi a wykorzystaniem przez agentów stanie się mniej wiarygodna.
Drugim sygnałem jest skład tokenów agentów. Rosnący udział tokenów z pamięci podręcznej wskazywałby, że głównym motorem wzrostu pozostaje powtarzanie kontekstu, a nie świeże przetwarzanie przez model.
Spadający udział tokenów z pamięci podręcznej przy rosnącym całkowitym wolumenie opowiadałby inną historię. Sugerowałby, że agenci wykonują więcej nowej inferencji, zamiast głównie odtwarzać ustalony kontekst.
Publiczne raportowanie powinno rozróżniać nowe dane wejściowe, odczyty z cache, zapisy do cache, tokeny rozumowania i dane wyjściowe. Łączenie ich w jedną liczbę ukrywa istotne różnice w kosztach i zapotrzebowaniu infrastrukturalnym.
Trzecim sygnałem jest efektywność zadań. Dostawcy agentów i użytkownicy korporacyjni powinni raportować ukończoną pracę na wywołanie modelu, tokeny na pomyślnie wykonane zadanie oraz liczbę interwencji człowieka na ukończenie.
Jeśli te miary będą się poprawiać, a całkowity ruch agentów będzie rósł, argument za wzrostem stanie się mocniejszy. Wskazywałoby to, że wdrażanie i skuteczna automatyzacja rozwijają się równocześnie.
Jeśli wykorzystanie tokenów wzrośnie, podczas gdy skuteczność pozostanie bez zmian, wykres będzie coraz bardziej opisywał marnotrawstwo operacyjne. Wyższa proporcja osłabiłaby wówczas, zamiast wzmocnić, argument dotyczący ROI.
Niezależne zestawy danych również zwiększyłyby pewność. Ruch z bezpośrednich API modeli, platform chmurowych i prywatnych wdrożeń mógłby pokazać, czy OpenRouter odzwierciedla szerszy rynek.
Na razie dowody wspierają węższy wniosek niż viralowe twierdzenie. Agenci wygenerowali w sierpniu 2026 roku ponad pięciokrotnie większy ruch tokenowy niż ruch ludzi obserwowany w OpenRouter.
Większość tego ruchu wydaje się obejmować kontekst z pamięci podręcznej. Ten kontekst nadal wymaga pamięci, routingu i starannego zarządzania, ale nie należy go mylić z równoważną ilością nowego rozumowania.
Przejście do poziomu 10 razy jest prognozą, a nie potwierdzonym wynikiem. Jego znaczenie będzie zależeć od tego, co osiągną dodatkowe tokeny.
Deweloperzy powinni sprawdzać, czy każda pętla ma jasny cel, budżet i warunek zatrzymania. Nabywcy korporacyjni powinni wymagać dowodów na poziomie zadań, zanim uznają zużycie za wskaźnik wdrożenia.
Użyteczne pytanie nie brzmi już, czy agenci będą generować większy ruch niż ludzie. Dane OpenRouter sugerują, że już tak jest. Pytanie brzmi, czy kolejny bilion tokenów wykona więcej pracy, czy jedynie ponownie odczyta więcej przeszłości.



