Die Token-Nutzung von OpenRouter-Agenten ist fünfmal so hoch wie der menschliche Traffic, doch der Vorsprung besteht größtenteils aus gecachtem Kontext
Die Token-Nutzung von OpenRouter-Agenten erreichte im August 7,3 Billionen Tokens – mehr als das Fünffache der 1,4 Billionen, die der Plattform Menschen zugeschrieben werden. Berichten zufolge stammten jedoch mehr als 85 % dieser Agenten-Tokens aus gecachten Prompts und nicht aus neu verarbeiteten Anweisungen oder generierten Antworten.
Diese Unterscheidung erschwert die Behauptung, dass KI inzwischen mehr KI nutzt als Menschen. Agenten erzeugen pro Aufgabe eindeutig deutlich mehr Modelltraffic. Das Diagramm misst jedoch Tokens, die über eine Plattform weitergeleitet werden – nicht die weltweite KI-Adoption, Ausgaben, produktive Arbeit oder wirtschaftlichen Wert.
Daniel Newman, CEO der Futurum Group, verbreitete die Zahlen in einem X-Post vom 30. September. Er prognostizierte, dass das Verhältnis von fünf auf zehn steigen und anschließend weiter zunehmen werde. Der Faktor fünf basiert auf beobachtetem OpenRouter-Traffic. Der Faktor zehn bleibt eine Prognose ohne genannten Zeithorizont oder unterstützendes Modell.
Der eigentliche Wettbewerb lautet daher nicht Agenten gegen Menschen. Es geht um reines Token-Volumen gegenüber nützlicher Arbeit. Diese Unterscheidung ist für Entwickler relevant, die Agenten-Schleifen steuern, für Unternehmen, die Renditen bewerten, und für Infrastrukturanbieter, die Speicherkapazitäten planen.
Die Token-Nutzung von OpenRouter-Agenten überschritt eine klare Schwelle
Die August-Daten zeigen eine bedeutende Veränderung im Modelltraffic, jedoch nur innerhalb der gemessenen OpenRouter-Umgebung.
OpenRouter betreibt ein Gateway, das Anfragen über Modelle und Inferenzanbieter hinweg weiterleitet. Diese Position verschafft dem Unternehmen Einblick in vielfältigen Anwendungstraffic, darunter direkte Gespräche, Coding-Tools und autonome Workflows.
Das berichtete Diagramm zeigt den Sieben-Tage-Durchschnitt der Token-Nutzung bis zum 10. August 2026. Agentischer Traffic erreichte etwa 7,3 Billionen Tokens, gegenüber 1,4 Billionen beim menschlichen Traffic.
Das daraus resultierende Verhältnis liegt bei etwa 5,2 zu eins. Es stützt die engere Aussage, dass Agenten während dieses Messzeitraums auf OpenRouter fünfmal mehr Token-Traffic erzeugten als Menschen.
Dasselbe Verhältnis für ChatGPT, Claude, Gemini, private Cloud-Deployments oder lokal gehostete Modelle lässt sich daraus nicht ableiten. Diese Systeme stehen für erheblichen Traffic, den OpenRouter nicht beobachten kann.
OpenRouter berichtete zudem, dass die agentische Nutzung seit dem 6. Februar etwa um das Vierzehnfache gewachsen sei. Die menschliche Token-Nutzung stieg im selben Zeitraum um etwa das 2,8-Fache. Gemischter Traffic, der menschliches und agentenähnliches Verhalten kombiniert, wuchs Berichten zufolge um etwa das 4,7-Fache.
Der 6. Februar war in dem Datensatz der letzte beobachtete Tag, an dem menschlicher Traffic noch über dem Agenten-Traffic lag. Dadurch wird das August-Ergebnis aussagekräftiger als ein einzelner täglicher Ausschlag. Agenten hatten ihren Vorsprung rund sechs Monate lang gehalten und ausgebaut.
OpenRouter klassifizierte jeden API-Key als agentisch, menschlich oder gemischt. Berichten zufolge nutzte das System sieben gewichtete Signale, darunter Tool-Call-Raten, Turn-Anzahlen und Zeitabstände zwischen Antworten.
Dieser Ansatz ist aufschlussreicher, als sich ausschließlich auf Anwendungsnamen zu verlassen. Ein generischer API-Client kann eine autonome Schleife ausführen, während eine als Agent vermarktete Anwendung unter direkter menschlicher Kontrolle bleiben kann.
Verhaltensbasierte Klassifizierung führt jedoch zu Unsicherheit. API-Keys können mehrere Produkte, Teams oder Anwendungsfälle bedienen. Eine Arbeitslast kann zudem zwischen menschlich gesteuertem und automatisiertem Verhalten wechseln, ohne dass sich die Zugangsdaten ändern.
Die gemischte Kategorie erkennt diese Mehrdeutigkeit an, beseitigt sie aber nicht. Würde ein Teil dieses Traffics anders zugeordnet, änderte sich das Verhältnis zwischen Agenten und Menschen.
Es gibt noch ein wichtiges semantisches Problem. Agenten sind im üblichen wirtschaftlichen Sinn keine unabhängigen Kunden. Menschen und Organisationen setzen sie ein, definieren Ziele, finanzieren ihre Anfragen und entscheiden, ob ihre Ergebnisse Wert haben.
Agenten lassen sich besser als automatisierte Vermittler verstehen. Eine menschliche Anfrage kann Planung, Abruf, Tool-Ausführung, Validierung, Korrektur und wiederholte Modellaufrufe auslösen.
Dieser Multiplikationseffekt ist das Kernereignis. Die KI-Nachfrage wird nicht mehr allein davon bestimmt, wie viele Menschen ein Chatfenster öffnen. Sie hängt zunehmend davon ab, wie viel Maschinenaktivität jede menschliche Anfrage auslöst.
Die frühere 100-Billionen-Token-Studie von OpenRouter identifizierte denselben strukturellen Wandel. Sie beschrieb agentische Inferenz als eine ausgedehnte Abfolge aus Planung, Tools, Überarbeitungen und wiederholter Modellinteraktion.
Die Studie stellte fest, dass Programmierung zu einer führenden Quelle des Prompt-Wachstums geworden war. Programmier-Prompts waren Ende 2025 im Durchschnitt zudem um ein Mehrfaches länger als Prompts für allgemeine Zwecke.
Diese Muster helfen zu erklären, warum Agenten die Schwelle überschritten. Eine Person kann eine Coding-Anfrage stellen. Ein Agent kann wiederholt Dateien prüfen, Tools aufrufen, Testergebnisse auswerten und seinen Arbeitskontext erneut senden.
Das August-Diagramm erfasst diese Verstärkung auf Plattformebene. Es beweist nicht, dass autonome Software die menschliche Nachfrage ersetzt hat. Es zeigt, dass menschliche Nachfrage zunehmend über Systeme ankommt, die viele nachgelagerte Anfragen erzeugen.
Eine menschliche Anweisung kann Tausende Modelloperationen auslösen
Agenten verbrauchen mehr Tokens, weil sie eine einzelne Anfrage in einen fortlaufenden Rechenprozess verwandeln.
Eine herkömmliche Chatbot-Interaktion folgt üblicherweise einem sichtbaren Rhythmus. Eine Person schreibt einen Prompt, erhält eine Antwort und entscheidet, ob sie fortfahren möchte. Jede neue Runde hängt von einer weiteren menschlichen Handlung ab.
Ein Agent kann ohne diese Pause fortfahren. Er interpretiert ein Ziel, erstellt Schritte, wählt Tools aus, bewertet Ergebnisse und entscheidet, ob ein weiterer Versuch erforderlich ist.
Betrachten wir eine Softwaremigration. Ein Entwickler könnte einen Agenten bitten, eine Anwendung von einem Cloud-Service zu einem anderen zu migrieren.
Der erste Modellaufruf kann die Anfrage prüfen und einen Plan formulieren. Spätere Aufrufe könnten Konfigurationsdateien untersuchen, Dokumentation durchsuchen, Code bearbeiten, Tests ausführen, Fehler diagnostizieren und die Implementierung überarbeiten.
Jeder Aufruf enthält oft mehr als nur die neueste Anweisung. Er kann Systemregeln, Tool-Definitionen, Repository-Details, vorherige Nachrichten, Befehlsausgaben und frühere Entscheidungen des Agenten mitführen.
Dieses angesammelte Material ist das Kontextfenster, also der Text und die strukturierten Daten, die dem Modell während einer Anfrage zur Verfügung stehen. Im Verlauf der Aufgabe kann dieser Kontext deutlich größer werden als der ursprüngliche menschliche Prompt.
Der Einsatz von Tools erhöht den Traffic zusätzlich. Ein Modell könnte eine Datenbankabfrage generieren, das Ergebnis prüfen und anschließend erneut das Modell aufrufen, um zu entscheiden, was als Nächstes folgt.
Parallele Agenten können den Prozess nochmals vervielfachen. Ein Koordinator könnte Recherche, Coding, Tests und Review an getrennte Worker delegieren. Jeder Worker verwaltet eigene Anweisungen und einen eigenen Aufgabenverlauf.
Das erklärt, warum das Token-Volumen viel schneller wachsen kann als die Zahl der Nutzer. Die grundlegende Einheit hat sich von einem Gesprächszug zu einem Workflow-Schritt verschoben.
Die Daten von OpenRouter spiegeln auch das Wachstum bei Reasoning- und Programmier-Workloads wider. Diese Aufgaben begünstigen naturgemäß längere Interaktionen, weil sie Zwischenzustände, externe Tools und wiederholte Validierung einbeziehen.
Akademische Evidenz deutet darauf hin, dass die Verstärkung extrem werden kann. Eine Studie aus dem Jahr 2026 zu agentischem Coding ergab, dass Agenten-Aufgaben in ihrem experimentellen Umfeld etwa 1.000-mal mehr Tokens verbrauchten als Code-Chat.
Die Forschung zu Agentenkosten stellte zudem starke Unterschiede zwischen wiederholten Durchläufen fest. Der Token-Verbrauch für dieselbe Aufgabe wich in den Tests der Forscher um bis zu das Dreißigfache ab.
Entscheidend ist, dass mehr Tokens nicht durchgängig bessere Ergebnisse lieferten. Die Leistung erreichte oft bei einem mittleren Niveau ihren Höhepunkt, bevor zusätzlicher Verbrauch keine entsprechenden Gewinne mehr brachte.
Dieses Ergebnis verstärkt die zentrale Spannung hinter der Token-Nutzung von OpenRouter-Agenten. Eine steigende Zahl kann produktive Automatisierung, unnötige Wiederholung oder eine Mischung aus beidem darstellen.
Entwickler von Agenten stehen daher unter Druck, erledigte Arbeit zu messen und nicht nur erzeugte Aktivität. Sinnvolle Indikatoren sind akzeptierte Codeänderungen, gelöste Supportfälle, erfolgreiche Transaktionen und ohne menschliche Nachbesserung abgeschlossene Aufgaben.
Ein Token ist lediglich eine Einheit der Textverarbeitung. Es enthält kein eingebautes Maß für Genauigkeit, Schwierigkeit, Neuheit oder Geschäftswert.
Zwei Workflows können dieselbe Anzahl an Tokens verbrauchen und dennoch sehr unterschiedliche Ergebnisse liefern. Einer könnte ein schwieriges Engineering-Problem lösen. Der andere könnte einen fehlgeschlagenen Plan wiederholen, bis ein Limit ihn stoppt.
Das Design des umgebenden Systems bestimmt, welches Ergebnis wahrscheinlicher ist. Klare Abschlusskriterien helfen einem Agenten, Erfolg zu erkennen. Begrenzte Retry-Richtlinien verhindern, dass eine scheiternde Aufgabe unbegrenzt weiterläuft.
Gute Tools verringern zudem den Bedarf an langwieriger textbasierter Schlussfolgerung. Eine strukturierte API kann ein präzises Ergebnis liefern, das andernfalls wiederholtes Browsen und Interpretieren erfordern würde.
Die Speicherarchitektur ist aus demselben Grund wichtig. Ein Agent benötigt nicht bei jedem Schritt jedes alte Detail. Er braucht die Teilmenge, die für die aktuelle Entscheidung relevant bleibt.
Hier kann eine durchsuchbare persönliche Wissensdatenbank menschlich gesteuerte Workflows unterstützen. Abgerufene Belege können wahllosen Verlauf ersetzen, wenn das System den Kontext sorgfältig auswählt.
Der Druck reicht über Entwickler hinaus. Unternehmenskäufer müssen nun bewerten, wie Produkte Schleifen steuern, Kontext abrufen und Verbrauch ausweisen.
Ein Produkt kann während einer kurzen Demonstration effizient wirken, sich bei lang laufenden Workloads jedoch anders verhalten. Produktionsaufgaben treffen auf fehlende Berechtigungen, mehrdeutige Ziele, sich ändernde Daten und unerwartete Tool-Antworten.
Diese Bedingungen erzeugen Wiederholungsversuche. Sie zeigen auch, ob der Agent über verlässliche Abbruchregeln verfügt oder lediglich weiterhin plausible nächste Schritte produziert.
Menschliche Adoption bleibt wichtig, sagt die Inferenznachfrage aber nicht mehr allein voraus. Die nützlichere Formel umfasst Nutzer, delegierte Aufgaben, Modellaufrufe pro Aufgabe und Tokens pro Aufruf.
Diese Formel macht ein Verhältnis von zehn zu eins grundsätzlich plausibel. Sie macht Newmans Prognose jedoch nicht unausweichlich. Das Verhältnis wird auch von Optimierung, Modellverhalten, Anwendungsdesign und Traffic außerhalb von OpenRouter abhängen.
Gecachte Prompts erklären den größten Teil der Token-Explosion
Der größte Teil des Agentenvorsprungs scheint aus wiederholtem Kontext zu bestehen, nicht aus vollständig neuem Reasoning oder Output.
Berichten zufolge stammten mehr als 85 % der Agenten-Tokens in der a16z-Präsentation aus gecachten Prompts. Gecachte Prompts sind zuvor verarbeitete Eingabesegmente, die ein Anbieter wiederverwenden kann, wenn eine spätere Anfrage mit übereinstimmendem Inhalt beginnt.
Ein Agent sendet oft stabiles Material erneut. Dieses Material kann Systemanweisungen, Tool-Beschreibungen, Projektdateien, Richtlinien und einen früheren Gesprächsverlauf umfassen.
Denselben Präfix bei jedem Aufruf von Grund auf zu verarbeiten, würde Rechenleistung verschwenden. Prompt-Caching ermöglicht dem Anbieter, Zwischenergebnisse wiederzuverwenden, die diesem Präfix zugeordnet sind.
Die Cache-Telemetrie von OpenRouter trennt gecachte Tokens von neu verarbeiteten Prompt-Tokens. Sie kann auch Tokens identifizieren, die für eine spätere Wiederverwendung in einen Cache geschrieben werden.
Das bedeutet, dass 7,3 Billionen Tokens nicht als 7,3 Billionen Einheiten frischer Modellarbeit interpretiert werden sollten. Ein großer Anteil steht für Informationen, auf die das System bereits zuvor gestoßen ist.
Diese Unterscheidung beeinflusst die Kosten. Anbieter berechnen für einen Cache-Lesevorgang in der Regel weniger als für die Verarbeitung neuer Eingaben, weil ein Großteil der früheren Berechnung bereits erfolgt ist.
Dies bedeutet jedoch nicht, dass der Cache kostenlos ist. Das System muss den Cache-Eintrag identifizieren, seine Daten abrufen und den zugehörigen Modellzustand während der Inferenz verfügbar machen.
Der relevante Modellzustand wird oft als Key-Value-Cache oder KV-Cache bezeichnet. Er speichert aus früheren Tokens abgeleitete Aufmerksamkeitsinformationen, damit das Modell fortfahren kann, ohne jede vorherige Position neu zu berechnen.
Längere Prompts erzeugen größere KV-Caches. Mehr parallele Agent-Sitzungen erzeugen mehr davon. Langlebige Workflows können zudem wiederholten Zugriff auf umfangreichen gespeicherten Kontext erfordern.
Dadurch verschiebt sich der Infrastrukturengpass. Rechenleistung bleibt wichtig, doch Speicherkapazität, Speicherbandbreite und Datenbewegung gewinnen zunehmend an Bedeutung.
Deshalb macht der Cache-Anteil die OpenRouter-Daten nicht bedeutungslos. Er verändert, was die Daten aussagen.
Als Beleg für neue Nachfrage nach Schlussfolgerungsleistung ist das Diagramm schwächer. Als Hinweis darauf, dass Agent-Systeme große Verläufe über viele Modellaufrufe hinweg wiederholt mitführen, ist es stärker.
Der Unterschied ähnelt dem wiederholten Nachschlagen in derselben umfangreichen Projektmappe. Vertraute Seiten erneut zu lesen erfordert weniger Vorbereitung als neue Seiten zu analysieren, doch die Mappe muss verfügbar bleiben.
Caching kann zudem ineffizientes Agent-Design finanziell erträglich machen. Ein Workflow könnte einen enormen System-Prompt erneut senden, weil der vergünstigte Cache-Lesezugriff einen Teil der Kosten verdeckt.
Dieses Design verbraucht dennoch Kapazität. Es kann die Latenz erhöhen, das Routing verkomplizieren und eine Abhängigkeit von stabilen Prompt-Präfixen schaffen.
Cache-Treffer sind nicht in jeder Konfiguration garantiert. Eine Änderung am frühen Teil des Prompts kann späteres gecachtes Material ungültig machen. Auch das Routing von Anfragen zwischen Anbietern kann die Wiederverwendung beeinflussen.
Dynamische Daten stellen eine weitere Herausforderung dar. Wenn Zeitstempel, abgerufene Dokumente, Tool-Ergebnisse oder nutzerspezifische Details nahe am Anfang erscheinen, können sie die Präfixstabilität verringern.
Entwickler von Agenten benötigen daher eine bewusste Kontextstruktur. Stabile Anweisungen gehören an den Anfang, während sich ändernde Informationen – sofern das Verhalten des Anbieters dies zulässt – nach wiederverwendbaren Abschnitten stehen sollten.
Auch die Sitzungsaffinität kann wichtig sein. Anfragen, die einem kompatiblen Anbieter zugeordnet bleiben, können früheren Kontext eher wiederverwenden als Anfragen, die unvorhersehbar geroutet werden.
Auch die Zahl von 85 % erfordert eine sorgfältige Quellenzuordnung. Laut dem Quellbericht erschien sie in der Einordnung von a16z zu OpenRouter-Daten. OpenRouters ursprüngliche Analyse wurde zudem als Darstellung eines niedrigeren Anteils nach einer anderen Berechnung beschrieben.
Unterschiedliche Nenner können unterschiedliche Prozentwerte ergeben. Eine Methode kann das gesamte Token-Volumen aggregieren, während eine andere den Cache-Anteil über Anfragen hinweg mittelt.
Einige wenige enorme Workflows können das Gesamtvolumen dominieren, ohne die typische Anfrage zu repräsentieren. Umgekehrt kann ein Durchschnitt pro Anfrage den Einfluss der größten Workloads unterschätzen.
Beide Messungen können korrekt sein und dennoch unterschiedliche Fragen beantworten. Das öffentliche Diagramm liefert nicht genügend methodische Details, um jeden gemeldeten Cache-Prozentsatz unabhängig abzugleichen.
Die sicherste Schlussfolgerung ist daher richtungsweisend. Gecachter Kontext bildet den klaren Großteil des Agent-Tokenverkehrs, während der genaue Anteil davon abhängt, wie die Plattform Anfragen aggregiert.
Dies stellt auch die Formulierung „KI nutzt KI“ infrage. Die Agenten führen nicht zwangsläufig Billionen unabhängiger Schlussfolgerungsakte aus. Ein großer Teil ihres Verkehrs dient dazu, den Kontext wiederherzustellen, der für die Fortsetzung delegierter Arbeit nötig ist.
Dieses Verhalten kann dennoch echten Wert schaffen. Ein Coding-Agent benötigt Repository-Zustand und frühere Entscheidungen, um nach jedem Tool-Aufruf nicht wieder bei null anzufangen.
Die Effizienzfrage betrifft die Auswahl. Lädt der Agent den kleinsten nützlichen Kontext neu, oder sendet er wiederholt alles, weil sich dieser Ansatz leichter implementieren lässt?
Mit steigendem Token-Volumen wird dieser Unterschied zu einer wesentlichen Engineering-Entscheidung. Effizientes Kontextmanagement kann den Speicherbedarf verringern, ohne die Aufgabenleistung zu schwächen.
Fünfmal so viele Tokens bedeuten nicht fünfmal so viel ROI
Das Token-Volumen misst die Auslastung, während der Return on Investment von erfolgreichen Ergebnissen und den gesamten Betriebskosten abhängt.
Newman argumentierte, dass Unternehmen bei der Bewertung von KI-Renditen zu stark auf menschliche Akzeptanz fokussieren. Sein weitergehender Punkt ist berechtigt, denn ein einzelner Nutzer kann heute weit mehr Inferenz auslösen, als eine chatbasierte Akzeptanzmetrik erkennen lässt.
Monatlich aktive Nutzer können den Infrastrukturbedarf unterschätzen. Auch die Zahl der Lizenzen kann automatisierte Arbeit übersehen, die kontinuierlich weiterläuft, nachdem Mitarbeitende ihren Arbeitsplatz verlassen haben.
Doch Nutzerzahlen durch Token-Zahlen zu ersetzen, schafft eine weitere unvollständige Kennzahl. Tokens zeigen Aktivität, aber nicht, ob diese Aktivität Umsatz geschaffen, Arbeitsaufwand reduziert, Qualität verbessert oder Risiken erhöht hat.
Das Fünffach-Verhältnis vergleicht zudem zwei Verkehrskategorien statt zwei wirtschaftliche Akteure. Agent-Anfragen bleiben nachgelagert zu menschlichen oder organisatorischen Entscheidungen.
Ein Unternehmen erzielt keine Rendite, weil ein Agent mehr Tokens verbraucht hat. Es erzielt sie, wenn der Agent wertvolle Arbeit zu vertretbaren Kosten und mit vertretbarem Risiko erledigt.
Eine sinnvolle Bewertung beginnt mit dem Erfolg der Aufgabe. Teams sollten fragen, ob der Workflow die beabsichtigte Aktion abgeschlossen hat und ob ein Mensch das Ergebnis akzeptiert hat.
Die nächste Frage betrifft Eingriffe. Ein Agent, der ohne Aufsicht fertig wird, hat ein anderes Betriebsprofil als einer, der wiederholte Korrekturen erfordert.
Auch die Latenz ist wichtig. Ein Workflow, der letztlich erfolgreich ist, kann kommerziell dennoch scheitern, wenn Kunden zu lange warten müssen oder die Infrastrukturwarteschlangen bei Spitzenlast anwachsen.
Dann folgen die Gesamtkosten. Token-Gebühren sind nur ein Bestandteil. Tool-Aufrufe, Suchdienste, Datenbanken, Sandboxes, Observability, Sicherheitsprüfungen und menschliche Nachbearbeitung können erhebliche Kosten verursachen.
Auch risikobereinigte Ergebnisse sind wichtig. Ein Agent, der Produktionssysteme verändert, benötigt stärkere Kontrollen als ein Agent, der öffentliche Dokumente zusammenfasst.
Das OpenRouter-Diagramm kann keine dieser Fragen beantworten. Es wurde entwickelt, um Verkehr zu beschreiben, nicht Unternehmensrenditen.
Dieselbe Einschränkung gilt für Newmans Prognose eines Zehnfachen. Die Fortschreibung des Verhältnisses setzt voraus, dass der Agent-Verkehr ohne vergleichbare Effizienzkorrektur schneller wächst als der menschliche Verkehr.
Diese Annahme kann aus mehreren Gründen scheitern. Anwendungen können Kontext komprimieren, kleinere Modelle für Routineaufgaben einsetzen, wiederholtes Schlussfolgern durch deterministische Software ersetzen und Schleifen früher beenden.
Modellverbesserungen können Wiederholungsversuche reduzieren. Bessere Tool-Schnittstellen können zudem sauberere Informationen zurückgeben und damit die Zahl der nötigen Aufrufe zur Erledigung einer Aufgabe senken.
Wirtschaftlicher Druck wird diese Veränderungen fördern. Unternehmen haben einen Anreiz, Aufrufe zu entfernen, die Ergebnisse nicht verbessern, selbst wenn Cache-Lesezugriffe vergleichsweise günstig sind.
Die a16z-Diskussion über Loop-Konvergenz hebt dasselbe Problem hervor. Ein Agent kann zusätzliche Arbeit erzeugen, nachdem der Großteil des verfügbaren Werts bereits entstanden ist.
Eine Schleife ohne externen Abschluss-Test kann fortgesetzte Aktivität mit Fortschritt verwechseln. Sie könnte ein Dokument wiederholt bearbeiten, einen fehlschlagenden Befehl erneut ausführen oder eine bereits akzeptable Antwort weiter verfeinern.
Dieses Verhalten ist besonders schwer zu erkennen, wenn jeder einzelne Aufruf plausibel erscheint. Verschwendung entsteht über den gesamten Verlauf hinweg statt innerhalb einer einzelnen Antwort.
Observability muss daher auf Aufgabenebene funktionieren. Entwickler benötigen Traces, die jeden Modellaufruf mit Tool-Nutzung, Zustandsänderungen, Fehlern und den letztlichen Ergebnissen verbinden.
Budgets sollten ebenfalls den Wert der Aufgabe widerspiegeln. Eine Untersuchung mit hohem Risiko kann mehr Iterationen rechtfertigen als eine routinemäßige Formatierungsanfrage.
Eskalationsregeln schaffen eine weitere Grenze. Wenn der Agent wiederholtes Scheitern oder unklare Berechtigungen feststellt, kann die Übergabe der Kontrolle an eine Person günstiger und sicherer sein.
Auch im Verkehr von OpenRouter gibt es einen Selektionseffekt. Die Plattform bedient Entwickler, die bewusst ein Model-Gateway einsetzen, was zu einer technischeren Workload-Mischung als bei Verbraucheranwendungen führen kann.
Programmierung und Agent-Frameworks können bei OpenRouter daher einen größeren Anteil einnehmen als im gesamten KI-Markt.
Die Größe von OpenRouter macht den Trend dennoch wichtig. Seine Daten decken erheblichen realen Verkehr über viele Modelle und Anbieter hinweg ab. Die Ergebnisse sollten lediglich an diesen Geltungsbereich gebunden bleiben.
Die Beziehungen der Plattform bringen einen weiteren Gesichtspunkt mit sich. Andreessen Horowitz hat in OpenRouter investiert, wodurch a16z ein Interesse am Wachstum der Token-Routing-Infrastruktur hat.
Das entkräftet die Zahlen nicht. Es macht transparente Methodik und unabhängige Replikation wichtiger – besonders wenn die Daten weitreichende Behauptungen über die KI-Wirtschaft stützen.
Die stärkste Interpretation vermeidet beide Extreme. Das Diagramm ist weder ein Beweis dafür, dass autonome Maschinen zu den primären Kunden der KI geworden sind, noch ein bedeutungsloses Artefakt des Cachings.
Es zeigt, dass Agent-Architekturen die Inferenznachfrage verstärken. Es zeigt auch, dass diese Verstärkung derzeit stark auf dem Transport und Abruf alten Kontexts beruht.
Für Käufer lautet die zentrale Frage nicht, ob ein Agent viele Tokens verwendet. Entscheidend ist, ob jede zusätzliche Runde die Wahrscheinlichkeit eines erfolgreichen, wertvollen Ergebnisses erhöht.
Speicheranbieter und Agent-Plattformen stehen unter unmittelbarem Druck
Die Verschiebung im Datenverkehr belohnt Systeme, die Kontext effizient verwalten, und setzt Produkte unter Druck, die Token-Verbrauch als Ersatzgröße für Fortschritt behandeln.
Modellanbieter stehen vor einer komplexeren Arbeitslast als beim gewöhnlichen Request-Response-Chat. Agent-Sitzungen können länger aktiv bleiben, wiederholt Tools aufrufen und wachsende Verläufe beibehalten.
Diese Arbeitslast setzt Scheduler und Routing-Systeme unter Druck. Anbieter müssen Cache-Lokalität, Modellverfügbarkeit, Latenz und Zuverlässigkeit bei schwankender Nachfrage ausbalancieren.
Gateway-Plattformen wie OpenRouter gewinnen strategisch an Bedeutung, weil Anwendungen zunehmend mehrere Modelle einsetzen. Ein Workflow kann Planung, Coding, Validierung und Zusammenfassung an verschiedene Endpunkte routen.
Dynamisches Routing kann Kosten senken oder die Leistung verbessern, aber es kann auch das Caching beeinträchtigen. Eine an einen anderen Anbieter gesendete Anfrage könnte den Zugriff auf einen zuvor aufgebauten Cache verlieren.
Anbieter, die klare Cache-Metriken bereitstellen, werden bei anspruchsvollen Käufern im Vorteil sein. Teams müssen wissen, wie viele Tokens neu, gecacht, generiert oder in den Speicher geschrieben wurden.
Auch Speicherhersteller sehen sich durch größere Kontexte und mehr parallele Sitzungen einer steigenden Nachfrage gegenüber. High-Bandwidth Memory versorgt Modellbeschleuniger, während konventioneller Speicher und Storage die umgebenden Systeme unterstützen.
Das Diagramm quantifiziert jedoch keine künftigen Speicheranschaffungen. Es zeigt Token-Verkehr, keine exakte Zuordnung zwischen jedem Token und neuer Hardwarekapazität.
Die Hardware-Nachfrage hängt von Modellarchitektur, Datentypen, Batching, Cache-Verdrängung, Komprimierung und der Zahl gleichzeitiger Sitzungen ab. Softwareverbesserungen können jede dieser Beziehungen verändern.
Agent-Plattformen stehen aus einer weiteren Richtung unter Druck. Kunden werden zunehmend nützliche Arbeit pro Token vergleichen, nicht nur den Zugang zu leistungsfähigen Modellen.
Produkte, die Verbrauch hinter pauschalen Nutzungsbehauptungen verbergen, können Schwierigkeiten bekommen, wenn Unternehmens-Finanzteams Ökonomie auf Aufgabenebene verlangen. Käufer werden wiederholbare Nachweise über ihre eigenen Workloads wünschen.
Coding-Agenten bieten einen frühen Testfall, weil ihre Ergebnisse anhand von Builds, Tests, Reviews und Deployment-Ergebnissen bewertet werden können. Diese Signale schaffen messbare Abbruchbedingungen.
Andere Bereiche bleiben schwieriger. Forschung, Strategie und Schreiben verfügen oft über keinen einzelnen objektiven Test. Agenten können Ergebnisse ohne einen klaren Abschlusszeitpunkt weiter verfeinern.
Diese Unsicherheit macht menschliche Prüfung wichtiger, selbst wenn Agenten den Großteil der Zwischenarbeit erledigen. Sie erschwert auch den Vergleich der Token-Effizienz zwischen Anbietern.
Infrastrukturanbieter können mit Kontextkomprimierung, Präfix-Caching, zustandsbehafteten Sitzungen und Retrieval-Systemen reagieren. Jeder Ansatz versucht, das erneute Senden unnötiger Verläufe zu vermeiden.
Anwendungsentwickler können dauerhaften Speicher vom Arbeitskontext trennen. Der dauerhafte Speicher bewahrt potenziell nützliche Informationen, während der Arbeitskontext nur enthält, was der aktuelle Schritt benötigt.
Diese Trennung reduziert wiederholten Text und begrenzt irrelevante Informationen. Sie kann zudem die Modellgenauigkeit verbessern, indem Ablenkungen außerhalb des aktiven Prompts bleiben.
Deterministische Software sollte deterministische Aufgaben übernehmen. Ein Agent muss nicht über eine Berechnung, eine Schemavalidierung oder eine Zugriffsprüfung nachdenken, wenn zuverlässiger Code dies direkt erledigen kann.
Die effizientesten Systeme werden Modelle wahrscheinlich mit konventioneller Software kombinieren. Modelle bewältigen Mehrdeutigkeit und Planung, während Code Regeln durchsetzt und stabile Operationen ausführt.
Dieses Hybrid-Design schwächt die Annahme, dass Agenten-Traffic unbegrenzt steigen müsse. Bessere Systeme können mehr Aufgaben erledigen und zugleich die Token pro Aufgabe reduzieren.
Gleichzeitig können sinkende Stückkosten die Gesamtnachfrage erhöhen. Wenn jeder Workflow günstiger wird, können Entwickler Agenten an mehr Stellen einsetzen und häufiger ausführen.
Der daraus entstehende Rebound-Effekt kann das Infrastrukturwachstum aufrechterhalten, selbst wenn einzelne Aufgaben effizienter werden. Diese Möglichkeit stützt die Richtung von Newmans Prognose, nicht jedoch ihr genaues Verhältnis.
Auch menschlicher Traffic kann wachsen. Bessere Verbraucherprodukte, neue Schnittstellen und eine breitere Unternehmensadoption könnten die direkte Nutzung neben dem Agenten-Traffic erhöhen.
Das künftige Verhältnis hängt davon ab, welche Kurve schneller wächst. Es ist nicht allein eine Funktion besser werdender Agenten.
Der Wettbewerb zwischen OpenAI, Anthropic, Google, Entwicklern offener Modelle und spezialisierten Inference-Anbietern wird diese Kurve prägen. Ihre Caching-Regeln und Tool-Fähigkeiten unterscheiden sich.
Auch die Modellwahl kann sich während eines Workflows ändern. Ein kleines Modell könnte eine Anfrage klassifizieren, während ein größeres Modell eine schwierige Entscheidung übernimmt.
Diese Architektur verringert die Aussagekraft einer einzelnen aggregierten Tokenzahl. Ein von einem kompakten Modell verarbeiteter Token hat ein anderes Ressourcenprofil als ein von einem Frontier-Modell verarbeiteter Token.
Unternehmen werden normalisierte Kennzahlen benötigen, die Modellwahl, Tokentyp, Latenz, Energie und Aufgabenerfolg zusammenführen. Derzeit gibt es keinen breit akzeptierten Standard, der das gesamte Bild erfasst.
Bis ein solcher Standard entsteht, bleibt die Agenten-Token-Nutzung von OpenRouter ein nützlicher Frühindikator. Sie zeigt die Form der Nachfrage, bevor die Finanzberichterstattung ihren Wert erklären kann.
Drei Signale werden die 10x-Prognose prüfen
Die nächste Phase sollte anhand der Stabilität der Klassifizierung, des Wachstums frischer Tokens und der erledigten Arbeit pro Inference-Einheit bewertet werden.
Das erste Signal ist, ob das Verhältnis von Agenten zu Menschen bei OpenRouter nach August weiter steigt. Ein anhaltender Anstieg würde die Annahme stützen, dass autonome Workflows schneller wachsen als direkte Interaktionen.
Der Vergleich sollte dieselbe Klassifizierungsmethode und denselben Messzeitraum verwenden. Änderungen der Methode könnten scheinbares Wachstum erzeugen, ohne dass sich das Verhalten entsprechend verändert.
Gemischter Traffic verdient besondere Aufmerksamkeit. Wenn er schneller wächst als beide Kategorien, wird die Grenze zwischen menschlicher und agentischer Nutzung weniger verlässlich.
Das zweite Signal ist die Zusammensetzung der Agenten-Tokens. Ein steigender Cache-Anteil würde darauf hindeuten, dass die Wiederholung von Kontext und nicht die frische Modellverarbeitung weiterhin der wichtigste Wachstumstreiber ist.
Ein sinkender Cache-Anteil bei gleichzeitig steigendem Gesamtvolumen würde eine andere Geschichte erzählen. Er würde darauf hindeuten, dass Agenten mehr neue Inference ausführen, statt hauptsächlich etablierten Kontext erneut abzuspielen.
Öffentliche Berichte sollten neue Eingaben, Cache-Lesevorgänge, Cache-Schreibvorgänge, Reasoning-Tokens und Ausgaben unterscheiden. Sie in einer einzigen Zahl zusammenzufassen, verdeckt wesentliche Unterschiede bei Kosten und Infrastrukturnachfrage.
Das dritte Signal ist die Aufgabeneffizienz. Anbieter von Agenten und Unternehmensnutzer sollten erledigte Arbeit pro Modellaufruf, Tokens pro erfolgreich abgeschlossener Aufgabe und menschliche Eingriffe pro Abschluss ausweisen.
Wenn sich diese Kennzahlen verbessern, während der gesamte Agenten-Traffic steigt, wird das Wachstumsargument stärker. Dies würde darauf hindeuten, dass Adoption und erfolgreiche Automatisierung gemeinsam zunehmen.
Wenn die Token-Nutzung steigt, während der Erfolg unverändert bleibt, würde das Diagramm zunehmend operativen Verschleiß beschreiben. Ein höheres Verhältnis würde das ROI-Argument dann schwächen statt stärken.
Unabhängige Datensätze würden das Vertrauen ebenfalls erhöhen. Traffic aus direkten Modell-APIs, Cloud-Plattformen und privaten Bereitstellungen könnte zeigen, ob OpenRouter den breiteren Markt widerspiegelt.
Derzeit stützen die Belege eine engere Schlussfolgerung als die virale Behauptung. Agenten erzeugten im August 2026 mehr als das Fünffache des auf OpenRouter beobachteten menschlichen Token-Traffics.
Der Großteil dieses Traffics scheint zwischengespeicherten Kontext zu betreffen. Dieser Kontext erfordert weiterhin Speicher, Routing und sorgfältiges Management, sollte jedoch nicht mit einer gleich großen Menge neuen Reasonings verwechselt werden.
Der Schritt auf das Zehnfache ist eine Prognose, kein bereits eingetretenes Ergebnis. Seine Bedeutung wird davon abhängen, was die zusätzlichen Tokens erreichen.
Entwickler sollten prüfen, ob jede Schleife einen klaren Zweck, ein Budget und eine Abbruchbedingung hat. Unternehmenskäufer sollten auf Nachweise auf Aufgabenebene bestehen, bevor sie Verbrauch als Adoption betrachten.
Die nützliche Frage lautet nicht länger, ob Agenten mehr Traffic erzeugen werden als Menschen. Die Daten von OpenRouter legen nahe, dass sie dies bereits tun. Die Frage ist, ob die nächsten Billionen Tokens mehr Arbeit erledigen oder lediglich mehr von der Vergangenheit erneut lesen.



