top of page

OpenAIs Codex Agents dominieren nun den internen KI-Tokenverbrauch

13. Aug.
12 Min. Lesezeit

OpenAI zufolge erzeugt Codex inzwischen 99,8 % seiner wöchentlichen internen Output-Tokens – eine Umkehr, die ein aktueller Google-News-Beitrag über KI-Ausgaben in Unternehmen hervorhebt.

Diese Zahl zeigt weder Ausgaben noch Umsatz oder Produktivität. Sie misst Output-Tokens, also die von einem Modell erzeugten Textbestandteile, innerhalb des Unternehmens, das diese Technologie verkauft. Dennoch verdeutlicht sie einen bedeutenden Wandel darin, wie OpenAI-Mitarbeitende KI einsetzen.

ChatGPT erledigte früher den Großteil der internen KI-Arbeit. Codex, ein Agent, der umfangreichere Aufgaben ausführen und Tools nutzen kann, dominiert inzwischen Aktivitäten in Engineering, Recht, Finanzen und Recruiting.

Der entscheidende Wettbewerb findet nicht länger zwischen OpenAI und einem anderen Modellanbieter statt. Es geht um chatbasierte Unterstützung gegenüber delegierter Agentenarbeit. Ein Chatbot beantwortet eine Anfrage, während ein Agent Dateien prüfen, Tools aufrufen, seinen Ansatz überarbeiten und Minuten oder Stunden lang arbeiten kann.

OpenAI stellt diesen Übergang als Beleg dafür dar, dass produktive Arbeit zu Agents wandert. Derselbe Übergang macht den KI-Verbrauch jedoch schwerer vorherzusagen, zuzuordnen, abzusichern und zu bewerten.

Unternehmenskäufer stehen daher vor einer präziseren Frage, als die Google-News-Schlagzeile vermuten lässt. Sie müssen feststellen, ob der steigende Tokenverbrauch wertvolle delegierte Arbeit oder eine teure Schleife darstellt, die Aktivität ohne ein entsprechendes Ergebnis erzeugt.

Was OpenAIs Tokenverschiebung tatsächlich zeigt

OpenAIs interne Daten zeigen einen klaren Wandel im Verhalten, belegen aber nicht, dass jedes Unternehmen dieselben Ergebnisse erzielen wird.

OpenAI veröffentlichte seine Analyse am 12. August 2026. Das Unternehmen untersuchte die Codex-Aktivität bei Einzelkunden, Organisationsnutzern und der eigenen Belegschaft.

Bis August 2025 lenkte der durchschnittliche OpenAI-Mitarbeitende weniger als 10 % seiner Tokens zu Codex. ChatGPT blieb in diesem Zeitraum die Standardoberfläche für die interne KI-Nutzung.

Das Verhältnis änderte sich, als Codex länger laufende Ausführungen, bessere Modelle und Unterstützung für parallele Aufgaben erhielt. OpenAI zufolge erzeugt der durchschnittliche Mitarbeitende inzwischen mehr als 85 % seiner Output-Tokens über Codex.

Codex steht laut OpenAIs Daten zur Agentenadoption für 99,8 % der wöchentlichen Output-Tokens im gesamten Unternehmen. Die Differenz zwischen diesen beiden Zahlen ist bedeutsam.

Die erste Zahl beschreibt den Mix aus Codex- und ChatGPT-Aktivität des durchschnittlichen Mitarbeitenden. Die zweite spiegelt den gesamten Pool erzeugter Tokens wider, der stark von intensiven Agentennutzern beeinflusst wird.

Agents erzeugen naturgemäß mehr Tokens als herkömmliche Chats. Sie lesen wiederholt Kontext, planen Aktionen, prüfen Ergebnisse, rufen Tools auf und überarbeiten ihre Arbeit.

Ein Mitarbeitender kann zudem mehrere Agents gleichzeitig ausführen. Damit ist der Anteil der Output-Tokens ein Maß für Rechenaktivität und keine direkte Zählung von Beschäftigten oder abgeschlossenen Aufgaben.

OpenAIs intensivste interne Nutzer veranschaulichen den Unterschied. Bis Juni 2026 erzeugten Mitarbeitende im 99. Perzentil regelmäßig mehr als 60 Stunden Codex-Agent-Turns pro Tag.

Diese Zahl bedeutet nicht, dass eine Person 60 Stunden gearbeitet hat. Sie spiegelt mehrere parallel arbeitende Agents wider, während ihr menschlicher Operator die Arbeit anleitete oder prüfte.

Auch längere Aufgaben sind bei den untersuchten Einzelnutzern verbreitet geworden. Bis Mai 2026 hatten 80,6 % mindestens eine Codex-Anfrage gestellt, die OpenAI auf mehr als 30 Minuten menschlicher Arbeit schätzte.

Weitere 70,2 % stellten eine Anfrage mit einer Schätzung von mehr als einer Stunde. Noch einmal 25,6 % stellten mindestens eine Anfrage mit einer Schätzung von mehr als acht Stunden.

Diese Schätzungen betreffen den mit einer Aufgabe verbundenen menschlichen Aufwand, nicht unbedingt die Laufzeit des Agents oder den Umfang der eingesparten Arbeit. OpenAIs Klassifizierungsmethode kann zudem nicht belegen, dass jedes erzeugte Ergebnis akzeptiert oder nützlich war.

Trotz dieser Einschränkungen ist die Richtung klar. Nutzer bitten KI, größere Arbeitseinheiten zu übernehmen, statt isolierte Antworten anzufordern.

Eine Chat-Interaktion kann eine Zusammenfassung, einen Entwurf oder ein Code-Snippet liefern. Ein Agent kann ein Repository untersuchen, mehrere Dateien ändern, Tests ausführen, Fehler interpretieren und Korrekturen versuchen.

Dieser Unterschied erklärt, warum die KI-Aktivität in Unternehmen deutlich schneller wachsen kann als Mitarbeiterzahl oder Nachrichtenvolumen. Jeder delegierte Auftrag umfasst mehrere Modellinteraktionen, die hinter einer einzelnen Nutzeranfrage verborgen bleiben.

Dies ist die zentrale Umkehr des Ereignisses. Der sichtbare Prompt wird zu einem kleineren Teil der Arbeit, während autonome Ausführung einen größeren Anteil der Rechenleistung beansprucht.

Für Organisationen verändert das die Bedeutung der KI-Einführung. Lizenzen und Nachrichten zu zählen, beschreibt nicht mehr, wie tief Modelle an operativer Arbeit beteiligt sind.

Auch die Risikogrenze verschiebt sich. Ein Chatbot schlägt üblicherweise eine Antwort vor, während ein Agent Aktionen in verbundenen Systemen ausführen kann.

Diese weitergehende Befugnis macht Berechtigungsdesign, Auditprotokolle, Prüfschleusen und Kostenkontrollen zu Bestandteilen der Einführung. Sie sind keine nachrangigen administrativen Details mehr.

Warum Google-News-Signale über Chatbots hinausweisen

Die Google-News-Meldung ist bedeutsam, weil OpenAIs Daten die steigende Token-Nachfrage mit der Verbreitung von Agents über das Software Engineering hinaus verknüpfen.

Codex begann als ein mit Programmierung verbundenes Produkt. Engineers waren die ersten Mitarbeitenden, die den Großteil ihrer OpenAI-Nutzung von ChatGPT auf den Agent verlagerten.

Der durchschnittliche OpenAI-Engineer überschritt diese Schwelle bis Dezember 2025. OpenAI zufolge erzeugt der durchschnittliche Engineer heute 99 % seiner Output-Tokens über Codex statt über ChatGPT.

Der aufschlussreichere Übergang fand andernorts statt. Recht, Finanzen und Recruiting wechselten etwa im April 2026 zu einer mehrheitlichen Codex-Nutzung, nachdem Engineers dieses Muster bereits etabliert hatten.

OpenAI berichtet, dass der durchschnittliche Jurist oder Recruiter inzwischen mehr als 85 % seiner Output-Tokens über Codex erzeugt. Das bedeutet nicht, dass diese Mitarbeitenden den Großteil ihres Tages programmieren.

Vielmehr ist Codex zu einer allgemeinen Ausführungsumgebung geworden. Nichttechnische Nutzer setzen es für Automatisierung, strukturierte Analysen, Datentransformation, Debugging und interne Tools ein.

OpenAIs Aufschlüsselung nach Berufsfeldern stützt diese Interpretation. Mehr als ein Viertel der von Mitarbeitenden in Geschäftsbereichen erzeugten Codex-Arbeit fiel in Engineering- oder Programmierkategorien.

In Finanzen und Business Operations machten Engineering oder Programmierung 31 % des klassifizierten Codex-Outputs aus. Wissensarbeit stand für 34 %, während Finanzanalyse 16 % ausmachte.

Bei Mitarbeitenden aus Produkt, Marketing und Operations entfiel auf Wissensarbeit 51 % des klassifizierten Outputs. Engineering oder Programmierung machten weitere 25 % aus.

Diese Kategorien legen nahe, dass Agents die praktische Hürde zwischen der Anforderung technischer Arbeit und dem direkten Versuch ihrer Umsetzung senken. Sie zeigen nicht, dass Fachspezialisten nicht mehr erforderlich sind.

Ein Recruiter könnte einen Agent bitten, Daten aus mehreren Quellen in einen internen Workflow zu überführen. Ein Finanzmitarbeiter könnte ihn Dateien abgleichen, eine wiederholbare Analyse erstellen oder ein kleines Tool testen lassen.

Der Mitarbeitende bleibt für Kontext, Urteilsvermögen, Autorisierung und Prüfung verantwortlich. Der Ausführungsweg kann jedoch Code enthalten, ohne ein herkömmliches Softwareprojekt zu erfordern.

Die Nutzung durch Nichtentwickler wuchs in allen drei von OpenAI untersuchten Populationen schnell. Von August 2025 bis Anfang Juni 2026 stieg die Zahl wöchentlicher Nichtentwickler-Nutzer bei Einzelnutzern um das 137-Fache.

OpenAI meldete bei Organisationsnutzern einen Anstieg um das 189-Fache und in der eigenen Belegschaft um das 12-Fache. Diese Faktoren starteten von unterschiedlichen Ausgangsniveaus und sollten daher nicht als gleichwertige Adoptionsniveaus verglichen werden.

Sie stützen dennoch dieselbe Richtungsfeststellung. Die Agentennutzung breitet sich über das technische Publikum hinaus aus, das Codex zuerst übernahm.

Das Muster passt auch zu OpenAIs umfassenderer Unternehmensberichterstattung. Seine Studie zur Unternehmensnutzung besagt, dass das ChatGPT-Nachrichtenvolumen um das Achtfache stieg, während der Verbrauch von Reasoning-Tokens je API-Organisation im Jahresvergleich um etwa das 320-Fache zunahm.

Diese frühere Studie umfasste mehr als Codex. Sie schloss aggregierte Nutzungsdaten aus OpenAIs Unternehmensprodukten und eine Umfrage unter 9.000 Beschäftigten in fast 100 Organisationen ein.

OpenAI berichtete zudem von mehr als einer Million Geschäftskunden und über sieben Millionen Workplace-Seats. Fast 200 Organisationen hatten jeweils mehr als eine Billion Tokens verarbeitet.

Zusammen beschreiben diese Zahlen zwei Adoptionskurven. Das menschorientierte Nachrichtenvolumen steigt, doch die Rechenleistung innerhalb integrierter und mehrstufiger Workflows wächst deutlich schneller.

Deshalb wird Chat zu einer unvollständigen Einheit für die Messung von Unternehmens-KI. Eine Nachricht kann eine lange Folge aus Inferenz, Abruf, Tool-Nutzung, Validierung und Überarbeitung auslösen.

Die Verschiebung setzt mehrere Gruppen zugleich unter Druck. Finanzteams müssen variablen Verbrauch prognostizieren. Sicherheitsteams müssen Systemzugriffe steuern. Manager müssen entscheiden, welche Arbeit fortgesetzte Kapazitäten verdient.

Auch Mitarbeitende stehen vor einer neuen Form operativer Verantwortung. Viele Agents auszuführen kann produktiv wirken, doch parallele Aktivität ist nicht dasselbe wie abgeschlossene, akzeptierte Arbeit.

Organisationen benötigen gemeinsame Nachweise darüber, was während eines Agentenlaufs geschehen ist. Eine durchsuchbare KI-Wissensdatenbank kann relevanten Kontext bewahren, ersetzt jedoch keine Berechtigungen oder formale Bewertung.

Die Chance ist real. Agents können Beschäftigten helfen, technische Grenzen zu überschreiten und Aufgaben abzuschließen, die zuvor in der Warteschlange eines anderen Teams feststeckten.

Die Managementherausforderung ist ebenso real. Unternehmen müssen erkennen, wo diese Autonomie wiederholbaren Wert schafft und wo sie lediglich Modellaufrufe vervielfacht.

Chat-Unterstützung und Agentenausführung folgen unterschiedlichen wirtschaftlichen Logiken

Agents verwandeln Unternehmens-KI von einem weitgehend nutzergesteuerten Dienst in eine variable Arbeitslast, deren Verbrauch vom Ausführungsverhalten abhängt.

Traditionelle Chats setzen der Aktivität eine natürliche Grenze. Eine Person stellt eine Frage, wartet auf eine Antwort, bewertet sie und entscheidet, ob sie fortfährt.

Die Ausführung durch Agents beseitigt einige dieser Pausen. Das System kann die nächste Aktion wählen, frühere Ergebnisse wieder in den Kontext einbringen und fortfahren, bis es eine Abbruchbedingung erreicht.

Jeder Zyklus kann Input-Tokens hinzufügen, wenn der Agent Anweisungen, Dateien, Tool-Antworten und seine angesammelte Historie erneut liest. Output-Tokens erfassen nur einen Teil dieser Gesamtarbeitslast.

Lange Aufgaben treffen zudem auf Verzweigungen. Ein Agent kann eine Implementierung versuchen, einen Fehler prüfen, seinen Plan überarbeiten und einen weiteren Test ausführen.

Diese Wiederholungen können produktiv sein, weil reale Arbeit selten einem perfekten ersten Plan folgt. Sie können aber auch Verschwendung verursachen, wenn dem Agent die Informationen, Berechtigungen oder Fähigkeiten fehlen, die er zum Abschluss benötigt.

Damit ist das günstigste Modell keine vollständige Antwort auf die Kostenkontrolle. Ein weniger leistungsfähiges Modell könnte pro Aufruf weniger Ressourcen verbrauchen, aber mehr Versuche und mehr menschliche Korrektur erfordern.

OpenAI vertritt dieses Argument in seiner Leitlinie zu KI-Investitionen. Das Unternehmen empfiehlt, erledigte Aufgaben, eingesparte Zeit, verbesserte Entscheidungen und skalierungsbereite Workflows zu messen.

Das Unternehmen erklärt, der Preis pro einer Million Tokens sei zwischen GPT-4 und GPT-5.4 um 97 % gesunken. Zudem habe GPT-5.6 bei einem Coding-Agent-Index 54 % weniger Output-Tokens verwendet und Aufgaben 57 % schneller abgeschlossen.

Dabei handelt es sich um von OpenAI berichtete Benchmark-Ergebnisse, nicht um eine Garantie für den Arbeitsaufwand jedes Kunden. Der jeweilige Kontext, die Tools, Bewertungskriterien und Fehlerkosten eines Unternehmens können das Ergebnis verändern.

Sinkende Stückkosten reduzieren nicht zwangsläufig die Gesamtausgaben. Die Nutzung kann schneller wachsen als sich die Effizienz verbessert, insbesondere wenn Agenten länger laufen und parallel arbeiten.

Diese Dynamik ähnelt eher Cloud Computing als herkömmlicher Softwarelizenzierung. Die Nachfrage hängt vom Laufzeitverhalten, dem Workload-Design, der Modellauswahl, der Kontextgröße und wiederholten Ausführungen ab.

Sie führt außerdem zu einem Messproblem. Eine hohe Tokenzahl kann auf wertvolle Automatisierung, eine schwierige Aufgabe, unnötigen Kontext, wiederholtes Scheitern oder einen Agenten hindeuten, der nicht effizient zum Abschluss kommt.

Unabhängige Forschung gibt Käufern Anlass, Verbrauch vorsichtig zu bewerten. Eine Studie aus dem Jahr 2026 zu Programmieraufgaben ergab, dass agentische Workloads deutlich mehr Tokens verbrauchten als Code-Chat oder Code-Reasoning.

Die Forschenden berichteten in ihrem experimentellen Umfeld von Verbrauchsunterschieden um das bis zu 1.000-Fache. Ausführungen derselben Aufgabe unterschieden sich um das bis zu 30-Fache.

Mehr Tokenverbrauch führte nicht durchgängig zu höherer Genauigkeit. Die Leistung erreichte häufig bei einem mittleren Niveau ihren Höhepunkt und flachte dann mit steigendem Verbrauch ab.

Die Studie ergab außerdem, dass Modelle ihren eigenen Tokenbedarf nur schwer vorhersagen konnten. Die berichteten Korrelationen erreichten lediglich 0,39, und die Schätzungen unterschätzten den tatsächlichen Verbrauch systematisch.

Diese Ergebnisse stammen aus einer bestimmten Gruppe von Programmieraufgaben und Modellen. Sie sollten nicht zu einem universellen Multiplikator für jeden Unternehmensagenten verallgemeinert werden.

Sie zeigen jedoch, warum ein simples Budget pro Prompt unzuverlässig wird. Dieselbe Anfrage kann wesentlich unterschiedliche Ausführungspfade und Ressourcenanforderungen erzeugen.

Die Reaktion der Unternehmen ist bereits sichtbar. OpenAI ergänzte im Juni 2026 seine Global Admin Console um eine konsolidierte Ansicht des Credit-Verbrauchs von ChatGPT und Codex.

Administratoren können die Nutzung nach Nutzer, Produkt und Modell prüfen. Außerdem können sie über die spend control tools des Unternehmens Workspace-Standards, Gruppenlimits und individuelle Ausnahmen festlegen.

Databricks führte ähnliche Kontrollen in seinem Unity AI Gateway ein. Das System kann Limits durchsetzen, außer Kontrolle geratenen Verbrauch erkennen und für geeignete Aufgaben kostengünstigere Modelle empfehlen.

Diese entstehende Kontrollebene zeigt, wohin sich der Markt entwickelt. Der reine Modellzugang reicht für den Einsatz in Unternehmen zunehmend nicht mehr aus.

Organisationen benötigen Zuordnung, Richtlinien, Evaluierung und Eingriffsmöglichkeiten rund um diesen Zugang. Sie müssen Verbrauch mit einem verantwortlichen Team und einem definierten Geschäftsprozess verknüpfen.

Die stärkste Maßeinheit ist daher nicht das Token. Es ist das abgeschlossene Ergebnis unter vereinbarten Anforderungen an Qualität, Risiko und Prüfung.

Für einen Programmieragenten könnte das eine akzeptierte Änderung sein, die Tests und eine Sicherheitsprüfung besteht. Im Finanzbereich könnte es ein abgestimmter Bericht mit nachvollziehbaren Eingaben sein.

Im Recruiting könnte es ein Workflow sein, der administrativen Aufwand verringert, ohne unbefugte Entscheidungen über Bewerbende zu treffen. Jedes Ergebnis erfordert andere Nachweise.

Dieses Wirtschaftsmodell begünstigt Workflows, die sich häufig wiederholen und klar bewerten lassen. Es benachteiligt vage Aufgaben, deren Erfolg von subjektiven Eindrücken abhängt.

Der Wandel zu Agenten macht die Tokenmessung nicht nutzlos. Er macht Tokenzahlen zu einem operativen Signal unter mehreren, statt zu einem Ersatzmaß für Geschäftswert.

Was die Tokenzahlen nicht beweisen

Die beeindruckenden internen Nutzungszahlen von OpenAI zeigen Nachfrage und Intensität, lassen Produktivität, Qualität und Sicherheitsergebnisse jedoch offen.

Die erste Einschränkung ist die Auswahl. OpenAI entwickelt Codex, beschäftigt Menschen, die mit experimenteller KI vertraut sind, und kann ihnen ungewöhnlich direkten Produktsupport bieten.

Die Belegschaft ist keine repräsentative Stichprobe von Banken, Krankenhäusern, Behörden, Herstellern oder kleinen Unternehmen. Diese Organisationen arbeiten unter anderen technischen und regulatorischen Rahmenbedingungen.

OpenAI profitiert auch davon, wenn Kunden höhere Nutzung als Beleg für tiefere Akzeptanz interpretieren. Die Daten verdienen Aufmerksamkeit, doch Leser sollten zwischen gemessenem Verhalten und der weitergehenden Prognose des Unternehmens unterscheiden.

Die zweite Einschränkung betrifft Tokens als Erfolgskennzahl. Das Ausgabevolumen zeigt, dass Modelle Text oder Code erzeugt haben. Es zeigt nicht, wie viel davon Nutzer tatsächlich übernommen haben.

Ein Agent kann einen großen Patch erzeugen, den ein Entwickler ablehnt. Er kann eine Analyse generieren, die ein Mitarbeiter umschreibt, oder eine Automatisierung erstellen, die nie in Produktion geht.

Für OpenAIs Schätzungen langfristiger Aufgaben gilt eine ähnliche Einschränkung. Eine Aufgabe, die als acht Stunden menschlicher Arbeit klassifiziert wird, spart nicht automatisch acht Stunden.

Der Nutzer könnte weiterhin Zeit für die Vorbereitung von Eingaben, die Überwachung des Laufs, die Prüfung von Quellen, die Behebung von Fehlern und die Integration des Ergebnisses aufwenden. Manche Arbeit wäre ohne den Agenten möglicherweise gar nicht entstanden.

Diese zusätzliche Ausgabe kann dennoch wertvoll sein. Vermeidbare Arbeit ist jedoch nur ein möglicher Nutzen und erfordert direkte Messung.

Die dritte Einschränkung ist die Zuverlässigkeit. Längere Aufgaben schaffen mehr Gelegenheiten für Fehler, veraltete Annahmen, falsche Werkzeugauswahl oder frühe Fehler, die spätere Schritte beeinflussen.

Agenten mit Zugriff auf Unternehmenssysteme schaffen außerdem eine größere Sicherheitsgrenze. Eine fehlerhafte Antwort ist schädlich, eine unbefugte Aktion kann jedoch deutlich schwerer rückgängig zu machen sein.

Berechtigungen sollten daher zur Aufgabe passen, nicht zur maximalen Fähigkeit des Agenten. Lesezugriff, Schreibzugriff, externe Kommunikation und irreversible Aktionen verdienen getrennte Kontrollen.

Sicherheitsteams benötigen zudem Aufzeichnungen, die eine menschliche Anfrage mit jeder Tool-Aktion verbinden. Ohne diese Kette werden Incident Response und Verantwortlichkeit schwierig.

Kostenüberwachung kann einen weiteren Spannungsbereich schaffen. Unternehmen benötigen ausreichend Transparenz, um Verschwendung und kompromittierte Zugangsdaten zu erkennen, doch detaillierte Mitarbeiterüberwachung kann Vertrauen schwächen.

Ein Administrator muss möglicherweise wissen, dass ein Workflow wiederholt ein teures Modell aufruft. Er benötigt nicht zwangsläufig uneingeschränkten Zugang zu sensiblen Inhalten.

Gute Governance trennt operative Metadaten nach Möglichkeit von Geschäftsinhalten. Sie definiert außerdem, wer welche Ebene unter welchen Umständen prüfen darf.

Die vierte Einschränkung betrifft die Verallgemeinerung über das Programmieren hinaus. Codex kann Nichtentwickler unterstützen, doch OpenAIs Daten zeigen weiterhin Programmierung und Engineering als zentrale Kategorien.

Strukturierte technische Arbeit bietet relativ klare Validierung. Tests können ausgeführt, Dateien verglichen und Fehler zu einem weiteren Versuch führen.

Rechtsanalyse, Recruiting-Unterstützung, Strategie und Finanzinterpretation enthalten häufig subjektivere Anforderungen. Fehler können länger bestehen bleiben, weil automatisierte Validierung schwächer ist.

Dieser Unterschied macht die Bewertung von Ergebnissen wichtiger, wenn Agenten in Geschäftsfunktionen vordringen. Unternehmen sollten nicht annehmen, dass Akzeptanzgeschwindigkeit gleichbedeutend mit Einsatzreife ist.

Die öffentliche Stimmung hat sich bereits in Richtung dieser Unterscheidung verschoben. Eine im Juli veröffentlichte AI spending analysis beschrieb wachsenden Widerstand gegen „tokenmaxxing“, die Praxis, hohen Verbrauch als Erfolg zu behandeln.

Der Moody's-Analyst Vincent Gusdorf warnte, KI könne es leicht machen, Arbeit zu erzeugen, die eine Organisation nicht benötige. Diese Kritik trifft direkt die Schwäche tokenbasierter Statussignale.

Hoher Verbrauch kann rational sein, wenn ein Agent ein wertvolles Ergebnis liefert. Er lässt sich schwerer rechtfertigen, wenn kein Verantwortlicher die Aktivität mit einem akzeptierten Ergebnis verbinden kann.

Die angemessen skeptische Position ist nicht, dass Agenten lediglich verschwenderische Chatbots sind. OpenAIs Akzeptanzdaten sind zu umfangreich, um sie auf diese Weise abzutun.

Die besser vertretbare Schlussfolgerung ist enger gefasst. Agenten erweitern Menge und Umfang der Arbeit, die KI versuchen kann, während die Belege für realisierten Unternehmenswert uneinheitlich bleiben.

Ein Unternehmen sollte OpenAIs These daher in seiner eigenen Umgebung testen. Dafür braucht es Ausgangswerte, Evaluierungssätze, Prüfkosten, Fehlerraten und messbare Ergebnisse.

Es sollte einen Agenten-Workflow auch mit realistischen Alternativen vergleichen. Dazu gehören menschliche Ausführung, herkömmliche Software, eine kürzere Chat-Interaktion und ein kleineres Modell.

Erst dann können Führungskräfte erkennen, ob steigender Tokenverbrauch Hebelwirkung oder Reibung bedeutet. OpenAIs interne Kennzahlen können diese Frage nicht für sie beantworten.

Drei Signale, auf die Unternehmenskäufer als Nächstes achten sollten

Die nächste Phase wird durch Ergebnisberichte, Bindung nichttechnischer Nutzer und Sicherheitskontrollen entschieden – nicht durch einen weiteren Rekord bei der Tokenzahl.

Das erste Signal ist, ob Anbieter den Verbrauch von Agenten mit abgeschlossenen Geschäftsergebnissen verknüpfen. Nutzungs-Dashboards betonen derzeit Credits, Nutzer, Modelle und Trends.

Diese Ansichten helfen Administratoren, unerwartete Nachfrage zu erkennen. Sie zeigen jedoch weiterhin nicht, ob ein Workflow ein akzeptiertes Ergebnis hervorgebracht hat.

Käufer sollten nach Berichten suchen, die mit genehmigten Codeänderungen, gelösten Supportfällen, abgeschlossenen Analysen oder anderen domänenspezifischen Ergebnissen verknüpft sind. Kosten pro akzeptiertem Ergebnis würden Vergleiche aussagekräftiger machen.

Wenn Anbieter glaubwürdige Ergebniszuordnung liefern, wird OpenAIs Argument stärker. Unternehmen könnten Workflows mit hohem Verbrauch finanzieren, wenn der daraus entstehende Wert sichtbar ist.

Bleibt das Reporting auf Tokens und geschätzte Zeit fokussiert, wird die Skepsis wachsen. Organisationen werden Schwierigkeiten haben, intensive produktive Arbeit von intensiver fehlgeschlagener Arbeit zu unterscheiden.

Das zweite Signal ist die nachhaltige Codex-Nutzung außerhalb des Engineerings. OpenAI berichtet von auffälligem Wachstum bei Mitarbeitenden in Recht, Finanzen, Recruiting, Marketing und Operations.

Die nächste Frage lautet, ob diese Nutzer nach den ersten Experimenten dabeibleiben. Bindung ist wichtiger als ein schneller Anstieg von einer kleinen Ausgangsbasis.

Unternehmen sollten beobachten, welche nichttechnischen Aufgaben zu wiederholbaren Workflows werden. Sie sollten auch verfolgen, wie oft Fachleute von Agenten erzeugte Arbeit retten oder neu erstellen müssen.

Anhaltende Nutzung bei stabiler Qualität würde OpenAIs Behauptung stützen, dass Agenten Mitarbeitenden das Überschreiten funktionaler Grenzen ermöglichen. Sinkende Bindung würde darauf hindeuten, dass der stärkste Wert weiterhin in technischen Teams konzentriert bleibt.

Das dritte Signal ist die Reife der Kontrollen rund um Agentenaktionen. Ausgabenlimits kommen schnell, doch Kosten stellen nur einen Teil des operativen Risikos dar.

Organisationen benötigen zudem Berechtigungen auf Aufgabenebene, Genehmigungspunkte, auditierbare Tool-Aufrufe, isolierte Zugangsdaten und eine zuverlässige Beendigung, wenn Verhalten definierte Grenzen verlässt.

Diese Schutzmaßnahmen müssen über mehrere Modelle und Tools hinweg funktionieren. Unternehmen standardisieren selten jeden Workflow dauerhaft auf einen einzigen Anbieter.

Fortschritte in diesem Bereich würden eine breitere Delegation leichter rechtfertigen, insbesondere in regulierten Branchen. Schwache oder fragmentierte Kontrollen würden die Akzeptanz unabhängig von den Modellfähigkeiten verlangsamen.

Diese drei Signale hängen zusammen. Ergebnisberichte erklären, warum ein Agent Ressourcen verdient. Bindung zeigt, ob Mitarbeitende ihn nach dem Abklingen der Neuheit nützlich finden.

Sicherheit und Governance bestimmen, ob die Organisation diesem Agenten erlauben kann, folgenreiche Arbeit auszuführen. Fehlt eines der drei Elemente, kann dies einen erfolgreichen Einsatz verhindern.

Die Google-News-Schlagzeile erfasst einen echten Wandel vom Chat zu Agenten, doch der Tokenanteil ist erst der Anfang der Geschichte. Er ist nicht das Endergebnis.

OpenAI hat gezeigt, dass seine Mitarbeitenden zunehmend lange und komplexe Aufgaben an Codex delegieren. Es hat nicht gezeigt, dass 99,8 % der Output-Tokens einen gleichwertigen Anteil am organisatorischen Wert liefern.

Unternehmenskäufer sollten vor dem Feiern oder Einschränken dieses Verbrauchs eine praktische Frage stellen: Welche abgeschlossenen Ergebnisse wurden möglich, und welche Belege zeigen, dass sie das Risiko wert waren?

Diese Frage bietet einen besseren Leitfaden als das Tokenvolumen allein. Sie ermöglicht Organisationen, funktionierende Workflows auszubauen, abdriftende einzugrenzen und die Akzeptanz von Agenten nach Ergebnissen statt Aktivität zu beurteilen.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page