Die Selbstverbesserung von Anthropic Claude beschleunigt sich, doch Menschen bestimmen weiterhin das Ziel
Anthropic zufolge übernimmt Claude inzwischen bei 26 % seiner Modellforschung und -entwicklung die Führung, obwohl es im Februar 2026 keinen Anteil an dieser Arbeit geleitet hatte. Dieser steile Anstieg macht die Selbstverbesserung von Anthropic Claude zu mehr als einem provokanten Schlagwort. Das Unternehmen sagt, sein Modell könne umfangreiche Aufgaben anhand übergeordneter Prompts erledigen, werde dabei jedoch weiterhin von Menschen beaufsichtigt.
Die Offenlegung verlagert einen bekannten Trend aus der Softwareentwicklung in ein folgenreicheres Feld. Claude unterstützt Ingenieurinnen und Ingenieure nicht mehr nur beim Aufbau von Anwendungen. Zunehmend schreibt es Infrastruktur, führt Experimente durch, analysiert Ergebnisse und prüft Änderungen, die zur Entwicklung künftiger Claude-Modelle eingesetzt werden.
Anthropic bezeichnet dies als Fortschritt in Richtung rekursiver Selbstverbesserung, bei der ein KI-System zum Aufbau eines leistungsfähigeren Nachfolgers beiträgt. Die vorgelegten Belege zeigen jedoch auch die weiterhin bestehende Hürde. Claude führt klar definierte Arbeiten schnell aus, während Menschen nach wie vor entscheiden, welche Probleme wichtig sind und ob Ergebnisse vertrauenswürdig sind.
Diese Unterscheidung positioniert Anthropics Behauptung zwischen zwei konkurrierenden Deutungen. Die eine beschreibt einen sich verstärkenden Entwicklungszyklus, der sich mit jeder Modellgeneration beschleunigt. Die andere beschreibt fortschrittliche Automatisierung innerhalb einer Forschungsagenda, die weiterhin von Menschen kontrolliert wird.
Die Selbstverbesserung von Anthropic Claude erreicht nun die Modellforschung und -entwicklung
Die entscheidende Veränderung besteht nicht darin, dass Claude Code schreibt. Sie besteht darin, dass Claude inzwischen wesentliche Teile der Arbeit hinter seinem Nachfolger leitet.
Anthropic veröffentlichte die Zahl von 26 % am 17. September 2026. Das Unternehmen definiert „Leitung“ als die Erledigung des Großteils einer Aufgabe anhand eines übergeordneten Prompts bei gleichzeitiger menschlicher Aufsicht. Im Februar hatte Claude laut Unternehmen keinen Anteil der gemessenen Forschungs- und Entwicklungsarbeit geleitet.
Bis August war dieser Anteil auf ungefähr ein Viertel gestiegen. Anthropic sagt zudem, dass inzwischen rund 90 % seiner Modellforschung und -entwicklung eine Zusammenarbeit mit Claude beinhalten. In dieser weiter gefassten Kategorie erledigt das Modell große Teile der Arbeit unter enger menschlicher Anleitung.
Die beiden Zahlen messen unterschiedliche Grade der Delegation. Die 90-%-Zahl umfasst Arbeiten, bei denen eine Person eng eingebunden bleibt. Die 26-%-Zahl bezieht sich auf Aufgaben, bei denen Claude nach Erhalt des Ziels mehr Verantwortung für die Ausführung übernimmt.
Die Unterscheidung ist wichtig, denn keine der beiden Zahlen bedeutet, dass Claude unabhängig agiert. Das Modell wählt weder die Unternehmensziele von Anthropic, noch genehmigt es seinen eigenen Einsatz oder kontrolliert den gesamten Trainingsprozess. Menschliche Forschende formulieren weiterhin Probleme, verteilen Ressourcen, prüfen Ergebnisse und autorisieren folgenschwere Entscheidungen.
Dennoch vollzog sich die berichtete Veränderung ungewöhnlich schnell. Die erste Offenlegung besagt, dass Claude seinen Führungsanteil innerhalb von sechs Monaten von null auf 26 % steigerte. Diese Entwicklung, nicht allein der aktuelle Prozentsatz, erklärt die Aufmerksamkeit.
Anthropic unterteilt die Entwicklung von Frontier-Modellen in Engineering und Forschung. Engineering umfasst das Schreiben von Software, die Wartung von Infrastruktur und die Überwachung von Trainingssystemen. Forschung umfasst die Auswahl von Experimenten, die Interpretation von Ergebnissen und die Entscheidung, welche Ideen weiter getestet werden sollten.
Claude ist inzwischen in beiden Kategorien tief eingebunden. Bei Engineering-Aufgaben geben Menschen Anthropic zufolge zunehmend Ziele vor, ohne jeden Implementierungsschritt festzulegen. Bei Forschungsaufgaben kann Claude klar definierte Experimente ausführen und nachfolgende Schritte empfehlen.
Ein konkreter Vorfall veranschaulicht den Unterschied zwischen gewöhnlicher Code-Vervollständigung und delegiertem Engineering. Ein routinemäßiges Upgrade hatte dazu geführt, dass Zehntausende Trainingsjobs abstürzten. Ein Ingenieur versorgte Claude mit Kontext und Zugriff auf den betroffenen Cluster.
Claude testete Umgebungseinstellungen, isolierte ein schwer auffindbares Debugging-Flag, reproduzierte den Fehler und bestätigte eine Lösung. Anthropic zufolge dauerte die Untersuchung etwa zwei Stunden. Das Unternehmen schätzt, dass ein menschlicher Ingenieur gewöhnlich zwei oder drei Tage benötigen würde.
Dies ist keine autonome Modellerstellung. Dennoch ist es bedeutsam, weil die Trainingsinfrastruktur direkt beeinflusst, wie schnell ein Labor Modelle testen und verbessern kann. Wenn sich Tage der Fehlersuche auf Stunden verkürzen, erhalten Forschende mehr Möglichkeiten, Experimente durchzuführen und Fehler zu beheben.
Der Forschungsbericht des Unternehmens beschreibt deshalb eine enger werdende menschliche Rolle, nicht ihr Verschwinden. Claude übernimmt zunehmend Implementierung und Experimente. Menschen behalten die Autorität über Richtung, Bewertung und Freigabeentscheidungen.
Diese Grenze definiert die zentrale Spannung. Anthropic hat Belege für eine rasche Automatisierung innerhalb der KI-Entwicklung vorgelegt und zugleich das menschliche Urteilsvermögen dokumentiert, das verhindert, dass der Prozess selbstgesteuert wird.
Die Zahlen zum Programmieren zeigen, warum Anthropic Alarm schlägt
Claudes Beitrag wird folgenreicher, wenn Codegenerierung, Überprüfung und Experimente beginnen, einander zu verstärken.
Stand Mai 2026 stammt Anthropic zufolge mehr als 80 % des in seine Codebasis übernommenen Codes von Claude. Bevor Claude Code im Februar 2025 in die Research Preview ging, lag dieser Anteil im niedrigen einstelligen Prozentbereich.
Das Unternehmen berichtet zudem von einem starken Anstieg der Engineering-Leistung. Im zweiten Quartal 2026 integrierte der typische Ingenieur täglich achtmal so viel Code wie 2024. Anthropic führt einen großen Teil dieses Anstiegs darauf zurück, dass Ingenieurinnen und Ingenieure Claude anleiten und überprüfen, statt jede Änderung selbst einzutippen.
Codezeilen sind ein unvollkommener Produktivitätsmaßstab. Mehr Code kann Wartungskosten verursachen, bestehende Funktionen duplizieren oder schlechtes Design verbergen. Anthropic räumt ausdrücklich ein, dass der achtfache Anstieg die tatsächliche Produktivitätsverbesserung fast sicher überzeichnet.
Das Ausgabevolumen ist jedoch nur ein Teil der Argumentation. Anthropic zufolge sind die Eingriffsquoten über Claude-Code-Sitzungen hinweg gesunken. Ingenieurinnen und Ingenieure korrigieren, lenken um oder übernehmen vom Modell Berichten zufolge seltener als noch ein Jahr zuvor.
Bei den offensten Engineering-Aufgaben von Anthropic erreichte Claudes berichtete Erfolgsquote im Mai 2026 76 %. Das entsprach einem Anstieg um 50 Prozentpunkte innerhalb von sechs Monaten. Ein Claude-basierter Evaluator beurteilte, ob Sitzungen ihre zugewiesenen Aufgaben ohne Korrekturen abgeschlossen hatten.
Diese Methodik verdient Vorsicht. Wenn ein internes Modell ein anderes Modell bewertet, bietet das nicht dieselbe Absicherung wie eine unabhängige Evaluation. Auch die Zusammensetzung der Aufgaben kann sich im Zeitverlauf ändern und Vergleiche zwischen monatlichen Erfolgsquoten erschweren.
Anthropic berichtet dennoch, dass von Claude geschriebener Code innerhalb des Unternehmens im Jahr 2026 qualitativ an von Menschen geschriebenen Code heranreichte. Die Einschätzungen der Mitarbeitenden waren nicht einhellig. Das Unternehmen sagt, viele Beschäftigte hätten Claudes Code Ende 2025 als schlechter eingestuft, ihn bis Mitte 2026 jedoch als ungefähr vergleichbar angesehen.
Automatisierte Überprüfung fügt dem Kreislauf eine weitere Ebene hinzu. Anthropic nutzt Claude nun, um vorgeschlagene Codeänderungen auf Fehler und Sicherheitslücken zu prüfen. Eine rückblickende Unternehmensanalyse ergab, dass solche Prüfungen etwa ein Drittel der Fehler hinter früheren Produktionsvorfällen erkannt hätten.
Dadurch entsteht ein Entwicklungszyklus mit KI auf beiden Seiten. Eine Claude-Sitzung schreibt oder verändert Code. Eine weitere überprüft die vorgeschlagene Änderung. Menschen untersuchen das Ergebnis, entscheiden, ob es in die Produktion gehört, und analysieren Fälle, in denen automatisierte Prüfungen widersprüchliche Ergebnisse liefern.
Das Muster reicht über das Programmieren hinaus. Anthropic testete Modelle anhand einer Optimierungsaufgabe mit Code, der ein kleines KI-System trainiert. Das Ziel bestand darin, die Geschwindigkeit zu verbessern, ohne vorab festgelegte Korrektheitsprüfungen nicht zu bestehen.
Claude Opus 4 erzielte Anthropic zufolge im Mai 2025 eine durchschnittliche dreifache Beschleunigung. Ein internes Modell namens Mythos Preview erreichte bis April 2026 ungefähr eine 52-fache Beschleunigung. Das Unternehmen sagt, ein qualifizierter menschlicher Forscher benötige gewöhnlich vier bis acht Stunden, um eine vierfache Verbesserung zu erzielen.
Diese Zahlen zeigen, warum Anthropic den Trend als Beschleunigung und nicht als bloße Automatisierung darstellt. Schnellere Umsetzung ermöglicht mehr Experimente. Mehr Experimente liefern zusätzliche Erkenntnisse, die die Gestaltung späterer Modelle und Werkzeuge leiten können.
Die eigenen Daten des Unternehmens bleiben die wichtigste Quelle für diese Behauptungen. Kein externer Prüfer hat seine internen Aufgabenkennzeichnungen, Erfolgsbewertungen oder Produktivitätsberechnungen reproduziert. Leserinnen und Leser sollten den berichteten Trend als aussagekräftigen Beleg behandeln, nicht als unabhängig belegtes Gesetz des Fortschritts.
Selbst mit dieser Einschränkung lässt sich die Richtung schwer abtun. Claude wechselte vom Vorschlagen von Code-Snippets zum Bearbeiten von Repositories, Bedienen von Werkzeugen, Debuggen laufender Systeme und Durchführen experimenteller Schleifen. Jeder Schritt verlagert einen weiteren Teil der KI-Entwicklung von manueller Ausführung zu beaufsichtigter Delegation.
Der eigentliche Engpass verlagert sich von der Ausführung zum Urteilsvermögen
Claude senkt die Kosten der Forschungsarbeit, hat jedoch nicht die Notwendigkeit beseitigt zu entscheiden, welche Forschung stattfinden sollte.
Anthropics stärkste Belege betreffen die Ausführung. Wenn Claude ein messbares Ziel, Zugriff auf relevante Werkzeuge und eine Möglichkeit zum Testen der Ergebnisse erhält, kann das Modell viele mögliche Lösungen erkunden. Dadurch wird die Umsetzung von Forschung zu einem schnelleren iterativen Prozess.
Das schwierigere Problem ist die Festlegung der Richtung. Forschende müssen Fragen auswählen, die Fähigkeiten voranbringen, Sicherheit verbessern oder wichtige Unsicherheiten klären. Sie müssen zudem irreführende Benchmarks, verunreinigte Evaluierungen und Lösungen erkennen, die nur unter engen Bedingungen funktionieren.
Anthropic beschreibt Forschungsinstinkt als einen fortbestehenden menschlichen Vorteil. Dazu gehören die Auswahl wertvoller Probleme, die Entscheidung, welche Belege glaubwürdig sind, und das Aufgeben von Ansätzen, die in einer Sackgasse gelandet sind. Diese Entscheidungen prägen den gesamten Entwicklungsprozess.
Das Unternehmen hat getestet, ob Claude bei realistischen Untersuchungen bessere nächste Schritte empfehlen kann. Forschende wählten 129 Zeitpunkte aus, an denen ein Mensch bei früheren Arbeiten einen unproduktiven Umweg eingeschlagen hatte. Verschiedene Claude-Modelle schlugen anschließend vor, was als Nächstes geschehen sollte.
Ein separates Claude-Modell verglich diese Empfehlungen mit dem späteren Ergebnis. Anthropics Opus 4.5 übertraf Berichten zufolge im November 2025 in 51 % der Fälle die ursprüngliche menschliche Wahl. Mythos Preview erreichte im April 2026 64 %.
Das Ergebnis deutet auf ein sich verbesserndes taktisches Urteilsvermögen hin, belegt jedoch keine unabhängige Forschungsführung. Anthropic wählte bewusst Zeitpunkte aus, an denen die ursprüngliche menschliche Entscheidung Raum für Verbesserung bot. Ein Modell mit Zugriff auf die abgeschlossene Sitzung fungierte zudem als Evaluator.
Das Experiment misst daher, ob Claude ausgewählte Entscheidungspunkte bewältigen kann. Es zeigt nicht, dass Claude ein Forschungsprogramm definieren, dessen weiterreichende Folgen erkennen oder entscheiden kann, wann ein neues Modell eingesetzt werden sollte.
Ein separates Projekt testete umfassendere Autonomie in der KI-Sicherheitsforschung. Mehrere Claude-Agenten untersuchten, ob ein schwächeres Modell ein stärkeres beaufsichtigen könnte. Sie entwickelten Hypothesen, führten Experimente durch, teilten Erkenntnisse und passten ihren Ansatz an.
Anthropic zufolge schlossen zwei menschliche Forschende innerhalb von ungefähr einer Woche etwa 23 % der Lücke zwischen schwacher und starker Beaufsichtigung. Die Agenten schlossen 97 % der Lücke durch 800 kumulierte Arbeitsstunden und erhebliche Rechenressourcen.
Das Unternehmen identifizierte jedoch wichtige Einschränkungen. Menschen wählten die Fragestellung und entwarfen das Bewertungssystem. Das Ergebnis ließ sich nicht sauber auf Modelle im Produktionsmaßstab übertragen. Diese Vorbehalte trennen eine beeindruckende experimentelle Schleife von autonomer wissenschaftlicher Entdeckung.
Dasselbe Muster zeigt sich bei der alltäglichen Nutzung von Claude Code. Anthropics Nutzungsanalyse ergab, dass Nutzer in einer typischen Sitzung etwa 70 % der Planungsentscheidungen treffen. Claude trifft etwa 80 % der Ausführungsentscheidungen.
Diese Aufteilung beschreibt die Realität klarer als „KI baut sich selbst“. Menschen entscheiden im Allgemeinen, was geschehen soll. Claude entscheidet zunehmend, wie die Anweisung umgesetzt wird – teils über lange Ketten aus Datei-Lektüre, Code-Änderungen, Tests und Befehlsausführung.
Fachwissen bleibt wichtig, weil jemand ein plausibles, aber falsches Ergebnis erkennen muss. Ein Buchhalter kann ein Abstimmungsskript anleiten, indem er Rechnungslegungsregeln versteht. Ein Infrastrukturingenieur kann beurteilen, ob ein vorgeschlagener Fix ein unvertretbares Betriebsrisiko schafft.
Je günstiger die Ausführung wird, desto wertvoller wird Urteilsvermögen. Forschende können mehr Experimente beaufsichtigen, stehen jedoch auch vor mehr Ergebnissen, die bewertet werden müssen. Der Engpass verschiebt sich, statt zu verschwinden.
Dieser Wandel beeinflusst, wie technische Teams ihre Arbeit organisieren. Das Schreiben von Code wird zu einem kleineren Teil der Aufgabe. Spezifikation, Review, Systemdesign, Verifizierung und Verantwortlichkeit nehmen einen größeren Anteil ein.
Auch Anthropics eigene Einstellungsbewertungen sind auf diesen Übergang gestoßen. Das Unternehmen erklärt, dass Performance-Ingenieure weiterhin schwierige Debugging- und Designentscheidungen treffen, selbst wenn Claude herkömmliche Coding-Tests löst. Seine Ergebnisse aus Bewertungen zeigen, dass repräsentative Assessments schwieriger werden, wenn KI die mechanischen Teile erledigen kann.
Die praktische Herausforderung besteht darin, Fachwissen zu bewahren, wenn Menschen weniger direkte Implementierung leisten. Reviewer benötigen genug Verständnis, um versteckte Fehler aufzudecken. Doch ständiges Delegieren kann die praktische Erfahrung verringern, aus der dieses Verständnis entsteht.
Das ist die ungelöste menschliche Seite von Anthropics Claude-Selbstverbesserung. Ein schnelleres Modell kann den Umfang dessen erweitern, was einzelne Forschende beaufsichtigen. Es kann Forschungssysteme aber auch für jede einzelne Person schwerer vollständig verständlich machen.
Anthropics Behauptung setzt jedes Frontier-KI-Labor unter Druck
Wenn Anthropics Messungen in der Tendenz korrekt sind, müssen konkurrierende Labore sowohl bei der Beschleunigung als auch bei der Transparenz darum herum mithalten.
OpenAI, Google DeepMind, Meta und andere Frontier-Entwickler nutzen intern KI-Coding-Tools. Ihre genauen Methoden und Delegationsstufen unterscheiden sich, doch alle stehen vor demselben Wettbewerbsanreiz. Ein Labor, das mehr nützliche Experimente durchführt, kann Modelle schneller verbessern.
Claudes berichteter Beitrag verschafft Anthropic einen potenziellen Feedback-Vorteil. Bessere Modelle übernehmen mehr Engineering-Arbeit. Diese Arbeit verbessert Infrastruktur und Experimentierung, was bei der Entwicklung des nächsten Modells hilft.
Der Prozess muss nicht vollständig autonom sein, um wettbewerblich relevant zu sein. Menschliche Forschende können weiterhin Ziele wählen, während KI ihre Umsetzungskapazität vervielfacht. Anthropic bezeichnet dies als sich verstärkende Beschleunigung, auch ohne vollständig geschlossenen Selbstverbesserungskreislauf.
Diese Dynamik setzt Wettbewerber unter Druck, Agenten aggressiver einzusetzen. Auf perfekte Zuverlässigkeit zu warten, verursacht Opportunitätskosten, wenn ein anderes Unternehmen mehr Ideen testen, Infrastruktur schneller reparieren und die Zeit zwischen Modellgenerationen verkürzen kann.
Der daraus entstehende Wettlauf schafft ein Governance-Problem. Jedes Labor kontrolliert die internen Belege dafür, wie stark die Modellentwicklung automatisiert wurde. Außenstehende können „Zusammenarbeit“, „Führung“, Aufgabenerfolg, Codequalität oder Forscherproduktivität zwischen Unternehmen nicht ohne Weiteres vergleichen.
Anthropic hat andere Entwickler dazu aufgefordert, vergleichbare Messungen zu veröffentlichen. Das Unternehmen argumentiert, gemeinsame Methoden würden der Öffentlichkeit helfen zu verstehen, wie nahe Labore einer rekursiven Selbstverbesserung kommen. Regelmäßige Berichte könnten zudem zeigen, ob die derzeitigen Wachstumskurven weiterlaufen oder abflachen.
Die berichtete Ankündigung erfolgte, während Führungskräfte von Anthropic zugleich eine langsamere Frontier-Entwicklung forderten. Diese Kombination erzeugt einen unvermeidbaren Widerspruch.
Anthropic beschleunigt seine eigene Forschung mit Claude und warnt zugleich, dass die Beschleunigung schwer kontrollierbar werden könnte. Wettbewerbsdruck hilft zu erklären, weshalb das Unternehmen die Technologie nicht einfach nicht mehr nutzt.
Einseitige Zurückhaltung könnte ein vorsichtiges Labor zurückwerfen, ohne das gesamte Feld zu verlangsamen. Koordinierte Standards könnten diesen Nachteil verringern, erfordern jedoch Einigkeit zwischen Unternehmen und Regierungen mit unterschiedlichen wirtschaftlichen und strategischen Interessen.
Die Offenlegung erfüllt daher mehrere Zwecke. Sie informiert die Öffentlichkeit, stärkt Anthropics Sicherheitsargument und bewirbt die Fähigkeiten von Claude. Diese Ziele können nebeneinander bestehen, doch Leser sollten jedes davon erkennen.
Wettbewerber haben zudem Gründe, Anthropics Einordnung infrage zu stellen. Ein hoher Anteil KI-verfassten Codes misst Modellintelligenz nicht unmittelbar. Codevolumen sagt wenig darüber aus, ob Claude eine wertvolle Forschungsidee entwickelt oder lediglich eine detaillierte Spezifikation umgesetzt hat.
Verschiedene Labore könnten Arbeit unterschiedlich kategorisieren. Ein Unternehmen könnte eine von einem Agenten geleitete Debugging-Sitzung als Forschungsführung bezeichnen. Ein anderes könnte dieselbe Aufgabe als Engineering-Tool eines menschlichen Forschers zählen.
Ein gemeinsamer Messstandard müsste Planung, Ausführung, Verifizierung und Autorisierung trennen. Er müsste zudem unabhängige Audits vorsehen. Ohne solche Kontrollen könnten Unternehmen beeindruckende Prozentwerte veröffentlichen, die dennoch nicht vergleichbar bleiben.
Der breitere Druck reicht über Modelllabore hinaus. Führungskräfte im Enterprise Engineering werden fragen, ob Anthropics interner Workflow auf sie übertragbar ist. Viele werden ähnliche Systeme verfolgen, die Coding-Agenten mit Repositories, Tests, Deployment-Tools und Betriebsdaten verbinden.
Die Antwort hängt von der Qualität der Verifizierung ab. Anthropic entwickelt Modelle und beschäftigt Spezialisten, die ungewöhnliche Fehler überprüfen können. Ein Unternehmen ohne vergleichbare Expertise kann die Codeproduktion schneller automatisieren, als es seine Fähigkeit verbessert, diesen Code zu bewerten.
KI-generierte Ergebnisse können Unterschiede zwischen Organisationen daher vergrößern. Teams mit starken Tests, Dokumentation, Observability und Review-Praktiken können sicherer delegieren. Teams mit schwachen Grundlagen riskieren, Fehler mit höherer Geschwindigkeit zu produzieren.
Deshalb ist auch durchsuchbarer institutioneller Kontext wichtig. Ein Agent benötigt Zugriff auf Anforderungen, frühere Entscheidungen und technische Einschränkungen. Eine gepflegte KI-Wissensdatenbank kann Menschen helfen, die Überlegungen hinter delegierter Arbeit nachzuvollziehen, auch wenn sie technische Validierung nicht ersetzen kann.
Für Enterprise-Käufer ist Anthropics Ankündigung keine Aufforderung, alles zu automatisieren. Sie ist ein Beleg dafür, dass sich KI-gestützte Entwicklung von individuellen Vorschlägen hin zu beaufsichtigten Workflows bewegt. Die Wettbewerbsfrage betrifft, wie viel Verantwortung eine Organisation verifizieren kann – nicht bloß, wie viel sie delegieren kann.
Was Anthropics Zahlen weiterhin nicht beweisen
Anthropic hat rasch wachsende Unterstützung gezeigt, aber kein Modell, das seinen Nachfolger unabhängig entwirft, trainiert und genehmigt.
Die Formulierung „baut sich selbst“ verdichtet mehrere unterschiedliche Tätigkeiten. Anwendungscode zu schreiben unterscheidet sich von der Auswahl einer Modellarchitektur. Ein Experiment durchzuführen unterscheidet sich von der Entscheidung, ob sein Ergebnis eine bedeutende Trainingsinvestition rechtfertigt.
Laut Anthropic übernimmt Claude über dieses Spektrum hinweg sinnvolle Arbeit. Menschen liefern jedoch weiterhin Ziele, Bewertungskriterien, Infrastrukturzugang und Freigabebefugnis. Diese Kontrollen verhindern, dass der gegenwärtige Prozess als vollständig rekursive Selbstverbesserung gilt.
Auch die Messqualität gibt Anlass zur Sorge. Die meisten zentralen Zahlen stammen aus Anthropics internen Systemen. Das Unternehmen erstellte die Aufgabenkategorien, sammelte die Sitzungen und bewertete viele Ergebnisse mit Claude-basierten Beurteilern.
Modellbasierte Beurteiler können große Datensätze konsistent verarbeiten, doch sie können blinde Flecken der Systeme übernehmen, die sie bewerten. Eine Sitzung kann erfolgreich wirken, weil Tests bestanden wurden, während sie Wartungs-, Sicherheits- oder Architekturprobleme außerhalb des Testumfangs einführt.
Auch die Urheberschaft von Code ist mehrdeutig. Claude könnte nach umfangreicher menschlicher Planung eine vollständige Datei erzeugen. Alternativ könnte ein Forscher ein kurzes Ziel vorgeben, während das Modell die Implementierung bestimmt. Beide Dateien zählen als KI-verfasst, obwohl sie unterschiedliche Grade an Unabhängigkeit darstellen.
Die achtfache Output-Zahl misst zudem zusammengeführten Code, nicht verifizierten wirtschaftlichen Wert. Ein Ingenieur, der mehr Code erzeugt, kann mehr Probleme lösen. Derselbe Ingenieur könnte jedoch auch mehr Review-Arbeit und größere Systeme schaffen, deren Wartung teuer wird.
Unabhängige Forschung bietet nützlichen Kontext, ohne Anthropics interne Behauptungen aufzulösen. Ein Working Paper aus dem Jahr 2026 untersuchte 7,8 Millionen von Claude mitverfasste Commits und ein Panel aus 5.838 Entwicklern. Die Studie brachte die Einführung mit Arbeit über mehr Repositories und Technologien hinweg in Zusammenhang.
Ihre Entwicklerstudie legt nahe, dass Coding-Agenten die Bandbreite der Aufgaben erweitern können, die Menschen angehen. Öffentliche GitHub-Aktivität misst jedoch weder Anthropics interne Modellforschung noch beweist sie rekursive Verbesserung.
Die Zuverlässigkeit variiert zudem je nach Aufgabe. Strukturierte Probleme mit klaren Tests begünstigen automatisierte Iteration. Offene Forschungsfragen verfügen oft über keine objektive Bewertung, sodass plausible, aber schwache Schlussfolgerungen länger bestehen bleiben können.
Rechen- und physische Infrastruktur setzen weitere Grenzen. Schnellere Agenten können mehr Experimente vorschlagen und durchführen, doch das Training von Frontier-Modellen erfordert Chips, Energie, Netzwerkkapazität und sorgfältig verwaltete Daten. Intelligenz ist nicht die einzige knappe Ressource.
Menschliches Review kann mit wachsendem Output zum Engpass werden. Wenn Claude Änderungen schneller erzeugt, als Spezialisten sie prüfen können, muss Anthropic entweder die Bereitstellung verlangsamen oder sich stärker auf automatisierte Bewertung verlassen.
Dadurch entsteht ein zirkuläres Verifizierungsproblem. Claude schreibt Code, ein anderer Claude überprüft ihn, und Claude-basierte Systeme beurteilen, ob Aufgaben erfolgreich waren. Menschliche Spezialisten bleiben die letzte Absicherung, doch ihre Sichtbarkeit kann sinken, je länger die automatisierte Kette wird.
Sicherheit erhöht den Einsatz. Ein Agent mit Zugriff auf Repositories, Cluster und Befehle kann schwierige operative Probleme lösen. Derselbe Zugriff vergrößert die Folgen fehlerhafter Schlussfolgerungen, kompromittierten Kontexts oder manipulierter Anweisungen.
Organisationen, die ähnliche Workflows übernehmen, benötigen eng begrenzte Berechtigungen, vollständige Protokolle, reproduzierbare Tests und klare Eskalationswege. Sie brauchen außerdem Personen, die für Produktionsänderungen verantwortlich bleiben – unabhängig davon, wer den Code erzeugt hat.
Anthropic behauptet selbst nicht, dass Claude die Autonomie-Schwelle überschritten habe. Das besser vertretbare Argument lautet, dass der Abstand schrumpft. Die technische Ausführung ist stark automatisiert worden, während Forschungsurteile erste, aber begrenzte Verbesserungen zeigen.
Diese Behauptung ist auch ohne Übertreibung bedeutsam genug. Ein System muss nicht zu einem unabhängigen Wissenschaftler werden, bevor es Geschwindigkeit und Ökonomie der KI-Entwicklung verändert.
Drei Signale werden zeigen, ob sich der Kreislauf wirklich schließt
Die nächste Phase hängt von messbaren Veränderungen bei Forschungsführung, unabhängiger Validierung und menschlicher Kontrolle über folgenreiche Entscheidungen ab.
Das erste Signal ist Claudes Anteil an der Führung von Modelforschung und -entwicklung. Anthropic berichtete von einem Anstieg von null im Februar auf 26 % im August 2026. Künftige Offenlegungen sollten zeigen, ob diese Kurve weiter ansteigt, stagniert oder sich umkehrt.
Ein anhaltender Anstieg würde die These der sich verstärkenden Beschleunigung stützen, insbesondere wenn Aufgaben weniger spezifiziert werden. Ein Plateau würde darauf hindeuten, dass sich die Implementierung schneller verbessert hat als das Forschungsurteil. Ein Rückgang könnte auf Änderungen der Messung, schwierigere Aufgaben oder Zuverlässigkeitsprobleme hindeuten.
Die Definition von Führung muss stabil bleiben. Andernfalls könnte ein höherer Prozentsatz umkategorisierte Arbeit statt größerer Unabhängigkeit widerspiegeln. Anthropic sollte Beispiele aus Engineering, Experimenten, Interpretation und strategischer Planung veröffentlichen.
Das zweite Signal ist die unabhängige Replikation. Externe Evaluatoren benötigen Zugang zu repräsentativen Aufgaben, Bewertungskriterien und Ergebnissen, ohne sensible Geheimnisse der Modellentwicklung zu erhalten. Vergleichbare Tests über verschiedene Labore hinweg wären aussagekräftiger als isolierte Unternehmensprozente.
Bei Replikationen sollte die Codequalität über die Zeit untersucht werden, nicht nur der Abschluss von Aufgaben. Sie sollten Fehler, Sicherheitsprobleme, Wartungsaufwand und die Häufigkeit menschlicher Eingriffe messen. Forschungsaufgaben sollten prüfen, ob Agenten produktive Richtungen auswählen, bevor sie die späteren Ergebnisse kennen.
Unabhängige Belege würden Anthropics Darstellung entweder stützen oder schwächen. Ähnliche Ergebnisse bei unterschiedlichen Evaluatoren und Umgebungen würden die Behauptung eines breiten Fähigkeitswandels unterstützen. Große Unterschiede würden zeigen, dass interne Arbeitsabläufe oder Bewertungsentscheidungen einen erheblichen Teil der gemeldeten Leistung bestimmen.
Das dritte Signal ist, wie Anthropic mit menschlicher Aufsicht umgeht, wenn die Leistung wächst. Das Unternehmen bezeichnet die Überprüfung bereits als möglichen Engpass. Seine Reaktion wird zeigen, ob Menschen eine substanzielle Kontrolle behalten oder Entscheidungen zunehmend über automatisierte Zusammenfassungen genehmigen.
Achten Sie auf Änderungen bei Überprüfungsanforderungen, Zugriffskontrollen, Bereitstellungsverfahren und der Meldung von Vorfällen. Beobachten Sie außerdem, ob Claude beginnt, Forschungsziele auszuwählen, statt sie lediglich umzusetzen.
Ein echtes Schließen des Kreislaufs würde mehr erfordern als einen höheren Anteil an der Code-Autorenschaft. Claude müsste wertvolle Forschungsrichtungen vorschlagen, glaubwürdige Evaluierungen entwerfen, mehrdeutige Evidenz interpretieren und seinen Nachfolger mit begrenzter menschlicher Anleitung verbessern.
Selbst dann bleibt Autorisierung von Fähigkeit getrennt. Ein Modell könnte technisch in der Lage sein, mehr Forschung zu steuern, während Anthropic bewusst die menschliche Genehmigung beibehält. Governance-Entscheidungen werden bestimmen, ob potenzielle Autonomie zu operativer Autonomie wird.
Für Entwickler ist die unmittelbare Erkenntnis praktisch. Das Programmieren verlagert sich hin zu Spezifikation, Orchestrierung, Tests und Überprüfung. Ingenieure, die Systeme tief verstehen, können mehr delegieren und zugleich erkennen, wann die selbstsichere Ausgabe eines Agenten falsch ist.
Unternehmenskäufer sollten fragen, was Anbieter messen, wenn sie von autonomer Arbeit sprechen. Abschlussraten allein reichen nicht aus. Käufer benötigen Belege zu Aufsicht, Rücknahmen, Fehlern, Auditierbarkeit und Verantwortung nach Ausfällen.
Wissensarbeiter stehen vor einem ähnlichen Wandel. KI kann mehr Ausführung übernehmen, doch Menschen benötigen weiterhin verlässlichen Kontext und eine Dokumentation wichtiger Entscheidungen. Werkzeuge für Wissensverknüpfung werden nützlich, wenn sie Nutzern helfen, Evidenz nachzuverfolgen, statt lediglich eine weitere Antwort zu generieren.
Die Selbstverbesserung von Anthropic Claude ist daher in einem begrenzten, aber folgenreichen Sinn real. Claude beschleunigt bereits die Engineering- und Experimentarbeit, aus der spätere Claude-Modelle entstehen. Das Unternehmen hat kein autonomes System gezeigt, das seinen Nachfolger unabhängig entwickelt.
In der Lücke zwischen diesen Aussagen wird sich das nächste Kapitel entfalten. Verfolgen Sie den Führungsprozentsatz, verlangen Sie unabhängige Validierung und prüfen Sie, wer weiterhin irreversible Entscheidungen trifft. Wenn sich diese drei Signale gemeinsam bewegen, wird „KI baut KI“ ein Betriebssystem statt einer Schlagzeile beschreiben.
Die Frage für jede Organisation lautet nicht länger, ob KI mehr Arbeit produzieren kann. Sie lautet, ob Menschen diese Arbeit verifizieren, die Expertise bewahren können, die nötig ist, um sie infrage zu stellen, und verantwortlich bleiben, während die automatisierte Kette wächst.



