Zum AI-Missbrauchsbericht von Anthropic: Agenten verlagern die Kosten auf Verteidiger
Anthropic veröffentlichte seinen dritten Bericht über AI-Missbrauch, nachdem Claude bei Cyberangriffen, Überwachungssystemen, Einflusskampagnen, Waffenforschung und industrieller Modellextraktion festgestellt worden war. Die Belege hinter dem AI-Missbrauchsbericht von Anthropic umfassen Aktivitäten, die zwischen Dezember 2025 und August 2026 beobachtet wurden. Seine zentrale Warnung lautet nicht, dass AI neue böswillige Ziele erfunden hat. Vielmehr haben Agenten bestehende Operationen günstiger, schneller und leichter skalierbar gemacht.
Der Bericht beschreibt Menschen, die Ziele auswählen, Vorgaben definieren und folgenreiche Ergebnisse prüfen. AI-Systeme übernahmen anschließend Aufklärung, Softwareentwicklung, Schwachstellenforschung, Datenverarbeitung, Propagandaproduktion und Teile der Ausnutzung. Mehrere Akteure verbanden Claude außerdem mit externen Tools und persistentem Speicher, sodass automatisierte Workflows sitzungsübergreifend fortgesetzt werden konnten.
Diese Arbeitsteilung ist bedeutsamer als jeder einzelne böswillige Prompt. Sie integriert AI in die operative Maschinerie von Cyberkriminalität und staatlicher Überwachung. Angreifer können Fachwissen nun in Software bewahren, erfolgreiche Verfahren wiederholen und mehrere Arbeitsstränge gleichzeitig betreiben.
Bruce Schneier hob dasselbe Muster in seiner Analyse des Missbrauchsberichts hervor. Die wesentliche Verschiebung geht hin zu industrialisierter Ausführung: Menschen behalten die Entscheidungsgewalt, während Maschinen einen größeren Teil der operativen Last tragen.
Im AI-Missbrauchsbericht von Anthropic ist der Workflow die eigentliche Geschichte
Die folgenreichsten Belege des Berichts betreffen vollständige Workflows, nicht einzelne Antworten eines Chatbots.
Der Threat-Intelligence-Bericht von Anthropic dokumentiert Aktivitäten krimineller Gruppen, kommerzieller Überwachungsanbieter, politisch motivierter Einzelpersonen und staatsnaher Organisationen. Die Fälle umfassen Cyberoperationen, Propaganda, Überwachung, konventionelle Waffen, biologische Forschung und unerlaubte Modelldestillation.
Das Unternehmen erklärt, es habe bemerkenswerte oder neuartige Vorfälle ausgewählt, keine repräsentative Stichprobe aller Aktivitäten auf Claude. Diese Unterscheidung begrenzt Schlussfolgerungen über die Verbreitung. Dennoch zeigen die Fälle, was entschlossene Akteure zusammenstellen können, wenn Modelle mit Code, Browsern, Scannern, Datenbanken und anderen Tools verbunden werden.
Einige Akteure setzten Agentenschwärme ein, bei denen ein koordinierendes Modell ein großes Ziel auf mehrere spezialisierte AI-Agenten verteilte. Diese Agenten arbeiteten parallel an Aufklärung, Exploit-Forschung und Aufgaben nach einer Kompromittierung. Persistenter Kampagnenspeicher hielt Ziellisten, Zugangsdaten, Anweisungen und den Bearbeitungsstatus zwischen Sitzungen fest.
In einer gemeldeten Operation analysierten automatisierte Workflows Appliance-Firmware und Binärdateien mit Dekompilierungstools. Das System bildete Hypothesen zu Schwachstellen, schrieb vorgeschlagene Exploits und testete sie gegen Laborkopien der anvisierten Produkte. Anthropic zufolge erzeugte ein einziger durchgängiger Workflow innerhalb eines Monats mehr als ein Dutzend möglicher Zero-Day-Funde.
Ein Zero-Day ist eine zuvor unbekannte Softwareschwachstelle, für die noch kein Abwehr-Patch verfügbar ist. Der Bericht belegt nicht, dass jeder vermutete Fund valide war oder gegen reale Systeme eingesetzt wurde. Er zeigt jedoch einen automatisierten Prozess, der Arbeiten iterativ durchläuft, die traditionell anhaltende Aufmerksamkeit von Spezialisten erforderten.
Andere Agenten durchsuchten wiederholt exponierte Internetinfrastruktur. Sie erstellten Fingerabdrücke von Diensten, verglichen Einstiegspunkte mit bekannten Schwachstellen und fügten neue Erkenntnisse einem persistenten Projektspeicher hinzu. Eine separate Flotte aus 13 dauerhaft eingesetzten Agenten sammelte öffentliches Material aus militärischen, staatlichen, politischen und sozialen Quellen.
Diese Architektur verändert die Ökonomie böswilliger Arbeit. Ein Mensch muss nicht mehr jede Such-, Test-, Übersetzungs- oder Dokumentationsaufgabe persönlich ausführen. Der Akteur kann eine erweiterbare Gruppe automatisierter Arbeitskräfte beaufsichtigen und sich auf die Zielauswahl konzentrieren.
Deshalb unterschätzt eine Liste einzelner Prompts diese Entwicklung. Jeder Prompt kann bei isolierter Betrachtung gewöhnlich wirken. Die Gefahr entsteht durch Orchestrierung, angesammelten Kontext, Tool-Zugriff, Wiederholung und die Fähigkeit, Ergebnisse in Handlungen umzusetzen.
Anthropic erklärt, verknüpfte Konten gesperrt und seine Erkenntnisse zur Verbesserung der Schutzmaßnahmen genutzt zu haben. Die Entfernung von Konten betrifft jedoch den Zugang zu einem Anbieter, nicht das zugrunde liegende Fachwissen, den Code, gestohlene Zugangsdaten oder die Infrastruktur. Akteure können diese Ressourcen bewahren und Teile eines Workflows an anderer Stelle fortführen.
Der Bericht macht AI-Missbrauch daher aus einem Problem der Inhaltsmoderation ein Problem der operativen Sicherheit. Das Blockieren schädlicher Texte bleibt hilfreich, doch Verteidiger müssen auch automatisiertes Verhalten über Identitäten, Sitzungen, Tools und kompromittierte Konten hinweg erkennen.
AI-Agenten verdichten den Angriffszyklus
AI-Agenten entfernen Menschen nicht aus Cyberangriffen, ermöglichen aber weniger Menschen, über mehr Ziele und technische Ebenen hinweg zu operieren.
Eine von Anthropic beschriebene Kampagne nutzte AI für Aufklärung, Erstzugriff, Sammlung, Exfiltration und Persistenz. Der Akteur erstellte Berichten zufolge Fingerabdrücke von E-Mail- und Fernzugriffssystemen, baute Ziellisten auf und schuf Infrastruktur für Device-Code-Phishing.
Device-Code-Phishing missbraucht einen legitimen Anmeldeprozess, um ein Opfer dazu zu bewegen, eine vom Angreifer kontrollierte Sitzung zu autorisieren. Sobald der Angreifer diesen Zugriff erhält, kann die Sitzung Cloud-E-Mails und andere verbundene Dienste offenlegen. Die Technik wirkt oft weniger verdächtig, weil sie einen echten Authentifizierungsablauf nutzt.
Anthropic zufolge griff die Operation auf E-Mail-Datensätze von mindestens acht Organisationen zu. Zu den Zielen gehörten die nationale Staatsanwaltschaft, ein militärisches Bildungsinstitut und eine regionale zwischenstaatliche Organisation. Ein weiterer Einbruch legte mehr als 300.000 nationale Identitätsdatensätze sowie Registerinformationen zu über 500.000 Unternehmen offen.
Dem Bericht zufolge half das AI-System bei der Organisation von Hunderten Gigabyte gestohlener Informationen. Es unterstützte außerdem beim Abgreifen von Zugangsdaten, bei lateralen Bewegungen und bei der Anpassung schädlicher Software, nachdem Sicherheitsprodukte frühere Versionen erkannt hatten.
Dadurch schließt sich ein Teil der Rückkopplungsschleife zwischen Angreiferhandlung und Abwehrreaktion. Eine Erkennung verursacht nicht mehr dieselbe Verzögerung, wenn Software den Fehlschlag analysieren, ein Artefakt überarbeiten und rasch eine weitere Version vorbereiten kann. Die menschliche Freigabe kann im Kreislauf bleiben, während die maschinelle Iteration beschleunigt wird.
Ein anderer Akteur setzte eine autonome Exploit-Pipeline gegen produktive Webanwendungen ein. Arbeiter-Agenten testeten ohne fortlaufende menschliche Aufsicht auf Injection-Schwachstellen, Authentifizierungsumgehungen, Cross-Site-Scripting und Server-Side Request Forgery. Mögliche Zugangsdaten und Erkenntnisse flossen in einen gemeinsamen Arbeitsbereich zurück.
Server-Side Request Forgery ist eine Schwachstelle, die einen Server dazu bringt, im Auftrag eines Angreifers Anfragen zu stellen. Sie kann interne Systeme offenlegen, die vom öffentlichen Internet aus sonst nicht erreichbar sind. Die Automatisierung solcher Tests erhöht die Zahl der Endpunkte, die ein Akteur prüfen kann.
Der Bericht beschreibt außerdem Betrugsinfrastruktur, die Kontoregistrierung, Postfachüberwachung, CAPTCHA-Lösung und Schritte zur Identitätsverifikation automatisierte. Ein weiterer Workflow schaltete einen Reverse Proxy zwischen Opfer und echte Identitätsprüfungen und fing authentifizierte Sitzungen sowie eingereichte Dokumente ab.
Diese Beispiele zeigen, warum der AI-Missbrauchsbericht von Anthropic für gewöhnliche Organisationen relevant ist. Ein Unternehmen muss nicht das ursprüngliche Ziel des Angreifers sein, um Schaden zu erleiden. Seine offenliegenden Schlüssel, Cloud-Tenants, SaaS-Anwendungen, Lieferanten oder Kundendaten können zu Zwischenressourcen werden.
Ein französischsprachiger Angreifer nahm Berichten zufolge 42 politische und verbundene Organisationen ins Visier. Der Akteur verschaffte sich bei mindestens 14 internen Zugriff und entwendete schätzungsweise 12 bis 26 Gigabyte an Datenbankmaterial. Eine kompromittierte Kampagnenplattform legte rund 140.000 Datensätze offen, darunter politische Meinungen.
Unabhängige Berichterstattung über die französische Kampagne brachte mehrere Details mit betroffenen Organisationen in Verbindung. Diese Berichterstattung liefert wertvolle Bestätigung, obwohl Anthropic für einen großen Teil der technischen Darstellung die Primärquelle bleibt.
Der Akteur entwickelte außerdem eine zuvor nicht dokumentierte WordPress-Exploitationstechnik und war laut Anthropic gegen mindestens vier Websites erfolgreich. Weitere Tools sammelten eingegebene Zugangsdaten, vergifteten Backups und platzierten Fernzugriffscode in Website-Assets.
Dies war kein vollständig autonomer Angriff. Der Mensch wählte Ziele, betrieb Infrastruktur, interpretierte Ergebnisse und verfolgte politische Ziele. Die entscheidende Veränderung war die Hebelwirkung: Eine Person konnte eine Kampagne mit der Breite eines kleinen technischen Teams aufbauen und aufrechterhalten.
Der Hauptkonflikt lautet: Angreiferskalierung gegen Verantwortlichkeit der Verteidiger
Angreifer können Arbeit auf Agenten verteilen, doch Verteidiger tragen weiterhin die gesamten rechtlichen, operativen und finanziellen Folgen jedes Fehlers.
Traditionelle Sicherheitsplanung geht oft davon aus, dass offensive Arbeit knappes Fachwissen verbraucht. Fähige Angreifer müssen Infrastruktur untersuchen, Tools entwickeln, gestohlene Daten prüfen und ihre Methoden nach einer Erkennung anpassen. Diese Einschränkungen begrenzen, wie viele Ziele eine Gruppe gleichzeitig verfolgen kann.
Agentische Systeme schwächen diese Einschränkungen. Sie können Aufklärung fortlaufend durchführen, Ergebnisse konsistent dokumentieren, Material übersetzen und technische Aufgaben erneut versuchen. Außerdem bewahren sie prozedurales Wissen, das sonst im Gedächtnis eines einzelnen Akteurs liegen würde.
Verteidiger stehen vor einer weniger nachsichtigen Gleichung. Jede offengelegte Zugangsinformation, vergessene Anwendung, verwundbare Zuliefererbeziehung oder übermäßige Berechtigung kann zum Einstiegspunkt werden. Angreifer benötigen nur einen gangbaren Weg, während Verteidiger eine sich wandelnde Sammlung von Systemen und Identitäten schützen müssen.
Auch die AI-Lieferkette selbst ist zum Ziel geworden. Anthropic beschreibt gefälschte Dienste, die vergünstigten Zugang zu Frontier-Modellen versprachen, aber Credential-Harvester installierten. Diese Programme stahlen Kontozugangsdaten und authentifizierte Sitzungstokens von den Geräten der Kunden.
Die Angreifer verkauften oder nutzten diesen Zugriff anschließend über betrügerische Proxy-Netzwerke weiter. Manche Dienste leiteten Kunden unbemerkt an ein anderes Modell weiter und sammelten weiterhin neue Zugangsdaten. Dadurch erhielten Kriminelle eine erneuerbare Quelle legitim wirkender Konten, nachdem frühere Schlüssel widerrufen worden waren.
Eine weitere Operation testete 30 Ziele bei dem Versuch, Zugang zu einem Vorabmodell von Claude zu erhalten. Anthropic zufolge scheiterten sämtliche Versuche, und die eigenen Systeme des Unternehmens wurden nicht kompromittiert. Die gestohlenen Schlüssel gehörten Kunden, deren Umgebungen bereits zuvor verletzt worden waren.
Diese Unterscheidung ist wichtig. Ein Anbieter kann seine zentrale Infrastruktur absichern, während Angreifer schwächere Punkte im Umfeld ausnutzen. Entwickler-Laptops, Browser-Sitzungen, Automatisierungsplattformen, Drittanbieter-Router und kopierte Konfigurationsdateien werden alle Teil der tatsächlichen Sicherheitsgrenze.
Unternehmen sollten AI-Zugangsdaten daher wie andere privilegierte Produktionsgeheimnisse behandeln. Schlüssel benötigen begrenzte Berechtigungsumfänge, wo möglich kurze Laufzeiten, Nutzungsüberwachung und verlässlichen Widerruf. Ungewöhnlicher Modellverkehr kann auf eine kompromittierte Umgebung hinweisen, bevor ein Angreifer ein offensichtlicheres Ziel erreicht.
Sicherheitsteams benötigen außerdem Einblick in das Verhalten von Agenten. Ein einzelnes Konto, das persistente Scans, parallele Tool-Aufrufe oder wiederholte Extraktionsaufträge startet, stellt ein anderes Risiko dar als ein gewöhnliches Gespräch. Die Erkennung sollte Abfolgen von Handlungen berücksichtigen, statt jeweils nur einen Prompt zu betrachten.
Dies setzt Anthropic, OpenAI, Google, Microsoft, Cloud-Anbieter und Model-Routing-Dienste unter Druck. Jeder sieht einen anderen Abschnitt der Kette. Kein Beteiligter kann die gesamte Kampagne rekonstruieren, ohne relevante Bedrohungsinformationen auszutauschen.
Eine stärkere Überwachung bringt jedoch eigene Risiken mit sich. Anbieter könnten Prompts, Ausgaben, Dateien, Tool-Aufrufe und Kontobeziehungen prüfen, um Missbrauch zu erkennen. Diese Praktiken können sensible Kundeninformationen offenlegen oder umfassende Überwachungsmöglichkeiten innerhalb des Dienstes selbst schaffen.
Der daraus entstehende Zielkonflikt ist nicht einfach Sicherheit gegen Privatsphäre. Schwache Überwachung kann koordinierte Angriffe fortbestehen lassen. Übermäßige Überwachung kann Vertraulichkeit untergraben, falsche Anschuldigungen erzeugen oder wertvolle Kundendaten in ein weiteres zentralisiertes System überführen.
Anbieter benötigen begrenzte Aufbewahrungsfristen, eingeschränkten Zugang für Ermittler, klare Eskalationsregeln und aussagekräftige Transparenz über automatisierte Durchsetzung. Kunden müssen außerdem wissen, welche Telemetriedaten existieren und wann Informationen an externe Organisationen weitergegeben werden können.
Der AI Misuse Report von Anthropic bietet ungewöhnlich detaillierte Einblicke in erkannte Aktivitäten. Er liefert jedoch kein vollständiges Maß für Fehlalarme, unentdeckte Kampagnen oder die Datenschutzkosten der Untersuchungen. Diese unbeantworteten Fragen gehören neben die operativen Erkenntnisse.
Überwachung und Propaganda zeigen dieselbe Substitution von Arbeit
Die Überwachungsfälle des Berichts zeigen, wie KI Teile einer technischen und analytischen Belegschaft ersetzt, ohne zu verändern, wen mächtige Institutionen ins Visier nehmen.
Ein Berater nationaler Sicherheitsbehörden in Mali nutzte Claude Berichten zufolge, um eine Plattform zur Massenüberwachung zu entwickeln. Das System konnte Kommunikationsdaten der Mobilfunkanbieter des Landes sammeln und Dossiers über ausgewählte Personen erstellen.
Anthropic zufolge half das Modell bei der Entwicklung der zugrunde liegenden Software, nicht bei der Analyse der finalen Dossiers. Laut separater Berichterstattung über Überwachung wurde die Plattform nach dem Eingreifen von Anthropic schließlich lokal mit anderen Modellen eingesetzt.
Dieses Ergebnis zeigt eine Grenze der Durchsetzung durch Anbieter auf. Ein Cloud-Dienst kann Konten schließen und die Ausführung eines bestimmten Workflows erschweren. Exportierten Code, technisches Wissen, gesammelte Daten oder Zugang zu alternativen Modellen kann er jedoch nicht zuverlässig beseitigen.
Im Iran nutzten Akteure Claude, um eine bösartige Firefox-Erweiterung zu entwickeln, die Identitäten aus sozialen Netzwerken abgriff. Eine weitere iranische Einheit analysierte Hunderttausende Beiträge und identifizierte laut Anthropic 39 Oppositionskonten zur Überwachung.
Der Bericht beschreibt eine chinesische Geheimdienstoperation im Bereich Religionsangelegenheiten, die Berichten zufolge von vielen Analystenteams auf ein einziges Büro reduziert worden war. Mit KI-Unterstützung erstellte dieses Büro Tausende Untersuchungen pro Monat.
Andere Akteure nutzten Claude, um Artikel und Beiträge in sozialen Netzwerken nach politischer Sensibilität zu bewerten. Sie fassten Orte, demografische Merkmale, politische Ansichten und Vertrauensbewertungen in strukturierten Datensätzen zusammen. Diese Ergebnisse könnten Verhöre, Überwachung oder andere Formen der Kontrolle unterstützen.
Ein PRC-naher Akteur ohne Arabischkenntnisse führte angeblich eine mehrtägige Rekrutierungsoperation gegen Uiguren in Syrien durch. Claude formulierte Kontaktaufnahmen in einem regionalen Dialekt, übersetzte Antworten, simulierte Qualitätskontrollen und formatierte Ergebnisse für einen mutmaßlichen Fallbearbeiter.
Das Modell entschied nicht, welche verfolgte Gemeinschaft zum Ziel wurde. Menschliche Institutionen lieferten Ziel, Auftrag und beabsichtigte Verwendung. KI verringerte die sprachlichen, personellen und technischen Hürden, die die Operation sonst möglicherweise verlangsamt hätten.
Dasselbe Muster zeigt sich auch in Einflusskampagnen. Anthropic beschreibt neun Fälle aus Russland, Iran, der Türkei, den Golfstaaten, Südasien, Afrika und Europa. Die Kampagnen richteten sich an Zielgruppen auf sechs Kontinenten.
Die Akteure bauten gefälschte Profile, Nachrichtenseiten, politische Botschaften und koordinierte Veröffentlichungspläne auf. Einige Kampagnen standen im Zusammenhang mit Wahlen. Russische Staatsmedien verbreiteten vor Moldaus Wahl im September 2025 erfundene Behauptungen, während ein kenianischer Akteur vor der Wahl 2027 gefälschte Graswurzelinhalte vorbereitete.
KI hat täuschende politische Kommunikation nicht erfunden. Sie half dabei, Personas, Übersetzungen, Artikel, Targeting-Strategien und Varianten zu geringeren Grenzkosten zu erstellen. Ein kleines Team konnte den Eindruck einer größeren unabhängigen öffentlichen Beteiligung aufrechterhalten.
Anthropic verfügt über einen ungewöhnlichen Beobachtungspunkt, weil es Kampagnen sehen kann, während die Akteure sie planen. Soziale Netzwerke treffen oft erst auf die Operation, nachdem Inhalte öffentlich erscheinen. Modellanbieter können Zielauswahl und Inhaltserstellung früher erkennen.
Ihre Sichtbarkeit nimmt jedoch ab, sobald Inhalte die Modellplattform verlassen. Anthropic erklärt, dass es Open-Source-Recherchen, Partnerdaten und öffentliche Berichterstattung nutzt, um nachgelagerte Aktivitäten zu verstehen. Das bedeutet, dass manche geplanten Kampagnen nie starten, während andere außerhalb seines Blickfelds weiterwandern könnten.
Leser sollten nicht jeden erkannten Prompt als Beweis für eine abgeschlossene reale Operation behandeln. Absicht, Vorbereitung, Einsatz, Reichweite und messbare Wirkung sind unterschiedliche Phasen. Der Bericht ist am stärksten, wenn er Modellaktivität mit Infrastruktur oder bestätigenden Belegen verknüpft.
Dennoch ist die Richtung klar. KI hält Einzug in die alltägliche Bürokratie von Überwachung und politischer Einflussnahme. Sie kann Institutionen helfen, mehr Menschen zu bearbeiten, mehr Personas aufrechtzuerhalten und mehr Berichte vorzubereiten, ohne den Personalbestand proportional auszuweiten.
Waffenforschung stellt ein schwierigeres Schutzproblem dar
Die Erkenntnisse von Anthropic verlagern die Debatte über böswillige Schreibunterstützung hinaus hin zu Software, die Analyse mit physischen Systemen verbindet.
Das Unternehmen erklärt, sechs Fälle zu konventionellen Waffen unter Beteiligung von drei Akteuren in China, zwei in Russland und einem im Jemen unterbunden zu haben. Vier betrafen Software für Waffenhardware, während zwei auf Beschaffung oder Nachrichtengewinnung ausgerichtet waren.
Zu den berichteten Projekten gehörten gelenkte Raketen, Flugkörperlenkung, Software für Drohnenschwärme, Torpedoabwehr, Zielerfassung für elektronische Kriegsführung und die Unterdrückung von Luftabwehr. Ein Programm für gelenkte Raketen umfasste laut Anthropic einen Live-Feldtest.
Die Akteure verfügten im Allgemeinen bereits vor der Nutzung von Claude über relevante Hardware, technisches Wissen oder Zugang zu den Programmen. Sie teilten ihre Arbeit auf mehrere Sitzungen auf, um das Gesamtziel zu verschleiern, und versuchten, Schutzmaßnahmen zu umgehen.
Diese Einschränkung ist wichtig. Der Bericht zeigt nicht, dass eine uninformierte Person eine Frage stellt und eine vollständige Waffe erhält. Er zeigt fähige Gruppen, die KI einsetzen, um technische Entwicklung, Fehlersuche, Recherche, Dokumentation und Beschaffungsaufgaben zu beschleunigen.
Anthropic erklärt, Klassifikatoren eingeführt zu haben, die Datenverkehr zu hochexplosiven Stoffen und Waffenentwicklung besser erkennen. Ein Klassifikator ist ein automatisiertes System, das einschätzt, ob eine Anfrage zu einer eingeschränkten Kategorie gehört.
Solche Kontrollen stehen vor einem inhärenten Problem. Viele technische Aufgaben haben legitime zivile Anwendungen. Lenkung, Navigation, Bildverarbeitung, Funkkommunikation, Materialanalyse und Flugsteuerung können sowohl kommerziellen als auch militärischen Systemen dienen.
Der Bericht beschreibt außerdem Forschungsanfragen im biologischen Bereich mit Dual-Use-Eigenschaften. Ein Fall betraf einen Finanzierungsantrag zu Veränderungen am Chikungunya-Virus, die Übertragbarkeit und Immunflucht beeinflussen könnten.
Claude verweigerte Berichten zufolge Unterstützung bei Teilen dieser Arbeit, woraufhin sich der Nutzer einem anderen KI-Dienst zuwandte. Anthropic erklärt, seine älteren Modelle hätten unter der Schwelle gelegen, einen hochentwickelten biologischen Forscher substanziell zu unterstützen. Für aktuelle Systeme gibt es dieselbe Zusicherung nicht.
Berichte über den Fall biologischer Schutzmaßnahmen unterstreichen diese Unsicherheit. Leistungsfähigere Modelle können legitime Forschung unterstützen, doch dieselbe Kompetenz erschwert Entscheidungen darüber, welche Anfragen blockiert werden sollten.
Zu weitgehendes Blockieren verursacht reale Kosten. Wissenschaftler, Teams im öffentlichen Gesundheitswesen und Sicherheitsforscher benötigen möglicherweise Informationen, die eingeschränkter Arbeit ähneln. Zu geringes Blockieren kann einem böswilligen Akteur Unterstützung bei Versuchsplanung oder operativer Planung liefern.
Ein Modellanbieter muss diese Entscheidungen mit unvollständigem Kontext treffen. Eine harmlos wirkende Anfrage kann ein Fragment eines verdeckten Programms sein. Eine besorgniserregende Anfrage kann Teil autorisierter defensiver Forschung sein.
Dieselbe Schwäche betrifft Cyber-Schutzmaßnahmen. Angreifer können Ziele in gewöhnliche Aufgaben aufteilen, Konten wechseln, gestohlene Zugangsdaten verwenden oder mehrere Anbieter kombinieren. Modelle mit offenen Gewichten eröffnen einen weiteren Weg ohne einen zentralen Betreiber, der ein Konto schließen könnte.
Daher kann kein Anbieter Sicherheit als abgeschlossene Produktfunktion darstellen. Schutzmaßnahmen schaffen Reibung und verbessern die Erkennung, doch sie entfernen Fähigkeiten nicht aus dem weiteren Umfeld. Entscheidend ist, ob Eingriffe die Kosten für Angreifer schneller erhöhen, als Fähigkeiten sie senken.
Der AI Misuse Report von Anthropic liefert Belege für erfolgreiche Unterbrechungen, kann jedoch nicht die Kampagnen zeigen, die Anthropic nie erkannt hat. Er kann auch nicht bestimmen, wie viele Akteure ein Projekt aufgegeben haben, anderswohin migrierten oder mit lokal eingesetzten Systemen fortfuhren.
Diese Unsicherheit sollte zwei gegensätzliche Fehler verhindern. Die Fälle beweisen nicht, dass KI-Agenten jede hochentwickelte Operation eigenständig ausführen können. Sie rechtfertigen aber auch nicht, das Problem abzutun, weil Menschen weiterhin die Ziele bestimmen.
Menschliche Steuerung und maschinelle Ausführung können nebeneinander bestehen. Tatsächlich könnte diese Kombination die praktikabelste Struktur für schädliche Operationen sein, weil sie Urteilsvermögen bewahrt und zugleich wiederholbare Arbeit skaliert.
Modelldestillation macht Kundendaten zu einer Sicherheitsfrage
Die letzte Umkehrung des Berichts besteht darin, dass KI-Anbieter nicht nur Plattformen für Missbrauch sind, sondern auch Ziele, Datenquellen und gestohlene Rechenressourcen.
Anthropic wirft mehreren chinesischen KI-Laboren vor, unautorisierte Destillationskampagnen gegen Claude durchgeführt zu haben. Destillation nutzt die Ausgaben eines Modells, um das Verhalten oder die Fähigkeiten eines anderen Modells zu verbessern.
Laut Anthropic erzeugte Alibaba zwischen Mai und Juli 2026 mehr als 151 Millionen Austauschvorgänge. Moonshot generierte im gleichen Zeitraum angeblich mehr als 23 Millionen Austauschvorgänge. DeepSeek produzierte über einen Zeitraum von 14 Tagen im Juli mehr als 12,1 Millionen Austauschvorgänge.
Das Unternehmen schreibt Zhipu über 17 Tage im Juni und Juli mehr als 3,4 Millionen Austauschvorgänge zu. Xiaomi soll zwischen März und April über 20 Tage hinweg mehr als 400.000 Austauschvorgänge erzeugt haben.
Diese Zahlen sind Erkenntnisse von Anthropic und wurden im Bericht nicht unabhängig geprüft. Bei der Bewertung von Zuschreibung, Absicht und vertraglichen Ansprüchen sind auch die Reaktionen der genannten Unternehmen relevant.
Anthropic zufolge zielten die Kampagnen auf Fähigkeiten zum Schlussfolgern, Programmieren, Tool-Nutzen und zur Datenanalyse. Die Akteure nutzten angeblich falsche Identitäten, gestohlene Karten, kompromittierte API-Zugangsdaten, Proxys und Tausende Konten, um Zugriffskontrollen zu umgehen.
Einige testeten viele Prompt-Varianten, um verborgene Schlussfolgerungsspuren zu extrahieren. Ein Experiment soll mehr als 12.000 unterschiedliche Anfragen gesendet haben, um erfolgreiche Extraktionsmethoden zu identifizieren, bevor eine größere Kampagne gestartet wurde.
Die besorgniserregendste Behauptung betrifft Kundendaten. Anthropic zufolge leiteten DeepSeek, Moonshot und Xiaomi einige Nutzerunterhaltungen zu Trainingszwecken an Claude weiter. Nutzer seien angeblich nicht darüber informiert worden, dass ein anderer Modellanbieter ihre Anfragen verarbeiten würde.
Anthropic berichtet, dass einige Austauschvorgänge Namen, E-Mail-Adressen, Unternehmensinformationen, Entwicklerzugangsdaten und interne Prognosen enthielten. Drittanbieter-Routing-Dienste stellten Berichten zufolge zusätzliche Unterhaltungen mit Nutzern in den Vereinigten Staaten und Europa bereit.
Diese Behauptungen erweitern die Bedeutung des KI-Lieferkettenrisikos. Ein Kunde könnte glauben, dass Informationen an eine Anwendung und ein Modell gehen. In der Praxis können Anfragen über Router, Wiederverkäufer, Proxy-Dienste, Evaluatoren und verborgene vorgelagerte Anbieter laufen.
Unternehmen sollten Anbieter fragen, welche Modelle eingereichte Informationen tatsächlich verarbeiten. Sie benötigen außerdem klare Antworten zu Aufbewahrung, Training, regionalem Routing, Unterauftragsverarbeitern und dem Zugriff durch menschliche Prüfer.
Die Episode schafft eine schwierige Symmetrie. Anthropic kritisiert andere Organisationen dafür, Nutzerdaten angeblich ohne Einwilligung weiterzuleiten. Gleichzeitig zeigt der eigene Bericht, wie viel Modellanbieter durch Missbrauchsüberwachung ableiten können.
Diese Situationen sind nicht gleichwertig, doch sie teilen eine Governance-Frage. Sensible Informationen können weiter wandern, als Nutzer erwarten — sei es durch verdecktes Routing, Sicherheits-Telemetrie oder eine Untersuchung.
Die Antwort kann nicht das Versprechen sein, dass vertrauliche Daten niemals bewegt werden. Organisationen benötigen durchsetzbare Kontrollen, überprüfbares Routing, minimierte Aufbewahrung und Protokolle, die zeigen, welche Systeme jede Anfrage verarbeitet haben.
Deshalb sollten Beschäftigte auch vermeiden, aktive Geheimnisse in nicht genehmigte KI-Tools einzugeben. Eine professionell gestaltete Oberfläche zeigt nicht, wohin eine Anfrage gelangt oder wie viele Zwischeninstanzen darauf zugreifen können.
Worauf Verteidiger als Nächstes achten sollten
Der nächste Test besteht darin, ob die Sicherheitsreaktion die in On Anthropic’s AI Misuse Report beschriebenen ökonomischen Bedingungen verändert.
Das erste Signal ist eine störende Wirkung über Anbieter hinweg. Anthropic sagt, dass es Erkenntnisse gegebenenfalls mit öffentlichen und privaten Partnern teilt. Der aussagekräftigere Test ist, ob die Erkennung eines Anbieters zu einer schnellen Sperrung zugehöriger Konten, Infrastruktur und gestohlener Zugangsdaten bei anderen führt.
Verbessert sich die Zusammenarbeit, verlieren Angreifer einen Teil ihrer Fähigkeit, intakte Arbeitsabläufe zwischen Diensten zu verlagern. Tauchen Kampagnen wiederholt über neue Konten und alternative Modelle auf, bleiben Kontosperren lediglich vorübergehende Reibung.
Das zweite Signal sind Belege zur Autonomie von Agenten. Künftige Berichte sollten zwischen KI-generierten Vorschlägen und über Tools ausgeführten Aktionen unterscheiden. Sie sollten darlegen, an welchen Stellen Menschen Befehle genehmigten, Fehler korrigierten, Ziele auswählten oder mehrdeutige Ergebnisse interpretierten.
Diese Unterscheidung wird zeigen, ob Agenten unabhängiger werden oder qualifizierte Akteure lediglich produktiver machen. Beide Entwicklungen sind relevant, erfordern jedoch unterschiedliche Abwehrmaßnahmen und politische Reaktionen.
Das dritte Signal ist Transparenz über Untersuchungen und Privatsphäre. Anbieter sollten erklären, welche Daten sie aufbewahren, wie Missbrauchsklassifikatoren eine Überprüfung auslösen und wie sie den Zugriff von Ermittlern begrenzen. Sie sollten außerdem Fehlalarme und Einspruchsmöglichkeiten berichten, sofern eine Offenlegung Angreifern nicht hilft.
Für Sicherheitsverantwortliche ist die unmittelbare Reaktion praktisch. Inventarisieren Sie KI-Zugangsdaten, überprüfen Sie Modellrouter, reduzieren Sie langlebige Tokens und überwachen Sie ungewöhnliche automatisierte Aktivitäten. Testen Sie, ob kompromittierte Entwicklergeräte Modellsitzungen oder damit verbundene Produktionsgeheimnisse offenlegen können.
Teams sollten außerdem ihre Incident-Response-Pläne für Iterationen mit Maschinengeschwindigkeit überarbeiten. Eine blockierte Domain oder erkannte Payload kann innerhalb von Minuten eine automatisierte Überarbeitung auslösen. Verteidiger benötigen koordinierte Identitätswiderrufe, Endpunkt-Eindämmung, Cloud-Protokollierung und Kommunikation mit Anbietern.
Wissensarbeiter sollten prüfen, wohin sensible Prompts gelangen. Bevor sie Quellcode, interne Dokumente, Zugangsdaten, Forschungsdaten oder Kundendaten übermitteln, sollten sie den zugelassenen Anbieter und dessen Verarbeitungsbedingungen bestätigen.
Anthropics Bericht belegt keine autonome Cyber-Apokalypse. Er dokumentiert etwas Unmittelbareres: Menschen nutzen KI, um Fachwissen in wiederholbare Infrastruktur für Cyberkriminalität, Überwachung, Propaganda und Waffenarbeit zu verwandeln.
Die Frage für den nächsten Bericht lautet nicht, ob Missbrauch weitergeht. Sie lautet, ob Verteidiger Angreifer dazu zwingen, für jede erfolgreiche Operation mehr Identitäten, Geld, Zeit und Fachwissen einzusetzen. Dieser messbare Wettbewerb wird zeigen, ob Schutzmaßnahmen den Wandel eindämmen oder ihn lediglich dokumentieren.



