Stephen Aarons’ ChatGPT-Sanktionen machen erfundene Zeugen zur Rechtskrise
Stephen Aarons erhielt eine Sanktion in Höhe von 5.000 US-Dollar, nachdem seine mit ChatGPT unterstützte Berufungsschrift falsche Aussagen und Zeugen präsentierte, die nie im Prozess aufgetreten waren. Der Supreme Court von New Mexico befand den erfahrenen Strafverteidiger außerdem der unmittelbaren Missachtung des Gerichts schuldig. Die ChatGPT-Sanktionen gegen Stephen Aarons legen ein weitaus schwerwiegenderes Versagen offen als nur ein weiteres erfundenes Rechtszitat.
Aarons vertrat Oscar Renee Sandoval, der nach einer Verurteilung wegen Mordes zu lebenslanger Haft verurteilt wurde. Nach Angaben des Gerichts stellte die Berufungsschrift sowohl das Prozessprotokoll als auch Rechtsquellen falsch dar. Einige Passagen beschrieben Aussagen erfundener Zeugen, darunter angebliche Beobachtungen zur Kleidung und zum Erscheinungsbild des Schützen.
Dieser Unterschied verändert die Tragweite. Frühere KI-Sanktionen betrafen häufig nicht existierende Fälle oder Zitate. Diese Eingabe veränderte mutmaßlich die Tatsachendarstellung eines Strafprozesses, in dem die Freiheit des Mandanten von einem präzisen Aktenbestand abhing. Sie machte aus einer unzuverlässigen Zusammenfassung vermeintliche Beweise und brachte dieses Material vor das höchste Gericht des Bundesstaats.
Die ChatGPT-Sanktionen gegen Stephen Aarons gingen über eine Geldstrafe hinaus
Das Gericht wertete die Eingabe als Bedrohung für die Berufung selbst, nicht bloß als peinlichen Recherchefehler.
Der Supreme Court von New Mexico verhängte die Sanktionen am 9. September 2026. Die Richter befanden Aarons der unmittelbaren Missachtung des Gerichts schuldig und ordneten an, dass er 5.000 US-Dollar an den State Bar of New Mexico Client Protection Fund zahlen muss.
Das Gericht verwies die Angelegenheit außerdem zur berufsrechtlichen Prüfung. Aarons darf nicht vor dem Supreme Court des Bundesstaats auftreten, solange dieses Verfahren anhängig ist. Diese Einschränkung unterscheidet den Fall von Vorfällen, die mit Verwarnungen oder Fortbildungen erledigt wurden.
Die bestehenden Berufungsschriften wurden gestrichen. Sandovals Berufung wurde über das System der öffentlichen Pflichtverteidigung von New Mexico der Anwältin Kim Chavez Cook übertragen. Die zugrunde liegende Berufung ist weiterhin anhängig, wie Fallberichterstattung von Reuters berichtet.
Diese Abhilfemaßnahmen erkennen zwei unterschiedliche Schäden an. Der erste betrifft das Gericht, das eine Eingabe erhielt, deren Inhalt nicht mit der Aktenlage übereinstimmte. Der zweite betrifft Sandoval, dessen direkte Berufung verzögert wurde und mit neuer Vertretung neu beginnen musste.
Sandoval hatte sich wegen des Mordes an der Mutter seiner Kinder für nicht schuldig erklärt. Er wurde 2025 verurteilt und zu lebenslanger Haft verurteilt. Seine Kapitalberufung warf Fragen zu Beweisen, der Offenlegung von Zeugen, Sachverständigenaussagen, Konfrontationsrechten und der Wirksamkeit der Prozessvertretung auf.
Die Fallliste der Justiz von New Mexico für die Sitzungsperiode bestätigt diese Berufungsfragen. Sie erforderten sorgfältige Vergleiche zwischen Prozessakte, ordnungsgemäß erhobenen Einwänden und maßgeblichem Recht.
Stattdessen, so das Gericht, enthielt die eingereichte Schrift falsche Aussagen der Polizei und Erklärungen, die Personen zugeschrieben wurden, die sie nie abgegeben hatten. Sie enthielt zudem unzutreffende Beschreibungen von Rechtsquellen.
Die Unterscheidung zwischen Beweisen und Argumenten ist entscheidend. Ein erfundener Präzedenzfall kann die Rechtsregel verzerren, die einen Fall bestimmt. Erfundenes Zeugnis kann umschreiben, was Geschworene hörten, welche Zeugen es gab und warum ein Urteil aufgehoben werden sollte.
Eine falsche Sachverhaltszusammenfassung kann dann jedes darauf aufbauende Argument kontaminieren. Ein Anspruch wegen unzureichender anwaltlicher Vertretung hängt beispielsweise davon ab, was die Vertretung getan hat und was die Akte tatsächlich enthielt. Ein erfundener Zeuge kann ein Versäumnis erzeugen, das nie stattgefunden hat.
Die Reaktion des Gerichts richtete sich daher gegen die Eingabe, den Anwalt und die Vertretung. Das Streichen der Schriftsätze beseitigte das kontaminierte Arbeitsergebnis. Die Bestellung neuer Vertretung eröffnete dem Angeklagten einen sauberen weiteren Weg. Die berufsrechtliche Überweisung verlagerte die professionellen Fragen über die Berufung hinaus.
Diese Struktur erklärt, warum die ChatGPT-Sanktionen gegen Stephen Aarons auch außerhalb von New Mexico Beachtung verdienen. Das Gericht verkündete nicht, dass Anwälte generative KI meiden müssten. Es setzte die ältere Regel durch, dass ein Anwalt für jede eingereichte Behauptung verantwortlich bleibt.
Der Vorfall stellt zudem eine vertraute Verteidigung gegen KI-Fehler auf die Probe. Aarons bezeichnete den Vorfall als ehrlichen Fehler und erklärte, er habe nicht verstanden, in welchem Ausmaß ChatGPT Fakten erfinden könne. Das Gericht konzentrierte sich stattdessen auf das nicht überprüfte Dokument, das seine Unterschrift trug.
Eine unterzeichnete Berufungsschrift ist keine Notiz zum Brainstorming. Sie ist eine formelle Erklärung gegenüber Richtern, gegnerischer Vertretung und einem Mandanten. Sobald generierter Text in dieses Dokument gelangt, mindert seine Herkunft nicht die Verantwortung des Anwalts.
Eine KI-Zusammenfassung wurde zu einer falschen Version des Prozesses
Das zentrale Versagen trat ein, als generierter Text ohne zeilenweise Überprüfung als getreue Akte behandelt wurde.
Bei einer Anhörung am 21. August erklärte Aarons, er habe ChatGPT ein computergeneriertes Transkript und weitere Fallunterlagen gegeben. Er erwartete, dass das System eine, wie er es nannte, „wasserdichte Zusammenfassung“ erstellen würde.
Diese Erwartung kehrte die angemessene Beweislast um. Ein generatives Modell erzeugt plausiblen Text aus Mustern und Kontext. Es bescheinigt nicht, dass jeder Satz in einem hochgeladenen Transkript vorkommt.
Eine KI-Halluzination ist eine überzeugend formulierte Ausgabe, die in den relevanten Beweisen oder Quellen keine Grundlage hat. Der Begriff kann harmlos klingen, doch seine Folgen hängen davon ab, wohin die Ausgabe gelangt. Eine falsche Zusammenfassung in privaten Notizen stiftet Verwirrung. Dieselbe Zusammenfassung wird in einer Berufungsschrift zu einer Erklärung gegenüber einem Gericht.
Die Schrift schrieb Danny Stanton und Linda Stanton Berichten zufolge Aussagen zu, die das Gericht als falsch einstufte. Sie bezog sich außerdem auf Mariah Chavez und Teresa Marquez in Beschreibungen zur Kleidung und zum Erscheinungsbild des Schützen. Das Gericht identifizierte Marquez als erfundene Zeugin.
Eine Passage erklärte offenbar, der Schütze habe dunkle Hosen und ein weißes Hemd getragen. Die Aussage klang wie ein gewöhnliches Sachdetail und ließ sich deshalb leicht in die größere Darstellung einfügen. Das Gericht fand jedoch keine tragfähige Grundlage in der Akte dafür.
Dies ist ein schwierigeres Problem als die Erkennung einer offensichtlich absurden Antwort. Generierter juristischer Text verwendet oft den richtigen Ton, erwartbares Vokabular und vertraute Argumentationsstrukturen. Diese Eigenschaften lassen unbelegte Details als geklärt erscheinen.
Ein Anwalt, der schnell liest, kann die Gesamtgeschichte erkennen und das erfundene verbindende Gewebe übersehen. Namen, Kleidungsbeschreibungen, Drohungen und Zeugenaussagen können mit dem umgebenden Material vereinbar wirken. Sprachliche Flüssigkeit verschleiert die fehlende Herkunftsangabe.
Der Arbeitsablauf verwischte außerdem zwei unterschiedliche Dokumente. Ein Transkript hält Aussagen und Ereignisse im Gerichtssaal fest. Eine modellgenerierte Zusammenfassung ist ein neuer Text, der aus dieser Quelle erstellt wird. Sie muss als Interpretation behandelt werden, bis jede wesentliche Behauptung zurückverfolgt ist.
Das Hochladen von Ausgangsmaterial beseitigt Halluzinationen nicht. Lange Akten können die effektive Aufmerksamkeit eines Systems übersteigen, Übertragungsfehler enthalten oder zu unbelegter Synthese verleiten. Ein Modell kann auch nahe beieinanderliegende Details zu einer Aussage verbinden, die kein Zeuge gemacht hat.
Dieses Risiko steigt, wenn Anweisungen nach einer definitiven Darstellung verlangen. Begriffe wie „vollständig“, „wasserdicht“ oder „umfassend“ können scheinbare Vollständigkeit gegenüber ausdrücklicher Unsicherheit belohnen. Die Ausgabe kann Lücken füllen, statt sie zu kennzeichnen.
Ein verlässlicher juristischer Arbeitsablauf benötigt Herkunftsnachweise auf Ebene einzelner Behauptungen. Jeder Tatsachensatz sollte auf eine Transkriptseite, ein Beweisstück, einen Docket-Eintrag oder eine gerichtliche Feststellung verweisen. Jedes Zitat sollte exakt mit der Quelle übereinstimmen. Jeder zitierte Fall sollte existieren und den behaupteten Rechtssatz stützen.
Dieser Prozess kann nicht damit enden, denselben Chatbot zu fragen, ob seine Zusammenfassung korrekt sei. Ein Generator kann seine eigene unbelegte Ausgabe mit weiteren erfundenen Erklärungen verteidigen. Die Überprüfung erfordert die Rückkehr zu unabhängigen Ausgangsmaterialien.
Die Lehre gilt über das Recht hinaus. Forschende, Analysten, Berater und Führungskräfte nutzen KI zunehmend, um lange Akten zu verdichten. Die Gefahr steigt, wenn eine Zusammenfassung zur einzigen Version wird, die spätere Prüfer sehen.
Teams müssen die ursprünglichen Beweise neben der generierten Synthese bewahren. Ein strukturierter Workflow für Wissensverknüpfung kann helfen, Notizen mit Quelldokumenten zu verbinden. Allein der Abruf stellt jedoch nicht fest, dass jede generierte Behauptung korrekt ist.
Die entscheidende Schutzmaßnahme bleibt die menschliche Überprüfung anhand maßgeblicher Unterlagen. KI kann helfen, Passagen zu finden, Themen zu strukturieren und Arbeitsnotizen zu erstellen. Sie sollte keine ungeprüfte Schlussfolgerung in eine Tatsachenbehauptung verwandeln.
Die Unterschrift des Anwalts, nicht ChatGPT, begründete die Pflicht
Der zentrale Konflikt besteht zwischen delegierter Ausarbeitung und nicht delegierbarer beruflicher Verantwortung.
Aarons sagte Reuters, dass er mehr als 40 Jahre lang Strafverteidigung praktiziert habe. Er erklärte, er sei mit dem Ausmaß von KI-Halluzinationen nicht vertraut gewesen, als er 2025 Sandovals Berufung übernahm.
„Ich bereue es, hoffe aber, dass die Disziplinarkammer berücksichtigt, dass es ein ehrlicher Fehler war“, sagte er. Er charakterisierte den Vorfall als Lehre für Fachleute, die eine instabile Technologie nutzten.
Das Gericht gelangte zu einer härteren Bewertung. In seiner Anordnung hieß es, Aarons habe eingeräumt, die Tatsachenbehauptungen oder Rechtsquellen vor Unterzeichnung und Einreichung der Schrift nicht überprüft zu haben. Es hieß außerdem, er habe seinen Mandanten nicht über diese Mängel informiert.
Die Richter stellten fest, dass er unzureichende Reue und Sorge um Sandoval gezeigt habe. Richterin C. Shannon Bacon stellte die Behauptung infrage, ein Anwalt könne über weithin berichtete KI-Fehler unwissend bleiben. Ihre Fragen unterstrichen, dass halluziniertes juristisches Material bereits zu einem wiederkehrenden öffentlichen Problem geworden war.
Diese Spannung erfordert nicht, ChatGPT als schuldlos zu behandeln. Das System erzeugte nach Angaben von Aarons und des Gerichts Sprache, die unbelegtes Material enthielt. OpenAI gab Reuters nicht sofort eine Stellungnahme zu den Sanktionen.
Ein Chatbot kann jedoch keine Prozessvertretung übernehmen, keine Berufungsschrift unterzeichnen, keinen Mandanten beraten und keiner Missachtungsanordnung antworten. Diese Pflichten liegen bei zugelassenen Rechtsanwälten. Das Rechtssystem weist die Verantwortung der Person zu, die zum Handeln befugt ist.
Die American Bar Association zog schon vor diesem Fall dieselbe grundlegende Schlussfolgerung. Ihre KI-Ethikstellungnahme besagt, dass Anwälte die Vorteile und Risiken eines generativen Werkzeugs verstehen müssen.
Formal Opinion 512 verknüpft den KI-Einsatz mit bestehenden Pflichten in Bezug auf Kompetenz, Vertraulichkeit, Mandantenkommunikation, Aufsicht, Offenheit, begründete Ansprüche und angemessene Honorare. Sie schafft keine KI-Ausnahme von diesen Pflichten.
Die Leitlinien beschreiben generative Textsysteme außerdem als Prognosewerkzeuge. Sie erzeugen statistisch wahrscheinliche Ausgaben aus Mustern in Daten. Dieses Design unterscheidet sich von einer Datenbank, die ein authentifiziertes Gerichtsdokument zurückgibt.
Ein Anwalt kann Recherche oder Entwürfe an Mitarbeiter, Rechtsanwaltsfachangestellte, Auftragnehmer und Software delegieren. Delegation verändert, wer die erste Bearbeitung übernimmt. Sie verändert nicht, wer die Arbeit beaufsichtigen oder die Eingabe überprüfen muss.
Dieser Fall zeigt, warum Offenlegung allein das Problem nicht lösen würde. Ein Hinweis wie „mit KI-Unterstützung erstellt“ könnte das Gericht aufmerksam machen, würde erfundene Aussagen jedoch nicht zutreffend machen. Richter können nicht zu Faktenprüfern für jede mithilfe von Software erstellte Eingabe werden.
Auch Werkzeugverbote stoßen auf ähnliche Grenzen. Ein Anwalt kann falsche Informationen durch fehlerhafte Erinnerung, unachtsames Diktieren, ungeschultes Personal oder gewöhnliche Copy-and-paste-Fehler einbringen. Gerichte interessiert die Genauigkeit der unterzeichneten Eingabe, unabhängig von der Produktionsmethode.
Die bessere Trennlinie betrifft die Überprüfung. KI-Unterstützung kann nützlich bleiben, wenn jede wesentliche Behauptung anhand der Akten geprüft wird. Gefährlich wird sie, wenn Sprachgewandtheit diese Prüfung ersetzt.
Die Kommunikation mit dem Mandanten fügt eine weitere Ebene hinzu. Ein strafrechtlicher Berufungskläger sollte verstehen, wenn eine fehlerhafte Einreichung die Berufung gefährdet hat. Nach Auffassung des Gerichts informierte Aarons Sandoval nicht über die tatsächlichen und rechtlichen Falschdarstellungen in der Berufungsschrift.
Dieses Versäumnis ist bedeutsam, weil der Mandant die praktischen Folgen trägt. Dem Anwalt drohen Sanktionen und berufsrechtliche Maßnahmen, doch der Berufungskläger erlebt Verzögerungen, Unsicherheit und ein gestörtes Vertrauensverhältnis zum Rechtsbeistand.
Berufliche Verantwortung muss daher den gesamten Arbeitsablauf erfassen. Sie beginnt mit der Auswahl eines geeigneten Werkzeugs und dem Schutz vertraulicher Informationen. Sie setzt sich über die Validierung von Quellen, die inhaltliche Prüfung, die Kommunikation mit dem Mandanten und die abschließende Bestätigung fort.
ChatGPT Fake Witnesses Überschritten eine gefährlichere Grenze
Erfundene Aussagen verschieben KI-Halluzinationen von fehlerhafter Recherche hin zur Verfälschung der Beweisakte.
Der bekannteste frühe Sanktionsfall betraf Mata v. Avianca. Anwälte reichten in einem bundesrechtlichen Personenschadensverfahren nicht existente, durch ChatGPT erzeugte Gerichtsentscheidungen ein. Ein Richter verhängte 2023 eine Geldstrafe von 5.000 US-Dollar.
Der Fall etablierte eine dauerhafte Warnung. Ein Chatbot kann Fallnamen, Zitate, Aktenzeichen und juristische Begründungen erfinden. Gerichte erwarten von Anwälten, dass sie solche Quellen über anerkannte Recherche-Systeme bestätigen.
Der Vorfall in New Mexico erweitert das Problem. Aarons’ Schriftsatz soll erfundene Zeugen und falsche Beschreibungen von Aussagen enthalten haben. Diese Fehler stellten nicht nur falsch dar, was ein anderes Gericht entschieden hatte. Sie schufen Tatsachen innerhalb des eigenen Falls des Mandanten.
Berufungsgerichte überprüfen in der Regel eine bestehende Akte. Sie führen kein neues Verfahren durch und akzeptieren faktische Ergänzungen eines Anwalts nicht als Beweise. Schriftsätze müssen ihre Darstellung auf Protokolle, Beweisstücke, Entscheidungen und ordnungsgemäß festgehaltene Einwände stützen.
Ein erfundenes tatsächliches Detail kann beeinflussen, wie Richter eine Benachteiligung verstehen. Es kann ausgeschlossene Beweise wichtiger erscheinen lassen, ein Identifizierungsargument stärken oder den scheinbaren Wert eines Kreuzverhörs verändern. Diese Effekte können selbst nach einer Korrektur fortbestehen.
Das Problem belastet auch die Gegenseite. Staatsanwälte müssen den Schriftsatz mit der Akte vergleichen und Abweichungen identifizieren. Richter und Geschäftsstellenmitarbeiter müssen feststellen, ob eine ungewöhnliche Aussage einen echten Protokollauszug oder generierte Fiktion darstellt.
Diese Überprüfungskosten verteilen sich über das gesamte System. Ein Anwalt kann Zeit beim Entwurf sparen, während er Prüfaufwand auf das Gericht, die Gegenpartei, Ersatzanwälte und den Mandanten verlagert. Sanktionen sollen diese Kosten wieder dem verantwortlichen Berufsträger zuweisen.
Eine Mordberufung in Georgia aus dem Jahr 2026 zeigte einen weiteren Weg der Verfälschung. In Payne v. State erschienen fiktive oder falsch zugeordnete Zitate in einem Schriftsatz der Staatsanwaltschaft und in einem vom erstinstanzlichen Gericht unterzeichneten Entscheidungsentwurf.
Die Payne decision hob die Entscheidung des erstinstanzlichen Gerichts auf und verwies die Sache zur erneuten Entscheidung zurück. Der Vorfall zeigte, wie generierte Fehler aus dem Entwurf eines Prozessvertreters in ein gerichtliches Dokument gelangen können.
Dieses Migrationsrisiko macht die Herkunftsnachverfolgung unerlässlich. Juristische Dokumente werden häufig für Anträge, Entscheidungsentwürfe, interne Vermerke und Berufungsschriftsätze wiederverwendet. Sobald eine unbelegte Passage in diese Kette gelangt, könnten spätere Verfasser annehmen, dass sie bereits geprüft wurde.
Die Einreichung in New Mexico scheint einer ähnlichen Vertrauensabkürzung gefolgt zu sein. Aarons nutzte ChatGPT, um eine verdichtete Darstellung des Verfahrens zu erstellen. Anschließend stützte er sich auf diese Darstellung, ohne vollständig zum Protokoll zurückzukehren.
Das entstandene Dokument hatte die äußere Form anwaltlicher Berufungsvertretung. Es benannte Zeugen, beschrieb Aussagen, berief sich auf Präzedenzfälle und verknüpfte Tatsachen mit rechtlichen Ansprüchen. Diese Form ließ den Inhalt professionell geprüft erscheinen.
Deshalb bietet „human in the loop“ für sich genommen wenig Gewähr. Ein Mensch kann einen Entwurf überfliegen, Grammatik korrigieren und dennoch faktische Erfindungen übersehen. Der Ausdruck ist nur dann aussagekräftig, wenn der Prüfer Zeit, Fachkenntnis und direkten Zugang zu den Quellen hat.
Wirksame Prüfung braucht zudem sichtbare Grenzen zwischen Quelltext und generiertem Text. Zitierte Protokollpassagen sollten Seitenverweise behalten. Zusammenfassungen sollten die zugrunde liegenden Bereiche benennen. Unbelegte Modellkommentare sollten außerhalb der Tatsachendarstellung bleiben.
In Fällen mit hohem Risiko sollte ein zweiter Prüfer das Dokument unabhängig kontrollieren. Dieser Prüfer sollte Quellen risikobasiert stichprobenartig prüfen und die Kontrolle ausweiten, sobald eine Abweichung auftaucht. Erfunde Namen sollten eine Überprüfung jeder Tatsachenbehauptung auslösen.
Dasselbe Prinzip gilt für Rechtsquellen. Prüfer müssen jede zitierte Entscheidung öffnen und die zitierte Sprache, Entscheidungsaussage, Zuständigkeit und Relevanz bestätigen. Ein realer Fall, der für eine falsche Aussage angeführt wird, bleibt ein schwerwiegender Fehler.
Die ChatGPT-Sanktionen gegen Stephen Aarons zeigen, dass Gerichte über die Neugier hinausgehen, welches Werkzeug einen Fehler verursacht hat. Die operative Frage lautet, ob der Anwalt Kontrollen geschaffen hat, die stark genug sind, um zu verhindern, dass generierte Fiktion als eingereichte Tatsache erscheint.
Die Sanktionen Beweisen Nicht, Dass KI Keinen Platz in der Rechtsarbeit Hat
Die stärkste Kritik richtet sich gegen unkontrollierte Abhängigkeit, nicht gegen jede Nutzung generativer KI durch Anwälte.
Es wäre einfach, diesen Fall als Beleg dafür zu behandeln, dass Juristen ChatGPT niemals nutzen sollten. Diese Schlussfolgerung geht über die Feststellungen des Gerichts hinaus und ignoriert die Bandbreite der Aufgaben, die unter „KI-Nutzung“ zusammengefasst werden.
Ein Modell kann dabei helfen, Themenlisten zu erstellen, von Anwälten verfasste Notizen neu zu ordnen, Dokumentstrukturen zu vergleichen oder Suchbegriffe vorzuschlagen. Diese Anwendungen erfordern weiterhin Urteilsvermögen, bergen aber nicht alle dasselbe Risiko wie die Zusammenfassung eines Mordprozessprotokolls.
Das Risiko hängt vom Zweck und Ziel des Ergebnisses ab. Eine private Gliederung ist vorläufig. Ein Mandantenschreiben erfordert sorgfältige Prüfung. Eine Tatsachenbehauptung in einer strafrechtlichen Berufung verlangt eine Überprüfung anhand der offiziellen Akte.
Auch Werkzeuge unterscheiden sich. Ein allgemeiner Chatbot erzeugt offene Texte, während einige juristische Systeme aus begrenzten Datenbanken abrufen und unterstützende Quellen anzeigen. Selbst Systeme mit Zitaten können falsch zitieren, falsch lesen oder irrelevantes Material auswählen.
Das Gericht in New Mexico führte keine wissenschaftliche Bewertung der Zuverlässigkeit von ChatGPT durch. Es untersuchte das Verhalten eines Anwalts und einen fehlerhaften Schriftsatz. Leser sollten diese Feststellung nicht in eine universelle Fehlerquote umdeuten.
Der Fall beweist auch nicht, dass KI jeden Mangel eigenständig verursacht hat. Aarons wählte die Materialien aus, gab dem System Anweisungen, nutzte dessen Ausgabe und unterzeichnete das Ergebnis. Öffentliche Berichte enthalten weder den vollständigen Verlauf der Eingaben noch jeden Zwischenentwurf.
Diese Ungewissheit ist wichtig. Ohne die vollständige Interaktionsakte können Beobachter nicht rekonstruieren, welche Behauptungen das Modell erzeugte, welche Passagen Aarons bearbeitete oder ob Mängel im Protokoll beigetragen haben. Die gerichtliche Anordnung begründet Verantwortung, nicht aber eine vollständige technische Ursachenanalyse.
Dennoch entschuldigen diese Lücken die eingereichten Ungenauigkeiten nicht. Sie verdeutlichen, welche Produkt- und Prozessfragen offen bleiben. Bessere Protokollierung könnte Kanzleien helfen festzustellen, wie eine unbelegte Aussage in ein Dokument gelangte.
Anbieter juristischer KI können Risiken senken, indem sie jedem Tatsachensatz Quellenverweise beifügen. Sie können warnen, wenn einer Antwort Belege fehlen, Zitate von Zusammenfassungen trennen und Exporte mit ungeklärten Zitaten blockieren.
Solche Kontrollen würden helfen, können aber eine inhaltliche Prüfung nicht ersetzen. Ein Quellenlink kann auf ein echtes Dokument verweisen, das die generierte Behauptung nicht stützt. Automatisierung kann die Überprüfung erleichtern, ohne sie optional zu machen.
Anwaltskanzleien benötigen zudem Richtlinien, die sich an der Sensibilität der Aufgabe orientieren. Die Zusammenfassung öffentlich zugänglicher Hintergrundinformationen hat nicht dieselben Folgen wie die Auslegung privilegierter Beweise. Der Entwurf einer routinemäßigen Checkliste unterscheidet sich von der Beschreibung umstrittener Aussagen.
Eine praktische Richtlinie sollte verbotene Eingaben, zugelassene Systeme, Aufbewahrungsregeln, Prüfstandards und Eskalationspunkte benennen. Sie sollte festlegen, wer Zitate prüft und wer Tatsachenbehauptungen mit der Akte abgleicht.
Schulungen müssen über das Zeigen hinausgehen, wie Anwälte Eingabeaufforderungen formulieren. Nutzer müssen selbstsichere Fehler, Kontextgrenzen, unvollständigen Abruf, Datenoffenlegung und Automatisierungsbias verstehen. Automatisierungsbias tritt auf, wenn Menschen Ergebnissen übermäßig vertrauen, weil sie von einem System erzeugt wurden.
Auch Zeitdruck verdient Aufmerksamkeit. KI verspricht schnellere Entwürfe, doch die Überprüfung kann einen Teil dieses Gewinns aufzehren. Kanzleien müssen Prüfzeit ehrlich einplanen, statt anzunehmen, der erste sprachlich überzeugende Entwurf sei nahezu fertig.
Vorgesetzte sollten Erfolg auch nicht allein über Geschwindigkeit messen. Dieser Anreiz ermutigt Mitarbeitende, Unsicherheit zu verbergen und Quellenprüfungen auszulassen. KI-Arbeit mit hohem Risiko benötigt Genauigkeitsmetriken, die an Belege gebunden sind.
Die skeptische Schlussfolgerung ist daher enger und stärker. Generative KI kann Rechtsarbeit unterstützen, aber nur, wenn Kanzleien ihre Ausgabe als ungeprüften Entwurf behandeln. Die Person, die das Dokument einreicht, muss weiterhin jede wesentliche Behauptung selbst belegen können.
Worauf Gerichte und Rechtsteams Als Nächstes Achten Sollten
Der nächste Test lautet, ob Sanktionen nachweisbare Veränderungen der Arbeitsabläufe in der Rechtspraxis bewirken.
Das erste Signal wird aus dem Disziplinarverfahren gegen Aarons kommen. Die Kammer in New Mexico kann Kompetenz, Offenheit, Mandantenkommunikation und die Umstände rund um die Einreichung untersuchen.
Eine öffentliche Disziplinarentscheidung würde klären, ob das Gericht den Vorfall als isolierte Fahrlässigkeit oder als weitergehendes berufliches Fehlverhalten betrachtet. Eine strengere Strafe würde die Anordnung wegen unmittelbarer Missachtung des Gerichts verstärken. Eine begrenzte Abhilfe würde Sanierung und Absicht betonen.
Das Verfahren könnte auch Informationen offenlegen, die in Nachrichtenberichten fehlen. Ermittler können den Entwurfsprozess, die Kommunikation mit Sandoval, die Behandlung des Protokolls und den Zeitpunkt von Aarons’ Entdeckung untersuchen. Diese Tatsachen werden den Wert des Falls als Präzedenzfall bestimmen.
Das zweite Signal wird Sandovals Berufung mit neuem Rechtsbeistand sein. Neue Anwälte müssen die Argumente anhand der tatsächlichen Akte neu aufbauen, nachdem die früheren Schriftsätze gestrichen wurden. Dieser Prozess wird zeigen, wie groß der durch das erfundene Material verursachte inhaltliche Schaden war.
Wenn der korrigierte Schriftsatz ähnliche rechtliche Ansprüche mit authentischen Belegen erhebt, wird der Vorfall wie ein schweres Versagen des Arbeitsablaufs mit einer rettbaren Berufung erscheinen. Wenn sich die Ansprüche wesentlich verändern, hat die KI-Zusammenfassung wahrscheinlich die Theorie des Falls verzerrt.
Ebenso wichtig ist die letztliche Behandlung Sandovals durch das Gericht. Die Sanktionierung des Rechtsbeistands schützt die institutionelle Integrität, doch das System muss vermeiden, den Mandanten für die fehlerhafte Einreichung eines Anwalts zu bestrafen. Neue Vertretung begegnet diesem Risiko, ohne jede Verzögerung aufzulösen.
Das dritte Signal wird die Einführung belegverknüpfter Entwurfskontrollen sein. Gerichte können Bestätigungen verlangen, während Kanzleien Protokollzitate für jede Tatsachenbehauptung fordern können. Anbieter können die Quelle hinter jeder generierten Passage sichtbar machen.
Die nützlichsten Kontrollen werden prüfbar sein. Ein Kontrollkästchen, das erklärt, jemand habe den Entwurf geprüft, bietet begrenzten Schutz. Eine Behauptungskarte, die jede Aussage mit einer Protokollseite verknüpft, schafft einen Nachweis tatsächlicher Überprüfung.
Gerichte werden auch entscheiden, ob bestehende Berufsregeln ausreichend Durchsetzungsmöglichkeiten bieten. Der ABA-Rahmen deckt bereits Kompetenz, Offenheit, Aufsicht und Vertraulichkeit ab. Die Anordnung aus New Mexico legt nahe, dass Richter handeln können, ohne KI-spezifische Pflichten zu schaffen.
Neue Regeln haben dennoch potenziellen Wert, wenn sie Verfahren definieren. Sie können für bestimmte Nutzungen Offenlegung, die Aufbewahrung generierter Entwürfe oder eine persönliche Bestätigung von Zitaten und Quellen verlangen. Die Offenlegung sollte jedoch die Überprüfung unterstützen, statt sie zu ersetzen.
Die gesamte Branche sollte auf wiederholte faktische Erfindungen in Strafsachen achten. Gefälschte Präzedenzfälle sind inzwischen vertraut. Erfundenes Zeugnis stellt eine unmittelbarere Herausforderung für die Integrität von Berufungsakten dar.
Für Wissensarbeiter ist die unmittelbare Maßnahme einfach, aber anspruchsvoll: Jede generierte Tatsachenbehauptung identifizieren, die maßgebliche Quelle erneut prüfen und dokumentieren, wo sich die Belege finden. Jede Abweichung eskalieren, bevor der Text einen Kunden, eine Aufsichtsbehörde, eine Führungskraft oder ein Gericht erreicht.
Die Stephen-Aarons-Sanktionen im Zusammenhang mit ChatGPT sind keine Warnung vor unvollkommener Prosa. Sie zeigen, was geschieht, wenn eine KI-generierte Zusammenfassung zu einem undokumentierten Ersatz für Beweise wird.
Stellen Sie sich vor, bevor Sie sich auf eine generierte Darstellung verlassen, eine Frage: Kann ein anderer Prüfer jeden folgenreichen Satz zu einer maßgeblichen Quelle zurückverfolgen? Wenn die Antwort nein lautet, ist der Entwurf nicht fertig. Erstellen Sie den Prüfpfad jetzt, bewahren Sie die Originalunterlagen auf und geben Sie Prüfern ausreichend Zeit, flüssig formulierte Sprache infrage zu stellen. Der nächste schwerwiegende KI-Fehler wird wahrscheinlich plausibel wirken, bevor er sich als falsch erweist.



