Claude Opus 5.5: Schreibmuster haben sich verändert, sind aber nicht verschwunden
Die Schreibmuster von Claude Opus 5.5 haben Anthropics Stilüberarbeitung überstanden, obwohl das Modell Gedankenstriche 99 % seltener verwendet. Das stärkste Signal ist nun „zuverlässig“, das in vom Modell verfassten Artikeln 23-mal häufiger vorkam als in vergleichbaren menschlichen Texten.
Dieses Ergebnis stammt aus Graphites Analyse von Artikeln zu 9.974 abgeglichenen Themen. Die Forschenden identifizierten 2.548 Wörter, Formulierungen und Satzmuster, die Opus 5.5 mindestens doppelt so häufig verwendete wie menschliche Autoren.
Das Ergebnis verkompliziert Anthropics Behauptung, Opus 5.5 kommuniziere natürlicher. Sein Wortschatz rückte messbar näher an menschliches Schreiben heran, doch Tausende statistische Unterschiede blieben bestehen. Das Modell verlor seinen sprachlichen Fingerabdruck nicht. Es tauschte mehrere vertraute Gewohnheiten gegen eine neue Sammlung von Präferenzen aus.
OpenAIs GPT-6 Astra zeigte ein weiteres, eigenständiges Muster. Es schränkte Behauptungen häufiger ein und setzte stärker auf korrigierende Einordnungen, während Opus Superlative und Aussagen über Bedeutung bevorzugte. Der Vergleich macht die Erkennung von AI-Texten zu einem Problem mit beweglichem Ziel. Jede Modellversion verändert die Indizien, von denen Redakteure, Lehrkräfte und Leser glauben, sie wiederzuerkennen.
Eine 23-fache Präferenz offenbarte das neue Opus-Muster
Die jüngsten Schreibmuster von Claude Opus 5.5 sind gewöhnliche Wörter, die durch Wiederholung ungewöhnlich werden.
Graphite veröffentlichte sein Opus-5.5-Update, nachdem Anthropic das Modell am 22. September 2026 vorgestellt hatte. Die Untersuchung erweiterte eine frühere Analyse über zehn AI-Modelle und eine menschliche Kontrollsammlung.
Die Forschenden verwendeten 9.974 Themen, zu denen jedes Modell und das menschliche Korpus einen entsprechenden Artikel enthielten. Die menschlichen Artikel wurden vor der Veröffentlichung von ChatGPT publiziert, wodurch sich die Wahrscheinlichkeit verringerte, dass diese Stichproben nicht gekennzeichnete generative AI-Ausgaben enthielten.
Jedes Modell erhielt eine Zusammenfassung und verfasste einen neuen Artikel über dasselbe Thema. Dieser Ansatz reduzierte thematische Unterschiede, konnte jedoch nicht jeden Effekt durch Prompting oder Quellenwahl ausschließen.
Anschließend verglichen die Forschenden längennormalisierte Häufigkeiten von Wörtern und Phrasen. Sie untersuchten außerdem Frames, also wiederkehrende Sprachmuster mit Lücken, die bis zu drei Wörter enthalten können.
Nach Graphites Definition erscheint ein Schreibmerkmal mindestens doppelt so häufig in AI-Texten wie in der menschlichen Sammlung. Häufigkeitsfilter schließen Ausdrücke aus, die nur in einer Handvoll Dokumente vorkommen.
Die daraus resultierende Studie zu AI-Texten fand 2.548 Merkmale von Opus 5.5. Das waren nur 4 % weniger als die 2.666 für Opus 5 erfassten Merkmale.
„Zuverlässig“ führte die wertenden Adjektive des Modells mit dem 23-Fachen der menschlichen Rate an. „Beständig“ erschien 11-mal so häufig, während „durchdacht“ neunmal so häufig vorkam. „Bedeutungsvoll“ erreichte das Achtfache der menschlichen Rate.
Diese Wörter sind nicht von sich aus künstlich. Ein menschlicher Autor kann einen Dienst vernünftigerweise als zuverlässig bezeichnen oder eine Antwort als durchdacht beschreiben. Ihr Aussagewert liegt im Gesamtverhalten, nicht in einzelnen Vorkommen.
Auch die Überleitungssprache war auffällig. „Mit Blick auf die Zukunft“ erschien 40-mal so häufig wie bei Menschen. „Fügt eine weitere Ebene hinzu“ erreichte das 27-Fache, und „was als Nächstes kommt“ das 24-Fache.
Opus 5.5 behielt zudem seine Vorliebe für Kontraste. Das Muster „ist mehr als ein _ es“ erschien 98-mal so häufig wie in menschlichen Artikeln. „Anstatt einfach“ erreichte das 32-Fache der menschlichen Rate.
Seine stärkste Kategorie betraf das Hervorheben von Bedeutung. „Das ist wichtig“ erschien 116-mal so häufig wie in der menschlichen Sammlung. „Warum _ wichtig ist“ erschien 92-mal so häufig.
Diese Zahlen bedeuten nicht, dass jeder Opus-Artikel diese Formulierungen enthält. Sie beschreiben die relative Häufigkeit in einem großen, kontrollierten Korpus. Eine seltene Phrase kann einen hohen Quotienten erzeugen, wenn Menschen sie fast nie verwenden.
Dieser Unterschied ist wichtig für alle, die versucht sind, einen einzelnen Ausdruck als Beweis zu behandeln. Die Studie kartiert Gewohnheiten auf Populationsebene. Sie liefert kein verlässliches Urteil über die Autorschaft eines einzelnen Absatzes, einer E-Mail oder eines studentischen Essays.
Die am besten begründbare Schlussfolgerung ist enger gefasst. Opus 5.5 greift wiederholt auf bestimmte wertende und strukturierende Formulierungen zurück, wenn es Zusammenfassungen in Artikel verwandelt. Diese Präferenzen bleiben selbst nach einer umfassenden Stilüberarbeitung sichtbar.
Die vertrauten Merkmale von AI-Texten sind bereits überholt
Der Gedankenstrich ist keine nützliche Abkürzung mehr, weil sich das Modellverhalten schneller verändert hat als populäre Erkennungsratschläge.
Mehrere Jahre lang betrachteten Leser Gedankenstriche als informelles Kennzeichen generierter Texte. Das Satzzeichen wurde mit Claude assoziiert, weil frühere Versionen es häufig verwendeten.
Opus 5.5 hat diese Gewohnheit weitgehend aufgegeben. Graphite maß 0,015 Gedankenstriche pro 1.000 Wörter, verglichen mit 2,92 bei Opus 5. Das entspricht einem Rückgang von rund 99 %.
Eine separate Bewertung ergab ein ähnliches Ergebnis in dieselbe Richtung. Ein Arize-Forscher generierte mit Opus 5.5 57.000 Wörter und fand nur zwei Gedankenstriche. Seine Opus-5-Stichprobe erzeugte 12,9 pro 1.000 Wörter.
Dieser kleinere unabhängige Schreibtest verwendete 20 eingefrorene Briefings aus fünf Genres und fünf Themenbereichen. Der Forscher markierte manuell 153 Beispiele, bevor er einen automatisierten Evaluator entwickelte.
Der Datensatz war deutlich kleiner als Graphites Korpus, prüfte Anthropics überarbeitetes Modell jedoch direkt gegen seinen Vorgänger. Er stellte fest, dass andere erkennbare „Claudismen“ ungefähr um die Hälfte zurückgingen, statt zu verschwinden.
Die Veränderung schafft eine unbequeme Umkehrung. Menschliche Autoren riskieren nun Verdacht wegen eines Satzzeichens, das aktuelle Spitzenmodelle selten verwenden.
Ein Modellentwickler kann eine offensichtliche Gewohnheit durch Post-Training, Systemanweisungen oder Präferenzen für generierte Ausgaben unterdrücken. Nutzer können mit einem Satz im Prompt auch andere Zeichensetzung anfordern.
Das macht oberflächliche Hinweise fragil. „Delve“, Gedankenstriche, ordentliche dreiteilige Listen und geschliffene Schlussfolgerungen können einen Stil beschreiben. Keines davon beweist Urheberschaft.
Dasselbe Problem betrifft kommerzielle AI-Detektoren. Ein Klassifikator, der auf den Modellen von gestern trainiert wurde, kann an Genauigkeit verlieren, nachdem ein Anbieter das Ausgabeverhalten verändert. Das zugrunde liegende Modell kann denselben Namen behalten, während sich sein Stil durch ein Update verschiebt.
Falschpositive haben reale Folgen. Eine Lehrkraft könnte einen Schüler beschuldigen, der von Natur aus formell schreibt. Ein Redakteur könnte die charakteristische Zeichensetzung eines Autors glätten, um automatisierten Verdacht zu vermeiden.
Falschnegative lassen sich ebenso leicht erzeugen. Ein Nutzer kann unregelmäßige Satzlängen anfordern, bevorzugte Formulierungen entfernen oder ein zweites Modell bitten, die erste Ausgabe umzuschreiben. Menschliche Bearbeitung kann offensichtliche Muster tilgen, ohne den Ursprung des Textes zu verändern.
Die praktische Antwort besteht darin, Herkunft, faktische Belege und Überarbeitungshistorie gemeinsam zu bewerten. Stilistische Indizien können eine genauere Prüfung auslösen, sollten den Fall aber nicht allein entscheiden.
Für professionelle Teams bedeutet das, Quellennotizen und Entwürfe aufzubewahren. Eine durchsuchbare persönliche Wissensdatenbank kann dabei helfen, Behauptungen mit ihren Belegen zu verbinden und zu dokumentieren, wie ein Dokument entstanden ist.
Dieser Arbeitsablauf behandelt das tatsächliche Qualitätsrisiko. Nicht offengelegte AI-Nutzung kann relevant sein, doch unbelegte Behauptungen und fehlende Verantwortlichkeit schaffen meist das größere operative Problem.
Graphites Ergebnisse schwächen daher das Argument für einfache Erkennungsregeln. Sie stärken das Argument für Prozessbelege, redaktionelle Prüfung und transparente Richtlinien.
Anthropic verbesserte den Stil, ohne den Fingerabdruck zu löschen
Opus 5.5 rückte statistisch näher an menschliches Schreiben heran und behielt dabei fast ebenso viele messbare Merkmale wie Opus 5.
Anthropic stellte Opus 5.5 mit einer klaren Kommunikationsbehauptung vor. Das Unternehmen erklärte, das Modell schreibe natürlicher, platziere wichtige Informationen zuerst und vermeide mehr Jargon sowie eigenwillige Formulierungen.
Frühe Tester fanden den Text Berichten zufolge klarer und leichter nachvollziehbar. Anthropic stellte bessere Kommunikation zudem als Sicherheitsvorteil dar, weil Leser die Arbeit des Modells leichter prüfen könnten.
Graphites Ergebnisse stützen diese Position teilweise. Die Forschenden maßen die Abweichung der Wortverteilung mithilfe der Jensen-Shannon-Divergenz, einer Statistik zum Vergleich zweier Wahrscheinlichkeitsverteilungen.
Ein Wert von null würde eine identische Wortverwendung anzeigen. Ein Wert von eins würde bedeuten, dass es keine Überschneidung gibt.
Opus 5 erzielte gegenüber menschlichem Schreiben 0,064. Opus 5.5 fiel auf 0,052, ein Rückgang um 19 %. Das bedeutet, dass sich seine gesamte Wortverteilung dem menschlichen Korpus annäherte.
Auch bei „manierierter Prosa“ verbesserte sich das Modell; Anthropic definiert dies als Sprache, die direkte Aussagen durch Ausschmückung oder Metaphern ersetzt. Graphite berichtete für Opus 5.5 einen Wert von 10,57, 37 % weniger als die 16,75 von Opus 5.
Menschliche Artikel erzielten 6,65. GPT-6 Astra erzielte 7,91. Opus verbesserte sich somit deutlich, blieb jedoch manierierter als beide Vergleichsgruppen.
Das Ergebnis zur manierierten Prosa erfordert eine vorsichtige Interpretation. Graphite setzte Claude Opus 5 selbst ein, um eine Teilstichprobe von 1.000 abgeglichenen Themen auf einer Skala von null bis 100 zu bewerten.
Der Evaluator wusste nicht, welches Modell den jeweiligen Artikel erstellt hatte. Dennoch spiegelt sein Urteil die Interpretation eines anderen Modells wider und keine mechanische Messung.
Die Zahl der Merkmale erzeugt die zentrale Spannung. Opus 5.5 wies eine bessere allgemeine Ähnlichkeit im Wortschatz auf, doch seine 2.548 Merkmale lagen nur 4 % unter dem Gesamtwert von Opus 5.
Diese Ergebnisse messen unterschiedliche Eigenschaften. Verteilungsähnlichkeit fragt, wie der gesamte Wortschatz mit menschlichem Schreiben verglichen wird. Eine Merkmalzählung fragt, wie viele konkrete Muster einen Häufigkeitsschwellenwert überschreiten.
Ein Modell kann sich beim ersten Maß verbessern, ohne das zweite zu beseitigen. Breite Wortschatzentscheidungen können menschlicher werden, während engere Gewohnheiten weiterhin stark konzentriert bleiben.
Anthropics Ankündigung zu Opus 5.5 hob auch eine stärkere Leistung bei Wissensarbeit hervor. In einer internen Forschungsaufgabe erfüllten 16 von 18 Berichten über verschiedene Aufwandsstufen hinweg einen strengen Qualitätsschwellenwert.
Anthropic erklärte, eine erfundene Zahl oder ein erfundenes Zitat würde dazu führen, dass ein Bericht durchfällt. Frühere Opus- und Fable-Modelle hätten diese Hürde laut dem Unternehmen in keinem Versuch genommen.
Diese internen Ergebnisse sind relevant, weil natürliche Prosa und verlässliche Recherche getrennte Dimensionen sind. Eine wiederholte Formulierung macht einen Bericht nicht faktisch falsch. Menschlich klingende Sprache macht eine Behauptung nicht korrekt.
Das übergeordnete Argument des Unternehmens betrifft die Nutzbarkeit. Klareres Schreiben kann die Prüfzeit verkürzen, selbst wenn ein Redakteur wiederkehrende Stilmerkmale weiterhin erkennen kann.
Graphites Forschung widerlegt diese Verbesserung nicht. Sie setzt ihr eine Grenze. Opus 5.5 wirkt im Aggregat menschlicher, doch „menschlicher“ ist nicht gleichbedeutend mit nicht unterscheidbar.
Opus und Astra hinterlassen unterschiedliche sprachliche Fingerabdrücke
Der entscheidende Wettbewerb besteht nicht zwischen menschlicher Prosa und einem festen AI-Stil, sondern zwischen sich verändernden Modell-Fingerabdrücken und stabilen Erkennungsannahmen.
GPT-6 Astra schnitt nicht einfach besser oder schlechter ab als Opus 5.5. Es zeigte eine andere Sammlung von Gewohnheiten.
Astra schränkte Behauptungen häufiger ein. „Kann bereitstellen“ erschien bei Astra 18-mal so häufig wie bei Opus 5.5. „Nicht unbedingt“ erschien 17-mal so häufig.
Die Formulierung „belegt nicht“ zeigte einen noch größeren Unterschied und erreichte das 275-Fache der Opus-5.5-Rate. Diese Muster legen nahe, dass Astra eine Behauptung häufig mit ausdrücklichen Einschränkungen absichert.
Opus 5.5 setzte stärker auf Superlative. Im Vergleich mit Astra verwendete es „das beliebteste“ 45-mal so häufig und „das leistungsstärkste“ 24-mal so häufig.
„Vielleicht das am meisten“ erschien 29-mal so häufig. Der Frame „eines der besten _ an“ erreichte das 79-Fache der Astra-Rate.
Dieser Kontrast beeinflusst den Ton. Astra kann vorsichtig oder korrigierend klingen. Opus kann bewertender und selbstbewusster wirken, insbesondere wenn es Wichtigkeit zuschreibt.
Graphites CEO Ethan Smith beschrieb das Muster als Unterschied statt als stetigen Fortschritt. Jedes neue Modell kann in einer Dimension besser werden und zugleich einen anderen, wiedererkennbaren Duktus entwickeln.
Die berichtete Branchenberichterstattung kam zum gleichen Schluss. Ein Modellvergleich stellte fest, dass die Studie zehn Modelle zu denselben 9.974 Themen untersuchte.
Die Wortverteilung von Opus 5.5 rückte näher an die von Menschen heran. Astra entfernte sich davon und stieg von 0,101 bei GPT-5.6 Sol auf 0,109.
Dennoch erzeugte Astra weniger manierierte Prosa als Opus. Das verhindert eine einfache Rangfolge auf Grundlage eines einzigen Werts.
Ein Nutzer könnte Astros Direktheit bevorzugen, aber seine vorsichtige Absicherung ablehnen. Ein anderer könnte den Lesefluss von Opus bevorzugen und beim Editieren unnötige Superlative entfernen.
Die Ergebnisse erschweren auch die Zuordnung zu einem Modell. Ein Textabschnitt kann Merkmale mehrerer Systeme enthalten, weil Nutzer Werkzeuge in einem Arbeitsablauf kombinieren.
Ein Modell könnte recherchieren, ein anderes einen Entwurf erstellen und ein drittes ihn bearbeiten. Anschließend könnte ein Mensch das Ergebnis vor der Veröffentlichung überarbeiten.
Prompts fügen eine weitere Ebene hinzu. Das ausdrückliche Verbot einer Formulierung kann deren Häufigkeit verändern. Die Aufforderung zu vorsichtiger wissenschaftlicher Sprache kann Opus in einer Dimension Astra ähneln lassen.
Feinabgestimmte Systeme und Anweisungen auf Anwendungsebene sorgen für weitere Variationen. Die für einen Nutzer sichtbare Ausgabe kann das Modell des Anbieters, den System-Prompt der Anwendung und die Anfrage des Nutzers widerspiegeln.
Deshalb ist die Bezeichnung „KI-Stil“ zu weit gefasst geworden. Spitzenmodelle teilen keine stabile einheitliche Stimme mehr, selbst wenn sie einige vertraute Strukturen wiederholen.
Der Wettbewerbsdruck betrifft Modelllabore und Anbieter von KI-Erkennung gleichermaßen. Labore wollen Prosa, die sich an die Absicht der Nutzer anpasst. Anbieter von Erkennungssystemen benötigen Systeme, die schnelle Modelländerungen überstehen.
Redaktionen stehen unter einem weiteren Druck. Sie müssen zwischen harmloser stilistischer Wiederholung und Mängeln unterscheiden, die Genauigkeit, Klarheit oder Vertrauen beeinträchtigen.
Ein Satz wie „Das ist wichtig“ kann unerquicklich sein, ist aber nicht automatisch falsch. Ein eleganter Satz mit einer erfundenen Quelle ist weitaus gravierender.
Die nützliche Lehre besteht nicht darin, nach einem einzelnen Ersatzmerkmal zu suchen. Es geht darum zu erkennen, dass generierte Prosa wechselnde statistische Signaturen trägt, von denen keine redaktionelles Urteilsvermögen ersetzen sollte.
Die Studie kann nicht feststellen, wer einen einzelnen Text verfasst hat
Graphite maß Unterschiede auf Korpusebene, keinen forensischen Test für einzelne Dokumente oder Autoren.
Der Umfang der Studie macht ihre aggregierten Erkenntnisse überzeugend. Ihr Aufbau setzt zugleich Grenzen dafür, wie diese Erkenntnisse genutzt werden sollten.
Erstens konzentrierte sich das Experiment auf die Artikelerstellung aus Zusammenfassungen. Es beschreibt nicht automatisch E-Mails, Belletristik, juristische Analysen, Schulaufsätze oder lockere Gespräche.
Unterschiedliche Aufgaben verändern die Sprache eines Modells. Ein technischer Bericht kann naturgemäß mehr Einschränkungen enthalten. Marketingtexte können naturgemäß mehr Superlative enthalten.
Zweitens entstanden die menschlichen Kontrollartikel vor ChatGPT. Das schützt die Ausgangsbasis vor offensichtlicher Verunreinigung, führt aber einen zeitlichen Unterschied ein.
Redaktionelle Konventionen ändern sich. Suchmaschinenoptimierung ändert sich. Verlage verändern Überschriftenstrukturen, Absatzlängen und bevorzugte Zeichensetzung.
Einige den Modellen zugeschriebene Unterschiede könnten teilweise das heutige Schreibumfeld widerspiegeln. Das thematisch abgestimmte Design von Graphite reduziert inhaltliche Verzerrungen, kann aber nicht jeden historischen Unterschied beseitigen.
Drittens können Häufigkeitsverhältnisse seltenes Verhalten überzeichnen. Wenn Menschen eine Formulierung fast nie verwenden, kann bereits eine moderate Zahl von Modellverwendungen ein auffälliges Vielfaches erzeugen.
Die Forschenden legten Mindesthäufigkeiten fest, um dieses Problem anzugehen. Für eine Rangliste mussten Wörter in mindestens 500 Modellartikeln erscheinen, während andere Analysen eigene Schwellenwerte verwendeten.
Selbst mit diesen Filtern braucht ein Verhältnis seine Basisrate. „Das ist wichtig“ mit dem 116-Fachen der menschlichen Rate klingt eindeutig, zeigt aber nicht, wie oft die Formulierung pro Artikel vorkam.
Viertens spiegeln die Ergebnisse bestimmte Modellversionen und Versuchseinstellungen wider. Anbieter-Updates, Inferenz-Einstellungen, System-Prompts und Nutzeranweisungen können die Ausgabe allesamt verändern.
Fünftens stammt die Studie von Graphite, einem Marketing- und Wachstumsunternehmen und nicht von einem unabhängigen akademischen Labor. Die Forschenden veröffentlichten die zugrunde liegenden Daten zu den Merkmalen und die Rohartikel, was externe Prüfung ermöglicht.
Unabhängige Replikation bleibt wertvoll. Forschende sollten weitere Genres, Sprachen, Prompt-Designs und menschliche Vergleichsgrundlagen testen. Außerdem sollten sie absolute Häufigkeiten neben relativen Verhältnissen angeben.
Der frühe Arize-Test bietet einen nützlichen Vergleich. Er bestätigte den starken Rückgang von Gedankenstrichen, stellte jedoch fest, dass allgemeinere Stilgewohnheiten bestehen blieben.
Seine 20 Briefings können jedoch nicht jedes Ergebnis aus fast 10.000 abgestimmten Themen bestätigen. Die beiden Projekte verwendeten unterschiedliche Designs und beantworteten unterschiedliche Fragen.
Die stärkste externe Berichterstattung hat diese Grenzen sichtbar gehalten. Die ursprüngliche Berichterstattung über Schreibmerkmale beschrieb die Modellgewohnheiten, ohne zu behaupten, dass irgendeine Formulierung KI-Autorschaft beweise.
Leser sollten dieselbe Zurückhaltung üben. Eine verdächtige Formulierung kann eine Frage auslösen. Sie kann diese Frage nicht allein beantworten.
Für Verlage fragt eine verlässlichere Prüfung, ob Behauptungen Quellen haben, Zitate mit den Originalen übereinstimmen und Schlussfolgerungen aus den Belegen folgen. Sie fragt auch, wer Verantwortung für den endgültigen Text übernimmt.
Für Schulen sollten Richtlinien zur Autorschaft akzeptable Unterstützung definieren, bevor Streitfälle entstehen. Entwurfshistorien, Quellenangaben und mündliche Nachfragen liefern stärkere Belege als Zeichensetzung oder Wortschatz allein.
Für Unternehmen sollten Offenlegungsregeln zum Risiko passen. Eine routinemäßige interne Zusammenfassung erfordert nicht dieselben Kontrollen wie medizinische Beratung, Finanzanalysen oder öffentliche Berichterstattung.
Die Studie zeigt Tendenzen, keine Schuld. Sie als Detektor zu behandeln, würde sorgfältige beschreibende Forschung in ein unzuverlässiges Durchsetzungsinstrument verwandeln.
Drei Signale werden zeigen, ob die neuen Merkmale Bestand haben
Der nächste Test besteht darin, ob der aktuelle Fingerabdruck von Opus 5.5 Replikation, Nutzer-Prompts und das nächste Modell-Update übersteht.
Das erste Signal ist die unabhängige Reproduktion der Graphite-Ergebnisse. Forschende müssen vergleichbare Korpora mit anderen Prompts, Genres und menschlichen Stichproben erzeugen.
Bleiben „zuverlässig“, „das ist wichtig“ und die Kontrastrahmen erhöht, stärkt das den Fall für eine beständige Signatur von Opus 5.5. Brechen sie bei geringfügigen Prompt-Änderungen zusammen, sind sie schwache Zuordnungssignale.
Das zweite Signal ist, wie schnell Anthropic die Sprache des Modells verändert. Das Unternehmen reagierte offenbar auf Kritik am Kommunikationsstil von Opus 5.
Ein späteres Update könnte die aktuellen Merkmale ebenso stark reduzieren, wie Opus 5.5 Gedankenstriche reduzierte. Das würde bestätigen, dass sichtbare Stilmerkmale anpassbare Produkteigenschaften sind.
Das dritte Signal ist, ob Anbieter von Erkennungssystemen versionsspezifische Bewertungen veröffentlichen. Ein Detektor sollte mit aktuellen Modellen, gemischten Mensch-KI-Arbeitsabläufen und bearbeiteten Ausgaben getestet werden.
Genauigkeitsangaben benötigen außerdem Falschpositivraten in unterschiedlichen Schreibgemeinschaften. Nichtmuttersprachliche Englischschreibende, technische Fachleute und Menschen mit formellem Stil sollten nicht zu Kollateralschäden werden.
Die sinnvollere Zukunft könnte eher auf Herkunftsnachweisen als auf sprachlichem Rätselraten beruhen. Signierte Generierungsaufzeichnungen, aufbewahrte Entwürfe und klare Offenlegung könnten den Prozess belegen, ohne so zu tun, als verrate Prosa allein ihren Ursprung.
Für Schreibende ist die unmittelbare Maßnahme einfach. Durchsuchen Sie Entwürfe nach wiederholten bewertenden Wörtern, vorgefertigten Kontrasten, unnötigen Superlativen und Sätzen, die Wichtigkeit verkünden, statt sie zu belegen.
Überprüfen Sie dann jede Tatsachenbehauptung. Entfernen Sie unbegründete Gewissheit. Behalten Sie ungewöhnliche Zeichensetzung bei, wenn sie dem Satz dient, statt sie aus Angst vor Verdacht zu löschen.
Die Schreibmerkmale von Claude Opus 5.5 bieten eine wertvolle redaktionelle Checkliste, sind aber kein Urteil. Werden Verlage die Erkenntnisse nutzen, um ihre Prüfung zu verbessern, oder ein weiteres vorübergehendes Muster in eine unzuverlässige Abkürzung verwandeln?



