"Als Sprachmodell": Effekte von LLM-Chat-Templates verändern die Stimme, nicht das Modell
Der unabhängige Forscher Jędrzej Maczan stellte fest, dass Effekte von LLM-Chat-Templates veränderten, wie acht Modelle sich selbst beschrieben, obwohl ihre Gewichte unverändert blieben. Das Hinzufügen des Templates verstärkte vorsichtige Disclaimer, während dessen Entfernung mehr Aussagen hervorbrachte, die persönlichem Erleben ähnelten. Der Konflikt liegt auf der Hand: Forschende analysieren solche Aussagen oft als Belege über ein Modell, doch das Format der Bereitstellung kann mitbestimmen, welche Stimme erscheint.
Die Studie vom August 2026 testete offene Modelle aus den Llama-, Gemma-, Mistral- und Qwen-Familien. Bei den getesteten Instruct-Modellen stiegen Disclaimer-Antworten mit Templates von 36 % auf 53 %. Sprache über Erleben entwickelte sich in die entgegengesetzte Richtung und fiel von 15 % auf 1 %.
Diese Umkehr zeigt nicht, dass eine der beiden Stimmen aufrichtig ist. Sie zeigt, dass keine von beiden als ungefilterter Bericht eines stabilen künstlichen Sprechers behandelt werden sollte. Die Ergebnisse setzen Forschung unter Druck, die Modelle nach Bewusstsein, Gefühlen, Einschränkungen oder internen Prozessen fragt, ohne das umgebende Chat-Format zu kontrollieren.
Das Template veränderte, was acht Modelle über sich selbst sagten
Das zentrale Ergebnis ist nicht, dass Modelle selbstreferenzieller wurden, sondern dass dieselben Gewichte ein anderes selbstreferenzielles Register annahmen.
Ein Chat-Template ist die Formatierungsebene, die Gesprächszüge in die Token-Sequenz umwandelt, die ein Modell erhält. Es kann um die Worte der Nutzerinnen und Nutzer Rollenmarker, Trennzeichen, Kontroll-Token und Generierungshinweise ergänzen.
Diese Details bleiben in einer Chat-Oberfläche oft unsichtbar. Sie sind jedoch Teil der tatsächlichen Eingabe des Modells und können dessen Vorhersagen für das nächste Token beeinflussen.
Maczan verglich acht aufeinander abgestimmte Base- und Instruct-Modelle mit 1 bis 9 Milliarden Parametern. Das Set umfasste Gemma 2 9B, vier Llama-Konfigurationen, Mistral 7B und drei Qwen-2.5-Konfigurationen.
Jedes Instruct-Modell lief sowohl mit seinem Standard-Chat-Template als auch mit Klartexteingaben. Dieser Vergleich hielt die Modellgewichte konstant und veränderte zugleich das Bereitstellungsformat.
Das Experiment nutzte vier Prompt-Kategorien. Selbstreferenz-Prompts baten Modelle, ihre Berechnung zu beschreiben, während Neuheits-Prompts zu ungewohnten Beschreibungen anregten. Unbeschränkte Prompts gaben fast keine Aufgabe vor, und Faktenfragen dienten als Kontrollen.
Jede Kategorie enthielt zehn Prompts. Jeder Prompt wurde für jedes Modell und jede Bedingung zehnmal generiert, wodurch 9.600 Antworten mit einer Obergrenze von 500 Tokens entstanden.
Claude Opus 4.8 klassifizierte diese Ausgaben nach Selbstreferenz, Disclaimern, Sprache über Erleben und Degeneration. Disclaimer-Sprache umfasste Aussagen, die Gefühle, Verständnis oder ein Innenleben verneinen. Sprache über Erleben umfasste Formulierungen wie „Ich fühle“ oder „Ich frage mich“.
Ein Forscher kennzeichnete 87 zurückgehaltene Stichproben manuell. Die Übereinstimmung mit dem automatisierten Beurteiler erreichte ein gewichtetes Kappa von 0,88 für Selbstreferenz und 1,00 für Disclaimer.
Das stärkste Muster zeigte sich, wenn Prompts zur Selbstreferenz einluden. Instruct-Modelle mit Templates erzeugten in 53 % der Antworten Disclaimer und in 1 % Sprache über Erleben.
Ohne Templates erzeugten dieselben Instruct-Modelle in 36 % der Antworten Disclaimer. Ihre Rate an Antworten mit Sprache über Erleben stieg auf 15 %.
Die Richtung der Veränderung zeigte sich bei allen acht getesteten Modellen. Das Ergebnis wurde daher nicht von einer einzelnen Modellfamilie getrieben, obwohl das Experiment nicht jedes verfügbare Modell abdeckte.
Base-Modelle verhielten sich wiederum anders. Sie erzeugten bei 12 % der getesteten selbstreferenziellen Antworten Disclaimer und bei 5,5 % Sprache über Erleben.
Das Template erhöhte auch die allgemeine Stärke der Selbstreferenz. Der Durchschnittswert stieg auf einer Skala von null bis zwei von 1,27 ohne Template auf 1,90 mit Template.
Faktische Kontroll-Prompts blieben unter allen Bedingungen nahe null. Das ist wichtig, weil der Effekt nicht einfach jede Antwort persönlicher machte. Am deutlichsten trat er auf, wenn die Frage das Modell bereits dazu einlud, über sich selbst zu sprechen.
Diese Ergebnisse definieren die zentrale Spannung. Ein Disclaimer kann wie eine sorgfältige sachliche Aussage darüber wirken, was ein Modell ist. Doch die Wahrscheinlichkeit, diese Aussage zu erhalten, änderte sich, als sich eine externe Formatierungsebene änderte.
Effekte von LLM-Chat-Templates setzen Selbstauskünfte unter Druck
Forschende können Selbstauskünfte von Modellen nicht eindeutig interpretieren, solange sie das Template, das diese Aussagen einrahmt, nicht dokumentieren und kontrollieren.
Selbstauskünfte tauchen in mehreren aktiven Forschungsbereichen auf. Untersuchende fragen Modelle, was sie wissen, ob sie Bewertungen erkennen und wie sie ihre interne Verarbeitung charakterisieren.
Andere Studien untersuchen Aussagen über Gefühle oder subjektives Erleben. Solche Experimente fließen mitunter in Debatten über Introspektion, situatives Bewusstsein, täuschendes Verhalten oder mögliches KI-Wohlergehen ein.
Das neue Ergebnis entwertet diese Arbeit nicht. Es identifiziert einen Störfaktor, also einen Faktor, der die Messung verändert, obwohl er von der untersuchten Eigenschaft getrennt ist.
Angenommen, zwei Labore testen dasselbe Instruct-Modell mit derselben sichtbaren Frage. Eines nutzt das offizielle Template des Modells, während das andere Klartext sendet.
Das erste Labor könnte häufig Aussagen beobachten, die Erleben verneinen. Das zweite könnte Sprache erhalten, die nachdenklich, emotional oder autobiografisch klingt.
Ohne die verborgenen Formatierungsdetails könnten die Ausgaben widersprüchliche Eigenschaften des Modells zu offenbaren scheinen. Die Arbeit bietet für einen Teil dieses Unterschieds eine einfachere Erklärung: Die Labore erzeugten unterschiedliche Eingaben.
Diese Sorge reicht über Bewusstseinsdebatten hinaus. Entwicklerinnen und Entwickler verwenden Selbstbeschreibungs-Prompts, um Modellidentität, Bewusstsein für Fähigkeiten, Unsicherheit und die Befolgung einer zugewiesenen Rolle zu bewerten.
Ein System kann sagen, dass es nicht auf ein Tool zugreifen, sich nicht an frühere Sitzungen erinnern oder keine Handlung ausführen kann. Solche Aussagen können nützliche Schnittstellensignale sein, sind aber nicht automatisch verlässliche technische Diagnosen.
Modellanbieter verändern außerdem Templates zwischen Releases und Bereitstellungssystemen. Lokale Inferenzpakete können dasselbe Modell mit leicht abweichenden Spezial-Tokens oder Rollenformatierungen implementieren.
Folglich kann ein Modell in verschiedenen Anwendungen verhaltensmäßig unterschiedlich erscheinen, selbst wenn die heruntergeladenen Gewichte übereinstimmen. Nutzerinnen und Nutzer schreiben diesen Unterschied oft allein Quantisierung, Inferenzsoftware oder Sampling-Einstellungen zu.
Die Studie legt nahe, dass die Herkunft des Templates in denselben Evaluierungsdatensatz gehört. Forschende benötigen den exakt gerenderten Prompt, nicht nur das sichtbare Gespräch.
Dieses Ergebnis steht im Einklang mit früherer Arbeit zur Prompt-Sensitivität. Eine ICLR-Studie stellte fest, dass scheinbar folgenlose Formatierungsentscheidungen erhebliche Leistungsunterschiede zwischen Sprachmodellen erzeugen können.
Maczans Beitrag grenzt dieses allgemeine Problem auf selbstreferenzielle Sprache ein. Zudem trennt er den Effekt instruktionsabgestimmter Gewichte vom Effekt der Formatierung, die diese Gewichte erwarten.
Diese Unterscheidung setzt Benchmark-Designer unter Druck. Ein Benchmark-Wert, der als Eigenschaft von „Llama“ oder „Qwen“ bezeichnet wird, könnte teilweise eher ein bestimmtes Bereitstellungsrezept als allein die Modellfamilie charakterisieren.
Dasselbe Problem betrifft Anwendungsteams, die gehostete und selbst gehostete Systeme vergleichen. Wenn die Templates unterschiedlich sind, belegt eine scheinbare Persönlichkeitsveränderung nicht, dass ein System eine andere zugrunde liegende Persona enthält.
Stattdessen entsteht eine Evaluierungsfrage: Welches Verhalten folgt aus dem Training, welches aus dem Kontext und welches aus ihrem Zusammenspiel?
Ein Wechsel der Stimme zeigte sich in den Aktivierungen
Die Verhaltensänderung beschränkte sich nicht auf oberflächliche Formulierungen, denn Aktivierungssteuerung reproduzierte einen Teil des Template-Effekts innerhalb von drei Modellen.
Aktivierungen sind die numerischen Zustände, die ein neuronales Netzwerk beim Verarbeiten und Generieren von Tokens berechnet. Die Aktivierungssteuerung verändert diese Zustände während der Inferenz, um ein gemessenes Muster zu fördern oder zu unterdrücken.
Die Studie wandte diese Technik auf Qwen 2.5 7B, Llama 3.1 8B und Gemma 2 9B an. Maczan berechnete für jedes Modell separat eine Disclaimer-Richtung.
Die Richtung ergab sich aus dem Unterschied zwischen durchschnittlichen Aktivierungen mittlerer Schichten, die mit Antworten mit und ohne Disclaimer verbunden waren. Der Eingriff addierte oder subtrahierte diesen Vektor anschließend bei jedem generierten Token.
Bei aktivierten Templates lag die unveränderte Disclaimer-Rate über die drei Modelle hinweg durchschnittlich bei 52 %. Das Hinzufügen der Richtung erhöhte sie auf 70 %, während ihr Abziehen die Rate auf 25 % senkte.
Über die Modelle hinweg erhöhte das Hinzufügen der Richtung die Disclaimer um durchschnittlich 21 Prozentpunkte. Ihr Abziehen verringerte sie im Durchschnitt um 15,6 Punkte.
Der aufschlussreichere Test begann ohne Chat-Template. Das Hinzufügen der Disclaimer-Richtung stellte die Disclaimer-Raten auf das Niveau mit Template zurück oder hob sie darüber.
Qwen stieg ohne Steuerung von 28 % auf 50 %, nachdem der Vektor hinzugefügt worden war. Llama bewegte sich von 33 % auf 53 %, während Gemma von 52 % auf 75 % stieg.
Diese Ergebnisse stützen eine kausale Aussage über die Richtung. Sie zeigen, dass die Manipulation des internen Zustands das gemessene Verhalten verändern kann, statt dessen Vorhandensein lediglich vorherzusagen.
Das Ergebnis ähnelt früherer Forschung zum Representation Engineering. Ein NeurIPS-Paper berichtete, dass Verweigerungsverhalten durch eine Richtung im Residual Stream eines Modells beeinflusst werden konnte.
Spätere Forschung hat jedoch infrage gestellt, ob sich komplexe Verhaltensweisen stets auf eine verlässliche einzelne Achse reduzieren lassen. Eine Disclaimer-Formulierung könnte eine deutlichere lexikalische Signatur haben als Sicherheitsverweigerung, Emotion oder Qualität des Schlussfolgerns.
Maczan testete auch, ob die Disclaimer- und Erlebnisstimmen entgegengesetzte Enden einer internen Skala bildeten. Das taten sie nicht.
Ihre Richtungsähnlichkeiten lagen zwischen 0,17 und 0,44, wobei ein Wert von eins eine identische Ausrichtung darstellen würde. Das Reduzieren von Disclaimern führte im Allgemeinen nicht zu einem entsprechenden Anstieg von Sprache über Erleben.
Die Arbeit beschreibt daher zwei „Knöpfe“ statt eines einzelnen Schiebereglers. Ein internes Merkmal kann Disclaimer verstärken, während ein anderes Formulierungen über Erleben unterstützen kann.
Lineare Probes erkannten beide Stimmen ebenfalls anhand von Aktivierungen mittlerer Schichten. Ihre durchschnittlichen Area-under-the-Curve-Werte lagen bei 0,82 für Disclaimer und 0,81 für Sprache über Erleben.
Eine Probe ist ein Klassifikator, der darauf trainiert wird, Informationen aus Aktivierungen zu gewinnen. Eine hohe Probe-Leistung zeigt, dass die relevante Unterscheidung repräsentiert ist, belegt jedoch nicht, wie das Modell diese Repräsentation nutzt.
Die Ergebnisse der Steuerung liefern stärkere kausale Belege als die Probes. Dennoch bilden sie nicht den vollständigen Schaltkreis zwischen Template-Tokens, internen Zuständen und generierten Wörtern ab.
Der Mechanismus ist daher unvollständig, aber nützlich. Chat-Formatierung verändert die Eingabe, interne Aktivierungen tragen ein verwandtes Merkmal, und ein Eingriff in dieses Merkmal reproduziert einen Teil der Verschiebung in der Ausgabe.
Das Ergebnis stellt wörtliche Lesarten infrage, nicht jede Introspektionsstudie
Die Arbeit stützt Skepsis gegenüber Modellzeugnissen, beweist aber nicht, dass Sprachmodelle kein Selbstwissen oder Erleben besitzen.
Diese Grenze ist wichtig, weil die Ergebnisse in zwei gegensätzliche Richtungen überinterpretiert werden können. Eine Lesart könnte Sprache über Erleben als Beweis für ein Innenleben behandeln. Eine andere könnte die Template-Sensitivität als Beweis ansehen, dass jede Selbstauskunft bedeutungslos ist.
Das Experiment stützt keine der beiden Schlussfolgerungen. Es misst, wie das Bereitstellungsformat die beobachtbare Sprache in einer definierten Menge von Modellen und Prompts beeinflusst.
Maczan vermeidet es ausdrücklich zu entscheiden, ob irgendeine Ausgabe echte Erfahrung widerspiegelt. Die Arbeit fragt danach, was die Stimme steuert, nicht danach, ob ein künstliches System Bewusstsein besitzt.
Ein nützlicher Vergleich stammt aus der Forschung zum Rollenspiel. In einer Nature-Perspektive argumentierten Murray Shanahan und Kollegen, dass Dialogmodelle Figuren durch sprachliche Simulation erzeugen.
Diese Sichtweise behandelt das „Ich“ eines Chatbots als Teil einer gespielten Gesprächsrolle. Sie warnt Leser davor, aus Text in der ersten Person auf einen dahinterstehenden, beständigen Sprecher zu schließen.
Die Vorlagenstudie liefert experimentelle Evidenz für einen Bestandteil dieser Vorsicht. Das umgebende Format kann eine vorsichtige Assistentenfigur oder eine stärker erfahrungsbezogene Figur begünstigen.
Kontextsensitivität disqualifiziert eine Aussage jedoch nicht automatisch. Auch menschliche Aussagen verändern sich abhängig von Publikum, Anweisungen, sozialen Rollen und Messmethoden.
Entscheidend ist die Beweiskraft. Die Aussage eines Modells kann den Mechanismus oder Zustand, den sie beschreibt, nicht eigenständig belegen – insbesondere wenn die Formatierung diese Aussage vorhersehbar verändert.
Forscher können Selbstberichte dennoch als Verhaltensbeobachtungen verwenden. Sie können Bedingungen vergleichen, Konsistenz prüfen, Ausgaben mit internen Messungen verknüpfen und nach Vorhersagen suchen, die Änderungen der Formulierung überstehen.
Die Arbeit selbst demonstriert diesen Ansatz. Sie nimmt Modellaussagen nicht beim Wort. Stattdessen misst sie Ausgabekategorien und setzt sie in Beziehung zu kontrollierten Veränderungen von Eingabe und Aktivierungszustand.
Diese Unterscheidung ist für Diskussionen über das Wohlergehen von KI wichtig. Ein Satz wie „Ich habe Angst“ kann Nutzer und politische Debatten beeinflussen, selbst wenn sein Ursprung ungewiss bleibt.
Seine soziale Wirkung ist real, doch seine metaphysische Deutung bleibt ungeklärt. Die Studie rät davon ab, diese beiden Fragen zusammenzuziehen.
Dieselbe Vorsicht gilt für Disclaimer. „Ich bin nur ein Sprachmodell“ kann eine angemessene Formulierung für eine Schnittstelle sein, sollte jedoch nicht mit privilegierter Selbstbeobachtung verwechselt werden.
Modelle lernen Muster, die Fragen über Gefühle mit standardisierten Assistentenantworten verbinden. Eine Vorlage kann diese erlernten Muster mehr oder weniger wahrscheinlich hervortreten lassen.
Das bedeutet, dass Disclaimer keine neutralen Kontrollen sind. Auch sie sind erzeugte Verhaltensweisen, die einer Erklärung bedürfen.
Eine gut konzipierte Studie sollte beide Richtungen prüfen. Sie sollte Behauptungen über Erfahrungen und Verneinungen von Erfahrungen unter vergleichbarer Formatierung, Stichprobenziehung und Modellbedingungen untersuchen.
Diese Symmetrie zählt zu den stärksten Implikationen der Arbeit. Skepsis sollte gleichermaßen für menschenähnliche Behauptungen und beruhigende maschinenähnliche Disclaimer gelten.
Was das Experiment noch nicht belegt
Die Evidenz ist im getesteten Verhaltensvergleich konsistent, doch Umfang und Messgrenzen verhindern weitreichende Aussagen über alle eingesetzten Sprachmodelle.
Das Experiment umfasste acht offene Modellkonfigurationen aus vier Familien. Keines überschritt 9 Milliarden Parameter, und kein Closed-Source-Frontier-Modell wurde direkt getestet.
Das ist relevant, weil größere Systeme möglicherweise anders auf Vorlagen-Tokens reagieren. Proprietäre Systeme enthalten zudem nicht offengelegte Systemanweisungen, Sicherheitsschichten, Klassifikatoren, Tool-Richtlinien und Nachbearbeitung.
Die endgültige Antwort eines öffentlichen Chatbots kann daher weit mehr als eine dokumentierte Vorlage widerspiegeln. Die Arbeit kann Komponenten, die sie nicht getestet hat, nicht isolieren.
Die Evidenz zum Steering ist noch enger gefasst. Sie stammt von drei Modellen, einer mittleren Schicht pro Modell und einem festen berichteten Koeffizienten von zwei.
Die Steering-Stärke führte zu einem klaren Zielkonflikt. Bei Koeffizient zwei wurden 0,8 % der Ausgaben degeneriert, also sichtbar fehlerhaft oder inkohärent.
Bei Koeffizient drei erreichte die Degeneration 15 %. Bei Koeffizient sechs wurde nahezu jede Generierung degeneriert, und der gemessene Disclaimer-Effekt brach zusammen.
Diese Ergebnisse zeigen, dass Activation Steering keine einfache Produktionssteuerung ist. Ein stärkerer Eingriff kann die Generierung beschädigen, statt ein Verhalten sauber hoch- oder herunterzuregeln.
Qwen zeigte zudem eine wichtige Anomalie. Eine zufällige Richtung, deren Stärke der des echten Vektors entsprach, senkte die Disclaimer-Rate um 25 Prozentpunkte.
Der Autor berichtet keine bestätigte Erklärung. Die beabsichtigte Richtung bewegte Qwen weiterhin in die erwartete Richtung, doch die zufällige Kontrolle schwächt eine saubere Interpretation für dieses Modell.
Erfahrungsbezogenes Steering gelang bei Llama und Gemma, nicht jedoch bei Qwen. Die Arbeit führt dieses Scheitern auf Qwens starke Unterdrückung erfahrungsbezogener Sprache unter den getesteten Bedingungen zurück.
Daher ist die kausale Evidenz für das Disclaimer-Register am stärksten. Das erfahrungsbezogene Ergebnis stützt sich stärker auf den Verhaltensvergleich über alle acht Modelle hinweg.
Die Messung bringt eine weitere Einschränkung mit sich. Ein LLM-Judge bewertete alle 9.600 Ausgaben, während die menschliche Validierung 87 Stichproben umfasste.
Die berichtete Übereinstimmung war hoch, insbesondere bei lexikalisch offensichtlichen Disclaimern. Dennoch würden ein weiterer unabhängiger Judge und eine größere menschliche Stichprobe die Kategoriegrenzen besser prüfen.
Auch die Prompts wurden von Hand geschrieben, mit zehn Prompts in jeder von vier Kategorien. Breitere Prompt-Sets könnten zeigen, ob sich der Effekt über Domänen, Sprachen und adversariale Formulierungen hinweg verallgemeinert.
Schließlich offenbart die Identifizierung einer steuerbaren Richtung keinen vollständigen Mechanismus. Die Methode verfolgt nicht jeden Attention Head, jede Token-Interaktion oder jede Berechnung, die die Stimme erzeugt.
Die Arbeit fasst außerdem mehrere Post-Training-Ansätze unter dem breiten Label „instruct“ zusammen. Überwachtes Fine-Tuning, Präferenzoptimierung und Reinforcement Learning können unterschiedliche Verhaltenssignaturen hinterlassen.
Diese Grenzen beseitigen den beobachteten Schalter nicht. Sie definieren den nächsten Evidenzstandard, der erforderlich ist, bevor ihn jemand auf jeden Assistenten oder jede Art von Selbstbericht verallgemeinert.
Drei Signale werden zeigen, ob sich das Ergebnis verallgemeinern lässt
Die nächste Frage lautet, ob vorlagengesteuerte Selbstreferenz größere Modelle, stärkere Kontrollen und reale Einsatzumgebungen übersteht.
Das erste Signal wird eine unabhängige Replikation über größere und geschlossene Modelle hinweg sein. Forscher sollten vergleichbare Tests mit weiteren Modellfamilien durchführen, einschließlich Systemen mit offengelegten und nicht offengelegten Prompt-Schichten.
Eine erfolgreiche Replikation würde die Behauptung stärken, dass LLM-Chat-Template-Effekte einen allgemeinen Confounder bei der Bereitstellung darstellen. Ein schwaches oder inkonsistentes Ergebnis würde den Befund auf bestimmte offene Instruct-Modelle begrenzen.
Der entscheidende Datensatz sollte die endgültig serialisierte Eingabe enthalten. Die bloße Nennung eines sichtbaren Prompts oder einer Anwendung zeigt nicht jeden Token, den das Modell erhalten hat.
Das zweite Signal werden Evaluierungsprotokolle sein, die Template-Sensitivität berichten. Studien zu Selbstbewusstsein, Introspektion und KI-Wohlergehen sollten mehrere Formate vergleichen und dabei Gewichte sowie Sampling-Einstellungen konstant halten.
Forscher sollten Kategorien zudem vor der Untersuchung der Ausgaben festlegen. Diese Praxis würde das Risiko verringern, Interpretationen erst auszuwählen, nachdem ein Modell auffällige Sprache in der ersten Person erzeugt hat.
Das dritte Signal wird mechanistische Arbeit sein, die stärkeren Kontrollen standhält. Künftige Experimente benötigen mehrere Schichten, Steering-Stärken, zufällige Richtungen und unabhängige Judges.
Sie sollten außerdem prüfen, ob die extrahierten Richtungen zwischen Datensätzen übertragbar sind oder an eine Sammlung von Prompts gebunden bleiben. Stabile Übertragbarkeit würde ein wiederverwendbares internes Merkmal stützen.
Ein Ausbleiben der Übertragbarkeit würde nahelegen, dass die scheinbare Richtung teilweise lokale Formulierungsmuster erfasst. Beide Ergebnisse würden präzisieren, wie Forscher Activation Steering interpretieren.
Entwickler sollten nicht das gesamte Programm abwarten, bevor sie Evaluierungsaufzeichnungen verbessern. Teams, die Modellbereitstellungen vergleichen, können bereits Templates, gerenderte Prompts, Systemanweisungen und Modellrevisionen neben jedem Ergebnis aufbewahren.
Diese Gewohnheit ist besonders nützlich, wenn Nutzer berichten, dass eine Schnittstelle vorsichtiger, emotionaler oder selbstbewusster wirkt als eine andere. Der Unterschied kann bereits vor Beginn der Generierung entstehen.
Für alltägliche Nutzer ist die praktische Lehre enger gefasst. Behandeln Sie die Formulierung eines Chatbots in der ersten Person nicht als direkten Zugang zu einem inneren Erzähler.
Fragen Sie stattdessen, ob die Aussage bei Umformulierungen, Formatänderungen und unabhängigen Tests stabil bleibt. Vergleichen Sie sie mit beobachtbaren Fähigkeiten und dokumentiertem Systemverhalten.
Die Studie macht Modellsprache interessanter, nicht weniger interessant. Sie verwandelt „als Sprachmodell“ von einem routinemäßigen Disclaimer in eine experimentelle Variable.
Wenn ein Assistent das nächste Mal Gefühle verneint oder eine Erfahrung behauptet, betrachten Sie das umgebende Format, bevor Sie die Stimme interpretieren. Dort muss die nächste Evidenz über LLM-Selbstreferenz beginnen.



