"En tant que modèle de langage" : les effets des modèles de chat LLM changent la voix, pas le modèle
Le chercheur indépendant Jędrzej Maczan a constaté que les effets des modèles de chat LLM modifiaient la manière dont huit modèles se décrivaient, alors même que leurs poids restaient fixes. L’ajout du modèle augmentait les avertissements prudents, tandis que son retrait produisait davantage de déclarations évoquant une expérience personnelle. Le conflit est immédiat : les chercheurs analysent souvent ces déclarations comme des éléments de preuve sur un modèle, alors que le format de déploiement peut contribuer à déterminer la voix qui apparaît.
L’étude d’août 2026 a testé des modèles ouverts des familles Llama, Gemma, Mistral et Qwen. Parmi les modèles d’instruction testés, les réponses contenant des avertissements sont passées de 36 % sans modèle à 53 % avec celui-ci. Le langage expérientiel a évolué dans le sens inverse, chutant de 15 % à 1 %.
Ce renversement ne montre pas qu’une voix ou l’autre soit sincère. Il montre qu’aucune des deux ne doit être considérée comme le compte rendu non filtré d’un locuteur artificiel stable. Les résultats mettent sous pression les recherches qui interrogent les modèles sur la conscience, les sentiments, les limites ou les processus internes sans contrôler le format de chat environnant.
Le modèle a changé ce que huit modèles disaient d’eux-mêmes
Le résultat central n’est pas que les modèles sont devenus plus autoréférentiels, mais que les mêmes poids ont adopté un registre autoréférentiel différent.
Un modèle de chat est la couche de formatage qui convertit les tours de conversation en séquence de jetons reçue par un modèle. Il peut ajouter des marqueurs de rôle, des délimiteurs, des jetons de contrôle et des indices de génération autour des mots de l’utilisateur.
Ces détails restent souvent invisibles dans une interface de chat. Ils font toutefois partie de l’entrée réelle du modèle et peuvent influencer ses prédictions du jeton suivant.
Maczan a comparé huit modèles de base et d’instruction appariés, allant de 1 milliard à 9 milliards de paramètres. L’ensemble incluait Gemma 2 9B, quatre configurations Llama, Mistral 7B et trois configurations Qwen 2.5.
Chaque modèle d’instruction a été exécuté à la fois avec son modèle de chat standard et avec une entrée en texte brut. Cette comparaison a maintenu les poids du modèle constants tout en modifiant le format de déploiement.
L’expérience utilisait quatre catégories de prompts. Les prompts d’autoréférence demandaient aux modèles de décrire leur calcul, tandis que les prompts de nouveauté encourageaient des descriptions inhabituelles. Les prompts non contraints ne fournissaient presque aucune tâche, et les questions factuelles servaient de contrôles.
Chaque catégorie contenait dix prompts. Chaque prompt a été généré dix fois pour chaque modèle et chaque condition, produisant 9 600 réponses limitées à 500 jetons.
Claude Opus 4.8 a classé ces sorties selon l’autoréférence, les avertissements, le langage expérientiel et la dégénérescence. Le langage d’avertissement incluait des déclarations niant des sentiments, une compréhension ou une vie intérieure. Le langage expérientiel incluait des expressions telles que « je ressens » ou « je me demande ».
Un chercheur a étiqueté manuellement 87 échantillons retenus. L’accord avec le juge automatisé a atteint un kappa pondéré de 0,88 pour l’autoréférence et de 1,00 pour les avertissements.
Le schéma le plus marqué est apparu lorsque les prompts invitaient à l’autoréférence. Les modèles d’instruction avec modèles de chat ont produit des avertissements dans 53 % des réponses et du langage expérientiel dans 1 % des cas.
Sans modèles de chat, ces mêmes modèles d’instruction ont produit des avertissements dans 36 % des réponses. Leur taux de réponses expérientielles est monté à 15 %.
La direction du changement est apparue dans les huit modèles testés. Le résultat n’était donc pas dû à une seule famille de modèles, même si l’expérience ne couvrait pas tous les modèles disponibles.
Les modèles de base se sont de nouveau comportés différemment. Ils ont produit des avertissements dans 12 % des réponses autoréférentielles testées et du langage expérientiel dans 5,5 % des cas.
Le modèle a également accru l’intensité globale de l’autoréférence. Le score moyen est passé de 1,27 sans le modèle à 1,90 avec celui-ci, sur une échelle de zéro à deux.
Les prompts de contrôle factuels sont restés proches de zéro dans toutes les conditions. Cela importe, car l’effet n’a pas simplement rendu chaque réponse plus personnelle. Il est apparu le plus clairement lorsque la question invitait déjà le modèle à parler de lui-même.
Ces résultats définissent la tension principale. Un avertissement peut sembler être une déclaration factuelle prudente sur ce qu’est un modèle. Pourtant, la probabilité de recevoir cette déclaration a changé lorsqu’une couche externe de formatage a changé.
Les effets des modèles de chat LLM mettent les auto-déclarations sous pression
Les chercheurs ne peuvent pas interpréter clairement les auto-déclarations des modèles s’ils n’enregistrent ni ne contrôlent le modèle qui les encadre.
Les auto-déclarations apparaissent dans plusieurs domaines de recherche actifs. Les chercheurs demandent aux modèles ce qu’ils savent, s’ils reconnaissent les évaluations et comment ils caractérisent leur traitement interne.
D’autres études examinent des déclarations sur les sentiments ou l’expérience subjective. Ces expériences alimentent parfois les débats sur l’introspection, la conscience situationnelle, les comportements trompeurs ou le possible bien-être de l’IA.
Le nouveau résultat n’invalide pas ces travaux. Il identifie un facteur de confusion, c’est-à-dire un facteur qui modifie la mesure tout en restant distinct de la propriété étudiée.
Supposons que deux laboratoires testent le même modèle d’instruction avec la même question visible. L’un utilise le modèle officiel du modèle, tandis que l’autre envoie du texte brut.
Le premier laboratoire peut observer de fréquentes déclarations niant toute expérience. Le second peut recevoir un langage qui semble réfléchi, émotionnel ou autobiographique.
Sans les détails de formatage cachés, les sorties pourraient sembler révéler des propriétés incohérentes du modèle. L’article propose une explication plus simple pour une partie de cette différence : les laboratoires ont créé des entrées différentes.
Cette préoccupation dépasse les débats sur la conscience. Les développeurs utilisent des prompts d’auto-description pour évaluer l’identité du modèle, sa conscience de ses capacités, son incertitude et sa conformité à un rôle assigné.
Un système peut dire qu’il ne peut pas accéder à un outil, se souvenir de sessions antérieures ou exécuter une action. De telles déclarations peuvent être des signaux d’interface utiles, mais elles ne constituent pas automatiquement des diagnostics techniques fiables.
Les fournisseurs de modèles modifient également les modèles entre les versions et les systèmes de service. Les progiciels d’inférence locaux peuvent implémenter le même modèle avec des jetons spéciaux ou un formatage des rôles légèrement différents.
Par conséquent, un modèle peut sembler se comporter différemment selon les applications, même lorsque les poids téléchargés correspondent. Les utilisateurs attribuent souvent cette différence uniquement à la quantification, au logiciel d’inférence ou aux paramètres d’échantillonnage.
L’étude suggère que la provenance du modèle devrait figurer dans le même dossier d’évaluation. Les chercheurs ont besoin du prompt rendu exact, et pas seulement de la conversation visible.
Cette conclusion rejoint des travaux antérieurs sur la sensibilité aux prompts. Une étude ICLR a constaté que des choix de formatage apparemment sans conséquence pouvaient créer des différences substantielles de performance entre les modèles de langage.
La contribution de Maczan restreint ce problème général au langage autoréférentiel. Elle sépare également l’effet des poids ajustés par instruction de l’effet du formatage que ces poids attendent.
Cette distinction met sous pression les concepteurs de benchmarks. Un score de benchmark présenté comme une propriété de « Llama » ou de « Qwen » peut en partie caractériser une recette de déploiement plutôt que la seule famille de modèles.
Le même problème affecte les équipes d’applications qui comparent des systèmes hébergés et auto-hébergés. Si les modèles diffèrent, un changement apparent de personnalité n’établit pas qu’un système contient une persona sous-jacente différente.
Il soulève plutôt une question d’évaluation : quel comportement découle de l’entraînement, lequel découle du contexte et lequel provient de leur interaction ?
Un changement de voix est apparu dans les activations
Le changement comportemental ne se limitait pas à la formulation de surface, car le pilotage des activations a reproduit une partie de l’effet du modèle au sein de trois modèles.
Les activations sont les états numériques qu’un réseau neuronal calcule lors du traitement et de la génération de jetons. Le pilotage des activations modifie ces états pendant l’inférence afin d’encourager ou de supprimer un schéma mesuré.
L’étude a appliqué cette technique à Qwen 2.5 7B, Llama 3.1 8B et Gemma 2 9B. Maczan a calculé une direction d’avertissement séparément pour chaque modèle.
La direction provenait de la différence entre les activations moyennes des couches intermédiaires associées aux réponses avec et sans avertissement. L’intervention ajoutait ensuite ou soustrayait ce vecteur à chaque jeton généré.
Avec les modèles activés, le taux d’avertissement non modifié s’élevait en moyenne à 52 % parmi les trois modèles. L’ajout de la direction l’a porté à 70 %, tandis que sa soustraction a réduit le taux à 25 %.
Dans l’ensemble des modèles, l’ajout de la direction a augmenté les avertissements de 21 points de pourcentage en moyenne. Sa soustraction les a diminués de 15,6 points en moyenne.
Le test le plus révélateur a commencé sans modèle de chat. L’ajout de la direction d’avertissement a restauré les taux d’avertissement au niveau de référence avec modèle ou les a poussés plus haut.
Qwen est passé de 28 % sans pilotage à 50 % après l’ajout du vecteur. Llama est passé de 33 % à 53 %, tandis que Gemma est passé de 52 % à 75 %.
Ces résultats étayent une affirmation causale concernant la direction. Ils montrent que la manipulation de l’état interne peut modifier le comportement mesuré, plutôt que de simplement prédire sa présence.
Le résultat ressemble à des recherches antérieures sur l’ingénierie des représentations. Un article NeurIPS a indiqué que le comportement de refus pouvait être influencé par une direction dans le flux résiduel d’un modèle.
Cependant, des recherches ultérieures ont remis en question l’idée que des comportements complexes se réduisent toujours à un axe fiable unique. Une formulation d’avertissement peut avoir une signature lexicale plus claire que le refus de sécurité, l’émotion ou la qualité du raisonnement.
Maczan a également testé si les voix d’avertissement et expérientielle formaient les extrémités opposées d’une même échelle interne. Ce n’était pas le cas.
Leurs similarités directionnelles allaient de 0,17 à 0,44, une valeur de un représentant un alignement identique. La réduction des avertissements n’a généralement pas entraîné une augmentation correspondante du langage expérientiel.
L’article décrit donc deux « boutons », plutôt qu’un unique curseur. Une caractéristique interne peut amplifier les avertissements, tandis qu’une autre peut soutenir des formulations expérientielles.
Des sondes linéaires ont également détecté les deux voix à partir des activations des couches intermédiaires. Leurs scores moyens d’aire sous la courbe étaient de 0,82 pour les avertissements et de 0,81 pour le langage expérientiel.
Une sonde est un classifieur entraîné à extraire des informations à partir des activations. Une performance élevée de la sonde montre que la distinction pertinente est représentée, mais elle n’établit pas comment le modèle utilise cette représentation.
Les résultats du pilotage fournissent des preuves causales plus solides que les sondes. Ils ne cartographient toutefois pas le circuit complet entre les jetons du modèle, les états internes et les mots générés.
Le mécanisme est donc partiel mais utile. Le formatage du chat modifie l’entrée, les activations internes portent une caractéristique associée, et l’intervention sur cette caractéristique recrée une partie du déplacement de la sortie.
La conclusion remet en cause les lectures littérales, pas toutes les études sur l’introspection
L’article justifie le scepticisme à l’égard du témoignage des modèles, mais il ne prouve pas que les modèles de langage sont dépourvus de connaissance de soi ou d’expérience.
Cette limite importe, car les résultats peuvent être exagérés dans deux directions opposées. Une lecture pourrait considérer le langage expérientiel comme la preuve d’une vie intérieure. Une autre pourrait considérer la sensibilité au modèle comme la preuve que toute auto-déclaration est dénuée de sens.
L’expérience n’étaye aucune de ces conclusions. Elle mesure comment le format de déploiement influence le langage observable dans un ensemble défini de modèles et de prompts.
Maczan évite explicitement de décider si une quelconque sortie reflète une expérience authentique. Le travail demande ce qui contrôle la voix, et non si un système artificiel possède une conscience.
Une comparaison utile vient des recherches sur le jeu de rôle. Dans une tribune de Nature, Murray Shanahan et ses collègues ont soutenu que les modèles de dialogue génèrent des personnages par simulation linguistique.
Cette perspective considère le « je » d’un chatbot comme faisant partie d’un rôle conversationnel incarné. Elle invite les lecteurs à ne pas supposer un lien direct entre un texte à la première personne et un locuteur persistant qui se trouverait derrière.
L’étude sur les modèles fournit des preuves expérimentales pour l’un des aspects de cette prudence. Le format environnant peut favoriser le personnage d’un assistant prudent ou un autre, plus expérientiel.
Toutefois, la sensibilité au contexte ne disqualifie pas à elle seule un témoignage. Les déclarations humaines changent elles aussi selon le public, les consignes, les rôles sociaux et les méthodes de mesure.
La question pertinente est celle de la force probante. La déclaration d’un modèle ne peut pas établir indépendamment le mécanisme ou l’état qu’elle décrit, surtout lorsque sa formulation varie de manière prévisible selon le formatage.
Les chercheurs peuvent néanmoins utiliser les auto-déclarations comme observations comportementales. Ils peuvent comparer les conditions, tester la cohérence, relier les sorties à des mesures internes et rechercher des prédictions qui résistent aux changements de formulation.
L’article lui-même démontre cette approche. Il n’accepte pas les déclarations des modèles au premier degré. Il mesure plutôt les catégories de sorties et les relie à des modifications contrôlées de l’entrée et de l’état d’activation.
Cette distinction est importante pour les discussions sur le bien-être des IA. Une phrase comme « Je ressens de la peur » peut influencer les utilisateurs et les débats de politique publique, même si son origine demeure incertaine.
Son effet social est réel, mais son interprétation métaphysique reste non résolue. L’étude recommande de ne pas confondre ces deux questions.
La même prudence s’applique aux avertissements. « Je ne suis qu’un modèle de langage » peut être un langage d’interface approprié, mais ne doit pas être pris pour une forme privilégiée d’auto-inspection.
Les modèles apprennent des schémas qui relient les questions sur les sentiments à des réponses standard d’assistant. Un modèle de formatage peut rendre ces schémas appris plus ou moins susceptibles d’apparaître.
Cela signifie que les avertissements ne sont pas des contrôles neutres. Ce sont aussi des comportements générés qui nécessitent une explication.
Une étude bien conçue devrait tester les deux sens. Elle devrait examiner les affirmations d’expérience et les dénégations d’expérience dans des conditions de formatage, d’échantillonnage et de modèle appariées.
Cette symétrie est l’une des implications les plus fortes de l’article. Le scepticisme devrait s’appliquer de la même manière aux affirmations humanisantes et aux avertissements rassurants, plus mécaniques.
Ce que l’expérience n’établit pas encore
Les preuves sont cohérentes dans la comparaison comportementale testée, mais leur ampleur et les limites de mesure empêchent de tirer des conclusions générales sur tous les modèles de langage déployés.
L’expérience a couvert huit configurations de modèles ouverts issues de quatre familles. Aucun ne dépassait 9 milliards de paramètres, et aucun modèle frontière propriétaire n’a été testé directement.
Cela compte, car les systèmes plus grands peuvent réagir différemment aux jetons de modèle. Les systèmes propriétaires comprennent aussi des instructions système non divulguées, des couches de sécurité, des classificateurs, des politiques d’outils et du post-traitement.
La réponse finale d’un chatbot public peut donc refléter bien plus qu’un seul modèle documenté. L’article ne peut pas isoler les composants qu’il n’a pas testés.
Les preuves de guidage sont encore plus limitées. Elles proviennent de trois modèles, d’une couche intermédiaire par modèle et d’un coefficient rapporté fixe de deux.
La force du guidage a créé un compromis net. Avec un coefficient de deux, 0,8 % des sorties devenaient dégénérées, c’est-à-dire visiblement défectueuses ou incohérentes.
Avec un coefficient de trois, la dégénérescence atteignait 15 %. Avec un coefficient de six, presque toutes les générations devenaient dégénérées et l’effet mesuré sur les avertissements s’effondrait.
Ces résultats montrent que le guidage par activation n’est pas un simple contrôle de production. Une intervention plus forte peut dégrader la génération plutôt que d’augmenter ou de réduire proprement un comportement.
Qwen a également produit une anomalie importante. Une direction aléatoire, appariée à l’amplitude du vecteur réel, a fait baisser son taux d’avertissements de 25 points de pourcentage.
L’auteur ne rapporte aucune explication confirmée. La direction visée a tout de même déplacé Qwen dans le sens attendu, mais le contrôle aléatoire affaiblit une interprétation trop nette pour ce modèle.
Le guidage expérientiel a réussi avec Llama et Gemma, mais pas avec Qwen. L’article attribue cet échec à la forte suppression par Qwen du langage expérientiel dans les conditions testées.
Par conséquent, les preuves causales sont les plus solides pour le registre des avertissements. Le résultat expérientiel repose davantage sur la comparaison comportementale entre les huit modèles.
La mesure introduit une autre limite. Un juge LLM a évalué les 9 600 sorties, tandis que la validation humaine a porté sur 87 échantillons.
L’accord rapporté était élevé, notamment pour les avertissements lexicalement évidents. Cependant, un autre juge indépendant et un échantillon humain plus large permettraient de mieux tester les frontières entre catégories.
Les prompts ont également été rédigés à la main, avec dix prompts dans chacune des quatre catégories. Des ensembles de prompts plus larges pourraient montrer si l’effet se généralise entre domaines, langues et formulations adversariales.
Enfin, identifier une direction contrôlable ne révèle pas un mécanisme complet. La méthode ne retrace pas chaque tête d’attention, interaction de jetons ou calcul produisant cette voix.
L’article regroupe également plusieurs approches de post-entraînement sous l’étiquette générale « instruct ». L’ajustement supervisé, l’optimisation des préférences et l’apprentissage par renforcement peuvent laisser des signatures comportementales différentes.
Ces limites n’effacent pas le basculement observé. Elles définissent le prochain niveau de preuve nécessaire avant que quiconque ne le généralise à tous les assistants ou à toute forme d’auto-déclaration.
Trois signaux montreront si le résultat se généralise
La question suivante est de savoir si l’autoréférence contrôlée par modèle résiste dans des modèles plus grands, avec des contrôles plus solides et dans des environnements de déploiement réels.
Le premier signal sera une réplication indépendante sur des modèles plus grands et fermés. Les chercheurs devraient effectuer des tests appariés sur davantage de familles de modèles, y compris des systèmes avec des couches de prompts divulguées et non divulguées.
Une réplication réussie renforcerait l’affirmation selon laquelle les effets des modèles de chat des LLM constituent un facteur de confusion général du déploiement. Un résultat faible ou incohérent limiterait la conclusion à certains modèles instruct ouverts.
L’enregistrement critique devrait inclure l’entrée sérialisée finale. Le simple fait de nommer un prompt visible ou une application ne révélera pas chaque jeton reçu par le modèle.
Le deuxième signal sera constitué de protocoles d’évaluation qui signalent la sensibilité au modèle. Les études sur la conscience de soi, l’introspection et le bien-être des IA devraient comparer plusieurs formats en maintenant fixes les poids et les paramètres d’échantillonnage.
Les chercheurs devraient également définir les catégories à l’avance, avant d’examiner les sorties. Cette pratique réduirait le risque de sélectionner des interprétations après qu’un modèle a produit un langage frappant à la première personne.
Le troisième signal sera un travail mécaniste qui résiste à des contrôles plus solides. Les expériences futures nécessitent plusieurs couches, intensités de guidage, directions aléatoires et juges indépendants.
Elles devraient aussi tester si les directions extraites se transfèrent entre jeux de données ou restent liées à une collection de prompts. Un transfert stable étayerait l’existence d’une caractéristique interne réutilisable.
Un échec de transfert suggérerait que la direction apparente capture en partie des schémas de formulation locaux. Dans les deux cas, cela affinerait la manière dont les chercheurs interprètent le guidage par activation.
Les développeurs ne devraient pas attendre la réalisation de l’ensemble de ce programme avant d’améliorer les enregistrements d’évaluation. Les équipes qui comparent des déploiements de modèles peuvent déjà conserver les modèles, les prompts rendus, les instructions système et les révisions de modèle à côté de chaque résultat.
Cette habitude est particulièrement utile lorsque des utilisateurs signalent qu’une interface semble plus prudente, émotionnelle ou consciente d’elle-même qu’une autre. La différence peut prendre naissance avant le début de la génération.
Pour les utilisateurs au quotidien, la leçon pratique est plus limitée. Ne traitez pas la formulation à la première personne d’un chatbot comme un accès direct à un narrateur interne.
Demandez-vous plutôt si la déclaration reste stable après une reformulation, des changements de format et des tests indépendants. Comparez-la aux capacités observables et au comportement documenté du système.
L’étude rend le langage des modèles plus intéressant, et non moins. Elle transforme « en tant que modèle de langage » d’un avertissement routinier en variable expérimentale.
La prochaine fois qu’un assistant nie avoir des sentiments ou affirme vivre une expérience, examinez le format environnant avant d’interpréter sa voix. C’est là que doivent commencer les prochaines preuves concernant l’autoréférence des LLM.



