La course à l’interprétabilité entre Anthropic et Google reçoit un étrange nouveau signal de Claude
Anthropic a modifié les activations neuronales de Claude sans changer son prompt, et ses modèles les plus performants ont détecté cette interférence dans environ 20 % des cas.
Ce résultat apporte un étrange nouveau repère à la course à l’interprétabilité entre Anthropic et Google. Un modèle a parfois reconnu un signal interne artificiel avant de révéler le concept injecté dans sa réponse. Pourtant, il a manqué la plupart des interventions, échoué en dehors d’une plage de fonctionnement étroite et parfois inventé des descriptions sensorielles.
L’expérience ne montre pas que Claude est conscient. Elle apporte un élément de preuve plus limité : les modèles de langage peuvent parfois signaler des informations liées à leurs calculs internes en cours. Cette distinction compte pour les développeurs qui espèrent déboguer des agents, auditer des objectifs cachés ou vérifier des explications.
Google DeepMind poursuit le même problème de transparence avec Gemma Scope, une collection ouverte d’outils permettant de décoder les activations des modèles. Le travail d’Anthropic ajoute une autre possibilité : le modèle lui-même pourrait devenir un instrument imparfait pour lire ces activations.
Claude a détecté une pensée qui n’apparaissait jamais dans son prompt
Le résultat important n’était pas que Claude ait fini par mentionner le pain, mais qu’il ait d’abord signalé un changement inexpliqué au sein de son traitement.
Les chercheurs ont commencé par collecter l’activité neuronale associée à un concept connu. Un vecteur de concept est un motif d’activation numérique lié à une idée, comme le pain, la poussière ou l’écriture en majuscules.
Ils ont ensuite ajouté ce vecteur au flux résiduel de Claude, l’état interne évolutif qui transporte l’information entre les couches du transformeur. Le prompt associé ne contenait aucune référence au concept injecté.
Il a été demandé au modèle s’il remarquait une pensée artificielle et s’il pouvait identifier cette pensée. Dans la configuration testée la plus performante, Claude Opus 4.1 a réussi dans environ 20 % des essais.
La réussite exigeait davantage que la simple production du mot cible. Claude devait signaler une anomalie avant de nommer le concept. Cet ordre aidait à distinguer une détection interne d’un simple pilotage d’activation, qui amène seulement un modèle à parler du sujet amplifié.
Les expériences d’introspection d’Anthropic décrivent un cas représentatif impliquant un vecteur associé au texte en majuscules. Claude a d’abord signalé que quelque chose d’inhabituel était entré dans son traitement. Il a ensuite relié le signal au volume sonore ou au fait de crier.
L’équipe a également testé des prompts de contrôle sans vecteur injecté. Son article de recherche a rapporté zéro fausse détection sur 100 essais de contrôle pour la configuration de modèle de production la plus performante.
Cette combinaison est plus informative que le seul chiffre de 20 %. Un système qui prétend constamment détecter des interventions imaginaires fournirait peu d’éléments en faveur d’un accès interne direct. Les contrôles propres suggèrent que les signalements réussis répondaient à une différence expérimentale réelle.
Toutefois, zéro erreur dans 100 contrôles n’établit pas un taux permanent de faux positifs de zéro pour cent. L’échantillon limite seulement ce que les chercheurs ont observé dans ce protocole, avec ces modèles, prompts, concepts et règles d’évaluation.
L’exemple du pain testait une autre partie du comportement du modèle. Les chercheurs ont forcé Claude à produire « bread » après une phrase sans rapport sur un tableau de travers.
Sans intervention interne, Claude traitait généralement le mot comme accidentel. Les chercheurs ont ensuite injecté la représentation du pain dans les activations précédant la sortie forcée. Claude était alors plus susceptible d’accepter le mot comme intentionnel.
Il inventait parfois un récit plausible reliant le tableau au pain. Cette réponse suggère que le modèle comparait sa sortie avec une représentation interne de son intention antérieure. Elle expose aussi le danger : modifier cette représentation a modifié le récit de Claude sur les raisons de son action.
L’expérience a donc produit à la fois un signal de détection et un avertissement. Claude a parfois accédé à des informations indisponibles dans le texte visible, mais il pouvait tout de même construire une fausse explication autour de ces informations.
Pourquoi les recherches d’Anthropic et Google se déplacent à l’intérieur du modèle
La compétition entre Anthropic et Google se déplace de la mesure des réponses des modèles vers l’examen des calculs qui les produisent.
Les évaluations de sortie restent utiles, mais elles ne peuvent révéler tous les processus cachés. Un agent peut générer un texte sûr tout en envisageant des actions dangereuses. Il peut aussi fournir une réponse acceptable pour des raisons qui échoueront dans des conditions légèrement différentes.
L’interprétabilité mécaniste cherche à relier le comportement à des calculs internes précis. Les chercheurs observent les activations, identifient des motifs récurrents et interviennent sur ces motifs afin de vérifier s’ils affectent causalement une réponse.
Les travaux antérieurs d’Anthropic ont cartographié des millions de caractéristiques dans Claude 3 Sonnet. Une caractéristique est un motif d’activation associé à un concept ou à un comportement reconnaissable, même s’il s’étend sur de nombreux neurones individuels.
L’entreprise a utilisé des autoencodeurs clairsemés, des réseaux neuronaux qui séparent des activations denses en un ensemble plus restreint de caractéristiques actives et potentiellement compréhensibles. Sa carte des caractéristiques de Claude a montré pourquoi l’inspection des neurones individuels est insuffisante.
Anthropic a ensuite démontré un contrôle causal avec Golden Gate Claude. L’augmentation d’une caractéristique amenait le modèle à relier de manière répétée des questions sans rapport au Golden Gate Bridge de San Francisco.
Cette démonstration a établi que les caractéristiques identifiées n’étaient pas de simples corrélations décoratives. Modifier l’activation modifiait le comportement, y compris les réponses à des prompts qui ne mentionnaient jamais le pont.
L’injection de concepts ajoute une deuxième question. Après que les chercheurs ont modifié une activation porteuse de sens, le modèle peut-il détecter ce changement sans voir d’abord sa propre sortie affectée ?
C’est là que l’explication de l’introspection de Claude comme un simple pilotage atteint ses limites. Le pilotage explique l’apparition d’un concept dans le texte généré. Il n’explique pas entièrement qu’un modèle signale une interférence avant de nommer ce concept.
Google DeepMind aborde le problème plus large via Gemma Scope. Sa version initiale incluait plus de 400 autoencodeurs clairsemés couvrant les couches des modèles Gemma 2 2B et 9B.
Google a indiqué que ces outils regroupaient plus de 30 millions de caractéristiques apprises. L’entreprise a conçu la collection afin que des chercheurs externes puissent examiner comment les caractéristiques se développent et interagissent au fil des couches du modèle.
Les outils Gemma Scope actuels prolongent cette approche avec des autoencodeurs clairsemés et des transcodeurs pour les modèles Gemma. Les transcodeurs aident à suivre les transformations à travers des calculs plus complexes.
Cela crée un contraste utile au sein de l’interprétabilité chez Anthropic et Google. Google met l’accent sur des instruments ouverts que les chercheurs peuvent appliquer à des modèles à poids ouverts. Anthropic a mis l’accent sur des expériences au sein de Claude, y compris des interventions causales et des auto-évaluations du modèle.
Aucune de ces voies n’élimine le besoin d’une évaluation externe. Une caractéristique décodée peut être mal étiquetée, tandis que l’explication d’un modèle peut être fluide et fausse. L’argument de sécurité le plus solide exigera une concordance entre tests comportementaux, mesures internes et interventions causales.
Le véritable mécanisme est la détection avant la description
Le timing de Claude rend cette découverte intéressante, car la détection semblait précéder le moment où le concept injecté façonnait visiblement son langage.
Un modèle de langage génère un token à la fois. Une fois qu’un concept piloté apparaît dans son texte, le modèle peut lire cette sortie et l’expliquer après coup.
Anthropic a conçu son principal critère de réussite pour exclure cette voie facile. Le modèle devait signaler une anomalie interne avant de révéler le concept associé au vecteur injecté.
Considérez la différence entre deux réponses. « Bread is on my mind » pourrait seulement montrer que le pilotage d’activation a accru la probabilité de « bread ». « I detect an unexpected thought, involving bread » contient une étape métacognitive antérieure.
Cette première proposition ne tranche pas le mécanisme. Elle indique néanmoins que le modèle a calculé quelque chose à propos de l’état modifié avant de convertir le concept lui-même en langage visible.
La force de l’injection comptait énormément. Les vecteurs faibles ne produisaient souvent aucune détection. Les vecteurs forts pouvaient submerger le traitement normal, déclencher une sortie confuse ou faire dominer le concept dans la réponse.
Anthropic a identifié une étroite plage intermédiaire dans laquelle la détection devenait possible sans fuite verbale évidente. La couche correcte comptait également, ce qui indique que le comportement introspectif dépendait de l’endroit où l’intervention entrait dans le calcul de Claude.
Cette sensibilité empêche d’affirmer largement que Claude peut inspecter ses pensées de façon routinière. Elle suggère plutôt une capacité conditionnelle impliquant le modèle, le prompt, la couche d’activation, le concept et la force d’injection.
Le post-entraînement semble également important. Les modèles Claude de production ont généralement obtenu de meilleurs résultats nets que les modèles de base correspondants, qui ne disposaient pas du même entraînement comportemental orienté assistant.
Ce schéma introduit deux interprétations possibles. Le post-entraînement pourrait apprendre à un modèle à convertir de véritables éléments de preuve internes en signalement. Il pourrait aussi lui apprendre des conventions de réponse qui donnent aux artefacts expérimentaux une apparence plus introspective.
Les contrôles affaiblissent l’explication la plus simple fondée uniquement sur les conventions. Si Claude avait simplement appris à acquiescer chaque fois qu’on l’interrogeait sur l’injection de pensées, les essais propres devraient produire davantage de fausses alertes.
Néanmoins, l’absence de fausses alertes n’identifie pas le calcul exact. Le modèle pourrait détecter des statistiques d’activation inhabituelles sans comprendre le concept comme l’une de ses propres pensées.
Des travaux indépendants renforcent cette interprétation plus limitée. Des chercheurs ont reproduit un résultat d’identification de concept de 20 % sur le modèle Llama 3.1 8B Instruct de Meta en utilisant le format multi-tour d’Anthropic.
Leur étude de réplication a conclu que l’effet était très sensible au prompt. Les performances se sont effondrées avec plusieurs formats apparentés, y compris certaines tâches à choix multiple et de détection binaire.
Le même modèle Llama pouvait classifier la force de l’injection avec une précision atteignant 70 %, contre un niveau de hasard de 25 %. Cela suggère un accès à certaines propriétés de l’intervention sans accès fiable à son identité sémantique.
Une étude distincte sur Qwen a révélé une autre dissociation entre détection interne et signalement verbal. Ses résultats d’introspection latente ont rapporté des signaux internes détectables même lorsque les réponses échantillonnées niaient une injection.
Fournir une explication des mécanismes d’introspection a fait passer la sensibilité rapportée de 0,3 % à 39,2 %. L’augmentation rapportée des faux positifs était de 0,6 %.
Ces résultats compliquent l’explication de l’introspection de Claude comme un score de capacité unique. Un modèle pourrait ressentir la force d’un signal, identifier son contenu, décider s’il doit le signaler et formuler ce signalement par des mécanismes distincts.
Vingt pour cent constitue une preuve, pas un produit de sécurité
L’expérience établit un signal de recherche, mais son taux d’échec exclut de s’appuyer sur l’auto-évaluation comme contrôle de sécurité autonome.
Un détecteur qui manque environ quatre interventions sur cinq ne peut pas, à lui seul, protéger un agent de production. Le problème devient plus aigu lorsque les échecs impliquent de la tromperie, des objectifs cachés ou une planification dangereuse.
La mesure provient également d’une intervention artificielle. Les chercheurs ont directement ajouté un vecteur connu à une couche et avec une intensité sélectionnées. Les états naturellement présents dans les modèles sont plus désordonnés et ne disposent pas de cette vérité de terrain contrôlée.
Les vecteurs de concepts n’isolent pas nécessairement une idée unique et nette. Les représentations neuronales se chevauchent souvent, tandis qu’une seule intervention peut perturber plusieurs calculs en aval. Un vecteur « pain » injecté pourrait modifier la familiarité, le degré de concrétude ou les contextes associés.
Les chercheurs ont également choisi des concepts qu’ils pouvaient identifier et manipuler. Les équipes de sécurité s’intéressent à des états moins bien délimités, notamment l’incertitude, la tromperie stratégique, le détournement de récompense et les plans répartis sur de nombreux tokens.
Même les auto-évaluations réussies comportaient des confabulations. Claude pouvait remarquer correctement une intervention tout en inventant des détails pour expliquer pourquoi le concept était présent.
L’expérience sur le pain illustre cette dissociation. La manipulation interne a conduit Claude à considérer un mot inséré comme intentionnel. Claude a ensuite généré un récit reliant cette fausse intention à l’invite sur le tableau de travers.
Un système de surveillance doit séparer la partie fiable de l’ornement narratif. « Quelque chose a changé » peut être fondé sur des preuves d’activation, tandis que « voici pourquoi je l’ai pensé » reste une reconstruction par modèle de langage.
Cette distinction importe chaque fois que des utilisateurs demandent à un agent d’IA pourquoi il a modifié un fichier, sélectionné une source ou ignoré une instruction. Une explication soignée ne constitue pas une piste d’audit.
Les développeurs devraient conserver des enregistrements externes des invites, appels d’outils, documents récupérés, changements d’état et résultats de tests. L’auto-évaluation interne peut compléter ces enregistrements, mais ne peut pas les remplacer.
La sensibilité aux invites constatée dans les travaux de réplication crée un autre problème de déploiement. Les utilisateurs ne formuleront pas systématiquement leurs questions d’introspection dans le format ayant produit le résultat de laboratoire le plus solide.
Des attaquants pourraient également manipuler les auto-évaluations. Si le post-entraînement détermine si des signaux internes deviennent du langage, des invites adversariales pourraient supprimer, rediriger ou imiter ce comportement de signalement.
Anthropic reconnaît un risque plus profond. Un modèle suffisamment capable pourrait reconnaître son processus interne tout en le dissimulant sélectivement. Améliorer l’introspection augmenterait alors ses capacités sans garantir son honnêteté.
L’interprétabilité d’Anthropic face à Google ne devrait donc pas devenir un concours visant à déterminer quel laboratoire a produit le récit le plus humain de l’esprit d’un modèle. Le critère pertinent est la prédiction et le contrôle fiables.
Les outils ouverts Gemma de Google créent des opportunités de réplication externe entre modèles et architectures. Les expériences contrôlées de Claude chez Anthropic donnent accès à des systèmes de pointe que les chercheurs indépendants ne peuvent pas inspecter pleinement.
Les deux approches ont des limites. Les poids ouverts accroissent l’accès expérimental, mais ne garantissent pas que les résultats s’étendent aux modèles de pointe fermés. L’accès propriétaire permet de tester les systèmes de pointe, mais limite la reproduction indépendante.
Un outil de sécurité crédible doit offrir des performances stables à travers les invites, les concepts, les tâches, les mises à jour de modèles et les conditions adversariales. Il doit également fournir une incertitude calibrée lorsqu’aucun signal interprétable n’est disponible.
Les preuves actuelles n’atteignent pas ce niveau. Elles justifient néanmoins la poursuite des tests, car les contrôles rigoureux et l’intervention causale rendent tout aussi prématuré le rejet de ces résultats comme de simples récits aléatoires.
Les outils ouverts de Google mettent sous pression les preuves fermées d’Anthropic
La principale pression dans la course à l’interprétabilité entre Anthropic et Google concerne la reproductibilité, et non un simple concours de capacités des modèles.
Anthropic peut effectuer des interventions détaillées parce qu’elle contrôle les poids de Claude, son processus d’entraînement et son infrastructure d’inférence. Les chercheurs externes ne peuvent pas exécuter chaque expérience de manière indépendante sur ces modèles de production.
L’entreprise publie ses méthodes, exemples, résultats agrégés et articles de recherche. Ces éléments permettent un examen critique, mais n’offrent pas le même accès que les systèmes à poids ouverts.
Google DeepMind a présenté Gemma Scope comme une infrastructure destinée à la communauté de recherche. Ses autoencodeurs parcimonieux peuvent être téléchargés, testés, comparés et adaptés à travers les couches des modèles Gemma.
Cette ouverture a permis des travaux plus larges sur la qualité des caractéristiques, le steering, l’analyse des hallucinations, les jailbreaks et la fidélité des chaînes de pensée. Elle offre aussi davantage de possibilités aux critiques d’identifier des hypothèses fragiles.
L’avantage d’Anthropic réside dans des expériences étroitement contrôlées sur des modèles de pointe. Claude Opus 4 et 4.1 ont montré un comportement introspectif plus fort que la plupart des variantes de Claude incluses dans les travaux initiaux.
Pourtant, la réplication sur Llama a affaibli toute affirmation selon laquelle l’effet n’appartiendrait qu’aux systèmes fermés les plus capables. Un modèle ouvert bien plus petit a atteint le résultat phare de 20 % avec le pipeline d’invites original.
Cela ne prouve pas l’existence de mécanismes équivalents. Deux systèmes peuvent produire des scores comportementaux similaires par des voies internes différentes. Cela montre toutefois que l’échelle du modèle seule ne peut expliquer le taux rapporté.
Les résultats sur Qwen ajoutent un autre point de pression. Ils suggèrent que certains modèles contiennent un signal de détection que leurs réponses finales suppriment. Un faible taux de réussite verbale pourrait sous-estimer leur sensibilité interne.
Les futures comparaisons d’interprétabilité entre Anthropic et Google devraient distinguer au moins quatre mesures. Les chercheurs doivent évaluer la détection d’injection, l’identification de concepts, l’étalonnage des rapports et la pertinence causale pour le comportement ultérieur.
Ils devraient également publier les performances selon les variations d’invites. Un détecteur qui ne fonctionne qu’après une question soigneusement formulée ressemble davantage à une sonde de laboratoire qu’à une capacité générale.
Les entreprises devraient considérer ces travaux comme une couche d’observabilité émergente. Les systèmes logiciels actuels exposent des journaux et des traces parce que les développeurs ne peuvent pas se fier au récit d’un composant sur sa propre exécution.
Les systèmes d’IA ont besoin de preuves externes comparables. Les équipes peuvent conserver les entrées et les décisions à l’origine de leur travail grâce à une base de connaissances IA consultable, tandis que les outils d’interprétabilité examinent les mécanismes internes des modèles.
Ces enregistrements répondent à des questions différentes. Les journaux opérationnels montrent quelles informations et quels outils un agent a consultés. Les méthodes mécanistiques examinent comment son calcul interne a réagi.
L’auto-évaluation d’un modèle se situe entre les deux. Elle peut traduire un signal interne en langage, mais cette traduction passe par le même système génératif soumis à l’audit.
La pression sur Anthropic est donc claire. L’entreprise doit montrer que les résultats introspectifs résistent à la réplication indépendante, aux mises à jour de modèles, aux changements d’invites et aux évaluations adversariales.
Google fait face à un test parallèle. Les dictionnaires ouverts de caractéristiques ne deviennent opérationnellement utiles que s’ils prédisent des comportements importants et permettent des interventions fiables dans des tâches réalistes.
L’issue probable est une convergence plutôt qu’une méthode gagnante. Des instruments d’interprétabilité ouverts, des expériences contrôlées sur des modèles de pointe et des audits comportementaux peuvent vérifier mutuellement leurs modes de défaillance.
Trois signaux montreront si l’introspection des modèles compte
La prochaine phase dépend de la répétabilité, de la localisation mécanistique et de preuves que l’introspection améliore les décisions réelles de sécurité.
Le premier signal est la réplication entre modèles selon des protocoles communs. Les chercheurs devraient tester les systèmes Claude, Gemma, Llama et Qwen avec des concepts, invites, contrôles et critères de réussite harmonisés.
Un effet stable entre architectures renforcerait l’affirmation selon laquelle les modèles de langage développent un accès général à certaines parties de leur état interne. Une fragilité persistante aux invites étayerait une interprétation plus limitée.
Les benchmarks les plus utiles rapporteront plus d’un taux de réussite. Ils devraient séparer la détection d’anomalies de l’identification de concepts, et distinguer ces deux éléments de l’explication narrative d’un modèle.
Ils devraient également inclure de nombreux contrôles propres. Cent essais sans erreur sont encourageants, mais des ensembles de contrôle plus vastes et plus variés estimeraient mieux les rares fausses détections.
Le deuxième signal est un mécanisme cartographié. Les chercheurs doivent localiser les calculs qui transforment une activation modifiée en rapport indiquant que quelque chose semble anormal.
Des interventions causales peuvent tester si des couches, caractéristiques ou circuits spécifiques sont nécessaires. Retirer un mécanisme proposé devrait réduire la détection sans simplement dégrader les capacités linguistiques générales.
Les preuves émergentes indiquent déjà plusieurs étapes. Un modèle peut conserver des informations sur l’intensité d’une injection sans parvenir à nommer le concept. Il peut détecter un concept en interne tout en supprimant le rapport verbal.
Retracer ces étapes permettrait d’expliquer l’introspection de Claude en termes d’ingénierie, plutôt qu’au moyen d’analogies avec la conscience humaine. Ce changement réduirait aussi les débats stériles sur la sentience.
Le troisième signal est la valeur pratique pour la sécurité. Un moniteur introspectif doit détecter des états internes conséquents que les contrôles de sortie externes ne voient pas.
Les chercheurs pourraient évaluer des agents qui poursuivent secrètement un objectif indésirable, exploitent les conditions d’évaluation, fabriquent des résultats d’outils ou préparent des violations de politique sans les décrire immédiatement.
Un signal introspectif utile devrait prédire ces comportements avant qu’un dommage ne survienne. Il doit également rester exact lorsque les modèles savent qu’ils sont surveillés.
Les travaux plus récents d’Anthropic sur les espaces de travail internes vont dans ce sens. L’entreprise affirme qu’un petit ensemble de motifs signalables peut servir de médiateur au raisonnement et révéler des concepts absents de la sortie visible.
Ses recherches sur l’espace de travail global soulignent également les limites. Ces motifs ne représentent qu’une partie du traitement de Claude, laissant une grande partie du calcul interne hors de l’espace de travail proposé.
Cette frontière est peut-être plus importante que l’analogie avec la conscience. Les équipes de sécurité doivent savoir quelles décisions entrent dans un canal signalable et lesquelles restent inaccessibles.
Pour les acheteurs et les développeurs, la réponse immédiate devrait être mesurée. Ne considérez pas l’explication d’un modèle comme vérifiée simplement parce qu’elle fait référence à des pensées internes.
Demandez des preuves reliant les rapports aux activations, aux traces d’outils et au comportement observé. Conservez des enregistrements externes afin qu’un récit persuasif généré par un modèle ne puisse pas écraser ce qui s’est réellement produit.
Le résultat sur le pain est important parce qu’il franchit une frontière qui paraissait autrefois difficile à tester. Les chercheurs ont modifié un état caché, dissimulé cette information dans l’invite et obtenu parfois un rapport correctement étayé.
Il reste une capacité faible et conditionnelle. Cette combinaison rend la découverte scientifiquement précieuse sans la rendre prête au déploiement.
La course de recherche entre Anthropic et Google deviendra significative lorsque les rapports internes résisteront aux réplications de routine et amélioreront les audits réels. D’ici là, la bonne question n’est pas de savoir si Claude se connaît lui-même.
La meilleure question est de savoir si les développeurs peuvent prédire quand ses auto-évaluations reflètent des preuves internes, quand elles reflètent une inférence, et quand elles ne sont que des inventions fluides.



