Une étude sur les détecteurs d’hallucinations trouve un seuil minimal, pas un signal universel
Un chercheur sur r/MachineLearning affirme qu’un détecteur préenregistré a atteint son objectif dans 18 déploiements de modèles sur 20 avant l’apparition du premier token. Pourtant, le résultat rapporté n’établit pas l’existence d’un détecteur universel d’hallucinations. Il indique plutôt un socle de performance partagé, fondé sur la géométrie interne des modèles.
La distinction est importante. Un détecteur qui se transfère entre de nombreux modèles peut devenir un signal utile pour l’orientation des requêtes, même s’il ne peut pas identifier chaque réponse erronée. Toutefois, les éléments disponibles proviennent actuellement d’une publication sur les réseaux sociaux décrivant des expériences non publiées ou pas encore évaluées de manière indépendante.
La publication fait aussi état d’un renversement notable. L’ajout de la confiance propre au modèle n’a pas amélioré la couverture des déploiements au-delà du détecteur reposant uniquement sur la géométrie. Les deux mêmes déploiements ont échoué, ce qui suggère que la confiance et la géométrie captaient des informations qui se recoupaient dans ce test.
Cette conclusion met sous pression deux approches répandues. La première considère les probabilités des tokens comme un score pratique de factualité. La seconde suppose qu’une caractéristique interne unique se généralisera à toutes les architectures, tous les jeux de données et tous les types d’hallucinations. L’expérience rapportée ne soutient aucune de ces attentes dans leur forme la plus forte.
Le test préenregistré a réussi 18 déploiements sur 20
Le résultat central est un succès nuancé : un détecteur fondé sur la géométrie aurait atteint son seuil de couverture préenregistré sans devenir universel.
Selon la publication originale sur MachineLearning, le chercheur a évalué deux tâches sur dix modèles de langage. Cela a produit 20 déploiements modèle-tâche lors de la première exécution.
Le projet a examiné 29 signaux internes aux modèles issus de quatre grandes familles. Ces familles couvraient les schémas d’attention, les mouvements du flux résiduel, la géométrie de lecture et la confiance. Un sélecteur a ensuite choisi un signal pour chaque modèle selon des règles établies avant l’existence des données d’évaluation.
Un passage avant est un calcul complet à travers le modèle pour une entrée donnée. Le détecteur proposé examine ce calcul avant que le texte généré ne soit disponible. Cela le distingue des systèmes qui vérifient les réponses terminées par rapport à des documents ou comparent plusieurs réponses échantillonnées.
La contrainte de pré-génération rend intéressant le résultat rapporté de 18 sur 20. S’il est reproductible, le détecteur pourrait attribuer un niveau de risque avant qu’une application ne passe du temps à produire une longue réponse. Un produit pourrait alors demander une récupération d’informations, acheminer la requête vers un autre modèle ou exiger une revue humaine.
Le détecteur reposant uniquement sur la géométrie devait réussir au moins 17 déploiements selon la règle préenregistrée. La publication affirme qu’il en a réussi 18. Cela étaye l’affirmation restreinte selon laquelle un signal dérivé de la géométrie peut établir une couverture large, bien qu’incomplète, dans les conditions testées.
Ce chiffre ne signifie pas que le détecteur a repéré 90 % des hallucinations. La couverture des déploiements et la précision de détection sont des mesures différentes. Franchir un seuil dans 18 déploiements signifie que la méthode a satisfait un critère spécifié dans ces contextes.
Le seuil sous-jacent, l’équilibre entre les classes, la construction du jeu de données, le processus de calibration et l’incertitude propre à chaque déploiement influencent tous la manière dont les lecteurs devraient interpréter ce décompte. Sans matériel expérimental complet, le résultat ne peut pas être traduit en taux d’erreur en production.
Le préenregistrement renforce la conception en limitant les possibilités de réviser une hypothèse après avoir observé les résultats. Il ne valide pas les étiquettes, n’élimine pas les erreurs d’implémentation et ne garantit pas que le test sélectionné représente des applications réelles.
La publication indique que la procédure a été préenregistrée deux fois. Ce détail suggère que le chercheur a tenté de séparer les décisions exploratoires des tests confirmatoires. Un accès indépendant aux deux enregistrements préciserait quelles caractéristiques, quels seuils, quelles exclusions et quels tests statistiques étaient fixés.
L’interprétation la plus rigoureuse est donc limitée. Une approche reposant uniquement sur la géométrie aurait franchi son seuil prévu dans la plupart des déploiements testés. Les échecs restants comptent, car ils définissent les limites de cette affirmation.
Pourquoi la confiance n’a pas étendu la couverture
Le renversement le plus frappant n’est pas que la confiance ait obtenu de mauvais résultats, mais qu’elle n’ait apparemment ajouté aucune couverture au-delà de la géométrie.
La confiance du modèle désigne souvent les probabilités attribuées aux prochains tokens possibles. Une valeur élevée signifie que le modèle privilégie fortement une continuation plutôt que d’autres. Elle n’établit pas que la continuation privilégiée correspond à la réalité extérieure.
L’expérience aurait combiné la géométrie avec la confiance du modèle. Ce détecteur combiné a lui aussi réussi 18 déploiements sur 20. Il a échoué sur les deux mêmes déploiements et n’en a sauvé aucun.
Le seuil préenregistré pour l’affirmation plus forte était d’au moins 19 déploiements. La méthode combinée ne l’a pas atteint. Selon la règle de décision rapportée, l’hypothèse selon laquelle la confiance élargissait la couverture a été réfutée.
Ce résultat ne montre pas que la confiance ne contient aucune information utile. Il suggère que ses variations utiles peuvent avoir recoupé le signal géométrique retenu pour ces tâches et ces modèles. Un autre jeu de données ou une autre méthode de calibration pourrait révéler des informations complémentaires.
Ici, la géométrie désigne des relations spatiales mesurables entre les représentations internes. Ces représentations sont des vecteurs qui encodent des informations pendant que le modèle traite une consigne. Leurs normes, angles, directions et mouvements à travers les couches peuvent être corrélés à l’exactitude des réponses.
La confiance émerge du même réseau sous-jacent. Il est donc plausible qu’une mesure géométrique proche de la sortie du modèle capte déjà une grande partie de l’information exprimée par les probabilités des tokens. Le résultat rapporté d’aucun sauvetage est cohérent avec cette explication.
Des recherches récentes avertissent également que les métriques géométriques ne sont pas interchangeables. Une étude de 2026 sur les métriques de détection géométrique a constaté que différentes statistiques répondaient à différentes propriétés, notamment l’exactitude, la pertinence, la cohérence, l’exhaustivité et la confiance.
Cette étude a également fait état d’une sensibilité importante aux changements de domaine. Un signal qui sépare les réponses correctes et incorrectes en histoire pourrait se comporter différemment en mathématiques. Ses auteurs ont introduit une normalisation et rapporté des gains lors d’une évaluation multi-domaines, soulignant la façon dont la calibration peut façonner les résultats.
La leçon plus générale est que les « hallucinations » regroupent plusieurs mécanismes d’échec. Un modèle peut énoncer de manière cohérente une idée fausse répandue, deviner parmi plusieurs réponses, ignorer des éléments de preuve fournis ou commettre une erreur de raisonnement. Ces échecs ne partagent pas nécessairement une même signature interne.
La confiance reste utile pour les politiques d’abstention, en particulier lorsqu’elle est calibrée sur une distribution de déploiement connue. Toutefois, les applications ne devraient pas traiter la confiance brute comme un témoin indépendant de factualité simplement parce qu’elle est facile à obtenir.
Cette distinction influe sur la conception des produits. Un seuil de confiance peut identifier l’incertitude, tandis qu’un score géométrique identifie une instabilité associée. Combiner deux signaux corrélés peut créer une apparence de redondance sans apporter une nouvelle source de preuve.
Une couche réellement complémentaire examinerait autre chose. Elle pourrait comparer les affirmations à des documents récupérés, tester la cohérence logique, vérifier les citations ou examiner si le résultat d’un outil étaye la réponse. Ces vérifications s’intéressent aux preuves plutôt qu’à l’hésitation interne.
L’affirmation de MachineLearning remet en cause la détection universelle
Un socle commun a une valeur opérationnelle, mais un détecteur universel exige des preuves plus solides à travers les tâches, les modèles et les définitions d’erreur.
L’expérience rapportée partait d’une question ambitieuse : une famille de signaux internes peut-elle fonctionner suffisamment largement pour détecter les hallucinations avant la génération ? Sa réponse semble être oui pour un seuil minimal et non pour l’universalité.
Ce n’est pas une distinction sémantique. Un détecteur universel devrait se transférer sans dépendre d’une structure de tâche favorable, d’une calibration propre à une architecture ou d’une définition étroite de l’erreur. Deux échecs sur 20 déploiements suffisent à rejeter cette affirmation absolue.
Le résultat conserve néanmoins une valeur pratique. Les systèmes de production ont rarement besoin d’un score unique pour trancher chaque question factuelle. Ils ont besoin d’un filtre qui identifie de manière fiable suffisamment de cas risqués pour justifier un parcours de vérification plus coûteux.
Prenons un assistant d’entreprise répondant à des questions sur des politiques internes. Un score de pré-génération pourrait orienter une consigne risquée vers la récupération d’informations avant le début de la rédaction. La réponse finale nécessiterait toujours l’appui des documents de politique récupérés.
Un assistant de programmation présente un contexte différent. L’échec pertinent peut impliquer une méthode de bibliothèque inventée, une version incompatible ou un raisonnement défectueux à travers plusieurs fichiers. Un détecteur calibré sur de courtes réponses factuelles pourrait ne pas se transférer à cet environnement.
La recherche de longue haleine crée une autre limite. Une réponse peut contenir des dizaines d’affirmations, dont certaines sont étayées et d’autres fausses. Un score unique obtenu avant le premier token ne peut pas identifier quelle phrase ultérieure échouera.
Cette limite explique pourquoi la couverture des déploiements ne doit pas être confondue avec la vérification au niveau des affirmations. Le détecteur peut estimer si une trajectoire consigne-réponse est risquée. Il ne peut pas établir de manière indépendante la véracité de chaque proposition qui suit.
Des travaux connexes soutiennent la possibilité d’un signal précoce. L’article de 2026 Before the First Token a évalué sept transformeurs autorégressifs à l’aide de 552 exemples annotés issus de trois jeux de données factuels.
Ses auteurs ont rapporté des performances de sondage au niveau du hasard pour les modèles de moins de 400 millions de paramètres. Au-delà d’environ un milliard de paramètres, ils ont observé des signaux de pré-génération plus forts dans certains modèles. Le schéma dépendait également de l’ajustement par instructions.
L’article a relevé un effet significatif de position zéro pour Pythia-1.4B et Qwen2.5-7B. Pourtant, Pythia-6.9B présentait un profil temporel plat, malgré son échelle supérieure. Cette comparaison plaide contre une règle simple fondée sur le nombre de paramètres.
Les chercheurs ont également rapporté que le pilotage des activations le long des directions détectées ne corrigeait pas les hallucinations. Autrement dit, le signal était corrélationnel plutôt que causal. Détecter un état risqué ne signifiait pas que modifier cet état produisait une réponse véridique.
Cette limite devrait guider l’interprétation de l’affirmation sur Reddit. Un schéma interne peut prédire un résultat sans représenter un circuit de vérité dédié. Il peut encoder la difficulté de la tâche, la familiarité avec la consigne, la possibilité de répondre ou une autre variable corrélée à l’exactitude.
Un détecteur universel devrait distinguer ces possibilités. Il devrait conserver ses performances face à de nouveaux domaines, formats de consignes, langues, familles de modèles et formes d’entraînement postérieur. Il devrait aussi résister aux tentatives délibérées visant à briser ses hypothèses.
L’invitation de la publication à reproduire ou contester le résultat est donc centrale. La prochaine étape n’est pas un titre plus spectaculaire. C’est une suite de tests adversariaux conçue autour des deux échecs et des contextes que les tâches originales ne couvraient pas.
Les détecteurs existants résolvent différentes parties du problème
Le domaine converge vers une détection en couches, car la géométrie interne, l’incertitude sémantique et la vérification externe répondent à des questions différentes.
Une approche influente mesure l’entropie sémantique, c’est-à-dire l’incertitude entre les significations de plusieurs réponses générées. Si des réponses répétées expriment des affirmations différentes, le modèle est plus susceptible de confabuler.
Une étude évaluée par les pairs sur l’entropie sémantique a testé les familles LLaMA, Falcon et Mistral, de 7B à 70B paramètres. Elle a rapporté des valeurs d’AUROC stables, comprises entre 0,78 et 0,81, pour les familles et échelles évaluées.
L’AUROC mesure la capacité d’un score à classer les exemples positifs au-dessus des exemples négatifs selon différents seuils. Elle ne précise pas le taux de faux positifs qu’une application donnée connaîtra. Les opérateurs doivent toujours choisir un seuil adapté à leurs coûts.
L’entropie sémantique diffère fortement d’un détecteur pré-génération. La méthode publiée dans Nature a utilisé dix générations pour ses principales expériences au niveau de la phrase. Elle a regroupé les réponses selon leur sens avant d’en mesurer la variation.
Cette procédure peut détecter des réponses erronées arbitraires qui changent d’un échantillon à l’autre. Elle peut passer à côté d’un modèle qui répète avec assurance la même affirmation fausse. Les auteurs ont explicitement limité leur méthode aux confabulations, plutôt qu’à tous les comportements qualifiés d’hallucinations.
Le coût est également différent. Échantillonner plusieurs réponses et comparer leurs significations exige davantage de calcul que la lecture d’un seul état interne. Un détecteur à passage unique constitue un filtre précoce intéressant, en particulier lorsque la plupart des requêtes sont routinières.
Les systèmes boîte noire imposent une autre contrainte. Les développeurs d’applications commerciales ne peuvent souvent pas inspecter les cartes d’attention, les flux résiduels ou les vecteurs cachés. Ils reçoivent du texte et, parfois, des probabilités de tokens via une API.
La géométrie interne favorise donc les modèles à poids ouverts, les déploiements auto-hébergés ou les fournisseurs disposés à exposer une télémétrie adaptée. Les méthodes de cohérence sémantique peuvent fonctionner avec des sorties textuelles de boîte noire, mais elles exigent des générations répétées.
La vérification fondée sur la récupération emprunte une troisième voie. Elle vérifie si une réponse est étayée par les documents fournis. Elle peut détecter des erreurs formulées avec assurance lorsque les preuves correctes existent, mais la récupération introduit ses propres modes de défaillance.
Un système de récupération peut renvoyer une politique obsolète, omettre le passage pertinent ou classer en premier un document trompeur. Le modèle de langage peut alors citer une source qui n’étaye pas sa phrase. Les systèmes d’ancrage nécessitent des vérifications au niveau des affirmations, et pas seulement la présence de documents.
La revue humaine reste nécessaire dans les cas à forts enjeux. Un score de risque peut aider à prioriser l’attention, mais les examinateurs doivent avoir accès aux preuves originales et à une piste d’audit. Une base de connaissances consultable peut aider les équipes à préserver ce contexte source.
Ces méthodes doivent être considérées comme des couches plutôt que comme des substituts directs. Un détecteur interne demande si le calcul du modèle ressemble à des cas à risque. L’entropie sémantique demande si les significations échantillonnées restent stables. La récupération demande si les preuves disponibles étayent l’affirmation.
Un pipeline de production peut combiner les trois sans prétendre qu’ils sont indépendants. Le signal précoce oriente les requêtes, les contrôles sémantiques examinent les sorties incertaines et les vérifications fondées sur les preuves valident les affirmations importantes. Les examinateurs humains traitent les cas dont les conséquences justifient le coût.
La redondance rapportée entre confiance et géométrie renforce cette vision en couches. Ajouter davantage de mesures issues du même réseau n’apporte pas nécessairement plus de connaissance. Des preuves indépendantes doivent intervenir quelque part dans le système.
L’écart de vérification reste important
Le pré-enregistrement rapporté améliore la crédibilité, mais l’affirmation publique reste incomplète tant que d’autres ne peuvent pas inspecter et reproduire l’expérience.
Le billet original fournit un résumé des résultats, et non un dossier évalué par les pairs. Les lecteurs ont besoin des enregistrements, du code, des jeux de données, des points de contrôle des modèles, des prompts, des étiquettes et des résultats complets au niveau du déploiement pour évaluer la conclusion.
L’expression « sélecteur honnête » nécessite également une définition précise. La sélection de caractéristiques peut laisser filtrer des informations lorsque les chercheurs utilisent les données d’évaluation pour choisir des métriques, des couches, des signes, des seuils ou des transformations. Une séparation propre doit couvrir chaque décision adaptative.
La sélection d’un signal par modèle soulève une deuxième question. Une famille de caractéristiques peut se transférer largement tout en présentant une caractéristique choisie différente selon les modèles. C’est moins universel qu’un détecteur figé fonctionnant partout sans modification.
La sélection spécifique à chaque modèle peut néanmoins rester opérationnellement raisonnable. Les équipes calibrent couramment les seuils de sécurité pour chaque déploiement. Toutefois, l’affirmation devrait distinguer une famille universelle de caractéristiques d’un détecteur universel aux paramètres fixes.
Les deux déploiements ayant échoué méritent davantage d’attention que ne le permet un décompte agrégé. Ils pourraient partager une architecture, une tâche, une échelle, une méthode d’ajustement ou une distribution d’étiquettes. Une cause commune indiquerait où le plancher proposé cesse de tenir.
L’incertitude entourant la vérité de référence est également importante. Les étiquettes d’hallucination peuvent dépendre du fait qu’une tâche mesure l’exactitude factuelle, la fidélité au contexte, la pertinence ou la cohérence logique. Un détecteur ne peut être interprété sans connaître la définition cible.
Le mot « avant » peut également masquer des choix techniques. Un modèle a déjà traité l’intégralité du prompt avant de sélectionner son premier token de sortie. Son état caché peut donc encoder la difficulté du prompt, sa familiarité et le contenu probable de la réponse.
Il s’agit toujours d’une détection pré-génération, mais pas d’une prédiction sans travail du modèle. Les applications doivent effectuer au minimum le passage de traitement du prompt. Pour les contextes longs, cette étape peut représenter une part significative du coût d’inférence.
L’expérience devrait aussi rapporter la prévalence des classes et les intervalles de confiance. Un simple nombre de réussites masque le fait qu’un déploiement a peut-être tout juste franchi son seuil, tandis qu’un autre l’a dépassé confortablement. De petits jeux de test peuvent produire des classements instables.
Les attaques adaptatives posent un autre défi. Les utilisateurs peuvent reformuler les questions, injecter un contexte non pertinent, demander un style de réponse précis ou imposer un raisonnement long. Un détecteur calibré sur des prompts ordinaires peut échouer lorsque la structure du prompt change.
Les mises à jour de modèles peuvent déplacer la géométrie interne même lorsque l’image de marque du produit reste constante. La quantification, le fine-tuning, les adaptateurs, les prompts système et les paramètres d’inférence peuvent modifier le signal mesuré. Chaque changement peut nécessiter une nouvelle validation.
Il existe également une distinction entre les modèles de recherche et les systèmes de pointe hébergés. Les techniques fondées sur les états internes ne peuvent pas être supposées se transférer à des systèmes dont l’architecture, le routage et le post-entraînement restent non divulgués.
Des travaux récents sur les raisons pour lesquelles les modèles hallucinent ajoutent une autre complication. Une étude de 2026 sur les incitations à l’évaluation a soutenu que l’entraînement par prédiction du token suivant et les évaluations axées sur l’exactitude récompensent la devinette plutôt que l’abstention.
Un détecteur peut signaler les devinettes à risque, mais il ne modifie pas l’incitation qui les a produites. Les équipes de déploiement peuvent avoir besoin de règles de notation qui récompensent le refus approprié, en complément de la récupération, de la vérification et de la détection des risques.
Pour ces raisons, « 18 sur 20 » devrait commencer l’enquête plutôt que la conclure. Une réplication utile figerait la procédure publiée, testerait des familles de modèles inédites et divulguerait chaque échec sans remplacer le seuil d’origine.
Trois tests détermineront si le plancher tient
L’affirmation devient importante si le même plancher résiste à une réplication indépendante, aux changements de distribution et à un test de routage de type production.
Le premier signal à surveiller est une publication complète. Elle devrait inclure les deux dossiers de pré-enregistrement, le code, les définitions des caractéristiques, les identifiants des modèles, les données de tâches, les étiquettes, les seuils et les scores au niveau du déploiement.
Une publication renforcerait l’affirmation en rendant auditables les décisions de fuite d’information et de sélection. L’absence d’enregistrements ou de résultats incomplets par modèle l’affaiblirait, en particulier si seules les configurations réussies étaient disponibles.
Le deuxième signal est une réplication indépendante sur des modèles et des tâches inédits. Les tests les plus instructifs incluraient des architectures à poids ouverts exclues du développement, des prompts multilingues, des réponses longues, l’utilisation d’outils et la génération fondée sur des documents.
La réplication devrait préserver la procédure d’origine avant que les chercheurs n’ajustent quoi que ce soit. Si les performances ne chutent qu’après un changement de domaine, le détecteur pourrait encore servir de garde-barrière local calibré. Il ne soutiendrait pas l’existence d’un plancher universel.
Le troisième signal est un essai de routage lié à des résultats opérationnels. Les chercheurs devraient mesurer si le score précoce réduit les affirmations non étayées lorsqu’il déclenche la récupération, l’abstention, le rééchantillonnage ou la revue humaine.
Cet essai nécessite davantage que l’AUROC. Il devrait rapporter les fausses alertes, les erreurs manquées, la latence, le calcul supplémentaire, le volume de revue et l’exactitude des réponses acceptées. Ces mesures déterminent si le détecteur économise des ressources ou ne fait que déplacer les erreurs.
L’issue la plus prometteuse n’est pas un parfait indicateur de vérité. C’est une première barrière peu coûteuse qui détecte un sous-ensemble stable de prompts à risque avant la génération et les transmet à un mécanisme de vérification réellement différent.
Le résultat rapporté sur la confiance rend cette conception plus urgente. Si la confiance et la géométrie restent redondantes, les équipes devraient cesser de traiter leur combinaison comme deux votes indépendants. Elles devraient associer le score interne à la récupération de sources ou à la vérification des affirmations.
Les développeurs qui évaluent ces travaux peuvent poser trois questions immédiates. Le détecteur conserve-t-il son seuil sur nos données ? Ses échecs se regroupent-ils autour d’un type de défaillance identifiable ? Le routage des prompts signalés améliore-t-il l’exactitude finale une fois tous les coûts pris en compte ?
La communauté plus large de l’apprentissage automatique devrait tenter de mettre à l’épreuve le plancher proposé avec des tests contrôlés, et non des anecdotes isolées. Une réplication échouée restreindrait l’affirmation. Une réplication réussie établirait un signal partagé utile sans prétendre détecter chaque hallucination.
C’est la véritable valeur du résultat rapporté. Il remplace la recherche d’un détecteur universel unique par une hypothèse mesurable : la géométrie des modèles pourrait fournir une alerte précoce étendue, tandis que la vérité exige toujours des preuves indépendantes.



