Un estudio sobre detectores de alucinaciones halla un umbral mínimo, no una señal universal
Un investigador en r/MachineLearning afirma que un detector preregistrado cumplió su objetivo en 18 de 20 despliegues de modelos antes de que apareciera el primer token. Sin embargo, el resultado reportado no establece un detector universal de alucinaciones. Más bien apunta a un umbral de rendimiento compartido basado en la geometría interna del modelo.
La distinción importa. Un detector que se transfiera entre muchos modelos puede convertirse en una señal útil para enrutar consultas, incluso si no puede identificar todas las respuestas falsas. No obstante, la evidencia procede actualmente de una publicación social que describe experimentos inéditos o aún no revisados de forma independiente.
La publicación también informa de un giro notable. Añadir la propia confianza del modelo no mejoró la cobertura de despliegues frente al detector basado únicamente en geometría. Los mismos dos despliegues fallaron, lo que sugiere que la confianza y la geometría capturaron información superpuesta en esta prueba.
Ese hallazgo pone presión sobre dos enfoques conocidos. Uno considera las probabilidades de los tokens como una puntuación práctica de veracidad. El otro espera que una única característica interna se generalice entre arquitecturas, conjuntos de datos y tipos de alucinación. El experimento reportado no respalda ninguna de esas expectativas en su forma más contundente.
La prueba preregistrada superó 18 de 20 despliegues
El resultado central es un éxito matizado: un detector basado en geometría habría alcanzado su umbral de cobertura preregistrado sin llegar a ser universal.
Según la publicación original de MachineLearning, el investigador evaluó dos tareas en diez modelos de lenguaje. Esto generó 20 despliegues modelo-tarea en la primera ejecución.
El proyecto examinó 29 señales internas de los modelos procedentes de cuatro familias amplias. Esas familias abarcaban patrones de atención, movimiento del flujo residual, geometría de lectura y confianza. Después, un selector eligió una señal para cada modelo conforme a reglas establecidas antes de que existieran los datos de evaluación.
Un pase hacia delante es un cálculo completo a través del modelo para una entrada determinada. El detector propuesto inspecciona ese cálculo antes de que el texto generado esté disponible. Esto lo diferencia de los sistemas que verifican respuestas terminadas frente a documentos o comparan varias respuestas muestreadas.
La restricción previa a la generación hace interesante el resultado reportado de 18 de 20. Si es reproducible, el detector podría asignar riesgo antes de que una aplicación invierta tiempo en producir una respuesta larga. Entonces, un producto podría solicitar recuperación de información, enrutar la consulta a otro modelo o exigir revisión humana.
El detector basado únicamente en geometría debía superar al menos 17 despliegues según la regla preregistrada. La publicación afirma que superó 18. Esto respalda la afirmación limitada de que una señal derivada de la geometría puede establecer una cobertura amplia, aunque incompleta, en las condiciones evaluadas.
La cifra no significa que el detector detectara el 90 por ciento de las alucinaciones. La cobertura de despliegue y la precisión de detección son mediciones distintas. Superar un umbral en 18 despliegues indica que el método cumplió un criterio especificado en esos entornos.
El umbral subyacente, el equilibrio de clases, la construcción del conjunto de datos, el proceso de calibración y la incertidumbre por despliegue afectan a cómo los lectores deben interpretar el recuento. Sin materiales experimentales completos, el resultado no puede traducirse en una tasa de error en producción.
El preregistro fortalece el diseño al limitar las oportunidades de revisar una hipótesis después de ver los resultados. No valida las etiquetas, no elimina errores de implementación ni garantiza que la prueba seleccionada represente aplicaciones reales.
La publicación indica que el procedimiento se preregistró dos veces. Ese detalle sugiere que el investigador intentó separar las decisiones exploratorias de las pruebas confirmatorias. El acceso independiente a ambos registros aclararía qué características, umbrales, exclusiones y pruebas estadísticas quedaron fijados.
Por tanto, la interpretación responsable más sólida es limitada. Un enfoque basado únicamente en geometría habría superado su umbral previsto en la mayoría de los despliegues evaluados. Los fallos restantes importan porque definen el límite de la afirmación.
Por qué la confianza no amplió la cobertura
El giro más contundente no es que la confianza tuviera un mal desempeño, sino que, según se informa, no añadió cobertura más allá de la geometría.
La confianza del modelo suele referirse a las probabilidades asignadas a posibles tokens siguientes. Un valor alto significa que el modelo favorece con fuerza una continuación sobre las alternativas. No establece que la continuación favorecida coincida con la realidad externa.
Según se informa, el experimento combinó geometría con la confianza del modelo. Ese detector combinado también superó 18 de 20 despliegues. Falló en los mismos dos despliegues y no rescató ninguno.
El umbral preregistrado para la afirmación más sólida era de al menos 19 despliegues. El método combinado no lo alcanzó. Según la regla de decisión reportada, quedó falsificada la proposición de que la confianza ampliaba la cobertura.
Este resultado no demuestra que la confianza no contenga información útil. Sugiere que su variación útil podría haberse solapado con la señal geométrica elegida en estas tareas y modelos. Un conjunto de datos o método de calibración diferente podría revelar información complementaria.
La geometría se refiere aquí a relaciones espaciales medibles entre representaciones internas. Esas representaciones son vectores que codifican información mientras el modelo procesa una instrucción. Sus normas, ángulos, direcciones y movimiento entre capas pueden correlacionarse con la corrección de la respuesta.
La confianza surge de la misma red subyacente. Por tanto, es plausible que una medición geométrica cerca de la salida del modelo ya capture gran parte de la información expresada por las probabilidades de los tokens. El resultado reportado de cero rescates es coherente con esa explicación.
Investigaciones recientes también advierten que las métricas geométricas no son intercambiables. Un estudio de 2026 sobre métricas de detección geométrica halló que distintas estadísticas respondían a propiedades diferentes, entre ellas la corrección, la relevancia, la coherencia, la exhaustividad y la confianza.
Ese estudio también reportó una sensibilidad considerable a los cambios de dominio. Una señal que separa respuestas correctas e incorrectas sobre historia podría comportarse de forma distinta en matemáticas. Sus autores introdujeron normalización e informaron de mejoras en una evaluación multidominio, lo que subraya cómo la calibración puede moldear los resultados.
La lección más amplia es que la «alucinación» combina varios mecanismos de fallo. Un modelo puede afirmar de manera consistente una idea errónea común, adivinar entre varias respuestas, ignorar evidencia proporcionada o cometer un error de razonamiento. Esos fallos no tienen por qué compartir una única firma interna.
La confianza sigue siendo útil para las políticas de abstención, especialmente cuando se calibra frente a una distribución de despliegue conocida. Sin embargo, las aplicaciones no deberían tratar la confianza bruta como un testigo independiente de la veracidad simplemente porque sea fácil de obtener.
Esta distinción afecta al diseño de producto. Un umbral de confianza puede identificar incertidumbre, mientras que una puntuación geométrica identifica una inestabilidad relacionada. Combinar dos señales correlacionadas puede crear una apariencia de redundancia sin añadir una nueva fuente de evidencia.
Una capa realmente complementaria inspeccionaría algo distinto. Podría comparar afirmaciones con registros recuperados, comprobar la coherencia lógica, verificar citas o examinar si el resultado de una herramienta respalda la respuesta. Esas comprobaciones abordan la evidencia, no la vacilación interna.
La afirmación de MachineLearning cuestiona la detección universal
Un umbral común es valioso desde el punto de vista operativo, pero un detector universal exige evidencia más sólida entre tareas, modelos y definiciones de error.
El experimento reportado partió de una pregunta ambiciosa: ¿puede una familia de señales internas funcionar con suficiente amplitud como para detectar alucinaciones antes de la generación? Su respuesta parece ser sí para un umbral mínimo y no para la universalidad.
No se trata de una distinción semántica. Un detector universal debería transferirse sin depender de una estructura de tarea favorable, de una calibración específica de la arquitectura o de una definición estrecha del error. Dos fallos entre 20 despliegues bastan para rechazar esa afirmación absoluta.
El resultado sigue teniendo valor práctico. Los sistemas de producción rara vez necesitan una puntuación que resuelva todas las cuestiones factuales. Necesitan una barrera que identifique de forma fiable suficientes casos arriesgados como para justificar una vía de verificación más costosa.
Considere un asistente empresarial que responde preguntas sobre políticas internas. Una puntuación previa a la generación podría enrutar una instrucción arriesgada hacia la recuperación de información antes de que comience la redacción. La respuesta final seguiría necesitando respaldo de los documentos de políticas recuperados.
Un asistente de programación presenta un entorno distinto. El fallo relevante puede implicar un método de biblioteca inventado, una versión incompatible o un razonamiento defectuoso entre varios archivos. Un detector calibrado con respuestas factuales breves podría no transferirse a ese entorno.
La investigación de formato largo crea otro límite. Una respuesta puede contener decenas de afirmaciones, algunas respaldadas y otras falsas. Una única puntuación tomada antes del primer token no puede identificar qué oración posterior fallará.
Esta limitación explica por qué la cobertura de despliegue no debe confundirse con la verificación a nivel de afirmación. El detector puede estimar si una trayectoria de instrucción-respuesta es arriesgada. No puede establecer de forma independiente la verdad de cada proposición que siga.
Investigaciones relacionadas respaldan la posibilidad de una señal temprana. El artículo de 2026 Before the First Token evaluó siete transformers autorregresivos utilizando 552 ejemplos etiquetados de tres conjuntos de datos factuales.
Sus autores informaron de un rendimiento de las sondas equivalente al azar en modelos de menos de 400 millones de parámetros. Por encima de aproximadamente mil millones de parámetros, observaron señales previas a la generación más fuertes en algunos modelos. El patrón también dependía del ajuste mediante instrucciones.
El artículo halló un efecto significativo en la posición cero para Pythia-1.4B y Qwen2.5-7B. Sin embargo, Pythia-6.9B mostró un perfil temporal plano, pese a su mayor escala. Esa comparación desaconseja una regla simple basada en el número de parámetros.
Los investigadores también informaron de que dirigir las activaciones a lo largo de las direcciones detectadas no corrigió las alucinaciones. En otras palabras, la señal era correlacional, no causal. Detectar un estado arriesgado no significaba que cambiar ese estado produjera una respuesta veraz.
Ese límite debería orientar la interpretación de la afirmación de Reddit. Un patrón interno puede predecir un resultado sin representar un circuito dedicado a la verdad. Puede codificar dificultad de la tarea, familiaridad con la instrucción, capacidad de respuesta u otra variable correlacionada con la corrección.
Un detector universal tendría que separar esas alternativas. Debería preservar el rendimiento en nuevos dominios, formatos de instrucciones, idiomas, familias de modelos y formas de posentrenamiento. También debería resistir intentos intencionados de romper sus supuestos.
Por tanto, la invitación de la publicación a reproducir o cuestionar el resultado es central. La siguiente etapa no es un titular más grande. Es una batería de pruebas adversariales diseñada en torno a los dos fallos y a entornos que las tareas originales no cubrieron.
Los detectores existentes resuelven partes diferentes del problema
El campo está convergiendo en una detección por capas porque la geometría interna, la incertidumbre semántica y la verificación externa responden a preguntas distintas.
Un enfoque influyente mide la entropía semántica, es decir, la incertidumbre entre los significados de varias respuestas generadas. Si las respuestas repetidas expresan afirmaciones diferentes, es más probable que el modelo esté confabulando.
Un estudio revisado por pares sobre entropía semántica probó las familias LLaMA, Falcon y Mistral, con entre 7B y 70B parámetros. Reportó valores de AUROC estables entre 0,78 y 0,81 en las familias y escalas evaluadas.
El AUROC mide qué tan bien una puntuación clasifica los ejemplos positivos por encima de los negativos a través de distintos umbrales. No especifica la tasa de falsos positivos que experimentará una aplicación concreta. Los operadores aún necesitan un umbral alineado con sus costes.
La entropía semántica difiere radicalmente de un detector previo a la generación. El método de Nature utilizó diez generaciones en sus principales experimentos a nivel de oración. Agrupó las respuestas por significado antes de medir su variación.
Ese procedimiento puede detectar respuestas incorrectas arbitrarias que cambian entre muestras. Puede pasar por alto un modelo que repite con seguridad la misma afirmación falsa. Los autores limitaron explícitamente su método a las confabulaciones, en lugar de abarcar todos los comportamientos etiquetados como alucinaciones.
El coste también es distinto. Muestrear varias respuestas y comparar sus significados requiere más cómputo que leer un único estado interno. Un detector de una sola pasada ofrece un filtro inicial atractivo, especialmente cuando la mayoría de las consultas son rutinarias.
Los sistemas de caja negra introducen otra limitación. Los desarrolladores de aplicaciones comerciales a menudo no pueden inspeccionar mapas de atención, flujos residuales o vectores ocultos. Reciben texto y, quizá, probabilidades de tokens mediante una API.
Por tanto, la geometría interna favorece a los modelos con pesos abiertos, los despliegues autoalojados o los proveedores dispuestos a exponer telemetría adecuada. Los métodos de consistencia semántica pueden funcionar con salidas de texto de caja negra, aunque exigen generaciones repetidas.
La verificación basada en recuperación adopta una tercera vía. Comprueba si una respuesta está fundamentada en los documentos proporcionados. Puede detectar errores expresados con seguridad cuando existe la evidencia correcta, pero la recuperación introduce sus propios modos de fallo.
Un recuperador puede devolver una política desactualizada, omitir el pasaje relevante o clasificar primero un documento engañoso. El modelo de lenguaje podría entonces citar una fuente que no respalda su oración. Los sistemas de fundamentación necesitan comprobaciones a nivel de afirmación, no solo la presencia de documentos.
La revisión humana sigue siendo necesaria en casos de alto riesgo. Una puntuación de riesgo puede priorizar la atención, pero los revisores necesitan acceso a la evidencia original y a un rastro de auditoría. Una base de conocimiento con búsqueda puede ayudar a los equipos a preservar ese contexto de las fuentes.
Estos métodos deberían considerarse capas, no sustitutos directos. Un detector interno pregunta si el cómputo del modelo se parece a casos de riesgo. La entropía semántica pregunta si los significados muestreados se mantienen estables. La recuperación pregunta si la evidencia disponible respalda la afirmación.
Un pipeline de producción puede combinar los tres sin fingir que son independientes. La señal temprana dirige las consultas, las comprobaciones semánticas examinan las salidas inciertas y las verificaciones de evidencia validan las afirmaciones relevantes. Los revisores humanos se encargan de los casos cuyas consecuencias justifican el coste.
La redundancia reportada entre confianza y geometría refuerza esta visión por capas. Añadir más mediciones de la misma red no necesariamente añade más conocimiento. La evidencia independiente debe entrar en algún punto del sistema.
La brecha de verificación sigue siendo grande
El prerregistro reportado mejora la credibilidad, pero la afirmación pública sigue incompleta hasta que otros puedan inspeccionar y reproducir el experimento.
La publicación original ofrece un resumen de resultados, no un registro revisado por pares. Los lectores necesitan los registros, el código, los conjuntos de datos, los checkpoints de los modelos, los prompts, las etiquetas y los resultados completos a nivel de despliegue para evaluar el hallazgo.
La expresión “selector honesto” también necesita una definición precisa. La selección de características puede filtrar información cuando los investigadores usan datos de evaluación para elegir métricas, capas, signos, umbrales o transformaciones. Una división limpia debe abarcar cada decisión adaptativa.
Seleccionar una señal por modelo plantea una segunda cuestión. Una familia de características puede transferirse ampliamente, mientras que la característica elegida difiere entre modelos. Eso es menos universal que un detector congelado que opera sin cambios en todas partes.
La selección específica por modelo puede seguir siendo razonable desde el punto de vista operativo. Los equipos calibran habitualmente los umbrales de seguridad para cada despliegue. Sin embargo, la afirmación debería distinguir entre una familia universal de características y un detector universal con parámetros fijos.
Los dos despliegues fallidos merecen más atención de la que proporciona un recuento agregado. Podrían compartir arquitectura, tarea, escala, método de ajuste o distribución de etiquetas. Una causa común identificaría dónde se rompe el umbral propuesto.
La incertidumbre en torno a la verdad de referencia también importa. Las etiquetas de alucinación pueden depender de si una tarea mide corrección factual, fidelidad al contexto, relevancia o consistencia lógica. Un detector no puede interpretarse sin conocer la definición objetivo.
La palabra “antes” también puede ocultar decisiones técnicas. Un modelo ya ha procesado todo el prompt antes de seleccionar su primer token de salida. Por tanto, su estado oculto puede codificar la dificultad del prompt, su familiaridad y el contenido probable de la respuesta.
Esto sigue siendo detección previa a la generación, pero no es una predicción sin trabajo del modelo. Las aplicaciones deben completar al menos la pasada de procesamiento del prompt. En contextos largos, esa etapa puede representar una parte significativa del coste de inferencia.
El experimento también debería informar de la prevalencia de clases y los intervalos de confianza. Un simple recuento de aprobados oculta si un despliegue apenas superó su umbral mientras otro lo superó cómodamente. Los conjuntos de prueba pequeños pueden producir clasificaciones inestables.
Los ataques adaptativos presentan otro desafío. Los usuarios pueden reformular preguntas, inyectar contexto irrelevante, solicitar un estilo de respuesta concreto o forzar razonamientos largos. Un detector calibrado con prompts ordinarios podría fallar cuando cambia la estructura del prompt.
Las actualizaciones del modelo pueden desplazar la geometría interna incluso cuando la marca del producto se mantiene constante. La cuantización, el ajuste fino, los adaptadores, los prompts de sistema y la configuración de inferencia pueden alterar la señal medida. Cada cambio puede requerir una nueva validación.
También existe una distinción entre los modelos de investigación y los sistemas frontier alojados. No puede suponerse que las técnicas basadas en estados internos se transfieran a sistemas cuya arquitectura, enrutamiento y postentrenamiento siguen sin revelarse.
Trabajos recientes sobre por qué los modelos alucinan añaden otra complicación. Un estudio de incentivos de evaluación de 2026 sostuvo que el entrenamiento de predicción del siguiente token y las evaluaciones centradas en la precisión recompensan adivinar en lugar de abstenerse.
Un detector puede señalar adivinaciones de riesgo, pero no cambia el incentivo que las produjo. Los equipos de despliegue pueden necesitar reglas de puntuación que recompensen la negativa apropiada, junto con recuperación, verificación y detección de riesgos.
Por esas razones, “18 de 20” debería iniciar la investigación, no terminarla. Una replicación útil congelaría el procedimiento publicado, probaría familias de modelos no vistas y revelaría cada fallo sin sustituir el umbral original.
Tres pruebas decidirán si el umbral se sostiene
La afirmación cobra importancia si el mismo umbral sobrevive a una replicación independiente, a cambios de distribución y a una prueba de enrutamiento de estilo productivo.
La primera señal que conviene observar es una publicación completa. Debería incluir ambos registros de prerregistro, código, definiciones de características, identificadores de modelos, datos de tareas, etiquetas, umbrales y puntuaciones a nivel de despliegue.
Una publicación reforzaría la afirmación al hacer auditables las decisiones de filtrado y selección. La ausencia de registros o de resultados completos por modelo la debilitaría, especialmente si solo estuvieran disponibles las configuraciones exitosas.
La segunda señal es una replicación independiente en modelos y tareas no vistos. Las pruebas más informativas incluirían arquitecturas con pesos abiertos excluidas del desarrollo, prompts multilingües, respuestas extensas, uso de herramientas y generación fundamentada en documentos.
La replicación debería preservar el procedimiento original antes de que los investigadores ajusten nada. Si el rendimiento cae solo después de un cambio de dominio, el detector aún podría servir como una puerta local calibrada. No respaldaría un umbral universal.
La tercera señal es una prueba de enrutamiento vinculada a resultados operativos. Los investigadores deberían medir si la puntuación temprana reduce las afirmaciones sin respaldo cuando activa recuperación, abstención, remuestreo o revisión humana.
Esa prueba necesita más que AUROC. Debería informar de falsas alarmas, errores no detectados, latencia, cómputo añadido, volumen de revisión y precisión de las respuestas aceptadas. Esas mediciones determinan si el detector ahorra recursos o simplemente desplaza los errores.
El resultado más prometedor no es un medidor perfecto de la verdad. Es una primera puerta económica que detecta un subconjunto estable de prompts de riesgo antes de la generación y los entrega a un mecanismo de verificación realmente distinto.
El resultado de confianza reportado hace que ese diseño sea más urgente. Si la confianza y la geometría siguen siendo redundantes, los equipos deberían dejar de tratar su combinación como dos votos independientes. Deberían emparejar la puntuación interna con recuperación de fuentes o verificación de afirmaciones.
Los desarrolladores que evalúan este trabajo pueden plantearse tres preguntas inmediatas. ¿El detector conserva su umbral con nuestros datos? ¿Sus errores no detectados se agrupan en torno a un tipo de fallo reconocible? ¿Enrutar los prompts señalados mejora la precisión final una vez contabilizados todos los costes?
La comunidad más amplia de aprendizaje automático debería intentar romper el umbral propuesto con pruebas controladas, no con anécdotas aisladas. Una replicación fallida delimitaría la afirmación. Una exitosa establecería una señal compartida útil sin pretender que detecta todas las alucinaciones.
Ese es el valor real del resultado reportado. Sustituye la búsqueda de un detector universal por una hipótesis medible: la geometría del modelo puede proporcionar una advertencia temprana amplia, mientras que la verdad sigue requiriendo evidencia independiente.



