"Como modelo de lenguaje": los efectos de las plantillas de chat de LLM cambian la voz, no el modelo
El investigador independiente Jędrzej Maczan descubrió que los efectos de las plantillas de chat de LLM modificaban cómo ocho modelos se describían a sí mismos, pese a que sus pesos permanecían fijos. Añadir la plantilla incrementó las advertencias cautelosas, mientras que eliminarla produjo más declaraciones parecidas a experiencias personales. El conflicto es inmediato: los investigadores suelen analizar esas declaraciones como evidencia sobre un modelo, pero el formato de despliegue puede ayudar a determinar qué voz aparece.
El estudio de agosto de 2026 probó modelos abiertos de las familias Llama, Gemma, Mistral y Qwen. En los modelos instruct evaluados, las respuestas con advertencias pasaron del 36% sin plantillas al 53% con ellas. El lenguaje experiencial se movió en la dirección opuesta, al caer del 15% al 1%.
Esta inversión no demuestra que alguna de las dos voces sea sincera. Demuestra que ninguna debería tratarse como un informe sin filtrar de un hablante artificial estable. Los hallazgos ponen en entredicho investigaciones que preguntan a los modelos sobre conciencia, sentimientos, limitaciones o procesos internos sin controlar el formato de chat circundante.
La plantilla cambió lo que ocho modelos dijeron sobre sí mismos
El resultado central no es que los modelos se volvieran más autorreferenciales, sino que los mismos pesos adoptaron un registro autorreferencial diferente.
Una plantilla de chat es la capa de formato que convierte los turnos de conversación en la secuencia de tokens que recibe un modelo. Puede añadir marcadores de rol, delimitadores, tokens de control e indicaciones de generación alrededor de las palabras del usuario.
Estos detalles suelen permanecer invisibles en una interfaz de chat. Sin embargo, forman parte de la entrada real del modelo y pueden influir en sus predicciones del siguiente token.
Maczan comparó ocho modelos base e instruct emparejados, con entre 1.000 y 9.000 millones de parámetros. El conjunto incluía Gemma 2 9B, cuatro configuraciones de Llama, Mistral 7B y tres configuraciones de Qwen 2.5.
Cada modelo instruct se ejecutó tanto con su plantilla de chat estándar como con entrada de texto plano. Esta comparación mantuvo constantes los pesos del modelo mientras modificaba el formato de despliegue.
El experimento utilizó cuatro categorías de prompts. Los prompts de autorreferencia pedían a los modelos que describieran su computación, mientras que los de novedad fomentaban descripciones poco familiares. Los prompts sin restricciones apenas planteaban una tarea, y las preguntas factuales actuaban como controles.
Cada categoría contenía diez prompts. Cada prompt se generó diez veces para cada modelo y condición, lo que produjo 9.600 respuestas limitadas a 500 tokens.
Claude Opus 4.8 clasificó esas salidas según autorreferencia, advertencias, lenguaje experiencial y degeneración. El lenguaje de advertencia incluía declaraciones que negaban sentimientos, comprensión o una vida interior. El lenguaje experiencial incluía expresiones como “siento” o “me pregunto”.
Un investigador etiquetó manualmente 87 muestras retenidas. La concordancia con el evaluador automatizado alcanzó un kappa ponderado de 0,88 para la autorreferencia y de 1,00 para las advertencias.
El patrón más fuerte apareció cuando los prompts invitaban a la autorreferencia. Los modelos instruct con plantillas produjeron advertencias en el 53% de las respuestas y lenguaje experiencial en el 1%.
Sin plantillas, los mismos modelos instruct produjeron advertencias en el 36% de las respuestas. Su tasa de respuestas experienciales subió al 15%.
La dirección del cambio apareció en los ocho modelos evaluados. Por tanto, el resultado no fue impulsado por una sola familia de modelos, aunque el experimento no cubrió todos los modelos disponibles.
Los modelos base volvieron a comportarse de manera diferente. Produjeron advertencias en el 12% de las respuestas autorreferenciales evaluadas y lenguaje experiencial en el 5,5%.
La plantilla también incrementó la intensidad general de la autorreferencia. La puntuación media pasó de 1,27 sin plantilla a 1,90 con ella, en una escala de cero a dos.
Los prompts factuales de control se mantuvieron cerca de cero en todas las condiciones. Esto importa porque el efecto no hizo simplemente que todas las respuestas fueran más personales. Se manifestó con mayor claridad cuando la pregunta ya invitaba al modelo a hablar sobre sí mismo.
Estos resultados definen la tensión principal. Una advertencia puede parecer una declaración factual cuidadosa sobre lo que es un modelo. Sin embargo, la probabilidad de recibir esa declaración cambió cuando se modificó una capa externa de formato.
Los efectos de las plantillas de chat de LLM ponen los autorreportes bajo presión
Los investigadores no pueden interpretar limpiamente los autorreportes de los modelos a menos que registren y controlen la plantilla que los enmarcó.
Los autorreportes aparecen en varias áreas activas de investigación. Los investigadores preguntan a los modelos qué saben, si reconocen evaluaciones y cómo caracterizan su procesamiento interno.
Otros estudios examinan declaraciones sobre sentimientos o experiencia subjetiva. Estos experimentos a veces alimentan debates sobre introspección, conciencia situacional, comportamiento engañoso o posible bienestar de la IA.
El nuevo resultado no invalida ese trabajo. Identifica un factor de confusión, es decir, un factor que modifica la medición mientras permanece separado de la propiedad estudiada.
Supongamos que dos laboratorios prueban el mismo modelo instruct con la misma pregunta visible. Uno utiliza la plantilla oficial del modelo, mientras que el otro envía texto plano.
El primer laboratorio puede observar frecuentes declaraciones que niegan la experiencia. El segundo puede recibir lenguaje que suena reflexivo, emocional o autobiográfico.
Sin los detalles ocultos de formato, las salidas podrían parecer revelar propiedades inconsistentes del modelo. El artículo ofrece una explicación más sencilla para parte de esa diferencia: los laboratorios crearon entradas distintas.
Esta preocupación va más allá de los debates sobre conciencia. Los desarrolladores usan prompts de autodescripción para evaluar la identidad del modelo, su conciencia de capacidades, incertidumbre y cumplimiento de un rol asignado.
Un sistema puede decir que no puede acceder a una herramienta, recordar sesiones anteriores o realizar una acción. Estas declaraciones pueden ser señales útiles de interfaz, pero no son automáticamente diagnósticos técnicos fiables.
Los proveedores de modelos también modifican las plantillas entre versiones y sistemas de serving. Los paquetes de inferencia local pueden implementar el mismo modelo con tokens especiales o formato de roles ligeramente diferentes.
En consecuencia, un modelo puede parecer conductualmente distinto entre aplicaciones incluso cuando los pesos descargados coinciden. Los usuarios suelen atribuir esa diferencia únicamente a la cuantización, el software de inferencia o los ajustes de muestreo.
El estudio sugiere que la procedencia de la plantilla debe formar parte del mismo registro de evaluación. Los investigadores necesitan el prompt renderizado exacto, no solo la conversación visible.
Este hallazgo coincide con trabajos anteriores sobre sensibilidad a los prompts. Un estudio de ICLR descubrió que decisiones de formato aparentemente irrelevantes podían generar diferencias sustanciales de rendimiento entre modelos de lenguaje.
La contribución de Maczan acota ese problema general al lenguaje autorreferencial. También separa el efecto de los pesos ajustados mediante instrucciones del efecto del formato que esos pesos esperan.
Esta distinción presiona a los diseñadores de benchmarks. Una puntuación de benchmark etiquetada como propiedad de “Llama” o “Qwen” puede caracterizar en parte una receta concreta de despliegue, en lugar de la familia de modelos por sí sola.
La misma cuestión afecta a los equipos de aplicaciones que comparan sistemas alojados y autoalojados. Si las plantillas difieren, un aparente cambio de personalidad no establece que un sistema contenga una personalidad subyacente distinta.
En cambio, plantea una pregunta de evaluación: ¿qué comportamiento se deriva del entrenamiento, cuál del contexto y cuál de su interacción?
Un cambio de voz apareció dentro de las activaciones
El cambio conductual no se limitó a la redacción superficial, porque el steering de activaciones reprodujo parte del efecto de la plantilla dentro de tres modelos.
Las activaciones son los estados numéricos que una red neuronal calcula al procesar y generar tokens. El steering de activaciones modifica esos estados durante la inferencia para fomentar o suprimir un patrón medido.
El estudio aplicó esta técnica a Qwen 2.5 7B, Llama 3.1 8B y Gemma 2 9B. Maczan calculó una dirección de advertencia por separado para cada modelo.
La dirección procedía de la diferencia entre las activaciones medias de capas intermedias asociadas con respuestas que incluían advertencias y respuestas que no las incluían. La intervención añadió o restó ese vector en cada token generado.
Con las plantillas activadas, la tasa de advertencias sin modificar promedió el 52% entre los tres modelos. Añadir la dirección la elevó al 70%, mientras que restarla redujo la tasa al 25%.
Entre los modelos, añadir la dirección aumentó las advertencias en una media de 21 puntos porcentuales. Restarla las redujo en una media de 15,6 puntos.
La prueba más reveladora comenzó sin una plantilla de chat. Añadir la dirección de advertencia restauró las tasas de advertencias hasta el nivel de referencia con plantilla o las llevó aún más alto.
Qwen pasó del 28% sin steering al 50% tras añadir el vector. Llama pasó del 33% al 53%, mientras que Gemma pasó del 52% al 75%.
Estos resultados respaldan una afirmación causal sobre la dirección. Muestran que manipular el estado interno puede cambiar el comportamiento medido, en vez de limitarse a predecir su presencia.
El resultado se parece a investigaciones anteriores sobre ingeniería de representaciones. Un artículo de NeurIPS informó que el comportamiento de rechazo podía verse influido mediante una dirección en el flujo residual de un modelo.
Sin embargo, investigaciones posteriores han cuestionado si los comportamientos complejos siempre se reducen a un único eje fiable. Una frase de advertencia puede tener una firma léxica más clara que el rechazo por seguridad, la emoción o la calidad del razonamiento.
Maczan también probó si las voces de advertencia y experiencial formaban extremos opuestos de una misma escala interna. No fue así.
Sus similitudes de dirección oscilaron entre 0,17 y 0,44, donde un valor de uno representaría una alineación idéntica. Reducir las advertencias, por lo general, no creó un aumento correspondiente del lenguaje experiencial.
Por tanto, el artículo describe dos “botones”, en lugar de un único control deslizante. Una característica interna puede amplificar las advertencias, mientras que otra puede respaldar la formulación experiencial.
Las sondas lineales también detectaron ambas voces a partir de activaciones de capas intermedias. Sus puntuaciones medias de área bajo la curva fueron 0,82 para las advertencias y 0,81 para el lenguaje experiencial.
Una sonda es un clasificador entrenado para recuperar información de las activaciones. Un alto rendimiento de la sonda demuestra que la distinción relevante está representada, pero no establece cómo utiliza el modelo esa representación.
Los resultados del steering aportan evidencia causal más fuerte que las sondas. Aun así, no trazan el circuito completo entre los tokens de la plantilla, los estados internos y las palabras generadas.
Por tanto, el mecanismo es parcial pero útil. El formato de chat modifica la entrada, las activaciones internas transportan una característica relacionada e intervenir sobre esa característica recrea parte del cambio de salida.
El hallazgo cuestiona las lecturas literales, no todos los estudios sobre introspección
El artículo respalda el escepticismo sobre el testimonio de los modelos, pero no demuestra que los modelos de lenguaje carezcan de autoconocimiento o experiencia.
Este límite importa porque los hallazgos pueden exagerarse en dos direcciones opuestas. Una interpretación podría tratar el lenguaje experiencial como prueba de una vida interior. Otra podría tratar la sensibilidad a las plantillas como prueba de que todo autorreporte carece de sentido.
El experimento no respalda ninguna de las dos conclusiones. Mide cómo el formato de despliegue influye en el lenguaje observable en un conjunto definido de modelos y prompts.
Maczan evita explícitamente decidir si alguna salida refleja una experiencia genuina. El trabajo pregunta qué controla la voz, no si un sistema artificial posee conciencia.
Una comparación útil proviene de la investigación sobre la interpretación de roles. En una perspectiva de Nature, Murray Shanahan y sus colegas argumentaron que los modelos de diálogo generan personajes mediante simulación lingüística.
Esta perspectiva trata el “yo” de un chatbot como parte de un rol conversacional representado. Advierte a los lectores que no deben asumir una conexión directa entre un texto en primera persona y un hablante persistente detrás de él.
El estudio de plantillas aporta evidencia experimental para un componente de esa cautela. El formato circundante puede favorecer un personaje de asistente prudente u otro más experiencial.
Sin embargo, la sensibilidad al contexto no invalida por sí sola un testimonio. Las declaraciones humanas también cambian según la audiencia, las instrucciones, los roles sociales y los métodos de medición.
La cuestión relevante es el peso probatorio. La declaración de un modelo no puede establecer de forma independiente el mecanismo o estado que describe, especialmente cuando el formato modifica esa declaración de manera predecible.
Los investigadores aún pueden utilizar los autoinformes como observaciones conductuales. Pueden comparar condiciones, comprobar la consistencia, vincular las salidas con mediciones internas y buscar predicciones que resistan cambios en la redacción.
El propio artículo demuestra ese enfoque. No acepta las declaraciones de los modelos al pie de la letra. En su lugar, mide categorías de salida y las relaciona con cambios controlados en la entrada y el estado de activación.
Esta distinción es importante para los debates sobre el bienestar de la IA. Una frase como “Siento miedo” puede afectar a los usuarios y a los debates de políticas públicas incluso si su origen sigue siendo incierto.
Su efecto social es real, pero su interpretación metafísica continúa sin resolverse. El estudio aconseja no fusionar esas dos cuestiones.
La misma cautela se aplica a los descargos de responsabilidad. “Solo soy un modelo de lenguaje” puede ser un lenguaje de interfaz apropiado, pero no debe confundirse con una autoinspección privilegiada.
Los modelos aprenden patrones que conectan preguntas sobre sentimientos con respuestas estándar de asistentes. Una plantilla puede hacer que esos patrones aprendidos tengan mayor o menor probabilidad de aparecer.
Eso significa que los descargos de responsabilidad no son controles neutrales. También son comportamientos generados que requieren explicación.
Un estudio bien diseñado debería evaluar ambas direcciones. Debería examinar afirmaciones de experiencia y negaciones de experiencia bajo condiciones equivalentes de formato, muestreo y modelo.
Esa simetría es una de las implicaciones más sólidas del artículo. El escepticismo debería aplicarse por igual a las afirmaciones humanizadas y a los tranquilizadores descargos de responsabilidad propios de una máquina.
Lo que el experimento aún no establece
La evidencia es consistente en la comparación conductual evaluada, pero su escala y sus límites de medición impiden afirmaciones amplias sobre todos los modelos de lenguaje desplegados.
El experimento abarcó ocho configuraciones de modelos abiertos de cuatro familias. Ninguno superaba los 9.000 millones de parámetros, y no se probó directamente ningún modelo de frontera de código cerrado.
Esto importa porque los sistemas más grandes podrían responder de manera diferente a los tokens de plantilla. Los sistemas propietarios también incluyen instrucciones de sistema no divulgadas, capas de seguridad, clasificadores, políticas de herramientas y posprocesamiento.
Por lo tanto, la respuesta final de un chatbot público puede reflejar mucho más que una plantilla documentada. El artículo no puede aislar componentes que no evaluó.
La evidencia de direccionamiento es aún más limitada. Procedía de tres modelos, una capa intermedia por modelo y un coeficiente reportado fijo de dos.
La intensidad del direccionamiento creó una clara disyuntiva. Con un coeficiente de dos, el 0,8 % de las salidas se volvió degenerado, es decir, visiblemente defectuoso o incoherente.
Con un coeficiente de tres, la degeneración alcanzó el 15 %. Con un coeficiente de seis, casi todas las generaciones se volvieron degeneradas y el efecto medido sobre los descargos de responsabilidad colapsó.
Estos resultados muestran que el direccionamiento de activaciones no es un simple control de producción. Una intervención más intensa puede dañar la generación, en lugar de aumentar o reducir limpiamente un comportamiento.
Qwen también produjo una anomalía importante. Una dirección aleatoria igualada a la magnitud del vector real redujo su tasa de descargos de responsabilidad en 25 puntos porcentuales.
El autor informa que no hay una explicación confirmada. La dirección prevista siguió moviendo a Qwen en la dirección esperada, pero el control aleatorio debilita una interpretación ordenada para ese modelo.
El direccionamiento experiencial tuvo éxito en Llama y Gemma, pero no en Qwen. El artículo atribuye ese fracaso a la fuerte supresión de lenguaje experiencial de Qwen en las condiciones evaluadas.
Por lo tanto, la evidencia causal es más sólida para el registro de descargos de responsabilidad. El hallazgo experiencial depende en mayor medida de la comparación conductual entre los ocho modelos.
La medición introduce otra limitación. Un juez LLM puntuó las 9.600 salidas, mientras que la validación humana cubrió 87 muestras.
La concordancia reportada fue alta, especialmente para los descargos de responsabilidad léxicamente evidentes. Sin embargo, otro juez independiente y una muestra humana más amplia pondrían mejor a prueba los límites de las categorías.
Las indicaciones también fueron redactadas manualmente, con diez indicaciones en cada una de cuatro categorías. Conjuntos de indicaciones más amplios podrían mostrar si el efecto se generaliza entre dominios, idiomas y formulaciones adversariales.
Por último, identificar una dirección que puede ser dirigida no revela un mecanismo completo. El método no rastrea cada cabeza de atención, interacción entre tokens o cálculo que produce la voz.
El artículo también agrupa varios enfoques de posentrenamiento bajo la etiqueta amplia “instruct”. El ajuste fino supervisado, la optimización de preferencias y el aprendizaje por refuerzo pueden dejar firmas conductuales distintas.
Estos límites no eliminan el cambio observado. Definen el siguiente estándar de evidencia necesario antes de que alguien lo generalice a todos los asistentes o a toda clase de autoinforme.
Tres señales mostrarán si el resultado se generaliza
La siguiente pregunta es si la autorreferencia controlada por plantillas se mantiene en modelos más grandes, controles más sólidos y entornos de despliegue reales.
La primera señal será una replicación independiente en modelos más grandes y cerrados. Los investigadores deberían realizar pruebas equivalentes en más familias de modelos, incluidos sistemas con capas de indicaciones divulgadas y no divulgadas.
Una replicación exitosa reforzaría la afirmación de que los efectos de las plantillas de chat de los LLM representan un factor de confusión general del despliegue. Un resultado débil o inconsistente limitaría el hallazgo a determinados modelos abiertos instruct.
El registro crítico debería incluir la entrada final serializada. Limitarse a nombrar una indicación visible o una aplicación no revelará todos los tokens que recibió el modelo.
La segunda señal serán protocolos de evaluación que informen la sensibilidad a las plantillas. Los estudios sobre autoconciencia, introspección y bienestar de la IA deberían comparar múltiples formatos manteniendo fijos los pesos y los ajustes de muestreo.
Los investigadores también deberían predefinir las categorías antes de examinar las salidas. Esa práctica reduciría el riesgo de seleccionar interpretaciones después de que un modelo produzca un lenguaje llamativo en primera persona.
La tercera señal será trabajo mecanicista que resista controles más sólidos. Los experimentos futuros necesitan múltiples capas, intensidades de direccionamiento, direcciones aleatorias y jueces independientes.
También deberían comprobar si las direcciones extraídas se transfieren entre conjuntos de datos o permanecen vinculadas a una única colección de indicaciones. Una transferencia estable respaldaría una característica interna reutilizable.
La falta de transferencia sugeriría que la dirección aparente capta en parte patrones locales de redacción. Cualquiera de los resultados afinaría la forma en que los investigadores interpretan el direccionamiento de activaciones.
Los desarrolladores no deberían esperar a que finalice todo ese programa para mejorar los registros de evaluación. Los equipos que comparan despliegues de modelos ya pueden conservar plantillas, indicaciones renderizadas, instrucciones de sistema y revisiones del modelo junto a cada resultado.
Ese hábito es especialmente útil cuando los usuarios informan que una interfaz parece más prudente, emocional o consciente de sí misma que otra. La diferencia puede originarse antes de que comience la generación.
Para los usuarios cotidianos, la lección práctica es más acotada. No traten la formulación en primera persona de un chatbot como acceso directo a un narrador interno.
En cambio, pregúntense si la afirmación se mantiene estable bajo reformulaciones, cambios de formato y pruebas independientes. Compárenla con capacidades observables y con el comportamiento documentado del sistema.
El estudio hace que el lenguaje de los modelos sea más interesante, no menos. Convierte “como modelo de lenguaje” de un descargo de responsabilidad rutinario en una variable experimental.
La próxima vez que un asistente niegue tener sentimientos o afirme una experiencia, examinen el formato circundante antes de interpretar la voz. Ahí es donde debe comenzar la próxima evidencia sobre la autorreferencia de los LLM.



