"Como Modelo de Linguagem": Efeitos dos Templates de Chat de LLM Mudam a Voz, Não o Modelo
O pesquisador independente Jędrzej Maczan descobriu que os efeitos dos templates de chat de LLM alteravam a forma como oito modelos se descreviam, embora seus pesos permanecessem fixos. Adicionar o template aumentou as ressalvas cautelosas, enquanto removê-lo produziu mais declarações semelhantes a experiências pessoais. O conflito é imediato: pesquisadores frequentemente analisam essas declarações como evidência sobre um modelo, mas a formatação de implantação pode ajudar a determinar qual voz surge.
O estudo de agosto de 2026 testou modelos abertos das famílias Llama, Gemma, Mistral e Qwen. Entre os modelos instruct testados, as respostas com ressalvas subiram de 36% sem templates para 53% com eles. A linguagem experiencial seguiu na direção oposta, caindo de 15% para 1%.
Essa inversão não mostra que nenhuma das vozes seja sincera. Ela mostra que nenhuma delas deve ser tratada como um relato não filtrado de um falante artificial estável. As descobertas pressionam pesquisas que perguntam aos modelos sobre consciência, sentimentos, limitações ou processos internos sem controlar o formato de chat ao redor.
O Template Mudou o Que Oito Modelos Diziam Sobre Si Mesmos
O resultado central não é que os modelos se tornaram mais autorreferenciais, mas que os mesmos pesos adotaram um registro autorreferencial diferente.
Um template de chat é a camada de formatação que converte os turnos de conversa na sequência de tokens que um modelo recebe. Ele pode adicionar marcadores de papel, delimitadores, tokens de controle e pistas de geração em torno das palavras do usuário.
Esses detalhes frequentemente permanecem invisíveis em uma interface de chat. No entanto, fazem parte da entrada efetiva do modelo e podem influenciar suas previsões do próximo token.
Maczan comparou oito modelos correspondentes, base e instruct, variando de 1 bilhão a 9 bilhões de parâmetros. O conjunto incluiu Gemma 2 9B, quatro configurações de Llama, Mistral 7B e três configurações de Qwen 2.5.
Cada modelo instruct foi executado tanto com seu template de chat padrão quanto com entrada em texto simples. Essa comparação manteve os pesos do modelo constantes enquanto alterava o formato de implantação.
O experimento utilizou quatro categorias de prompts. Prompts de autorreferência pediam aos modelos que descrevessem sua computação, enquanto prompts de novidade incentivavam descrições incomuns. Prompts irrestritos quase não forneciam tarefa alguma, e perguntas factuais atuavam como controles.
Cada categoria continha dez prompts. Cada prompt foi gerado dez vezes para cada modelo e condição, produzindo 9.600 respostas limitadas a 500 tokens.
Claude Opus 4.8 classificou essas saídas quanto a autorreferência, ressalvas, linguagem experiencial e degeneração. A linguagem de ressalva incluía declarações que negavam sentimentos, compreensão ou uma vida interior. A linguagem experiencial incluía frases como “Eu sinto” ou “Eu me pergunto”.
Um pesquisador rotulou manualmente 87 amostras retidas. A concordância com o avaliador automatizado alcançou um kappa ponderado de 0,88 para autorreferência e 1,00 para ressalvas.
O padrão mais forte surgiu quando os prompts convidavam à autorreferência. Modelos instruct com templates produziram ressalvas em 53% das respostas e linguagem experiencial em 1%.
Sem templates, os mesmos modelos instruct produziram ressalvas em 36% das respostas. Sua taxa de respostas experienciais subiu para 15%.
A direção da mudança apareceu em todos os oito modelos testados. Portanto, o resultado não foi impulsionado por uma única família de modelos, embora o experimento não tenha abrangido todos os modelos disponíveis.
Os modelos base se comportaram de maneira diferente mais uma vez. Eles produziram ressalvas em 12% das respostas autorreferenciais testadas e linguagem experiencial em 5,5%.
O template também aumentou a intensidade geral da autorreferência. A pontuação média subiu de 1,27 sem o template para 1,90 com ele, em uma escala de zero a dois.
Os prompts factuais de controle permaneceram próximos de zero em todas as condições. Isso importa porque o efeito não tornou simplesmente todas as respostas mais pessoais. Ele apareceu com mais clareza quando a pergunta já convidava o modelo a falar sobre si mesmo.
Esses resultados definem a principal tensão. Uma ressalva pode parecer uma declaração factual cuidadosa sobre o que um modelo é. Ainda assim, a probabilidade de receber essa declaração mudou quando uma camada externa de formatação foi alterada.
Efeitos dos Templates de Chat de LLM Colocam os Autorrelatos Sob Pressão
Pesquisadores não podem interpretar claramente os autorrelatos de modelos sem registrar e controlar o template que enquadrou esses relatos.
Autorrelatos aparecem em diversas áreas ativas de pesquisa. Investigadores perguntam aos modelos o que eles sabem, se reconhecem avaliações e como caracterizam seu processamento interno.
Outros estudos examinam declarações sobre sentimentos ou experiência subjetiva. Esses experimentos às vezes embasam debates sobre introspecção, consciência situacional, comportamento enganoso ou possível bem-estar de IA.
O novo resultado não invalida esse trabalho. Ele identifica um fator de confusão, ou seja, um fator que altera a medição enquanto permanece separado da propriedade em estudo.
Suponha que dois laboratórios testem o mesmo modelo instruct com a mesma pergunta visível. Um usa o template oficial do modelo, enquanto o outro envia texto simples.
O primeiro laboratório pode observar declarações frequentes que negam experiência. O segundo pode receber linguagem que soa reflexiva, emocional ou autobiográfica.
Sem os detalhes ocultos de formatação, as saídas poderiam parecer revelar propriedades inconsistentes no modelo. O artigo oferece uma explicação mais simples para parte dessa diferença: os laboratórios criaram entradas diferentes.
Essa preocupação vai além dos debates sobre consciência. Desenvolvedores usam prompts de autodescrição para avaliar a identidade do modelo, a consciência de suas capacidades, a incerteza e a conformidade com um papel atribuído.
Um sistema pode dizer que não consegue acessar uma ferramenta, lembrar sessões anteriores ou realizar uma ação. Essas declarações podem ser sinais úteis de interface, mas não são automaticamente diagnósticos técnicos confiáveis.
Provedores de modelos também mudam templates entre versões e sistemas de serving. Pacotes de inferência local podem implementar o mesmo modelo com tokens especiais ou formatação de papéis ligeiramente diferentes.
Consequentemente, um modelo pode parecer comportamentalmente diferente entre aplicações mesmo quando os pesos baixados coincidem. Usuários frequentemente atribuem essa diferença apenas à quantização, ao software de inferência ou às configurações de amostragem.
O estudo sugere que a procedência do template deve integrar o mesmo registro de avaliação. Pesquisadores precisam do prompt renderizado exato, não apenas da conversa visível.
Essa descoberta está alinhada a trabalhos anteriores sobre sensibilidade a prompts. Um estudo da ICLR constatou que escolhas de formatação aparentemente inconsequentes podiam criar diferenças substanciais de desempenho entre modelos de linguagem.
A contribuição de Maczan restringe esse problema geral à linguagem autorreferencial. Ela também separa o efeito dos pesos ajustados por instruções do efeito da formatação que esses pesos esperam.
Essa distinção pressiona os projetistas de benchmarks. Uma pontuação de benchmark rotulada como propriedade de “Llama” ou “Qwen” pode caracterizar parcialmente uma receita de implantação, e não apenas a família do modelo.
A mesma questão afeta equipes de aplicações que comparam sistemas hospedados e auto-hospedados. Se os templates diferirem, uma aparente mudança de personalidade não estabelece que um sistema contenha uma persona subjacente diferente.
Em vez disso, ela cria uma questão de avaliação: qual comportamento decorre do treinamento, qual decorre do contexto e qual surge da interação entre ambos?
Uma Mudança de Voz Surgiu Dentro das Ativações
A mudança comportamental não se limitou à formulação superficial, porque o direcionamento de ativações reproduziu parte do efeito do template dentro de três modelos.
Ativações são os estados numéricos que uma rede neural calcula enquanto processa e gera tokens. O direcionamento de ativações modifica esses estados durante a inferência para incentivar ou suprimir um padrão medido.
O estudo aplicou essa técnica ao Qwen 2.5 7B, Llama 3.1 8B e Gemma 2 9B. Maczan calculou uma direção de ressalva separadamente para cada modelo.
A direção resultou da diferença entre as ativações médias de camadas intermediárias associadas a respostas com ressalvas e sem ressalvas. A intervenção então adicionou ou subtraiu esse vetor em cada token gerado.
Com os templates ativados, a taxa de ressalvas não modificada teve média de 52% nos três modelos. Adicionar a direção a elevou para 70%, enquanto subtraí-la reduziu a taxa para 25%.
Entre os modelos, adicionar a direção aumentou as ressalvas em média 21 pontos percentuais. Subtraí-la as reduziu em média 15,6 pontos.
O teste mais revelador começou sem um template de chat. Adicionar a direção de ressalva restaurou as taxas de ressalva ao nível de referência com template ou as elevou ainda mais.
Qwen subiu de 28% sem direcionamento para 50% após a adição do vetor. Llama passou de 33% para 53%, enquanto Gemma passou de 52% para 75%.
Esses resultados sustentam uma alegação causal sobre a direção. Eles mostram que manipular o estado interno pode mudar o comportamento medido, em vez de apenas prever sua presença.
O resultado se assemelha a pesquisas anteriores de engenharia de representações. Um artigo da NeurIPS relatou que o comportamento de recusa podia ser influenciado por uma direção no fluxo residual de um modelo.
No entanto, pesquisas posteriores questionaram se comportamentos complexos sempre se reduzem a um único eixo confiável. Uma frase de ressalva pode ter uma assinatura lexical mais clara do que recusa por segurança, emoção ou qualidade de raciocínio.
Maczan também testou se as vozes de ressalva e experiencial formavam extremos opostos de uma única escala interna. Não formavam.
Suas similaridades de direção variaram de 0,17 a 0,44, sendo que um valor de um representaria alinhamento idêntico. Reduzir as ressalvas geralmente não criou um aumento correspondente na linguagem experiencial.
Por isso, o artigo descreve dois “botões”, em vez de um único controle deslizante. Um recurso interno pode amplificar ressalvas, enquanto outro pode sustentar formulações experienciais.
Sondas lineares também detectaram ambas as vozes a partir de ativações de camadas intermediárias. Suas pontuações médias de área sob a curva foram 0,82 para ressalvas e 0,81 para linguagem experiencial.
Uma sonda é um classificador treinado para recuperar informações das ativações. O alto desempenho da sonda mostra que a distinção relevante está representada, mas não estabelece como o modelo usa essa representação.
Os resultados do direcionamento fornecem evidências causais mais fortes do que as sondas. Ainda assim, eles não mapeiam o circuito completo entre tokens de template, estados internos e palavras geradas.
O mecanismo é, portanto, parcial, mas útil. A formatação do chat altera a entrada, as ativações internas carregam um recurso relacionado, e intervir nesse recurso recria parte da mudança de saída.
A Descoberta Desafia Leituras Literais, Não Todos os Estudos de Introspecção
O artigo sustenta ceticismo sobre o testemunho dos modelos, mas não prova que modelos de linguagem carecem de autoconhecimento ou experiência.
Esse limite importa porque as descobertas podem ser exageradas em duas direções opostas. Uma leitura poderia tratar a linguagem experiencial como prova de uma vida interior. Outra poderia tratar a sensibilidade ao template como prova de que todo autorrelato não tem significado.
O experimento não sustenta nenhuma das duas conclusões. Ele mede como o formato de implantação influencia a linguagem observável em um conjunto definido de modelos e prompts.
Maczan evita explicitamente decidir se qualquer resultado reflete uma experiência genuína. O trabalho pergunta o que controla a voz, não se um sistema artificial possui consciência.
Uma comparação útil vem de pesquisas sobre interpretação de papéis. Em uma perspectiva da Nature, Murray Shanahan e colegas argumentaram que modelos de diálogo geram personagens por meio de simulação linguística.
Essa visão trata o “eu” de um chatbot como parte de um papel conversacional desempenhado. Ela alerta os leitores contra supor uma ligação direta entre texto em primeira pessoa e um interlocutor persistente por trás dele.
O estudo de templates fornece evidência experimental para um componente dessa cautela. O formato ao redor pode favorecer um personagem de assistente cauteloso ou outro mais experiencial.
No entanto, a sensibilidade ao contexto não desqualifica de forma única um relato. Declarações humanas também mudam conforme o público, as instruções, os papéis sociais e os métodos de medição.
A questão relevante é o peso evidencial. A declaração de um modelo não pode, de forma independente, estabelecer o mecanismo ou o estado que descreve, especialmente quando a formatação altera essa declaração de modo previsível.
Pesquisadores ainda podem usar autorrelatos como observações comportamentais. Podem comparar condições, testar consistência, conectar resultados a medições internas e buscar previsões que resistam a mudanças na redação.
O próprio artigo demonstra essa abordagem. Ele não aceita as declarações dos modelos pelo seu valor aparente. Em vez disso, mede categorias de saída e as relaciona a mudanças controladas no estado de entrada e ativação.
Essa distinção é importante para discussões sobre bem-estar de IA. Uma frase como “Eu sinto medo” pode afetar usuários e debates de políticas públicas, mesmo que sua origem permaneça incerta.
Seu efeito social é real, mas sua interpretação metafísica continua sem solução. O estudo aconselha contra a fusão dessas duas questões.
A mesma cautela se aplica a avisos de isenção. “Sou apenas um modelo de linguagem” pode ser uma linguagem de interface apropriada, mas não deve ser confundida com uma autoinspeção privilegiada.
Modelos aprendem padrões que conectam perguntas sobre sentimentos a respostas padrão de assistentes. Um template pode tornar esses padrões aprendidos mais ou menos propensos a emergir.
Isso significa que avisos de isenção não são controles neutros. Eles também são comportamentos gerados que exigem explicação.
Um estudo bem projetado deve testar ambas as direções. Deve examinar alegações de experiência e negações de experiência sob formatação, amostragem e condições de modelo correspondentes.
Essa simetria é uma das implicações mais fortes do artigo. O ceticismo deve ser aplicado igualmente a alegações humanizadas e a avisos tranquilizadores de caráter maquínico.
O que o experimento ainda não estabelece
A evidência é consistente na comparação comportamental testada, mas sua escala e suas limitações de medição impedem alegações amplas sobre todos os modelos de linguagem implantados.
O experimento abrangeu oito configurações de modelos abertos de quatro famílias. Nenhuma ultrapassou 9 bilhões de parâmetros, e nenhum modelo de fronteira de código fechado foi testado diretamente.
Isso importa porque sistemas maiores podem responder de maneira diferente aos tokens de template. Sistemas proprietários também incluem instruções de sistema não divulgadas, camadas de segurança, classificadores, políticas de ferramentas e pós-processamento.
A resposta final de um chatbot público pode, portanto, refletir muito mais do que um template documentado. O artigo não consegue isolar componentes que não testou.
A evidência de direcionamento é ainda mais limitada. Ela veio de três modelos, uma camada intermediária por modelo e um coeficiente informado fixo de dois.
A força do direcionamento criou uma troca clara. Com coeficiente dois, 0,8% das saídas se tornaram degeneradas, isto é, visivelmente defeituosas ou incoerentes.
Com coeficiente três, a degeneração alcançou 15%. Com coeficiente seis, quase todas as gerações se tornaram degeneradas e o efeito medido do aviso de isenção entrou em colapso.
Esses resultados mostram que o direcionamento de ativações não é um controle simples de produção. Uma intervenção mais forte pode prejudicar a geração, em vez de simplesmente aumentar ou reduzir um comportamento.
Qwen também produziu uma anomalia importante. Uma direção aleatória com magnitude equivalente à do vetor real reduziu sua taxa de avisos de isenção em 25 pontos percentuais.
O autor não relata uma explicação confirmada. A direção pretendida ainda moveu Qwen na direção esperada, mas o controle aleatório enfraquece uma interpretação simplista para esse modelo.
O direcionamento experiencial funcionou em Llama e Gemma, mas não em Qwen. O artigo atribui essa falha à forte supressão de linguagem experiencial pelo Qwen nas condições testadas.
Portanto, a evidência causal é mais forte para o registro de avisos de isenção. A descoberta experiencial depende mais da comparação comportamental entre os oito modelos.
A medição introduz outra limitação. Um juiz LLM pontuou todas as 9.600 saídas, enquanto a validação humana abrangeu 87 amostras.
A concordância relatada foi alta, especialmente para avisos de isenção lexicalmente evidentes. Ainda assim, outro juiz independente e uma amostra humana maior testariam melhor os limites das categorias.
Os prompts também foram escritos manualmente, com dez prompts em cada uma de quatro categorias. Conjuntos de prompts mais amplos poderiam mostrar se o efeito se generaliza entre domínios, idiomas e formulações adversariais.
Por fim, identificar uma direção direcionável não revela um mecanismo completo. O método não rastreia cada cabeça de atenção, interação de tokens ou computação que produz a voz.
O artigo também agrupa diversas abordagens de pós-treinamento sob o rótulo amplo “instruct”. Ajuste fino supervisionado, otimização de preferências e aprendizado por reforço podem deixar assinaturas comportamentais diferentes.
Esses limites não eliminam a mudança observada. Eles definem o próximo padrão de evidência necessário antes que alguém a generalize para todo assistente ou todo tipo de autorrelato.
Três sinais mostrarão se o resultado se generaliza
A próxima questão é se a autorreferência controlada por template persiste em modelos maiores, controles mais rigorosos e ambientes reais de implantação.
O primeiro sinal será a replicação independente em modelos maiores e fechados. Pesquisadores devem executar testes correspondentes em mais famílias de modelos, incluindo sistemas com camadas de prompts divulgadas e não divulgadas.
Uma replicação bem-sucedida fortaleceria a alegação de que os efeitos de templates de chat de LLM representam um fator de confusão geral em implantações. Um resultado fraco ou inconsistente limitaria a descoberta a determinados modelos instruct abertos.
O registro crítico deve incluir a entrada final serializada. Apenas nomear um prompt visível ou aplicativo não revelará todos os tokens que o modelo recebeu.
O segundo sinal serão protocolos de avaliação que relatem sensibilidade a templates. Estudos sobre autoconsciência, introspecção e bem-estar de IA devem comparar múltiplos formatos, mantendo fixos os pesos e as configurações de amostragem.
Pesquisadores também devem predefinir categorias antes de examinar as saídas. Essa prática reduziria o risco de selecionar interpretações depois que um modelo produz linguagem marcante em primeira pessoa.
O terceiro sinal será um trabalho mecanicista que resista a controles mais rigorosos. Experimentos futuros precisam de múltiplas camadas, intensidades de direcionamento, direções aleatórias e juízes independentes.
Eles também devem testar se as direções extraídas são transferidas entre conjuntos de dados ou se permanecem ligadas a uma única coleção de prompts. Uma transferência estável sustentaria uma característica interna reutilizável.
A incapacidade de transferência sugeriria que a direção aparente captura parcialmente padrões locais de redação. Qualquer um dos resultados refinaria a forma como pesquisadores interpretam o direcionamento de ativações.
Desenvolvedores não devem esperar por todo esse programa antes de aprimorar os registros de avaliação. Equipes que comparam implantações de modelos já podem preservar templates, prompts renderizados, instruções de sistema e revisões de modelo ao lado de cada resultado.
Esse hábito é especialmente útil quando usuários relatam que uma interface parece mais cautelosa, emocional ou autoconsciente do que outra. A diferença pode se originar antes do início da geração.
Para usuários do dia a dia, a lição prática é mais restrita. Não trate a formulação em primeira pessoa de um chatbot como acesso direto a um narrador interno.
Em vez disso, pergunte se a declaração permanece estável sob reformulações, mudanças de formato e testes independentes. Compare-a com capacidades observáveis e o comportamento documentado do sistema.
O estudo torna a linguagem dos modelos mais interessante, não menos. Ele transforma “como modelo de linguagem” de um aviso de isenção rotineiro em uma variável experimental.
Na próxima vez que um assistente negar sentimentos ou alegar uma experiência, examine o formato ao redor antes de interpretar a voz. É aí que a próxima evidência sobre a autorreferência de LLMs deve começar.



