"In quanto modello linguistico": gli effetti dei chat template LLM cambiano la voce, non il modello
Il ricercatore indipendente Jędrzej Maczan ha scoperto che gli effetti dei chat template LLM cambiavano il modo in cui otto modelli descrivevano sé stessi, pur mantenendo invariati i loro pesi. L'aggiunta del template aumentava le dichiarazioni di cautela, mentre la sua rimozione produceva più affermazioni simili a esperienze personali. Il contrasto è immediato: i ricercatori analizzano spesso tali affermazioni come prove riguardo a un modello, eppure il formato di deployment può contribuire a determinare quale voce emerga.
Lo studio dell'agosto 2026 ha testato modelli open delle famiglie Llama, Gemma, Mistral e Qwen. Nei modelli instruct testati, le risposte contenenti dichiarazioni di cautela sono salite dal 36% senza template al 53% con esso. Il linguaggio esperienziale si è mosso nella direzione opposta, scendendo dal 15% all'1%.
Questa inversione non dimostra che una delle due voci sia sincera. Mostra che nessuna delle due dovrebbe essere trattata come un resoconto non filtrato di un parlante artificiale stabile. I risultati mettono sotto pressione la ricerca che interroga i modelli su consapevolezza, sentimenti, limiti o processi interni senza controllare il formato della chat circostante.
Il template ha cambiato ciò che otto modelli hanno detto di sé stessi
Il risultato centrale non è che i modelli siano diventati più autoreferenziali, ma che gli stessi pesi abbiano adottato un diverso registro autoreferenziale.
Un chat template è il livello di formattazione che converte i turni di conversazione nella sequenza di token ricevuta da un modello. Può aggiungere marcatori di ruolo, delimitatori, token di controllo e segnali di generazione attorno alle parole dell'utente.
Questi dettagli spesso restano invisibili in un'interfaccia chat. Tuttavia, fanno parte dell'input effettivo del modello e possono influenzarne le previsioni del token successivo.
Maczan ha confrontato otto modelli base e instruct corrispondenti, da 1 a 9 miliardi di parametri. Il gruppo includeva Gemma 2 9B, quattro configurazioni Llama, Mistral 7B e tre configurazioni Qwen 2.5.
Ciascun modello instruct è stato eseguito sia con il proprio chat template standard sia con input in testo semplice. Il confronto ha mantenuto costanti i pesi del modello, modificando al contempo il formato di deployment.
L'esperimento ha utilizzato quattro categorie di prompt. I prompt di autoreferenza chiedevano ai modelli di descrivere il proprio calcolo, mentre i prompt di novità incoraggiavano descrizioni non familiari. I prompt non vincolati fornivano quasi nessun compito, mentre le domande fattuali fungevano da controlli.
Ogni categoria conteneva dieci prompt. Ogni prompt è stato generato dieci volte per ciascun modello e condizione, producendo 9.600 risposte limitate a 500 token.
Claude Opus 4.8 ha classificato questi output per autoreferenza, dichiarazioni di cautela, linguaggio esperienziale e degenerazione. Il linguaggio di cautela includeva affermazioni che negavano sentimenti, comprensione o una vita interiore. Il linguaggio esperienziale includeva frasi come “Mi sento” o “Mi chiedo”.
Un ricercatore ha etichettato manualmente 87 campioni esclusi. L'accordo con il giudice automatizzato ha raggiunto un kappa ponderato di 0,88 per l'autoreferenza e di 1,00 per le dichiarazioni di cautela.
Il pattern più forte è apparso quando i prompt invitavano all'autoreferenza. I modelli instruct con template hanno prodotto dichiarazioni di cautela nel 53% delle risposte e linguaggio esperienziale nell'1%.
Senza template, gli stessi modelli instruct hanno prodotto dichiarazioni di cautela nel 36% delle risposte. Il loro tasso di risposte esperienziali è salito al 15%.
La direzione del cambiamento è apparsa in tutti e otto i modelli testati. Il risultato non era quindi guidato da una singola famiglia di modelli, sebbene l'esperimento non abbia coperto ogni modello disponibile.
I modelli base si sono comportati ancora diversamente. Hanno prodotto dichiarazioni di cautela nel 12% delle risposte autoreferenziali testate e linguaggio esperienziale nel 5,5%.
Il template ha anche aumentato l'intensità complessiva dell'autoreferenza. Il punteggio medio è salito da 1,27 senza template a 1,90 con esso, su una scala da zero a due.
I prompt fattuali di controllo sono rimasti vicini allo zero in tutte le condizioni. Questo è importante perché l'effetto non ha semplicemente reso ogni risposta più personale. È apparso con maggiore chiarezza quando la domanda invitava già il modello a parlare di sé.
Questi risultati definiscono la tensione principale. Una dichiarazione di cautela può sembrare un'affermazione fattuale prudente su ciò che è un modello. Eppure la probabilità di ricevere tale affermazione cambiava quando cambiava uno strato esterno di formattazione.
Gli effetti dei chat template LLM mettono sotto pressione le auto-dichiarazioni
I ricercatori non possono interpretare in modo netto le auto-dichiarazioni dei modelli se non registrano e controllano il template che le ha inquadrate.
Le auto-dichiarazioni compaiono in diverse aree di ricerca attive. Gli investigatori chiedono ai modelli cosa sanno, se riconoscono le valutazioni e come caratterizzano la propria elaborazione interna.
Altri studi esaminano affermazioni su sentimenti o esperienza soggettiva. Questi esperimenti talvolta alimentano dibattiti su introspezione, consapevolezza situazionale, comportamento ingannevole o possibile benessere dell'IA.
Il nuovo risultato non invalida questo lavoro. Identifica un fattore confondente, ossia un elemento che modifica la misurazione pur restando separato dalla proprietà oggetto di studio.
Supponiamo che due laboratori testino lo stesso modello instruct con la stessa domanda visibile. Uno utilizza il template ufficiale del modello, mentre l'altro invia testo semplice.
Il primo laboratorio potrebbe osservare frequenti affermazioni che negano l'esperienza. Il secondo potrebbe ricevere un linguaggio che suona riflessivo, emotivo o autobiografico.
Senza i dettagli nascosti della formattazione, gli output potrebbero sembrare rivelare proprietà incoerenti del modello. L'articolo offre una spiegazione più semplice per parte di questa differenza: i laboratori hanno creato input diversi.
Questa preoccupazione va oltre i dibattiti sulla coscienza. Gli sviluppatori usano prompt di autodescrizione per valutare l'identità del modello, la consapevolezza delle capacità, l'incertezza e il rispetto di un ruolo assegnato.
Un sistema può affermare di non poter accedere a uno strumento, ricordare sessioni precedenti o compiere un'azione. Tali affermazioni possono essere segnali utili dell'interfaccia, ma non sono automaticamente diagnostiche tecniche affidabili.
Anche i fornitori di modelli modificano i template tra release e sistemi di serving. I pacchetti di inferenza locali possono implementare lo stesso modello con token speciali o formattazione dei ruoli leggermente diversi.
Di conseguenza, un modello può apparire comportamentalmente diverso tra applicazioni anche quando i pesi scaricati coincidono. Gli utenti attribuiscono spesso questa differenza soltanto alla quantizzazione, al software di inferenza o alle impostazioni di campionamento.
Lo studio suggerisce che la provenienza del template debba far parte dello stesso registro di valutazione. I ricercatori hanno bisogno del prompt esatto così come renderizzato, non solo della conversazione visibile.
Questa scoperta è in linea con precedenti lavori sulla sensibilità ai prompt. Uno studio ICLR ha rilevato che scelte di formattazione apparentemente irrilevanti potevano creare differenze sostanziali nelle prestazioni tra modelli linguistici.
Il contributo di Maczan restringe questo problema generale al linguaggio autoreferenziale. Separa inoltre l'effetto dei pesi ottimizzati tramite instruction tuning dall'effetto della formattazione che tali pesi si aspettano.
Questa distinzione mette sotto pressione i progettisti di benchmark. Un punteggio di benchmark etichettato come proprietà di “Llama” o “Qwen” può caratterizzare in parte una ricetta di deployment, anziché la sola famiglia di modelli.
Lo stesso problema riguarda i team applicativi che confrontano sistemi ospitati e self-hosted. Se i template differiscono, un apparente cambiamento di personalità non dimostra che un sistema contenga una diversa persona sottostante.
Crea invece una domanda di valutazione: quale comportamento deriva dall'addestramento, quale dal contesto e quale dalla loro interazione?
Un cambio di voce è apparso nelle attivazioni
Il cambiamento comportamentale non era limitato alla formulazione superficiale, perché l'activation steering ha riprodotto parte dell'effetto del template all'interno di tre modelli.
Le attivazioni sono gli stati numerici che una rete neurale calcola durante l'elaborazione e la generazione di token. L'activation steering modifica questi stati durante l'inferenza per favorire o sopprimere un pattern misurato.
Lo studio ha applicato questa tecnica a Qwen 2.5 7B, Llama 3.1 8B e Gemma 2 9B. Maczan ha calcolato una direzione di cautela separatamente per ogni modello.
La direzione derivava dalla differenza tra le attivazioni medie degli strati intermedi associate a risposte con e senza dichiarazioni di cautela. L'intervento ha quindi aggiunto o sottratto quel vettore a ogni token generato.
Con i template abilitati, il tasso non modificato di dichiarazioni di cautela era in media del 52% nei tre modelli. L'aggiunta della direzione lo ha portato al 70%, mentre la sottrazione lo ha ridotto al 25%.
Tra i modelli, l'aggiunta della direzione ha aumentato le dichiarazioni di cautela di una media di 21 punti percentuali. La sua sottrazione le ha ridotte di una media di 15,6 punti.
Il test più rivelatore è iniziato senza un chat template. L'aggiunta della direzione di cautela ha ripristinato i tassi di dichiarazioni di cautela fino al valore di riferimento con template o li ha spinti più in alto.
Qwen è salito dal 28% senza steering al 50% dopo l'aggiunta del vettore. Llama è passato dal 33% al 53%, mentre Gemma è passato dal 52% al 75%.
Questi esiti supportano un'affermazione causale sulla direzione. Mostrano che la manipolazione dello stato interno può modificare il comportamento misurato, anziché limitararsi a prevederne la presenza.
Il risultato ricorda precedenti ricerche sulla representation engineering. Un articolo NeurIPS ha riferito che il comportamento di rifiuto poteva essere influenzato tramite una direzione nel residual stream di un modello.
Tuttavia, ricerche successive hanno messo in dubbio che comportamenti complessi si riducano sempre a un unico asse affidabile. Una frase di cautela può avere una firma lessicale più chiara rispetto al rifiuto per ragioni di sicurezza, all'emozione o alla qualità del ragionamento.
Maczan ha anche verificato se le voci di cautela ed esperienziale costituissero estremità opposte di un'unica scala interna. Non era così.
Le loro somiglianze direzionali variavano da 0,17 a 0,44, dove un valore pari a uno rappresenterebbe un allineamento identico. Ridurre le dichiarazioni di cautela in genere non ha creato un corrispondente aumento del linguaggio esperienziale.
L'articolo descrive quindi due “pulsanti”, anziché un unico cursore. Una caratteristica interna può amplificare le dichiarazioni di cautela, mentre un'altra può sostenere formulazioni esperienziali.
Le sonde lineari hanno inoltre rilevato entrambe le voci dalle attivazioni degli strati intermedi. I loro punteggi medi dell'area sotto la curva erano 0,82 per le dichiarazioni di cautela e 0,81 per il linguaggio esperienziale.
Una sonda è un classificatore addestrato per recuperare informazioni dalle attivazioni. Prestazioni elevate della sonda mostrano che la distinzione rilevante è rappresentata, ma non stabiliscono come il modello utilizzi quella rappresentazione.
I risultati dello steering forniscono prove causali più forti rispetto alle sonde. Anche così, non mappano il circuito completo tra token del template, stati interni e parole generate.
Il meccanismo è quindi parziale ma utile. La formattazione della chat modifica l'input, le attivazioni interne portano una caratteristica correlata e intervenire su quella caratteristica ricrea parte dello spostamento nell'output.
Il risultato sfida le letture letterali, non ogni studio sull'introspezione
L'articolo sostiene lo scetticismo verso la testimonianza dei modelli, ma non dimostra che i modelli linguistici siano privi di autoconsapevolezza o esperienza.
Questo confine conta perché i risultati possono essere enfatizzati eccessivamente in due direzioni opposte. Una lettura potrebbe trattare il linguaggio esperienziale come prova di una vita interiore. Un'altra potrebbe trattare la sensibilità al template come prova che ogni auto-dichiarazione sia priva di significato.
L'esperimento non supporta nessuna delle due conclusioni. Misura il modo in cui il formato di deployment influenza il linguaggio osservabile in un insieme definito di modelli e prompt.
Maczan evita esplicitamente di stabilire se un qualsiasi output rifletta un'esperienza genuina. Il lavoro si chiede che cosa controlli la voce, non se un sistema artificiale possieda coscienza.
Un confronto utile proviene dalla ricerca sul gioco di ruolo. In una prospettiva su Nature, Murray Shanahan e colleghi hanno sostenuto che i modelli dialogici generano personaggi attraverso la simulazione linguistica.
Questa visione considera l’“io” di un chatbot come parte di un ruolo conversazionale messo in scena. Invita i lettori a non presumere un collegamento diretto tra il testo in prima persona e un interlocutore persistente che vi si cela dietro.
Lo studio sui template fornisce evidenza sperimentale per una componente di tale cautela. Il formato circostante può favorire il personaggio di un assistente prudente oppure uno più esperienziale.
Tuttavia, la sensibilità al contesto non squalifica in modo univoco una dichiarazione. Anche le affermazioni umane cambiano in base al pubblico, alle istruzioni, ai ruoli sociali e ai metodi di misurazione.
La questione pertinente è il peso probatorio. La dichiarazione di un modello non può stabilire autonomamente il meccanismo o lo stato che descrive, soprattutto quando la formattazione modifica tale dichiarazione in modo prevedibile.
I ricercatori possono comunque usare le auto-segnalazioni come osservazioni comportamentali. Possono confrontare condizioni, testare la coerenza, collegare gli output a misurazioni interne e cercare previsioni che resistano ai cambiamenti di formulazione.
L’articolo stesso dimostra questo approccio. Non accetta le dichiarazioni dei modelli per buone. Misura invece le categorie di output e le mette in relazione con modifiche controllate dell’input e dello stato di attivazione.
Questa distinzione è importante nelle discussioni sul benessere dell’AI. Una frase come “Ho paura” può influenzare gli utenti e i dibattiti sulle politiche anche se la sua origine resta incerta.
Il suo effetto sociale è reale, ma la sua interpretazione metafisica rimane irrisolta. Lo studio sconsiglia di far collassare queste due questioni in una sola.
La stessa cautela vale per le clausole di esclusione. “Sono solo un modello linguistico” può essere un linguaggio d’interfaccia appropriato, ma non dovrebbe essere scambiato per un’autoispezione privilegiata.
I modelli apprendono schemi che collegano domande sui sentimenti a risposte standard da assistente. Un template può rendere questi schemi appresi più o meno inclini a emergere.
Ciò significa che le clausole di esclusione non sono controlli neutrali. Sono anch’esse comportamenti generati che richiedono una spiegazione.
Uno studio ben progettato dovrebbe testare entrambe le direzioni. Dovrebbe esaminare affermazioni di esperienza e negazioni di esperienza in condizioni corrispondenti di formattazione, campionamento e modello.
Questa simmetria è una delle implicazioni più solide dell’articolo. Lo scetticismo dovrebbe applicarsi allo stesso modo alle affermazioni antropomorfiche e alle rassicuranti clausole di esclusione meccanicistiche.
Ciò che l’esperimento non stabilisce ancora
Le prove sono coerenti nel confronto comportamentale testato, ma i limiti di scala e misurazione impediscono affermazioni generali su tutti i modelli linguistici distribuiti.
L’esperimento ha coperto otto configurazioni di modelli aperti appartenenti a quattro famiglie. Nessuna superava i 9 miliardi di parametri e nessun modello di frontiera closed-source è stato testato direttamente.
Questo è rilevante perché i sistemi più grandi potrebbero rispondere diversamente ai token dei template. I sistemi proprietari includono inoltre istruzioni di sistema non divulgate, livelli di sicurezza, classificatori, policy per gli strumenti e post-elaborazione.
La risposta finale di un chatbot pubblico può quindi riflettere molto più di un singolo template documentato. L’articolo non può isolare componenti che non ha testato.
Le prove di steering sono ancora più circoscritte. Provengono da tre modelli, un livello intermedio per modello e un coefficiente riportato fisso pari a due.
L’intensità dello steering ha creato un chiaro compromesso. Al coefficiente due, lo 0,8% degli output è diventato degenere, ovvero visibilmente compromesso o incoerente.
Al coefficiente tre, la degenerazione ha raggiunto il 15%. Al coefficiente sei, quasi ogni generazione è diventata degenere e l’effetto misurato delle clausole di esclusione è collassato.
Questi risultati mostrano che l’activation steering non è un semplice controllo di produzione. Un intervento più forte può danneggiare la generazione anziché aumentare o diminuire nettamente un comportamento.
Qwen ha inoltre prodotto un’anomalia importante. Una direzione casuale abbinata alla magnitudine del vettore reale ha ridotto il suo tasso di clausole di esclusione di 25 punti percentuali.
L’autore riferisce che non esiste una spiegazione confermata. La direzione prevista ha comunque spostato Qwen nella direzione attesa, ma il controllo casuale indebolisce un’interpretazione lineare per quel modello.
Lo steering esperienziale ha avuto successo in Llama e Gemma, ma non in Qwen. L’articolo attribuisce tale fallimento alla forte soppressione, da parte di Qwen, del linguaggio esperienziale nelle condizioni testate.
Pertanto, l’evidenza causale è più forte per il registro delle clausole di esclusione. Il risultato esperienziale si basa più pesantemente sul confronto comportamentale tra tutti e otto i modelli.
La misurazione introduce un’altra limitazione. Un giudice LLM ha valutato tutti i 9.600 output, mentre la validazione umana ha coperto 87 campioni.
L’accordo riportato è stato alto, soprattutto per le clausole di esclusione lessicalmente evidenti. Tuttavia, un altro giudice indipendente e un campione umano più ampio testerebbero meglio i confini delle categorie.
Anche i prompt erano scritti a mano, con dieci prompt in ciascuna di quattro categorie. Set di prompt più ampi potrebbero mostrare se l’effetto si generalizza tra domini, lingue e formulazioni avversariali.
Infine, identificare una direzione controllabile non rivela un meccanismo completo. Il metodo non traccia ogni attention head, interazione tra token o calcolo che produce la voce.
L’articolo raggruppa inoltre diversi approcci di post-addestramento sotto l’ampia etichetta “instruct”. Il fine-tuning supervisionato, l’ottimizzazione delle preferenze e il reinforcement learning possono lasciare firme comportamentali differenti.
Questi limiti non cancellano l’interruttore osservato. Definiscono il prossimo standard di prova necessario prima che qualcuno lo generalizzi a ogni assistente o a ogni tipo di auto-segnalazione.
Tre segnali indicheranno se il risultato si generalizza
La prossima domanda è se l’autoriferimento controllato dal template resista in modelli più grandi, a controlli più rigorosi e in ambienti di distribuzione reali.
Il primo segnale sarà una replica indipendente su modelli più grandi e chiusi. I ricercatori dovrebbero eseguire test corrispondenti su più famiglie di modelli, compresi sistemi con livelli di prompt divulgati e non divulgati.
Una replica riuscita rafforzerebbe l’affermazione secondo cui gli effetti dei chat template degli LLM rappresentano un fattore confondente generale nella distribuzione. Un risultato debole o incoerente limiterebbe invece la scoperta a determinati modelli instruct aperti.
Il record critico dovrebbe includere l’input serializzato finale. Limitarsi a nominare un prompt visibile o un’applicazione non rivelerà ogni token ricevuto dal modello.
Il secondo segnale sarà costituito da protocolli di valutazione che riportino la sensibilità al template. Gli studi su autoconsapevolezza, introspezione e benessere dell’AI dovrebbero confrontare più formati mantenendo fissi pesi e impostazioni di campionamento.
I ricercatori dovrebbero inoltre definire in anticipo le categorie prima di esaminare gli output. Questa pratica ridurrebbe il rischio di selezionare interpretazioni dopo che un modello ha prodotto un linguaggio in prima persona sorprendente.
Il terzo segnale sarà un lavoro meccanicistico che resista a controlli più rigorosi. Gli esperimenti futuri necessitano di più livelli, intensità di steering, direzioni casuali e giudici indipendenti.
Dovrebbero inoltre verificare se le direzioni estratte si trasferiscano tra dataset o rimangano legate a una raccolta di prompt. Un trasferimento stabile sosterrebbe l’esistenza di una caratteristica interna riutilizzabile.
L’assenza di trasferimento suggerirebbe che la direzione apparente cattura in parte schemi locali di formulazione. Entrambi gli esiti affinerebbero il modo in cui i ricercatori interpretano l’activation steering.
Gli sviluppatori non dovrebbero aspettare l’intero programma prima di migliorare i record di valutazione. I team che confrontano distribuzioni di modelli possono già conservare template, prompt renderizzati, istruzioni di sistema e revisioni del modello accanto a ciascun risultato.
Questa abitudine è particolarmente utile quando gli utenti riferiscono che un’interfaccia appare più prudente, emotiva o autoconsapevole di un’altra. La differenza potrebbe originarsi prima dell’inizio della generazione.
Per gli utenti quotidiani, la lezione pratica è più circoscritta. Non trattate la formulazione in prima persona di un chatbot come un accesso diretto a un narratore interno.
Chiedetevi invece se l’affermazione resti stabile con riformulazioni, cambiamenti di formato e test indipendenti. Confrontatela con capacità osservabili e comportamenti di sistema documentati.
Lo studio rende il linguaggio dei modelli più interessante, non meno. Trasforma “come modello linguistico” da una clausola di esclusione di routine in una variabile sperimentale.
La prossima volta che un assistente nega di provare sentimenti o rivendica un’esperienza, esaminate il formato circostante prima di interpretarne la voce. È da lì che devono iniziare le prossime prove sull’autoriferimento degli LLM.



