I segnali di scrittura di Claude Opus 5.5 sono cambiati, ma non sono scomparsi
I segnali di scrittura di Claude Opus 5.5 sono sopravvissuti alla revisione stilistica di Anthropic, nonostante una riduzione del 99% nell’uso dei trattini lunghi da parte del modello. Il segnale più forte è ora “affidabile”, comparso 23 volte più spesso negli articoli scritti dal modello rispetto a lavori umani comparabili.
La conclusione deriva dall’analisi di Graphite su articoli che coprono 9.974 argomenti corrispondenti. I ricercatori hanno identificato 2.548 parole, frasi e strutture sintattiche che Opus 5.5 ha usato almeno il doppio rispetto agli autori umani.
Il risultato complica l’affermazione di Anthropic secondo cui Opus 5.5 comunica in modo più naturale. Il suo vocabolario si è avvicinato in modo misurabile alla scrittura umana, ma sono rimaste migliaia di differenze statistiche. Il modello non ha perso la propria impronta linguistica. Ha sostituito diverse abitudini familiari con una nuova raccolta di preferenze.
GPT-6 Astra di OpenAI ha prodotto un altro schema distinto. Ha qualificato le affermazioni più spesso e ha fatto ricorso a formulazioni correttive, mentre Opus ha privilegiato superlativi e dichiarazioni di importanza. Il confronto trasforma il rilevamento della scrittura AI in un problema con un bersaglio mobile. Ogni versione del modello modifica gli indizi che redattori, insegnanti e lettori ritengono di riconoscere.
Una preferenza di 23 volte ha rivelato il nuovo schema di Opus
Gli ultimi segnali di scrittura di Claude Opus 5.5 sono parole comuni rese insolite dalla ripetizione.
Graphite ha pubblicato il suo aggiornamento su Opus 5.5 dopo che Anthropic ha rilasciato il modello il 22 settembre 2026. La ricerca ha esteso una precedente analisi condotta su dieci modelli AI e una raccolta di controllo composta da testi umani.
I ricercatori hanno utilizzato 9.974 argomenti per i quali ogni modello e il corpus umano disponevano di un articolo corrispondente. Gli articoli umani sono stati pubblicati prima del rilascio di ChatGPT, riducendo la probabilità che tali campioni contenessero output di AI generativa non segnalati.
Ogni modello ha ricevuto un riassunto e ha generato un nuovo articolo sullo stesso argomento. Questo approccio ha ridotto le differenze legate agli argomenti, anche se non ha potuto eliminare ogni effetto causato dai prompt o dalla selezione delle fonti.
I ricercatori hanno quindi confrontato le frequenze normalizzate per lunghezza di parole e frasi. Hanno inoltre studiato i frame, ovvero schemi linguistici ricorrenti con spazi che possono contenere fino a tre parole.
Secondo la definizione di Graphite, un segnale compare almeno il doppio nella scrittura AI rispetto alla raccolta umana. I filtri di frequenza escludono le espressioni presenti soltanto in una manciata di documenti.
Il risultante studio sulla scrittura AI ha individuato 2.548 segnali di Opus 5.5. Si tratta di appena il 4% in meno rispetto ai 2.666 registrati per Opus 5.
“Affidabile” ha guidato gli aggettivi valutativi del modello, con una frequenza 23 volte superiore al tasso umano. “Costante” è apparso 11 volte più spesso, mentre “ponderato” è apparso nove volte più spesso. “Significativo” ha raggiunto otto volte il tasso umano.
Queste parole non sono intrinsecamente artificiali. Un autore umano può ragionevolmente definire affidabile un servizio o descrivere ponderata una risposta. Il loro valore risiede nel comportamento aggregato, non nelle singole occorrenze.
Anche il linguaggio di transizione era distintivo. “Guardando avanti il” è apparso con una frequenza 40 volte superiore al tasso umano. “Aggiunge un ulteriore livello” ha raggiunto 27 volte, e “ciò che viene dopo” 24 volte.
Opus 5.5 ha inoltre mantenuto una preferenza per il contrasto. Il modello “è più di un _ esso” è apparso 98 volte più spesso rispetto agli articoli umani. “Piuttosto che semplicemente” è comparso 32 volte rispetto al tasso umano.
La sua categoria più forte riguardava la segnalazione dell’importanza. “Questo conta” è apparso 116 volte più spesso rispetto alla raccolta umana. “Perché _ conta” è apparso 92 volte più spesso.
Questi dati non significano che ogni articolo di Opus contenga tali frasi. Descrivono la frequenza relativa in un corpus ampio e controllato. Una frase rara può produrre un rapporto elevato quando gli umani non la usano quasi mai.
Questa distinzione conta per chiunque sia tentato di trattare una singola espressione come prova. Lo studio mappa abitudini a livello di popolazione. Non fornisce un verdetto affidabile sull’autorialità di un singolo paragrafo, email o elaborato studentesco.
La conclusione più difendibile è più circoscritta. Opus 5.5 ricorre ripetutamente a determinate frasi valutative e organizzative quando trasforma riassunti in articoli. Queste preferenze rimangono visibili anche dopo una rilevante revisione dello stile.
I familiari segnali della scrittura AI sono già obsoleti
Il trattino lungo ha smesso di essere una scorciatoia utile perché il comportamento dei modelli è cambiato più rapidamente dei consigli diffusi sul rilevamento.
Per diversi anni, i lettori hanno considerato i trattini lunghi come un indicatore informale di testo generato. Questa punteggiatura è stata associata a Claude perché le versioni precedenti la usavano frequentemente.
Opus 5.5 ha in gran parte abbandonato quell’abitudine. Graphite ha misurato 0,015 trattini lunghi ogni 1.000 parole, rispetto ai 2,92 di Opus 5. Ciò rappresenta un calo di circa il 99%.
Una valutazione separata ha prodotto un risultato direzionalmente simile. Un ricercatore di Arize ha generato 57.000 parole con Opus 5.5 e ha trovato soltanto due trattini lunghi. Il suo campione di Opus 5 ne ha prodotto 12,9 ogni 1.000 parole.
Quel più piccolo test indipendente di scrittura ha utilizzato 20 brief fissi in cinque generi e cinque aree tematiche. Il ricercatore ha contrassegnato manualmente 153 esempi prima di costruire un valutatore automatizzato.
Il dataset era molto più piccolo del corpus di Graphite, ma ha testato direttamente il modello rivisto di Anthropic rispetto al suo predecessore. Ha rilevato che altri riconoscibili “Claudismi” si sono ridotti di circa la metà, anziché scomparire.
Il cambiamento produce un’inversione scomoda. Gli autori umani rischiano ora sospetti per una punteggiatura che gli attuali modelli di frontiera usano raramente.
Uno sviluppatore di modelli può sopprimere un’abitudine evidente tramite post-addestramento, istruzioni di sistema o preferenze per l’output generato. Gli utenti possono anche richiedere una punteggiatura diversa con una sola frase nel prompt.
Questo rende fragili gli indizi superficiali. “Approfondire”, i trattini lunghi, ordinate liste in tre parti e conclusioni levigate possono descrivere uno stile. Nessuno di questi elementi stabilisce l’autorialità.
Lo stesso problema riguarda i rilevatori commerciali di AI. Un classificatore addestrato sui modelli di ieri può perdere accuratezza dopo che un fornitore modifica il comportamento dell’output. Il modello sottostante può mantenere lo stesso nome mentre il suo stile cambia attraverso un aggiornamento.
I falsi positivi comportano conseguenze reali. Un insegnante potrebbe accusare uno studente che scrive naturalmente in modo formale. Un redattore potrebbe appiattire la punteggiatura distintiva di un collaboratore per evitare sospetti automatizzati.
I falsi negativi sono altrettanto facili da produrre. Un utente può richiedere lunghezze di frase irregolari, rimuovere le frasi preferite o chiedere a un secondo modello di riscrivere il primo output. L’editing umano può cancellare gli schemi evidenti senza modificare l’origine del testo.
La risposta pratica consiste nel valutare insieme provenienza, supporto fattuale e cronologia delle revisioni. Le prove stilistiche possono giustificare un esame più attento, ma non dovrebbero decidere il caso da sole.
Per i team professionali, ciò significa conservare note sulle fonti e bozze. Una base di conoscenza personale consultabile può aiutare a collegare le affermazioni alle relative prove e a registrare come si è sviluppato un documento.
Questo flusso di lavoro affronta il rischio reale per la qualità. L’uso non dichiarato dell’AI può essere rilevante, ma affermazioni prive di supporto e responsabilità mancanti creano di norma il problema operativo maggiore.
Le conclusioni di Graphite indeboliscono quindi l’argomento a favore di semplici regole di rilevamento. Rafforzano l’argomento a favore di prove di processo, revisione editoriale e politiche trasparenti.
Anthropic ha migliorato lo stile senza cancellare l’impronta
Opus 5.5 è diventato statisticamente più vicino alla scrittura umana pur mantenendo quasi altrettanti segnali misurabili di Opus 5.
Anthropic ha presentato Opus 5.5 con un’affermazione diretta sulla comunicazione. L’azienda ha dichiarato che il modello scrive in modo più naturale, colloca prima le informazioni importanti ed evita più gergo e formulazioni idiosincratiche.
I primi tester avrebbero trovato la prosa più chiara e più facile da seguire. Anthropic ha inoltre presentato una migliore comunicazione come un vantaggio per la sicurezza, perché i lettori potevano esaminare più facilmente il lavoro del modello.
I risultati di Graphite supportano in parte questa posizione. I ricercatori hanno misurato la divergenza nella distribuzione delle parole utilizzando la divergenza di Jensen-Shannon, una statistica che confronta due distribuzioni di probabilità.
Un punteggio pari a zero indicherebbe un uso identico delle parole. Un punteggio pari a uno indicherebbe nessuna sovrapposizione.
Opus 5 ha ottenuto 0,064 rispetto alla scrittura umana. Opus 5.5 è sceso a 0,052, una riduzione del 19%. Ciò significa che la sua distribuzione complessiva delle parole si è avvicinata al corpus umano.
Il modello è migliorato anche nella “prosa manierata”, che Anthropic definisce come linguaggio che sostituisce affermazioni dirette con ornamenti o metafore. Graphite ha riportato un punteggio di 10,57 per Opus 5.5, in calo del 37% rispetto al 16,75 di Opus 5.
Gli articoli umani hanno ottenuto 6,65. GPT-6 Astra ha ottenuto 7,91. Opus ha quindi registrato un miglioramento sostanziale, pur rimanendo più manierato rispetto a entrambi i gruppi di confronto.
Il risultato sulla prosa manierata richiede un’interpretazione prudente. Graphite ha utilizzato Claude Opus 5 stesso per valutare un sottocampione di 1.000 argomenti corrispondenti su una scala da zero a 100.
Il valutatore non sapeva quale modello avesse prodotto ciascun articolo. Ciononostante, il suo giudizio riflette l’interpretazione di un altro modello anziché una misurazione meccanica.
Il conteggio dei segnali crea la tensione centrale. Opus 5.5 presentava una migliore somiglianza complessiva del vocabolario, ma i suoi 2.548 segnali erano soltanto il 4% in meno rispetto al totale di Opus 5.
Questi risultati misurano proprietà diverse. La somiglianza distributiva chiede come l’intero vocabolario si confronti con la scrittura umana. Un conteggio di segnali chiede quanti schemi specifici superino una soglia di frequenza.
Un modello può migliorare nella prima misura senza eliminare la seconda. Le ampie scelte di vocabolario possono diventare più umane mentre abitudini ristrette rimangono fortemente concentrate.
L’annuncio di Opus 5.5 di Anthropic ha inoltre evidenziato prestazioni più forti nel lavoro basato sulla conoscenza. In un’attività di ricerca interna, 16 report su 18 hanno superato una rigorosa soglia qualitativa in diverse impostazioni di impegno.
Anthropic ha affermato che un numero o una citazione inventati avrebbero causato il fallimento di un report. Secondo l’azienda, i precedenti modelli Opus e Fable non hanno superato tale soglia in alcun tentativo.
Questi risultati interni sono rilevanti perché una prosa naturale e una ricerca affidabile sono dimensioni separate. Una frase ripetitiva non rende un report fattualmente errato. Un linguaggio che sembra umano non rende accurata un’affermazione.
L’argomento più ampio dell’azienda riguarda l’usabilità. Una scrittura più chiara può ridurre i tempi di revisione anche quando un redattore può ancora identificare schemi stilistici ricorrenti.
La ricerca di Graphite non smentisce questo miglioramento. Ne traccia un confine. Opus 5.5 appare più umano nel complesso, ma “più umano” non equivale a indistinguibile.
Opus e Astra lasciano impronte linguistiche diverse
La competizione importante non è tra prosa umana e un unico stile AI fisso, ma tra impronte dei modelli in evoluzione e presupposti di rilevamento stabili.
GPT-6 Astra non ha semplicemente ottenuto risultati migliori o peggiori di Opus 5.5. Ha mostrato una diversa raccolta di abitudini.
Astra ha qualificato le affermazioni più spesso. “Può fornire” è apparso 18 volte più frequentemente in Astra rispetto a Opus 5.5. “Non necessariamente” è apparso 17 volte più frequentemente.
La frase “non stabilisce” ha mostrato una differenza ancora maggiore, raggiungendo 275 volte il tasso di Opus 5.5. Questi schemi suggeriscono che Astra spesso protegga un’affermazione con limiti espliciti.
Opus 5.5 ha fatto maggiore affidamento sui superlativi. Rispetto ad Astra, ha usato “il più popolare” 45 volte più spesso e “il più potente” 24 volte più spesso.
“Forse il più” è apparso 29 volte più frequentemente. Il frame “una delle migliori _ su” ha raggiunto 79 volte il tasso di Astra.
Quel contrasto influisce sul tono. Astra può apparire prudente o correttivo. Opus può sembrare più valutativo e sicuro, soprattutto quando attribuisce importanza.
Il CEO di Graphite, Ethan Smith, ha descritto questo schema come una differenza piuttosto che come un progresso costante. Ogni nuovo modello può migliorare lungo una dimensione sviluppando al contempo un'altra cadenza riconoscibile.
La copertura del settore riportata ha raggiunto la stessa conclusione. Un confronto tra modelli ha osservato che lo studio ha valutato dieci modelli sugli stessi 9.974 argomenti.
La distribuzione delle parole di Opus 5.5 si è avvicinata a quella umana. Astra se n'è allontanata, passando da 0,101 per GPT-5.6 Sol a 0,109.
Eppure Astra ha prodotto una prosa meno affettata di Opus. Questo impedisce una classifica semplice basata su un solo punteggio.
Un utente potrebbe preferire la schiettezza di Astra, pur non apprezzandone le cautele. Un altro potrebbe preferire la fluidità di Opus, eliminando però i superlativi non necessari in fase di revisione.
I risultati complicano anche l'attribuzione dei modelli. Un passaggio può contenere tratti associati a diversi sistemi, perché gli utenti combinano strumenti in un unico flusso di lavoro.
Un modello potrebbe svolgere la ricerca, un altro redigere una bozza e un terzo modificarla. Una persona potrebbe poi rivedere il risultato prima della pubblicazione.
I prompt aggiungono un ulteriore livello. Vietare esplicitamente una frase può modificarne la frequenza. Richiedere un linguaggio scientifico prudente può rendere Opus simile ad Astra sotto una determinata dimensione.
I sistemi sottoposti a fine-tuning e le istruzioni a livello di applicazione creano ulteriori variazioni. L'output visibile a un utente può riflettere il modello del fornitore, il prompt di sistema dell'applicazione e la richiesta dell'utente.
Ecco perché l'espressione “stile AI” è diventata troppo generica. I modelli di frontiera non condividono più una sola voce stabile, anche quando ripetono alcune strutture familiari.
La pressione competitiva ricade sia sui laboratori di modelli sia sui fornitori di rilevamento AI. I laboratori vogliono una prosa che si adatti all'intento dell'utente. I fornitori di rilevamento hanno bisogno di sistemi che resistano ai rapidi cambiamenti dei modelli.
Gli editor devono affrontare un'altra pressione. Devono distinguere tra ripetizioni stilistiche innocue e difetti che compromettono accuratezza, chiarezza o fiducia.
Una frase che afferma “questo è importante” può essere tediosa, ma non è automaticamente falsa. Una frase elegante con una fonte inventata è molto più grave.
La lezione utile non è cercare un unico nuovo indizio. È riconoscere che la prosa generata porta firme statistiche mutevoli, nessuna delle quali dovrebbe sostituire il giudizio editoriale.
Lo studio non può identificare chi ha scritto un singolo passaggio
Graphite ha misurato differenze a livello di corpus, non un test forense per singoli documenti o autori.
La scala dello studio rende persuasivi i suoi risultati aggregati. Il suo disegno impone anche limiti a come tali risultati dovrebbero essere utilizzati.
In primo luogo, l'esperimento si è concentrato sulla generazione di articoli a partire da riassunti. Non descrive automaticamente email, narrativa, analisi legali, elaborati scolastici o conversazioni informali.
Compiti diversi cambiano il linguaggio di un modello. Un rapporto tecnico può naturalmente contenere più qualificazioni. Il copy di marketing può naturalmente contenere più superlativi.
In secondo luogo, gli articoli di controllo umani precedevano ChatGPT. Questo protegge la base di riferimento da contaminazioni evidenti, ma introduce una differenza temporale.
Le convenzioni editoriali cambiano. Cambia l'ottimizzazione per la ricerca. Gli editori modificano le strutture dei titoli, la lunghezza dei paragrafi e la punteggiatura preferita.
Alcune differenze attribuite ai modelli potrebbero riflettere in parte l'ambiente di scrittura contemporaneo. Il disegno di Graphite con argomenti abbinati riduce il bias dei contenuti, ma non può cancellare ogni differenza storica.
In terzo luogo, i rapporti di frequenza possono amplificare comportamenti rari. Se gli esseri umani non usano quasi mai una frase, un numero modesto di utilizzi da parte dei modelli può generare un multiplo impressionante.
I ricercatori hanno applicato requisiti di frequenza minima per affrontare il problema. Per una visualizzazione classificata, le parole dovevano comparire in almeno 500 articoli dei modelli, mentre altre analisi utilizzavano soglie proprie.
Anche con questi filtri, un rapporto necessita del suo tasso di base. “Questo è importante” a 116 volte il tasso umano suona decisivo, ma non mostra quante volte la frase sia comparsa per articolo.
In quarto luogo, i risultati riflettono versioni specifiche dei modelli e impostazioni sperimentali. Aggiornamenti dei fornitori, impostazioni di inferenza, prompt di sistema e istruzioni degli utenti possono tutti modificare l'output.
In quinto luogo, lo studio proveniva da Graphite, un'azienda di marketing e crescita piuttosto che da un laboratorio accademico indipendente. I suoi ricercatori hanno pubblicato i dati sottostanti sugli indizi e gli articoli grezzi, favorendo così il controllo esterno.
La replica indipendente rimane preziosa. I ricercatori dovrebbero testare altri generi, lingue, disegni dei prompt e basi di riferimento umane. Dovrebbero inoltre riportare le frequenze assolute accanto ai rapporti relativi.
Il primo test di Arize offre un confronto utile. Ha confermato la forte riduzione dei trattini lunghi, rilevando al contempo che abitudini stilistiche più ampie rimanevano.
Tuttavia, i suoi 20 brief non possono convalidare ogni risultato derivante da quasi 10.000 argomenti allineati. I due progetti hanno utilizzato disegni diversi e risposto a domande diverse.
La più solida copertura esterna ha mantenuto visibili questi confini. L'originale copertura degli indizi di scrittura ha descritto le abitudini del modello senza sostenere che una qualsiasi frase dimostri la paternità AI.
I lettori dovrebbero applicare la stessa cautela. Una frase sospetta può motivare una domanda. Non può rispondere da sola a quella domanda.
Per gli editori, una revisione più affidabile chiede se le affermazioni hanno fonti, se le citazioni corrispondono agli originali e se le conclusioni derivano dalle prove. Chiede inoltre chi si assuma la responsabilità del testo finale.
Per le scuole, le politiche sull'attribuzione dovrebbero definire l'assistenza accettabile prima che sorgano controversie. La cronologia delle bozze, le citazioni e i colloqui orali di approfondimento forniscono prove più solide della sola punteggiatura o del vocabolario.
Per le aziende, le regole di divulgazione dovrebbero corrispondere al rischio. Un riepilogo interno di routine non richiede gli stessi controlli di indicazioni mediche, analisi finanziarie o comunicazioni pubbliche.
Lo studio rivela tendenze, non colpevolezza. Trattarlo come un rilevatore trasformerebbe un'attenta ricerca descrittiva in uno strumento di applicazione inaffidabile.
Tre segnali mostreranno se i nuovi indizi dureranno
Il prossimo test è stabilire se l'attuale impronta di Opus 5.5 resisterà alla replica, ai prompt degli utenti e al prossimo aggiornamento del modello.
Il primo segnale è la riproduzione indipendente dei risultati di Graphite. I ricercatori devono generare corpus comparabili con prompt, generi e campioni umani diversi.
Se “affidabile”, “questo è importante” e le strutture di contrasto restano elevati, si rafforza l'ipotesi di una firma persistente di Opus 5.5. Se crollano in seguito a piccole modifiche dei prompt, sono deboli segnali di attribuzione.
Il secondo segnale è la velocità con cui Anthropic modifica il linguaggio del modello. L'azienda ha chiaramente risposto alle critiche sullo stile comunicativo di Opus 5.
Un aggiornamento successivo potrebbe ridurre gli indizi attuali con la stessa nettezza con cui Opus 5.5 ha ridotto i trattini lunghi. Ciò confermerebbe che i tratti stilistici visibili sono comportamenti di prodotto regolabili.
Il terzo segnale è se i fornitori di rilevamento pubblicheranno valutazioni specifiche per versione. Un rilevatore dovrebbe essere testato sui modelli attuali, sui flussi di lavoro misti umano-AI e sugli output modificati.
Le dichiarazioni di accuratezza necessitano anche di tassi di falsi positivi nelle diverse comunità di scrittura. Chi scrive in inglese come lingua non madre, gli specialisti tecnici e le persone con stili formali non dovrebbero diventare danni collaterali.
Il futuro più utile potrebbe basarsi sulla provenienza anziché su congetture linguistiche. Registri firmati di generazione, bozze conservate e una divulgazione chiara potrebbero stabilire il processo senza fingere che la sola prosa riveli la propria origine.
Per gli scrittori, l'azione immediata è semplice. Cercate nelle bozze parole valutative ripetute, contrasti preconfezionati, superlativi non necessari e frasi che proclamano l'importanza invece di dimostrarla.
Poi verificate ogni affermazione fattuale. Eliminate la sicurezza non supportata. Conservate la punteggiatura insolita quando serve alla frase, anziché cancellarla per evitare sospetti.
Gli indizi di scrittura di Claude Opus 5.5 offrono una preziosa checklist editoriale, ma non sono un verdetto. Gli editori useranno questi risultati per migliorare la revisione, o trasformeranno un altro schema temporaneo in una scorciatoia inaffidabile?



