top of page

Os Indícios de Escrita do Claude Opus 5.5 Mudaram, mas Não Desapareceram

há 6 dias
12 min de leitura

Os indícios de escrita do Claude Opus 5.5 sobreviveram à reformulação de estilo da Anthropic, apesar de uma redução de 99% no uso de travessões pelo modelo. O sinal mais forte agora é “confiável”, que apareceu 23 vezes mais em artigos escritos pelo modelo do que em trabalhos humanos comparáveis.

A constatação vem da análise da Graphite sobre artigos que cobrem 9.974 tópicos correspondentes. Os pesquisadores identificaram 2.548 palavras, frases e padrões de sentença que o Opus 5.5 usou pelo menos duas vezes mais do que escritores humanos.

O resultado complica a afirmação da Anthropic de que o Opus 5.5 se comunica de forma mais natural. Seu vocabulário se aproximou mensuravelmente da escrita humana, mas milhares de diferenças estatísticas permaneceram. O modelo não perdeu sua assinatura linguística. Ele trocou vários hábitos conhecidos por uma nova coleção de preferências.

O GPT-6 Astra da OpenAI produziu outro padrão distinto. Ele qualificou afirmações com mais frequência e recorreu a enquadramentos corretivos, enquanto o Opus favoreceu superlativos e declarações de importância. A comparação transforma a detecção de escrita por IA em um problema de alvo móvel. Cada versão de modelo altera as evidências que editores, professores e leitores acreditam reconhecer.

Uma preferência 23 vezes maior revelou o novo padrão do Opus

Os mais recentes indícios de escrita do Claude Opus 5.5 são palavras comuns que se tornam incomuns pela repetição.

A Graphite publicou sua atualização sobre o Opus 5.5 depois que a Anthropic lançou o modelo em 22 de setembro de 2026. A pesquisa ampliou uma análise anterior que abrangia dez modelos de IA e uma coleção de controle humana.

Os pesquisadores usaram 9.974 tópicos para os quais cada modelo e o corpus humano tinham um artigo correspondente. Os artigos humanos foram publicados antes do lançamento do ChatGPT, reduzindo a chance de que essas amostras contivessem conteúdo de IA generativa não identificado.

Cada modelo recebeu um resumo e gerou um novo artigo sobre o mesmo assunto. Essa abordagem reduziu as diferenças entre tópicos, embora não pudesse eliminar todos os efeitos causados por prompts ou seleção de fontes.

Os pesquisadores então compararam frequências de palavras e frases normalizadas por extensão. Eles também estudaram estruturas, que são padrões recorrentes de linguagem com lacunas que podem conter até três palavras.

Segundo a definição da Graphite, um indício aparece pelo menos duas vezes mais na escrita por IA do que na coleção humana. Filtros de frequência excluem expressões que aparecem em apenas um pequeno número de documentos.

O estudo sobre escrita por IA resultante encontrou 2.548 indícios do Opus 5.5. Isso foi apenas 4% abaixo dos 2.666 registrados para o Opus 5.

“Confiável” liderou os adjetivos avaliativos do modelo, com frequência 23 vezes maior que a humana. “Constante” apareceu 11 vezes mais, enquanto “atencioso” apareceu nove vezes mais. “Significativo” atingiu oito vezes a taxa humana.

Essas palavras não são inerentemente artificiais. Um escritor humano pode, com razão, chamar um serviço de confiável ou descrever uma resposta como atenciosa. Seu valor está no comportamento agregado, não em ocorrências isoladas.

A linguagem de transição também foi distinta. “Olhando para o futuro, o” apareceu 40 vezes mais do que na taxa humana. “Adiciona outra camada” atingiu 27 vezes, e “o que vem a seguir” chegou a 24 vezes.

O Opus 5.5 também manteve uma preferência por contraste. O padrão “é mais do que um _ ele” apareceu 98 vezes mais do que em artigos humanos. “Em vez de simplesmente” apareceu 32 vezes mais do que na taxa humana.

Sua categoria mais forte envolveu sinalizar importância. “Isto importa” apareceu 116 vezes mais do que na coleção humana. “Por que _ importa” apareceu 92 vezes mais.

Esses números não significam que todos os artigos do Opus contenham essas frases. Eles descrevem a frequência relativa em um grande corpus controlado. Uma frase rara pode produzir uma razão elevada quando humanos quase nunca a usam.

Essa distinção importa para qualquer pessoa tentada a tratar uma única expressão como prova. O estudo mapeia hábitos em nível populacional. Ele não fornece um veredito confiável de autoria para um parágrafo, e-mail ou redação de estudante.

A conclusão mais defensável é mais restrita. O Opus 5.5 recorre repetidamente a certas frases avaliativas e organizacionais quando transforma resumos em artigos. Essas preferências continuam visíveis mesmo após uma grande revisão de estilo.

Os indícios conhecidos de escrita por IA já estão obsoletos

O travessão deixou de ser um atalho útil porque o comportamento dos modelos mudou mais rápido do que os conselhos populares de detecção.

Por vários anos, leitores trataram travessões como um marcador informal de texto gerado. A pontuação passou a ser associada ao Claude porque versões anteriores a utilizavam com frequência.

O Opus 5.5 abandonou em grande parte esse hábito. A Graphite mediu 0,015 travessão por 1.000 palavras, em comparação com 2,92 no Opus 5. Isso representa uma queda de cerca de 99%.

Uma avaliação separada produziu um resultado semelhante na mesma direção. Um pesquisador da Arize gerou 57.000 palavras com o Opus 5.5 e encontrou apenas dois travessões. Sua amostra do Opus 5 produziu 12,9 por 1.000 palavras.

Esse teste independente de escrita menor usou 20 briefs fixos em cinco gêneros e cinco áreas temáticas. O pesquisador marcou manualmente 153 exemplos antes de criar um avaliador automatizado.

O conjunto de dados era muito menor do que o corpus da Graphite, mas testou diretamente o modelo revisado da Anthropic contra seu antecessor. Ele constatou que outros “Claudismos” reconhecíveis caíram cerca de pela metade, em vez de desaparecer.

A mudança cria uma inversão desconfortável. Escritores humanos agora correm o risco de despertar suspeitas por uma pontuação que os atuais modelos de ponta raramente usam.

Um desenvolvedor de modelos pode suprimir um hábito evidente por meio de pós-treinamento, instruções de sistema ou preferências de saída gerada. Usuários também podem solicitar uma pontuação diferente com uma frase no prompt.

Isso torna pistas superficiais frágeis. “Aprofundar-se”, travessões, listas organizadas em três partes e conclusões polidas podem descrever um estilo. Nenhum deles estabelece autoria.

O mesmo problema afeta detectores comerciais de IA. Um classificador treinado com os modelos de ontem pode perder precisão depois que um provedor altera o comportamento de saída. O modelo subjacente pode manter o mesmo nome enquanto seu estilo muda por meio de uma atualização.

Falsos positivos trazem consequências reais. Um professor pode acusar um estudante que naturalmente escreve em prosa formal. Um editor pode neutralizar a pontuação distinta de um colaborador para evitar suspeita automatizada.

Falsos negativos são igualmente fáceis de produzir. Um usuário pode solicitar extensões irregulares de frases, remover expressões favorecidas ou pedir a um segundo modelo que reescreva a primeira saída. A edição humana pode apagar padrões óbvios sem alterar a origem do texto.

A resposta prática é avaliar em conjunto a procedência, o suporte factual e o histórico de revisões. Evidências estilísticas podem justificar uma análise mais detalhada, mas não devem decidir o caso isoladamente.

Para equipes profissionais, isso significa preservar notas de fontes e rascunhos. Uma base de conhecimento pessoal pesquisável pode ajudar a conectar afirmações às suas evidências e registrar como um documento evoluiu.

Esse fluxo de trabalho aborda o verdadeiro risco de qualidade. O uso não declarado de IA pode importar, mas afirmações sem suporte e falta de responsabilização geralmente criam o problema operacional maior.

As conclusões da Graphite, portanto, enfraquecem o argumento a favor de regras simples de detecção. Elas fortalecem o argumento a favor de evidências de processo, revisão editorial e políticas transparentes.

A Anthropic melhorou o estilo sem apagar a assinatura

O Opus 5.5 ficou estatisticamente mais próximo da escrita humana enquanto reteve quase tantos indícios mensuráveis quanto o Opus 5.

A Anthropic apresentou o Opus 5.5 com uma afirmação direta sobre comunicação. A empresa disse que o modelo escreve de forma mais natural, coloca informações importantes primeiro e evita mais jargão e formulações idiossincráticas.

Testadores iniciais teriam considerado a prosa mais clara e fácil de acompanhar. A Anthropic também apresentou uma comunicação melhor como benefício de segurança, pois leitores poderiam examinar o trabalho do modelo com mais facilidade.

Os resultados da Graphite apoiam parcialmente essa posição. Os pesquisadores mediram a divergência na distribuição de palavras usando a divergência de Jensen-Shannon, uma estatística que compara duas distribuições de probabilidade.

Uma pontuação de zero indicaria uso idêntico de palavras. Uma pontuação de um indicaria ausência de sobreposição.

O Opus 5 marcou 0,064 contra a escrita humana. O Opus 5.5 caiu para 0,052, uma redução de 19%. Isso significa que sua distribuição geral de palavras se aproximou do corpus humano.

O modelo também melhorou em “prosa afetada”, que a Anthropic define como linguagem que substitui declarações diretas por floreios ou metáforas. A Graphite relatou uma pontuação de 10,57 para o Opus 5.5, 37% abaixo dos 16,75 do Opus 5.

Artigos humanos marcaram 6,65. O GPT-6 Astra marcou 7,91. Portanto, o Opus melhorou substancialmente, embora tenha permanecido mais afetado do que ambos os grupos de comparação.

O resultado sobre prosa afetada exige interpretação cuidadosa. A Graphite usou o próprio Claude Opus 5 para pontuar uma subamostra de 1.000 tópicos correspondentes em uma escala de zero a 100.

O avaliador não sabia qual modelo havia produzido cada artigo. Ainda assim, seu julgamento reflete a interpretação de outro modelo, e não uma medição mecânica.

A contagem de indícios cria a tensão central. O Opus 5.5 apresentou melhor similaridade geral de vocabulário, mas seus 2.548 indícios foram apenas 4% menos que o total do Opus 5.

Esses resultados medem propriedades diferentes. A similaridade distribucional pergunta como todo o vocabulário se compara à escrita humana. Uma contagem de indícios pergunta quantos padrões específicos ultrapassam um limiar de frequência.

Um modelo pode melhorar na primeira medida sem eliminar a segunda. Escolhas amplas de vocabulário podem se tornar mais humanas enquanto hábitos específicos permanecem fortemente concentrados.

O anúncio do Opus 5.5 da Anthropic também destacou desempenho mais forte em trabalho de conhecimento. Em uma tarefa interna de pesquisa, 16 de 18 relatórios superaram um limite rigoroso de qualidade em diferentes configurações de esforço.

A Anthropic afirmou que um número ou uma citação inventada faria um relatório falhar. Modelos Opus e Fable anteriores não superaram esse padrão em nenhuma tentativa, segundo a empresa.

Esses resultados internos são relevantes porque prosa natural e pesquisa confiável são dimensões separadas. Uma frase repetitiva não torna um relatório factualmente errado. Linguagem que soa humana não torna uma afirmação precisa.

O argumento mais amplo da empresa diz respeito à usabilidade. Uma escrita mais clara pode reduzir o tempo de revisão mesmo quando um editor ainda consegue identificar padrões estilísticos recorrentes.

A pesquisa da Graphite não refuta essa melhoria. Ela estabelece um limite para ela. O Opus 5.5 parece mais humano no agregado, mas “mais humano” não equivale a indistinguível.

Opus e Astra deixam assinaturas linguísticas diferentes

A competição importante não é entre prosa humana e um estilo fixo de IA, mas entre assinaturas de modelos em mudança e pressupostos estáveis de detecção.

O GPT-6 Astra não teve simplesmente desempenho melhor ou pior que o Opus 5.5. Ele mostrou uma coleção diferente de hábitos.

O Astra qualificou afirmações com mais frequência. “Pode fornecer” apareceu 18 vezes mais no Astra do que no Opus 5.5. “Não necessariamente” apareceu 17 vezes mais.

A frase “não estabelece” mostrou uma diferença ainda maior, atingindo 275 vezes a taxa do Opus 5.5. Esses padrões sugerem que o Astra frequentemente protege uma afirmação com limites explícitos.

O Opus 5.5 recorreu mais intensamente a superlativos. Comparado ao Astra, usou “o mais popular” 45 vezes mais e “o mais poderoso” 24 vezes mais.

“Talvez o mais” apareceu 29 vezes mais. A estrutura “uma das melhores _ sobre” atingiu 79 vezes a taxa do Astra.

Esse contraste afeta o tom. Astra pode soar cauteloso ou corretivo. Opus pode soar mais avaliativo e confiante, especialmente ao atribuir importância.

O CEO da Graphite, Ethan Smith, descreveu o padrão como diferença, e não como progresso constante. Cada novo modelo pode se tornar melhor em uma dimensão enquanto desenvolve outro ritmo reconhecível.

A cobertura setorial reportada chegou à mesma conclusão. Uma comparação de modelos observou que o estudo avaliou dez modelos nos mesmos 9.974 tópicos.

A distribuição de palavras do Opus 5.5 se aproximou da dos humanos. Astra se afastou deles, subindo de 0,101 para GPT-5.6 Sol para 0,109.

Ainda assim, Astra produziu uma prosa menos afetada do que Opus. Isso impede uma classificação simples baseada em uma única pontuação.

Um usuário pode preferir a objetividade de Astra, mas não gostar de suas ressalvas. Outro pode preferir a fluidez de Opus, removendo superlativos desnecessários durante a edição.

As conclusões também complicam a atribuição de modelos. Uma passagem pode conter traços associados a vários sistemas porque os usuários combinam ferramentas em um mesmo fluxo de trabalho.

Um modelo pode realizar a pesquisa, outro pode redigir, e um terceiro pode editar. Depois, uma pessoa pode revisar o resultado antes da publicação.

Os prompts acrescentam outra camada. Proibir explicitamente uma expressão pode alterar sua frequência. Pedir linguagem científica cautelosa pode fazer Opus se parecer com Astra em uma dimensão.

Sistemas ajustados e instruções no nível da aplicação criam ainda mais variações. A saída visível para um usuário pode refletir o modelo do provedor, o prompt de sistema da aplicação e a solicitação do usuário.

É por isso que a expressão “estilo de IA” se tornou ampla demais. Modelos de fronteira já não compartilham uma única voz estável, mesmo quando repetem algumas estruturas familiares.

A pressão competitiva recai tanto sobre os laboratórios de modelos quanto sobre os fornecedores de detecção de IA. Os laboratórios querem uma prosa que se adapte à intenção do usuário. Os fornecedores de detecção precisam de sistemas que resistam a mudanças rápidas nos modelos.

Os editores enfrentam outra pressão. Eles precisam distinguir entre repetição estilística inofensiva e defeitos que prejudicam a precisão, a clareza ou a confiança.

Uma frase que diz “isto importa” pode ser tediosa, mas não é automaticamente falsa. Uma frase elegante com uma fonte inventada é muito mais grave.

A lição útil não é procurar um único novo indício. É reconhecer que a prosa gerada carrega assinaturas estatísticas mutáveis, nenhuma das quais deve substituir o julgamento editorial.

O estudo não consegue identificar quem escreveu uma única passagem

A Graphite mediu diferenças no nível de corpus, não um teste forense para documentos ou autores individuais.

A escala do estudo torna suas conclusões agregadas persuasivas. Seu desenho também impõe limites sobre como essas conclusões devem ser usadas.

Primeiro, o experimento se concentrou na geração de artigos a partir de resumos. Ele não descreve automaticamente e-mails, ficção, análises jurídicas, redações escolares ou conversas casuais.

Tarefas diferentes mudam a linguagem de um modelo. Um relatório técnico pode naturalmente conter mais ressalvas. Textos de marketing podem naturalmente conter mais superlativos.

Segundo, os artigos de controle humanos eram anteriores ao ChatGPT. Isso protege a linha de base contra contaminação óbvia, mas introduz uma diferença temporal.

As convenções editoriais mudam. A otimização para buscas muda. Os editores alteram estruturas de manchetes, tamanhos de parágrafos e pontuação preferida.

Algumas diferenças atribuídas aos modelos podem refletir parcialmente o ambiente contemporâneo de escrita. O desenho de tópicos correspondentes da Graphite reduz o viés de conteúdo, mas não consegue eliminar todas as diferenças históricas.

Terceiro, proporções de frequência podem exagerar comportamentos raros. Se humanos quase nunca usam uma frase, um número modesto de usos pelo modelo pode gerar um múltiplo impressionante.

Os pesquisadores aplicaram requisitos de frequência mínima para lidar com esse problema. As palavras precisavam aparecer em pelo menos 500 artigos do modelo em uma visualização classificada, enquanto outras análises usaram seus próprios limiares.

Mesmo com esses filtros, uma proporção precisa de sua taxa-base. “Isto importa” a 116 vezes a taxa humana soa decisivo, mas não mostra com que frequência a frase apareceu por artigo.

Quarto, os resultados refletem versões específicas de modelos e configurações experimentais. Atualizações dos provedores, configurações de inferência, prompts de sistema e instruções dos usuários podem alterar a saída.

Quinto, o estudo veio da Graphite, uma empresa de marketing e crescimento, e não de um laboratório acadêmico independente. Seus pesquisadores divulgaram os dados subjacentes sobre os indícios e os artigos brutos, o que favorece o escrutínio externo.

A replicação independente continua valiosa. Pesquisadores devem testar outros gêneros, idiomas, desenhos de prompt e linhas de base humanas. Também devem informar frequências absolutas ao lado de proporções relativas.

O teste inicial da Arize oferece uma comparação útil. Ele corroborou a forte redução no uso de travessões, ao mesmo tempo que constatou a permanência de hábitos estilísticos mais amplos.

Ainda assim, seus 20 briefs não podem validar todos os resultados de quase 10.000 tópicos alinhados. Os dois projetos usaram desenhos diferentes e responderam a perguntas diferentes.

A cobertura externa mais sólida manteve esses limites visíveis. A cobertura original sobre indícios de escrita descreveu os hábitos do modelo sem afirmar que qualquer expressão prova autoria por IA.

Os leitores devem aplicar a mesma cautela. Uma expressão suspeita pode motivar uma pergunta. Ela não pode responder a essa pergunta sozinha.

Para publicadores, uma revisão mais confiável pergunta se as alegações têm fontes, se as citações correspondem aos originais e se as conclusões decorrem das evidências. Ela também pergunta quem assume a responsabilidade pelo texto final.

Para escolas, as políticas de autoria devem definir a assistência aceitável antes que surjam disputas. Histórico de rascunhos, citações e acompanhamento oral fornecem evidências mais fortes do que pontuação ou vocabulário isoladamente.

Para empresas, as regras de divulgação devem corresponder ao risco. Um resumo interno de rotina não exige os mesmos controles que orientações médicas, análises financeiras ou reportagens públicas.

O estudo revela tendências, não culpa. Tratá-lo como um detector transformaria uma pesquisa descritiva cuidadosa em uma ferramenta de fiscalização não confiável.

Três sinais mostrarão se os novos indícios permanecem

O próximo teste é saber se a impressão digital atual do Opus 5.5 resiste à replicação, aos prompts dos usuários e à próxima atualização do modelo.

O primeiro sinal é a reprodução independente dos resultados da Graphite. Pesquisadores precisam gerar corpora comparáveis com prompts, gêneros e amostras humanas diferentes.

Se “dependable”, “isto importa” e as estruturas de contraste permanecerem elevadas, o argumento a favor de uma assinatura persistente do Opus 5.5 se fortalece. Se desaparecerem com pequenas mudanças nos prompts, serão sinais fracos de atribuição.

O segundo sinal é a rapidez com que a Anthropic altera a linguagem do modelo. A empresa claramente respondeu às críticas ao estilo de comunicação do Opus 5.

Uma atualização posterior poderia reduzir os indícios atuais tão drasticamente quanto o Opus 5.5 reduziu os travessões. Isso confirmaria que traços estilísticos visíveis são comportamentos de produto ajustáveis.

O terceiro sinal é se os fornecedores de detecção publicam avaliações específicas por versão. Um detector deve ser testado em modelos atuais, fluxos de trabalho híbridos entre humanos e IA e resultados editados.

As alegações de precisão também precisam de taxas de falsos positivos em diferentes comunidades de escrita. Pessoas que não têm o inglês como língua nativa, especialistas técnicos e pessoas com estilos formais não devem se tornar danos colaterais.

O futuro mais útil pode envolver proveniência, em vez de adivinhações linguísticas. Registros assinados de geração, rascunhos preservados e divulgação clara poderiam estabelecer o processo sem fingir que a prosa, por si só, revela sua origem.

Para escritores, a ação imediata é simples. Procure nos rascunhos palavras avaliativas repetidas, contrastes prontos, superlativos desnecessários e frases que anunciam importância em vez de demonstrá-la.

Em seguida, verifique cada alegação factual. Remova certezas sem respaldo. Mantenha pontuação incomum quando ela servir à frase, em vez de apagá-la para evitar suspeitas.

Os indícios de escrita do Claude Opus 5.5 fornecem uma valiosa lista de verificação editorial, mas não são um veredito. Os publicadores usarão essas conclusões para melhorar a revisão ou transformarão outro padrão temporário em um atalho não confiável?

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page