top of page

Les tics d’écriture de Claude Opus 5.5 ont changé, mais ils n’ont pas disparu

il y a 6 jours
13 min de lecture

Les tics d’écriture de Claude Opus 5.5 ont survécu à la refonte stylistique d’Anthropic, malgré une réduction de 99 % de l’utilisation des tirets cadratins par le modèle. Le signal le plus fort est désormais « dependable », apparu 23 fois plus souvent dans les articles rédigés par le modèle que dans des textes humains comparables.

Cette conclusion provient de l’analyse par Graphite d’articles couvrant 9 974 sujets appariés. Les chercheurs ont identifié 2 548 mots, expressions et structures de phrase qu’Opus 5.5 utilisait au moins deux fois plus souvent que les auteurs humains.

Le résultat nuance l’affirmation d’Anthropic selon laquelle Opus 5.5 communique plus naturellement. Son vocabulaire s’est sensiblement rapproché de l’écriture humaine, mais des milliers de différences statistiques subsistent. Le modèle n’a pas perdu son empreinte linguistique. Il a troqué plusieurs habitudes familières contre un nouvel ensemble de préférences.

GPT-6 Astra d’OpenAI a produit un autre profil distinct. Il nuançait davantage ses affirmations et s’appuyait sur des formulations correctives, tandis qu’Opus privilégiait les superlatifs et les déclarations d’importance. Cette comparaison transforme la détection de l’écriture par IA en cible mouvante. Chaque version de modèle modifie les indices que les éditeurs, enseignants et lecteurs pensent reconnaître.

Une préférence multipliée par 23 révèle le nouveau profil d’Opus

Les derniers tics d’écriture de Claude Opus 5.5 sont des mots ordinaires rendus inhabituels par la répétition.

Graphite a publié sa mise à jour sur Opus 5.5 après la sortie du modèle par Anthropic le 22 septembre 2026. La recherche prolongeait une analyse précédente couvrant dix modèles d’IA et un corpus de référence humain.

Les chercheurs ont utilisé 9 974 sujets pour lesquels chaque modèle et le corpus humain disposaient d’un article correspondant. Les articles humains avaient été publiés avant le lancement de ChatGPT, ce qui réduisait la probabilité que ces échantillons contiennent du contenu d’IA générative non signalé.

Chaque modèle a reçu un résumé et généré un nouvel article sur le même sujet. Cette approche a réduit les différences thématiques, sans toutefois pouvoir éliminer tous les effets causés par les consignes ou la sélection des sources.

Les chercheurs ont ensuite comparé les fréquences de mots et d’expressions normalisées selon la longueur. Ils ont également étudié les cadres, c’est-à-dire des structures linguistiques récurrentes comprenant des emplacements pouvant contenir jusqu’à trois mots.

Selon la définition de Graphite, un tic apparaît au moins deux fois plus souvent dans l’écriture par IA que dans le corpus humain. Des filtres de fréquence excluent les expressions qui ne figurent que dans une poignée de documents.

La étude sur l’écriture par IA qui en résulte a relevé 2 548 tics chez Opus 5.5. C’était seulement 4 % de moins que les 2 666 recensés pour Opus 5.

« Dependable » dominait les adjectifs évaluatifs du modèle, à une fréquence 23 fois supérieure au taux humain. « Steady » apparaissait 11 fois plus souvent, tandis que « thoughtful » apparaissait neuf fois plus souvent. « Meaningful » atteignait huit fois le taux humain.

Ces mots ne sont pas intrinsèquement artificiels. Un auteur humain peut raisonnablement qualifier un service de dependable ou décrire une réponse comme thoughtful. Leur intérêt réside dans le comportement agrégé, non dans des occurrences isolées.

Le langage de transition était également distinctif. « Looking ahead the » apparaissait à une fréquence 40 fois supérieure au taux humain. « Adds another layer » atteignait 27 fois ce taux, et « what comes next » 24 fois.

Opus 5.5 conservait aussi une préférence pour le contraste. La structure « is more than a _ it » apparaissait 98 fois plus souvent que dans les articles humains. « Rather than simply » atteignait 32 fois le taux humain.

Sa catégorie la plus marquée concernait la mise en avant de l’importance. « This matters » apparaissait 116 fois plus souvent que dans le corpus humain. « Why _ matters » apparaissait 92 fois plus souvent.

Ces chiffres ne signifient pas que chaque article d’Opus contient ces expressions. Ils décrivent une fréquence relative dans un vaste corpus contrôlé. Une expression rare peut produire un ratio élevé lorsque les humains ne l’utilisent presque jamais.

Cette distinction compte pour quiconque serait tenté de traiter une seule expression comme une preuve. L’étude cartographie des habitudes à l’échelle d’une population. Elle ne fournit pas de verdict fiable sur la paternité d’un paragraphe, d’un e-mail ou d’une dissertation d’étudiant.

La conclusion la plus défendable est plus restreinte. Opus 5.5 recourt de manière répétée à certaines expressions évaluatives et organisationnelles lorsqu’il transforme des résumés en articles. Ces préférences restent visibles même après une révision stylistique majeure.

Les tics familiers de l’écriture par IA sont déjà obsolètes

Le tiret cadratin a cessé d’être un raccourci utile, car le comportement des modèles a changé plus vite que les conseils populaires de détection.

Pendant plusieurs années, les lecteurs ont traité les tirets cadratins comme un marqueur informel de texte généré. Cette ponctuation est devenue associée à Claude parce que les versions antérieures l’utilisaient fréquemment.

Opus 5.5 a largement abandonné cette habitude. Graphite a mesuré 0,015 tiret cadratin pour 1 000 mots, contre 2,92 pour Opus 5. Cela représente une baisse d’environ 99 %.

Une évaluation distincte a produit un résultat directionnel similaire. Un chercheur d’Arize a généré 57 000 mots avec Opus 5.5 et n’a trouvé que deux tirets cadratins. Son échantillon Opus 5 en produisait 12,9 pour 1 000 mots.

Ce test d’écriture indépendant de plus petite taille utilisait 20 briefs figés couvrant cinq genres et cinq domaines. Le chercheur a annoté manuellement 153 exemples avant de construire un évaluateur automatisé.

Le jeu de données était bien plus petit que le corpus de Graphite, mais il testait directement le modèle révisé d’Anthropic contre son prédécesseur. Il a constaté que d’autres « Claudismes » reconnaissables avaient diminué d’environ moitié au lieu de disparaître.

Ce changement crée un renversement inconfortable. Les auteurs humains risquent désormais d’être soupçonnés pour une ponctuation que les modèles de pointe actuels utilisent rarement.

Un développeur de modèles peut supprimer une habitude manifeste au moyen du post-entraînement, d’instructions système ou de préférences de sortie générée. Les utilisateurs peuvent aussi demander une ponctuation différente avec une seule phrase dans une consigne.

Cela rend les indices superficiels fragiles. « Delve », les tirets cadratins, les listes soignées en trois parties et les conclusions policées peuvent décrire un style. Aucun ne permet d’établir la paternité d’un texte.

Le même problème touche les détecteurs commerciaux d’IA. Un classificateur entraîné sur les modèles d’hier peut perdre en précision après qu’un fournisseur modifie le comportement de sortie. Le modèle sous-jacent peut conserver le même nom alors que son style évolue via une mise à jour.

Les faux positifs ont des conséquences réelles. Un enseignant pourrait accuser un étudiant qui écrit naturellement dans un style formel. Un éditeur pourrait uniformiser la ponctuation distinctive d’un contributeur afin d’éviter les soupçons automatisés.

Les faux négatifs sont tout aussi faciles à produire. Un utilisateur peut demander des longueurs de phrase irrégulières, supprimer les expressions privilégiées ou demander à un second modèle de réécrire la première sortie. Une révision humaine peut effacer des schémas évidents sans changer l’origine du texte.

La réponse pratique consiste à évaluer ensemble la provenance, l’étayage factuel et l’historique des révisions. Les indices stylistiques peuvent justifier un examen plus approfondi, mais ils ne devraient pas trancher seuls.

Pour les équipes professionnelles, cela signifie conserver les notes de sources et les brouillons. Une base de connaissances personnelle consultable peut aider à relier les affirmations à leurs preuves et à documenter l’évolution d’un document.

Ce flux de travail répond au véritable risque de qualité. L’utilisation non divulguée de l’IA peut compter, mais les affirmations non étayées et l’absence de responsabilité créent généralement le problème opérationnel le plus important.

Les conclusions de Graphite affaiblissent donc l’argument en faveur de règles de détection simples. Elles renforcent celui en faveur de preuves de processus, d’une révision éditoriale et de politiques transparentes.

Anthropic a amélioré le style sans effacer l’empreinte

Opus 5.5 s’est statistiquement rapproché de l’écriture humaine tout en conservant presque autant de tics mesurables qu’Opus 5.

Anthropic a présenté Opus 5.5 avec une affirmation directe sur la communication. L’entreprise a déclaré que le modèle écrivait plus naturellement, plaçait les informations importantes en premier et évitait davantage le jargon ainsi que les formulations idiosyncratiques.

Les premiers testeurs auraient trouvé la prose plus claire et plus facile à suivre. Anthropic a également présenté une meilleure communication comme un avantage de sécurité, car les lecteurs pouvaient examiner plus facilement le travail du modèle.

Les résultats de Graphite étayent en partie cette position. Les chercheurs ont mesuré la divergence dans la distribution des mots à l’aide de la divergence de Jensen-Shannon, une statistique qui compare deux distributions de probabilité.

Un score de zéro indiquerait une utilisation identique des mots. Un score de un indiquerait une absence de recouvrement.

Opus 5 a obtenu 0,064 face à l’écriture humaine. Opus 5.5 est tombé à 0,052, soit une réduction de 19 %. Cela signifie que sa distribution globale de mots s’est rapprochée du corpus humain.

Le modèle a également progressé sur la « prose maniérée », qu’Anthropic définit comme un langage qui substitue l’ornement ou la métaphore aux affirmations directes. Graphite a rapporté un score de 10,57 pour Opus 5.5, en baisse de 37 % par rapport aux 16,75 d’Opus 5.

Les articles humains ont obtenu 6,65. GPT-6 Astra a obtenu 7,91. Opus s’est donc sensiblement amélioré tout en restant plus maniéré que les deux groupes de comparaison.

Le résultat concernant la prose maniérée nécessite une interprétation prudente. Graphite a utilisé Claude Opus 5 lui-même pour évaluer un sous-échantillon de 1 000 sujets appariés sur une échelle de zéro à 100.

L’évaluateur ne savait pas quel modèle avait produit chaque article. Malgré cela, son jugement reflète l’interprétation d’un autre modèle plutôt qu’une mesure mécanique.

Le nombre de tics crée la tension centrale. Opus 5.5 présentait une meilleure similitude globale du vocabulaire, mais ses 2 548 tics n’étaient que 4 % moins nombreux que le total d’Opus 5.

Ces résultats mesurent des propriétés différentes. La similitude distributionnelle demande comment l’ensemble du vocabulaire se compare à l’écriture humaine. Le décompte des tics demande combien de schémas spécifiques franchissent un seuil de fréquence.

Un modèle peut améliorer la première mesure sans éliminer la seconde. Les choix de vocabulaire généraux peuvent devenir plus humains tandis que des habitudes étroites restent fortement concentrées.

L’annonce d’Opus 5.5 d’Anthropic a également mis en avant de meilleures performances pour le travail de connaissance. Dans une tâche de recherche interne, 16 rapports sur 18 ont franchi un seuil strict de qualité dans différents réglages d’effort.

Anthropic a déclaré qu’un chiffre ou une citation inventés entraîneraient l’échec d’un rapport. Les modèles Opus et Fable antérieurs n’ont franchi ce seuil dans aucune tentative, selon l’entreprise.

Ces résultats internes sont pertinents parce que la prose naturelle et la recherche fiable sont des dimensions distinctes. Une expression répétitive ne rend pas un rapport factuellement erroné. Un langage qui semble humain ne rend pas une affirmation exacte.

L’argument plus large de l’entreprise concerne l’utilisabilité. Une écriture plus claire peut réduire le temps de révision, même lorsqu’un éditeur peut encore identifier des schémas stylistiques récurrents.

La recherche de Graphite ne réfute pas cette amélioration. Elle en fixe une limite. Opus 5.5 paraît plus humain dans l’ensemble, mais « plus humain » n’est pas synonyme d’indiscernable.

Opus et Astra laissent des empreintes linguistiques différentes

La concurrence importante n’oppose pas la prose humaine à un style d’IA fixe, mais des empreintes de modèles changeantes à des hypothèses de détection stables.

GPT-6 Astra ne s’est pas simplement révélé meilleur ou moins bon qu’Opus 5.5. Il a montré un ensemble différent d’habitudes.

Astra nuançait davantage les affirmations. « May provide » apparaissait 18 fois plus fréquemment dans Astra que dans Opus 5.5. « Not necessarily » apparaissait 17 fois plus fréquemment.

L’expression « does not establish » affichait une différence encore plus marquée, atteignant 275 fois le taux d’Opus 5.5. Ces schémas suggèrent qu’Astra protège souvent une affirmation par des limites explicites.

Opus 5.5 s’appuyait davantage sur les superlatifs. Comparé à Astra, il utilisait « the most popular » 45 fois plus souvent et « the most powerful » 24 fois plus souvent.

« Perhaps the most » apparaissait 29 fois plus fréquemment. Le cadre « one of the best _ about » atteignait 79 fois le taux d’Astra.

Ce contraste influence le ton. Astra peut sembler prudente ou rectificative. Opus peut paraître plus évaluative et plus assurée, en particulier lorsqu’elle attribue de l’importance.

Le PDG de Graphite, Ethan Smith, a décrit cette tendance comme une différence plutôt qu’un progrès régulier. Chaque nouveau modèle peut s’améliorer sur une dimension tout en développant un autre rythme reconnaissable.

La couverture médiatique citée dans le secteur est parvenue à la même conclusion. Une comparaison de modèles a relevé que l’étude évaluait dix modèles sur les mêmes 9 974 sujets.

La distribution des mots d’Opus 5.5 s’est rapprochée de celle des humains. Astra s’en est éloignée, passant de 0,101 pour GPT-5.6 Sol à 0,109.

Pourtant, Astra a produit une prose moins affectée qu’Opus. Cela empêche tout classement simpliste fondé sur un seul score.

Un utilisateur peut préférer la franchise d’Astra tout en désapprouvant ses précautions excessives. Un autre peut préférer la fluidité d’Opus tout en supprimant les superlatifs inutiles à l’édition.

Les résultats compliquent également l’attribution à un modèle. Un passage peut contenir des traits associés à plusieurs systèmes, car les utilisateurs combinent des outils dans un même flux de travail.

Un modèle peut effectuer la recherche, un autre rédiger, et un troisième réviser. Une personne peut ensuite retoucher le résultat avant publication.

Les prompts ajoutent une autre couche. Interdire explicitement une expression peut modifier sa fréquence. Demander un langage scientifique prudent peut faire ressembler Opus à Astra sur une dimension.

Les systèmes affinés et les instructions au niveau de l’application créent d’autres variations. Le résultat visible par un utilisateur peut refléter le modèle du fournisseur, le prompt système de l’application et la demande de l’utilisateur.

C’est pourquoi l’expression « style IA » est devenue trop large. Les modèles de pointe ne partagent plus une voix unique et stable, même lorsqu’ils répètent certaines structures familières.

La pression concurrentielle pèse autant sur les laboratoires de modèles que sur les fournisseurs de détection de l’IA. Les laboratoires veulent une prose qui s’adapte à l’intention de l’utilisateur. Les fournisseurs de détection ont besoin de systèmes capables de résister à l’évolution rapide des modèles.

Les éditeurs font face à une autre pression. Ils doivent distinguer les répétitions stylistiques inoffensives des défauts qui nuisent à l’exactitude, à la clarté ou à la confiance.

Une phrase qui affirme « c’est important » peut être lassante, mais elle n’est pas automatiquement fausse. Une phrase élégante reposant sur une source inventée est bien plus grave.

La leçon utile n’est pas de chercher un nouvel indice unique. Il s’agit de reconnaître que la prose générée porte des signatures statistiques changeantes, dont aucune ne doit se substituer au jugement éditorial.

L’étude ne peut pas identifier l’auteur d’un passage isolé

Graphite a mesuré des différences à l’échelle des corpus, et non réalisé un test médico-légal pour des documents ou auteurs individuels.

L’ampleur de l’étude rend ses conclusions agrégées convaincantes. Sa conception impose également des limites à l’usage qui devrait être fait de ces résultats.

Premièrement, l’expérience s’est concentrée sur la génération d’articles à partir de résumés. Elle ne décrit pas automatiquement les e-mails, la fiction, l’analyse juridique, les dissertations scolaires ou les conversations informelles.

Des tâches différentes modifient le langage d’un modèle. Un rapport technique peut naturellement contenir davantage de réserves. Un texte marketing peut naturellement comporter davantage de superlatifs.

Deuxièmement, les articles de contrôle humains étaient antérieurs à ChatGPT. Cela protège la référence d’une contamination évidente, mais introduit une différence temporelle.

Les conventions éditoriales évoluent. L’optimisation pour les moteurs de recherche évolue. Les éditeurs modifient les structures des titres, la longueur des paragraphes et la ponctuation privilégiée.

Certaines différences attribuées aux modèles peuvent en partie refléter l’environnement d’écriture contemporain. La conception de Graphite fondée sur des sujets appariés réduit le biais de contenu, mais ne peut effacer toutes les différences historiques.

Troisièmement, les ratios de fréquence peuvent exagérer des comportements rares. Si les humains n’utilisent presque jamais une expression, un nombre modeste d’utilisations par les modèles peut produire un multiple frappant.

Les chercheurs ont appliqué des exigences de fréquence minimale pour répondre à ce problème. Les mots devaient apparaître dans au moins 500 articles générés par des modèles pour une vue classée, tandis que d’autres analyses utilisaient leurs propres seuils.

Même avec ces filtres, un ratio doit être accompagné de son taux de base. « C’est important » à 116 fois le taux humain semble décisif, mais cela n’indique pas combien de fois l’expression apparaissait par article.

Quatrièmement, les résultats reflètent des versions spécifiques de modèles et des paramètres expérimentaux précis. Les mises à jour des fournisseurs, les paramètres d’inférence, les prompts système et les instructions des utilisateurs peuvent tous modifier le résultat.

Cinquièmement, l’étude provenait de Graphite, une entreprise de marketing et de croissance plutôt que d’un laboratoire universitaire indépendant. Ses chercheurs ont publié les données sous-jacentes sur les indices ainsi que les articles bruts, ce qui facilite l’examen externe.

Une réplication indépendante reste précieuse. Les chercheurs devraient tester d’autres genres, langues, conceptions de prompts et références humaines. Ils devraient également indiquer les fréquences absolues à côté des ratios relatifs.

Le premier test d’Arize offre une comparaison utile. Il a confirmé la forte réduction des tirets cadratins tout en constatant que des habitudes stylistiques plus larges subsistaient.

Toutefois, ses 20 briefs ne peuvent valider tous les résultats issus de près de 10 000 sujets alignés. Les deux projets ont utilisé des conceptions différentes et répondu à des questions différentes.

Les reportages externes les plus solides ont maintenu ces limites visibles. La couverture originale des indices d’écriture a décrit les habitudes du modèle sans prétendre qu’une expression quelconque prouve une paternité IA.

Les lecteurs devraient faire preuve de la même retenue. Une expression suspecte peut susciter une question. Elle ne peut pas y répondre à elle seule.

Pour les éditeurs, un examen plus fiable consiste à vérifier que les affirmations ont des sources, que les citations correspondent aux originaux et que les conclusions découlent des preuves. Il consiste aussi à déterminer qui assume la responsabilité du texte final.

Pour les établissements scolaires, les règles sur la paternité des travaux devraient définir l’assistance acceptable avant que des différends ne surviennent. L’historique des brouillons, les citations et un suivi oral fournissent des preuves plus solides que la ponctuation ou le seul vocabulaire.

Pour les entreprises, les règles de divulgation devraient correspondre au risque. Un résumé interne courant ne nécessite pas les mêmes contrôles que des conseils médicaux, une analyse financière ou des informations destinées au public.

L’étude révèle des tendances, pas une culpabilité. La traiter comme un détecteur transformerait une recherche descriptive rigoureuse en outil de contrôle peu fiable.

Trois signaux diront si les nouveaux indices perdurent

Le prochain test consiste à savoir si l’empreinte actuelle d’Opus 5.5 résiste à la réplication, aux prompts des utilisateurs et à la prochaine mise à jour du modèle.

Le premier signal sera une reproduction indépendante des résultats de Graphite. Les chercheurs doivent générer des corpus comparables avec des prompts, des genres et des échantillons humains différents.

Si « dependable », « this matters » et les cadres de contraste restent surreprésentés, l’hypothèse d’une signature persistante d’Opus 5.5 se renforce. S’ils disparaissent avec de légers changements de prompt, ce sont de faibles signaux d’attribution.

Le deuxième signal est la vitesse à laquelle Anthropic modifie le langage du modèle. L’entreprise a clairement réagi aux critiques visant le style de communication d’Opus 5.

Une mise à jour ultérieure pourrait réduire les indices actuels aussi fortement qu’Opus 5.5 a réduit les tirets cadratins. Cela confirmerait que les traits stylistiques visibles sont des comportements de produit ajustables.

Le troisième signal est de savoir si les fournisseurs de détection publient des évaluations propres à chaque version. Un détecteur devrait être testé sur les modèles actuels, les flux de travail mêlant humains et IA, ainsi que les résultats révisés.

Les affirmations de précision doivent aussi inclure les taux de faux positifs dans différentes communautés d’écriture. Les personnes dont l’anglais n’est pas la langue maternelle, les spécialistes techniques et les personnes au style formel ne devraient pas devenir des victimes collatérales.

L’avenir le plus utile pourrait reposer sur la provenance plutôt que sur des conjectures linguistiques. Des registres de génération signés, des brouillons conservés et une divulgation claire pourraient établir le processus sans prétendre que la prose seule révèle son origine.

Pour les rédacteurs, l’action immédiate est simple. Recherchez dans les brouillons les mots évaluatifs répétés, les contrastes convenus, les superlatifs inutiles et les phrases qui annoncent l’importance au lieu de la démontrer.

Vérifiez ensuite chaque affirmation factuelle. Supprimez les certitudes non étayées. Conservez une ponctuation inhabituelle lorsqu’elle sert la phrase, plutôt que de la supprimer pour éviter les soupçons.

Les indices d’écriture de Claude Opus 5.5 fournissent une précieuse liste de contrôle éditoriale, mais ils ne constituent pas un verdict. Les éditeurs utiliseront-ils ces résultats pour améliorer leurs contrôles, ou transformeront-ils une autre tendance temporaire en raccourci peu fiable ?

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page