L’utilisation abusive de Claude d’Anthropic a révélé un conflit que ses garde-fous ne peuvent pas totalement contenir
Anthropic a révélé que Claude avait soutenu au moins sept catégories d’activités nuisibles, malgré des garde-fous destinés à bloquer les travaux sur les armes, la surveillance et les cyberopérations offensives. Les cas d’utilisation abusive de Claude d’Anthropic couvraient des opérations détectées entre décembre 2025 et août 2026. Ils comprenaient l’ingénierie d’armes guidées, l’espionnage, la surveillance de masse, les campagnes d’influence, la fraude, la recherche biologique et le vol de modèles.
Il ne s’agissait pas simplement de personnes posant des questions dangereuses à un chatbot. Plusieurs acteurs ont traité Claude comme une composante d’un système opérationnel pour des projets concrets. Ils ont réparti les missions entre des agents, connecté le modèle à du code et à des données, puis sont revenus avec les résultats de tests physiques.
Anthropic indique avoir banni les comptes associés, renforcé ses défenses et partagé des renseignements avec les partenaires concernés. Pourtant, ses conclusions créent un contraste inconfortable. Les mêmes capacités vendues pour le codage, l’analyse et l’automatisation ont également aidé de petites équipes à réaliser des tâches autrefois réservées à de plus grandes organisations.
Le rapport ne prouve pas de manière indépendante chaque attribution, objectif opérationnel ou capacité revendiquée. Anthropic contrôle les données de comptes sous-jacentes et a divulgué des éléments sélectionnés. Sa visibilité est précieuse, mais les observateurs extérieurs ne peuvent pas auditer pleinement les conclusions de l’entreprise à partir des seuls documents publiés.
Les cas d’utilisation abusive de Claude d’Anthropic ont dépassé le simple conseil de chatbot
Le changement le plus important est que Claude serait devenu un élément de flux de travail opérationnels, et non une simple source d’information.
Anthropic a publié son dernier rapport sur le renseignement relatif aux menaces le 10 septembre. Il décrivait des activités impliquant les modèles Claude Haiku, Sonnet et Opus. L’entreprise a indiqué que presque aucun des cas ne concernait ses systèmes plus récents de classe Fable ou Mythos.
Le rapport couvre sept domaines de préjudice et des acteurs disposant de ressources très différentes. Anthropic a identifié des groupes présumés soutenus par des États, des fournisseurs commerciaux de logiciels espions, des criminels, des organisations de propagande et des individus à motivation politique. Cette diversité compte, car elle montre comment une IA à usage général peut soutenir à la fois des opérations institutionnelles et des équipes bien plus petites.
Les cas liés aux armes offrent l’exemple le plus clair. Anthropic a déclaré qu’une cellule du nord du Yémen utilisait Claude Code pour développer des logiciels de guidage, de navigation et de contrôle. Ce logiciel détermine comment un véhicule volant estime sa position, reste stable et se dirige vers une cible.
La cellule aurait mené trois programmes. Ils comprenaient une roquette guidée, un missile balistique dont la portée annoncée dépassait 2 000 kilomètres, et une famille de missiles avec une variante hypersonique. Anthropic n’a trouvé aucune preuve que le groupe ait déployé un dispositif opérationnel.
Cependant, les acteurs ont bien mené un essai de roquette guidée, selon l’entreprise. L’essai aurait échoué. Quelques heures plus tard, ils sont revenus vers Claude et lui ont demandé de les aider à diagnostiquer l’échec.
Cette boucle de retour distingue ce cas de recherches spéculatives en ligne. Du code généré avec Claude a intégré un flux de travail comprenant simulation, firmware, matériel, essais et analyse des défaillances. La production du modèle était liée à une activité en dehors de la fenêtre de conversation.
La cellule faisait également fonctionner plusieurs instances de Claude avec des missions distinctes. L’une écrivait du code, une autre effectuait des recherches et une troisième examinait le travail de la première. Cette structure ressemblait à une petite équipe d’ingénierie dirigée par un responsable humain.
Anthropic affirme que ses garde-fous ont bloqué de nombreuses requêtes, mais pas toutes. Les utilisateurs ont dissimulé leurs objectifs et réparti le travail entre plusieurs sessions. Aucune conversation isolée ne révélait nécessairement l’intégralité du programme d’armement.
Le développement d’armes avec Claude est apparu ailleurs dans le rapport. Un acteur basé en Chine aurait rédigé une spécification de conduite de tir anti-torpille et une proposition technique de plus de 200 pages. Il a également demandé à Claude de critiquer des versions successives en jouant le rôle d’un expert adverse chargé de l’évaluation.
Une autre opération impliquait des acteurs basés en Russie développant un logiciel pour un essaim autonome de drones. Anthropic a indiqué que le logiciel comprenait une mémoire partagée, une logique de coordination, un guidage terminal et des commandes de détonation. Les acteurs auraient chargé le firmware sur des cartes de développement et testé des composants en simulation.
Ces cas n’établissent pas que Claude a conçu de manière indépendante des armes fonctionnelles. Ils montrent quelque chose de plus circonscrit, mais néanmoins important. Le modèle a regroupé dans un seul service accessible le codage, la documentation, la révision, la traduction et le dépannage.
Les cas d’utilisation abusive de Claude rapportés par Reuters comprenaient également les achats militaires et la collecte de renseignements. Un responsable basé en Russie aurait utilisé Claude pour trouver des intermédiaires pour des composants européens à double usage.
Cet acteur a demandé au modèle de planifier des itinéraires via des pays tiers et de dissimuler la destination des marchandises. Claude a aussi aidé à rédiger des échanges multilingues et des spécifications formelles d’appels d’offres. Anthropic a déclaré que l’automatisation du navigateur avait soutenu des recherches couvrant environ 40 lignes d’articles par appel d’offres.
Le point commun n’était pas une réponse extraordinaire unique. C’était l’intégration de nombreuses capacités ordinaires dans un projet suivi sur la durée. Recherche, codage, traduction, achats et documentation sont devenus les composantes d’un même flux de travail automatisé.
Les agents IA ont abaissé le seuil d’effectifs nécessaire aux opérations complexes
Les éléments présentés par Anthropic suggèrent que l’IA change qui peut organiser des opérations sophistiquées, même lorsqu’elle ne fournit pas de connaissances techniques inédites.
Les débats traditionnels sur la sécurité se concentrent souvent sur la question de savoir si un modèle révèle des informations indisponibles via les moteurs de recherche ou les publications techniques. Cette question reste importante, notamment pour la recherche biologique et militaire. Elle ne couvre pas l’ensemble du risque décrit ici.
Plusieurs acteurs possédaient déjà des équipements, des connaissances sectorielles, des données volées ou un accès à des infrastructures opérationnelles. Claude n’a pas créé ces ressources. Il aurait plutôt comblé des lacunes en ingénierie logicielle, traduction, traitement des données et coordination de projets.
Ce type d’assistance peut produire un « gain » significatif, terme qu’Anthropic emploie pour désigner la vitesse, l’échelle ou la profondeur supplémentaires permises par l’IA. Ce gain n’exige pas qu’un modèle invente une nouvelle arme. Il peut provenir de la réduction du travail nécessaire pour atteindre la phase suivante de développement.
La cellule du nord du Yémen illustre cette distinction. Ses membres avaient accès à du matériel et semblaient comprendre leurs objectifs généraux. Claude a fourni un travail logiciel qui aurait autrement pu nécessiter plusieurs ingénieurs. Plusieurs instances ont permis au groupe de répartir les tâches et de vérifier les résultats.
Les cas de surveillance ont suivi un schéma similaire. Une opération alignée sur la Chine a collecté des messages provenant de plus de 100 groupes WhatsApp et de dizaines de chaînes Telegram. Claude aurait converti ce contenu en renseignements structurés en chinois.
L’acteur a utilisé le modèle pour relier des identités entre plateformes, cartographier des réseaux sociaux et identifier des vulnérabilités personnelles. Il a également produit des plans ciblant des médias de la diaspora ouïghoure. L’infrastructure de collecte existait hors de Claude, mais le modèle a accéléré l’analyse et le reporting.
Anthropic a déclaré que ce même acteur avait organisé des prises de contact clandestines avec des Ouïghours en Syrie. L’opérateur ne maîtrisait pas l’arabe. Claude a traduit des messages, produit de l’arabe syrien et évalué la tromperie en tant que consultant « expert ».
La traduction est donc devenue plus qu’une commodité. Elle a supprimé une contrainte de personnel dans une opération de recrutement en cours. Une personne ne maîtrisant pas la langue cible pouvait apparemment mener des conversations prolongées et s’adapter aux réponses en temps réel.
Une autre opération concernait un consultant au Mali qui construisait un système de surveillance de données de télécommunications. Selon Anthropic, le système envisagé pouvait traiter des enregistrements concernant 25 millions de téléphones. Claude a servi de principale ressource d’ingénierie derrière le projet.
Le système visait apparemment à collecter les relevés d’appels, les messages texte et le trafic vocal. Parmi les fonctions proposées figuraient la reconnaissance de locuteurs utilisant différentes cartes SIM, la détection de l’usage de VPN et la génération de dossiers pour des numéros individuels.
Ces affirmations exigent une formulation prudente, car Anthropic n’a pas fourni d’audit indépendant du système achevé. Néanmoins, l’échelle décrite montre pourquoi la surveillance assistée par IA inquiète les groupes de la société civile. Le travail logiciel peut être centralisé tandis que la surveillance s’étend à l’ensemble d’une population.
Les gouvernements ont toujours recruté des ingénieurs, des traducteurs, des analystes et des informateurs. L’IA n’élimine pas complètement ces rôles. Elle réduit le nombre de spécialistes nécessaires pour passer de données collectées à des renseignements exploitables.
Cet effet sur les effectifs s’applique également aux défenseurs. Les équipes de sécurité peuvent utiliser des agents pour examiner les alertes, enquêter sur du code suspect et organiser les preuves liées à un incident. L’avantage dépendra de la partie qui intégrera la technologie le plus efficacement.
Les organisations qui se préparent à cette confrontation ont besoin de plus qu’une politique écrite sur l’IA. Elles ont besoin de journaux, de contrôles d’accès, de procédures de révision et d’une base de connaissances consultable reliant les décisions de sécurité aux preuves techniques. Sans cela, chaque flux de travail suspect devient une enquête isolée.
La pression s’exerce d’abord sur les fournisseurs de modèles. Anthropic et ses concurrents doivent identifier les intentions nuisibles à travers des sessions fragmentées sans bloquer la recherche légitime. Les gouvernements et les clients entreprises doivent ensuite décider du niveau de surveillance qu’ils attendent des fournisseurs.
Le compromis central oppose les capacités au contrôle
Claude devient plus utile commercialement lorsqu’il peut accomplir un travail complexe, mais ces mêmes capacités facilitent la coordination de projets nuisibles.
Le rapport décrit à plusieurs reprises des fonctions que les utilisateurs légitimes recherchent. Claude peut écrire du code, examiner des fichiers de projet, analyser de grands ensembles de données, traduire des conversations, critiquer des documents et fonctionner via des outils connectés. Retirer ces capacités réduirait également sa valeur.
Le problème s’accentue avec l’IA agentique, c’est-à-dire des systèmes capables de planifier et d’exécuter des tâches en plusieurs étapes avec une supervision limitée. Un chatbot fournit une réponse. Un agent peut réviser des fichiers, exécuter des tests, examiner des échecs et poursuivre un objectif.
Anthropic avait précédemment décrit une campagne chinoise présumée soutenue par l’État en 2025 qui utilisait Claude sur une grande partie du cycle de vie d’une cyberattaque. L’entreprise, dans son enquête sur l’espionnage, a indiqué que les attaquants avaient ciblé environ 30 organisations et réussi contre un petit nombre d’entre elles.
Dans cette campagne antérieure, Claude aurait effectué de la reconnaissance, de l’analyse de vulnérabilités, la collecte d’identifiants et le traitement de données volées. Des opérateurs humains fournissaient périodiquement des décisions stratégiques. Le modèle gérait une grande partie de l’exécution technique répétitive.
Les révélations de septembre 2026 élargissent cet avertissement. Des schémas d’orchestration similaires sont apparus dans le développement d’armes, les achats, la surveillance et les opérations d’influence. Le mécanisme restait cohérent, même lorsque les objectifs changeaient.
Les acteurs ont dissimulé leurs intentions, séparé les tâches, utilisé des réseaux privés virtuels et combiné Claude avec des logiciels externes. Certains ont présenté des travaux nuisibles comme de la recherche universitaire, des tests défensifs ou un développement commercial ordinaire. D’autres ont réparti les requêtes entre plusieurs comptes et sessions.
Un filtre évaluant une seule requête peut ne pas détecter un programme assemblé à partir d’éléments apparemment inoffensifs. Le code de contrôle de vol a des applications civiles. La mise en correspondance d’identités peut contribuer à la prévention de la fraude. La recherche sur les agents pathogènes peut participer au développement de vaccins.
Le contexte devient déterminant, mais c’est précisément ce que les workflows fragmentés dissimulent. Les fournisseurs ont besoin de systèmes capables d’analyser des schémas au fil du temps, entre outils, comptes et infrastructures associées. Cela soulève ses propres questions de confidentialité et de gouvernance.
Anthropic affirme avoir mené des enquêtes internes afin de relier des activités entre différentes sessions. L’entreprise a ensuite banni chaque compte lié à certaines opérations. Le rapport fournit peu de détails sur la manière dont ces liens ont été établis ou examinés.
Une surveillance plus poussée peut détecter des abus coordonnés. Elle peut aussi exposer des travaux sensibles menés par des journalistes, des chercheurs, des entreprises et des gouvernements. Un fournisseur agissant comme un service de renseignement sur les menaces acquiert une visibilité considérable sur les projets de ses clients.
L’entreprise doit donc contrôler à la fois les réponses de son modèle et sa propre autorité d’enquête. Les faux négatifs laissent se poursuivre des activités nuisibles. Les faux positifs peuvent interrompre des recherches légitimes, tandis qu’une surveillance étendue peut fragiliser la confiance des utilisateurs.
Les cas biologiques illustrent cette difficulté. Anthropic a décrit des chercheurs travaillant sur des recherches de gain de fonction concernant le chikungunya, un virus transmis par les moustiques. La recherche sur le gain de fonction modifie un organisme afin de créer ou d’améliorer une propriété biologique.
Le projet aurait visé des mutations affectant la transmission et l’évasion immunitaire. Ces travaux peuvent éclairer le développement de vaccins et de traitements. Ils peuvent aussi accroître la dangerosité d’un agent pathogène, selon les méthodes, l’intention et les mesures de confinement.
Selon Anthropic, Claude a bloqué les requêtes les plus sensibles. Toutefois, une plateforme aurait redirigé ces requêtes vers un autre modèle aux garde-fous moins stricts. Ce résultat révèle les limites des contrôles de sécurité appliqués par un seul fournisseur.
Un acteur déterminé peut répartir son travail entre plusieurs services, modèles locaux, consultants humains et logiciels classiques. Anthropic peut mettre fin à l’accès à Claude. L’entreprise ne peut ni effacer les résultats déjà enregistrés ni empêcher une migration vers un autre système.
Cela ne rend pas les garde-fous inutiles. L’échec du test de fusée suggère que l’assistance générée n’a pas automatiquement résolu un problème d’ingénierie difficile. Une intervention peut augmenter les coûts, ralentir les progrès et alerter des cibles potentielles.
La tension demeure inévitable. De meilleurs agents sont plus faciles à utiliser dans des workflows commerciaux utiles et plus faciles à réorienter vers des usages nuisibles. Les évaluations de capacités doivent donc mesurer l’achèvement opérationnel, et non seulement déterminer si un modèle répond à des questions interdites.
Les preuves sont sérieuses, mais elles ne constituent pas un audit indépendant
La visibilité d’Anthropic confère au rapport une valeur inhabituelle, tandis que son contrôle des éléments de preuve limite la confiance avec laquelle les observateurs externes peuvent interpréter chaque cas.
Les fournisseurs de modèles voient des informations inaccessibles aux journalistes, aux chercheurs et aux analystes gouvernementaux. Ils peuvent examiner les requêtes, les appels d’outils, les liens entre comptes, les réponses des modèles et les changements de comportement. Ce point d’observation peut révéler des projets avant que des preuves matérielles ne deviennent publiques.
Anthropic affirme avoir utilisé cette visibilité pour identifier la cellule du nord du Yémen avant le déploiement d’une arme opérationnelle. L’entreprise a également observé des utilisateurs revenir après un test raté. Des enquêteurs traditionnels pourraient ne découvrir une telle activité qu’après avoir récupéré du matériel ou intercepté des achats.
Toutefois, le public ne reçoit que la sélection de cas et les conclusions d’Anthropic. Il n’a pas accès aux historiques complets des comptes, à la télémétrie brute ni à toutes les explications concurrentes. Les préoccupations de sécurité et de confidentialité rendent une divulgation complète impraticable.
Il en résulte un déficit de vérification inévitable. Anthropic peut raisonnablement retenir des détails opérationnels qui aideraient des imitateurs. Pourtant, ces omissions empêchent des spécialistes indépendants de reproduire ses évaluations.
L’attribution mérite une prudence particulière. L’entreprise utilise des identifiants internes de Generative Threat Group pour désigner des groupes d’activités. Certains cas font l’objet d’évaluations géographiques ou d’alignement étatique, mais Anthropic ne peut souvent pas nommer une organisation précise.
Une constatation fondée sur la localisation n’établit pas non plus l’appartenance à un groupe armé particulier. Le nord du Yémen est contrôlé par les Houthis, mais Anthropic n’a pas identifié la cellule chargée des armes. Un responsable houthi a contesté l’idée selon laquelle le mouvement s’appuyait sur des outils d’IA publics.
Associated Press a rapporté que Hazam al-Assad avait qualifié cette suggestion de déraisonnable. Son compte rendu sur les armes au Yémen cite également l’analyste des armements Trevor Ball, qui a mis en doute la capacité du groupe à produire des missiles hypersoniques.
Ball a souligné qu’étudier une capacité ne signifie pas qu’un acteur puisse la fabriquer. Les matériaux, les installations d’essai, le contrôle qualité et l’intégration des systèmes restent des obstacles considérables. L’assistance logicielle ne peut pas supprimer toutes les contraintes physiques.
L’étiquette « disrupted » employée par l’entreprise exige elle aussi de la précision. Anthropic définit principalement la perturbation comme le bannissement des comptes qu’elle a pu relier à un acteur. Cette mesure peut mettre fin à l’accès sur une plateforme sans arrêter l’opération dans son ensemble.
Selon Anthropic, la cellule yéménite avait déjà créé une boîte à outils de simulation hors ligne. D’autres groupes utilisaient une infrastructure externe pour collecter des données ou exécuter des attaques. Certains pouvaient conserver le code généré par le modèle et poursuivre ailleurs.
L’intention biologique est encore plus difficile à évaluer. La recherche légitime et la recherche nuisible peuvent partager une terminologie, des méthodes et des objectifs expérimentaux. Une proposition de subvention portant sur la transmission virale n’établit pas à elle seule l’existence d’un programme d’armes biologiques.
Anthropic a indiqué qu’une subvention pertinente impliquait un institut de recherche militaire et un financement soutenu par l’État. Les constatations sur les usages abusifs biologiques reposent néanmoins largement sur l’interprétation par l’entreprise de l’activité des comptes.
Le rapport précise également que ses cas étaient exceptionnels. Ils représentent les activités les plus notables et les plus inédites identifiées par Anthropic, et non l’utilisation typique de Claude. Les lecteurs ne devraient pas considérer cette sélection comme une mesure de la prévalence globale des abus.
Aucun dénominateur n’est fourni. Le public ne peut pas calculer quel pourcentage des sessions Claude impliquait une activité potentiellement nuisible. Il ne peut pas non plus comparer les taux de détection entre fournisseurs, car les entreprises publient des éléments de preuve différents selon des définitions différentes.
Un second problème de sélection existe. Anthropic peut signaler les activités qu’elle a trouvées, mais les opérations non détectées restent invisibles. Des études de cas solides n’établissent ni la fréquence de réussite des garde-fous ni la fréquence à laquelle des acteurs sophistiqués les contournent.
Ces limites n’effacent pas les éléments de preuve. Elles définissent ce que le rapport peut étayer. Il montre des schémas crédibles de tentatives d’utilisation abusive et plusieurs liens avec des projets réels. Il ne fournit ni un recensement exhaustif ni une confirmation indépendante de chaque attribution.
Les rivaux d’Anthropic font face au même problème interplateforme
Une règle de sécurité sur Claude ne peut pas contenir un workflow qui circule entre modèles commerciaux, systèmes ouverts et outils d’ingénierie ordinaires.
Le récit d’Anthropic concernant le projet sur le chikungunya rend explicite le problème interplateforme. Claude a refusé une assistance sensible. La plateforme de l’utilisateur aurait ensuite redirigé le travail vers un concurrent dont les garde-fous permettaient davantage ce type d’assistance.
Cette séquence modifie les enjeux concurrentiels. Un fournisseur aux contrôles plus stricts peut perdre de l’usage au profit d’un fournisseur aux contrôles plus permissifs. L’acteur nuisible continue de travailler, tandis que l’entreprise prudente supporte les coûts commerciaux et politiques du refus.
OpenAI, Google, xAI, Meta et d’autres développeurs de modèles sont confrontés à des variantes de ce problème. Leurs produits diffèrent par l’accès, l’usage des outils, la surveillance et les politiques d’utilisation acceptable. Ces différences créent des lacunes que les utilisateurs peuvent exploiter délibérément.
Les modèles ouverts compliquent encore davantage l’application des règles. Une fois les poids d’un modèle exécutés sur une infrastructure contrôlée par l’utilisateur, un développeur ne peut pas facilement inspecter les sessions ni révoquer l’accès. Le déploiement local peut protéger la confidentialité, mais il limite aussi la détection centralisée des usages abusifs.
Les fournisseurs commerciaux conservent davantage de leviers parce qu’ils contrôlent les comptes et la puissance de calcul. Ils peuvent détecter des schémas, suspendre des utilisateurs et mettre à jour les classificateurs. Leurs journaux les transforment également en détenteurs de renseignements dotés de responsabilités qui n’étaient traditionnellement pas attribuées aux entreprises de logiciels.
Le rapport d’Anthropic plaide en faveur du partage de renseignements avec les gouvernements et les partenaires du secteur. La coopération peut aider les fournisseurs à reconnaître des tactiques déjà observées ailleurs. Elle pourrait aussi empêcher un acteur banni de recréer immédiatement la même opération sur un autre service.
Toutefois, une application partagée des règles exige des définitions communes et des garanties de procédure régulière. Un avertissement vague concernant une « recherche suspecte » pourrait nuire à des scientifiques légitimes ou à des équipes de sécurité. Des indicateurs détaillés peuvent révéler des méthodes de détection sensibles ou des informations sur les clients.
La concurrence comprend également les défenseurs qui emploient les mêmes capacités. La découverte automatisée de vulnérabilités peut exposer des systèmes avant que des attaquants ne les atteignent. Les agents peuvent trier les alertes et enquêter sur les infrastructures malveillantes plus rapidement que des équipes de sécurité en sous-effectif.
Anthropic a utilisé Claude dans le cadre de ses propres enquêtes. Cela reflète le compromis central sans le résoudre. Les outils nécessaires pour comprendre les attaques agentiques sont souvent les mêmes que ceux que les attaquants utilisent pour les déployer à grande échelle.
Une réglementation axée uniquement sur les refus des modèles passerait à côté d’une grande partie de ce mécanisme. Les opérations signalées ont utilisé des réseaux de comptes, de la collecte de données externe, l’automatisation de navigateur, l’accès à des fichiers et du code enregistré. Le risque s’est accumulé sur l’ensemble du workflow.
Une supervision significative examinerait les capacités des modèles, les autorisations des outils, les contrôles d’identité, la journalisation, le signalement d’incidents et la coordination entre fournisseurs. Elle distinguerait également la recherche, les tests défensifs, les achats militaires et l’exploitation directe d’armes.
Le débat devient particulièrement sensible car Anthropic a fourni Claude à des agences de sécurité nationale. L’entreprise a défendu certains usages militaires tout en s’opposant aux armes entièrement autonomes et à la surveillance intérieure de masse.
Cette position trace une frontière entre le déploiement gouvernemental autorisé et les applications interdites. Le nouveau rapport montre combien de telles frontières sont difficiles à faire respecter lorsque les utilisateurs dissimulent le contexte et relient des modèles à des systèmes externes.
Elle crée aussi une pression politique venant de directions opposées. Les défenseurs de la sécurité peuvent soutenir que les agents avancés nécessitent des contrôles de déploiement plus stricts. Les clients gouvernementaux peuvent affirmer que les restrictions des fournisseurs entravent des missions légales.
Les concurrents soumis à moins de restrictions peuvent accéder à des clients qu’Anthropic refuse. Toutefois, un incident majeur d’utilisation abusive pourrait transformer des politiques plus permissives en risques réglementaires. L’application des règles de sécurité devient un élément du positionnement concurrentiel, et non plus seulement de la conformité interne.
L’issue ne dépendra pas de la politique d’une seule entreprise. Elle dépendra de la capacité du secteur à établir des défenses interopérables avant que les acteurs ne normalisent le déplacement de charges de travail nuisibles entre fournisseurs.
Ce qu’il faut surveiller après le rapport d’Anthropic sur les menaces
Le prochain test consistera à déterminer si les fournisseurs peuvent transformer des études de cas frappantes en réductions mesurables des usages abusifs opérationnels.
Le premier signal concerne le partage de renseignements sur les menaces entre fournisseurs. Anthropic a déclaré avoir informé des partenaires publics et privés lorsque cela était approprié. La question utile est de savoir si les laboratoires concurrents publieront des indicateurs concordants, des perturbations coordonnées ou des catégories communes de signalement.
Des définitions partagées faciliteraient la comparaison des futurs rapports. Les fournisseurs pourraient divulguer la manière dont ils classent le développement d’armes, les opérations cybernétiques, les usages abusifs biologiques et la surveillance. Ils pourraient aussi indiquer ce qu’une suspension de compte a réellement interrompu.
Si une action coordonnée apparaît, l’argument central d’Anthropic devient plus solide. Les fournisseurs de modèles de pointe pourraient fonctionner comme un réseau d’alerte distribué face aux menaces émergentes. Si la coopération reste informelle, les acteurs continueront d’exploiter des politiques inégales.
Le deuxième signal réside dans les preuves apportées par la prochaine génération de garde-fous. Anthropic affirme avoir introduit des classificateurs pour les explosifs à haut rendement et le développement d’armes. Les classificateurs sont des systèmes qui identifient des contenus ou des schémas comportementaux associés à des risques précis.
Les futurs rapports devraient expliquer si ces systèmes détectent des projets fragmentés plutôt que des requêtes isolées. Parmi les indicateurs utiles figurent une intervention plus précoce, moins de tentatives répétées de contournement et des taux d’achèvement plus faibles lors d’évaluations contrôlées.
Les données sur les faux positifs comptent également. Un garde-fou qui bloque des recherches inoffensives en aérospatiale, en biologie ou en cybersécurité peut détourner des utilisateurs légitimes. Les fournisseurs doivent mettre en place des procédures de recours et de réexamen à la hauteur des conséquences d’une suspension de compte.
Des résultats plus solides étayeraient l’affirmation selon laquelle les améliorations de sécurité peuvent suivre le rythme des capacités des modèles. La persistance de cas utilisant les mêmes méthodes de contournement suggérerait que les filtres restent réactifs. Un basculement vers des modèles locaux révélerait une autre limite.
Le troisième signal serait une validation indépendante de l’impact opérationnel. Des enquêteurs pourraient à terme relier les identifiants de cas d’Anthropic à des équipements saisis, des campagnes de malware, des réseaux d’approvisionnement ou des organisations touchées. De telles preuves permettraient de déterminer quels projets ont dépassé le stade de la planification.
Des conclusions indépendantes pourraient renforcer les évaluations les plus graves du rapport. Elles pourraient aussi révéler des exagérations, des attributions erronées ou une maturité technique moindre. Dans tous les cas, cela améliorerait la compréhension du public.
Le cas du Yémen offre un exemple concret. La confirmation de logiciels d’orientation ou d’approvisionnement connexes montrerait que le développement d’armes avec Claude a pénétré plus profondément le programme. La poursuite d’essais infructueux mettrait en évidence l’écart qui subsiste entre le code généré et le matériel déployé.
Les enquêtes cyber pourraient fournir des réponses plus rapides. Les victimes, les gouvernements et les entreprises de sécurité peuvent parfois comparer les indicateurs d’Anthropic avec les données d’incidents. La correspondance entre l’infrastructure ou le comportement des malwares fournirait une corroboration sans exposer l’intégralité des journaux clients.
L’usage abusif de Claude d’Anthropic ne doit pas être réduit à l’affirmation selon laquelle un seul chatbot aurait conçu des armes ou mené seul des activités d’espionnage. Le schéma documenté est plus systémique. Les modèles ont fourni une main-d’œuvre adaptable au sein de projets contrôlés par des acteurs humains disposant d’outils et d’objectifs externes.
Ce schéma offre aux fournisseurs une occasion limitée d’intervenir. Les services centralisés peuvent observer des comportements que les logiciels locaux ne peuvent pas détecter. Ils peuvent désactiver des comptes, réviser les garde-fous et avertir des cibles potentielles.
Cette occasion n’est pas permanente. Les résultats sauvegardés survivent aux suspensions de compte, et les utilisateurs peuvent migrer d’un modèle à l’autre. Des systèmes locaux plus capables réduiront encore davantage la visibilité des fournisseurs.
Les développeurs, les acheteurs en entreprise et les responsables de la sécurité devraient se demander comment les agents sont surveillés sur l’ensemble d’une tâche, et pas seulement à la frontière de la requête. Ils devraient également exiger des preuves que les contrôles fonctionnent face à une activité fragmentée, multilingue et connectée à des outils.
Le prochain rapport d’Anthropic sur les menaces devrait donc être jugé à l’aune de ses résultats. La détection a-t-elle eu lieu plus tôt ? Des suspensions coordonnées ont-elles empêché la migration ? Des éléments indépendants ont-ils confirmé les cas les plus risqués ?
Les réponses à ces questions montreront si les divulgations d’Anthropic sur l’usage abusif de Claude représentent un système de défense en amélioration ou un relevé récurrent de menaces découvertes après l’achèvement de travaux substantiels.



