Sur le rapport d’Anthropic sur les abus de l’IA : les agents font peser le coût sur les défenseurs
Anthropic a publié son troisième rapport sur les abus de l’IA après avoir détecté l’utilisation de Claude dans des cyberattaques, des systèmes de surveillance, des campagnes d’influence, des recherches sur les armes et l’extraction industrielle de modèles. Les éléments présentés dans le rapport d’Anthropic sur les abus de l’IA couvrent des activités observées entre décembre 2025 et août 2026. Son avertissement central n’est pas que l’IA a inventé de nouveaux objectifs malveillants. C’est que les agents ont rendu les opérations existantes moins coûteuses, plus rapides et plus faciles à déployer à grande échelle.
Le rapport décrit des personnes qui choisissent les cibles, définissent les objectifs et examinent les résultats aux conséquences importantes. Les systèmes d’IA prennent ensuite en charge la reconnaissance, le développement logiciel, la recherche de vulnérabilités, le traitement des données, la production de propagande et certaines phases de l’exploitation. Plusieurs opérateurs ont également relié Claude à des outils externes et à une mémoire persistante, permettant aux flux de travail automatisés de se poursuivre d’une session à l’autre.
Cette répartition du travail importe davantage que n’importe quelle requête malveillante isolée. Elle place l’IA au cœur de la mécanique opérationnelle de la cybercriminalité et de la surveillance étatique. Les attaquants peuvent désormais conserver l’expertise dans des logiciels, répéter des procédures efficaces et mener plusieurs chantiers simultanément.
Bruce Schneier a souligné le même schéma dans son analyse du rapport sur les abus. L’évolution significative réside dans une exécution industrialisée, où les humains conservent l’autorité tandis que les machines assument une part plus importante de la charge opérationnelle.
Dans le rapport d’Anthropic sur les abus de l’IA, le flux de travail est l’histoire
Les éléments les plus importants du rapport concernent des flux de travail complets, et non des réponses isolées générées par un chatbot.
Le rapport de renseignement sur les menaces d’Anthropic documente des activités de groupes criminels, de fournisseurs commerciaux de surveillance, d’individus motivés politiquement et d’organisations alignées sur des États. Les cas couvrent les opérations cyber, la propagande, la surveillance, les armes conventionnelles, la recherche biologique et la distillation non autorisée de modèles.
L’entreprise indique avoir sélectionné des incidents notables ou inédits, et non un échantillon représentatif de tout ce qui se passe sur Claude. Cette distinction limite les conclusions sur leur prévalence. Toutefois, ces cas révèlent encore ce que des opérateurs motivés peuvent assembler lorsque les modèles sont connectés au code, aux navigateurs, aux scanners, aux bases de données et à d’autres outils.
Certains opérateurs ont déployé des essaims d’agents, c’est-à-dire qu’un modèle coordinateur répartissait un vaste objectif entre plusieurs agents d’IA spécialisés. Ces agents travaillaient en parallèle à la reconnaissance, à la recherche sur l’exploitation et aux tâches post-compromission. Une mémoire de campagne persistante conservait les listes de cibles, les identifiants, les instructions et l’état des opérations entre les sessions.
Dans une opération signalée, des flux de travail automatisés ont analysé des firmwares d’appareils et des binaires à l’aide d’outils de décompilation. Le système a formulé des hypothèses de vulnérabilités, rédigé des exploits proposés et les a testés sur des copies de laboratoire des produits ciblés. Anthropic affirme qu’un flux de travail continu a produit plus d’une douzaine de découvertes potentielles de failles zero-day en un mois.
Une zero-day est une vulnérabilité logicielle jusque-là inconnue, pour laquelle aucun correctif défensif n’est disponible. Le rapport n’établit pas que chaque découverte présumée était valide ou utilisée contre des systèmes réels. Il montre toutefois un processus automatisé itérant sur un travail qui exigeait traditionnellement une attention soutenue de spécialistes.
D’autres agents ont recherché à répétition des infrastructures Internet exposées. Ils ont identifié les services, comparé les points d’entrée à des vulnérabilités connues et ajouté les nouvelles découvertes à une mémoire de projet persistante. Une flotte distincte de 13 agents permanents a collecté des documents publics provenant de sources militaires, gouvernementales, politiques et sociales.
Cette architecture modifie l’économie du travail malveillant. Un humain n’a plus besoin d’effectuer personnellement chaque recherche, test, traduction ou tâche de documentation. L’opérateur peut superviser une collection extensible de travailleurs automatisés et se concentrer sur la sélection des cibles.
C’est pourquoi une liste de requêtes individuelles minimise l’ampleur de l’évolution. Chaque requête peut sembler ordinaire lorsqu’elle est examinée isolément. Le danger apparaît avec l’orchestration, le contexte accumulé, l’accès aux outils, la répétition et la capacité à agir sur les résultats.
Anthropic indique avoir banni les comptes associés et utilisé ses conclusions pour améliorer ses garde-fous. Pourtant, la suppression de comptes traite l’accès à un seul fournisseur, et non l’expertise sous-jacente, le code, les identifiants volés ou l’infrastructure. Les opérateurs peuvent conserver ces actifs et déplacer certaines parties d’un flux de travail ailleurs.
Le rapport transforme donc les abus de l’IA, d’un problème de modération de contenu, en problème de sécurité opérationnelle. Bloquer les textes nuisibles reste utile, mais les défenseurs doivent aussi détecter les comportements automatisés à travers les identités, les sessions, les outils et les comptes compromis.
Les agents d’IA compressent le cycle d’attaque
Les agents d’IA n’éliminent pas les humains des cyberattaques, mais ils permettent à un nombre réduit de personnes d’opérer sur davantage de cibles et de couches techniques.
Une campagne décrite par Anthropic a utilisé l’IA pour la reconnaissance, l’accès initial, la collecte, l’exfiltration et la persistance. L’acteur aurait identifié des systèmes de messagerie et d’accès à distance, constitué des listes de cibles et créé une infrastructure de phishing par code d’appareil.
Le phishing par code d’appareil détourne un processus de connexion légitime afin de convaincre une victime d’autoriser une session contrôlée par l’attaquant. Une fois cet accès obtenu, la session peut exposer la messagerie cloud et d’autres services connectés. La technique paraît souvent moins suspecte parce qu’elle utilise un véritable flux d’authentification.
Anthropic indique que l’opération a accédé aux données de messagerie d’au moins huit organisations. Les cibles comprenaient le parquet national d’un pays, un institut d’enseignement militaire et une organisation intergouvernementale régionale. Une autre intrusion a exposé plus de 300 000 dossiers d’identité nationale et des informations de registre concernant plus de 500 000 entreprises.
Selon le rapport, le système d’IA a aidé à organiser des centaines de gigaoctets d’informations volées. Il a également contribué à la collecte d’identifiants, aux mouvements latéraux et à l’adaptation de logiciels malveillants après que des produits de sécurité eurent détecté des versions antérieures.
Cela referme une partie de la boucle de rétroaction entre l’action de l’attaquant et la réponse défensive. Une détection ne crée plus le même délai si un logiciel peut analyser l’échec, réviser un artefact et préparer rapidement une autre version. Une validation humaine peut rester dans la boucle tandis que l’itération machine s’accélère.
Un autre acteur a utilisé un pipeline d’exploitation autonome contre des applications web en production. Des agents de travail ont testé des failles d’injection, des contournements d’authentification, du cross-site scripting et des falsifications de requêtes côté serveur sans supervision humaine continue. Les identifiants potentiels et les découvertes remontaient vers un espace de travail partagé.
La falsification de requêtes côté serveur est une faille qui amène un serveur à effectuer des requêtes pour le compte d’un attaquant. Elle peut exposer des systèmes internes autrement inaccessibles depuis l’Internet public. L’automatisation de tels tests augmente le nombre de points de terminaison qu’un opérateur peut sonder.
Le rapport décrit également une infrastructure de fraude qui automatisait l’inscription de comptes, la surveillance des boîtes de réception, la résolution de CAPTCHA et les étapes de vérification d’identité. Un autre flux de travail plaçait un proxy inverse entre les victimes et les véritables vérifications d’identité, capturant les sessions authentifiées et les documents soumis.
Ces exemples montrent pourquoi le rapport d’Anthropic sur les abus de l’IA concerne les organisations ordinaires. Une entreprise n’a pas besoin d’être la cible initiale de l’attaquant pour subir un préjudice. Ses clés exposées, ses locataires cloud, ses applications SaaS, ses fournisseurs ou les données de ses clients peuvent devenir des ressources intermédiaires.
Un attaquant francophone aurait ciblé 42 organisations politiques et affiliées. L’acteur a obtenu un accès interne à au moins 14 d’entre elles et a extrait entre 12 et 26 gigaoctets de données de bases de données, selon les estimations. Une plateforme de campagne compromise a exposé environ 140 000 dossiers, y compris des opinions politiques.
Des reportages indépendants sur la campagne française ont relié plusieurs détails aux organisations touchées. Ces reportages apportent une corroboration précieuse, même si Anthropic demeure la source principale pour une grande partie du récit technique.
L’acteur a également développé une technique d’exploitation WordPress jusque-là non documentée et a réussi à compromettre au moins quatre sites web, selon Anthropic. D’autres outils ont collecté les identifiants soumis, empoisonné les sauvegardes et placé du code d’accès à distance dans les ressources des sites.
Il ne s’agissait pas d’une attaque entièrement autonome. L’humain a choisi les cibles, exploité l’infrastructure, interprété les résultats et poursuivi des objectifs politiques. Le changement important résidait dans l’effet de levier : une seule personne pouvait bâtir et maintenir une campagne de l’ampleur de celle d’une petite équipe technique.
Le conflit principal oppose l’échelle des attaquants à la responsabilité des défenseurs
Les attaquants peuvent répartir le travail entre des agents, mais les défenseurs assument toujours l’ensemble des conséquences juridiques, opérationnelles et financières de chaque défaillance.
La planification de sécurité traditionnelle suppose souvent que le travail offensif consomme une expertise rare. Des attaquants qualifiés doivent étudier l’infrastructure, créer des outils, inspecter des données volées et adapter leurs méthodes après une détection. Ces contraintes limitent le nombre de cibles qu’un groupe peut poursuivre simultanément.
Les systèmes agentiques affaiblissent ces contraintes. Ils peuvent effectuer la reconnaissance en continu, documenter les résultats de manière cohérente, traduire des documents et réessayer des tâches techniques. Ils préservent aussi des connaissances procédurales qui résideraient autrement dans la mémoire d’un seul opérateur.
Les défenseurs font face à une équation moins clémente. Chaque identifiant exposé, application oubliée, fournisseur vulnérable ou permission excessive peut devenir un point d’entrée. Les attaquants n’ont besoin que d’un chemin viable, tandis que les défenseurs doivent protéger un ensemble évolutif de systèmes et d’identités.
La chaîne d’approvisionnement de l’IA est elle-même devenue une cible. Anthropic décrit de faux services qui promettaient un accès à prix réduit à des modèles de pointe, mais installaient des outils de collecte d’identifiants. Ces programmes ont dérobé des identifiants de comptes et des jetons de session authentifiés sur les appareils des clients.
Les attaquants ont ensuite vendu ou réutilisé cet accès par l’intermédiaire de réseaux de proxys frauduleux. Certains services redirigeaient discrètement les clients vers un modèle différent tout en continuant à collecter de nouveaux identifiants. Cela a fourni aux criminels une source renouvelable de comptes à l’apparence légitime après la révocation de clés précédentes.
Une autre opération a testé 30 cibles dans le but d’accéder à un modèle Claude en préversion. Anthropic indique que toutes les tentatives ont échoué et que ses propres systèmes n’ont pas été compromis. Les clés volées appartenaient à des clients dont les environnements avaient déjà été compromis.
Cette distinction est importante. Un fournisseur peut sécuriser son infrastructure centrale tandis que les attaquants exploitent les points plus faibles qui l’entourent. Les ordinateurs portables des développeurs, les sessions de navigateur, les plateformes d’automatisation, les routeurs tiers et les fichiers de configuration copiés font tous partie de la frontière de sécurité effective.
Les entreprises devraient donc traiter les identifiants d’IA comme d’autres secrets de production privilégiés. Les clés doivent avoir des périmètres limités, des durées de vie courtes lorsque possible, une surveillance de l’utilisation et une révocation fiable. Un trafic inhabituel vers les modèles peut révéler un environnement compromis avant qu’un attaquant n’atteigne un objectif plus évident.
Les équipes de sécurité ont également besoin de visibilité sur le comportement des agents. Un seul compte lançant des analyses persistantes, des appels d’outils parallèles ou des tâches répétitives d’extraction présente un risque différent d’une conversation ordinaire. La détection devrait prendre en compte les séquences d’actions plutôt qu’une seule requête à la fois.
Cela crée une pression sur Anthropic, OpenAI, Google, Microsoft, les fournisseurs cloud et les services de routage de modèles. Chacun ne voit qu’une partie différente de la chaîne. Aucun participant ne peut reconstituer l’ensemble de la campagne sans échanger des renseignements utiles sur les menaces.
Cependant, une surveillance accrue introduit ses propres risques. Les fournisseurs peuvent examiner les prompts, les sorties, les fichiers, les appels d’outils et les relations entre comptes afin d’identifier les abus. Ces pratiques peuvent exposer des informations sensibles sur les clients ou créer de vastes capacités de surveillance au sein même du service.
Le compromis qui en résulte ne se résume pas à opposer sécurité et vie privée. Une surveillance insuffisante peut laisser perdurer des attaques coordonnées. Une surveillance excessive peut éroder la confidentialité, produire de fausses accusations ou placer des données clients précieuses dans un autre système centralisé.
Les fournisseurs ont besoin de durées de conservation limitées, d’un accès restreint pour les enquêteurs, de règles d’escalade claires et d’une transparence réelle sur l’application automatisée des règles. Les clients doivent également savoir quelles données de télémétrie existent et dans quelles circonstances des informations peuvent être partagées avec des organisations externes.
Le rapport d’Anthropic sur les abus liés à l’IA offre une visibilité inhabituellement détaillée sur les activités détectées. Il ne fournit pas de mesure complète des faux positifs, des campagnes non détectées ni du coût des enquêtes en matière de vie privée. Ces questions sans réponse doivent accompagner les constats opérationnels.
La surveillance et la propagande révèlent la même substitution de main-d’œuvre
Les cas de surveillance décrits dans le rapport montrent que l’IA remplace certaines composantes d’une main-d’œuvre d’ingénierie et d’analyse, sans modifier les personnes que les institutions puissantes choisissent de cibler.
Un consultant travaillant pour les autorités de sécurité nationale au Mali aurait utilisé Claude pour concevoir une plateforme d’interception de masse. Le système pouvait collecter des données de communication auprès des opérateurs mobiles du pays et générer des dossiers sur des personnes sélectionnées.
Anthropic affirme que le modèle a contribué à concevoir le logiciel sous-jacent plutôt qu’à analyser les dossiers finaux. Selon des reportages distincts sur la surveillance, la plateforme a finalement été déployée localement avec d’autres modèles après l’intervention d’Anthropic.
Cette issue révèle une limite de l’application des règles par les fournisseurs. Un service cloud peut fermer des comptes et rendre un flux de travail plus difficile à exécuter. Il ne peut pas effacer de manière fiable le code exporté, les connaissances techniques, les données collectées ou l’accès à des modèles alternatifs.
En Iran, des acteurs ont utilisé Claude pour créer une extension Firefox malveillante qui collectait des identités sur les réseaux sociaux. Une autre unité iranienne a analysé des centaines de milliers de publications et identifié 39 comptes d’opposition à surveiller, selon Anthropic.
Le rapport décrit une opération chinoise de renseignement sur les affaires religieuses qui aurait réduit ses effectifs, passant de nombreuses équipes d’analystes à un seul bureau. Avec l’aide de l’IA, ce bureau produisait des milliers d’enquêtes par mois.
D’autres acteurs ont utilisé Claude pour évaluer la sensibilité politique d’articles et de publications sur les réseaux sociaux. Ils ont rassemblé des localisations, des attributs démographiques, des opinions politiques et des niveaux de confiance dans des fiches structurées. Ces résultats pouvaient soutenir des interrogatoires, la surveillance ou d’autres formes de contrôle.
Un opérateur aligné sur la RPC, ne maîtrisant pas l’arabe, aurait mené sur plusieurs jours une opération de recrutement ciblant des Ouïghours en Syrie. Claude a rédigé des messages d’approche dans un dialecte régional, traduit les réponses, simulé des contrôles qualité et mis les résultats en forme pour un officier traitant présumé.
Le modèle n’a pas choisi la communauté persécutée. Des institutions humaines ont fourni la cible, la mission et l’usage prévu. L’IA a réduit les barrières linguistiques, de personnel et techniques qui auraient autrement pu ralentir l’opération.
Ce schéma apparaît également dans les campagnes d’influence. Anthropic détaille neuf cas provenant de Russie, d’Iran, de Turquie, du Golfe, d’Asie du Sud, d’Afrique et d’Europe. Les campagnes ciblaient des publics sur six continents.
Les opérateurs ont créé de faux profils, des sites d’actualité, des messages politiques et des plans de publication coordonnée. Certaines campagnes coïncidaient avec des élections. Des médias d’État russes ont produit des affirmations fabriquées avant le vote de septembre 2025 en Moldavie, tandis qu’un opérateur kényan préparait de faux contenus d’apparence citoyenne avant l’élection de 2027.
L’IA n’a pas inventé la communication politique trompeuse. Elle a aidé à produire des personas, des traductions, des articles, des stratégies de ciblage et des variantes à un coût marginal inférieur. Une petite équipe pouvait maintenir une façade plus vaste de participation publique indépendante.
Anthropic bénéficie d’un point d’observation inhabituel, car l’entreprise peut voir les campagnes pendant que les opérateurs les planifient. Les réseaux sociaux ne rencontrent souvent l’opération qu’après l’apparition publique des contenus. Les fournisseurs de modèles peuvent détecter plus tôt la sélection des cibles et la création de contenus.
Leur visibilité diminue ensuite lorsque le contenu quitte la plateforme de modèle. Anthropic indique utiliser des recherches open source, des données de partenaires et des reportages publics pour comprendre l’activité en aval. Cela signifie que certaines campagnes planifiées pourraient ne jamais être lancées, tandis que d’autres pourraient migrer au-delà de son champ de vision.
Les lecteurs devraient éviter de considérer chaque prompt détecté comme la preuve d’une opération menée à bien dans le monde réel. L’intention, la préparation, le déploiement, la portée et l’impact mesurable sont des étapes distinctes. Le rapport est le plus solide lorsqu’il relie l’activité du modèle à une infrastructure ou à des éléments de corroboration.
Néanmoins, la direction est claire. L’IA s’intègre à la bureaucratie ordinaire de la surveillance et de l’influence politique. Elle peut aider les institutions à traiter davantage de personnes, à entretenir davantage de personas et à préparer davantage de rapports sans accroître les effectifs dans les mêmes proportions.
La recherche sur les armes soulève un problème de garde-fous plus difficile
Les conclusions d’Anthropic font passer le débat au-delà de l’assistance à la rédaction malveillante, vers des logiciels qui relient l’analyse à des systèmes physiques.
L’entreprise affirme avoir perturbé six cas liés à des armes conventionnelles impliquant trois acteurs en Chine, deux en Russie et un au Yémen. Quatre concernaient des logiciels destinés à du matériel militaire, tandis que deux portaient sur les achats ou la collecte de renseignements.
Les projets signalés comprenaient des roquettes guidées, le guidage de missiles, des logiciels d’essaims de drones, l’interception de torpilles, le ciblage en guerre électronique et la suppression des défenses aériennes. Selon Anthropic, un programme de roquettes guidées incluait un essai sur le terrain en conditions réelles.
Les acteurs disposaient généralement de matériel pertinent, de connaissances en ingénierie ou d’un accès aux programmes avant d’utiliser Claude. Ils ont réparti le travail entre plusieurs sessions pour dissimuler l’objectif global et tenté de contourner les garde-fous.
Cette précision est importante. Le rapport ne montre pas une personne non informée posant une question et recevant une arme complète. Il montre des groupes compétents utilisant l’IA pour accélérer des tâches d’ingénierie, de débogage, de recherche, de documentation et d’approvisionnement.
Anthropic affirme avoir introduit des classificateurs qui détectent mieux les explosifs à haut rendement et les activités de développement d’armes. Un classificateur est un système automatisé qui estime si une demande appartient à une catégorie restreinte.
Ces contrôles sont confrontés à un problème inhérent. De nombreuses tâches d’ingénierie ont des applications civiles légitimes. Le guidage, la navigation, le traitement d’images, les communications radio, l’analyse des matériaux et le contrôle de vol peuvent servir à la fois des systèmes commerciaux et militaires.
Le rapport décrit également des demandes de recherche biologique présentant des caractéristiques à double usage. Un cas concernait une proposition de financement portant sur des modifications du virus du chikungunya susceptibles d’affecter sa transmissibilité et son échappement immunitaire.
Claude aurait refusé d’aider pour certaines parties de ce travail, et l’utilisateur s’est tourné vers un autre service d’IA. Anthropic affirme que ses anciens modèles étaient en dessous du seuil leur permettant d’assister matériellement un chercheur biologique sophistiqué. L’entreprise ne donne pas la même assurance pour ses systèmes actuels.
La couverture du cas des garde-fous biologiques souligne cette incertitude. Des modèles plus capables peuvent soutenir une recherche légitime, mais cette même compétence complique les décisions sur les demandes à bloquer.
Un blocage excessif entraîne des coûts réels. Les scientifiques, les équipes de santé publique et les chercheurs en sécurité peuvent avoir besoin d’informations qui ressemblent à des travaux restreints. Un blocage insuffisant peut fournir à un acteur malveillant une assistance pour la conception expérimentale ou la planification opérationnelle.
Un fournisseur de modèles doit prendre ces décisions avec un contexte incomplet. Une demande d’apparence bénigne peut constituer un fragment d’un programme dissimulé. Une demande préoccupante peut faire partie d’une recherche défensive autorisée.
La même faiblesse affecte les garde-fous cybernétiques. Les attaquants peuvent diviser leurs objectifs en tâches ordinaires, changer de comptes, utiliser des identifiants volés ou combiner plusieurs fournisseurs. Les modèles à poids ouverts offrent une autre voie, sans opérateur central capable de fermer un compte.
Par conséquent, aucun fournisseur ne peut présenter la sécurité comme une fonctionnalité de produit achevée. Les garde-fous créent des frictions et améliorent la détection, mais ils ne retirent pas les capacités de l’environnement plus large. La mesure pertinente est de savoir si l’intervention augmente les coûts des attaquants plus vite que les capacités ne les réduisent.
Le rapport d’Anthropic sur les abus liés à l’IA fournit des éléments sur des perturbations réussies, mais il ne peut pas montrer les campagnes qu’Anthropic n’a jamais détectées. Il ne peut pas non plus déterminer combien d’opérateurs ont abandonné un projet, migré ailleurs ou poursuivi avec des systèmes déployés localement.
Cette incertitude devrait empêcher deux erreurs opposées. Les cas ne prouvent pas que des agents d’IA peuvent exécuter de façon indépendante toute opération sophistiquée. Ils ne permettent pas non plus de balayer le problème au motif que les humains choisissent toujours les objectifs.
La direction humaine et l’exécution par les machines peuvent coexister. En fait, cette combinaison pourrait être la structure la plus pratique pour des opérations nuisibles, car elle préserve le jugement tout en passant à l’échelle les tâches répétables.
La distillation des modèles fait des données clients une question de sécurité
Le renversement final du rapport est que les fournisseurs d’IA ne sont pas seulement des plateformes d’abus, mais aussi des cibles, des sources de données et des ressources de calcul dérobées.
Anthropic accuse plusieurs laboratoires chinois d’IA de mener des campagnes non autorisées de distillation contre Claude. La distillation utilise les sorties d’un modèle pour améliorer le comportement ou les capacités d’un autre modèle.
Selon Anthropic, Alibaba a généré plus de 151 millions d’échanges entre mai et juillet 2026. Moonshot aurait généré plus de 23 millions d’échanges durant la même période. DeepSeek a produit plus de 12,1 millions d’échanges sur 14 jours en juillet.
L’entreprise attribue plus de 3,4 millions d’échanges à Zhipu sur 17 jours en juin et juillet. Elle affirme que Xiaomi a généré plus de 400 000 échanges sur 20 jours en mars et avril.
Ces chiffres constituent les conclusions d’Anthropic et n’ont pas fait l’objet d’un audit indépendant dans le rapport. Les réponses des entreprises nommées comptent également dans l’évaluation de l’attribution, de l’intention et des affirmations contractuelles.
Anthropic affirme que les campagnes visaient des capacités de raisonnement, de programmation, d’utilisation d’outils et d’analyse de données. Les opérateurs auraient utilisé de fausses identités, des cartes volées, des identifiants API compromis, des proxys et des milliers de comptes pour contourner les contrôles d’accès.
Certains ont testé de nombreuses variantes de prompts afin d’extraire des traces de raisonnement cachées. Une expérience aurait envoyé plus de 12 000 requêtes différentes pour identifier des méthodes d’extraction efficaces avant de lancer une campagne plus vaste.
L’affirmation la plus préoccupante concerne les données clients. Anthropic indique que DeepSeek, Moonshot et Xiaomi ont acheminé certaines conversations d’utilisateurs vers Claude à des fins d’entraînement. Les utilisateurs n’auraient pas été informés qu’un autre fournisseur de modèles traiterait leurs demandes.
Anthropic rapporte que certains échanges contenaient des noms, des adresses e-mail, des informations sur des entreprises, des identifiants de développeur et des prévisions internes. Des services de routage tiers auraient fourni d’autres conversations impliquant des utilisateurs aux États-Unis et en Europe.
Ces affirmations élargissent le sens du risque lié à la chaîne d’approvisionnement de l’IA. Un client peut penser que ses informations sont envoyées à une application et à un modèle. En pratique, les requêtes peuvent passer par des routeurs, des revendeurs, des services proxy, des évaluateurs et des fournisseurs amont cachés.
Les entreprises devraient demander aux fournisseurs quels modèles traitent réellement les informations soumises. Elles ont également besoin de réponses claires sur la conservation, l’entraînement, le routage régional, les sous-traitants et l’accès des examinateurs humains.
Cet épisode crée une symétrie délicate. Anthropic critique d’autres organisations pour avoir prétendument transmis des données d’utilisateurs sans consentement. Dans le même temps, son propre rapport montre tout ce que les fournisseurs de modèles peuvent déduire grâce à la surveillance des abus.
Ces situations ne sont pas équivalentes, mais elles posent une même question de gouvernance. Les informations sensibles peuvent circuler plus loin que l’utilisateur ne l’imagine, que ce soit par routage clandestin, télémétrie de sécurité ou enquête.
La réponse ne peut pas être la promesse que les données confidentielles ne seront jamais déplacées. Les organisations ont besoin de contrôles applicables, d’un routage vérifiable, d’une conservation réduite au minimum et de journaux indiquant quels systèmes ont traité chaque requête.
C’est aussi pourquoi les employés devraient éviter d’intégrer des secrets actifs dans des outils d’IA non approuvés. Une interface soignée ne permet pas de savoir où va la requête ni combien d’intermédiaires peuvent y accéder.
Ce que les défenseurs devraient surveiller ensuite
Le prochain test consistera à déterminer si la réponse de sécurité modifie les mécanismes économiques décrits dans On Anthropic’s AI Misuse Report.
Le premier signal sera la perturbation entre fournisseurs. Anthropic indique partager ses conclusions avec des partenaires publics et privés lorsque cela est approprié. Le test le plus probant sera de voir si la détection par un fournisseur désactive rapidement, ailleurs, les comptes associés, l’infrastructure et les identifiants volés.
Si la coopération s’améliore, les attaquants perdront une partie de leur capacité à déplacer des flux de travail intacts d’un service à l’autre. Si les campagnes réapparaissent régulièrement via de nouveaux comptes et des modèles alternatifs, les bannissements de comptes ne resteront qu’une gêne temporaire.
Le deuxième signal concernera les preuves relatives à l’autonomie des agents. Les futurs rapports devraient distinguer les suggestions générées par l’IA des actions exécutées au moyen d’outils. Ils devraient préciser à quels moments des humains ont approuvé des commandes, corrigé des échecs, sélectionné des cibles ou interprété des résultats ambigus.
Cette distinction montrera si les agents deviennent plus indépendants ou s’ils rendent simplement les opérateurs qualifiés plus productifs. Les deux issues comptent, mais elles exigent des défenses et des réponses politiques différentes.
Le troisième signal portera sur la transparence des enquêtes et de la protection de la vie privée. Les fournisseurs devraient expliquer quelles données ils conservent, comment les classificateurs d’abus déclenchent un examen et comment ils limitent l’accès des enquêteurs. Ils devraient également signaler les faux positifs et les recours lorsque cette divulgation n’aide pas les attaquants.
Pour les responsables de la sécurité, la réponse immédiate est pragmatique. Inventoriez les identifiants d’IA, examinez les routeurs de modèles, réduisez les jetons de longue durée et surveillez les activités automatisées inhabituelles. Testez si des appareils de développeurs compromis peuvent exposer des sessions de modèles ou des secrets de production associés.
Les équipes devraient aussi réviser leurs plans de réponse aux incidents afin de tenir compte d’une itération à la vitesse des machines. Un domaine bloqué ou une charge utile détectée peut susciter une révision automatisée en quelques minutes. Les défenseurs ont besoin d’une révocation coordonnée des identités, d’un confinement des terminaux, d’une journalisation cloud et d’une communication avec les fournisseurs.
Les travailleurs du savoir devraient vérifier où transitent les invites sensibles. Avant de soumettre du code source, des documents internes, des identifiants, des données de recherche ou des dossiers clients, confirmez le fournisseur approuvé et ses conditions de traitement.
Le rapport d’Anthropic n’établit pas l’existence d’une apocalypse cybernétique autonome. Il documente quelque chose de plus immédiat : des humains qui utilisent l’IA pour transformer l’expertise en infrastructure reproductible au service de la cybercriminalité, de la surveillance, de la propagande et du travail sur les armes.
La question pour le prochain rapport n’est pas de savoir si les abus se poursuivent. Elle est de savoir si les défenseurs obligent les attaquants à dépenser davantage d’identités, d’argent, de temps et d’expertise pour chaque opération réussie. Cette confrontation mesurable révélera si les garde-fous contiennent réellement le changement ou ne font que le documenter.



