Le programme de vérification cyber d’Anthropic élargit l’accès, mais supprime des garde-fous clés de Claude
Anthropic a élargi l’accès à trois modèles Claude avancés, malgré leur capacité à accomplir des tâches offensives complexes de cybersécurité lorsque les garde-fous habituels sont supprimés. L’Anthropic Cyber Verification Program couvre désormais Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 et les futurs modèles. Les organisations approuvées peuvent les utiliser pour des travaux que les utilisateurs ordinaires de Claude verraient bloqués.
Ce changement ouvre une voie contrôlée vers des capacités d’IA qu’Anthropic a délibérément retirées de l’accès général. Les équipes de sécurité peuvent enquêter sur des malwares, détecter des vulnérabilités et mener des tests d’intrusion autorisés. Un groupe plus restreint peut tester des systèmes liés aux réseaux électriques, aux opérations aériennes, aux télécommunications, à la banque et aux services gouvernementaux.
Il s’agit de bien plus qu’une annonce sur l’accès à un produit. Anthropic teste si les contrôles d’identité, les mécanismes organisationnels, la surveillance et l’examen gouvernemental peuvent remplacer les restrictions intégrées à l’expérience du modèle. OpenAI a poursuivi sa propre approche d’accès progressif aux modèles cyber avancés, tandis que les autorités américaines ont pris un rôle plus important dans la décision de déterminer qui peut utiliser les systèmes de pointe.
La question centrale n’est plus de savoir si l’IA peut aider les défenseurs en cybersécurité. Anthropic affirme que ses premiers partenaires ont découvert plus de 134 000 vulnérabilités vérifiées grâce aux modèles Claude et à des travaux d’analyse associés. La question plus difficile est de savoir si un fournisseur peut supprimer sélectivement des garde-fous sans créer une voie privilégiée que des attaquants finiront par exploiter.
L’Anthropic Cyber Verification Program ouvre trois niveaux d’accès
Anthropic remplace une vaste barrière de sécurité par trois niveaux d’accès de plus en plus permissifs.
Le programme de vérification étendu répartit les utilisateurs approuvés entre Defense Access, Red Team Access et Specialized Access. Chaque niveau autorise une gamme de comportements différente et impose des critères d’éligibilité distincts.
Defense Access prend en charge des travaux tels que la réponse aux incidents, les opérations de sécurité, l’analyse de malwares, la validation de vulnérabilités et la recherche défensive. Parmi les candidats éligibles peuvent figurer des entreprises, universités, organisations à but non lucratif, organismes gouvernementaux, mainteneurs de projets open source et chercheurs individuels disposant d’antécédents crédibles en matière de divulgation.
Le programme inclut également des opérateurs d’infrastructures critiques de tailles diverses. Anthropic cite notamment des organisations telles que des hôpitaux régionaux et des services municipaux. L’entreprise indique s’attendre à ce que de nombreuses équipes défensives légitimes soient éligibles et vise à répondre à ces candidatures en quelques jours.
Red Team Access va plus loin. Il autorise les tests d’intrusion et exercices adverses approuvés contre des systèmes qu’une organisation possède ou pour lesquels elle a reçu l’autorisation de tester. Les équipes red team internes, les équipes gouvernementales, les cabinets de conseil en sécurité et les entreprises de tests d’intrusion peuvent candidater.
Les organisations de ce niveau doivent satisfaire à des contrôles d’éligibilité et de sécurité supplémentaires. Anthropic prévoit que les examens prendront plusieurs semaines. Les candidats peuvent recevoir Defense Access pendant que l’entreprise étudie leur demande pour le niveau plus permissif.
Red Team Access conserve néanmoins des limites. Claude doit bloquer les actions associées à des dommages physiques ou à des perturbations généralisées. Anthropic cite le déploiement de ransomware, les dommages aux systèmes physiques et les tests de systèmes de sécurité à haut risque parmi les activités restreintes.
Specialized Access supprime le plus grand nombre de restrictions cyber. Il est réservé aux organisations autorisées à tester des systèmes dont la défaillance pourrait mettre des vies en danger ou perturber des marchés majeurs.
Ces cibles comprennent les systèmes d’exploitation aérienne, les réseaux électriques, les réseaux de télécommunications, les infrastructures de transferts interbancaires et les systèmes administratifs gouvernementaux. Anthropic affirme examiner en profondeur chaque organisation bénéficiant de Specialized Access avec le gouvernement américain.
Les membres existants de Project Glasswing passeront à ce niveau sans demander de nouvelle approbation pour les modèles actuels. Project Glasswing est l’initiative contrôlée d’Anthropic visant à donner à certains fournisseurs d’infrastructures et organisations de sécurité un accès à ses capacités cyber les plus puissantes.
Le programme repose donc sur davantage qu’une adresse e-mail vérifiée ou un contrat d’entreprise standard. Il relie l’accès aux modèles à l’identité du candidat, à son rôle institutionnel, à son autorisation de tester, à ses contrôles techniques et aux cibles prévues.
Les organisations doivent également accepter des conditions de surveillance. Anthropic exige généralement la conservation des données afin de détecter les usages potentiellement abusifs. Les utilisateurs existants de Fable 5.1 ou Mythos 5.1 bénéficiant d’accords de rétention zéro des données peuvent temporairement conserver ces protections tout en rejoignant le programme.
Anthropic prévoit une autre option appelée Enterprise Frontier Safeguards. L’entreprise indique que ce système combinera des contrôles contre les abus avec un stockage cloud géré par l’organisation participante. En attendant son arrivée, la gouvernance des données reste un compromis important pour les équipes traitant du code sensible ou des preuves liées à des incidents.
La distinction la plus importante est l’autorisation. Une même action technique peut représenter une validation défensive ou une intrusion illégale, selon la cible et l’autorisation de l’opérateur. Le programme tente d’établir ce contexte avant d’assouplir les restrictions de Claude.
Cette conception crée la tension centrale de l’article. Anthropic ne prétend pas que les comportements cyber à haut risque sont devenus sûrs pour tout le monde. L’entreprise affirme que les institutions vérifiées peuvent recevoir des capacités renforcées dans le cadre d’un système d’accès contrôlé.
Les capacités cyber de Claude produisent déjà des résultats
L’élargissement s’appuie sur des éléments montrant que les modèles Claude avancés peuvent ramener des mois de travail sur les vulnérabilités à des enquêtes bien plus courtes.
Anthropic affirme que les partenaires de Project Glasswing ont identifié au moins 129 000 vulnérabilités logicielles vérifiées entre avril et juillet 2026. Ses travaux distincts d’analyse open source ont identifié 5 500 autres vulnérabilités vérifiées entre avril et octobre.
Plus de 33 000 de ces découvertes ont reçu une évaluation de criticité élevée ou critique. L’entreprise estime que le total sous-évalue probablement l’effet du programme, car ses chiffres ne comprennent que les rapports de 33 partenaires.
Ces données présentent également d’importantes limites. Les participants ont utilisé des méthodes différentes pour confirmer et catégoriser les découvertes. Moins de la moitié ont indiqué combien de vulnérabilités avaient été corrigées, souvent parce que les remédiations étaient encore en cours.
Découvrir une vulnérabilité ne revient pas à la corriger. Les équipes de sécurité doivent reproduire le problème, évaluer sa gravité, identifier les logiciels affectés, avertir les mainteneurs, créer un correctif, tester la réparation et le déployer en toute sécurité.
Un modèle peut accélérer la découverte tout en rendant les étapes ultérieures plus difficiles à gérer. Si les systèmes automatisés produisent des découvertes plus vite que les humains ne peuvent les vérifier, les équipes de sécurité font face à une file de triage plus importante et à une période d’exposition non résolue plus longue.
Anthropic a reconnu ce goulet d’étranglement lors de sa précédente extension de Glasswing. L’entreprise a indiqué que la vérification, la divulgation et le déploiement des correctifs étaient devenus plus contraignants que la découverte initiale des vulnérabilités.
Cette pression contribue à expliquer le programme d’accès élargi. Un petit groupe géré de manière centralisée ne peut pas inspecter chaque réseau hospitalier, paquet open source, système de paiement, plateforme de services publics ou application gouvernementale. Les opérateurs ont besoin d’un accès direct parce qu’ils comprennent leurs propres environnements et peuvent autoriser des tests réalistes.
Les gains potentiels vont au-delà de l’analyse logicielle. Les modèles avancés peuvent reconstruire des chemins d’attaque, analyser des malwares inconnus, générer des correctifs potentiels et répéter les tests après que les défenseurs ont modifié un système.
Une collaboration avec le Pacific Northwest National Laboratory illustre ce mécanisme. Les chercheurs ont créé un agent scaffold, c’est-à-dire un ensemble d’outils et d’instructions permettant à Claude d’effectuer des actions contrôlées dans un environnement réseau.
L’équipe l’a utilisé pour simuler des attaques contre un modèle cyberphysique d’une installation de traitement de l’eau. Selon les recherches d’Anthropic sur les infrastructures, le système a reconstruit une attaque en trois heures plutôt qu’en plusieurs semaines.
Le test a utilisé Claude Sonnet 4, un modèle plus ancien. Lors d’une exécution, une méthode préparée pour contourner le contrôle de compte d’utilisateur de Windows a échoué. Claude a détecté l’échec et sélectionné une autre technique connue pour poursuivre l’attaque simulée.
Cette capacité d’adaptation est précieuse pour les défenseurs, car les environnements réels se comportent rarement exactement comme une procédure écrite. C’est aussi ce qui rend l’accès dangereux. Un modèle capable de se remettre d’étapes échouées peut aider un attaquant à aller au-delà d’instructions statiques.
Le nouveau programme vise à donner aux équipes légitimes suffisamment de liberté pour reproduire ce comportement. La révision de code de base et le déploiement de correctifs restent accessibles via les modèles Claude généralement disponibles. Les opérations plus interactives et à plusieurs étapes nécessitent une vérification, car elles ressemblent à une véritable activité d’intrusion.
Cette frontière restera difficile à définir. L’analyse de vulnérabilités commence souvent comme une inspection bénigne du code et évolue en chaîne d’exploitation. Un intervenant en réponse aux incidents peut devoir reproduire la technique d’un attaquant avant de pouvoir la bloquer.
La réponse d’Anthropic consiste à évaluer l’opérateur et la cible, plutôt qu’à juger chaque demande uniquement à partir de son texte. Ce changement place l’identité, la gouvernance et l’autorisation juridique aux côtés du filtrage au niveau du modèle comme mécanismes de sécurité essentiels.
La suppression des garde-fous cyber change ce que Claude peut accomplir
Les propres tests d’Anthropic montrent que les niveaux d’accès ne réduisent pas seulement les contraintes : ils déterminent si Claude peut mener à bien des opérations offensives.
L’entreprise a évalué Claude Opus 5.5 avec CyScenarioBench, un benchmark destiné à planifier et exécuter des opérations cyber à plusieurs étapes dans des contraintes réalistes. Elle a effectué cinq tentatives sur chacun des dix défis à chaque niveau d’accès.
Sans accès au programme, Claude a bloqué chaque tâche dès la première instruction. L’expérience généralement accessible empêchait donc l’évaluation de progresser, même si l’opérateur avait des intentions bénignes.
Defense Access a permis une activité légèrement plus étendue, mais les garde-fous ont tout de même arrêté 46 des 50 essais avant leur achèvement. Quatre tâches ont réussi. Ce comportement correspond à un niveau conçu pour l’enquête, la réponse aux incidents et les travaux sur les vulnérabilités, plutôt que pour une simulation complète d’attaque.
Red Team Access a produit un résultat différent. Aucun blocage de garde-fou n’est survenu, et Claude a mené à bien 34 essais sur 50. Son taux d’achèvement de 68 % était pratiquement identique au résultat de 67,6 % obtenu sans garde-fous.
Ces chiffres précisent ce qu’Anthropic accorde. Les red teams approuvées ne reçoivent pas l’expérience Claude standard avec un quota de requêtes plus élevé. Elles reçoivent un accès à un comportement du modèle qui se rapproche fortement de ses performances sans restriction dans cette évaluation.
Specialized Access va plus loin en autorisant les tests approuvés de systèmes sensibles pour la sécurité. Il est destiné aux scénarios où même un accès red team ordinaire conserverait des restrictions, car un test défaillant pourrait affecter des opérations physiques, des services publics ou les marchés financiers.
Cette structure constitue un compromis calculé. Des filtres universels forts peuvent protéger contre les abus, mais ils peuvent aussi empêcher les défenseurs de répéter les attaques auxquelles ils doivent résister. Supprimer largement ces filtres élargirait l’accès pour les deux groupes.
Anthropic parie sur le fait que la vérification institutionnelle peut les distinguer. Les utilisateurs du secteur de la défense bénéficient d’une large éligibilité assortie de restrictions permanentes. Les red teams font l’objet d’un examen plus approfondi, mais rencontrent moins de blocages. Un petit groupe d’organisations obtient un accès spécialisé grâce à un contrôle conjoint avec le gouvernement.
Les classificateurs de sécurité restent au cœur du système. Un classificateur est un modèle distinct ou une couche de contrôle qui évalue les requêtes et les réponses afin de détecter les comportements interdits. Il peut interrompre une interaction même lorsque le modèle Claude sous-jacent est capable de poursuivre.
Anthropic a décrit comment ces contrôles répartissent les requêtes cyber en catégories, notamment les activités clairement interdites, les travaux à double usage à haut risque, les travaux à double usage à faible risque et les tâches défensives ordinaires. Son cadre de classification publié reconnaît également que les opérateurs malveillants et défensifs emploient parfois des techniques presque identiques.
Cette ambiguïté limite ce que les filtres automatisés peuvent déduire d’une invite. Une demande visant à établir une persistance, extraire des identifiants ou échapper à la détection paraît dangereuse sans informations fiables sur la cible et l’autorisation.
Le programme de vérification fournit ce contexte manquant avant le début d’une session. Il associe un utilisateur à une organisation approuvée, un niveau d’accès, des obligations contractuelles, une surveillance et une plage définie de systèmes autorisés.
Toutefois, la vérification n’élimine pas le risque technique. Des comptes peuvent être compromis. Des employés peuvent outrepasser leur autorité. Des prestataires peuvent perdre leur accès sans que les autorisations ne soient rapidement modifiées. Une infrastructure autorisée peut se connecter à des systèmes non approuvés.
La surveillance peut détecter une utilisation suspecte, mais cette détection peut intervenir après qu’un modèle a généré une piste d’attaque utile. Les limites de débit et les contrôles de cible peuvent réduire l’exposition, mais les opérateurs qualifiés répartissent souvent leur travail entre plusieurs outils et comptes.
Le benchmark n’évalue également qu’un échantillon de scénarios structurés. Un taux d’exécution de 68 % ne permet pas d’établir comment Claude se comportera face à des logiciels inconnus, des équipements industriels sur mesure ou des attaques en chaîne impliquant de l’ingénierie sociale.
Les éléments avancés par Anthropic étayent une conclusion plus limitée. Les contrôles d’accès peuvent produire des comportements sensiblement différents selon les niveaux, et les modèles Claude avancés peuvent accomplir de nombreuses tâches cyber lorsque les restrictions sont assouplies.
Rien ne permet d’établir si ces contrôles restent fiables à grande échelle. Cette question prend davantage d’importance à mesure que le bassin de candidats s’élargit au-delà de la cohorte Glasswing initiale.
L’examen gouvernemental renforce la sécurité et concentre l’autorité
Le gouvernement américain devient partie intégrante du système de contrôle d’accès pour les modèles cyber de pointe, et non plus seulement un régulateur externe.
Anthropic affirme collaborer avec le gouvernement lors de l’examen de chaque organisation bénéficiant d’un Specialized Access. Cet arrangement donne aux autorités publiques un rôle dans la décision concernant les institutions autorisées à utiliser Claude sur des systèmes aéronautiques, des réseaux électriques, des infrastructures bancaires et d’autres cibles sensibles.
Ce partenariat obéit à une logique pratique. Les agences gouvernementales comprennent les menaces classifiées, les infrastructures nationales, les contrôles à l’exportation et les conséquences opérationnelles d’attaques contre des systèmes réglementés. Elles peuvent également confirmer une autorité juridique qu’un fournisseur privé de modèles ne peut évaluer seul.
Des événements récents montrent jusqu’où cette relation s’est développée. Anthropic aurait collaboré avec des agences de renseignement américaines pour tester un modèle Mythos contre des systèmes gouvernementaux classifiés.
Un responsable a déclaré à l’Associated Press que le modèle avait identifié certaines vulnérabilités en quelques heures. Il a souligné que l’identification d’une faiblesse ne signifiait pas que Mythos l’avait exploitée au cours de la même période.
Le sénateur Mark Warner a décrit le résultat de manière plus spectaculaire lors d’une audition en juin. Il a déclaré que le système avait pénétré presque tous les environnements classifiés testés en quelques heures, attribuant ce récit au responsable de la National Security Agency et de l’U.S. Cyber Command.
La NSA et Anthropic ont refusé de confirmer les détails de ces tests classifiés. L’écart entre les descriptions publiques justifie de traiter les affirmations générales avec prudence.
L’implication gouvernementale a également suscité des tensions. En juin, l’administration Trump a soumis les lancements de modèles de pointe à un examen de sécurité nationale et limité l’accès à certains systèmes Anthropic.
Anthropic a temporairement retiré Fable 5 et Mythos 5 après une directive concernant l’accès des ressortissants étrangers. Le gouvernement a ensuite approuvé Mythos pour un déploiement limité auprès de certains cyberdéfenseurs et fournisseurs d’infrastructures.
OpenAI a fait l’objet d’un examen similaire pour GPT-5.6 Sol. Les deux entreprises ont d’abord limité leurs systèmes les plus récents à de petits groupes, faisant de l’accès aux modèles d’IA commerciaux une question de politique de sécurité nationale.
Les partisans de cette approche peuvent soutenir que des systèmes cyber exceptionnellement capables exigent des processus de diffusion exceptionnellement prudents. Les fournisseurs de modèles ne disposent pas d’une visibilité complète sur les menaces liées au renseignement, tandis que les gouvernements ne peuvent développer indépendamment tous les modèles de pointe pertinents.
Les critiques y voient un dispositif moins redevable. La représentante Lori Trahan a estimé que des responsables politiques décidaient, entreprise par entreprise, qui obtenait l’accès, sans loi, procédure ni mécanisme de contrôle clairement définis.
Cette critique s’applique au programme Anthropic Cyber Verification Program élargi. Impliquer le gouvernement peut améliorer la sélection des candidats pour des cibles sensibles, mais cela concentre également l’autorité dans un processus dont les critères ne sont pas entièrement publics.
Les organisations situées hors des États-Unis sont confrontées à une autre préoccupation. Anthropic avait auparavant étendu Glasswing à des partenaires dans plus de 15 pays, et beaucoup desservaient des populations au-delà de leurs marchés nationaux.
Les logiciels critiques sont mondiaux. Les responsables de projets open source, les fournisseurs cloud, les fabricants de puces, les fournisseurs de télécommunications et les réseaux financiers franchissent régulièrement les frontières nationales. Un système fortement façonné par les priorités de sécurité d’un seul gouvernement peut créer des inégalités d’accès.
Les modèles cyber les plus puissants pourraient donc devenir des ressources stratégiques distribuées au gré des relations géopolitiques. Les organisations seraient alors contraintes de satisfaire à la fois aux règles d’un fournisseur privé et aux exigences de sécurité nationale d’un gouvernement.
Le programme nécessite des voies de recours claires, des normes cohérentes, des procédures de révocation auditables et des rapports transparents sur les exclusions. Sans ces éléments, la vérification risque de devenir un système opaque de licences pour une technologie défensive de plus en plus importante.
Anthropic n’a pas présenté ce programme comme une politique publique permanente. L’entreprise décrit l’accès contrôlé comme une solution transitoire en attendant le développement de garanties plus robustes. Pourtant, les systèmes temporaires établissent souvent des précédents opérationnels difficiles à remplacer par la suite.
L’avantage défensif dépend du correctif, pas de la découverte
Claude ne peut donner un avantage aux défenseurs que si les organisations corrigent les vulnérabilités avant que les attaquants ne reproduisent les mêmes découvertes.
L’objectif déclaré d’Anthropic est de faire pencher la balance en faveur de la défense. Cet objectif paraît intuitif, car les opérateurs d’infrastructures peuvent examiner leurs propres systèmes, déployer des correctifs et coordonner la réponse aux incidents avant de publier des détails techniques.
Les attaquants disposent d’autres avantages. Ils peuvent choisir la cible la plus faible, réutiliser des techniques éprouvées, opérer dans plusieurs juridictions et avancer plus vite que les procédures d’approbation institutionnelles.
Les modèles avancés peuvent amplifier les deux camps. Un défenseur peut analyser des millions de lignes de code et hiérarchiser les failles dangereuses. Un attaquant peut utiliser un raisonnement similaire pour trouver une voie négligée vers un service exposé.
L’écart de temps détermine qui en bénéficie. Une vulnérabilité découverte en privé et rapidement corrigée améliore la sécurité. Une faille signalée dans une file de correction longue de plusieurs mois reste utile aux attaquants, même si les défenseurs l’ont trouvée en premier.
Les totaux de vulnérabilités d’Anthropic mesurent donc la découverte, et non un résultat défensif complet. Plus de 134 000 constats vérifiés représentent une production de recherche substantielle. Ils ne révèlent pas combien de systèmes concernés restent exposés.
L’entreprise indique que moins de la moitié des partenaires participants ont communiqué des chiffres sur les correctifs. Ce dénominateur manquant empêche toute évaluation indépendante visant à déterminer si la découverte dépasse la remédiation.
Un volume élevé de constats automatisés peut aussi créer des problèmes opérationnels. Les mainteneurs ont besoin de suffisamment d’éléments pour reproduire une faille, en comprendre l’impact et distinguer un problème exploitable d’une faiblesse théorique.
Des rapports mal hiérarchisés peuvent submerger les projets open source animés par des bénévoles. Des informations détaillées sur les exploits peuvent accroître le risque de divulgation si elles circulent entre trop d’organisations avant qu’un correctif n’existe.
Le programme élargi confie davantage de responsabilités aux candidats. Les équipes de sécurité ont besoin de processus de gestion des vulnérabilités, d’environnements de test isolés, de journaux d’accès, de voies d’escalade claires et de l’autorité nécessaire pour déployer des correctifs.
Elles ont également besoin de dossiers durables. Les enquêtes assistées par l’IA peuvent générer de longues chaînes d’hypothèses, de résultats d’outils, de modifications de code et de décisions. Une base de connaissances d’ingénierie consultable peut aider les équipes à préserver ce contexte sans traiter les conclusions du modèle comme des faits vérifiés.
L’examen humain demeure nécessaire. Les modèles peuvent mal comprendre les limites d’un système, proposer des correctifs dangereux ou identifier des schémas qui échouent dans des conditions opérationnelles réelles. Les systèmes industriels ajoutent des contraintes physiques que les benchmarks logiciels ordinaires ne capturent pas.
Specialized Access accroît ces enjeux. Une action erronée contre un environnement de contrôle de vol, un système de gestion de réseau électrique ou un réseau interbancaire peut avoir des conséquences allant au-delà de la perte de données.
Anthropic indique que des restrictions en temps réel continuent de s’appliquer aux niveaux inférieurs pour les activités susceptibles de causer des dommages physiques ou des perturbations massives. Les utilisateurs Specialized reçoivent moins de blocages précisément parce que leur travail exige parfois de tester ces scénarios.
Le programme doit donc juger davantage que la seule légitimité apparente d’une organisation. Il doit évaluer si l’organisation peut isoler les cibles, contraindre les actions du modèle, superviser les tests, se remettre des défaillances et signaler les anomalies.
L’examen gouvernemental peut contribuer à cette évaluation, mais la discipline opérationnelle reste locale. Un fournisseur de modèles ne peut pas superviser chaque commande au sein d’un laboratoire d’entreprise de services publics ou d’un réseau classifié.
La concurrence ajoute de la pression. OpenAI a également rendu des modèles cyber avancés disponibles dans le cadre de programmes contrôlés. Si les fournisseurs rivalisent sur le système qui accomplit le plus de tâches offensives, les restrictions d’accès peuvent devenir un désavantage commercial.
S’ils rivalisent uniquement sur la sécurité, les défenseurs peuvent choisir des modèles offrant moins de blocages et de meilleures simulations d’attaque. Cela crée une incitation à assouplir les contrôles tout en présentant la vérification comme mesure compensatoire.
La structure à plusieurs niveaux d’Anthropic est une tentative crédible de gérer cette pression. Elle ne résout pas le conflit sous-jacent. Les mêmes capacités qui rendent Claude utile contre des attaquants sophistiqués rendent toute défaillance de la vérification plus lourde de conséquences.
L’avantage défensif sera visible dans les résultats de remédiation, et non dans les benchmarks de modèles. Les taux de correction, le délai de réparation, les taux de récurrence et les incidents évités comptent davantage que le nombre brut de vulnérabilités découvertes.
Trois signaux montreront si l’accès contrôlé fonctionne
Le prochain test consiste à déterminer si Anthropic peut élargir la participation sans affaiblir la vérification ni submerger les défenseurs de constats non résolus.
Le premier signal est la qualité de l’inscription. Anthropic indique pouvoir examiner de nombreuses candidatures Defense Access en quelques jours, tandis que Red Team Access peut prendre plusieurs semaines. Une approbation plus rapide n’est utile que si les contrôles d’identité, d’autorité et de sécurité restent cohérents.
L’entreprise devrait publier le nombre total de candidatures, les taux d’approbation, les délais d’examen, les révocations et les principaux motifs de refus. Elle n’a pas besoin d’identifier les participants sensibles pour montrer si le système peut passer à l’échelle de manière responsable.
Une forte hausse des accès sans capacité de supervision équivalente affaiblirait la position d’Anthropic. Des normes d’examen stables et de faibles taux d’usage abusif la renforceraient.
Le deuxième signal concerne la relation entre les vulnérabilités découvertes et celles corrigées. Les 129 000 résultats signalés par les partenaires d’Anthropic et les 5 500 résultats issus de l’open source constituent une référence pour la détection.
Les futurs rapports devraient distinguer les résultats confirmés des doublons, des signalements contestés et des vulnérabilités affectant des logiciels obsolètes. Ils devraient également indiquer combien de problèmes ont reçu des correctifs et dans quels délais ces correctifs ont atteint les systèmes déployés.
Des taux de correction plus élevés étayeraient l’affirmation selon laquelle les modèles de pointe procurent un avantage défensif. Un arriéré croissant de problèmes graves non résolus suggérerait que la détection automatisée révèle un goulet d’étranglement organisationnel au lieu de le résoudre.
Le troisième signal est la manière dont Anthropic gère le premier échec d’accès sérieux. Aucun système de vérification ne devrait être évalué uniquement en fonctionnement normal.
Un compte compromis, une cible non autorisée, le contournement d’un classificateur ou une interaction accidentelle avec un système en production mettraient la réponse du programme à l’épreuve. Les mesures importantes incluraient le temps de détection, le confinement, la notification, la révocation et les changements apportés par la suite.
Une communication transparente sur les incidents renforcerait la confiance, même si certains détails techniques restaient confidentiels. Le silence empêcherait les organisations externes d’évaluer les risques réels liés à leur participation au programme.
Enterprise Frontier Safeguards influera également sur ce signal. Anthropic indique que le système prévu combinera protection de la confidentialité et prévention des abus, tout en permettant aux organisations éligibles de conserver les informations dans leurs propres environnements cloud.
Cette configuration pourrait répondre aux inquiétudes liées à l’envoi de code sensible et de données d’incident à un fournisseur de modèles. Elle pourrait aussi compliquer la supervision centralisée si les contrôles se comportent différemment selon les environnements gérés par les clients.
Le comportement des concurrents reste un élément de contexte, mais il orientera les choix d’Anthropic. Les déploiements cyber contrôlés d’OpenAI offriront aux acheteurs et aux régulateurs un autre modèle pour comparer l’accès, la supervision et la réponse aux incidents.
Un accès plus large proposé par un concurrent pousserait Anthropic à accélérer les approbations. Un événement d’usage abusif important ailleurs pourrait l’inciter à imposer des exigences plus strictes.
Les lecteurs ne devraient pas considérer le Anthropic Cyber Verification Program comme la preuve que les capacités cyber des modèles de pointe sont désormais sûres. Il s’agit d’une expérience de gouvernance en conditions réelles, fondée sur une hypothèse difficile : des institutions connues peuvent recevoir moins de restrictions parce que leur identité et leurs contrôles réduisent le risque.
Cette hypothèse peut être testée. Anthropic a publié des résultats de benchmark montrant que ses niveaux d’accès modifient le comportement de Claude. L’entreprise a également signalé un grand nombre de résultats vérifiés provenant de déploiements contrôlés.
Les éléments manquants concernent les opérations à grande échelle. Nous ne savons pas encore à quelle fréquence des demandes légitimes sont bloquées, combien d’organisations approuvées enfreignent les règles, ni avec quelle efficacité Anthropic détecte un compte utilisé en dehors de son périmètre prévu.
Les développeurs et responsables de la sécurité devraient suivre le programme, car des systèmes d’accès similaires pourraient s’étendre au-delà de la cybersécurité. Les modèles de pointe disposant de capacités de recherche biologique, financière ou autonome pourraient eux aussi nécessiter des autorisations liées à des utilisateurs vérifiés et à des environnements approuvés.
Les acheteurs en entreprise devraient demander ce qu’un niveau d’accès modifie sur le plan technique. Ils devraient également examiner la conservation des données, la supervision, la divulgation des incidents, l’autorisation des employés et la responsabilité relative aux actions générées par le modèle.
Pour les travailleurs du savoir, la leçon plus large est que l’accès à une IA avancée ne se présentera pas toujours sous la forme d’une mise à jour uniforme du produit. Les comportements les plus capables dépendront de plus en plus de l’identité de l’utilisateur, de l’institution qui le soutient et des systèmes qu’il est autorisé à tester.
Anthropic a rapproché cet avenir. Son programme donne à davantage de défenseurs accès aux capacités cyber avancées de Claude tout en préservant des restrictions plus fortes pour tous les autres.
L’issue dépendra moins des chiffres spectaculaires de vulnérabilités que d’une remédiation rigoureuse et d’une supervision responsable. Anthropic publiera-t-elle suffisamment d’éléments pour démontrer qu’un accès vérifié rend les infrastructures plus sûres, ou le premier échec majeur révélera-t-il que la vérification constitue la protection la plus fragile ?



