Il programma di verifica cyber di Anthropic amplia l'accesso, ma rimuove importanti protezioni di Claude
Anthropic ha ampliato l'accesso a tre modelli Claude avanzati, nonostante la loro capacità di completare complesse attività offensive di cybersecurity quando vengono rimosse le normali protezioni. L'Anthropic Cyber Verification Program ora copre Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 e i modelli futuri. Le organizzazioni approvate possono usarli per attività che gli utenti ordinari di Claude vedrebbero bloccate.
Il cambiamento apre una via controllata a capacità di AI che Anthropic ha deliberatamente escluso dall'accesso generale. I team di sicurezza possono analizzare malware, individuare vulnerabilità e condurre test di penetrazione autorizzati. Un gruppo più ristretto può testare sistemi collegati a reti elettriche, operazioni di volo, telecomunicazioni, banche e servizi governativi.
Questo è più di un annuncio sull'accesso al prodotto. Anthropic sta verificando se controlli sull'identità, controlli organizzativi, monitoraggio e revisione governativa possano sostituire le restrizioni integrate nell'esperienza del modello. OpenAI ha adottato un proprio approccio di accesso graduale per i modelli cyber avanzati, mentre i funzionari statunitensi hanno assunto un ruolo più ampio nel decidere chi possa utilizzare sistemi di frontiera.
La domanda centrale non è più se l'AI possa assistere i difensori informatici. Anthropic afferma che i suoi precedenti partner hanno individuato oltre 134.000 vulnerabilità verificate con i modelli Claude e attività di scansione correlate. La domanda più difficile è se un fornitore possa rimuovere selettivamente le protezioni senza creare un percorso privilegiato che gli aggressori finiranno per sfruttare.
L'Anthropic Cyber Verification Program apre tre livelli di accesso
Anthropic sta sostituendo un unico ampio confine di sicurezza con tre livelli di accesso sempre più permissivi.
Il programma di verifica ampliato suddivide gli utenti approvati in Defense Access, Red Team Access e Specialized Access. Ogni livello consente una diversa gamma di comportamenti e applica requisiti di idoneità differenti.
Defense Access supporta attività quali risposta agli incidenti, operazioni di sicurezza, analisi di malware, convalida delle vulnerabilità e ricerca difensiva. Tra i candidati idonei possono figurare aziende, università, organizzazioni non profit, enti governativi, manutentori open source e singoli ricercatori con credibili precedenti di divulgazione responsabile.
Il programma comprende inoltre operatori di infrastrutture critiche di dimensioni diverse. Anthropic identifica nello specifico organizzazioni quali ospedali regionali e aziende municipalizzate. L'azienda afferma di aspettarsi che molti team difensivi legittimi possano qualificarsi e punta a rispondere a queste candidature entro alcuni giorni.
Red Team Access si spinge oltre. Consente test di penetrazione autorizzati ed esercitazioni avversariali contro sistemi che un'organizzazione possiede o ha il permesso di testare. Possono candidarsi red team interni, team governativi, società di consulenza per la sicurezza e aziende specializzate in penetration testing.
Le organizzazioni a questo livello devono soddisfare ulteriori verifiche di idoneità e controlli di sicurezza. Anthropic prevede che le revisioni richiedano diverse settimane. I candidati possono ricevere Defense Access mentre l'azienda valuta le richieste per il livello più permissivo.
Red Team Access mantiene comunque dei limiti. Claude dovrebbe bloccare azioni associate a danni fisici o interruzioni su vasta scala. Anthropic include tra le attività limitate la distribuzione di ransomware, il danneggiamento di sistemi fisici e il test di sistemi di sicurezza ad alto rischio.
Specialized Access rimuove il maggior numero di restrizioni cyber. È riservato alle organizzazioni autorizzate a testare sistemi il cui guasto potrebbe mettere in pericolo vite umane o perturbare mercati importanti.
Tra questi obiettivi figurano sistemi operativi di volo, reti elettriche, reti di telecomunicazione, infrastrutture per trasferimenti interbancari e sistemi amministrativi governativi. Anthropic afferma di esaminare approfonditamente ogni organizzazione con Specialized Access insieme al governo degli Stati Uniti.
Gli attuali membri di Project Glasswing passeranno a questo livello senza richiedere una nuova approvazione per i modelli attuali. Project Glasswing è l'iniziativa controllata di Anthropic per fornire a selezionati fornitori di infrastrutture e organizzazioni di sicurezza l'accesso alle sue più potenti capacità cyber.
Il programma si basa quindi su qualcosa di più di un indirizzo email verificato o di un contratto enterprise standard. Collega l'accesso al modello all'identità del candidato, al ruolo istituzionale, all'autorità di test, ai controlli tecnici e agli obiettivi previsti.
Le organizzazioni devono inoltre accettare condizioni di monitoraggio. Anthropic richiede generalmente la conservazione dei dati per poter rilevare possibili abusi. Gli utenti esistenti di Fable 5.1 o Mythos 5.1 con accordi di zero-data-retention possono mantenere temporaneamente tali protezioni aderendo al programma.
Anthropic prevede un'altra opzione chiamata Enterprise Frontier Safeguards. L'azienda afferma che questo sistema combinerà controlli contro gli abusi con archiviazione cloud gestita dall'organizzazione partecipante. Finché il sistema non sarà disponibile, la governance dei dati rimane un compromesso significativo per i team che gestiscono codice sensibile o prove relative a incidenti.
La distinzione più importante è l'autorizzazione. La stessa azione tecnica può rappresentare una convalida difensiva o un'intrusione illegale, a seconda dell'obiettivo e del permesso dell'operatore. Il programma tenta di stabilire quel contesto prima di allentare le restrizioni di Claude.
Questo approccio crea la tensione centrale dell'articolo. Anthropic non sostiene che il comportamento cyber ad alto rischio sia diventato sicuro per tutti. Sostiene che le istituzioni verificate possano ricevere capacità più avanzate nell'ambito di un sistema di accesso controllato.
Le capacità cyber di Claude stanno già producendo risultati
L'espansione segue prove secondo cui i modelli Claude avanzati possono comprimere mesi di lavoro sulle vulnerabilità in indagini molto più brevi.
Anthropic afferma che i partner di Project Glasswing hanno individuato almeno 129.000 vulnerabilità software verificate tra aprile e luglio 2026. La sua separata attività di scansione open source ha identificato altre 5.500 vulnerabilità verificate tra aprile e ottobre.
Oltre 33.000 di questi risultati hanno ricevuto classificazioni di gravità critica o elevata. L'azienda afferma che il totale probabilmente sottostima l'effetto del programma, poiché le sue cifre includono rapporti provenienti da soli 33 partner.
I dati presentano anche importanti limitazioni. I partecipanti hanno utilizzato metodi diversi per confermare e categorizzare i risultati. Meno della metà ha divulgato quante vulnerabilità fossero state corrette, spesso perché la remediation era ancora in corso.
Individuare una vulnerabilità non equivale a correggerla. I team di sicurezza devono riprodurre il problema, valutarne la gravità, identificare il software interessato, notificare i manutentori, creare una patch, testare la correzione e distribuirla in sicurezza.
Un modello può accelerare la scoperta rendendo però più difficili da gestire le fasi successive. Se i sistemi automatizzati producono risultati più rapidamente di quanto gli esseri umani possano verificarli, i team di sicurezza devono affrontare una coda di triage più ampia e un periodo più lungo di esposizione irrisolta.
Anthropic ha riconosciuto quel collo di bottiglia durante la precedente espansione di Glasswing. L'azienda ha dichiarato che la verifica, la divulgazione e l'applicazione delle patch erano diventate più limitanti della scoperta iniziale delle vulnerabilità.
Questa pressione aiuta a spiegare il programma di accesso più ampio. Un piccolo gruppo gestito centralmente non può ispezionare ogni rete ospedaliera, pacchetto open source, sistema di pagamento, piattaforma di servizi pubblici o applicazione governativa. Gli operatori necessitano di accesso diretto perché comprendono i propri ambienti e possono autorizzare test realistici.
I potenziali vantaggi vanno oltre la scansione del software. I modelli avanzati possono ricostruire percorsi di attacco, analizzare malware sconosciuti, generare potenziali patch e ripetere i test dopo che i difensori hanno modificato un sistema.
Una collaborazione con il Pacific Northwest National Laboratory illustra il meccanismo. I ricercatori hanno creato un'impalcatura agentica, ossia un insieme di strumenti e istruzioni che consentivano a Claude di compiere azioni controllate in un ambiente di rete.
Il team l'ha utilizzata per emulare attacchi contro un modello ciberfisico di un impianto di trattamento delle acque. Secondo la ricerca sulle infrastrutture di Anthropic, il sistema ha ricostruito un attacco in tre ore anziché in diverse settimane.
Il test ha utilizzato Claude Sonnet 4, un modello precedente. Durante un'esecuzione, un metodo preparato per aggirare il Controllo dell'account utente di Windows non è riuscito. Claude ha rilevato il fallimento e ha selezionato un'altra tecnica nota per proseguire l'attacco simulato.
Questa adattabilità è preziosa per i difensori perché gli ambienti reali raramente si comportano esattamente come previsto da una procedura scritta. È anche il motivo per cui l'accesso diventa pericoloso. Un modello in grado di recuperare dopo passaggi falliti può aiutare un aggressore ad andare oltre istruzioni statiche.
Il nuovo programma mira a dare ai team legittimi sufficiente libertà per riprodurre quel comportamento. La revisione di base del codice e l'applicazione di patch restano disponibili tramite i modelli Claude generalmente accessibili. Operazioni più interattive e in più fasi richiedono una verifica perché assomigliano a vere attività di intrusione.
Questo confine rimarrà difficile da definire. L'analisi delle vulnerabilità spesso inizia come un'ispezione innocua del codice e si sviluppa in una catena di exploit. Un addetto alla risposta agli incidenti potrebbe dover riprodurre la tecnica di un aggressore prima di bloccarla.
La risposta di Anthropic consiste nel valutare l'operatore e l'obiettivo, anziché giudicare ogni richiesta soltanto dal suo testo. Questo spostamento pone identità, governance e autorizzazione legale accanto al filtraggio a livello di modello come meccanismi di sicurezza fondamentali.
La rimozione delle protezioni cyber cambia ciò che Claude può completare
I test condotti dalla stessa Anthropic mostrano che i livelli di accesso non si limitano a ridurre gli ostacoli; determinano se Claude possa portare a termine operazioni offensive.
L'azienda ha valutato Claude Opus 5.5 con CyScenarioBench, un benchmark per pianificare ed eseguire operazioni cyber in più fasi soggette a vincoli realistici. Ha eseguito cinque tentativi per ciascuna delle dieci sfide a ogni livello di accesso.
Senza accesso al programma, Claude ha bloccato ogni attività al primo prompt. L'esperienza generalmente disponibile ha quindi impedito alla valutazione di proseguire, indipendentemente dal fatto che l'operatore avesse intenzioni benigne.
Defense Access ha consentito un'attività leggermente maggiore, ma le protezioni hanno comunque interrotto 46 delle 50 prove prima del completamento. Quattro attività sono riuscite. Questo comportamento è coerente con un livello progettato per indagine, risposta e lavoro sulle vulnerabilità, piuttosto che per la simulazione completa di attacchi.
Red Team Access ha prodotto un risultato diverso. Non si sono verificati blocchi delle protezioni e Claude ha completato 34 delle 50 prove. Il suo tasso di completamento del 68 percento era sostanzialmente identico al risultato del 67,6 percento ottenuto senza protezioni.
Questi numeri chiariscono cosa sta concedendo Anthropic. I red team approvati non ricevono l'esperienza standard di Claude con una quota di richieste più ampia. Ricevono accesso a un comportamento del modello che si avvicina molto alle sue prestazioni senza restrizioni in questa valutazione.
Specialized Access si spinge oltre consentendo il test autorizzato di sistemi sensibili alla sicurezza. È pensato per scenari in cui persino il normale accesso red team manterrebbe restrizioni, perché un test fallito potrebbe influire sulle operazioni fisiche, sui servizi pubblici o sui mercati finanziari.
Questa struttura rappresenta un compromesso calcolato. Filtri universali forti possono proteggere dagli abusi, ma possono anche impedire ai difensori di simulare gli attacchi che devono saper contrastare. Rimuovere ampiamente tali filtri aumenterebbe l'accesso per entrambi i gruppi.
Anthropic scommette sul fatto che la verifica istituzionale possa fare la differenza. Gli utenti della difesa ottengono un'ampia idoneità con restrizioni persistenti. I red team affrontano una revisione più approfondita ma ricevono meno blocchi. Un piccolo gruppo di organizzazioni ottiene un accesso specializzato attraverso un esame congiunto con il governo.
I classificatori di sicurezza restano centrali nel sistema. Un classificatore è un modello separato o un livello di controllo che valuta richieste e risposte alla ricerca di comportamenti vietati. Può interrompere un'interazione anche quando il modello Claude sottostante è in grado di proseguire.
Anthropic ha descritto come questi controlli suddividano le richieste cyber in categorie, incluse attività chiaramente vietate, lavoro dual-use ad alto rischio, lavoro dual-use a rischio inferiore e normali attività difensive. Il suo framework dei classificatori pubblicato riconosce inoltre che operatori malevoli e difensivi talvolta utilizzano tecniche quasi identiche.
Questa ambiguità limita ciò che i filtri automatizzati possono dedurre da un prompt. Una richiesta di stabilire persistenza, estrarre credenziali o eludere il rilevamento appare pericolosa senza informazioni affidabili sul bersaglio e sull'autorizzazione.
Il programma di verifica fornisce quel contesto mancante prima che inizi una sessione. Collega un utente a un'organizzazione approvata, un livello di accesso, obblighi contrattuali, monitoraggio e una gamma definita di sistemi consentiti.
Tuttavia, la verifica non elimina il rischio tecnico. Gli account possono essere compromessi. I dipendenti possono oltrepassare la propria autorità. I contraenti possono perdere l'accesso senza che le autorizzazioni cambino tempestivamente. Un'infrastruttura autorizzata può connettersi a sistemi non approvati.
Il monitoraggio può rilevare un utilizzo sospetto, ma il rilevamento può avvenire dopo che un modello ha già generato un percorso d'attacco utile. I limiti di frequenza e i controlli sui bersagli possono ridurre l'esposizione, ma operatori esperti spesso distribuiscono il lavoro tra strumenti e account.
Il benchmark valuta inoltre soltanto un campione di scenari strutturati. Un tasso di completamento del 68 per cento non stabilisce come Claude si comporterà con software sconosciuto, apparecchiature industriali personalizzate o attacchi concatenati che coinvolgono ingegneria sociale.
Le evidenze di Anthropic supportano una conclusione più circoscritta. I controlli di accesso possono produrre comportamenti significativamente diversi tra i livelli, e i modelli Claude avanzati possono completare molte attività cyber quando le restrizioni vengono allentate.
Non è stabilito se tali controlli rimarranno affidabili su larga scala. Questa domanda diventa più importante man mano che il bacino dei candidati cresce oltre la coorte originale di Glasswing.
La revisione governativa aumenta la sicurezza e concentra l'autorità
Il governo degli Stati Uniti sta diventando parte del sistema di controllo degli accessi per i modelli cyber di frontiera, non soltanto un regolatore esterno.
Anthropic afferma di collaborare con il governo nella revisione di ogni organizzazione con Specialized Access. Questo assetto assegna ai funzionari pubblici un ruolo nel decidere quali istituzioni possano usare Claude contro sistemi di volo, reti elettriche, infrastrutture bancarie e altri bersagli sensibili.
La partnership ha una logica pratica. Le agenzie governative comprendono minacce classificate, infrastrutture nazionali, controlli sulle esportazioni e le conseguenze operative degli attacchi ai sistemi regolamentati. Possono inoltre confermare un'autorità legale che un fornitore privato di modelli non può valutare da solo.
Eventi recenti mostrano fino a che punto questa relazione si sia sviluppata. Secondo quanto riportato, Anthropic ha collaborato con le agenzie di intelligence statunitensi per testare un modello Mythos contro sistemi governativi classificati.
Un funzionario ha riferito all'Associated Press che il modello ha identificato alcune vulnerabilità nel giro di poche ore. Il funzionario ha sottolineato che identificare una debolezza non significava che Mythos l'avesse sfruttata nello stesso periodo.
Il senatore Mark Warner ha descritto l'esito in termini più drammatici durante un'audizione di giugno. Ha affermato che il sistema era entrato in quasi tutti gli ambienti classificati testati nel giro di poche ore, attribuendo quel resoconto al leader della National Security Agency e dell'U.S. Cyber Command.
La NSA e Anthropic hanno rifiutato di confermare i dettagli dei test classificati. Il divario tra le descrizioni pubbliche è un motivo per trattare con cautela le affermazioni più ampie.
Il coinvolgimento del governo ha anche prodotto conflitti. A giugno, l'amministrazione Trump ha sottoposto i rilasci di modelli di frontiera a una revisione della sicurezza nazionale e ha limitato l'accesso ad alcuni sistemi Anthropic.
Anthropic ha temporaneamente ritirato Fable 5 e Mythos 5 dopo una direttiva relativa all'accesso dei cittadini stranieri. Il governo ha poi approvato Mythos per un'implementazione limitata presso selezionati difensori cyber e fornitori di infrastrutture.
OpenAI ha affrontato una revisione simile per GPT-5.6 Sol. Entrambe le aziende hanno inizialmente limitato i loro sistemi più recenti a piccoli gruppi, trasformando l'accesso ai modelli di IA commerciali in una questione di politica per la sicurezza nazionale.
I sostenitori possono sostenere che sistemi cyber insolitamente capaci richiedano processi di rilascio insolitamente cauti. I fornitori di modelli non hanno visibilità completa sulle minacce di intelligence, mentre i governi non possono sviluppare autonomamente ogni modello di frontiera rilevante.
I critici vedono un assetto meno responsabile. La rappresentante Lori Trahan ha sostenuto che i nominati politici decidevano azienda per azienda chi ricevesse accesso, senza una legge chiara, un processo o una struttura di supervisione.
Questa critica si applica all'ampliato Anthropic Cyber Verification Program. Coinvolgere il governo può migliorare la verifica per bersagli sensibili, ma concentra anche l'autorità in un processo i cui criteri non sono completamente pubblici.
Le organizzazioni al di fuori degli Stati Uniti affrontano un'altra preoccupazione. Anthropic aveva in precedenza esteso Glasswing a partner in oltre 15 Paesi, e molti servivano popolazioni oltre i rispettivi mercati nazionali.
Il software critico è globale. I manutentori open-source, i fornitori cloud, i produttori di chip, i vendor di telecomunicazioni e le reti finanziarie attraversano abitualmente i confini nazionali. Un sistema fortemente plasmato dalle priorità di sicurezza di un solo governo può creare un accesso diseguale.
I modelli cyber più potenti potrebbero quindi diventare risorse strategiche distribuite attraverso relazioni geopolitiche. Ciò metterebbe pressione sulle organizzazioni affinché soddisfino sia le regole di un fornitore privato sia i requisiti di sicurezza nazionale di un governo.
Il programma necessita di procedure di ricorso chiare, standard coerenti, procedure di revoca verificabili e reportistica trasparente sulle esclusioni. Senza questi elementi, la verifica rischia di diventare un sistema opaco di licenze per una tecnologia difensiva sempre più importante.
Anthropic non ha presentato il programma come una politica pubblica permanente. Descrive l'accesso controllato come un ponte nell'attesa che vengano sviluppate salvaguardie più solide. Tuttavia, i sistemi temporanei spesso stabiliscono precedenti operativi che in seguito diventano difficili da sostituire.
Il vantaggio difensivo dipende dalle correzioni, non dalla scoperta
Claude può offrire ai difensori un vantaggio solo se le organizzazioni riparano le vulnerabilità prima che gli aggressori riproducano gli stessi risultati.
L'obiettivo dichiarato di Anthropic è spostare l'equilibrio a favore della difesa. Questo obiettivo appare intuitivo perché gli operatori delle infrastrutture possono ispezionare i propri sistemi, distribuire patch e coordinare la risposta agli incidenti prima di pubblicare i dettagli tecnici.
Gli aggressori hanno vantaggi diversi. Possono scegliere il bersaglio più debole, riutilizzare tecniche riuscite, operare tra diverse giurisdizioni e muoversi più velocemente dei processi di approvazione istituzionali.
I modelli avanzati possono amplificare entrambe le parti. Un difensore può analizzare milioni di righe di codice e stabilire le priorità delle falle pericolose. Un aggressore può usare un ragionamento simile per individuare un percorso trascurato verso un servizio esposto.
Il divario temporale determina chi ne beneficia. Una vulnerabilità scoperta privatamente e corretta rapidamente migliora la sicurezza. Una falla inserita in una coda di remediation lunga mesi resta utile agli aggressori, anche se i difensori l'hanno individuata per primi.
I totali delle vulnerabilità di Anthropic misurano quindi la scoperta, non un esito difensivo completo. Oltre 134.000 rilevamenti verificati rappresentano una produzione di ricerca sostanziale. Non rivelano quanti sistemi interessati restino esposti.
L'azienda afferma che meno della metà dei partner partecipanti ha comunicato dati sulle patch. Questo denominatore mancante impedisce una valutazione indipendente del fatto che la scoperta stia superando la remediation.
Un elevato volume di rilevamenti automatizzati può anche creare problemi operativi. I manutentori hanno bisogno di prove sufficienti per riprodurre una falla, comprenderne l'impatto e distinguere un problema sfruttabile da una debolezza teorica.
Segnalazioni con priorità inadeguata possono travolgere i progetti open-source gestiti da volontari. Informazioni dettagliate sugli exploit possono aumentare il rischio di divulgazione se passano attraverso troppe organizzazioni prima che esista una correzione.
Il programma ampliato assegna maggiore responsabilità ai candidati. I team di sicurezza necessitano di processi di gestione delle vulnerabilità, ambienti di test isolati, registrazione degli accessi, percorsi di escalation chiari e autorità per distribuire le correzioni.
Hanno anche bisogno di archivi durevoli. Le indagini assistite dall'IA possono generare lunghe catene di ipotesi, output degli strumenti, modifiche al codice e decisioni. Una base di conoscenza ingegneristica consultabile può aiutare i team a preservare quel contesto senza trattare le conclusioni del modello come fatti verificati.
La revisione umana resta necessaria. I modelli possono fraintendere i confini del sistema, proporre correzioni non sicure o identificare schemi che falliscono in condizioni operative reali. I sistemi industriali aggiungono vincoli fisici che i normali benchmark software non catturano.
Specialized Access aumenta la posta in gioco. Un'azione errata contro un ambiente di controllo del volo, un sistema di gestione della rete elettrica o una rete interbancaria può avere conseguenze che vanno oltre la perdita di dati.
Anthropic afferma che le restrizioni in tempo reale continuano ai livelli inferiori per le attività che potrebbero causare danni fisici o interruzioni di massa. Gli utenti specializzati ricevono meno blocchi proprio perché il loro lavoro talvolta richiede di testare questi scenari.
Il programma deve quindi valutare più del fatto che un'organizzazione appaia legittima. Deve stabilire se l'organizzazione sia in grado di isolare i bersagli, limitare le azioni del modello, supervisionare i test, riprendersi dai fallimenti e segnalare anomalie.
La revisione governativa può sostenere questa valutazione, ma la disciplina operativa resta locale. Un fornitore di modelli non può supervisionare ogni comando all'interno di un laboratorio di una utility o di una rete classificata.
La concorrenza aggiunge pressione. OpenAI ha anch'essa reso disponibili modelli cyber avanzati attraverso programmi controllati. Se i fornitori competono su quale sistema completi più attività offensive, le restrizioni di accesso possono diventare uno svantaggio commerciale.
Se competono soltanto sulla sicurezza, i difensori potrebbero scegliere modelli che offrono meno blocchi e una migliore simulazione degli attacchi. Ciò crea un incentivo ad allentare i controlli descrivendo la verifica come misura compensativa.
La struttura a livelli di Anthropic è un tentativo credibile di gestire questa pressione. Non risolve il conflitto sottostante. Le stesse capacità che rendono Claude utile contro aggressori sofisticati rendono più gravi le conseguenze di qualsiasi fallimento nella verifica.
Il vantaggio difensivo sarà visibile nei risultati della remediation, non nei benchmark dei modelli. Tassi di applicazione delle patch, tempi di riparazione, tassi di recidiva e incidenti prevenuti contano più del numero grezzo di vulnerabilità trovate.
Tre segnali mostreranno se l'accesso controllato funziona
Il prossimo test è se Anthropic riuscirà ad ampliare la partecipazione senza indebolire la verifica né sommergere i difensori di rilevamenti irrisolti.
Il primo segnale è la qualità dell'iscrizione. Anthropic afferma di poter esaminare molte candidature a Defense Access entro pochi giorni, mentre Red Team Access può richiedere settimane. Un'approvazione più rapida è utile soltanto se i controlli su identità, autorità e sicurezza restano coerenti.
L’azienda dovrebbe divulgare il numero aggregato di domande, i tassi di approvazione, i tempi di revisione, le revoche e le principali ragioni dei rifiuti. Non deve identificare i partecipanti sensibili per dimostrare se il sistema riesce a crescere in modo responsabile.
Un forte aumento degli accessi senza una corrispondente capacità di monitoraggio indebolirebbe la tesi di Anthropic. Standard di revisione stabili e bassi tassi di abuso la rafforzerebbero.
Il secondo segnale è il rapporto tra vulnerabilità individuate e corrette. Le 129.000 segnalazioni dei partner e le 5.500 segnalazioni open source di Anthropic forniscono una base di riferimento per l’individuazione.
Le future comunicazioni dovrebbero distinguere le segnalazioni confermate dai duplicati, dalle segnalazioni contestate e dalle vulnerabilità che interessavano software obsoleto. Dovrebbero inoltre indicare quanti problemi hanno ricevuto patch e con quale rapidità tali patch hanno raggiunto i sistemi distribuiti.
Tassi di patch più elevati sosterrebbero l’affermazione secondo cui i modelli di frontiera creano un vantaggio difensivo. Un arretrato crescente di problemi gravi irrisolti suggerirebbe che l’individuazione automatizzata sta mettendo in luce un collo di bottiglia organizzativo, anziché risolverlo.
Il terzo segnale è il modo in cui Anthropic gestisce il primo grave fallimento dell’accesso. Nessun sistema di verifica dovrebbe essere valutato soltanto durante il normale funzionamento.
Un account compromesso, un obiettivo non autorizzato, l’elusione di un classificatore o un’interazione accidentale con un sistema attivo metterebbero alla prova la risposta del programma. Le misure importanti includerebbero il tempo di rilevamento, il contenimento, la notifica, la revoca e le modifiche apportate successivamente.
Una rendicontazione trasparente degli incidenti rafforzerebbe la fiducia, anche se alcuni dettagli tecnici rimanessero riservati. Il silenzio renderebbe difficile per le organizzazioni esterne valutare i rischi reali dell’adesione al programma.
Anche Enterprise Frontier Safeguards influenzerà questo segnale. Anthropic afferma che il sistema pianificato combinerà la privacy con la protezione dagli abusi, consentendo alle organizzazioni idonee di mantenere le informazioni nei propri ambienti cloud.
Questa configurazione potrebbe rispondere alle preoccupazioni relative all’invio di codice sensibile e dati sugli incidenti a un fornitore di modelli. Potrebbe però anche rendere più difficile il monitoraggio centralizzato se i controlli si comportano diversamente nei vari ambienti gestiti dai clienti.
Il comportamento dei concorrenti resta sullo sfondo, ma plasmerà le scelte di Anthropic. Le distribuzioni cyber controllate di OpenAI offriranno ad acquirenti e regolatori un altro modello con cui confrontare accesso, supervisione e risposta agli incidenti.
Un accesso più ampio da parte di un concorrente farebbe pressione su Anthropic affinché acceleri le approvazioni. Un evento significativo di abuso altrove potrebbe spingerla verso requisiti più severi.
I lettori dovrebbero evitare di considerare l’Anthropic Cyber Verification Program una prova che le capacità cyber di frontiera siano ormai sicure. Si tratta di un esperimento di governance in corso, costruito attorno a una premessa difficile: istituzioni conosciute possono ricevere meno restrizioni perché la loro identità e i loro controlli riducono il rischio.
Questa premessa è verificabile. Anthropic ha pubblicato risultati di benchmark che mostrano come i suoi livelli di accesso modifichino il comportamento di Claude. Ha inoltre riportato un gran numero di segnalazioni verificate provenienti da distribuzioni controllate.
Le prove mancanti riguardano le operazioni su larga scala. Non sappiamo ancora con quale frequenza vengano bloccate richieste legittime, quante organizzazioni approvate violino le regole o quanto efficacemente Anthropic rilevi un account utilizzato al di fuori del suo ambito previsto.
Sviluppatori e responsabili della sicurezza dovrebbero seguire il programma perché sistemi di accesso simili possono estendersi oltre la cybersecurity. I modelli di frontiera con capacità biologiche, finanziarie o di ricerca autonoma potrebbero anch’essi richiedere autorizzazioni legate a utenti verificati e ambienti approvati.
Gli acquirenti enterprise dovrebbero chiedersi cosa cambi tecnicamente un livello di accesso. Dovrebbero inoltre esaminare la conservazione dei dati, il monitoraggio, la divulgazione degli incidenti, l’autorizzazione dei dipendenti e la responsabilità per le azioni generate dal modello.
Per i knowledge worker, la lezione più ampia è che l’accesso all’IA avanzata non arriverà sempre come un aggiornamento uniforme del prodotto. Il comportamento più capace potrebbe dipendere sempre più da chi sia l’utente, dall’istituzione che lo sostiene e dai sistemi che è autorizzato a testare.
Anthropic ha avvicinato questo futuro. Il suo programma offre a più difensori l’accesso alle capacità cyber avanzate di Claude, preservando al contempo restrizioni più forti per tutti gli altri.
L’esito dipenderà meno dai numeri delle vulnerabilità riportati nei titoli che da una correzione disciplinata e da una supervisione responsabile. Anthropic pubblicherà prove sufficienti per dimostrare che l’accesso verificato crea infrastrutture più sicure, oppure il primo grave fallimento rivelerà che la verifica è la salvaguardia più debole?



