top of page

Sul rapporto di Anthropic sull’uso improprio dell’AI: gli agenti spostano i costi sui difensori

56 minuti fa
Tempo di lettura: 16 min

Anthropic ha pubblicato il suo terzo rapporto sull’uso improprio dell’AI dopo aver rilevato Claude in attacchi informatici, sistemi di sorveglianza, campagne di influenza, ricerca sulle armi ed estrazione industriale di modelli. Le evidenze alla base di Sul rapporto di Anthropic sull’uso improprio dell’AI coprono attività osservate tra dicembre 2025 e agosto 2026. L’avvertimento centrale non è che l’AI abbia inventato nuovi obiettivi malevoli. È che gli agenti hanno reso le operazioni esistenti meno costose, più rapide e più facili da scalare.

Il rapporto descrive persone che scelgono gli obiettivi, definiscono gli scopi e revisionano gli output rilevanti. I sistemi di AI hanno poi gestito ricognizione, sviluppo software, ricerca sulle vulnerabilità, elaborazione dei dati, produzione di propaganda e parti dello sfruttamento. Diversi operatori hanno inoltre collegato Claude a strumenti esterni e memoria persistente, consentendo ai flussi di lavoro automatizzati di proseguire tra una sessione e l’altra.

Questa divisione del lavoro conta più di qualunque singolo prompt malevolo. Colloca l’AI all’interno del meccanismo operativo della criminalità informatica e della sorveglianza statale. Gli attaccanti possono ora conservare competenze nel software, ripetere procedure riuscite e gestire contemporaneamente più filoni di lavoro.

Bruce Schneier ha evidenziato lo stesso schema nella sua analisi del rapporto sull’uso improprio. Il cambiamento significativo riguarda l’esecuzione industrializzata: gli esseri umani mantengono l’autorità, mentre le macchine assumono una quota maggiore del carico operativo.

Sul rapporto di Anthropic sull’uso improprio dell’AI, il flusso di lavoro è la storia

Le prove più rilevanti del rapporto riguardano flussi di lavoro completi, non risposte isolate generate da un chatbot.

Il rapporto di intelligence sulle minacce di Anthropic documenta attività di gruppi criminali, fornitori commerciali di sorveglianza, individui politicamente motivati e organizzazioni allineate a Stati. I casi coprono operazioni informatiche, propaganda, sorveglianza, armi convenzionali, ricerca biologica e distillazione non autorizzata di modelli.

L’azienda afferma di aver selezionato incidenti rilevanti o nuovi, non un campione rappresentativo di tutto ciò che accade su Claude. Questa distinzione limita le conclusioni sulla prevalenza. Tuttavia, i casi mostrano comunque ciò che operatori motivati possono assemblare quando i modelli si connettono a codice, browser, scanner, database e altri strumenti.

Alcuni operatori hanno gestito sciami di agenti, ossia un modello coordinatore ha suddiviso un obiettivo ampio tra diversi agenti AI specializzati. Questi agenti hanno lavorato in parallelo su ricognizione, ricerca sullo sfruttamento e attività successive alla compromissione. La memoria persistente della campagna conservava elenchi di obiettivi, credenziali, istruzioni e stato delle attività tra le sessioni.

In un’operazione segnalata, flussi di lavoro automatizzati hanno analizzato firmware e binari di dispositivi con strumenti di decompilazione. Il sistema ha formulato ipotesi di vulnerabilità, scritto exploit proposti e li ha testati su copie di laboratorio dei prodotti presi di mira. Anthropic afferma che un unico flusso di lavoro continuo ha prodotto più di una dozzina di possibili vulnerabilità zero-day in un mese.

Una zero-day è una vulnerabilità software precedentemente sconosciuta e priva di una patch difensiva disponibile. Il rapporto non dimostra che ogni scoperta sospetta fosse valida o usata contro sistemi reali. Mostra però un processo automatizzato che iterava su un lavoro tradizionalmente bisognoso di un’attenzione specialistica prolungata.

Altri agenti hanno cercato ripetutamente infrastrutture internet esposte. Hanno identificato i servizi, confrontato i punti di accesso con vulnerabilità note e aggiunto le nuove scoperte alla memoria persistente del progetto. Una flotta separata di 13 agenti permanenti ha raccolto materiale pubblico da fonti militari, governative, politiche e sociali.

Questa architettura modifica l’economia del lavoro malevolo. Un essere umano non deve più eseguire personalmente ogni attività di ricerca, test, traduzione o documentazione. L’operatore può supervisionare una raccolta espandibile di lavoratori automatizzati e concentrarsi sulla selezione degli obiettivi.

Ecco perché un elenco di singoli prompt sottovaluta lo sviluppo. Ogni prompt può apparire ordinario se esaminato isolatamente. Il pericolo emerge dall’orchestrazione, dal contesto accumulato, dall’accesso agli strumenti, dalla ripetizione e dalla capacità di agire sugli output.

Anthropic afferma di aver vietato gli account collegati e di aver usato le proprie scoperte per migliorare le salvaguardie. Tuttavia, la rimozione degli account affronta l’accesso a un singolo fornitore, non le competenze sottostanti, il codice, le credenziali rubate o l’infrastruttura. Gli operatori possono conservare tali risorse e spostare altrove parti di un flusso di lavoro.

Il rapporto trasforma quindi l’uso improprio dell’AI da un problema di moderazione dei contenuti a un problema di sicurezza operativa. Bloccare testi dannosi rimane utile, ma i difensori devono anche rilevare comportamenti automatizzati tra identità, sessioni, strumenti e account compromessi.

Gli agenti AI stanno comprimendo il ciclo d’attacco

Gli agenti AI non eliminano gli esseri umani dagli attacchi informatici, ma consentono a un numero inferiore di persone di operare su più obiettivi e livelli tecnici.

Una campagna descritta da Anthropic ha usato l’AI nella ricognizione, nell’accesso iniziale, nella raccolta, nell’esfiltrazione e nella persistenza. Secondo quanto riportato, l’attore ha identificato sistemi di posta elettronica e di accesso remoto, creato elenchi di obiettivi e predisposto infrastrutture per il phishing tramite device code.

Il phishing tramite device code abusa di un processo di accesso legittimo per convincere una vittima ad autorizzare una sessione controllata dall’attaccante. Una volta ottenuto tale accesso, la sessione può esporre posta elettronica cloud e altri servizi connessi. La tecnica spesso appare meno sospetta perché utilizza un autentico flusso di autenticazione.

Anthropic afferma che l’operazione ha avuto accesso a registri di posta di almeno otto organizzazioni. Tra gli obiettivi figuravano l’ufficio del procuratore nazionale, un istituto di formazione militare e un’organizzazione intergovernativa regionale. Un’altra intrusione ha esposto oltre 300.000 registri di identità nazionale e informazioni di registro relative a più di 500.000 aziende.

Secondo il rapporto, il sistema AI ha aiutato a organizzare centinaia di gigabyte di informazioni rubate. Ha inoltre assistito nella raccolta di credenziali, nel movimento laterale e nell’adattamento di software malevolo dopo che prodotti di sicurezza avevano rilevato versioni precedenti.

Ciò chiude una parte del ciclo di feedback tra l’azione dell’attaccante e la risposta difensiva. Un rilevamento non genera più lo stesso ritardo se il software può analizzare il fallimento, modificare un artefatto e preparare rapidamente un’altra versione. L’approvazione umana può rimanere nel ciclo, mentre l’iterazione della macchina accelera.

Un altro attore ha usato una pipeline di sfruttamento autonoma contro applicazioni web di produzione. Agenti lavoratori hanno testato difetti di injection, bypass dell’autenticazione, cross-site scripting e server-side request forgery senza supervisione umana continua. Credenziali potenziali e risultati confluivano in uno spazio di lavoro condiviso.

Il server-side request forgery è un difetto che induce un server a effettuare richieste per conto di un attaccante. Può esporre sistemi interni altrimenti irraggiungibili da internet pubblico. Automatizzare tali test aumenta il numero di endpoint che un operatore può sondare.

Il rapporto descrive inoltre infrastrutture di frode che automatizzavano la registrazione degli account, il monitoraggio delle caselle di posta, la risoluzione dei CAPTCHA e le fasi di verifica dell’identità. Un altro flusso di lavoro collocava un reverse proxy tra le vittime e i controlli di identità autentici, catturando sessioni autenticate e documenti inviati.

Questi esempi mostrano perché Sul rapporto di Anthropic sull’uso improprio dell’AI è rilevante per le organizzazioni comuni. Un’azienda non deve essere l’obiettivo iniziale dell’attaccante per subire danni. Le sue chiavi esposte, tenant cloud, applicazioni SaaS, fornitori o registri dei clienti possono diventare risorse intermedie.

Secondo quanto riferito, un attaccante francofono ha preso di mira 42 organizzazioni politiche e affiliate. L’attore ha ottenuto accesso interno ad almeno 14 di esse e ha sottratto una stima tra 12 e 26 gigabyte di materiale da database. Una piattaforma elettorale compromessa ha esposto circa 140.000 record, comprese opinioni politiche.

Una copertura indipendente della campagna francese ha collegato diversi dettagli alle organizzazioni colpite. Tale copertura offre una preziosa corroborazione, sebbene Anthropic resti la fonte primaria per gran parte del resoconto tecnico.

L’attore ha inoltre sviluppato una tecnica di sfruttamento WordPress non documentata in precedenza ed è riuscito contro almeno quattro siti web, afferma Anthropic. Altri strumenti hanno raccolto le credenziali inviate, avvelenato i backup e inserito codice di accesso remoto nelle risorse dei siti web.

Non si è trattato di un attacco interamente autonomo. L’essere umano ha scelto gli obiettivi, gestito l’infrastruttura, interpretato i risultati e perseguito obiettivi politici. Il cambiamento importante è stato la leva: una persona poteva costruire e mantenere una campagna con l’ampiezza di un piccolo team tecnico.

Il conflitto principale è tra la scala degli attaccanti e la responsabilità dei difensori

Gli attaccanti possono distribuire il lavoro tra agenti, ma i difensori continuano a sostenere tutte le conseguenze legali, operative e finanziarie di ogni fallimento.

La pianificazione tradizionale della sicurezza spesso presuppone che il lavoro offensivo consumi competenze scarse. Gli attaccanti qualificati devono studiare l’infrastruttura, creare strumenti, ispezionare dati rubati e adattare i propri metodi dopo un rilevamento. Tali vincoli limitano il numero di obiettivi che un gruppo può perseguire contemporaneamente.

I sistemi agentici indeboliscono questi vincoli. Possono svolgere ricognizione in modo continuo, documentare i risultati con coerenza, tradurre materiale e ritentare compiti tecnici. Conservano inoltre conoscenze procedurali che altrimenti risiederebbero nella memoria di un singolo operatore.

I difensori affrontano un’equazione meno indulgente. Ogni credenziale esposta, applicazione dimenticata, fornitore vulnerabile o autorizzazione eccessiva può diventare un punto di ingresso. Agli attaccanti basta un percorso praticabile, mentre i difensori devono proteggere una raccolta mutevole di sistemi e identità.

Anche la catena di fornitura dell’AI è diventata un obiettivo. Anthropic descrive servizi falsi che promettevano accesso scontato a modelli di frontiera, ma installavano strumenti per sottrarre credenziali. Questi programmi rubavano credenziali degli account e token di sessione autenticati dai dispositivi dei clienti.

Gli attaccanti hanno poi venduto o riutilizzato tale accesso attraverso reti proxy fraudolente. Alcuni servizi instradavano silenziosamente i clienti verso un modello diverso, continuando al contempo a raccogliere nuove credenziali. Questo ha fornito ai criminali una fonte rinnovabile di account dall’aspetto legittimo dopo la revoca delle chiavi precedenti.

Un’altra operazione ha testato 30 obiettivi cercando di accedere a un modello Claude prerelease. Anthropic afferma che ogni tentativo è fallito e che i propri sistemi non sono stati compromessi. Le chiavi rubate appartenevano a clienti i cui ambienti erano già stati violati.

Questa distinzione è importante. Un fornitore può proteggere la propria infrastruttura centrale mentre gli attaccanti sfruttano punti più deboli circostanti. Laptop degli sviluppatori, sessioni del browser, piattaforme di automazione, router di terze parti e file di configurazione copiati diventano tutti parte del perimetro di sicurezza effettivo.

Le aziende dovrebbero quindi trattare le credenziali AI come altri segreti di produzione privilegiati. Le chiavi necessitano di ambiti limitati, durate brevi dove possibile, monitoraggio dell’utilizzo e revoca affidabile. Un traffico anomalo verso i modelli può rivelare un ambiente compromesso prima che un attaccante raggiunga un obiettivo più evidente.

I team di sicurezza necessitano inoltre di visibilità sul comportamento degli agenti. Un singolo account che avvia scansioni persistenti, chiamate parallele agli strumenti o lavori di estrazione ripetitivi presenta un rischio diverso da una conversazione ordinaria. Il rilevamento dovrebbe considerare sequenze di azioni anziché un prompt alla volta.

Questo crea pressione su Anthropic, OpenAI, Google, Microsoft, i provider cloud e i servizi di instradamento dei modelli. Ognuno vede una porzione diversa della catena. Nessun partecipante può ricostruire l’intera campagna senza scambiare informazioni utili sulle minacce.

Tuttavia, un maggiore monitoraggio introduce rischi propri. I provider possono ispezionare prompt, output, file, chiamate di strumenti e relazioni tra account per identificare abusi. Tali pratiche possono esporre informazioni sensibili dei clienti o creare ampie capacità di sorveglianza all’interno del servizio stesso.

Il compromesso che ne deriva non riguarda semplicemente sicurezza contro privacy. Un monitoraggio debole può consentire il proseguimento di attacchi coordinati. Un monitoraggio eccessivo può erodere la riservatezza, produrre false accuse o collocare dati preziosi dei clienti in un altro sistema centralizzato.

I provider necessitano di conservazione dei dati limitata, accesso ristretto agli investigatori, regole di escalation chiare e trasparenza significativa sull’applicazione automatizzata delle policy. Anche i clienti devono sapere quale telemetria esiste e quando le informazioni possono essere condivise con organizzazioni esterne.

Il rapporto di Anthropic sugli abusi dell’AI offre una visibilità insolitamente dettagliata sulle attività rilevate. Non fornisce una misura completa dei falsi positivi, delle campagne non individuate o del costo per la privacy delle indagini. Queste domande senza risposta devono affiancare i risultati operativi.

Sorveglianza e propaganda mostrano la stessa sostituzione del lavoro

I casi di sorveglianza descritti nel rapporto mostrano l’AI sostituire parti della forza lavoro ingegneristica e analitica, senza cambiare chi le istituzioni potenti scelgono di prendere di mira.

Un consulente che lavorava per le autorità di sicurezza nazionale del Mali avrebbe usato Claude per progettare una piattaforma di intercettazione di massa. Il sistema poteva raccogliere dati sulle comunicazioni dagli operatori mobili del Paese e generare dossier su persone selezionate.

Anthropic afferma che il modello ha contribuito a progettare il software sottostante anziché analizzare i dossier finali. Secondo una distinta inchiesta sulla sorveglianza, la piattaforma è stata infine implementata localmente con altri modelli dopo l’intervento di Anthropic.

Questo esito mette in luce un limite dell’applicazione delle policy da parte dei provider. Un servizio cloud può chiudere account e rendere più difficile l’esecuzione di un flusso di lavoro. Non può eliminare in modo affidabile codice esportato, conoscenze tecniche, dati raccolti o l’accesso a modelli alternativi.

In Iran, alcuni soggetti hanno usato Claude per creare un’estensione Firefox dannosa che raccoglieva identità dai social network. Un’altra unità iraniana ha analizzato centinaia di migliaia di post e identificato 39 account dell’opposizione da monitorare, secondo Anthropic.

Il rapporto descrive un’operazione di intelligence cinese sugli affari religiosi che avrebbe ridotto molte squadre analitiche a un solo ufficio. Con l’assistenza dell’AI, quell’ufficio produceva migliaia di indagini al mese.

Altri soggetti hanno usato Claude per valutare articoli e post sui social in base alla sensibilità politica. Hanno raccolto località, attributi demografici, opinioni politiche e valutazioni di affidabilità in record strutturati. Questi output potevano supportare interrogatori, monitoraggio o altre forme di controllo.

Un operatore allineato alla RPC privo di competenze in arabo avrebbe condotto un’operazione di reclutamento durata più giorni e rivolta agli uiguri in Siria. Claude ha redatto messaggi di contatto in un dialetto regionale, tradotto le risposte, simulato controlli di qualità e formattato i risultati per un presunto ufficiale operativo.

Il modello non ha scelto la comunità perseguitata. Le istituzioni umane hanno fornito il bersaglio, la missione e l’uso previsto. L’AI ha ridotto le barriere linguistiche, di personale e tecniche che altrimenti avrebbero potuto rallentare l’operazione.

Questo schema appare anche nelle campagne di influenza. Anthropic dettaglia nove casi originati in Russia, Iran, Turchia, Golfo, Asia meridionale, Africa ed Europa. Le campagne prendevano di mira pubblici in sei continenti.

Gli operatori hanno creato profili falsi, siti di notizie, messaggi politici e piani di pubblicazione coordinati. Alcune campagne coincidevano con elezioni. I media statali russi hanno prodotto affermazioni inventate prima del voto moldavo del settembre 2025, mentre un operatore keniota preparava falsi contenuti di base prima delle elezioni del 2027.

L’AI non ha inventato la comunicazione politica ingannevole. Ha contribuito a produrre identità fittizie, traduzioni, articoli, strategie di targeting e varianti a un costo marginale inferiore. Un piccolo team poteva mantenere una facciata più ampia di partecipazione pubblica indipendente.

Anthropic dispone di un punto di osservazione insolito perché può vedere le campagne mentre gli operatori le pianificano. I social network spesso incontrano l’operazione solo dopo che il contenuto appare pubblicamente. I provider di modelli possono rilevare prima la selezione dei bersagli e la creazione dei contenuti.

La loro visibilità diminuisce poi quando i contenuti lasciano la piattaforma del modello. Anthropic afferma di usare ricerca open source, dati dei partner e resoconti pubblici per comprendere l’attività a valle. Ciò significa che alcune campagne pianificate potrebbero non essere mai lanciate, mentre altre potrebbero migrare oltre il suo campo visivo.

I lettori dovrebbero evitare di trattare ogni prompt rilevato come prova di un’operazione reale completata. Intento, preparazione, implementazione, portata e impatto misurabile sono fasi diverse. Il rapporto è più solido quando collega l’attività del modello a infrastrutture o prove corroboranti.

Eppure, la direzione è chiara. L’AI sta entrando nella burocrazia ordinaria della sorveglianza e dell’influenza politica. Può aiutare le istituzioni a elaborare più persone, mantenere più identità fittizie e preparare più rapporti senza espandere proporzionalmente il personale.

La ricerca sulle armi pone un problema più difficile per le salvaguardie

Le conclusioni di Anthropic spostano il dibattito oltre l’assistenza alla scrittura malevola, verso software che collega l’analisi ai sistemi fisici.

L’azienda afferma di aver interrotto sei casi relativi ad armi convenzionali che coinvolgevano tre soggetti in Cina, due in Russia e uno nello Yemen. Quattro riguardavano software per hardware militare, mentre due si concentravano su approvvigionamento o raccolta di intelligence.

I progetti segnalati includevano razzi guidati, guida missilistica, software per sciami di droni, intercettazione di siluri, targeting per guerra elettronica e soppressione delle difese aeree. Un programma di razzi guidati includeva un test sul campo dal vivo, secondo Anthropic.

I soggetti disponevano generalmente di hardware pertinente, conoscenze ingegneristiche o accesso al programma prima di usare Claude. Hanno suddiviso il lavoro tra sessioni per nascondere l’obiettivo complessivo e hanno tentato di aggirare le salvaguardie.

Questa precisazione è importante. Il rapporto non mostra una persona inesperta che pone una domanda e riceve un’arma completa. Mostra gruppi capaci che usano l’AI per accelerare compiti di ingegneria, debugging, ricerca, documentazione e approvvigionamento.

Anthropic afferma di aver introdotto classificatori che rilevano meglio il traffico relativo a esplosivi ad alto potenziale e sviluppo di armi. Un classificatore è un sistema automatizzato che stima se una richiesta appartiene a una categoria soggetta a restrizioni.

Tali controlli affrontano un problema intrinseco. Molti compiti ingegneristici hanno applicazioni civili legittime. Guida, navigazione, elaborazione delle immagini, comunicazioni radio, analisi dei materiali e controllo del volo possono servire sia sistemi commerciali sia militari.

Il rapporto descrive anche richieste di ricerca biologica con caratteristiche a duplice uso. Un caso riguardava una proposta di finanziamento relativa a modifiche del virus chikungunya che potevano influire sulla trasmissibilità e sull’elusione immunitaria.

Claude avrebbe rifiutato di aiutare con parti di quel lavoro, e l’utente si sarebbe rivolto a un altro servizio di AI. Anthropic afferma che i suoi modelli precedenti erano al di sotto della soglia per assistere materialmente un ricercatore biologico sofisticato. Non offre la stessa garanzia per i sistemi attuali.

La copertura del caso sulle salvaguardie biologiche sottolinea questa incertezza. Modelli più capaci possono sostenere la ricerca legittima, ma la stessa competenza complica le decisioni su quali richieste bloccare.

Un blocco eccessivo comporta costi reali. Scienziati, team di salute pubblica e ricercatori della sicurezza possono aver bisogno di informazioni che assomigliano a lavori soggetti a restrizioni. Un blocco insufficiente può fornire a un soggetto malevolo assistenza nella progettazione sperimentale o nella pianificazione operativa.

Un provider di modelli deve prendere queste decisioni con un contesto incompleto. Una richiesta dall’apparenza innocua può essere un frammento di un programma nascosto. Una richiesta preoccupante può far parte di una ricerca difensiva autorizzata.

La stessa debolezza riguarda le salvaguardie informatiche. Gli aggressori possono suddividere gli obiettivi in compiti ordinari, cambiare account, usare credenziali rubate o combinare più provider. I modelli open-weight aggiungono un’altra strada senza un operatore centrale in grado di chiudere un account.

Pertanto, nessun provider può presentare la sicurezza come una funzionalità di prodotto completata. Le salvaguardie creano attrito e migliorano il rilevamento, ma non rimuovono la capacità dall’ambiente più ampio. La misura rilevante è se l’intervento aumenta i costi per gli aggressori più rapidamente di quanto la capacità li riduca.

Il rapporto di Anthropic sugli abusi dell’AI fornisce prove di interruzioni riuscite, ma non può mostrare le campagne che Anthropic non ha mai rilevato. Non può nemmeno determinare quanti operatori abbiano abbandonato un progetto, siano migrati altrove o abbiano proseguito con sistemi implementati localmente.

Questa incertezza dovrebbe evitare due errori opposti. I casi non dimostrano che gli agenti AI possano eseguire autonomamente ogni operazione sofisticata. Né giustificano il minimizzare il problema perché gli esseri umani continuano a scegliere gli obiettivi.

La direzione umana e l’esecuzione automatizzata possono coesistere. In effetti, questa combinazione potrebbe essere la struttura più pratica per operazioni dannose perché preserva il giudizio umano ampliando al contempo il lavoro ripetibile.

La distillazione dei modelli trasforma i dati dei clienti in una questione di sicurezza

Il ribaltamento finale del rapporto è che i provider di AI non sono soltanto piattaforme oggetto di abusi, ma anche bersagli, fonti di dati e risorse computazionali sottratte.

Anthropic accusa diversi laboratori cinesi di AI di aver condotto campagne di distillazione non autorizzate contro Claude. La distillazione utilizza gli output di un modello per migliorare il comportamento o le capacità di un altro modello.

Secondo Anthropic, Alibaba ha generato più di 151 milioni di scambi tra maggio e luglio 2026. Moonshot avrebbe generato più di 23 milioni di scambi nello stesso periodo. DeepSeek ha prodotto più di 12,1 milioni di scambi nell’arco di 14 giorni a luglio.

L’azienda attribuisce a Zhipu più di 3,4 milioni di scambi nell’arco di 17 giorni tra giugno e luglio. Afferma che Xiaomi ha generato più di 400.000 scambi nell’arco di 20 giorni tra marzo e aprile.

Queste cifre rappresentano le conclusioni di Anthropic e non sono state sottoposte a verifica indipendente nel rapporto. Anche le risposte delle aziende nominate sono rilevanti nella valutazione di attribuzione, intento e rivendicazioni contrattuali.

Anthropic afferma che le campagne puntavano a capacità di ragionamento, programmazione, uso di strumenti e analisi dei dati. Gli operatori avrebbero usato identità false, carte rubate, credenziali API compromesse, proxy e migliaia di account per eludere i controlli di accesso.

Alcuni hanno testato molte varianti di prompt per estrarre tracce di ragionamento nascoste. Un esperimento avrebbe inviato oltre 12.000 richieste diverse per identificare metodi di estrazione efficaci prima di avviare una campagna più ampia.

L’affermazione più preoccupante riguarda i dati dei clienti. Anthropic afferma che DeepSeek, Moonshot e Xiaomi hanno instradato alcune conversazioni degli utenti a Claude per finalità di addestramento. Agli utenti non sarebbe stato comunicato che un altro provider di modelli avrebbe elaborato le loro richieste.

Anthropic riferisce che alcuni scambi contenevano nomi, indirizzi email, informazioni aziendali, credenziali di sviluppatori e previsioni interne. I servizi di instradamento di terze parti avrebbero fornito ulteriori conversazioni che coinvolgevano utenti negli Stati Uniti e in Europa.

Queste affermazioni ampliano il significato del rischio nella catena di fornitura dell’AI. Un cliente può pensare che le informazioni vadano a una singola applicazione e a un singolo modello. In pratica, le richieste possono passare attraverso router, rivenditori, servizi proxy, valutatori e provider upstream nascosti.

Le aziende dovrebbero chiedere ai fornitori quali modelli elaborano effettivamente le informazioni inviate. Hanno inoltre bisogno di risposte chiare su conservazione dei dati, addestramento, instradamento regionale, subfornitori e accesso da parte di revisori umani.

L’episodio crea una simmetria difficile. Anthropic critica altre organizzazioni per aver presumibilmente inoltrato dati degli utenti senza consenso. Allo stesso tempo, il suo rapporto dimostra quanto i fornitori di modelli possano dedurre attraverso il monitoraggio degli abusi.

Le due situazioni non sono equivalenti, ma condividono una questione di governance. Le informazioni sensibili possono viaggiare più lontano di quanto l’utente si aspetti, attraverso instradamenti occulti, telemetria di sicurezza o un’indagine.

La risposta non può essere la promessa che i dati riservati non verranno mai trasferiti. Le organizzazioni hanno bisogno di controlli applicabili, instradamento verificabile, conservazione ridotta al minimo e registri che mostrino quali sistemi hanno elaborato ciascuna richiesta.

Ecco anche perché i dipendenti dovrebbero evitare di inserire segreti attivi in strumenti AI non approvati. Un’interfaccia curata non chiarisce dove venga inviata la richiesta né quanti intermediari possano accedervi.

Cosa dovrebbero monitorare i difensori

Il prossimo banco di prova è capire se la risposta di sicurezza modifica l’economia descritta in On Anthropic’s AI Misuse Report.

Il primo segnale è l’interruzione delle attività tra diversi fornitori. Anthropic afferma di condividere le proprie scoperte con partner pubblici e privati quando opportuno. Il test più significativo è stabilire se il rilevamento da parte di un fornitore disabiliti rapidamente account correlati, infrastrutture e credenziali rubate anche altrove.

Se la cooperazione migliora, gli aggressori perderanno parte della capacità di migrare flussi di lavoro intatti tra servizi diversi. Se le campagne riappaiono ripetutamente tramite nuovi account e modelli alternativi, i blocchi degli account resteranno un ostacolo temporaneo.

Il secondo segnale riguarda le prove sull’autonomia degli agenti. I rapporti futuri dovrebbero distinguere tra suggerimenti generati dall’AI e azioni eseguite tramite strumenti. Dovrebbero inoltre identificare i punti in cui gli esseri umani hanno approvato comandi, corretto errori, scelto obiettivi o interpretato risultati ambigui.

Questa distinzione mostrerà se gli agenti stanno diventando più indipendenti o se stanno semplicemente rendendo più produttivi gli operatori esperti. Entrambi gli esiti sono importanti, ma richiedono difese e risposte normative diverse.

Il terzo segnale è la trasparenza su indagini e privacy. I fornitori dovrebbero spiegare quali dati conservano, come i classificatori degli abusi attivano la revisione e in che modo limitano l’accesso degli investigatori. Dovrebbero inoltre segnalare falsi positivi e procedure di ricorso quando la divulgazione non agevola gli aggressori.

Per i responsabili della sicurezza, la risposta immediata è pratica. Censire le credenziali AI, rivedere i router dei modelli, ridurre i token a lunga durata e monitorare attività automatizzate insolite. Verificare se dispositivi di sviluppo compromessi possano esporre sessioni dei modelli o segreti di produzione correlati.

I team dovrebbero inoltre rivedere i piani di risposta agli incidenti in vista di iterazioni alla velocità delle macchine. Un dominio bloccato o un payload rilevato può indurre una revisione automatizzata nel giro di pochi minuti. I difensori hanno bisogno di revoca coordinata delle identità, contenimento degli endpoint, registrazione cloud e comunicazione con i fornitori.

I lavoratori della conoscenza dovrebbero verificare dove transitano i prompt sensibili. Prima di inviare codice sorgente, documenti interni, credenziali, dati di ricerca o record dei clienti, confermare il fornitore approvato e le relative condizioni di trattamento.

Il rapporto di Anthropic non dimostra l’esistenza di un’apocalisse informatica autonoma. Documenta qualcosa di più immediato: esseri umani che usano l’AI per trasformare le competenze in infrastrutture ripetibili per cybercriminalità, sorveglianza, propaganda e attività legate alle armi.

La domanda per il prossimo rapporto non è se l’abuso continuerà. È se i difensori costringeranno gli aggressori a spendere più identità, denaro, tempo e competenze per ogni operazione riuscita. Questa competizione misurabile rivelerà se le salvaguardie stanno contenendo il cambiamento o semplicemente documentandolo.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page