Secondo quanto riferito, Kriminal AI ha aggirato le protezioni noleggiando modelli legittimi
Kriminal AI è arrivata su Google News dopo che i ricercatori hanno segnalato una netta contraddizione: il modello criminale apparentemente senza restrizioni veniva in larga parte noleggiato da fornitori di AI legittimi. Il servizio commercializzava intelligence su misura e priva di protezioni, mentre avrebbe instradato le richieste verso Grok, Claude e altri modelli affermati. Questa scoperta sposta la questione della sicurezza da chi possa costruire un modello dannoso a chi possa riconfezionare infrastrutture lecite per fini abusivi.
ThreatDown ha pubblicato la propria indagine tecnica il 18 agosto 2026. I ricercatori hanno affermato che Kriminal esponeva parti del proprio stack di fornitori nel JavaScript di produzione distribuito attraverso il suo sito web pubblico. Hanno inoltre interrogato il servizio sul suo modello e sulle istruzioni di sistema, pur avvertendo che tali risposte autodichiarate non costituiscono una prova definitiva.
Il risultato mette in discussione l'approccio alla sicurezza dell'AI incentrato sul modello. I fornitori possono investire molto nell'addestramento di modelli più sicuri, ma una vetrina esterna può combinare fiducia sottratta, prompt avversariali, inferenza noleggiata e infrastrutture frammentate. Ogni fornitore vede una singola transazione, mentre nessuno necessariamente vede l'intero servizio criminale.
Cosa ha scoperto l'indagine su Kriminal AI
Secondo quanto riferito, Kriminal operava meno come un laboratorio di AI indipendente e più come un rivenditore dotato di un livello di jailbreak.
Secondo l'indagine su Kriminal, il servizio sosteneva di offrire un sistema di AI privo di filtri o protezioni. La sua interfaccia pubblica ricordava un'attività software convenzionale, completa di account, abbonamenti, aggiornamenti del servizio e dashboard di stato.
Questa presentazione era rilevante. I precedenti chatbot criminali spesso circolavano attraverso forum clandestini, canali di messaggistica privati o siti web temporanei. Kriminal si sarebbe invece presentata sul web aperto, dove i motori di ricerca potevano indicizzarla e i potenziali clienti potevano accedere tramite una normale pagina di login.
ThreatDown ha affermato che il servizio promuoveva diverse modalità specializzate. Queste coprivano intelligence finanziaria, ricerca di exploit, analisi di documenti, social engineering e costruzione di identità. Le modalità davano l'impressione di agenti tecnici distinti, progettati per differenti fasi dell'attività criminale.
I ricercatori hanno trovato un'architettura diversa nel codice front-end pubblico. Quest'ultimo avrebbe identificato Grok di xAI come motore di inferenza principale, ossia il sistema che produceva la maggior parte delle risposte del modello. OpenRouter sembrava fungere da instradamento verso modelli specialistici, inclusi Mistral Large e Llama 3.3.
Secondo i ricercatori, Claude di Anthropic appariva anch'esso come opzione per attività con contesto esteso. Hanno osservato che il codice non stabiliva in che modo Kriminal avesse ottenuto tale accesso. Tavily avrebbe fornito la ricerca web in tempo reale, mentre Google Cloud e Cloudflare apparivano altrove nello stack del servizio.
Questi risultati non stabiliscono in modo indipendente che ogni fornitore nominato servisse consapevolmente Kriminal. Non mostrano neppure se gli operatori abbiano utilizzato account diretti, intermediari, credenziali compromesse o un altro metodo di accesso. I nomi dei fornitori nel codice lato client possono essere obsoleti, fuorvianti o inseriti deliberatamente.
ThreatDown ha quindi utilizzato diverse forme di evidenza. I ricercatori hanno ispezionato il codice di produzione, confrontato la configurazione esposta con il comportamento del servizio e chiesto al chatbot di identificare il proprio motore sottostante. Secondo quanto riferito, il chatbot ha indicato Grok, in linea con il riferimento al fornitore trovato nel codice.
Quando gli sono state chieste le istruzioni di sistema, il servizio ha anche restituito un prompt che ordinava al modello di ignorare le limitazioni. Un prompt di sistema è un'istruzione ad alta priorità inserita attorno a una richiesta dell'utente per modellare il comportamento del modello. In questo caso, l'istruzione segnalata tentava di sopprimere le protezioni applicate dal fornitore sottostante.
I ricercatori hanno opportunamente trattato le dichiarazioni del chatbot come indicative, non conclusive. Un modello può allucinare la propria identità, ripetere testo inserito deliberatamente o rispondere secondo una persona. La configurazione di produzione ha fornito un segnale separato, ma gli esterni continuano a non disporre di registri lato server che dimostrino l'intero percorso delle richieste.
Questa distinzione è importante quando un titolo si diffonde attraverso Google News. La conclusione più solidamente supportata è che il codice esposto e le risposte osservate di Kriminal indicassero modelli commerciali noleggiati. Non costituisce prova che ogni funzionalità pubblicizzata funzionasse, che ogni dichiarazione d'uso mostrata fosse accurata o che ogni fornitore rimanesse collegato.
L'indagine rivela comunque il capovolgimento centrale. Kriminal avrebbe pubblicizzato l'indipendenza dai controlli dell'industria dell'AI pur affidandosi a quella stessa industria per intelligence, hosting, instradamento, ricerca e distribuzione.
Perché l'attenzione di Google News cambia la posta in gioco della sicurezza
La visibilità pubblica di Kriminal trasforma l'AI criminale da un problema di modelli nascosti in un problema di applicazione delle regole lungo la supply chain.
Il servizio non aveva bisogno di addestrare un modello di frontiera. L'addestramento richiede ricercatori specializzati, grandi dataset, un'estesa infrastruttura di calcolo e investimenti operativi continui. Noleggiare l'accesso ai modelli trasferisce la maggior parte di questi oneri alle aziende che li hanno già sostenuti.
Il contributo che Kriminal avrebbe apportato era il packaging. Combinava una vetrina pubblica, personaggi specifici per attività, infrastruttura di pagamento, un endpoint compatibile con gli sviluppatori e istruzioni pensate per indebolire le protezioni del modello. Questo pacchetto potrebbe ridurre le competenze necessarie per sperimentare flussi di lavoro criminali assistiti dall'AI.
Questo schema esercita innanzitutto pressione sui fornitori di modelli di frontiera. Le loro policy disciplinano gli utenti diretti, ma rivenditori e wrapper possono nascondere lo scopo del cliente finale. Un fornitore può vedere traffico API dall'aspetto normale finché comportamenti, volumi, segnali di pagamento o ripetute violazioni delle policy non rivelano un'operazione più ampia.
L'attuale policy di utilizzo accettabile di SpaceXAI vieta jailbreak, prompting avversariale, prompt injection, hacking dannoso, phishing e la rivendita di input o output dei modelli. Vieta inoltre servizi a pagamento che incoraggino violazioni attraverso output generati dai suoi sistemi.
Tali regole creano una base contrattuale per l'applicazione delle misure. Tuttavia, le restrizioni scritte non rivelano se Kriminal abbia usato un account diretto, per quanto tempo sia durato un eventuale accesso o se il fornitore lo avesse già identificato. Né la policy né le prove dei ricercatori stabiliscono lo stato di account specifici.
I fornitori cloud e di rete affrontano un problema diverso. Una società di hosting può vedere una normale applicazione web anziché il significato di ogni interazione con il modello. Un fornitore edge può identificare schemi di traffico, segnalazioni di abuso e relazioni infrastrutturali senza leggere automaticamente ogni richiesta crittografata.
I router di modelli e i fornitori di ricerca occupano un'altra porzione ristretta. Possono applicare i propri termini e indagare sugli account, ma potrebbero non sapere in che modo un'applicazione a monte etichetti o rivenda una risposta. I processori di pagamento vedono le transazioni senza necessariamente vedere il servizio erogato in seguito.
Questa frammentazione crea resilienza. La rimozione di un account può interrompere una funzione senza smantellare la vetrina. Gli operatori possono sostituire un modello, spostare l'hosting, cambiare canali di pagamento o rinominare un servizio mantenendo il brand rivolto al cliente.
Per questo l'inquadramento di Google News non dovrebbe ridurre la storia a una singola protezione fallita. L'operazione denunciata dipendeva da molti componenti legittimi, le cui singole visuali restavano incomplete. Ogni fornitore poteva agire entro il proprio perimetro mentre il servizio assemblato continuava altrove.
La pressione raggiunge anche i team di sicurezza aziendale. Bloccare un noto dominio criminale affronta l'accesso diretto dei dipendenti, ma non impedisce agli aggressori di usare gli stessi modelli sottostanti al di fuori della rete bersaglio. I difensori devono rilevare il comportamento risultante, non limitarsi a identificare il brand che lo ha assistito.
Un messaggio di phishing non reca un'etichetta affidabile che indichi quale modello lo abbia redatto. Il codice di un exploit non rivela se provenga da Grok, Claude, un modello aperto o un operatore umano. Una volta che il contenuto generato entra in una catena di attacco, l'attribuzione al fornitore diventa secondaria rispetto a identità, accesso e intenzione.
Le aziende hanno quindi bisogno di controlli su credenziali, azioni privilegiate, spostamento dei dati ed esecuzione degli strumenti. Le protezioni dei modelli rimangono utili, ma si collocano a monte dei sistemi che gli aggressori prendono infine di mira. Un prompt rifiutato è prezioso solo quando l'aggressore non può aggirare quel rifiuto.
Il vero prodotto è un wrapper di jailbreak
Il vantaggio segnalato di Kriminal non era un nuovo modello; era un'interfaccia che trasformava capacità noleggiate in flussi di lavoro criminali specializzati.
Un jailbreak è una strategia di istruzioni progettata per indurre un modello a ignorare o reinterpretare i propri confini di sicurezza. Non altera necessariamente i pesi del modello, ossia i parametri appresi creati durante l'addestramento. Colpisce invece il modo in cui il modello interpreta la conversazione in corso.
Secondo quanto riferito, Kriminal inseriva la propria istruzione di sistema attorno alle richieste inviate a modelli esterni. Questo livello tentava di presentare un comportamento senza restrizioni come il ruolo a più alta priorità del modello. Le persone specializzate in seguito inquadravano le medesime capacità sottostanti come strumenti per attività di exploit, analisi di intelligence o social engineering.
Questa configurazione assomiglia più all'integrazione software che allo sviluppo di modelli. L'operatore può cambiare fornitore senza ricostruire la vetrina. Può inoltre assegnare modelli diversi a compiti differenti, scegliendone uno per documenti lunghi e un altro per il codice o la chat generica.
L'endpoint per sviluppatori aumentava questa flessibilità. ThreatDown ha affermato che Kriminal offriva un'interfaccia compatibile con client in stile OpenAI, consentendo a strumenti di coding esterni di comunicare con essa. La compatibilità riduce i costi di cambiamento perché i clienti possono collegare software esistente senza apprendere un protocollo proprietario.
L'accesso alla ricerca può estendere ulteriormente un modello altrimenti statico. Un fornitore di ricerca connesso fornisce materiale web corrente che non era presente nei dati di addestramento. In un prodotto legittimo, questo supporta la ricerca e gli aggiornamenti fattuali. In un flusso di lavoro dannoso, può supportare l'individuazione di bersagli, la ricerca sulle identità o un contesto operativo in rapida evoluzione.
L'approccio si inserisce in un più ampio schema di mercato. La revisione di Trend Micro del mercato dell'AI criminale ha concluso che i criminali spesso effettuano il jailbreak di sistemi commerciali invece di costruire modelli indipendenti. I ricercatori hanno descritto questa scelta come economicamente razionale, poiché i fornitori affermati avevano già finanziato il costoso livello di intelligence.
WormGPT, FraudGPT e Xanthorox hanno contribuito a creare una categoria riconoscibile attorno a un'AI apparentemente senza restrizioni. Tuttavia, un brand criminale non rivela il suo fondamento tecnico. Alcuni servizi possono essere wrapper, altri possono utilizzare modelli aperti ottimizzati e alcuni potrebbero offrire ben poco oltre a un marketing ingannevole.
Questo problema di branding complica la threat intelligence. Un servizio può scomparire e tornare con un altro nome mantenendo gli stessi fornitori e prompt. Al contrario, operatori non correlati possono riutilizzare un nome noto senza condividere infrastruttura o codice.
La più ampia ricerca di ThreatDown sulla cybercriminalità legata all'AI ha rilevato migliaia di modelli pubblicati apertamente con etichette quali uncensored o unfiltered. Tali etichette sono autodichiarazioni, non una prova che un modello supporti in modo affidabile attacchi sofisticati.
I conteggi dei download non equivalgono nemmeno a operazioni criminali riuscite. Alcuni utenti sono ricercatori, appassionati, red team o persone che esplorano il comportamento dei modelli. Altri potrebbero scaricare diverse varianti senza mai distribuirle. Le cifre mostrano disponibilità e interesse, non danni misurati.
Il rischio pratico deriva dalla combinazione tra capacità e progettazione del flusso di lavoro. Un chatbot generico richiede che l’utente sappia cosa chiedere, come convalidare una risposta e come collegarla ad altri strumenti. Un servizio confezionato può codificare parte di questo processo in menu, agenti, modelli e integrazioni.
Questa confezione può aiutare attori meno esperti a tentare attività che in precedenza richiedevano maggiori conoscenze. Non rende però affidabili i risultati. Il codice exploit generato può non funzionare, esporre il suo operatore, danneggiare il sistema sbagliato o inventare dettagli tecnici.
La stessa limitazione vale per l’ingegneria sociale. Un modello può produrre messaggi fluidi e identità sintetiche, ma una frode riuscita dipende comunque da accesso, tempismo, conoscenza del bersaglio e disciplina operativa. L’AI può ridurre il lavoro necessario senza eliminare questi requisiti.
Questo è il principale conflitto del settore. I fornitori promettono un’intelligenza generale utile delimitata da policy, mentre i wrapper possono tentare di separare l’intelligenza da tali confini. La contesa non è più limitata all’addestramento dei modelli. Prosegue attraverso API, applicazioni, account e azioni a valle.
I guardrail dei modelli non possono vedere l’intera catena di attacco
I guardrail riducono gli output dannosi, ma Kriminal illustra perché nessuna singola difesa del modello può governare un servizio distribuito.
Anthropic ha riconosciuto nella sua ricerca sui classificatori del gennaio 2026 che nessun sistema AI disponibile dispone di difese contro il jailbreak perfettamente affidabili. Il suo precedente approccio basato su classificatori ha ridotto nettamente gli attacchi riusciti nei test, ma ha aggiunto costi computazionali e alcuni rifiuti errati.
La nuova architettura dell’azienda utilizza un controllo iniziale economico e inoltra gli scambi sospetti a un classificatore più potente. Un classificatore è un sistema secondario che valuta i contenuti rispetto alle regole di sicurezza. Questo progetto a livelli mira a migliorare la protezione limitando al contempo il costo dell’ispezione uniforme di ogni interazione.
I ricercatori hanno comunque individuato categorie di attacco complesse. Gli attacchi di ricostruzione dividono una richiesta dannosa in parti che appaiono singolarmente innocue. L’offuscamento dell’output nasconde materiale pericoloso dietro sostituzioni, metafore o forme codificate che un filtro semplice potrebbe interpretare male.
Questi non sono motivi per abbandonare le salvaguardie dei modelli. Una difesa non deve essere perfetta per prevenire abusi significativi. Limiti di frequenza, classificatori, verifica degli account, rilevamento delle anomalie e indagini umane possono aumentare i costi e interrompere comportamenti ripetuti.
Tuttavia, la struttura riportata di Kriminal crea diverse opportunità per eludere controlli isolati. Gli operatori possono distribuire i prompt tra fornitori, modificare la formulazione, indirizzare attività diverse a modelli diversi o spostarsi quando un account viene sospeso. Un rivenditore può anche nascondere la relazione tra l’utente sottostante e lo scopo finale.
L’applicazione delle policy lato fornitore deve quindi esaminare schemi che vadano oltre i singoli prompt. I segnali rilevanti possono includere la creazione di account, le sequenze di richieste, comportamenti ripetuti di verifica delle policy, relazioni di pagamento, instradamenti insoliti e connessioni a infrastrutture abusive note. Ogni segnale richiede un trattamento accurato perché ricercatori legittimi possono produrre traffico superficialmente simile.
I falsi positivi contano. Professionisti della sicurezza, ricercatori di vulnerabilità e addetti alla risposta agli incidenti interrogano i modelli su malware, exploit, phishing ed evasione per ragioni difensive. Un sistema che blocchi ogni prompt relativo alla sicurezza comprometterebbe il lavoro legittimo senza fermare in modo affidabile gli aggressori determinati.
Identità e autorizzazione offrono un confine più deterministico. Anche un modello manipolato non può rubare dati protetti se il suo account non dispone dell’accesso. Non può distribuire codice se le autorizzazioni dei suoi strumenti escludono i sistemi di produzione. Non può trasferire fondi quando le azioni sensibili richiedono un’approvazione indipendente.
Questo diventa più importante man mano che i sistemi AI acquisiscono strumenti. Un agente abilitato agli strumenti può navigare siti web, eseguire codice, interrogare database o attivare servizi esterni. L’output del modello diventa quindi un input per azioni reali, rendendo la progettazione delle autorizzazioni importante quanto il filtraggio dei contenuti.
I ricercatori di Check Point hanno dimostrato separatamente una tecnica di proxy AI che coinvolge assistenti con accesso al web. Il loro lavoro ha mostrato come il traffico AI legittimo potrebbe essere abusato come relay, rafforzando il pericolo di considerare il dominio di un fornitore affidabile come prova di un intento affidabile.
Le imprese dovrebbero di conseguenza distinguere la sicurezza del modello dalla sicurezza del sistema. La sicurezza del modello riguarda ciò che l’AI genera. La sicurezza del sistema determina a quali risorse identità, applicazioni e agenti possono accedere o quali azioni possono eseguire dopo la generazione.
I controlli utili includono identità di servizio con ambiti limitati, credenziali di breve durata, allowlist degli strumenti, limiti alle transazioni, passaggi di approvazione e registri completi delle azioni. Il monitoraggio della rete può quindi valutare il comportamento tra chiamate al modello, uso degli strumenti e movimento dei dati, anziché giudicare un prompt isolatamente.
I difensori dovrebbero inoltre evitare di sopravvalutare ciò che l’analisi tecnica di Kriminal dimostra. Il JavaScript pubblico può rivelare la configurazione, ma l’instradamento lato server può differire. Un chatbot che si assegna un nome non costituisce una conferma forense. Le statistiche sui clienti e le dichiarazioni sulle prestazioni mostrate restano non verificate, salvo il supporto di registri indipendenti.
La ricerca presenta comunque un’architettura credibile e coerente con un modello consolidato dei mercati criminali. Molteplici osservazioni hanno indicato un wrapper che utilizza fornitori legittimi. L’incertezza riguarda l’implementazione esatta e la scala, non la più ampia fattibilità del metodo.
Tre segnali mostreranno se i fornitori possono rispondere
Il prossimo test sarà capire se i vendor potranno interrompere il modello di servizio senza limitarsi a costringere Kriminal a cambiare nome o fornitori.
Il primo segnale è l’applicazione coordinata delle misure sugli account. Occorre osservare se xAI, Anthropic, OpenRouter, i fornitori di hosting o altri vendor citati confermeranno indagini e descriveranno azioni contro accessi correlati. Una singola sospensione sarebbe rilevante, ma un’azione coordinata verificherebbe meglio la resilienza descritta da ThreatDown.
Se diversi fornitori identificano rapidamente account collegati, l’indagine rafforzerà l’ipotesi di una risposta agli abusi su più livelli. Se Kriminal li sostituisce immediatamente, la vicenda mostrerà invece che gli attuali controlli di onboarding e monitoraggio restano facili da aggirare tramite instradamento.
Il silenzio pubblico non dimostra l’inazione. I fornitori spesso evitano di descrivere le indagini sugli abusi perché la divulgazione può aiutare gli operatori ad adattarsi. I ricercatori potrebbero dover monitorare i cambiamenti nel comportamento dei modelli, nella disponibilità, nei registri dell’infrastruttura o nella configurazione esposta come prove indirette.
Il secondo segnale è il rilevamento lato fornitore dei modelli di rivendita. Le aziende che sviluppano modelli possono aggiornare i classificatori, esaminare sequenze di prompt avversariali e cercare account che inviano ripetutamente contenuti legati a flussi di lavoro criminali. Possono inoltre rafforzare le regole contro la rivendita e indagare interfacce che oscurano gli utenti finali.
Il successo non dovrebbe essere misurato soltanto dalla scomparsa di un dominio. Un risultato più significativo sarebbe un maggiore attrito operativo tra account e modelli sostitutivi. Interruzioni più lunghe, capacità ridotte o fallimenti ripetuti indicherebbero che l’applicazione delle misure ha raggiunto la catena di fornitura.
Il terzo segnale è la prova dell’uso nel mondo reale. Le pagine di marketing e le dimostrazioni di prompt stabiliscono l’intento, ma non misurano l’impatto operativo. I difensori dovrebbero osservare segnalazioni di incidenti che colleghino il servizio a campagne di phishing, sviluppo di exploit, frodi d’identità o accessi non autorizzati.
Quel collegamento richiede cautela. Testo o codice simile costituisce un’attribuzione debole, perché molti modelli possono generare materiale comparabile. Prove più solide includerebbero registri dei clienti, sovrapposizioni infrastrutturali, log recuperati, relazioni di pagamento o artefatti diretti provenienti da un’intrusione investigata.
L’assenza di incidenti confermati non renderebbe il servizio innocuo. Indebolirebbe le affermazioni sulla sua scala attuale, lasciando comunque rilevante l’architettura sottostante. I servizi criminali esagerano abitualmente la propria portata per attrarre acquirenti e intimidire i difensori.
Il ciclo di notizie di Google News può amplificare tali affermazioni prima che la verifica riesca a raggiungerle. I lettori dovrebbero distinguere tre proposizioni: Kriminal ha pubblicizzato funzioni criminali, i ricercatori hanno trovato prove che indicano modelli a noleggio e l’impatto nel mondo reale resta documentato in modo meno chiaro.
Per i fornitori di AI, l’obiettivo strategico non è un comportamento di rifiuto perfetto. È rendere gli abusi abbastanza costosi da impedire ai wrapper di offrire un accesso costante. Ciò richiede controlli che coprano modelli, account, pagamenti, instradamento e applicazioni a valle.
Per gli acquirenti aziendali, la lezione è altrettanto concreta. Non trattate il nome di un modello rispettato come un confine di sicurezza completo. Limitate ciò che ogni identità connessa all’AI può raggiungere, monitorate ciò che fa e richiedete un’approvazione indipendente per le azioni consequenziali.
L’architettura riportata di Kriminal trasforma l’AI legittima in un componente di un servizio presumibilmente criminale senza richiedere un nuovo modello di frontiera. I prossimi mesi mostreranno se i fornitori riusciranno a collegare le loro prove frammentate prima che gli operatori si ricostruiscano semplicemente altrove.
I lettori che seguono la vicenda tramite Google News dovrebbero osservare l’applicazione delle misure da parte dei fornitori, i cambiamenti dell’infrastruttura e prove verificate di incidenti, anziché le affermazioni della vetrina. Questi segnali riveleranno se Kriminal rappresenta un’attività duratura o un wrapper di breve vita esposto dal proprio codice. Entrambi gli esiti contano perché il metodo sottostante è facile da copiare. I team di sicurezza dovrebbero verificare quali servizi AI, agenti e strumenti per sviluppatori possono raggiungere sistemi sensibili, quindi ridurre le autorizzazioni prima che un prompt convincente diventi un’azione autorizzata.



