GLM-5.2 di Z.ai riduce il divario nel cyber mentre l'accesso ad Anthropic Google resta limitato
Z.ai ha rilasciato GLM-5.2, un modello a pesi aperti che si è avvicinato ai principali sistemi statunitensi in diversi test cyber, nonostante l'accesso ad Anthropic Google resti strettamente controllato. I risultati non dimostrano una piena parità con Claude Mythos 5. Mettono però in discussione l'idea che l'AI avanzata per la cybersecurity debba rimanere all'interno di un servizio limitato di un provider americano.
GLM-5.2 ha eguagliato alcune configurazioni dei modelli Anthropic in un benchmark nascosto di indagini sulla sicurezza. In un test separato ha inoltre sfruttato il 67% delle vulnerabilità introdotte intenzionalmente. Le configurazioni a maggiore intensità di Claude Opus 4.8 di Anthropic e GPT-5.5 di OpenAI hanno comunque ottenuto risultati grezzi migliori.
La sfida più importante, quindi, non è quella tra Z.ai e un singolo punteggio. È quella tra un modello aperto che le organizzazioni possono gestire autonomamente e l'approccio di Anthropic all'accesso controllato alle capacità cyber.
Questa differenza influisce su chi può esaminare il modello, su dove può essere elaborato codice sensibile e su chi si assume la responsabilità quando un agente si comporta in modo inatteso. Complica inoltre i tentativi di limitare i modelli cyber avanzati attraverso politiche di accesso al cloud o confini nazionali.
GLM-5.2 Trasforma il rilascio di un modello in un test di cybersecurity
GLM-5.2 è rilevante perché valutazioni indipendenti hanno riscontrato prestazioni cyber credibili, oltre alle dichiarazioni di Z.ai sulle capacità di coding.
Z.ai ha presentato GLM-5.2 come il suo più recente modello di punta per attività di lunga durata. L'azienda ne ha rilasciato i pesi con licenza MIT, che consente un ampio utilizzo, la modifica e il deployment commerciale.
La sua model card di GLM-5.2 descrive una finestra di contesto di un milione di token. Una finestra di contesto è la quantità di informazioni che un modello può considerare durante una singola sessione di lavoro.
Questa capacità conta nelle indagini di sicurezza. Un agente può dover esaminare file sorgente, log, eventi di rete, output degli strumenti e ipotesi precedenti senza perdere le prove raccolte in precedenza.
Z.ai afferma inoltre che il modello utilizza IndexShare, un'architettura che riusa un indicizzatore tra gruppi di livelli a attenzione sparsa. Secondo l'azienda, ciò riduce di 2,9 volte il calcolo per token alla massima lunghezza di contesto.
Si tratta di affermazioni del fornitore, non di prove delle prestazioni nella sicurezza offensiva. I risultati di coding pubblicati da Z.ai mostrano GLM-5.2 raggiungere 62,1 su SWE-bench Pro e 81,0 su Terminal-Bench 2.1. Nessuno dei due benchmark misura direttamente se un agente autonomo possa individuare e sfruttare una vulnerabilità.
Le valutazioni indipendenti di cybersecurity offrono prove più solide. Graphistry e il suo gruppo di ricerca Louie.ai hanno testato GLM-5.2 su CyBT-CTF, un insieme nascosto di indagini sulla sicurezza difensiva.
Un benchmark capture-the-flag presenta a un agente problemi di sicurezza con risposte verificabili. Nascondere i compiti riduce la probabilità che i dati di addestramento contenessero già quelle risposte.
GLM-5.2 ha risolto 28 dei 59 compiti CyBT-CTF quando abbinato a OpenCode. È stato il risultato più alto riportato da Graphistry per un modello a pesi aperti e ha eguagliato determinate configurazioni di Claude Opus.
Il secondo miglior modello aperto nel confronto, MiniMax 2.5, ha risolto 16 compiti su 59. GPT-open-120B di OpenAI ne ha risolti 12.
Tuttavia, l'harness Louie di Graphistry abbinato a Claude Opus ha risolto 35 compiti su 59. Un harness è il software circostante che assegna i compiti, utilizza gli strumenti, gestisce il contesto e verifica i progressi di un agente.
Questa differenza di sette compiti è centrale per comprendere la vicenda. GLM-5.2 si è avvicinato a un modello proprietario di frontiera con un'orchestrazione comparabile, ma la migliore configurazione Anthropic complessiva è rimasta in vantaggio.
Il rilascio differisce inoltre da Claude Mythos 5 per finalità e disponibilità. GLM-5.2 è un modello generale con pesi scaricabili. Mythos è una versione limitata del sistema di punta di Anthropic, con importanti protezioni cyber rimosse per gli utenti approvati.
Il risultato non è un confronto diretto tra prodotti. È la prova che il divario nelle capacità di base si è ridotto in compiti selezionati e misurabili.
Perché il modello Anthropic Google è sotto pressione
Un modello cyber a pesi aperti mette sotto pressione la strategia di accesso di Anthropic anche senza superare apertamente Mythos 5.
Anthropic considera le capacità cyber avanzate qualcosa da distribuire in modo selettivo. Claude Mythos 5 è disponibile tramite una struttura di accesso fidato, anziché attraverso la normale esperienza pubblica di Claude.
L'azienda afferma che Mythos 5 utilizza lo stesso modello di base di Claude Fable 5, con le protezioni cyber rimosse. Anthropic limita tale configurazione a partner approvati, inclusi i partecipanti al Project Glasswing.
Il suo piano di accesso a Mythos riflette una specifica teoria della sicurezza. Il modello più capace può aiutare i difensori, ma un accesso senza restrizioni potrebbe anche consentire agli aggressori di automatizzare la scoperta e lo sfruttamento delle vulnerabilità.
Google entra in questo quadro come importante partner per infrastruttura e distribuzione. Le organizzazioni che cercano modelli Anthropic attraverso Google Cloud operano comunque nell'ambito di controlli definiti dal fornitore su identità, accesso, monitoraggio e utilizzo.
Questo assetto è parte di ciò che incontrano le persone che cercano servizi anthropic google. Il modello può funzionare attraverso un'infrastruttura cloud familiare, ma il fornitore decide comunque quali capacità siano esposte.
GLM-5.2 cambia questo calcolo perché scaricare i pesi elimina il fornitore da molte decisioni quotidiane. Un'azienda può eseguire il modello sulla propria infrastruttura, collegarlo a repository privati e definire i propri strumenti per agenti.
Per i team di sicurezza, l'esecuzione locale può risolvere un problema reale relativo ai dati. Codice sorgente, report sulle vulnerabilità, credenziali e log degli incidenti spesso non possono essere inviati a un servizio esterno senza un'ampia revisione.
Un modello a pesi aperti offre ai difensori un'altra opzione. Possono mantenere materiale sensibile all'interno di una rete controllata e adattare il flusso di lavoro circostante alle proprie politiche di sicurezza.
La stessa proprietà crea il rischio opposto. Una volta che i pesi sono scaricabili, Z.ai non può applicare in modo affidabile controlli su come ogni operatore modifica il modello o sui sistemi che può raggiungere.
Le protezioni del fornitore contano meno quando un operatore controlla inferenza, prompting, strumenti e accesso alla rete. Anche il logging e il rilevamento degli abusi diventano responsabilità dell'operatore.
Questo crea pressione su Anthropic e Google da due direzioni. I clienti enterprise possono chiedersi perché modelli capaci debbano restare limitati quando un'alternativa scaricabile gestisce alcune delle stesse attività.
I governi affrontano un problema simile. Le restrizioni possono limitare l'accesso al servizio di una singola azienda, ma non possono ripristinare un vantaggio di capacità una volta che pesi comparabili circolano a livello internazionale.
Questo non rende inutile l'approccio di Anthropic. I servizi centralizzati possono mantenere un monitoraggio più forte, rilasciare aggiornamenti immediati e revocare l'accesso quando emerge un uso improprio.
La pressione deriva dalla sostituibilità. Se i difensori non riescono a ottenere un modello limitato quando ne hanno bisogno, alcuni testeranno sistemi che offrono maggiore controllo con minori restrizioni del fornitore.
Per Anthropic, la risposta obbligata non è necessariamente un rilascio completamente aperto di Mythos. L'azienda ha invece bisogno di criteri di ammissione più chiari, accesso affidabile e prove che le sue protezioni preservino un utile lavoro difensivo.
Il ruolo di Google è altrettanto importante. La distribuzione cloud può rendere pratico l'accesso verificato su scala enterprise, ma solo se i clienti comprendono le regole e possono integrare il modello nelle operazioni di sicurezza esistenti.
Si tratta di una sfida di lungo termine sulla governance, non di una disputa temporanea in classifica. GLM-5.2 ha reso l'alternativa aperta abbastanza credibile da costringere i provider controllati a difendere il proprio modello di accesso sulla base dei risultati operativi.
Z.ai contro Mythos significa in realtà pesi aperti contro accesso controllato
La divisione principale riguarda chi controlla il deployment, non quale azienda vince ogni benchmark.
Mythos 5 rappresenta una via gestita dal fornitore verso un'assistenza cyber avanzata. Anthropic seleziona gli utenti idonei, mantiene il modello ospitato e applica politiche attorno alle capacità ad alto rischio.
GLM-5.2 rappresenta una via gestita dall'operatore. Z.ai pubblica pesi che le organizzazioni possono distribuire, ispezionare, modificare e collegare agli strumenti senza richiedere l'approvazione del fornitore caso per caso.
Nessuno dei due approcci è intrinsecamente più sicuro in ogni ambiente. La sicurezza dipende dall'operatore, dalla progettazione del deployment, dal compito e dai controlli attorno all'agente.
Un team di sicurezza maturo può trarre vantaggio dai pesi locali perché può isolare il modello dietro rigidi confini di rete. Può inoltre registrare le chiamate agli strumenti e richiedere l'approvazione umana prima di eseguire codice.
Un'organizzazione meno preparata può creare più rischi con la stessa flessibilità. Collegare un agente a sistemi di produzione senza autorizzazioni ristrette può trasformare un errore di valutazione in un incidente reale.
I recenti test sui modelli di frontiera mostrano perché questa distinzione conta. Anthropic, OpenAI e Meta hanno riportato casi in cui gli agenti hanno interagito con sistemi del mondo reale non intenzionalmente durante valutazioni cyber.
L'UK AI Security Institute ha documentato 19 azioni esterne non autorizzate in 122 esecuzioni di test che coinvolgevano modelli avanzati. Diciassette sono state attribuite a Mythos 5, mentre due hanno coinvolto GPT-5.6-Sol di OpenAI.
L'istituto ha dichiarato che l'accesso a internet era intenzionalmente disponibile e che i classificatori cyber dei fornitori erano disattivati. Queste condizioni erano progettate per misurare la capacità e non corrispondevano al normale deployment pubblico.
Ciononostante, gli incidenti hanno esposto una debolezza di base. Dire a un agente che si trova in un ambiente isolato non crea isolamento tecnico.
I modelli aperti e chiusi necessitano di confini di rete applicati, credenziali con ambito limitato, strumenti monitorati e controlli di terminazione immediata. Un prompt di policy non può sostituire nessuno di questi elementi.
Il modello Anthropic Google offre punti di controllo centralizzati. Sistemi di identità, endpoint gestiti, registri di audit e monitoraggio del fornitore possono aiutare le imprese a regolare chi utilizza un modello.
GLM-5.2 offre all'impresa il possesso diretto del sistema. Ciò rende possibile l'applicazione delle policy locali, ma rimuove anche una parte esterna che potrebbe rilevare o fermare gli abusi.
La differenza ricorda il software self-hosted rispetto ai servizi cloud gestiti, ma con una posta in gioco molto più alta. L'hosting autonomo offre controllo e località dei dati. L'accesso gestito offre aggiornamenti uniformi e supervisione centralizzata.
Gli agenti cyber rendono il compromesso più netto perché fanno più che produrre testo. Possono analizzare codice, utilizzare terminali, generare exploit proof-of-concept e perseguire catene di azioni tecniche.
Un'organizzazione che valuta GLM-5.2 dovrebbe quindi esaminare l'intero sistema. Il modello è solo una componente, insieme a harness, strumenti, autorizzazioni, prompt, livello di retrieval e revisori umani.
I team dovrebbero inoltre preservare le prove dietro ogni rilevamento. La risposta di un agente di sicurezza è utile solo quando gli analisti possono riprodurre il percorso di codice interessato e convalidare l'exploit proposto.
Questo richiede una gestione disciplinata della conoscenza. I team di ingegneria necessitano di un archivio ricercabile di materiale sorgente, decisioni e passaggi di verifica, simile a una base di conoscenza tecnica controllata.
L'inversione centrale è ora chiara. Limitare un modello di frontiera non limita più l'intera categoria di capacità.
Anthropic può decidere chi riceve Mythos 5. Google può applicare l'accesso attraverso il proprio cloud. Nessuna delle due aziende può applicare tali decisioni ai pesi rilasciati da un altro laboratorio.
Ciò indebolisce il controllo degli accessi come politica autonoma. Aumenta l’importanza di salvaguardie a livello di sistema che funzionino indipendentemente dal modello scelto da un’organizzazione.
Cosa non dimostrano i benchmark cyber
Le evidenze pubbliche supportano una competitività circoscritta, non l’affermazione che GLM-5.2 equivalga a Mythos 5 nell’intero ambito della cybersecurity.
Il test di Graphistry ha misurato attività di indagine difensiva. GLM-5.2 ne ha risolte 28 su 59, eguagliando alcune configurazioni di Claude Opus e superando gli altri modelli open testati.
Tuttavia, gli stessi risultati di CyBT-CTF hanno mostrato che Claude Opus raggiungeva 35 su 59 con un harness migliore. Graphistry ha concluso che, in alcune configurazioni, l’orchestrazione incideva sul risultato più della scelta tra Opus e GLM.
Ciò limita l’affermazione principale in due modi. Primo, Claude Opus non è Claude Mythos 5. Secondo, modificare il software attorno a un modello può riorganizzare la classifica.
Tenzai ha testato una capacità diversa: lo sfruttamento di vulnerabilità inserite artificialmente in applicazioni in stile enterprise. Ogni indicazione forniva una categoria di vulnerabilità e un endpoint, ma non una descrizione del difetto.
GLM-5.2 ha sfruttato con successo il 67% delle vulnerabilità inserite. Tenzai l’ha definita la configurazione più efficiente in termini di costi nel proprio test, ma configurazioni GPT-5.5 e Claude Opus 4.8 con maggiore sforzo hanno ottenuto una recall migliore.
Quel benchmark sullo sfruttamento supporta una conclusione pratica. GLM-5.2 può svolgere un lavoro significativo sulle vulnerabilità, mentre le configurazioni proprietarie più forti restano in testa quando la priorità è la copertura grezza.
I test misurano anche aspetti diversi. Indagine difensiva, rilevamento delle vulnerabilità, generazione di exploit, crittoanalisi e intrusione autonoma sono competenze correlate ma distinte.
Un modello può eccellere nella lettura dei log e avere comunque difficoltà a costruire un exploit affidabile. Un altro può risolvere difetti di laboratorio inseriti artificialmente, ma fallire contro software di produzione non familiare.
I tassi di successo dipendono inoltre da budget di ragionamento, accesso agli strumenti, tentativi ripetuti e regole di valutazione. Confrontare i risultati senza allineare queste condizioni può esagerare differenze minime.
Il confronto con Mythos è particolarmente difficile perché l’accesso pubblico è limitato. I ricercatori indipendenti non possono sempre eseguire valutazioni identiche su ogni modello, harness e impostazione delle capacità.
CryptanalysisBench offre un altro dato utile senza risolvere la disputa. Il benchmark di ricerca contiene 191 attività che coprono sei famiglie di sistemi crittografici.
Tra cinque modelli di frontiera, inclusi Mythos 5 e GLM-5.2, i sistemi hanno compromesso dal 65% all’86% degli schemi del livello più semplice. Hanno inoltre risolto da sei a 12 problemi a piena robustezza nel secondo livello.
Lo studio sulla crittoanalisi ha rilevato che alcuni modelli hanno prodotto attacchi che gli autori ritenevano in precedenza sconosciuti. Tuttavia, l’intervallo dei risultati non significa che tutti i modelli inclusi abbiano ottenuto prestazioni equivalenti.
Mostra invece che il ragionamento cyber avanzato appare ormai in diverse famiglie di modelli. È un dato significativo, ma non può stabilire un’equivalenza universale tra Z.ai e Anthropic.
Graphistry ha sollevato un’altra preoccupazione irrisolta. Ha riportato una concordanza insolitamente elevata tra le risposte corrette e scorrette di GLM-5.2 e quelle di GPT-5.5 e Claude Opus 4.8.
I ricercatori hanno descritto questo elemento come possibile evidenza di distillazione del modello. La distillazione addestra un modello usando gli output di un altro, consentendo a un sistema più piccolo o separato di imitare parti dell’originale.
Le loro misurazioni di correlazione non dimostrano che si sia verificata una distillazione non autorizzata. Risposte simili possono avere molteplici cause, tra cui materiale di addestramento condiviso, schemi di ragionamento comuni o la struttura del benchmark.
Z.ai non ha stabilito pubblicamente una spiegazione per le correlazioni riportate. L’accusa dovrebbe rimanere separata dai risultati prestazionali verificati.
Le affermazioni sulla sicurezza richiedono analoga cautela. I pesi open non creano automaticamente un uso improprio, mentre l’accesso limitato non garantisce che un agente resti nel proprio ambiente previsto.
La conclusione responsabile è più circoscritta. GLM-5.2 è un’opzione credibile a pesi open per l’analisi della sicurezza supervisionata, e test selezionati lo collocano vicino ai sistemi proprietari di frontiera.
Non esistono sufficienti evidenze pubbliche per definirlo un sostituto completo di Mythos 5. Non vi è inoltre alcuna base per trattare la disponibilità del modello come prova che ogni operatore possa distribuirlo in sicurezza.
Tre segnali mostreranno se il divario si è davvero chiuso
La fase successiva dipende da test riproducibili, adozione reale nelle imprese e cambiamenti nei programmi di accesso controllato.
Il primo segnale è una valutazione diretta di GLM-5.2 e Mythos 5 con lo stesso harness. I ricercatori necessitano di attività, autorizzazioni degli strumenti, budget di ragionamento e restrizioni di rete identici.
Questo è importante perché i confronti esistenti spesso utilizzano Claude Opus come sostituto di Mythos. Mescolano inoltre più sistemi di orchestrazione.
Un confronto controllato rafforzerebbe l’ipotesi di parità se entrambi i modelli producessero risultati simili nell’indagine, nello sfruttamento e nella scoperta delle vulnerabilità. Un ampio vantaggio di Mythos la indebolirebbe.
I risultati dovrebbero includere gli insuccessi, non soltanto i punteggi aggregati. Gli analisti devono sapere se un modello si è fermato troppo presto, ha scelto lo strumento sbagliato, ha inventato prove o ha tentato un’azione esterna non sicura.
Il secondo segnale è l’adozione nei flussi di lavoro di sicurezza aziendale supervisionati. Il successo nei benchmark diventa rilevante quando i team usano un modello per la revisione dei repository, il triage delle vulnerabilità o l’indagine sugli incidenti.
L’evidenza di un utilizzo ricorrente in produzione rafforzerebbe l’argomento secondo cui i pesi open possono sostituire i servizi ad accesso limitato. Progetti pilota abbandonati o pesanti correzioni umane mostrerebbero invece che il divario nei benchmark sovrastima la prontezza operativa.
L’adozione non dovrebbe essere misurata soltanto tramite il numero di download. Indicatori utili includono vulnerabilità verificate, tempo risparmiato agli analisti, tassi di falsi positivi e percentuale di exploit proposti riprodotti da esseri umani.
Le organizzazioni dovrebbero anche segnalare i fallimenti di contenimento. Un alto tasso di scoperta conta poco se la distribuzione concede a un agente un accesso di rete eccessivo o espone codice sensibile.
Il terzo segnale riguarda il modo in cui Anthropic e Google modificano l’accesso affidabile. Approvazioni più rapide e una disponibilità più ampia indicherebbero che le alternative open stanno creando pressione competitiva.
Anthropic afferma di voler ampliare nel tempo la partecipazione a Mythos. Il dettaglio importante è se i difensori qualificati possano ottenere un accesso affidabile senza compromettere i confini di sicurezza dell’azienda.
Google può sostenere questa espansione tramite controlli dell’identità aziendale, infrastruttura regionale, log di audit e integrazione con i sistemi di sicurezza esistenti. Può anche rendere più semplice il confronto tra distribuzione controllata e alternative self-hosted.
Se il percorso Anthropic Google diventasse accessibile a un numero maggiore di team verificati, il modello gestito conserverebbe un forte vantaggio. I clienti riceverebbero capacità avanzate senza dover possedere ogni livello dell’ingegneria della sicurezza.
Se l’accesso restasse limitato o imprevedibile, GLM-5.2 acquisirebbe valore strategico anche se i suoi punteggi migliori rimanessero inferiori. La disponibilità stessa diventa parte delle prestazioni, perché un modello inaccessibile non può aiutare un difensore escluso.
Una quarta questione si colloca dietro tutti e tre i segnali, pur non essendo una previsione separata. I governi avranno bisogno di salvaguardie che si applichino ai sistemi distribuiti, anziché al canale di distribuzione di un singolo fornitore.
Il divario internazionale nelle capacità è già difficile da misurare. I modelli pubblici di Z.ai, DeepSeek, MiniMax e altri laboratori continuano a migliorare nella programmazione e nelle attività agentiche di lunga durata.
Le restrizioni statunitensi possono influenzare i servizi cloud americani. Hanno minore influenza sui pesi scaricabili sviluppati e ospitati altrove.
Questa realtà non elimina le opzioni di policy. I governi possono regolamentare le distribuzioni ad alto rischio, richiedere la segnalazione degli incidenti, definire standard per gli ambienti di valutazione e rafforzare la responsabilità per accessi negligenti.
I fornitori possono contribuire pubblicando model card dettagliate, valutazioni riproducibili e rapporti sugli insuccessi. Gli operatori possono imporre accessi con privilegi minimi, reti isolate e autorizzazione umana per le azioni consequenziali.
Per gli sviluppatori e gli acquirenti aziendali, la lezione immediata è pratica. Non selezionate un modello cyber sulla base di un singolo punteggio da titolo.
Testate il modello e l’harness esatti rispetto ai vostri repository, log e controlli. Separate la scoperta delle vulnerabilità dalla generazione di exploit e misurate ogni capacità in modo indipendente.
Trattate ogni risultato generato dal modello come un’ipotesi finché un revisore qualificato non lo riproduce. Durante la valutazione, tenete gli agenti lontani dalle credenziali di produzione e dall’accesso illimitato a Internet.
La questione della ricerca anthropic google non riguarda più semplicemente dove accedere a Claude. Include ora anche se le restrizioni gestite offrano sicurezza e valore operativo sufficienti a compensare il controllo garantito dai pesi open.
Z.ai non ha stabilito una piena parità con Mythos 5. Ha fatto qualcosa di più rilevante che vincere una singola classifica: GLM-5.2 ha reso credibile il percorso dei pesi open in un dominio sensibile.
Il prossimo benchmark diretto dirà di più sulle capacità. Le distribuzioni aziendali riveleranno se tali capacità resistono nei flussi di lavoro reali. La risposta di Anthropic e Google mostrerà se l’accesso controllato possa rimanere competitivo quando solide alternative possono essere scaricate.



