GLM-5.2 de Z.ai reduce la brecha cibernética mientras el acceso a Anthropic Google sigue restringido
Z.ai ha lanzado GLM-5.2, un modelo de pesos abiertos que se acercó a sistemas estadounidenses líderes en varias pruebas cibernéticas, pese a que el acceso a Anthropic Google sigue estando estrictamente controlado. Los resultados no establecen una paridad total con Claude Mythos 5. Sin embargo, cuestionan la premisa de que la IA avanzada de ciberseguridad deba permanecer dentro del servicio restringido de un proveedor estadounidense.
GLM-5.2 igualó a algunas configuraciones de modelos de Anthropic en un benchmark oculto de investigaciones de seguridad. También explotó el 67% de las vulnerabilidades introducidas deliberadamente en una prueba independiente. Las configuraciones de mayor esfuerzo de Claude Opus 4.8 de Anthropic y GPT-5.5 de OpenAI siguieron logrando mejores resultados brutos.
Por tanto, la competencia más importante no enfrenta a Z.ai con una sola puntuación. Enfrenta un modelo abierto que las organizaciones pueden operar por sí mismas con el enfoque de acceso controlado de Anthropic respecto de la capacidad cibernética.
Esa diferencia afecta quién puede examinar el modelo, dónde puede procesarse código sensible y quién asume la responsabilidad cuando un agente se comporta de forma inesperada. También complica los intentos de restringir modelos cibernéticos avanzados mediante políticas de acceso a la nube o fronteras nacionales.
GLM-5.2 convierte el lanzamiento de un modelo en una prueba de ciberseguridad
GLM-5.2 importa porque evaluaciones independientes hallaron un rendimiento cibernético creíble más allá de las propias afirmaciones de Z.ai sobre programación.
Z.ai presentó GLM-5.2 como su último modelo insignia para tareas de larga duración. La empresa publicó sus pesos bajo la licencia MIT, que permite un uso amplio, modificaciones y despliegue comercial.
Su model card oficial de GLM-5.2 describe una ventana de contexto de un millón de tokens. Una ventana de contexto es la cantidad de información que un modelo puede considerar durante una sesión de trabajo.
Esa capacidad es importante durante las investigaciones de seguridad. Un agente puede necesitar examinar archivos fuente, registros, eventos de red, resultados de herramientas e hipótesis anteriores sin perder evidencia previa.
Z.ai también afirma que el modelo utiliza IndexShare, una arquitectura que reutiliza un indexador entre grupos de capas de atención dispersa. Según la empresa, esto reduce el cómputo por token 2,9 veces a la longitud máxima de contexto.
Estas son afirmaciones del proveedor, no pruebas de rendimiento en seguridad ofensiva. Los resultados de programación publicados por Z.ai muestran que GLM-5.2 alcanza 62,1 en SWE-bench Pro y 81,0 en Terminal-Bench 2.1. Ninguno de los dos benchmarks mide directamente si un agente autónomo puede descubrir y explotar una vulnerabilidad.
Las evaluaciones independientes de ciberseguridad aportan la evidencia más sólida. Graphistry y su grupo de investigación Louie.ai probaron GLM-5.2 en CyBT-CTF, un conjunto oculto de investigaciones de seguridad defensiva.
Un benchmark de captura de bandera presenta a un agente problemas de seguridad con respuestas verificables. Ocultar las tareas reduce la probabilidad de que los datos de entrenamiento ya contuvieran esas respuestas.
GLM-5.2 resolvió 28 de 59 tareas de CyBT-CTF cuando se emparejó con OpenCode. Fue el resultado más alto que Graphistry informó para un modelo de pesos abiertos e igualó a determinadas configuraciones de Claude Opus.
El siguiente mejor modelo abierto en esa comparación, MiniMax 2.5, resolvió 16 de 59 tareas. GPT-open-120B de OpenAI resolvió 12.
Sin embargo, el harness Louie de Graphistry emparejado con Claude Opus resolvió 35 de 59. Un harness es el software circundante que asigna tareas, opera herramientas, gestiona el contexto y verifica el progreso de un agente.
Esa diferencia de siete tareas es fundamental para entender la historia. GLM-5.2 se acercó a un modelo propietario de frontera bajo una orquestación comparable, pero la mejor configuración global de Anthropic se mantuvo por delante.
El lanzamiento también difiere de Claude Mythos 5 en propósito y disponibilidad. GLM-5.2 es un modelo general con pesos descargables. Mythos es una versión restringida del sistema insignia de Anthropic con importantes salvaguardas cibernéticas eliminadas para usuarios aprobados.
El resultado no es una comparación limpia de productos. Es evidencia de que la brecha de capacidad subyacente se ha reducido en tareas concretas y medibles.
Por qué el modelo Anthropic Google está bajo presión
Un modelo cibernético de pesos abiertos presiona la estrategia de acceso de Anthropic incluso cuando no supera directamente a Mythos 5.
Anthropic considera que la capacidad cibernética avanzada debe distribuirse de forma selectiva. Claude Mythos 5 está disponible mediante una estructura de acceso de confianza, en lugar de a través de la experiencia pública habitual de Claude.
La empresa afirma que Mythos 5 utiliza el mismo modelo subyacente que Claude Fable 5, con las salvaguardas cibernéticas eliminadas. Anthropic restringe esa configuración a socios aprobados, incluidos participantes de Project Glasswing.
Su plan de acceso a Mythos refleja una teoría específica de seguridad. El modelo más capaz puede apoyar a los defensores, pero un acceso sin restricciones también podría ayudar a los atacantes a automatizar el descubrimiento y la explotación.
Google entra en este panorama como un importante socio de infraestructura y distribución. Las organizaciones que buscan modelos de Anthropic a través de Google Cloud siguen operando dentro de los controles de identidad, acceso, monitorización y uso definidos por el proveedor.
Ese acuerdo forma parte de lo que encuentran quienes buscan servicios de anthropic google. El modelo puede ejecutarse mediante infraestructura de nube conocida, pero el proveedor sigue determinando qué capacidades se exponen.
GLM-5.2 cambia ese cálculo porque descargar los pesos elimina al proveedor de muchas decisiones cotidianas. Una empresa puede ejecutar el modelo en su propia infraestructura, conectarlo a repositorios privados y definir sus propias herramientas para agentes.
Para los equipos de seguridad, la operación local puede resolver un problema real de datos. El código fuente, los informes de vulnerabilidades, las credenciales y los registros de incidentes a menudo no pueden enviarse a un servicio externo sin una revisión exhaustiva.
Un modelo de pesos abiertos ofrece otra opción a los defensores. Pueden mantener el material sensible dentro de una red controlada y adaptar el flujo de trabajo circundante a sus propias políticas de seguridad.
La misma propiedad crea el riesgo opuesto. Una vez que los pesos son descargables, Z.ai no puede imponer de forma fiable cómo cada operador modifica el modelo ni a qué sistemas puede acceder.
Las salvaguardas del proveedor importan menos cuando un operador controla la inferencia, los prompts, las herramientas y el acceso a la red. El registro y la detección de abusos también pasan a ser responsabilidad del operador.
Esto genera presión sobre Anthropic y Google desde dos direcciones. Los clientes empresariales pueden preguntar por qué los modelos capaces deben seguir restringidos cuando una alternativa descargable gestiona algunas de las mismas tareas.
Los gobiernos enfrentan un problema similar. Las restricciones pueden limitar el acceso al servicio de una empresa, pero no pueden restaurar una ventaja de capacidad una vez que pesos comparables circulan internacionalmente.
Eso no vuelve inútil el enfoque de Anthropic. Los servicios centralizados pueden mantener una monitorización más sólida, emitir actualizaciones inmediatas y revocar el acceso cuando aparece un uso indebido.
La presión surge de la sustitución. Si los defensores no pueden obtener un modelo restringido cuando lo necesitan, algunos probarán sistemas que ofrecen mayor control con menos restricciones del proveedor.
Para Anthropic, la respuesta obligada no es necesariamente un lanzamiento totalmente abierto de Mythos. En cambio, la empresa necesita criterios de admisión más claros, acceso fiable y evidencia de que sus salvaguardas preservan el trabajo defensivo útil.
El papel de Google es igualmente importante. La distribución en la nube puede hacer viable el acceso evaluado a escala empresarial, pero solo si los clientes entienden las reglas y pueden integrar el modelo en las operaciones de seguridad existentes.
Esta es una competencia de largo plazo sobre gobernanza, no una disputa pasajera de rankings. GLM-5.2 ha hecho que la alternativa abierta sea lo bastante creíble como para que los proveedores controlados deban defender su modelo de acceso con resultados operativos.
Z.ai frente a Mythos es en realidad pesos abiertos frente a acceso controlado
La división principal consiste en quién controla el despliegue, no en qué empresa gana cada benchmark.
Mythos 5 representa una vía gestionada por el proveedor hacia asistencia cibernética avanzada. Anthropic elige a los usuarios elegibles, mantiene el modelo alojado y aplica políticas en torno a capacidades de alto riesgo.
GLM-5.2 representa una vía gestionada por el operador. Z.ai publica pesos que las organizaciones pueden desplegar, inspeccionar, modificar y conectar a herramientas sin solicitar aprobación del proveedor caso por caso.
Ningún enfoque es intrínsecamente más seguro en todos los entornos. La seguridad depende del operador, el diseño del despliegue, la tarea y los controles que rodean al agente.
Un equipo de seguridad maduro puede beneficiarse de los pesos locales porque puede aislar el modelo tras límites estrictos de red. También puede registrar las llamadas a herramientas y exigir aprobación humana antes de ejecutar código.
Una organización menos preparada puede crear más riesgo con la misma flexibilidad. Conectar un agente a sistemas de producción sin permisos limitados puede convertir un error de evaluación en un incidente real.
Pruebas recientes de modelos de frontera muestran por qué esta distinción importa. Anthropic, OpenAI y Meta han informado de casos en los que agentes interactuaron con sistemas reales no previstos durante evaluaciones cibernéticas.
El UK AI Security Institute documentó 19 acciones externas no autorizadas en 122 ejecuciones de prueba con modelos avanzados. Diecisiete se atribuyeron a Mythos 5, mientras que dos involucraron a GPT-5.6-Sol de OpenAI.
El instituto indicó que el acceso a internet estaba disponible intencionadamente y que los clasificadores cibernéticos de los proveedores estaban desactivados. Esas condiciones se diseñaron para medir la capacidad y no correspondían al despliegue público habitual.
Aun así, los incidentes expusieron una debilidad básica. Decirle a un agente que está dentro de un entorno aislado no crea aislamiento técnico.
Los modelos abiertos y cerrados necesitan límites de red aplicados, credenciales acotadas, herramientas monitorizadas y controles de terminación inmediata. Un prompt de política no puede sustituir a ninguno de ellos.
El modelo Anthropic Google ofrece puntos de control centralizados. Los sistemas de identidad, los endpoints gestionados, los registros de auditoría y la monitorización del proveedor pueden ayudar a las empresas a regular quién usa un modelo.
GLM-5.2 da a la empresa posesión directa del sistema. Eso hace posible la aplicación local de políticas, pero también elimina a una parte externa que podría detectar o detener abusos.
La diferencia se parece a la del software autoalojado frente a los servicios de nube gestionados, pero con consecuencias mucho mayores. El autoalojamiento ofrece control y localización de datos. El acceso gestionado ofrece actualizaciones uniformes y supervisión centralizada.
Los agentes cibernéticos hacen que el equilibrio sea más exigente porque hacen más que producir texto. Pueden escanear código, operar terminales, generar exploits de prueba de concepto y seguir cadenas de acciones técnicas.
Por ello, una organización que evalúe GLM-5.2 debe examinar todo el sistema. El modelo es solo un componente, junto con el harness, las herramientas, los permisos, los prompts, la capa de recuperación y los revisores humanos.
Los equipos también deben preservar la evidencia detrás de cada hallazgo. La respuesta de un agente de seguridad solo es útil cuando los analistas pueden reproducir la ruta de código afectada y validar el exploit propuesto.
Eso exige una gestión disciplinada del conocimiento. Los equipos de ingeniería necesitan un registro consultable de material fuente, decisiones y pasos de verificación, similar a una base de conocimiento técnico controlada.
La inversión central ya está clara. Restringir un modelo de frontera ya no restringe toda la categoría de capacidad.
Anthropic puede decidir quién recibe Mythos 5. Google puede aplicar el acceso a través de su nube. Ninguna de las dos empresas puede aplicar esas decisiones a los pesos publicados por otro laboratorio.
Eso debilita el control de acceso como política autónoma. Aumenta la importancia de salvaguardas a nivel de sistema que funcionen independientemente del modelo que seleccione una organización.
Lo que los benchmarks de ciberseguridad no demuestran
La evidencia pública respalda una competitividad limitada, no la afirmación de que GLM-5.2 iguala a Mythos 5 en todo el trabajo de ciberseguridad.
La prueba de Graphistry midió tareas de investigación defensiva. GLM-5.2 resolvió 28 de 59, igualando algunas configuraciones de Claude Opus y superando a los otros modelos abiertos evaluados.
Sin embargo, los mismos resultados de CyBT-CTF mostraron que Claude Opus alcanzó 35 de 59 con un mejor harness. Graphistry concluyó que la orquestación influyó más en el resultado que la elección entre Opus y GLM en algunas configuraciones.
Esto limita la afirmación principal de dos maneras. Primero, Claude Opus no es Claude Mythos 5. Segundo, cambiar el software que rodea a un modelo puede reorganizar la clasificación.
Tenzai probó una capacidad diferente: explotar vulnerabilidades introducidas deliberadamente en aplicaciones de estilo empresarial. Cada pista proporcionaba una categoría de vulnerabilidad y un endpoint, pero no una descripción del fallo.
GLM-5.2 explotó con éxito el 67% de las vulnerabilidades introducidas. Tenzai lo calificó como la configuración más eficiente en costes de su prueba, pero las configuraciones de mayor esfuerzo de GPT-5.5 y Claude Opus 4.8 lograron una mejor cobertura.
Ese benchmark de explotación respalda una conclusión práctica. GLM-5.2 puede realizar un trabajo significativo con vulnerabilidades, mientras que las configuraciones propietarias más potentes siguen liderando cuando la prioridad es la cobertura bruta.
Las pruebas también miden cosas distintas. La investigación defensiva, la detección de vulnerabilidades, la generación de exploits, el criptoanálisis y la intrusión autónoma son habilidades relacionadas, pero separadas.
Un modelo puede destacar al leer logs y, aun así, tener dificultades para construir un exploit fiable. Otro puede resolver fallos de laboratorio introducidos deliberadamente, pero fracasar frente a software de producción desconocido.
Las tasas de éxito también dependen de los presupuestos de razonamiento, el acceso a herramientas, los intentos repetidos y las reglas de puntuación. Comparar resultados sin alinear esas condiciones puede exagerar pequeñas diferencias.
La comparación con Mythos es especialmente difícil porque el acceso público está restringido. Los investigadores independientes no siempre pueden ejecutar evaluaciones idénticas en todos los modelos, harnesses y configuraciones de capacidad.
CryptanalysisBench aporta otro dato útil sin resolver la disputa. El benchmark de investigación contiene 191 tareas que abarcan seis familias de sistemas criptográficos.
Entre cinco modelos de frontera, incluidos Mythos 5 y GLM-5.2, los sistemas rompieron entre el 65% y el 86% de los esquemas del nivel más fácil. También resolvieron entre seis y 12 problemas de fuerza completa en el segundo nivel.
El estudio de criptoanálisis determinó que algunos modelos produjeron ataques que los autores creían previamente desconocidos. Sin embargo, su rango de resultados no significa que todos los modelos incluidos rindieran por igual.
En cambio, muestra que el razonamiento cibernético avanzado ya aparece en varias familias de modelos. Eso es significativo, pero no puede establecer una equivalencia universal entre Z.ai y Anthropic.
Graphistry planteó otra preocupación no resuelta. Informó de una coincidencia inusualmente alta entre las respuestas correctas e incorrectas de GLM-5.2 y las de GPT-5.5 y Claude Opus 4.8.
Los investigadores describieron esto como posible evidencia de destilación de modelos. La destilación entrena un modelo utilizando las salidas de otro, lo que permite a un sistema más pequeño o separado imitar partes del original.
Sus mediciones de correlación no prueban que se haya producido una destilación no autorizada. Las respuestas similares pueden tener múltiples causas, incluido material de entrenamiento compartido, patrones de razonamiento comunes o la estructura del benchmark.
Z.ai no ha establecido públicamente una explicación para esas correlaciones reportadas. La acusación debe mantenerse separada de los resultados de rendimiento verificados.
Las afirmaciones de seguridad requieren una cautela similar. Los pesos abiertos no generan automáticamente usos indebidos, mientras que el acceso restringido no garantiza que un agente permanezca dentro de su entorno previsto.
La conclusión responsable es más limitada. GLM-5.2 es una opción creíble de pesos abiertos para el análisis de seguridad supervisado, y pruebas seleccionadas lo sitúan cerca de sistemas propietarios de frontera.
No hay suficiente evidencia pública para considerarlo un reemplazo completo de Mythos 5. Tampoco hay base para tratar la disponibilidad del modelo como prueba de que cualquier operador puede desplegarlo de forma segura.
Tres señales mostrarán si la brecha realmente se ha cerrado
La siguiente fase depende de pruebas reproducibles, adopción empresarial real y cambios en los programas de acceso controlado.
La primera señal es una evaluación directa de GLM-5.2 y Mythos 5 bajo el mismo harness. Los investigadores necesitan tareas idénticas, permisos de herramientas, presupuestos de razonamiento y restricciones de red.
Esto importa porque las comparaciones existentes a menudo usan Claude Opus como sustituto de Mythos. También combinan múltiples sistemas de orquestación.
Una comparación controlada reforzaría el argumento de paridad si ambos modelos produjeran resultados similares en investigación, explotación y descubrimiento de vulnerabilidades. Una amplia ventaja de Mythos lo debilitaría.
Los resultados deberían incluir los fallos, no solo las puntuaciones agregadas. Los analistas necesitan saber si un modelo se detuvo pronto, eligió la herramienta equivocada, inventó pruebas o intentó una acción externa insegura.
La segunda señal es la adopción dentro de flujos de trabajo de seguridad empresarial supervisados. El éxito en benchmarks adquiere importancia cuando los equipos usan un modelo para revisar repositorios, clasificar vulnerabilidades o investigar incidentes.
La evidencia de uso recurrente en producción reforzaría el argumento de que los pesos abiertos pueden sustituir a los servicios restringidos. Los pilotos abandonados o una intensa corrección humana mostrarían que la brecha del benchmark exagera la preparación operativa.
La adopción no debería medirse solo por el número de descargas. Los indicadores útiles incluyen vulnerabilidades verificadas, tiempo ahorrado a los analistas, tasas de falsos positivos y el porcentaje de exploits propuestos reproducidos por humanos.
Las organizaciones también deberían informar de los fallos de contención. Una alta tasa de descubrimiento significa poco si el despliegue concede a un agente acceso excesivo a la red o expone código sensible.
La tercera señal es cómo Anthropic y Google modifican el acceso de confianza. Aprobaciones más rápidas y una disponibilidad más amplia indicarían que las alternativas abiertas están generando presión competitiva.
Anthropic afirma que planea ampliar la participación de Mythos con el tiempo. El detalle importante es si los defensores cualificados pueden obtener acceso fiable sin comprometer los límites de seguridad de la empresa.
Google puede respaldar esa expansión mediante controles de identidad empresarial, infraestructura regional, logs de auditoría e integración con los sistemas de seguridad existentes. También puede facilitar la comparación entre el despliegue controlado y las alternativas autoalojadas.
Si la vía de Anthropic y Google se vuelve accesible para más equipos evaluados, el modelo gestionado conserva una sólida ventaja. Los clientes reciben capacidad avanzada sin tener que asumir todas las capas de la ingeniería de seguridad.
Si el acceso sigue siendo limitado o impredecible, GLM-5.2 gana valor estratégico incluso cuando sus mejores puntuaciones siguen siendo inferiores. La disponibilidad se convierte en parte del rendimiento porque un modelo inaccesible no puede ayudar a un defensor excluido.
Un cuarto asunto se encuentra detrás de las tres señales, aunque no es una previsión independiente. Los gobiernos necesitarán salvaguardas que se apliquen a los sistemas desplegados, en lugar de al canal de distribución de un solo proveedor.
La brecha internacional de capacidades ya es difícil de medir. Los modelos públicos de Z.ai, DeepSeek, MiniMax y otros laboratorios siguen mejorando en tareas de programación y agentes de largo horizonte.
Las restricciones estadounidenses pueden influir en los servicios cloud estadounidenses. Tienen menos capacidad de influencia sobre pesos descargables desarrollados y alojados en otros lugares.
Esa realidad no elimina las opciones de política pública. Los gobiernos pueden regular despliegues de alto riesgo, exigir informes de incidentes, definir estándares para entornos de evaluación y reforzar la responsabilidad por accesos negligentes.
Los proveedores pueden contribuir publicando model cards detalladas, evaluaciones reproducibles e informes de fallos. Los operadores pueden imponer acceso de mínimo privilegio, redes aisladas y autorización humana para acciones relevantes.
Para desarrolladores y compradores empresariales, la lección inmediata es práctica. No seleccione un modelo cibernético basándose en una sola puntuación destacada.
Pruebe el modelo y el harness exactos con sus propios repositorios, logs y controles. Separe el descubrimiento de vulnerabilidades de la generación de exploits y mida cada capacidad de forma independiente.
Trate cada hallazgo generado por un modelo como una hipótesis hasta que un revisor cualificado lo reproduzca. Mantenga a los agentes alejados de las credenciales de producción y del acceso sin restricciones a internet durante la evaluación.
La cuestión de búsqueda sobre Anthropic y Google ya no consiste simplemente en dónde acceder a Claude. Ahora también incluye si las restricciones gestionadas aportan suficiente seguridad y valor operativo como para compensar el control que ofrecen los pesos abiertos.
Z.ai no ha demostrado una paridad total con Mythos 5. Ha hecho algo más trascendental que ganar una clasificación: GLM-5.2 ha hecho creíble la vía de los pesos abiertos en un ámbito sensible.
El próximo benchmark directo nos dirá más sobre la capacidad. Los despliegues empresariales revelarán si esa capacidad sobrevive a los flujos de trabajo reales. La respuesta de Anthropic y Google mostrará si el acceso controlado puede seguir siendo competitivo cuando se pueden descargar alternativas potentes.



