top of page

El descifrado Enigma de Astra acaba de darle a Claude Opus un segundo objetivo

26 sept
14 min de lectura

GPT-6 Astra de OpenAI recuperó un mensaje Enigma de 82 letras tras dos días de trabajo, pese a que el mensaje se resistía a los investigadores desde 2005. Al resultado del descifrado Enigma de Astra le siguió, seis días después, otro ataque exitoso con Claude Opus 5 de Anthropic. En conjunto, los proyectos convierten el criptoanálisis histórico en una prueba inusualmente concreta para los agentes de IA de frontera.

No se trata de la historia de un chatbot adivinando alemán legible. Ambos proyectos combinaron evidencia archivística, software ejecutable, búsquedas criptográficas y comprobaciones que iban más allá de las conclusiones de los propios modelos. Su importancia reside en cuánto de ese ciclo de investigación pudo realizar la IA.

Los dos sistemas también llegaron a sus respuestas de formas distintas. Astra eligió su objetivo y desarrolló gran parte de sus herramientas dentro de una investigación dirigida por un investigador. Claude recibió un entorno de trabajo preparado, material histórico y una orientación humana más firme. Esa diferencia hace que Astra frente a Claude Opus se parezca menos a una competición de benchmarks y más a un estudio de dos flujos de trabajo de investigación.

El descifrado Enigma de Astra recuperó un mensaje que se resistía desde 2005

El cambio clave no es que Enigma se haya descifrado de nuevo, sino que una investigación asistida por IA resolvió un mensaje concreto que los investigadores modernos no habían podido recuperar antes.

El mensaje, identificado como MVUEH, fue enviado el 10 de julio de 1941. Una estación de radio del Ejército alemán con el indicativo táctico 2ny lo transmitió a la estación de intendencia de la División SS-Totenkopf. La estación receptora lo registró como mensaje número 172 a las 17:30.

Los criptoanalistas históricos ya entendían la maquinaria de Enigma y sus debilidades generales. Sin embargo, descifrar un único mensaje superviviente sigue exigiendo la configuración correcta de la máquina, un texto cifrado preciso y pistas útiles sobre el texto plano ausente.

MVUEH presentaba problemas en los tres frentes. Contenía solo 82 letras cifradas, dejando poco texto para el análisis estadístico. Sus copias supervivientes también contenían caracteres inciertos o transcritos incorrectamente.

La configuración de la máquina difería de otras claves conocidas utilizadas en la misma fecha. Su orden de rotores era 253, mientras que dos claves relacionadas usaban el orden 512. Un raro avance del rotor izquierdo en la letra setenta y dos añadió otra complicación.

El desarrollador Carter Leffen comenzó la investigación encargando a GPT-6 Astra que examinara mensajes no resueltos publicados por Crypto Cellar Research. Astra seleccionó MVUEH como su objetivo más prometedor. Después vinculó el mensaje con otro despacho, SIPVX, cuyo texto plano ya había sido recuperado.

Ese mensaje relacionado contenía el topónimo repetido ROSENOWROSENOW. La investigación utilizó esas 14 letras como un crib, es decir, un fragmento de texto plano supuesto que se prueba frente a posibles configuraciones de Enigma.

Un crib no revela directamente la respuesta. Restringe la búsqueda al eliminar configuraciones que no pueden producir la frase sospechada. Las letras restantes aún deben formar un texto coherente bajo una única clave consistente de la máquina.

Según el estudio de caso de MVUEH publicado, la investigación registró 12 posiciones inciertas del texto cifrado antes de recuperar la clave. Esas alternativas generaron 13.824 lecturas permitidas.

Ese orden importa. Registrar las incertidumbres antes de ver una respuesta reduce la tentación de reinterpretar una escritura poco clara hasta que encaje con un resultado preferido.

Astra y agentes especializados examinaron fuentes, crearon programas de búsqueda, realizaron experimentos y cuestionaron hallazgos intermedios. La investigación desarrolló software de simulación de Enigma y de búsqueda al estilo Bombe en Python y C++.

La clave resultante descifró las 82 letras reconstruidas del cuerpo del mensaje. También coincidió con la cabecera del mensaje registrada de forma independiente, que no se había utilizado para elegir el texto plano final.

El texto alemán recuperado solicita aproximadamente una ruta de marcha, informa de la ubicación del remitente en Rosenow y pide una respuesta inmediata por radio. La firma sospechada es Waschbusch, aunque esa lectura sigue siendo provisional.

El resultado fue comunicado al investigador de criptografía histórica Frode Weierud el 15 de septiembre de 2026. Weierud examinó la clave y el texto plano y concluyó que la solución era correcta.

La detallada revisión criptoanalítica señala que el trabajo también reveló errores en una transcripción anterior. Confirmó que el mensaje utilizaba una clave completamente distinta del resto del tráfico conocido del 10 de julio.

Por tanto, el proyecto hizo más que producir alemán plausible. Encontró una configuración que explicaba el texto cifrado, la cabecera independiente, el tráfico relacionado y el comportamiento de un simulador de Enigma.

Esa combinación explica por qué el resultado merece atención. Un modelo de lenguaje puede generar texto convincente sin recuperar un mensaje histórico. Aquí, la evidencia ejecutable y documental impuso límites a esa tendencia.

El verdadero resultado fue un ciclo de investigación, no un texto plano afortunado

La contribución más sólida de Astra fue coordinar varias formas de trabajo que los investigadores suelen realizar con herramientas separadas y repetidos traspasos manuales.

La investigación comenzó con la selección del objetivo, no con una solicitud de descifrado definida de forma estricta. Astra revisó una colección de mensajes sin resolver y eligió MVUEH porque el material relacionado ofrecía varias formas independientes de comprobar un resultado.

Comparó una transcripción publicada de la recepción con una copia de envío tenue. Investigó el tráfico cercano y las claves diarias conocidas. También ayudó a crear software capaz de probar configuraciones de la máquina bajo restricciones explícitas.

Esa secuencia se parece más a la investigación experta que a la respuesta habitual a preguntas. El modelo tuvo que moverse entre documentos incompletos, hipótesis históricas, código, búsquedas fallidas y verificación.

Varios enfoques iniciales fracasaron. Las claves conocidas del mismo día no descifraron el mensaje. Las hipótesis sobre la configuración de cables no produjeron ningún resultado aceptado, mientras que las primeras búsquedas de escalada de colinas rindieron mal incluso en condiciones controladas.

Esos fracasos obligaron a la investigación a reconsiderar sus supuestos. La frase repetida Rosenow acabó ofreciendo una vía más sólida porque vinculaba MVUEH con un mensaje relacionado ya resuelto.

El análisis final no se basó únicamente en el crib de 14 letras. Las 68 letras circundantes permanecían sin restricciones y debían producir una salida coherente. La cabecera registrada proporcionó entonces una prueba independiente de la configuración recuperada.

Los investigadores comprobaron de forma independiente 14.829.646 combinaciones físicas de claves frente a esa cabecera. Solo 923 siguieron siendo compatibles y requirieron una revisión completa de lectura.

Implementaciones separadas reprodujeron el resultado del mensaje y de la cabecera. Un modelo independiente de satisfacibilidad, que representa las restricciones de la máquina como un problema de lógica formal, coincidió en 42 estados muestreados.

El recifrado proporcionó otra comprobación necesaria. La configuración recuperada transformó el texto plano propuesto de vuelta en el texto cifrado reconstruido.

Esa prueba confirma la consistencia interna, pero no establece por sí sola la interpretación histórica. Una transcripción equivocada o un crib mal elegido todavía pueden desviar un cálculo consistente.

La investigación reforzó su afirmación al combinar el recifrado con la cabecera, los mensajes relacionados, las alternativas de fuentes declaradas de antemano y la revisión externa. La evidencia no elimina toda incertidumbre editorial, especialmente en torno a la firma.

La primera revisión independiente también tuvo límites. SWARM reprodujo el resultado esperado del cuerpo y la cabecera usando otro simulador, pero no repitió la búsqueda completa. Por tanto, confirmó la configuración recuperada sin redescubrirla de forma independiente.

Esta distinción es fundamental para entender cómo Astra descifró Enigma. Que varios agentes de IA coincidan entre sí no constituiría una confirmación independiente. Pueden heredar la misma fuente errónea, supuesto o defecto de software.

Las comprobaciones significativas procedían de evidencia externa a su conversación. Esto incluía formularios de mensajes, datos de cabecera registrados de forma independiente, implementaciones separadas, tráfico histórico y la revisión de un criptoanalista experimentado.

El flujo de trabajo ofrece un modelo útil para la investigación asistida por IA más allá de la criptografía. Un agente puede buscar documentos, escribir código de análisis y proponer explicaciones. Su conclusión se vuelve creíble solo cuando evidencia externa puede refutar un error bien presentado.

Aquí también es donde una buena gestión del conocimiento se convierte en parte del rigor técnico. Los investigadores necesitan vínculos trazables entre documentos fuente, supuestos, experimentos y revisiones.

Una base de conocimiento de IA estructurada puede preservar esas conexiones. No puede validar un cifrado, pero sí puede mantener visible la cadena de evidencia para los revisores humanos.

Claude Opus continuó con un tipo distinto de ataque a Enigma

Claude Opus 5 alcanzó otro resultado válido, pero una orientación humana más sólida dio forma tanto a su objetivo como a su estrategia de búsqueda.

El 20 de septiembre, el investigador de ciberseguridad Jack Willis recuperó la clave de otro mensaje, FMNGI. Informó a Weierud al día siguiente, seis días después de que la solución de MVUEH fuera enviada para validación.

FMNGI era un mensaje entrante fechado el 31 de julio de 1941. Había sido recibido por la estación de radio de intendencia de la División SS-Totenkopf y registrado como mensaje número 285.

Willis proporcionó a Claude Opus 5 un entorno de trabajo criptoanalítico escrito en Go y material histórico relevante. Esa configuración ofreció al modelo un entorno más limitado y preparado que el que recibió Astra.

La pista decisiva procedía del tráfico relacionado. Una firma de cierre asociada con Friedrich Hartjenstein produjo el crib de 14 letras XHARTJENSTEINX.

Los criptoanalistas históricos ya habían documentado varias formas de la firma de Hartjenstein. Eso hizo que su nombre fuera una fuente creíble de texto plano esperado, en lugar de una frase inventada después de ver el resultado.

Claude utilizó el entorno de trabajo y el material proporcionado para investigar el mensaje. La búsqueda final de la clave tardó 13 minutos y 28 segundos en un ordenador Apple M2, según el informe técnico de FMNGI.

El texto plano recuperado contenía un error en la palabra alemana para columna. Weierud explicó que el error pudo haberse producido durante el cifrado, la transcripción o la transmisión en Morse.

Esa imperfección refuerza un punto importante. Los mensajes históricos no son entradas limpias para benchmarks. Los operadores, las condiciones de radio, la escritura a mano y la transcripción posterior pueden introducir ruido.

Una segunda copia archivística del mensaje resultó especialmente útil. Weierud había encontrado una colección de tráfico del servicio de suministros en el Bundesarchiv de Alemania en julio de 2026.

La copia asociada con el mensaje número 205 NF conservaba un texto cifrado más preciso que la versión del número 285 publicada anteriormente. También respaldaba la relación con Hartjenstein.

La colección de textos planos disponible podría haber permitido una solución más directa. Sin embargo, Willis no disponía de ese texto plano completo cuando comenzó su ataque.

La búsqueda asistida por Claude se basó en cambio en la firma del oficial como crib. Esto dejó que el resto del mensaje sirviera como comprobación de la clave recuperada.

Este método situó más experiencia humana cerca del inicio del proceso. Willis seleccionó los recursos, proporcionó el entorno de trabajo y orientó la investigación hacia una pista respaldada históricamente.

El proyecto de Astra delegó una parte mayor de la selección de objetivos y el desarrollo de herramientas. Su investigador seguía estableciendo la meta, evaluando el progreso e impulsando el trabajo, pero el modelo exploró un espacio de problemas más amplio.

Esas diferencias importan más que una simple puntuación de Astra frente a Claude Opus. Un flujo de trabajo evaluó una autonomía de investigación más amplia. El otro evaluó la colaboración enfocada entre un experto, un modelo capaz y una infraestructura técnica preparada.

Ambos produjeron resultados útiles. Ninguno demuestra que un modelo pueda reemplazar de forma independiente a un criptoanalista, archivista, ingeniero de software y revisor histórico.

En cambio, muestran que los modelos de frontera pueden moverse eficazmente entre esos roles cuando un investigador humano controla el objetivo y exige evidencia verificable.

La otra prueba de Turing es la evidencia, no la imitación

La simetría histórica resulta convincente, pero estos proyectos no establecen que los modelos de frontera hayan recreado el logro bélico de descifrar Enigma.

Alan Turing está estrechamente asociado con el juego de imitación, posteriormente denominado prueba de Turing. Plantea si una interacción escrita puede hacer que una máquina sea indistinguible de una persona.

Su trabajo durante la guerra abordó un problema distinto. Turing, Gordon Welchman, criptanalistas polacos, operadores, ingenieros y miles de empleados de Bletchley Park construyeron un sistema de inteligencia en torno a los cambiantes cifrados alemanes.

Los relatos modernos suelen condensar ese esfuerzo colectivo en un solo hombre brillante y una sola máquina. La operación real combinó tráfico interceptado, errores de procedimiento, material capturado, razonamiento estadístico, Bombes electromecánicas y juicio humano continuo.

La Bombe británica ayudaba a buscar posibles configuraciones de Enigma utilizando contradicciones lógicas derivadas de cribas. No se limitaba a recibir texto cifrado y producir una respuesta legible.

Los proyectos recientes siguen ese patrón histórico más de cerca que la narrativa habitual sobre chatbots. Los humanos aportaron corpus históricos y objetivos de investigación. Los modelos organizaron pistas, escribieron herramientas y exploraron posibilidades. La evidencia externa determinó si sus respuestas se sostenían.

Sin embargo, calificar los resultados como equivalentes al trabajo bélico de Turing distorsionaría ambas historias. Los criptoanalistas originales se enfrentaban a un adversario activo cuyos procedimientos y claves cambiaban continuamente.

Astra y Claude trabajaron con mensajes preservados después de que el diseño de Enigma se entendiera durante décadas. Podían recurrir a claves publicadas, tráfico conocido, ordenadores modernos, hallazgos de archivo y técnicas criptoanalíticas consolidadas.

La afirmación responsable es más limitada. La IA de frontera ayudó a recuperar dos mensajes individuales cuyas configuraciones exactas se habían resistido a intentos anteriores.

El propio proyecto de Leffen declara explícitamente que no pretende haber descifrado Enigma por primera vez. Esa salvedad debe mantenerse en cada nueva narración.

La metáfora del titular aún captura algo real. Estos modelos afrontaron tareas en las que el lenguaje persuasivo era insuficiente. Tuvieron que producir artefactos que otras personas pudieran ejecutar e inspeccionar.

Esa es una evaluación más exigente que un benchmark normal. Un benchmark suele fijar la pregunta, la regla de puntuación y la respuesta esperada antes de que el modelo comience.

La criptoanálisis de archivo no ofrece límites tan claros. La fuente puede contener errores. La mejor pista puede encontrarse en otra colección. Una respuesta plausible puede ser incorrecta por varias razones no relacionadas.

Por tanto, el éxito depende de navegar la incertidumbre sin reescribirla silenciosamente. El modelo debe saber cuándo buscar, programar, comparar registros, cuestionar una transcripción y solicitar una comprobación externa.

Ese es el significado más útil de la otra prueba de Turing. Mide si un sistema de IA puede participar en una cadena disciplinada de investigación, no si suena como un experto.

El registro bélico también advierte contra tratar el descifrado como un acto de genialidad solitaria. La criptoanálisis eficaz siempre ha unido la perspicacia humana, las máquinas, los procedimientos y el conocimiento institucional.

Los resultados de 2026 actualizan la maquinaria de esa colaboración. No eliminan la colaboración en sí.

Lo que los resultados de Astra y Opus no demuestran

Dos casos exitosos no pueden establecer fiabilidad general, autonomía plena ni una amplia capacidad nueva para derrotar el cifrado moderno.

Enigma es históricamente importante, pero no representa la seguridad criptográfica actual. El cifrado moderno se basa en construcciones matemáticas, implementaciones y modelos de amenaza diferentes.

Por tanto, la recuperación de los mensajes dice poco sobre si un modelo de frontera puede romper un cifrado moderno correctamente desplegado. No debe presentarse como prueba de que las comunicaciones contemporáneas cifradas estén repentinamente expuestas.

Los casos también se beneficiaron de un amplio trabajo humano previo. Crypto Cellar Research mantuvo el corpus de mensajes, documentó los casos sin resolver, preservó las claves y conectó tráfico relacionado.

Los investigadores ya habían recuperado mensajes cercanos y estudiado firmas recurrentes. Nuevos hallazgos del Bundesarchiv añadieron textos cifrados duplicados y evidencia contextual poco antes de los ataques asistidos por IA.

Astra contó con una pista útil en la frase Rosenow repetida de SIPVX. Claude recibió la firma de Hartjenstein, material histórico preparado y un entorno criptoanalítico operativo.

Estas ventajas no hacen que los resultados sean triviales. Definen la tarea real que completaron los sistemas.

La interpretación más sólida se refiere a la compresión de la investigación. Según se informa, Astra completó en dos días un trabajo que Weierud creía que podría llevar a un investigador humano semanas o meses.

Esa comparación procede de un participante experimentado, no de un estudio controlado de productividad. Debe tratarse como un juicio informado, no como una medición universal.

Las partes autónomas de la investigación de Astra también requieren un examen adicional. Sus registros hacían referencia a identificadores correctos de archivos del Bundesarchiv que no estaban disponibles en el sitio web de Crypto Cellar.

Weierud informó de incertidumbre sobre cómo el modelo encontró esas referencias. Podrían haber aparecido en otra parte de internet, proceder de registros de catálogo accesibles o haber llegado al modelo por otra vía.

No es necesario inventar una explicación misteriosa. La respuesta adecuada es preservar los registros, identificar la ruta de recuperación y separar el descubrimiento de fuentes de la inferencia sin respaldo.

El caso también plantea cuestiones de contaminación. Un modelo puede parecer que razona de manera independiente cuando el material pertinente ya existe en sus datos de entrenamiento o entorno de recuperación.

MVUEH seguía figurando como no resuelto cuando comenzó la investigación. Sin embargo, los investigadores aún deben documentar cada fuente accesible antes de atribuir el mérito al razonamiento general.

La reproducibilidad también sigue siendo incompleta. Volver a ejecutar el verificador final es más fácil que repetir todo el proceso de descubrimiento.

Una réplica completa empezaría con el mismo corpus público, preservaría idénticas incertidumbres de las fuentes y recuperaría la clave de forma independiente sin reutilizar la posición descubierta de la criba.

FMNGI presenta una limitación relacionada. La búsqueda de Claude fue rápida una vez que el investigador proporcionó el banco de trabajo y la sólida pista de la firma. El tiempo de ejecución de 13 minutos no mide el trabajo de archivo necesario para identificar esa pista.

Estas salvedades no borran el logro. Muestran por qué las afirmaciones sobre ciencia autónoma necesitan evidencia más exigente que las afirmaciones sobre una investigación histórica exitosa.

La conclusión más defendible es específica. Dos proyectos dirigidos por investigadores utilizaron modelos de frontera para resolver mensajes Enigma separados que seguían sin resolver, y un especialista externo experimentado aceptó ambas claves.

Cualquier afirmación más amplia sigue siendo una cuestión de investigación abierta.

Tres señales mostrarán si esto se convierte en un método repetible

La próxima prueba consiste en determinar si otros investigadores pueden reproducir el flujo de trabajo, resolver mensajes más difíciles y preservar un registro verificable de cada decisión.

La primera señal es una réplica independiente de principio a fin de MVUEH. Un nuevo equipo debería comenzar con el corpus previo a la solución y las alternativas de fuentes documentadas.

Si ese equipo recupera la misma clave sin importar la solución publicada, se reforzará el argumento a favor de un método de investigación con IA reutilizable. Si la réplica requiere pistas no divulgadas, las afirmaciones de autonomía se debilitan.

La segunda señal es el progreso en el corpus restante. Crypto Cellar Research informa de que su colección contiene cerca de 1.000 mensajes Enigma y Truppenschlüssel.

Tras los dos desciframientos de septiembre, siete mensajes Enigma siguen sin resolver. Otro acertijo, WEUWY número 138, tiene texto plano conocido a partir de un mensaje paralelo, pero aún carece de su clave original.

Esos objetivos no son equivalentes. Algunos pueden seguir sin resolverse porque sus textos cifrados supervivientes contienen demasiados errores, sus mensajes son demasiado cortos o no existe una criba útil.

Un éxito adicional sería más significativo si los investigadores publican los enfoques fallidos, las incertidumbres de las fuentes, el código y los materiales de verificación. Un texto plano por sí solo proporcionaría evidencia mucho más débil.

La tercera señal es la adopción fuera de la criptoanálisis histórica. El flujo de trabajo central puede trasladarse a la arqueología de software, la revisión de literatura científica, la informática forense documental y otras investigaciones con registros incompletos.

Un modelo tendría que localizar evidencia relevante, escribir herramientas, poner a prueba explicaciones rivales y exponer sus supuestos para su revisión. También debería preservar los resultados negativos en vez de presentar una historia retrospectiva fluida.

Ese último requisito es importante para las empresas y los trabajadores del conocimiento. Muchos sistemas de IA ahora resumen documentos de forma convincente, pero menos mantienen una cadena rastreable desde la fuente hasta la conclusión.

El proyecto de descifrado de Enigma de Astra ofrece un estándar mejor. Los modelos deberían generar artefactos intermedios inspeccionables, mientras que la evidencia independiente conserva la capacidad de refutar la respuesta.

Los desarrolladores deberían observar si los proveedores de modelos facilitan la auditoría de esos flujos de trabajo. Entre las funciones útiles se incluyen registros de investigación persistentes, citas a nivel de fuente, ejecución reproducible de herramientas y una separación clara entre hechos recuperados e inferencia del modelo.

Los investigadores también deberían preguntar quién controla la selección de objetivos. La libertad relativa de Astra ayudó a revelar sus capacidades más amplias, pero la autonomía amplía el espacio para supuestos ocultos y búsquedas irrelevantes.

El entorno restringido de Claude redujo esa libertad y, al mismo tiempo, facilitó la interpretación del proceso. Ninguna disposición es automáticamente superior.

El diseño adecuado depende del coste del error y de la disponibilidad de comprobaciones externas. El descubrimiento abierto se beneficia de la exploración, mientras que las conclusiones de alto riesgo requieren controles de revisión más estrictos.

Estos casos dejan a los lectores una pregunta práctica. ¿Puede un sistema de IA limitarse a producir una respuesta, o puede ayudar a construir un registro que un experto escéptico pueda poner a prueba?

Para Astra y Claude Opus, dos antiguos mensajes Enigma aportaron evidencia alentadora. Los próximos proyectos deben demostrar que el método resiste a nuevos investigadores, nuevos archivos y objetivos sin soluciones conocidas.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page