top of page

La jugada 37 de AlphaGo resuena en el descubrimiento matemático impulsado por IA

11 ago
14 min de lectura

AlphaGo realizó la jugada 37 en 2016, desafiando siglos de intuición en Go antes de derrotar a Lee Sedol por cuatro partidas a una. Este análisis techmeme plantea si las matemáticas se acercan ahora a su propio momento de jugada 37.

La comparación ha cobrado fuerza porque los sistemas más recientes hacen más que reproducir soluciones conocidas. Exploran espacios amplios, generan candidatos inesperados y trasladan los resultados más sólidos a evaluadores formales o expertos humanos. Algunos han mejorado cotas matemáticas o encontrado algoritmos que superan métodos establecidos.

Esto cambia el argumento central sobre el razonamiento de la IA. La competencia importante ya no es IA contra un campeón en un juego de tablero cerrado. Es la novedad generada por máquinas frente a los estándares que emplean las matemáticas para reconocer el conocimiento.

AlphaGo aportó la imagen duradera: una jugada que al principio resultó difícil de explicar para los expertos, pero que demostró ser estratégicamente acertada. Las matemáticas plantean una exigencia mayor. Una respuesta sorprendente solo importa cuando los investigadores pueden verificarla, comprender su alcance y distinguir un descubrimiento de un redescubrimiento.

La jugada 37 convirtió una elección inusual en una ganadora

La jugada 37 importó porque la extraña decisión de AlphaGo resistió el contacto con un resultado implacable.

AlphaGo de Google DeepMind se enfrentó a Lee Sedol en Seúl durante marzo de 2016. Sedol había ganado 18 títulos mundiales de Go y figuraba entre los jugadores más fuertes de su generación. Más de 200 millones de personas vieron el enfrentamiento a cinco partidas, según DeepMind.

AlphaGo realizó la famosa jugada durante la segunda partida. Colocó una piedra en la quinta línea, lejos de los patrones convencionales que moldeaban el criterio profesional. Los comentaristas inicialmente consideraron la elección un posible error.

DeepMind describió posteriormente la jugada 37 como una decisión con aproximadamente una posibilidad entre 10.000 de ser elegida por un jugador humano. La jugada ayudó a AlphaGo a controlar el tablero y finalmente a ganar la partida. Su importancia provenía de la combinación de sorpresa y éxito medible.

Sedol reconoció esa diferencia. Esperaba una máquina guiada por el cálculo, pero la jugada 37 lo llevó a describir a AlphaGo como creativo. Esa reacción captó algo que las puntuaciones de referencia rara vez transmiten: el sistema había introducido una idea útil fuera de la práctica humana conocida.

El enfrentamiento terminó con una victoria de AlphaGo por 4-1. Sedol ganó la cuarta partida tras realizar su propia y muy improbable jugada 78, a veces llamada “God’s Touch”. El intercambio evitó que la historia se convirtiera en un simple relato de supremacía de las máquinas.

AlphaGo utilizó redes neuronales para evaluar posiciones del tablero y búsqueda de árbol Monte Carlo para examinar continuaciones prometedoras. La búsqueda de árbol Monte Carlo estima buenas acciones simulando repetidamente ramas seleccionadas de un árbol de decisión. El aprendizaje por refuerzo mejoró después el sistema mediante experiencia y autojuego.

El sistema no razonaba sobre Go mediante lenguaje humano. Asignaba valores a las posiciones, exploraba futuros posibles y seleccionaba la jugada con el resultado estimado más sólido. Ese mecanismo le permitió escapar de algunas convenciones integradas en ejemplos de expertos.

El relato de DeepMind sobre los enfrentamientos de AlphaGo afirma que la jugada 37 trastocó siglos de sabiduría heredada en Go. El resultado no fue simplemente una mejor puntuación. Los jugadores profesionales estudiaron la jugada y ajustaron su manera de entender el tablero.

Por eso el episodio sigue siendo útil diez años después. La jugada ofreció a los observadores un ejemplo conciso de novedad generada por máquinas que los humanos podían probar, reproducir y, con el tiempo, asimilar.

Las matemáticas no ofrecen un marcador tan inmediato como una partida de Go terminada. Su pregunta decisiva es si una construcción, algoritmo o conjetura inusual sigue siendo correcta bajo análisis formal. Esa diferencia vuelve los descubrimientos actuales más trascendentes, pero también más difíciles de evaluar.

Por qué este análisis techmeme va más allá de Go

La pregunta moderna de la jugada 37 se refiere a si la IA puede producir conocimiento verificable, no a si puede sorprender a una audiencia.

Go ofrecía a AlphaGo reglas fijas, información completa y un objetivo claro. Cada posición legal del tablero podía evaluarse mediante victorias y derrotas finales. Las matemáticas contienen espacios más amplios en los que incluso definir un objetivo útil exige criterio experto.

Un sistema matemático también debe afrontar la falta de contexto. A los investigadores les importa por qué funciona una construcción, qué supuestos la sustentan y si se generaliza. Una mejora numérica puede ser valiosa sin responder a esas cuestiones más profundas.

Sin embargo, el campo ha superado varios umbrales importantes. Los sistemas de IA ahora generan construcciones candidatas, buscan algoritmos, resuelven problemas difíciles de competición y ayudan a matemáticos que investigan cuestiones abiertas. Sus resultados más sólidos se basan en ciclos de verificación, no solo en resultados fluidos.

Esa distinción separa los sistemas de descubrimiento de los chatbots convencionales. Un modelo de lenguaje puede producir prosa matemática convincente que contenga un error oculto. En cambio, un evaluador puede ejecutar código, probar una construcción o comprobar si una demostración sigue reglas permitidas.

FunSearch de Google DeepMind combinó un modelo de lenguaje con un evaluador automatizado y un proceso de búsqueda evolutiva. El modelo de lenguaje propuso programas, mientras que el evaluador los calificó y rechazó los candidatos inadecuados. Los mejores programas regresaban al conjunto de prompts, creando un ciclo de búsqueda iterativo.

La investigación revisada por pares de FunSearch informó de nuevas construcciones para el problema de cap set, un problema establecido de combinatoria extremal. Los investigadores también encontraron heurísticas de empaquetado en línea que mejoraban las referencias ampliamente utilizadas bajo las distribuciones estudiadas.

Estos resultados importan porque el evaluador creó un estándar externo. El modelo no podía lograr aceptación mediante lenguaje persuasivo. Su programa tenía que generar un resultado que superara una referencia existente.

FunSearch también produjo programas en lugar de listas aisladas de respuestas. Un programa puede revelar un patrón reutilizable y ayudar a los investigadores a examinar cómo se generó el resultado. Eso lo hace más interpretable que una colección bruta de objetos exitosos.

Aun así, la interpretabilidad es relativa. El código legible no garantiza una explicación matemática concisa. Los investigadores pueden necesitar un trabajo considerable para convertir un resultado computacional en un teorema, una demostración o un principio general.

Aquí es donde la comparación con la jugada 37 se vuelve precisa. AlphaGo seleccionó una jugada cuyo valor se hizo visible durante el resto de una partida. Un candidato matemático puede requerir meses de comprobación, refinamiento y traducción a la teoría establecida.

La presión recae tanto en los desarrolladores de IA como en los matemáticos. Los desarrolladores deben construir sistemas cuyos resultados puedan auditarse. Los matemáticos deben decidir cuánto valor tiene la evidencia computacional, quién recibe el crédito y qué resultados merecen la escasa atención experta.

Un sistema personal de conocimiento útil puede ayudar a los investigadores a preservar esos rastros de hipótesis, verificaciones fallidas y artículos de apoyo. Sin embargo, organizar la evidencia no sustituye la verificación matemática.

Por tanto, un análisis techmeme de este cambio no puede detenerse en la imagen de una máquina creativa. Debe examinar el mecanismo que convierte la variación de las máquinas en conocimiento fiable.

Los evaluadores son el mecanismo detrás del descubrimiento de IA

El avance decisivo es un ciclo de exploración y evaluación que genera muchas ideas mientras aplica una prueba estricta a cada superviviente.

AlphaEvolve amplía este enfoque desde funciones individuales hasta bases de código algorítmico más grandes. Google DeepMind presentó el sistema en mayo de 2025 como un agente de programación evolutiva impulsado por modelos Gemini. Combina generación de programas, evaluación automatizada y selección repetida.

Los modelos más rápidos pueden generar una amplia variedad de programas candidatos. Los modelos más capaces aportan revisiones más profundas a los candidatos prometedores. Los evaluadores ejecutan los programas, miden su rendimiento y conservan variaciones útiles en una base de datos compartida.

El proceso se parece a la selección natural, pero su entorno está diseñado por investigadores. Los humanos especifican la tarea, el marco ejecutable y la métrica utilizada para evaluar a los candidatos. El sistema explora entonces más variaciones de las que un equipo pequeño podría inspeccionar manualmente.

Según los hallazgos de AlphaEvolve de DeepMind, el sistema se aplicó a más de 50 problemas abiertos. Según se informa, redescubrió soluciones líderes en aproximadamente el 75 por ciento de los experimentos y las mejoró en el 20 por ciento.

Uno de los resultados consistió en multiplicar matrices de valores complejos de 4 por 4 usando 48 multiplicaciones escalares. DeepMind afirmó que esto mejoraba el mejor método conocido para esa configuración concreta, cuyos antecedentes se remontaban al trabajo de Strassen en 1969.

Otro experimento abordó el problema del número de besos. El problema pregunta cuántas esferas unitarias no superpuestas pueden tocar una esfera unitaria central en una dimensión elegida. AlphaEvolve encontró una configuración de 593 esferas exteriores en 11 dimensiones, mejorando una cota inferior conocida.

Estos ejemplos revelan por qué las matemáticas se adaptan bien a la IA basada en evaluadores. Una configuración candidata a menudo puede comprobarse mecánicamente. El número de operaciones de un algoritmo puede medirse, mientras que su corrección puede examinarse de forma independiente.

El evaluador también delimita lo que significa la “creatividad”. No exige que una máquina posea motivaciones humanas o juicio estético. Exige que el sistema genere un candidato eficaz que no haya sido simplemente proporcionado por sus diseñadores.

Sin embargo, el evaluador crea su propio límite. AlphaEvolve funciona mejor cuando el éxito puede expresarse mediante código y un objetivo medible. Muchas preguntas matemáticas importantes se resisten a ese tratamiento.

Los investigadores también pueden optimizar el indicador equivocado. Un sistema puede producir una puntuación alta mientras explota lagunas en el evaluador o ignora cualidades que los expertos valoran. Esto se parece al reward hacking, en el que un agente satisface la métrica declarada sin cumplir el objetivo previsto.

Las decisiones humanas siguen presentes en toda la cadena. Los expertos formulan el problema, codifican restricciones, eligen referencias, inspeccionan resultados y deciden si una mejora numérica tiene importancia matemática. La IA amplía la búsqueda en lugar de eliminar el criterio de investigación.

Esa división del trabajo se parece más a AlphaGo de lo que sugieren los relatos populares. Los humanos diseñaron la arquitectura y el proceso de entrenamiento de AlphaGo, mientras el sistema buscaba más allá de los patrones de juego habituales. Los jugadores interpretaron después las estrategias resultantes e incorporaron lecciones útiles.

Los sistemas más recientes repiten ese ciclo en ámbitos menos controlados. Generan candidatos inusuales, los someten a evaluadores e invitan a expertos a explicar qué sobrevive. El ciclo es el verdadero sucesor de la jugada 37.

La competencia principal es entre novedad y verificación

Un resultado sorprendente se convierte en descubrimiento solo después de que comprobaciones independientes establecen que es correcto, nuevo y significativo.

La novedad es difícil de demostrar para un modelo entrenado con grandes colecciones de trabajo humano. Un sistema puede reproducir una construcción poco conocida sin revelar dónde encontró la idea. Por ello, los investigadores necesitan pruebas más sólidas que la explicación del propio modelo.

Mejorar un resultado documentado como estado del arte proporciona una prueba útil. Si un candidato supera una referencia publicada bajo las mismas condiciones, la simple memorización se convierte en una explicación menos convincente. Aun así, no establece una importancia científica amplia.

Las demostraciones formales ofrecen una vía más rigurosa. Un asistente de demostraciones puede comprobar cada paso lógico frente a reglas explícitas. Sin embargo, convertir una idea matemática informal en lenguaje formal suele requerir un amplio esfuerzo humano.

AlphaGeometry ilustra un enfoque híbrido. Combina un modelo neuronal de lenguaje con un motor de deducción simbólica, que aplica reglas geométricas formales. El modelo propone construcciones útiles cuando la búsqueda simbólica llega a puntos de ramificación difíciles.

En una prueba con 30 problemas de geometría de nivel olímpico, AlphaGeometry resolvió 25. El método líder anterior resolvió diez, mientras que el sistema se acercó al rendimiento de un medallista de oro promedio. Sus resultados incluyeron demostraciones legibles para humanos evaluadas por expertos.

El estudio publicado sobre AlphaGeometry también informó de una versión generalizada de un teorema de la Olimpiada Internacional de Matemáticas de 2004 traducido. Ese resultado sugiere que la búsqueda puede revelar estructuras que van más allá de completar un examen establecido.

No obstante, los problemas de las olimpiadas difieren de la investigación abierta. Están diseñados para tener soluciones concisas, y los evaluadores ya saben que existe una solución. Los problemas de investigación pueden estar mal especificados o resistirse a los métodos de demostración disponibles.

Por tanto, el rendimiento en competiciones mide una capacidad útil sin resolver la cuestión del descubrimiento. Un sistema puede dominar estilos de problemas conocidos y, aun así, aportar poco a las matemáticas fuera de esos estilos. A la inversa, un optimizador limitado puede producir un resultado valioso sin demostrar una capacidad amplia de razonamiento.

El argumento escéptico se refuerza cuando las empresas vinculan logros individuales con la inteligencia artificial general. La retrospectiva de DeepMind por el aniversario de AlphaGo presenta Move 37 como parte de un camino desde los juegos hacia el descubrimiento científico y la AGI.

Esa es una interpretación de la empresa, no una conclusión establecida de forma independiente. El progreso en la búsqueda algorítmica acotada no demuestra que un sistema pueda elegir de manera autónoma preguntas de investigación importantes. Tampoco muestra que comprenda un descubrimiento como lo hace un matemático.

También existen costes prácticos de verificación. Los sistemas automatizados pueden generar candidatos más rápido de lo que los expertos pueden revisarlos. Si el coste de validación sigue siendo alto, los investigadores se enfrentan a un cuello de botella de atención, no a una escasez de ideas.

Este cuello de botella cambia el valor de la producción de IA. El sistema más útil quizá no sea el que proponga el mayor número de conjeturas. Puede ser el que proporcione certificados breves, código reproducible y vínculos claros con trabajos previos.

La atribución de crédito plantea otra cuestión sin resolver. Un resultado puede involucrar a desarrolladores de modelos, equipos de infraestructura, matemáticos que formalizaron el problema y expertos que demostraron el teorema final. Las convenciones actuales de autoría no se diseñaron para esa cadena.

La respuesta adecuada no es descartar los resultados generados por máquinas. Es exigir pruebas que correspondan a la afirmación. «Encontró un candidato mejor» requiere una comparación reproducible, mientras que «descubrió un teorema» requiere un enunciado y una demostración verificados.

Move 37 superó una prueba transparente porque todos pudieron ver cómo se desarrollaba la partida. Las matemáticas necesitan pruebas igual de legibles antes de que sus propias jugadas sorprendentes merezcan un estatus comparable.

La IA está presionando los flujos de trabajo de investigación, no reemplazando a los matemáticos

El efecto inmediato es un cambio en la forma en que los investigadores buscan, prueban y priorizan ideas, en lugar de la eliminación de los matemáticos humanos.

Tradicionalmente, un matemático equilibra la intuición con el cálculo dirigido. Los sistemas de descubrimiento mediante IA alteran ese equilibrio al abaratar la exploración computacional amplia. Los investigadores pueden probar más desigualdades, construcciones o algoritmos candidatos antes de comprometerse con una estrategia de demostración.

Terence Tao describió una versión práctica de este flujo de trabajo en la actualización de DeepMind de 2026 sobre AlphaEvolve. Dijo que estas herramientas ayudan a los matemáticos a comprobar posibles desigualdades en busca de contraejemplos e investigar posibles extremizadores. Un extremizador es un objeto que alcanza el valor más grande o más pequeño posible.

Ese apoyo puede afinar la intuición. Un investigador puede llegar con una conjetura, pedir al sistema que busque contraejemplos y revisar el enunciado cuando aparece uno. El teorema final se vuelve más preciso antes de que comience la demostración formal.

El mismo flujo de trabajo puede ayudar a revelar una confianza injustificada. Las matemáticas contienen patrones plausibles que fallan en un caso límite remoto. Las búsquedas computacionales a gran escala pueden localizar esos fallos antes que el análisis manual.

DeepMind afirma que AlphaEvolve ha contribuido a trabajos sobre problemas de Erdős y ha mejorado cotas inferiores relacionadas con el problema del viajante y los números de Ramsey. Sus aplicaciones ampliadas también incluyen trabajos de optimización en informática y campos científicos.

Esas afirmaciones requieren un examen resultado por resultado. Una cota inferior puede mejorar sin resolver el problema asociado. Una observación computacional útil puede guiar una demostración sin convertirse por sí sola en un teorema.

La presión también se extiende más allá de las matemáticas puras. Mejores métodos de multiplicación de matrices pueden influir en bibliotecas de software, hardware especializado y entrenamiento de IA. Incluso una mejora limitada puede importar cuando la operación relevante se ejecuta a una escala enorme.

Esto crea incentivos para que Google y otras empresas de IA inviertan en sistemas de descubrimiento. Las ganancias algorítmicas pueden mejorar la infraestructura interna y, al mismo tiempo, aportar evidencia de una capacidad de razonamiento más amplia. El prestigio científico y la eficiencia operativa se refuerzan mutuamente.

Otros laboratorios se enfrentan a la presión de ofrecer más que respuestas pulidas a preguntas conocidas. Necesitan sistemas que produzcan trabajo auditable, interactúen con herramientas formales y resistan la revisión de expertos. Las puntuaciones de referencia por sí solas revelan poco sobre si un modelo puede ampliar el conocimiento.

Las universidades se enfrentan a una presión diferente. Los investigadores necesitan acceso a computación, infraestructura de evaluación y modelos que puedan estudiarse abiertamente. Si los principales sistemas de descubrimiento siguen siendo difíciles de reproducir, los expertos externos podrían tener dificultades para evaluar las afirmaciones de las empresas.

Los estudiantes también necesitarán un conjunto distinto de hábitos. Producir un borrador de demostración plausible se está volviendo menos escaso. Comprobar supuestos, rastrear trabajos previos, formalizar argumentos y reconocer preguntas significativas cobran mayor importancia.

Nada de esto vuelve obsoleto el criterio matemático. Los evaluadores premian aquello que los investigadores codifican. Elegir un problema fértil y reconocer un patrón esclarecedor sigue requiriendo un juicio contextual que los sistemas actuales no proporcionan de manera fiable.

El modelo más sólido a corto plazo es colaborativo. La IA realiza búsquedas amplias y pruebas mecánicas. Los humanos definen objetivos valiosos, investigan por qué funciona un resultado y lo conectan con el panorama matemático más amplio.

Esa disposición aún puede redistribuir la influencia. Los investigadores que construyen evaluadores eficaces ganan capacidad de acción, mientras que los equipos sin recursos computacionales corren el riesgo de quedarse atrás. El trabajo matemático queda más estrechamente vinculado a la ingeniería de software y a la infraestructura.

Este análisis de techmeme trata, por tanto, tanto del cambio institucional como de la inteligencia de las máquinas. Move 37 adquirió valor cuando los jugadores humanos lo estudiaron. La IA matemática importará cuando los investigadores puedan convertir de forma fiable resultados desconocidos en comprensión compartida.

Qué contaría como el Move 37 de las matemáticas

El próximo momento decisivo necesita verificación independiente, novedad genuina y una lección que cambie la forma en que trabajan los matemáticos.

La primera señal que hay que observar es un resultado plenamente verificado sobre un problema abierto que especialistas externos reconozcan como significativo. El código reproducible y una demostración formal reforzarían la afirmación. La dependencia de un evaluador privado la debilitaría.

La segunda señal es una adopción humana sostenida. Una sola construcción sorprendente puede atraer atención, pero un cambio real de flujo de trabajo aparece cuando investigadores independientes utilizan repetidamente ideas generadas por IA. Las citas, las demostraciones posteriores y los métodos mejorados ofrecen mejor evidencia que las demostraciones.

La tercera señal es la transferencia entre clases de problemas. AlphaGo dominó un juego antes de que sus técnicas subyacentes influyeran en sistemas posteriores. Un motor de descubrimiento matemático se vuelve más trascendente cuando el mismo enfoque tiene éxito en campos no relacionados sin una reconstrucción extensa y específica para cada tarea.

Estas pruebas protegen la comparación de convertirse en una fórmula de marketing. Move 37 no importó solo porque pareciera extraño. Importó porque la jugada contribuyó a la victoria y posteriormente transformó la intuición de los expertos.

Las matemáticas exigen un estándar aún más alto. Un resultado producido por una máquina debe seguir siendo correcto bajo un examen hostil. Los investigadores también deben establecer que el resultado era desconocido e importante más allá de la métrica elegida.

La vía más creíble pasa por una evaluación transparente. Los sistemas deberían revelar definiciones de problemas, líneas de base, procedimientos de verificación y las contribuciones humanas que rodean cada resultado. Los equipos independientes deberían poder reproducir las afirmaciones centrales.

Ese enfoque a veces hará que el progreso parezca más lento. También creará conocimiento que pueda sobrevivir más allá de un ciclo de producto. Las matemáticas premian resultados que siguen siendo válidos después de que hayan cambiado el modelo, la empresa y la referencia.

La expresión «descubrimiento mediante IA» debería abarcar, por tanto, varios niveles. Un sistema puede encontrar un candidato numérico mejor, sugerir una conjetura útil, generar una demostración o ayudar a los humanos a derivar una teoría nueva. Esos logros no deberían tratarse como intercambiables.

Una década después de AlphaGo, el desarrollo importante no es que las máquinas todavía puedan sorprender a las personas. Es que los investigadores están construyendo procesos que filtran la sorpresa mediante pruebas objetivas.

El análisis de techmeme sobre Move 37 apunta a una pregunta práctica para cada desarrollador, investigador y trabajador del conocimiento: ¿puede inspeccionar cómo un resultado de IA se ganó la confianza? Siga el rastro de la demostración, pruebe el código y conserve los intentos fallidos junto al ganador.

El próximo Move 37 quizá no llegue ante una audiencia global. Puede aparecer discretamente dentro de un programa, seguido de meses de comprobaciones. Cuando los matemáticos adopten su idea subyacente, el verdadero avance se hará visible.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page