top of page

Ataraxos Stratego AI venció al mejor humano, y entrenarlo costó menos de 8.000 dólares

hace 2 días
15 min de lectura

Ataraxos Stratego AI derrotó 15-1-4 al jugador humano más laureado del juego después de que los investigadores lo entrenaran con menos de 8.000 dólares en costes de computación. El resultado cuestiona la idea de que vencer a humanos de élite en juegos de estrategia complejos requiera un presupuesto de investigación industrial.

Investigadores del MIT, Carnegie Mellon University, New York University y Stanford University desarrollaron Ataraxos. Su artículo revisado por pares apareció en Nature el 30 de septiembre de 2026. El sistema combina entrenamiento eficiente mediante autojuego con planificación específica durante cada partida.

La comparación importante no es otra victoria sobre humanos. DeepNash de Google DeepMind ya alcanzó un nivel experto de juego en Stratego en 2022. Ataraxos superó ese hito al derrotar directamente a un campeón de élite, usando al mismo tiempo muchos menos ejemplos de entrenamiento y partidas de autojuego.

Qué cambió Ataraxos en Stratego

Ataraxos convirtió un referente de IA de nivel experto en una victoria documentada contra uno de los humanos más fuertes que han jugado jamás a este juego.

El equipo de investigación probó Ataraxos en una serie de 20 partidas contra Pim Niemeijer. Ha ganado cuatro campeonatos mundiales, 15 campeonatos nacionales de los Países Bajos y dos campeonatos mundiales en línea.

Niemeijer también pasó más de 600 semanas como el jugador mejor clasificado del mundo. George Franka, quien ha competido en todos los Campeonatos Mundiales de Stratego desde 1997, lo describió como el mejor jugador de Stratego de todos los tiempos.

Ataraxos ganó 15 partidas, perdió una y empató cuatro. Contar cada empate como media victoria otorga al sistema una tasa de victoria efectiva del 85 por ciento.

El formato importa porque Stratego recompensa el comportamiento aleatorio. Incluso un jugador más débil puede derrotar ocasionalmente a uno más fuerte, por lo que una sola partida es una prueba deficiente de superioridad general.

Veinte partidas también dieron a Niemeijer tiempo para buscar debilidades. Los investigadores le dijeron que Ataraxos usaría una estrategia fija y no se adaptaría entre partidas.

Esa información debería haber ayudado a un rival humano a explotar hábitos repetidos. En cambio, la IA mantuvo una amplia ventaja a lo largo de la serie.

Los investigadores informaron de que una prueba binomial unilateral exacta produciría una probabilidad inferior a 2,6 × 10^-4 bajo el supuesto de partidas independientes. También advirtieron que el supuesto no se cumple por completo porque las estrategias humanas cambian durante un enfrentamiento.

Ataraxos recibió otra prueba en el Campeonato Mundial de Stratego de 2025, celebrado del 1 al 3 de agosto. Los asistentes jugaron 40 partidas de demostración contra el sistema.

Según el artículo de Nature, Ataraxos registró 38 victorias y dos derrotas en esas partidas. Eso equivale a una tasa de victoria efectiva del 95 por ciento contra jugadores con experiencia y estilos variados.

Stratego plantea un desafío distintivo para la inteligencia artificial. Cada jugador coloca 40 piezas, mientras las identidades de las piezas del rival permanecen ocultas hasta que determinadas interacciones las revelan.

El objetivo es capturar la bandera rival. Los jugadores deben engañar, reunir información, proteger piezas valiosas e inferir qué sabe un oponente a partir tanto de sus acciones como de su inacción.

El juego contiene más de 10^33 configuraciones posibles de piezas, según el artículo. La explicación del MIT cuenta disposiciones etiquetadas y sitúa la cifra por encima de 10^66, lo que ilustra cómo el total cambia según la convención de conteo.

Cualquiera de las dos cifras describe un espacio de búsqueda demasiado grande para una enumeración directa. Un agente no puede calcular todas las disposiciones ocultas ni todas las posibles secuencias futuras antes de mover.

Esa escala distingue a Stratego del ajedrez y Go. En esos juegos, ambos bandos pueden ver el tablero completo, aunque el número de futuros movimientos posibles siga siendo enorme.

El póquer incluye información oculta, pero su estado privado es mucho menor. Stratego combina identidades ocultas con secuencias largas que pueden extenderse a lo largo de cientos de decisiones.

El resultado es un juego en el que la propia información se convierte en un recurso estratégico. A veces, un jugador acepta una pérdida material para revelar una pieza rival o proteger la incertidumbre sobre su propia posición.

La victoria de Ataraxos, por tanto, tiene más peso que una nueva clasificación en línea. Aporta evidencia directa frente a un humano reconocido en un enfrentamiento repetido y adversarial.

También plantea la pregunta central en torno al trabajo: ¿por qué un sistema académico comparativamente barato superó a un predecesor mucho mayor en la evaluación más difícil?

Por qué Ataraxos Stratego AI necesitó menos cómputo

El resultado de Ataraxos Stratego AI surgió de cambiar cómo el entrenamiento y la planificación en tiempo real se reparten el problema, no de escalar indefinidamente un único modelo.

El sistema comienza con aprendizaje por refuerzo mediante autojuego. En este proceso, un agente juega repetidamente contra versiones de sí mismo y mejora usando los resultados.

El autojuego permite a Ataraxos crear datos de entrenamiento sin partidas humanas registradas. Aprende gradualmente una política amplia que los investigadores denominan estrategia base.

Esa estrategia base proporciona una base estable para las disposiciones iniciales y las decisiones habituales. No intenta resolver cada incertidumbre que pueda surgir durante una partida.

El equipo diseñó un método de aprendizaje con amortiguación dinámica para estabilizar el autojuego. En juegos con múltiples agentes, el aprendizaje puede volverse inestable porque el comportamiento de cada participante cambia el entorno al que se enfrentan los demás.

Una mejora contra un oponente puede revelar una nueva debilidad en otra parte. El entrenamiento puede alternar entre estrategias en lugar de converger hacia un juego consistentemente sólido.

La amortiguación dinámica limita esas oscilaciones. Controla con qué agresividad el proceso de aprendizaje actualiza la política, permitiendo a Ataraxos progresar sin abandonar repetidamente estrategias útiles.

Los investigadores también mejoraron la forma en que el sistema estima la calidad de las acciones. Esto importa porque el resultado final de una partida de Stratego llega mucho después de muchas decisiones críticas.

Una pieza movida al principio de la partida puede moldear las creencias de un oponente decenas de turnos después. Atribuir mérito a ese movimiento es más difícil que evaluar una captura inmediata.

El proceso de entrenamiento resultante utilizó menos de una centésima parte de los ejemplos usados por DeepNash, según Gabriele Farina, autor principal del artículo. También requirió menos de una trigésima parte de las partidas de autojuego.

La comparación de hardware es igualmente llamativa. El equipo entrenó los modelos de aprendizaje por refuerzo de Ataraxos en 16 aceleradores Nvidia H100 durante una semana.

Entrenó los modelos de creencias, que estiman las identidades ocultas de las piezas, en cuatro H100 durante cuatro días. Los autores calculan que alquilar este hardware a los precios de 2025 costaría menos de 8.000 dólares.

Esa cifra cubre el cómputo de entrenamiento informado, no los salarios de los investigadores, el desarrollo de software, los experimentos ni la infraestructura institucional. No debe interpretarse como el coste total de producir la investigación.

El artículo calcula que DeepNash se entrenó en 1.024 nodos TPU v3 durante dos o tres meses. Usando precios comerciales de 2025, los autores de Ataraxos sitúan el gasto equivalente entre 3 millones y 4,5 millones de dólares.

Se trata de una estimación, no de una factura divulgada por DeepMind. Los contratos de hardware, la utilización y los costes internos históricos pueden diferir de las tarifas públicas de alquiler.

Incluso con esa salvedad, la brecha de recursos es sustancial. Ataraxos utilizó un clúster académico de computación modesto en lugar de una infraestructura disponible solo para los mayores laboratorios de IA.

La eficiencia también provino del entorno de simulación. El aprendizaje por refuerzo requiere que el agente experimente suficientes partidas para distinguir estrategias fiables de resultados afortunados.

Un simulador rápido y preciso puede procesar esas interacciones sin esperar a partidas físicas ni al etiquetado humano. Mejores algoritmos extraen entonces más aprendizaje de cada experiencia simulada.

El equipo ha publicado un código base de Stratego, lo que permite a otros investigadores inspeccionar y reproducir partes del trabajo. La reproducibilidad ayudará a aclarar qué avances provienen de los algoritmos, el simulador, el diseño del modelo o las decisiones de evaluación.

El resultado de costes no demuestra que pequeños equipos de investigación puedan entrenar barato todos los sistemas avanzados de IA. Stratego tiene reglas fijas, datos sintéticos baratos y un simulador capaz de devolver resultados de forma fiable.

Sí demuestra que el cómputo no es la única ruta hacia una toma de decisiones más potente. Una mejor división entre preparación general y razonamiento específico puede generar mayores avances que simplemente multiplicar las ejecuciones de entrenamiento.

Una estrategia base se encuentra con una búsqueda guiada por creencias

Ataraxos tiene éxito porque aprende por adelantado una estrategia amplia y después limita su razonamiento a los estados ocultos que importan en la partida actual.

Durante una partida, el sistema comienza con su política base. Después utiliza planificación en tiempo de decisión, lo que significa que dedica cómputo adicional a evaluar opciones inmediatamente antes de actuar.

La planificación en tiempo de decisión ha impulsado varios resultados célebres en juegos con tableros visibles. Un motor de ajedrez puede examinar movimientos candidatos porque conoce la posición exacta de cada pieza.

Stratego elimina esa certeza. El agente puede ver dónde se encuentran las piezas rivales, pero inicialmente no conoce sus identidades.

Un planificador ingenuo tendría que considerar una enorme colección de tableros posibles. La mayoría sería incompatible con los movimientos y la información revelada ya observados.

Ataraxos utiliza en cambio un modelo generativo de creencias. El modelo asigna probabilidades a configuraciones plausibles de piezas ocultas basándose en el historial de la partida.

Muestrea estados probables, evalúa acciones bajo esos estados y refina la recomendación de la estrategia base. Este proceso concentra el esfuerzo computacional en la posición y el oponente que el sistema tiene actualmente delante.

“En lugar de limitarnos a adivinar a ciegas, usamos planificación en tiempo de decisión para encontrar el estado más plausible del tablero”, dijo Farina a investigadores del MIT. El modelo generativo permite al sistema centrarse en el tablero concreto al que se enfrenta.

La idea importante no es que Ataraxos descubra la disposición exacta del oponente. Mantiene la incertidumbre mientras estima qué explicaciones merecen atención.

Esa distinción es crucial en juegos de información imperfecta. Actuar como si una interpretación incierta fuera segura puede producir errores catastróficos.

Una estrategia racional debe considerar tanto el valor esperado de una acción como el riesgo que se genera cuando su creencia es errónea. También debe tener en cuenta cómo su movimiento cambia las creencias del oponente.

El equipo de investigación describe a Ataraxos como inusualmente sereno ante el riesgo. Los jugadores humanos pueden sobrerreaccionar cuando una pieza valiosa parece expuesta, revelando información adicional mediante su respuesta defensiva.

Ataraxos no siente miedo ni vergüenza. Puede aceptar una posición de aspecto peligroso cuando el resultado ponderado por probabilidades sigue siendo favorable.

Niemeijer describió al sistema como alguien que asume riesgos que los humanos consideran arrogantes. También dijo que parecía “preternaturalmente afortunado” porque repetidamente parecía tener las piezas adecuadas en ubicaciones útiles.

La suerte aparente puede surgir de una incertidumbre bien calibrada. Un agente dispuesto a asumir un riesgo favorable con mayor frecuencia a veces parecerá temerario, pero sus resultados se acumulan a lo largo de muchas partidas.

Este comportamiento aporta la inversión central del artículo. El sistema barato no ganó examinando todas las posibilidades con un presupuesto de búsqueda mayor.

Ganó al descartar la mayoría de las posibilidades. El plano estratégico se encargaba del juego general, mientras que el modelo de creencias filtraba los estados ocultos antes de que comenzara la planificación en tiempo real.

Esta arquitectura también se trasladó más allá del Stratego estándar. Los investigadores aplicaron técnicas relacionadas a Barrage Stratego, Hanabi y dou dizhu.

Barrage Stratego es una variante más pequeña y rápida del juego original. El sistema derrotó a tres campeones mundiales en múltiples ocasiones, un resultado que los autores describen como el primero de nivel sobrehumano para esa variante.

Hanabi es un juego cooperativo de cartas en el que los jugadores pueden ver las manos de los demás, pero no la propia. El éxito exige que los agentes interpreten pistas limitadas y se coordinen sin comunicar directamente información privada.

El enfoque Ataraxos estableció un nuevo estado del arte en las evaluaciones de Hanabi descritas en el artículo. Ese resultado evalúa el razonamiento cooperativo, en lugar de la competencia directa.

Dou dizhu es un juego de cartas para tres jugadores en el que dos cooperan contra un tercero. Los agentes de los investigadores superaron a los programas PerfectDou y DouZero utilizados como referencias.

Estos resultados no demuestran que un único modelo universal haya dominado cuatro juegos no relacionados. Los investigadores adaptaron las técnicas subyacentes y entrenaron sistemas específicos para cada juego.

Aun así, el alcance es importante. Sugiere que combinar autojuego eficiente con razonamiento específico sobre estados ocultos es un patrón de diseño reutilizable, y no un truco exclusivo de Stratego.

La comparación con DeepNash cambia el punto de referencia

DeepNash demostró que una IA podía alcanzar un nivel experto en Stratego, mientras que Ataraxos elevó el estándar a victorias repetidas frente al humano más laureado del juego.

Google DeepMind presentó DeepNash en 2022 como un agente entrenado mediante aprendizaje por refuerzo multiagente sin modelo. «Sin modelo» significa que no reconstruía explícitamente las piezas ocultas del oponente durante la partida.

DeepNash utilizó Regularised Nash Dynamics, un algoritmo diseñado para orientar el aprendizaje hacia estrategias que los oponentes no puedan explotar fácilmente. Aprendió mediante autojuego sin utilizar una base de datos de partidas humanas.

En Gravon, una importante plataforma online de Stratego, DeepNash ganó 42 de 50 partidas evaluadas y alcanzó una clasificación histórica entre los tres primeros. DeepMind también informó de tasas de victoria superiores al 97 por ciento contra los principales bots de Stratego.

La investigación de DeepNash fue un logro importante. Stratego se había resistido a los métodos de búsqueda en árboles que ayudaron a las máquinas a superar a los humanos en ajedrez y Go.

DeepNash evitó deliberadamente la búsqueda explícita en el árbol de juego porque la información oculta dificultaba escalar ese enfoque. Su éxito respaldó la idea de aprender directamente una política estratégicamente equilibrada.

Ataraxos sigue una vía distinta. Conserva una sólida base de autojuego, pero reintroduce la planificación mediante un modelo de creencias que limita qué estados ocultos deben evaluarse.

Esta distinción crea el principal contraste técnico: una política en gran medida fija y difícil de explotar frente a un plano estratégico refinado mediante búsqueda situacional.

Los autores de Ataraxos también cuestionan cómo se interpretó el rendimiento humano de DeepNash. Señalan que la población de jugadores de Gravon había disminuido para 2022, con solo 25 jugadores presentes en la clasificación final de ese año.

Los oponentes online no sabían que participaban en una evaluación oficial de IA. Tampoco sabían que DeepNash utilizaba una estrategia fija que podía analizarse a lo largo de partidas repetidas.

En el Campeonato Mundial de Stratego de 2023, DeepNash ganó 19 partidas y perdió nueve durante una demostración. El artículo de Ataraxos afirma que perdió frente a la mayoría de los jugadores mejor clasificados a los que se enfrentó, incluido Niemeijer.

Los investigadores buscaron un enfrentamiento directo entre los dos sistemas. Informan de que DeepMind indicó que el código de DeepNash ya no era funcional, por lo que esa comparación no llegó a realizarse.

Sin un enfrentamiento cara a cara, las afirmaciones sobre la fuerza relativa de juego dependen de distintos oponentes humanos, contextos de torneo y períodos de tiempo. Ataraxos cuenta con el resultado más sólido frente a humanos de élite, pero los sistemas no se probaron en condiciones idénticas.

La descripción original de DeepMind presentó a DeepNash como un sistema que alcanzaba un nivel experto humano, no como uno que derrotaba al mejor campeón en un duelo prolongado. Su visión general de Stratego destacó una clasificación histórica entre los tres primeros de Gravon y una tasa de victoria del 84 por ciento contra usuarios expertos de la plataforma.

Por tanto, Ataraxos no borra la contribución de DeepNash. Cambia el objetivo establecido por aquel trabajo anterior.

Alcanzar el nivel experto ya no es el punto final. Ahora los investigadores pueden preguntarse si un sistema derrota a los mejores jugadores, resiste la explotación deliberada y logra esos resultados de forma eficiente.

La comparación de costes refuerza ese cambio. DeepNash apostó por la escala y por una política teóricamente difícil de explotar.

Ataraxos sostiene que la eficiencia de muestras y la planificación selectiva pueden ofrecer ganancias más prácticas. Ese argumento importará más allá de los juegos si otros equipos lo reproducen bajo evaluaciones igual de exigentes.

La presión recae sobre los investigadores que construyen agentes para negociación, ciberseguridad, asignación de recursos y coordinación multipartita. Estos campos también combinan información incompleta con largas secuencias de decisión.

Sin embargo, carecen de las reglas claras y los simuladores perfectos disponibles en Stratego. El próximo punto de referencia debe comprobar si el mecanismo resiste cuando las observaciones son ruidosas y los demás participantes se comportan fuera de la distribución de entrenamiento.

Lo que el resultado todavía no demuestra

Ganar en Stratego no demuestra que Ataraxos pueda asesorar de forma segura a personas en decisiones militares, empresariales o de seguridad.

La cobertura de MIT identifica las maniobras militares, las negociaciones empresariales, los mercados financieros y la ciberseguridad como posibles aplicaciones a largo plazo. Todas implican partes que actúan con información privada.

La similitud estructural es real. Un defensor rara vez conoce el plan completo de un atacante, mientras que un negociador rara vez conoce los términos mínimos aceptables de la otra parte.

Sin embargo, estos entornos difieren notablemente de un juego de mesa. Stratego tiene acciones fijas, reglas estables, un objetivo acordado y un resultado que un simulador puede puntuar.

Las negociaciones reales contienen lenguaje ambiguo, objetivos cambiantes, registros incompletos y participantes que pueden abandonar la interacción. Los incidentes de ciberseguridad implican fallos de software y adversarios que inventan acciones ausentes del entrenamiento.

Un modelo de creencias se vuelve peligroso cuando su lista de posibilidades está incompleta. Puede asignar probabilidades precisas entre varias explicaciones sin contemplar la explicación correcta.

Este problema suele denominarse especificación errónea del modelo. El sistema puede razonar de forma coherente dentro de su mundo simulado y aun así recomendar la acción equivocada en la realidad.

Stratego también proporciona retroalimentación rápida mediante autojuego. Un agente puede generar millones de situaciones legales sin perjudicar a nadie ni exponer información privada.

Los datos del mundo real pueden ser escasos, sesgados o éticamente difíciles de recopilar. Un modelo no puede reproducir de forma segura crisis militares solo para explorar políticas alternativas.

La interpretabilidad presenta otra limitación. Ataraxos puede seleccionar un movimiento, pero todavía no ofrece una explicación completa que un responsable humano de la toma de decisiones pueda auditar de forma fiable.

Farina identificó explícitamente esa carencia. Afirmó que los humanos deben conservar la autoridad final sobre las recomendaciones y que la adopción requiere una forma de inspeccionar las decisiones del modelo.

Una explicación debe hacer más que describir el movimiento después de los hechos. Debe revelar las suposiciones, las probabilidades de los estados ocultos, las acciones alternativas y las condiciones que invertirían la recomendación.

Esto importa porque el comportamiento más sólido del sistema puede parecer temerario a los expertos. Si Ataraxos recomienda exponer un activo valioso, una persona necesita saber si esa elección se basa en una inferencia estable o en una estimación de probabilidad frágil.

La evaluación humana también sigue siendo relativamente pequeña. La serie contra Niemeijer incluyó 20 partidas, mientras que la demostración del campeonato mundial añadió 40 partidas contra un grupo más amplio.

Estos resultados respaldan firmemente un alto rendimiento en Stratego. No miden el comportamiento en todas las aperturas, explotaciones adversariales, condiciones de software o cambios de distribución.

El sistema utilizó una estrategia fija durante el encuentro contra Niemeijer. Esa elección hizo posible la explotación, pero también deja abierta la cuestión de cómo la adaptación cambiaría la seguridad y el rendimiento.

Un agente adaptativo puede corregir debilidades. También puede volverse menos predecible, lo que dificulta la evaluación y la supervisión humana.

Las afirmaciones sobre generalidad requieren una cautela similar. El equipo logró resultados sólidos en cuatro juegos de información oculta, pero cada sistema operó dentro de un entorno de juego bien definido.

La transferencia se produjo a nivel algorítmico, no mediante un agente que entrara de forma independiente en entornos desconocidos. Ataraxos no aprendió Stratego y luego comenzó a jugar Hanabi sin nueva implementación y entrenamiento.

Su coste computacional también requiere una contextualización cuidadosa. Menos de $8,000 representa una ejecución de entrenamiento reportada, calculada con precios de alquiler de hardware de 2025.

Excluye experimentos fallidos, tiempo de los investigadores, desarrollo del simulador y el respaldo institucional necesario para descubrir el método final. Reproducir una ejecución finalizada no equivale a recrear el proyecto completo.

Ninguna de estas limitaciones debilita el resultado en Stratego. Definen lo que realmente se estableció y lo separan de las aplicaciones futuras propuestas.

Ataraxos aporta evidencia de que la planificación con información oculta puede ser a la vez sólida y eficiente en términos computacionales. Trasladar ese resultado a decisiones relevantes requerirá nuevas formas de prueba, explicación y control humano.

Tres señales que pondrán a prueba la tesis de Ataraxos

La próxima prueba será si investigadores independientes pueden reproducir la eficiencia, extender el método más allá de los juegos y hacer auditables sus decisiones.

La primera señal es la reproducción independiente del resultado de entrenamiento en Stratego. Los investigadores deberían poder utilizar el código publicado, hardware comparable y configuraciones documentadas para aproximarse a la fuerza de juego reportada.

Una reproducción exitosa dentro del presupuesto computacional declarado reforzaría la afirmación de eficiencia. Una brecha amplia sugeriría que la infraestructura no documentada, el ajuste fino o el conocimiento experimental contribuyeron más de lo que muestra la estimación final de costes.

La reproducción debería incluir evaluación humana y de máquinas. Jugar únicamente contra los mismos bots de referencia podría pasar por alto debilidades que los jugadores de élite identifican mediante enfrentamientos adversariales repetidos.

La segunda señal es una evaluación creíble en un entorno menos controlado. Simulaciones de ciberdefensa, puntos de referencia de negociación o sistemas de tráfico podrían ofrecer pruebas intermedias sin poner inmediatamente a personas en riesgo.

La pregunta clave no es si un agente gana otro juego. Es si la planificación guiada por creencias sigue siendo fiable cuando las reglas están incompletas, las observaciones contienen errores y los participantes se apartan del comportamiento esperado.

Los investigadores deberían publicar los casos de fallo con tanto cuidado como las tasas de éxito. Un sistema que funcione bien de media, pero se vuelva excesivamente confiado en condiciones desconocidas, necesitaría salvaguardas más sólidas antes de su uso práctico.

La tercera señal es una capa de interpretabilidad vinculada directamente al modelo de creencias de Ataraxos. El equipo ya ha identificado esto como trabajo futuro.

Una interfaz útil mostraría qué configuraciones ocultas considera probables el sistema, cómo cambian esas creencias después de cada acción y qué suposiciones impulsan la recomendación final.

También debería revelar la sensibilidad. Si un pequeño cambio en una probabilidad produce una acción diferente, un revisor humano debe poder ver esa inestabilidad.

Estas tres señales determinarán si Ataraxos sigue siendo un sistema excepcional para jugar o se convierte en una plantilla más amplia para la toma de decisiones bajo incertidumbre.

El resultado inmediato ya importa. Un equipo de investigación de cuatro universidades superó el rendimiento de humanos de élite en Stratego con un presupuesto de entrenamiento muy inferior a las estimaciones anteriores para DeepNash.

Su lección más profunda tiene que ver con la asignación de recursos. El sistema dedica amplios recursos de entrenamiento a un modelo reutilizable y luego concentra la computación en tiempo real en las incertidumbres relevantes para una decisión concreta.

Los desarrolladores deberían observar si este patrón aparece en otros sistemas de agentes. Los compradores empresariales deberían preguntarse si los impresionantes resultados de referencia incluyen pruebas adversariales, contabilidad de costes y supuestos verificables.

Los trabajadores del conocimiento que evalúen investigaciones similares pueden conservar artículos, experimentos y afirmaciones cambiantes en una base de conocimiento con capacidad de búsqueda. La acción importante es comparar cada nueva demostración con la evidencia original.

Ataraxos Stratego AI ha resuelto una cuestión: las máquinas pueden derrotar de forma contundente a los humanos más fuertes en este juego de información oculta sin requerir un entrenamiento de varios millones de dólares. La siguiente pregunta es más difícil: ¿puede mantenerse la misma eficiencia cuando las reglas ya no están escritas en un tablero?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page