top of page

A IA Ataraxos Stratego Venceu o Melhor Humano, e Seu Treinamento Custou Menos de US$ 8.000

há 3 dias
15 min de leitura

A IA Ataraxos Stratego derrotou o jogador humano mais condecorado do jogo por 15-1-4, após pesquisadores a treinarem com menos de US$ 8.000 em custos de computação. O resultado desafia a suposição de que vencer humanos de elite em jogos estratégicos complexos exige um orçamento industrial de pesquisa.

Pesquisadores do MIT, da Carnegie Mellon University, da New York University e da Stanford University desenvolveram o Ataraxos. Seu artigo revisado por pares foi publicado na Nature em 30 de setembro de 2026. O sistema combina treinamento eficiente por autojogo com planejamento direcionado durante cada partida.

A comparação importante não é mais uma vitória sobre humanos. O DeepNash, do Google DeepMind, já havia alcançado nível de especialista em Stratego em 2022. O Ataraxos foi além desse marco ao derrotar diretamente um campeão de elite, usando muito menos exemplos de treinamento e partidas de autojogo.

O Que o Ataraxos Mudou no Stratego

O Ataraxos transformou um benchmark de IA em nível de especialista em uma vitória documentada sobre um dos humanos mais fortes que já jogaram o jogo.

A equipe de pesquisa testou o Ataraxos em uma série de 20 partidas contra Pim Niemeijer. Ele venceu quatro campeonatos mundiais, 15 campeonatos nacionais holandeses e dois campeonatos mundiais online.

Niemeijer também passou mais de 600 semanas como o jogador número um do mundo. George Franka, que compete em todos os Campeonatos Mundiais de Stratego desde 1997, descreveu-o como o melhor jogador de Stratego de todos os tempos.

O Ataraxos venceu 15 partidas, perdeu uma e empatou quatro. Considerando cada empate como meia vitória, o sistema alcança uma taxa efetiva de vitórias de 85%.

O formato importa porque o Stratego recompensa comportamentos aleatórios. Mesmo um jogador mais fraco pode às vezes derrotar um oponente mais forte, o que torna uma única partida uma evidência fraca de superioridade geral.

Vinte partidas também deram a Niemeijer tempo para procurar fraquezas. Os pesquisadores disseram a ele que o Ataraxos usaria uma estratégia fixa e não se adaptaria entre as partidas.

Essa informação deveria ter ajudado um oponente humano a explorar hábitos repetidos. Em vez disso, a IA manteve uma grande vantagem ao longo da série.

Os pesquisadores relataram que um teste binomial unilateral exato produziria uma probabilidade inferior a 2,6 × 10^-4 sob a premissa de partidas independentes. Eles também alertaram que a premissa não se sustenta plenamente, pois as estratégias humanas mudam ao longo de uma partida.

O Ataraxos recebeu outro teste no Campeonato Mundial de Stratego de 2025, realizado de 1º a 3 de agosto. Participantes jogaram 40 partidas de demonstração contra o sistema.

Segundo o artigo da Nature, o Ataraxos registrou 38 vitórias e duas derrotas nessas partidas. Isso equivale a uma taxa efetiva de vitórias de 95% contra jogadores com experiências e estilos variados.

O Stratego apresenta um desafio singular para a inteligência artificial. Cada jogador organiza 40 peças, enquanto as identidades das peças do adversário permanecem ocultas até que interações específicas as revelem.

O objetivo é capturar a bandeira adversária. Os jogadores precisam blefar, reunir informações, proteger peças valiosas e inferir o que um oponente sabe tanto pelas ações quanto pela inação.

O jogo contém mais de 10^33 configurações possíveis de peças, segundo o artigo. A explicação do MIT contabiliza arranjos rotulados e coloca o número acima de 10^66, ilustrando como o total muda conforme a convenção de contagem.

Ambos os números descrevem um espaço de busca grande demais para enumeração direta. Um agente não consegue calcular todos os arranjos ocultos e todas as sequências futuras possíveis antes de agir.

Essa escala diferencia o Stratego do xadrez e do Go. Nesses jogos, ambos os lados podem ver todo o tabuleiro, mesmo quando o número de movimentos futuros possíveis permanece enorme.

O pôquer inclui informação oculta, mas seu estado privado é muito menor. O Stratego combina identidades ocultas com sequências longas que podem se estender por centenas de decisões.

O resultado é um jogo em que a própria informação se torna um recurso estratégico. Às vezes, um jogador aceita uma perda material para revelar uma peça adversária ou preservar a incerteza sobre sua própria posição.

A vitória do Ataraxos, portanto, tem mais peso do que uma nova classificação online. Ela fornece evidência direta contra um humano renomado em uma disputa repetida e adversarial.

Também levanta a questão central em torno do trabalho: por que um sistema acadêmico comparativamente barato superou um antecessor muito maior na avaliação mais difícil?

Por Que a IA Ataraxos Stratego Precisou de Menos Computação

O resultado da IA Ataraxos Stratego veio da mudança na forma como treinamento e planejamento em tempo real dividem o problema, e não da expansão indefinida de um único modelo.

O sistema começa com aprendizado por reforço por autojogo. Nesse processo, um agente joga repetidamente contra versões de si mesmo e melhora com base nos resultados.

O autojogo permite que o Ataraxos crie dados de treinamento sem partidas humanas registradas. Ele aprende gradualmente uma política ampla, que os pesquisadores chamam de estratégia-base.

Essa estratégia-base fornece uma fundação estável para formações iniciais e decisões comuns. Ela não tenta resolver toda incerteza que possa surgir durante uma partida.

A equipe desenvolveu um método de aprendizado com amortecimento dinâmico para estabilizar o autojogo. Em jogos com múltiplos agentes, o aprendizado pode se tornar instável porque o comportamento de cada participante altera o ambiente enfrentado pelos demais.

Uma melhora contra um oponente pode expor uma nova fraqueza em outro ponto. O treinamento pode alternar entre estratégias, em vez de convergir para um jogo consistentemente forte.

O amortecimento dinâmico limita essas oscilações. Ele controla quão agressivamente o processo de aprendizado atualiza a política, permitindo que o Ataraxos progrida sem abandonar repetidamente estratégias úteis.

Os pesquisadores também melhoraram a forma como o sistema estima a qualidade das ações. Isso importa porque o resultado final de uma partida de Stratego chega muito depois de muitas decisões críticas.

Uma peça movida no início do jogo pode moldar as crenças de um oponente dezenas de turnos depois. Atribuir crédito a esse movimento é mais difícil do que avaliar uma captura imediata.

O processo de treinamento resultante usou menos de um centésimo dos exemplos utilizados pelo DeepNash, segundo Gabriele Farina, autor principal do artigo. Ele também exigiu menos de um trigésimo do número de partidas de autojogo.

A comparação de hardware é igualmente marcante. A equipe treinou os modelos de aprendizado por reforço do Ataraxos em 16 aceleradores Nvidia H100 durante uma semana.

Ela treinou os modelos de crença, que estimam as identidades ocultas das peças, em quatro H100s durante quatro dias. Os autores estimam que alugar esse hardware aos preços de 2025 custaria menos de US$ 8.000.

Esse valor cobre a computação de treinamento relatada, não salários de pesquisadores, desenvolvimento de software, experimentos ou infraestrutura institucional. Ele não deve ser interpretado como o custo total para produzir a pesquisa.

O artigo estima que o DeepNash foi treinado em 1.024 nós TPU v3 por dois a três meses. Usando preços comerciais de 2025, os autores do Ataraxos calculam a despesa equivalente entre US$ 3 milhões e US$ 4,5 milhões.

Trata-se de uma estimativa, e não da fatura divulgada pela DeepMind. Contratos de hardware, utilização e custos internos históricos podem diferir das tarifas públicas de aluguel.

Mesmo com essa ressalva, a diferença de recursos é substancial. O Ataraxos usou um modesto cluster acadêmico de computação, em vez de uma implantação de infraestrutura disponível apenas para os maiores laboratórios de IA.

A eficiência também veio do ambiente de simulação. O aprendizado por reforço exige que o agente vivencie partidas suficientes para distinguir estratégias confiáveis de resultados afortunados.

Um simulador rápido e preciso pode processar essas interações sem esperar por partidas físicas ou rotulagem humana. Algoritmos melhores extraem então mais aprendizado de cada experiência simulada.

A equipe lançou uma base de código pública do Stratego, permitindo que outros pesquisadores inspecionem e reproduzam partes do trabalho. A reprodutibilidade ajudará a esclarecer quais ganhos vêm dos algoritmos, do simulador, do design do modelo ou das escolhas de avaliação.

O resultado de custo não demonstra que pequenas equipes de pesquisa possam treinar de forma barata todo sistema avançado de IA. O Stratego tem regras fixas, dados sintéticos baratos e um simulador que pode retornar resultados de maneira confiável.

Ele demonstra que computação não é a única rota para uma tomada de decisão mais forte. Uma melhor divisão entre preparação geral e raciocínio direcionado pode gerar ganhos maiores do que simplesmente multiplicar execuções de treinamento.

Uma Estratégia-Base Encontra a Busca Guiada por Crenças

O Ataraxos tem sucesso porque aprende antecipadamente uma estratégia ampla e, depois, restringe seu raciocínio aos estados ocultos que importam na partida atual.

Durante uma partida, o sistema começa com sua política-base. Em seguida, utiliza planejamento no momento da decisão, o que significa dedicar computação adicional à avaliação de escolhas imediatamente antes de agir.

O planejamento no momento da decisão impulsionou vários resultados famosos em jogos com tabuleiros visíveis. Um motor de xadrez pode examinar movimentos candidatos porque conhece a posição exata de cada peça.

O Stratego remove essa certeza. O agente pode ver onde estão as peças adversárias, mas inicialmente não conhece suas identidades.

Um planejador ingênuo precisaria considerar uma coleção enorme de tabuleiros possíveis. A maioria seria inconsistente com os movimentos e as informações reveladas já observados.

Em vez disso, o Ataraxos usa um modelo generativo de crenças. O modelo atribui probabilidades a configurações plausíveis de peças ocultas com base no histórico do jogo.

Ele amostra estados prováveis, avalia ações nesses estados e refina a recomendação da estratégia-base. Esse processo concentra o esforço computacional na posição e no oponente que estão diante do sistema naquele momento.

“Em vez de simplesmente adivinhar às cegas, usamos planejamento no momento da decisão para encontrar o estado mais plausível do tabuleiro”, disse Farina aos pesquisadores do MIT. O modelo generativo permite que o sistema se concentre no tabuleiro específico que enfrenta.

A ideia importante não é que o Ataraxos descubra o arranjo exato do oponente. Ele mantém a incerteza enquanto estima quais explicações merecem atenção.

Essa distinção é crucial em jogos de informação imperfeita. Agir como se uma interpretação incerta fosse certa pode produzir erros catastróficos.

Uma estratégia racional deve considerar tanto o valor esperado de uma ação quanto o risco criado quando sua crença está errada. Ela também deve levar em conta como seu movimento altera as crenças do oponente.

A equipe de pesquisa descreve o Ataraxos como incomumente sereno diante do risco. Jogadores humanos podem reagir de forma exagerada quando uma peça valiosa parece exposta, revelando informações adicionais por meio de sua resposta defensiva.

O Ataraxos não sente medo nem constrangimento. Ele pode aceitar uma posição de aparência perigosa quando o resultado ponderado pela probabilidade continua favorável.

Niemeijer descreveu o sistema como alguém que assume riscos que os humanos consideram arrogantes. Ele também disse que ele parecia “preternaturalmente sortudo”, porque repetidamente parecia ter as peças certas em posições úteis.

A sorte aparente pode surgir de uma incerteza bem calibrada. Um agente disposto a assumir um risco favorável com mais frequência às vezes parecerá imprudente, mas seus resultados se acumulam ao longo de muitas partidas.

Esse comportamento sustenta a inversão central do artigo. O sistema barato não venceu ao examinar todas as possibilidades com um orçamento de busca maior.

Venceu ao evitar a maioria das possibilidades. O blueprint tratava a jogabilidade geral, enquanto o modelo de crenças filtrava estados ocultos antes do início do planejamento em tempo real.

Essa arquitetura também foi transferida para além do Stratego tradicional. Os pesquisadores aplicaram técnicas relacionadas ao Barrage Stratego, Hanabi e dou dizhu.

Barrage Stratego é uma variante menor e mais rápida do jogo original. O sistema derrotou três campeões mundiais em várias ocasiões, resultado que os autores descrevem como o primeiro desempenho sobre-humano para essa variante.

Hanabi é um jogo cooperativo de cartas no qual os jogadores podem ver as mãos dos outros, mas não a própria. O sucesso exige que os agentes interpretem pistas limitadas e coordenem ações sem declarar diretamente informações privadas.

A abordagem Ataraxos estabeleceu um novo estado da arte nas avaliações de Hanabi relatadas no artigo. Esse resultado testa o raciocínio cooperativo, e não a competição direta.

Dou dizhu é um jogo de cartas para três jogadores no qual dois cooperam contra o terceiro. Os agentes dos pesquisadores superaram os programas PerfectDou e DouZero usados como referências.

Esses resultados não demonstram que um modelo universal dominou quatro jogos não relacionados. Os pesquisadores adaptaram as técnicas subjacentes e treinaram sistemas específicos para cada jogo.

Ainda assim, a amplitude é importante. Ela sugere que combinar self-play eficiente com raciocínio direcionado sobre estados ocultos é um padrão de projeto reutilizável, e não um truque exclusivo do Stratego.

A Comparação com DeepNash Muda a Referência

DeepNash mostrou que uma IA podia alcançar nível de especialista no Stratego, enquanto Ataraxos elevou o padrão a vitórias repetidas contra o humano mais condecorado do jogo.

O Google DeepMind apresentou o DeepNash em 2022 como um agente treinado por aprendizagem por reforço multiagente sem modelo. Sem modelo significa que ele não reconstruía explicitamente as peças ocultas do adversário durante a partida.

DeepNash usou Regularised Nash Dynamics, um algoritmo desenvolvido para orientar o aprendizado em direção a estratégias que os oponentes não conseguem explorar facilmente. Ele aprendeu com self-play sem consumir um banco de dados de partidas humanas.

No Gravon, uma importante plataforma online de Stratego, DeepNash venceu 42 das 50 partidas avaliadas e alcançou uma posição entre as três melhores de todos os tempos. A DeepMind também relatou taxas de vitória acima de 97% contra os principais bots de Stratego.

A pesquisa sobre DeepNash foi uma grande conquista. O Stratego havia resistido aos métodos de busca em árvore que ajudaram máquinas a superar humanos no xadrez e no Go.

DeepNash evitou deliberadamente a busca explícita na árvore do jogo porque a informação oculta tornava essa abordagem difícil de escalar. Seu sucesso reforçou a ideia de aprender diretamente uma política estrategicamente equilibrada.

Ataraxos segue um caminho diferente. Mantém uma base sólida de self-play, mas reintroduz o planejamento por meio de um modelo de crenças que limita quais estados ocultos precisam ser avaliados.

Essa distinção cria a principal disputa técnica: uma política amplamente fixa e difícil de explorar versus um blueprint refinado por busca situacional.

Os autores de Ataraxos também questionam como o desempenho humano do DeepNash foi interpretado. Eles observam que a população de jogadores do Gravon havia diminuído em 2022, com apenas 25 jogadores aparecendo nas classificações finais daquele ano.

Os oponentes online não sabiam que participavam de uma avaliação oficial de IA. Também não sabiam que DeepNash usava uma estratégia fixa que poderia ser examinada ao longo de partidas repetidas.

No Campeonato Mundial de Stratego de 2023, DeepNash venceu 19 partidas e perdeu nove durante uma demonstração. O artigo sobre Ataraxos afirma que ele perdeu para a maioria dos jogadores mais bem classificados que enfrentou, incluindo Niemeijer.

Os pesquisadores buscaram uma partida direta entre os dois sistemas. Eles relatam que a DeepMind disse que o código do DeepNash já não estava funcional, portanto essa comparação não ocorreu.

Sem um confronto direto, as alegações sobre a força relativa de jogo dependem de diferentes oponentes humanos, contextos de torneio e períodos. Ataraxos tem o resultado mais forte contra humanos de elite, mas os sistemas não foram testados em condições idênticas.

O relato original da DeepMind descreveu DeepNash como tendo alcançado nível de especialista humano, não como tendo derrotado o melhor campeão em uma longa série de partidas. Sua visão geral do Stratego enfatizou uma classificação histórica entre as três melhores no Gravon e uma taxa de vitória de 84% contra usuários especialistas da plataforma.

Ataraxos, portanto, não apaga a contribuição do DeepNash. Ele muda a meta estabelecida por esse trabalho anterior.

Alcançar o nível de especialista já não é o ponto final. Pesquisadores agora podem perguntar se um sistema derrota os melhores jogadores, resiste à exploração deliberada e alcança esses resultados de forma eficiente.

A comparação de custos reforça essa mudança. DeepNash apostou em escala e em uma política teoricamente difícil de explorar.

Ataraxos argumenta que eficiência de amostras e planejamento seletivo podem gerar ganhos mais práticos. Esse argumento terá importância além dos jogos se outras equipes o reproduzirem sob avaliações igualmente exigentes.

A pressão recai sobre pesquisadores que constroem agentes para negociação, cibersegurança, alocação de recursos e coordenação entre múltiplas partes. Esses campos também combinam informação incompleta com longas sequências de decisão.

No entanto, eles não dispõem das regras claras e dos simuladores perfeitos disponíveis no Stratego. A próxima referência deve testar se o mecanismo resiste quando as observações são ruidosas e outros participantes se comportam fora da distribuição de treinamento.

O Que o Resultado Ainda Não Comprova

Vencer no Stratego não demonstra que Ataraxos possa aconselhar pessoas com segurança em decisões militares, empresariais ou de segurança.

A cobertura do MIT identifica manobras militares, negociações empresariais, mercados financeiros e cibersegurança como possíveis aplicações de longo prazo. Cada uma envolve partes agindo com informações privadas.

A semelhança estrutural é real. Um defensor raramente conhece o plano completo de um atacante, enquanto um negociador raramente conhece os termos mínimos aceitáveis do outro lado.

Ainda assim, esses ambientes diferem profundamente de um jogo de tabuleiro. Stratego tem ações fixas, regras estáveis, um objetivo acordado e um resultado que um simulador pode avaliar.

Negociações reais contêm linguagem ambígua, objetivos em mudança, registros incompletos e participantes que podem abandonar a interação. Incidentes de cibersegurança envolvem falhas de software e adversários que inventam ações ausentes do treinamento.

Um modelo de crenças se torna perigoso quando sua lista de possibilidades está incompleta. Ele pode atribuir probabilidades precisas a várias explicações e, ainda assim, deixar de considerar a explicação correta.

Esse problema é frequentemente chamado de especificação incorreta do modelo. O sistema pode raciocinar de modo consistente dentro de seu mundo simulado e ainda recomendar a ação errada na realidade.

Stratego também fornece feedback rápido por meio de self-play. Um agente pode gerar milhões de situações legais sem prejudicar ninguém ou expor informações privadas.

Dados do mundo real podem ser escassos, enviesados ou eticamente difíceis de coletar. Um modelo não pode reproduzir crises militares com segurança apenas para explorar políticas alternativas.

A interpretabilidade apresenta outra limitação. Ataraxos pode escolher um movimento, mas ainda não oferece uma explicação completa que um tomador de decisão humano possa auditar com confiança.

Farina identificou explicitamente essa lacuna. Ele disse que os humanos devem manter a autoridade final sobre recomendações e que a adoção exige uma forma de inspecionar as decisões do modelo.

Uma explicação deve fazer mais do que descrever o movimento após o fato. Ela deve expor as premissas, as probabilidades de estados ocultos, as ações alternativas e as condições que inverteriam a recomendação.

Isso importa porque o comportamento mais forte do sistema pode parecer imprudente para especialistas. Se Ataraxos recomendar expor um ativo valioso, um humano precisa saber se essa escolha se baseia em uma inferência estável ou em uma estimativa de probabilidade frágil.

A avaliação humana também continua relativamente pequena. A série contra Niemeijer incluiu 20 partidas, enquanto a demonstração do campeonato mundial acrescentou 40 partidas contra um grupo mais amplo.

Esses resultados sustentam fortemente um alto desempenho no Stratego. Eles não medem o comportamento em todas as aberturas, explorações adversariais, condições de software ou mudanças de distribuição.

O sistema usou uma estratégia fixa durante a partida contra Niemeijer. Essa escolha tornou a exploração possível, mas também deixa em aberto como a adaptação alteraria a segurança e o desempenho.

Um agente adaptativo pode corrigir fraquezas. Ele também pode se tornar menos previsível, tornando a avaliação e a supervisão humana mais difíceis.

Alegações de generalidade exigem cautela semelhante. A equipe alcançou resultados fortes em quatro jogos de informação oculta, mas cada sistema operava dentro de um ambiente de jogo bem definido.

A transferência ocorreu no nível algorítmico, não por meio de um agente que entrou independentemente em ambientes desconhecidos. Ataraxos não aprendeu Stratego e depois começou a jogar Hanabi sem nova implementação e treinamento.

Seu custo computacional também exige contextualização cuidadosa. Menos de US$ 8.000 representa uma execução de treinamento relatada, precificada com base em aluguel de hardware de 2025.

Esse valor exclui experimentos fracassados, tempo de pesquisadores, desenvolvimento de simuladores e o suporte institucional necessário para descobrir o método final. Reproduzir uma execução concluída não equivale a recriar o projeto inteiro.

Nenhuma dessas limitações enfraquece o resultado no Stratego. Elas definem o que de fato foi estabelecido e o separam das aplicações futuras propostas.

Ataraxos fornece evidências de que o planejamento com informação oculta pode ser simultaneamente forte e eficiente em termos computacionais. Traduzir esse resultado em decisões consequentes exigirá novas formas de teste, explicação e controle humano.

Três Sinais Que Testarão a Tese de Ataraxos

O próximo teste é verificar se pesquisadores independentes podem reproduzir a eficiência, estender o método além dos jogos e tornar suas decisões auditáveis.

O primeiro sinal é a reprodução independente do resultado de treinamento em Stratego. Pesquisadores devem conseguir usar o código disponibilizado, hardware comparável e configurações documentadas para se aproximar da força de jogo relatada.

Uma reprodução bem-sucedida dentro do orçamento computacional declarado reforçaria a alegação de eficiência. Uma grande diferença sugeriria que infraestrutura não documentada, ajustes ou conhecimento experimental contribuíram mais do que a estimativa final de custo indica.

A reprodução deve incluir avaliação humana e de máquinas. Jogar apenas contra os mesmos bots de referência poderia deixar passar fraquezas que jogadores de elite identificam em confrontos adversariais repetidos.

O segundo sinal é uma avaliação crível em um ambiente menos controlado. Simulações de defesa cibernética, referências de negociação ou sistemas de tráfego poderiam oferecer testes intermediários sem colocar pessoas em risco imediatamente.

A questão central não é se um agente vence outro jogo. É se o planejamento orientado por crenças permanece confiável quando as regras estão incompletas, as observações contêm erros e os participantes se desviam do comportamento esperado.

Pesquisadores devem publicar casos de falha com o mesmo cuidado dedicado às taxas de sucesso. Um sistema que tem bom desempenho em média, mas se torna excessivamente confiante em condições desconhecidas, precisaria de salvaguardas mais fortes antes de uso prático.

O terceiro sinal é uma camada de interpretabilidade ligada diretamente ao modelo de crenças de Ataraxos. A equipe já identificou isso como trabalho futuro.

Uma interface útil mostraria quais configurações ocultas o sistema considera prováveis, como essas crenças mudam após cada ação e quais premissas conduzem à recomendação final.

Ela também deveria revelar a sensibilidade. Se uma pequena alteração em uma probabilidade produzir uma ação diferente, um revisor humano precisa enxergar essa instabilidade.

Esses três sinais determinarão se Ataraxos continuará sendo um sistema excepcional para jogar ou se se tornará um modelo mais amplo para tomada de decisões sob incerteza.

O resultado imediato já é importante. Uma equipe de pesquisa de quatro universidades superou o desempenho humano de elite no Stratego usando um orçamento de treinamento muito inferior às estimativas anteriores para DeepNash.

Sua lição mais profunda diz respeito à alocação. O sistema investe amplos recursos de treinamento em um plano reutilizável e, depois, concentra a computação em tempo real nas incertezas relevantes para uma decisão específica.

Os desenvolvedores devem observar se esse padrão surge em outros sistemas de agentes. Compradores empresariais devem perguntar se resultados impressionantes em benchmarks incluem testes adversariais, contabilização de custos e premissas passíveis de inspeção.

Profissionais do conhecimento que avaliam pesquisas semelhantes podem preservar artigos, experimentos e alegações em evolução em uma base de conhecimento pesquisável. A medida importante é comparar cada nova demonstração com as evidências originais.

Ataraxos Stratego AI resolveu uma questão: máquinas podem derrotar de forma decisiva os humanos mais fortes nesse jogo de informação oculta sem uma execução de treinamento de vários milhões de dólares. A próxima questão é mais difícil: a mesma eficiência pode sobreviver quando as regras já não estão escritas em um tabuleiro?

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page