---
title: "IA Ataraxos supera os melhores jogadores humanos de Stratego"
author: "André Iglesias"
date: "2026-10-03 08:30:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/10/03/ia-ataraxos-supera-os-melhores-jogadores-humanos-de-stratego/md"
---

## Resumo
- Ataraxos venceu o campeão mundial Pim Niemeijer no Stratego por 15 vitórias a 1, com quatro empates.
- O modelo foi desenvolvido por investigadores do MIT, Carnegie Mellon, NYU e Stanford.
- O Stratego desafia a IA porque tem 40 peças com identidades ocultas e exige decisões com informação imperfeita.
- A arquitetura combina uma rede de crenças, uma rede de política e valor baseada em transformadores e busca durante a decisão.
- O treinamento custou cerca de US$ 8.000, usando 16 GPUs NVIDIA H100 por uma semana.
- O sistema foi treinado com 163 milhões de partidas concluídas e 208 bilhões de passos de ambiente.
- A mesma arquitetura apresentou resultados de ponta em Hanabi e Dou Dizhu, mas o feito principal continua sendo a vitória demonstrada no Stratego.

---

O **Ataraxos**, modelo de inteligência artificial desenvolvido por investigadores do MIT, da Carnegie Mellon, da NYU e de Stanford, superou os melhores jogadores humanos de Stratego em um estudo publicado na revista Nature em 30 de setembro de 2026. Na disputa contra o campeão mundial **Pim Niemeijer**, o sistema conseguiu 15 vitórias, sofreu uma derrota e empatou quatro vezes. O resultado importa porque o jogo esconde a identidade das peças, obrigando a máquina a decidir com informação incompleta, e porque o treinamento custou cerca de **US$ 8.000**, muito menos que projetos anteriores comparáveis. Para entender o que essa vitória realmente demonstra, é preciso separar o placar, a arquitetura e a eficiência que tornaram a partida possível. O estudo foi detalhado pela [imprensa portuguesa](https://www.jn.pt/inovacao/artigo/modelo-de-inteligencia-artificial-supera-os-melhores-jogadores-de-popular-jogo-de-estrategia/18132341).

## Por que o Stratego é um teste difícil para a IA

O Stratego funciona como um teste particularmente exigente porque reúne **40 peças** cujas identidades ficam ocultas durante a partida. Em vez de enxergar todo o estado do tabuleiro, cada jogador precisa agir com base no que observa e no que consegue inferir sobre as peças adversárias. É isso que torna o jogo um benchmark, ou seja, uma referência usada para comparar o desempenho de diferentes sistemas. A tarefa pede mais do que escolher o movimento aparentemente mais forte: o jogador precisa considerar hipóteses sobre o que ainda não foi revelado e avaliar as consequências de cada decisão. Essa combinação de identidade escondida e raciocínio estratégico colocou o Ataraxos diante de um problema diferente daqueles em que todas as informações ficam visíveis.

Essa característica coloca o Stratego na categoria dos jogos de **informação imperfeita**, expressão usada para situações nas quais os participantes não conhecem completamente o estado em que estão tomando uma decisão. Para a IA, a dificuldade está em evitar que uma única suposição sobre o tabuleiro conduza toda a jogada, já que uma peça aparentemente fraca pode esconder uma função diferente daquela imaginada pelo adversário. O Ataraxos foi projetado justamente para trabalhar com possibilidades ocultas, em vez de tratar o tabuleiro como uma fotografia completa e definitiva. Esse detalhe ajuda a explicar por que a vitória contra um especialista humano tem peso próprio, pois o sistema precisou lidar com incerteza durante a competição, e não apenas calcular movimentos em uma posição totalmente revelada.

## O placar que colocou o Ataraxos acima dos especialistas

A comparação mais concreta aconteceu contra **Pim Niemeijer**, identificado pelas fontes como campeão mundial de Stratego. O Ataraxos venceu 15 das partidas, perdeu uma e empatou quatro, uma sequência que colocou o modelo acima do especialista humano no confronto descrito pelos investigadores. O placar é relevante porque não se limita a uma demonstração isolada ou a uma simulação contra um adversário genérico: ele foi obtido em partidas contra um jogador reconhecido como referência competitiva na modalidade. A disputa transforma a afirmação de desempenho super-humano em um resultado observável, com vitórias, derrota e empates contabilizados, permitindo que o público compreenda exatamente a dimensão do teste.

Além do duelo contra o campeão, o sistema também superou modelos anteriores usados como referência, incluindo o **DeepNash**, desenvolvido pelo Google. As fontes descrevem vantagem do Ataraxos tanto em desempenho quanto em eficiência computacional, duas medidas que precisam ser analisadas juntas para evitar uma leitura simplista da notícia. Vencer mais partidas mostra a qualidade da estratégia adotada, enquanto alcançar esse resultado com menos recursos de treinamento mostra que a equipe encontrou uma forma mais econômica de lidar com a informação escondida. O caso, portanto, combina uma vitória esportiva concreta com uma comparação técnica que desloca a discussão para a maneira como a IA aprende e calcula suas decisões.

## Como a rede de crenças ajuda a decidir sem enxergar tudo

A peça central da arquitetura é uma **rede de crenças**, ou belief network, responsável por modelar estados plausíveis do tabuleiro que permanecem ocultos para o sistema. Em termos simples, a rede trabalha com possibilidades sobre a localização e a identidade das peças que ainda não foram reveladas, em vez de assumir que existe apenas uma explicação para o que está acontecendo. O Ataraxos combina esse mecanismo com busca durante o tempo de decisão, conhecida como test-time search. A busca ocorre no momento em que a jogada será escolhida, permitindo que o modelo avalie possibilidades antes de executar uma ação. Essa combinação aproxima o processo de uma análise contínua de hipóteses, algo especialmente útil em um jogo no qual a informação disponível nunca conta toda a história.

O treinamento também utiliza uma rede de política e valor baseada em **transformadores**. Nesse arranjo, a política ajuda a indicar quais ações devem ser consideradas, enquanto o valor estima a qualidade das posições avaliadas pelo sistema. A fonte descreve essa estrutura em conjunto com a rede de crenças e com a aprendizagem por reforço, método no qual o modelo ajusta sua estratégia a partir dos resultados obtidos em sucessivas partidas simuladas. A diferença prática está em como o Ataraxos usa as possibilidades ocultas: em vez de tentar examinar à força todo o espaço de combinações do Stratego, ele amostra estados plausíveis e concentra a decisão nas alternativas que fazem sentido para a posição observada. O desenho técnico explica por que a eficiência foi tão relevante quanto o placar.

## O treinamento custou cerca de US$ 8.000

A eficiência aparece primeiro no investimento necessário para treinar o sistema. O Ataraxos foi formado com aproximadamente **US$ 8.000** em computação, usando 16 GPUs NVIDIA H100 durante uma semana. De acordo com as fontes, esse custo equivale a cerca de um quinhentésimo do esforço computacional associado a projetos anteriores como o DeepNash. A comparação não significa que os dois projetos tenham utilizado exatamente o mesmo desenho ou as mesmas condições, mas mostra a escala da economia relatada para alcançar desempenho superior no Stratego. O dado muda a pergunta feita depois da vitória: em vez de perguntar apenas se uma IA consegue derrotar um campeão, também é preciso perguntar quanto processamento foi necessário para chegar a esse resultado. Mais detalhes sobre a conta foram reunidos em uma [análise técnica do treinamento](https://aiweekly.co/alerts/ataraxos-ai-tops-stratego-champion-on-1500th-the-compute).

O custo reduzido dependeu de uma combinação entre arquitetura e simulação em larga escala. O modelo foi treinado com **163 milhões de partidas concluídas** e 208 bilhões de passos de ambiente, número que descreve a quantidade de interações processadas no simulador ao longo do aprendizado. Esses dados não vieram de uma coleção de partidas humanas apresentada como treinamento principal, mas do processo de jogos concluídos usado para ensinar o sistema a avaliar decisões e consequências. A grande quantidade de experiências permitiu que o Ataraxos encontrasse padrões em posições variadas, enquanto a arquitetura de crenças ajudou a lidar com aquilo que permanecia escondido em cada partida. Assim, o resultado nasceu da combinação entre muitas simulações e uma forma seletiva de analisar estados possíveis, não de uma simples busca cega por todas as jogadas.

O simulador acelerado por **CUDA**, tecnologia usada para executar cálculos em processadores gráficos, chegou a processar cerca de 10 milhões de atualizações de estado por segundo. Essa velocidade reduziu o tempo necessário para gerar e avaliar experiências de Stratego, criando as condições para os 208 bilhões de passos de ambiente informados pelas fontes. O número ajuda a traduzir o que significa treinar uma IA para um jogo com informação oculta: cada partida simulada alimenta o modelo com novas combinações de posições, decisões e resultados, mas a quantidade de experiências só se torna viável quando o software consegue atualizar o tabuleiro em ritmo muito alto. A eficiência do simulador, portanto, foi parte direta da estratégia de treinamento, e não apenas um detalhe de infraestrutura.

## O que o artigo da Nature permite concluir

O estudo publicado na **Nature** em 30 de setembro de 2026 descreve o desempenho super-humano do Ataraxos no Stratego e apresenta a arquitetura como uma abordagem para aprendizagem por reforço sob condições de grande quantidade de informação oculta. Entre os autores principais estão **Samuel Sokota** e **J. Zico Kolter**, ambos associados à Carnegie Mellon nas informações fornecidas. A publicação coloca o experimento dentro de uma discussão acadêmica mais ampla, porque o foco não está apenas em declarar que a máquina venceu, mas em explicar como uma rede de crenças, uma rede de política e valor e a busca durante a decisão foram combinadas. O resultado mais seguro é específico: esse sistema alcançou desempenho superior ao humano no teste de Stratego descrito pelo artigo, com uma relação de custo computacional menor que a de projetos anteriores citados.

A mesma arquitetura também apresentou resultados de ponta em **Hanabi**, jogo cooperativo, e em **Dou Dizhu**, segundo as fontes que resumem o artigo. Esses dados indicam que os investigadores testaram a abordagem em outros jogos com informação oculta, mas não autorizam transformar a vitória no Stratego em uma afirmação genérica sobre qualquer capacidade de inteligência. O ponto concreto continua sendo o desempenho medido em cada tarefa, com regras, objetivos e formas de cooperação ou competição próprias. Essa distinção evita o exagero comum em notícias sobre IA: vencer um campeão em um jogo complexo é uma demonstração relevante dentro daquele domínio, enquanto a transferência para atividades não mencionadas exigiria novos testes e evidências.

## A caixa de ferramentas para entender o avanço

O caso do Ataraxos pode ser lido por três medidas objetivas: o placar de **15 vitórias, uma derrota e quatro empates** contra Pim Niemeijer, a arquitetura preparada para raciocinar sobre estados ocultos e o custo de aproximadamente US$ 8.000 para o treinamento. Juntas, essas informações desbugam a manchete e mostram por que ela é mais específica do que a frase "a IA ficou mais inteligente". O sistema não venceu porque recebeu acesso completo ao tabuleiro, nem porque examinou todas as combinações por força bruta; ele usou uma rede de crenças para trabalhar com estados plausíveis e uma busca no momento da decisão. O próximo passo para avaliar esse tipo de avanço é observar resultados reproduzíveis em tarefas com informação incompleta, sempre mantendo separados o desempenho demonstrado e as capacidades que ainda não foram testadas.

O que muda, por enquanto, é a referência técnica para construir sistemas que precisam decidir quando parte dos dados está escondida. O Ataraxos mostrou no Stratego que aprendizagem por reforço, simulação acelerada e modelagem de crenças podem ser reunidas em uma arquitetura capaz de superar um campeão mundial usando uma fração do custo computacional atribuído ao DeepNash. O resultado não transforma automaticamente a IA em jogadora universal, mas entrega uma demonstração mensurável de como reduzir a incerteza durante uma partida. Para quem acompanha a evolução desses modelos, a lição prática é direta: o placar chama atenção, mas a combinação entre inferência sobre informações ocultas e eficiência de treinamento é o elemento que merece ser acompanhado nas próximas pesquisas.