Pim Niemeijer, el mejor competidor de Stratego del mundo, perdió ante una IA llamada Ataraxos con una puntuación de 15, con cuatro partidas terminando en empate. La máquina necesitó solo 16 GPUs y unos pocos miles de dólares para entrenarse.
Durante mucho tiempo, las máquinas tuvieron problemas con el juego. Entonces Deep Blue venció a Garry Kasparov en ajedrez en 1997, y AlphaGo venció a Lee Sedol en Go en 2016. Los bots de póker han vencido a profesionales durante años. Stratego, sin embargo, se mantuvo a raya.
El juego a primera vista
Stratego es un juego de información imperfecta, al igual que el póker. Cada jugador recibe 40 piezas — rangos desde mariscal hasta espía, además de bombas y una bandera. El objetivo es capturar la bandera del oponente. Su oponente conoce dónde están sus piezas, pero no qué son. Las identidades se revelan solo cuando dos piezas chocan en batalla — la pieza más débil es eliminada, y la identidad del ganador se muestra.
«Hay algo super distintivo de Stratego, que es una gran cantidad de información oculta que se desarrolla a lo largo de un período de tiempo muy largo», dijo Eugene Vinitsky, un investigador de NYU y coautor del estudio.
La información oculta
En algunas formas de póker, la información oculta es pequeña. En Texas Hold’em, «Solo tienes dos cartas ocultas», dijo Gabriele Farina, un científico informático del MIT y otro coautor. Eso deja solo 1,326 posibles manos, suficientes para que una máquina las pese todas.
«En Stratego, hay 40 piezas en el tablero que podrían estar en cualquier orden», dijo Farina. Eso es más de un decillón de posibles configuraciones. Luego está la duración del juego.
«En ajedrez, normalmente el juego dura 40 movimientos, pero en Stratego, un juego puede durar fácilmente 2,000 movimientos», dijo Farina.
El problema del farol
En Stratego, los jugadores a veces pretenden que una pieza débil es un mariscal para asustar a un oponente lejos de una posición. Si un jugador usa este truco demasiado, sus amenazas dejan de tener peso. Pero si nunca finge en absoluto, el otro lado puede leer su mano con facilidad.
El desafío de encontrar ese equilibrio fue lo que las AIs anteriores como DeepNash de DeepMind, introducida en 2022, no pudieron superar.
La victoria (The win)
Un equipo de investigadores de Carnegie Mellon, MIT, NYU y Stanford crearon Ataraxos, y fue Ataraxos el que finalmente lo logró. (A team of researchers from Carnegie Mellon, MIT, NYU, and Stanford created Ataraxos, and it was Ataraxos that finally cracked it.)
Los recursos (The resources)
El costo de entrenamiento fue modesto. Solo se necesitaron 16 GPUs y unos pocos miles de dólares para completar la tarea.
Lo que esto significa (What this means)
Lo que hace destacar la victoria es lo que resuelve. El programa derrota al mejor jugador humano del mundo y también resuelve un problema que previamente había eludido a otros sistemas de IA. (What makes the victory stand out is what it resolves. The program defeats the world’s top human player, and it also settles an issue that had previously eluded other AI systems.)
«Hay algo sumamente distintivo sobre Stratego, que es una gran cantidad de información oculta que se desarrolla a lo largo de un período de tiempo muy largo.» («There’s something super distinctive about Stratego, which is that it is a massive amount of hidden information that unfolds over a very long time scale.»)
El veredicto (The verdict)
La victoria marca un punto de inflexión para el estudio de la IA, mucho más allá de su importancia para aquellos que juegan Stratego. Demuestra lo que se puede lograr al combinar un vasto espacio de búsqueda con un largo plazo y información oculta. Los esfuerzos anteriores fracasaron porque no pudieron manejar el farol sin sacrificar fortaleza en alguna otra área. (The win marks a turning point for AI study, far beyond its significance to those who play Stratego. It demonstrates what can be achieved by joining a vast search space with a lengthy timeline and concealed information. Previous efforts fell short because they could not manage the bluffing without sacrificing strength somewhere else.)
Un equipo resolvió un rompecabezas que dejó atascado a DeepNash de DeepMind, haciéndolo con casi ningún recurso que hablar — solo 16 GPUs y unos pocos miles de dólares. (A team cracked a puzzle that had DeepMind’s DeepNash stuck, doing so with almost no resources to speak of — just 16 GPUs and a few thousand dollars.)
Una mirada rápida a los números (A quick look at the numbers)
| Juego (Game) | Año | Mejor jugador derrotado |
|---|---|---|
| Ajedrez | 1997 | Garry Kasparov |
| Go | 2016 | Lee Sedol |
| Stratego | Ahora | Pim Niemeijer |
La progresión ilustra el avance de la inteligencia artificial. El ajedrez fue superado primero, seguido por el Go, luego el póker y ahora el Stratego. Cada juego presentó un desafío distinto, pero cada uno finalmente sucumbió a una máquina que aprehendió sus principios más a fondo de lo que cualquier humano podría.
Fuente: “Con la mayor parte de la información oculta, el juego Stratego había desconcertado a la IA—hasta ahora,” Ars Technica.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

