Un nuevo bot llamado Codex Astra ha adoptado StarCraft’s Brood War como su pasatiempo, y ha emergido como la mejor IA en el juego. Un reciente punto de referencia, conocido como Brood War Bench, compara modelos de IA entre sí en el clásico juego de estrategia en tiempo real, y Codex ha quedado en el primer lugar. El resto del campo ni siquiera puede alcanzar un nivel de juego de principiante.
El punto de referencia, subido por el autor del experimento, revela a Codex como el claro ganador sobre todos los demás modelos, mientras que los modelos Grok aún no han demostrado que pueden jugar Brood War. Los sistemas restantes se quedan atrás, ocupándose principalmente de procesar en lugar de actuar.
El Problema del Queso de Codex
El concepto más persistente en Codex fue la disrupción, y tomó la forma de una Sonda moviéndose por el mapa para atacar a trabajadores o edificios enemigos. Esta táctica demostró ser sorprendentemente efectiva, ya que los agentes oponentes frecuentemente pasaban de treinta a cuarenta segundos contemplando cómo responder a la sonda mientras fallaban en actuar en cualquier otra cosa.
Los sistemas de Codex eran mucho más débiles en la producción constante. Retrasó la tecnología, envió uno o dos unidades básicas a bases defendidas y lanzó trabajadores a la última resistencia. También creó subagentes distintos para la economía, la producción de ejércitos y el control del ejército, que se comunicaban poco entre sí. El agente del ejército a menudo enviaba cada nueva unidad directamente a un ataque sin saber qué fuerza más grande estaban planeando los otros agentes.
Un error frecuente entre los recién llegados es enviar unidades una por una en lugar de esperar a un grupo más grande y un tiempo de ataque preparado. La persona que trabajó en Codex dijo que el juego se volvió mucho más fuerte al planificar estos momentos, coordinando sus subagentes para que actuaran en conjunto cuando él ayudó a guiar su desarrollo.
La resistencia se mantuvo firme. Dentro de G009, una vez que el ejército y la base primaria fueron perdidos, Codex 5.6 Terra / medio llevó su último Centro de Comando y lo colocó en la esquina más alejada. Resistió durante otros seis minutos.
Los Largos Periodos de Razonamiento de Grok
Grok 4.6 a menudo producía largos periodos de razonamiento y muy pocos lotes de comandos. En G043, la ejecución xhigh registró 11,138 tokens de razonamiento pero emitió solo seis lotes de comandos en 43 minutos, y nunca desplegó una unidad de combate.
Grok / xhigh hizo tres Marines en G003, y Grok / medium hizo dos Zealots en G002, pero ninguno alcanzó la base enemiga. Estos dos casos parecen menos como estrategias deficientes que como fallos para seguir observando el mapa y actuando sobre lo observado.
Ambición de Fable
Me encontré animando a Claude Fable en más de un par de partidas. Fable tendía a enfocarse en desarrollar una economía y avanzar en el árbol tecnológico en lugar de conformarse con la primera unidad que podía reunir. Parecía más comprometido con jugar realmente el juego que cualquiera de los otros modelos.
El juego alcanzó un Nido, Aguja y Mutaliscos y ganó en G007. Luego, en G027, añadió una Instalación Robótica, Ciudadela de Adun, Observatorio y Archivos Templarios antes de la victoria. La Ambición no garantizaba la ejecución: en G036, Fable llegó a una Fábrica y Academia, pero Opus 5 la dominó.
Ni Astra ni Fable lograron construir ejércitos complicados, defender ataques básicos o jugar estrategias claras. Un jugador completamente nuevo que se involucrara en una ofensiva de fotones fácilmente triunfaría en cada uno de estos encuentros.
Lo que el Benchmark Mide Realmente
Cada modelo fue enfrentado contra cada uno de los demás en un sistema de todos contra todos, con los enfrentamientos celebrados en paralelo en las VMs Freestyle. El sistema guardó datos del motor del juego y los registros para ambos agentes en cada partida.
Jugar una versión casera de Brood War con amigos reveló hasta dónde pueden llegar los modelos por su cuenta. Después de que el creador construyó esta versión solo para agentes, lo jugó con algunos amigos que solo habían jugado un par de juegos de Starcraft en sus vidas. Lo hicieron sorprendentemente bien, y cuando el creador preguntó por qué, dijeron que no habían hecho mucho: le habían pedido a su agente que atacara, y éste había construido un pequeño ejército y había realizado el ataque completo por ellos.
Ahí es de donde surgió el benchmark. La persona que lo creó quería ver hasta dónde podían llegar los agentes por su cuenta.
Codex contra Grok contra Fable
| Modelo | Fortaleza | Debilidad ( |
|---|---|---|
| Codex Astra ( | Líder consistente ( | Envía unidades una a la vez ( |
| Grok ( | Largos períodos de razonamiento ( | Nunca despliega una unidad de combate ( |
| Fábula ( | Asciende en el árbol tecnológico ( | Ambición sin ejecución ( |
La Persistencia de Codex (
G009 demostró la capacidad de Codex para resistir. Después de perder su ejército y su base principal, Codex 5.6 Terra / mediano levantó su último Centro de Mando y lo movió hacia la esquina opuesta. Continuó durante otros seis minutos antes de llegar a su fin.
La noción que constantemente regresaba en Codex era la disrupción. En las partidas de Protoss, con frecuencia implicaba enviar una Sonda a través del mapa para atacar a trabajadores o edificios. El plan funcionaba sorprendentemente bien, ya que los agentes oponentes usualmente gastaban treinta o más segundos contemplando cómo responder a esa sonda en lugar de tomar cualquier otra acción.
Estos sistemas funcionaban mal en la producción sostenida. Codex retrasaba la tecnología, liberando uno o dos unidades básicas a la vez en bases defendidas, y lanzaba trabajadores a la última resistencia. También producía subagentes separados para administrar la economía, la producción de ejércitos y el control del ejército, que apenas se comunicaban entre sí. El agente del ejército a menudo enviaba cada nueva unidad directamente a un ataque sin saber qué ejército más grande los otros agentes estaban planeando construir.
Un error frecuente entre los recién llegados es enviar unidades una a la vez, en lugar de esperar a una masa crítica y un tiempo de ataque planificado. Cuando el creador ayudó a dirigir a Codex, fue mucho mejor en la planificación de esos momentos y en hacer que sus subagentes trabajaran juntos.
Lo que esto significa
El punto de referencia es una instantánea de dónde se encuentran estos modelos en el dominio del juego de estrategia. El enfoque de «queso primero» de Codex Astra muestra un modelo que puede interrumpir con los mejores, pero tiene dificultades con la producción sostenida y la coordinación. Los largos periodos de razonamiento de Grok muestran un modelo que piensa profundamente pero rara vez actúa. Fable muestra ambición pero tiene dificultades con la ejecución.
Ninguno de los modelos superó un nivel de principiante, sin embargo, la propia reacción del creador fue de entusiasmo: «Este punto de referencia está lejos de agotarse. Hay mucho más para que los agentes aprendan y mucho más para que el punto de referencia les pida que hagan».
El creador se encontró más emocionado de lo habitual mientras observaba a los agentes jugar. Esta es la forma más honesta de describir todo el experimento: los bots son terribles en Brood War, pero sus payasadas son genuinamente entretenidas de ver.
El contraste entre Codex y Grok
La diferencia entre la disrupción de Codex y el uso intensivo de razonamiento de Grok y el punto de referencia hace que este último se sienta menos como un experimento científico y más como un acto de comedia protagonizado por bots.
Estos modelos aún no han alcanzado un rendimiento de nivel principiante, pero se están moviendo en esa dirección. La durabilidad de Codex, el audaz alcance de Fable y la vasta cantidad de razonamiento mostrada por Grok demuestran que estos sistemas no están estancados. Cada uno está simplemente estancado de una manera distinta.
Los resultados han llegado, y el benchmark muestra a Codex Astra como el ganador, superando a todos los demás modelos con consistencia. Los modelos Grok aún no han alcanzado el nivel necesario para jugar Brood War. El creador ya anticipa el día en que sí lo hagan.
Material fuente: “Brood War Bench,” swerdlow.dev.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

