Ein neuer Bot namens Codex Astra hat StarCrafts Brood War als Hobby angenommen und hat sich als die beste KI im Spiel herauskristallisiert. Ein aktueller Benchmark, bekannt als Brood War Bench, vergleicht KI-Modelle in dem klassischen Echtzeit-Strategiespiel miteinander, und Codex hat die Oberhand gewonnen. Der Rest des Feldes erreicht nicht einmal ein Anfängerniveau.
Der Benchmark, hochgeladen vom Autor des Experiments, enthüllt Codex als den klaren Sieger über alle anderen Modelle, während Grok-Modelle noch nicht bewiesen haben, dass sie Brood War spielen können. Die restlichen Systeme hinken hinterher und beschäftigen sich hauptsächlich mit der Verarbeitung anstelle von Aktion.
Codex‘ Problem mit dem „Cheese“
Das beständigste Konzept bei Codex war die Störung, und es nahm die Form einer Probe an, die über die Karte zog, um feindliche Arbeiter oder Gebäude ins Visier zu nehmen. Diese Taktik erwies sich als überraschend effektiv, da die gegnerischen Agenten häufig dreißig bis vierzig Sekunden damit verbrachten, zu überlegen, wie sie auf die Probe reagieren sollten, während sie nichts anderes taten.
Codex‘ Systeme waren bei der kontinuierlichen Produktion deutlich schwächer. Es verzögerte die Technologie, dribbelte ein oder zwei Basiseinheiten in verteidigte Basen und warf Arbeiter in den letzten Kampf. Es erstellte auch separate Subagenten für die Wirtschaft, die Armeeproduktion und die Armeekontrolle, die wenig miteinander kommunizierten. Der Armeeagent schickte jedes neue Einheit direkt in einen Angriff, ohne zu wissen, welche größere Kraft die anderen Agenten planen wollten zu bauen.
Ein häufiger Fehler bei Neulingen ist es, Einheiten einzeln zu schicken, anstatt auf eine größere Gruppe und einen vorbereiteten Angriffstermin zu warten. Die Person, die an Codex gearbeitet hat, sagte, das Spiel sei viel stärker darin geworden, diese Momente zu planen und seine Subagenten so zu koordinieren, dass sie zusammenarbeiten, als er bei der Entwicklung half.
Die Ausdauer hielt stand. Innerhalb von G009, nachdem Armee und Hauptbasis verloren waren, landete Codex 5.6 Terra / medium sein letztes Kommandozentrum in der weit entfernten Ecke. Es hielt weitere sechs Minuten durch.
Groks lange Denkphasen
Grok 4.6 produzierte oft lange Denkphasen und sehr wenige Befehlspatches. In G043 protokolierte der xhigh-Durchlauf 11.138 Denk-Token, erteilte aber nur sechs Befehlspatches über 43 Minuten und stellte nie eine Kampfeinheit auf.
Grok / xhigh eliminierte drei Marines in G003, und Grok / medium eliminierte zwei Zealots in G002, jedoch erreichte keines der beiden Modelle die feindliche Basis. Diese beiden Fälle sehen weniger nach schlechten Strategien aus als nach Versäumnissen, die Karte weiterhin zu beobachten und auf das Gesehene zu reagieren.
Fables Ambition
Ich fand mich dabei, Claude Fable in mehr als einigen Matches anzufeuern. Fable neigte dazu, sich darauf zu konzentrieren, eine Wirtschaft aufzubauen und den Technologiebaum voranzutreiben, anstatt sich mit der ersten Einheit zufrieden zu geben, die es aufbieten konnte. Es schien engagierter mit dem eigentlichen Spielgeschehen verbunden zu sein als eines der anderen Modelle.
Das Spiel erreichte Lair, Spire und Mutalisks und gewann in G007. Dann fügte es in G027 eine Robotics Facility, Citadel of Adun, Observatory und Templar Archives hinzu, bevor es gewann. Ambition garantierte keine Ausführung: in G036 erreichte Fable eine Factory und Academy, wurde aber von Opus 5 überrannt.
Weder Astra noch Fable schafften es, komplizierte Armeen aufzubauen, grundlegende Angriffe abzuwehren oder klare Strategien zu spielen. Ein brandneuer Spieler, der einen Photon-Rush startet, würde in jeder einzelnen dieser Begegnungen leicht triumphieren.
Was der Benchmark eigentlich misst
Jedes Modell wurde gegen jedes andere in einem Round-Robin-Raster getestet, wobei die Wettkämpfe parallel in Freestyle VMs abgehalten wurden. Das System speicherte Daten aus der Spiel-Engine und die Protokolle für beide Agenten für jedes Match.
Das Spielen einer selbst erstellten Version von Brood War mit Freunden offenbarte, wie weit die Modelle auf eigene Faust gehen können. Nachdem der Ersteller diese Agenten-only-Version erstellt hatte, spielte er sie mit ein paar Freunden, die nur ein paar Starcraft-Spiele in ihrem Leben gespielt hatten. Sie waren überraschend erfolgreich, und als der Ersteller fragte, warum, sagten sie, sie hätten nicht viel getan – sie hatten ihren Agenten aufgefordert, anzugreifen, und er hatte eine kleine Armee aufgebaut und den gesamten Angriff für sie durchgeführt.
Das ist, wo der Benchmark herkommt. Die Person, die ihn erstellt hat, wollte sehen, wie weit die Agenten auf eigene Faust gehen können.
Codex vs. Grok vs. Fable
| Modell | Stärke | Schwäche ( |
|---|---|---|
| Codex Astra ( | Beständiger Anführer ( | Schickt Einheiten einzeln aus ( |
| Grok ( | Lange Denkabschnitte ( | Setzt niemals eine Kampfeinheit ein ( |
| Fabel ( | Steigt den Technologiebaum auf ( | Ehrgeiz ohne Umsetzung ( |
Das Fortbestehen von Codex (
G009 demonstrierte Codex‘ Fähigkeit, auszuharren. Nachdem seine Armee und Hauptbasis verloren gegangen waren, erhöhte Codex 5.6 Terra / mittel sein letztes Kommandozentrum und bewegte es in die gegenüberliegende Ecke. Er hielt weitere sechs Minuten durch, bevor er seinem Ende entgegenging. (
Die Idee, die immer wieder im Codex auftauchte, war Störung. In Protoss-Matches beinhaltete dies häufig das Senden einer Probe über die Karte, um Arbeiter oder Gebäude anzugreifen. Der Plan funktionierte überraschend gut, da die gegnerischen Agenten in der Regel dreißig oder mehr Sekunden damit verbrachten, zu überlegen, wie sie auf diese Probe reagieren sollten, anstatt andere Aktionen durchzuführen.
Diese Systeme schnitten bei nachhaltiger Produktion schlecht ab. Codex verzögerte die Technologie, indem es ein oder zwei Basiseinheiten gleichzeitig in verteidigte Basen freisetzte, und warf Arbeiter in letzte Verteidigungsversuche. Es erzeugte außerdem separate Subagenten, um die Wirtschaft, die Armeeproduktion und die Armeeführung zu verwalten, die wenig miteinander kommunizierten. Der Armee-Agent schickte jedes neue Einheit sofort in einen Angriff, ohne zu wissen, welche größere Armee die anderen Agenten zu bauen planten.
Ein häufiger Fehler unter Neulingen ist es, Einheiten einzeln zu schicken, anstatt auf eine kritische Masse und einen geplanten Angriffstermin zu warten. Als der Ersteller half, Codex zu steuern, war es viel besser darin, diese Momente zu planen und seine Subagenten zusammenarbeiten zu lassen.
Was das bedeutet
Der Benchmark ist ein Schnappschuss davon, wo diese Modelle im Bereich des Strategiespiels stehen. Codex Astras „Cheese-First“-Ansatz zeigt ein Modell, das mit den Besten stören kann, aber Schwierigkeiten mit nachhaltiger Produktion und Koordination hat. Groks lange Denkphasen zeigen ein Modell, das tiefgründig denkt, aber selten handelt. Fable zeigt Ambitionen, hat aber Schwierigkeiten bei der Umsetzung.
Keines der Modelle stieg über ein Anfängerniveau auf, doch die eigene Reaktion des Erstellers war von Begeisterung geprägt: „Dieser Benchmark ist noch lange nicht erschöpft. Es gibt noch viel für die Agenten zu lernen, und es gibt noch viel mehr, was der Benchmark von ihnen verlangen kann.“
Der Ersteller fühlte sich beim Beobachten der Agenten beim Spielen ungewöhnlich aufgeregt. Dies ist die ehrlichste Art, das gesamte Experiment zu beschreiben: Die Bots sind schrecklich in Brood War, aber ihre Possen sind wirklich unterhaltsam anzusehen.
Der Unterschied zwischen Codex und Grok
Der Unterschied zwischen Codex‘ Störung und Groks intensivem Gebrauch von Denkprozessen und dem Benchmark lässt das Letztere eher wie eine Comedy-Show mit Bots als wie ein wissenschaftliches Experiment wirken.
Diese Modelle haben noch nicht das Leistungsniveau von Anfängern erreicht, bewegen sich aber in diese Richtung. Codex’s Ausdauer, Fables kühne Reichweite und die enorme Menge an Schlussfolgerungen, die Grok zeigt, beweisen, dass diese Systeme nicht stillstehen. Jedes einzelne steht lediglich auf eine andere Art und Weise still.
Die Ergebnisse sind eingetroffen, und das Benchmark zeigt Codex Astra als Sieger, der jedes andere Modell konsistent schlägt. Grok-Modelle haben noch nicht das Niveau erreicht, um Brood War zu spielen. Der Schöpfer blickt jedoch bereits auf den Tag, an dem dies der Fall sein wird, voraus.
Quelle: “Brood War Bench,” swerdlow.dev.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

