Unreal Labs hat Unreal Agent entwickelt, ein System, das Tool-Aufrufe aus dem „Gedanken“ des Modells herausverlagert, und behauptet, diese Verlagerung die Kosten um bis zu 40 % gegenüber Codex bei Produktionsaufgaben und Coding-Tests reduziert. Das Unternehmen beschreibt die Anordnung als ein „Design für frontier-artige Kosteneffizienz“ und hat den Code auf GitHub zur Verfügung gestellt.
Der Kostenanspruch
Unreal Labs behauptet, Unreal Agent liefert bis zu 40 % Kosteneinsparungen gegenüber Codex und bis zu 20 % Kosteneinsparungen gegenüber Pi, gemessen an realen Arbeitslasten und agentenbezogenen Benchmarks. Das Unternehmen ließ GPT-6 Astra xhigh gegen Codex und Pi laufen, wobei die Testergebnisse in seinen eigenen Benchmarks veröffentlicht wurden.
Das Harness-Design
Unreal Agent handhabt Tool-Aufrufe vollständig asynchron, was das zugrunde liegende Modell von der Notwendigkeit befreit, Wartezeiten, Abfragen und Heartbeats für Tools zu verwalten. Dieses Design liefert zwei wesentliche Vorteile:
- Benutzer können den Agenten jederzeit steuern, ohne auf den Abschluss von Tool-Aufrufen warten zu müssen.
- Der Agent kann mehr nützliche Tool-Aufrufe zwischen Modell-Aufrufen unterbringen.
SDK-Kompromisse
Unreal Labs hat mehrere agentenbezogene Produkte entwickelt und dabei wertvolle Erkenntnisse über weit verbreitete SDKs gewonnen. SDKs, die auf CLIs basieren, wie z. B. Claudes Agent SDK, bringen Annahmen über lokale Sitzungen, Subprozesse und Ressourcenbeschränkungen mit sich, die sich nicht ohne weiteres in Produktionsumgebungen übertragen lassen. Um Completion, Cancellation und Hintergrundaufgaben zuverlässig am Laufen zu halten, bedeutet dies in der Regel, ein eigenes Lifecycle-Management um diese Tools herum aufzubauen.
Wechsel zwischen API-Modi kann dazu führen, dass Tools kaputt gehen oder Kompression beeinträchtigt wird, und die Änderung des SDK verändert die Art und Weise, wie Nachrichten erstellt werden, was erfordert, dass Integrationscode umgeschrieben wird. Genehmigungen und Sicherheitsmaßnahmen, die von Harness-Hooks und benutzerdefinierten Tools abhängen, erfordern in der Regel mehr Wartung und bieten einen schwächeren Schutz als Umgebung- oder Sandbox-Grenzen, die außerhalb des Harness festgelegt werden.
Die Aufschlüsselung der Kosteneinsparungen
Laut Unreal Labs resultieren die Kostensenkungen aus zwei Faktoren. Der erste ist ein geringer Footprint für das Harness in Kombination mit der gezielten Steuerung der Art und Weise, wie Tools verwendet werden, einschließlich grundlegender Prompts, auf Effizienz abgestimmter Ergebnisse und ohne Sub-Agenten oder Workflows. Der zweite Faktor ist, dass mehr Arbeit durch Tools während jedes Modellzugs geleistet wird. Da das Modell asynchron arbeitet, kann der Agent mehrere schwere Tool-Aufrufe tätigen, ohne Tokens für die Überprüfung der Vollständigkeit oder das Warten auszugeben.
Wie das Harness funktioniert
Wenn Unreal Agent einen Tool-Aufruf durchführt, zeichnet es den Event-Log-Eintrag für das Tool zurückgebend im „in-progress“-Status sofort auf, obwohl es im Hintergrund weiterläuft. Der tatsächliche Abschluss eines Tools fügt sein Ergebnis zum Session-Log hinzu und löst einen Aufruf eines LLM aus. Es war eine interessante technische Herausforderung, diesen gesamten Prozess funktionsfähig zu machen, ohne den Cache zu beeinträchtigen.
Die Benchmark-Ergebnisse
Das Testen von GPT-6 Astra xhigh durch Unreal Labs verglichen es mit Codex und Pi. Die Ergebnisse wurden auf der Website des Unternehmens veröffentlicht.
| Benchmark | Codex (lb) | Unreal Agent | Pi |
|---|---|---|---|
| Terminal-Bench 4.0 | Codex (lb) | Unreal Agent | Pi |
| SWE-Atlas Codebase QnA | Codex (lb) | Unreal Agent | Pi |
| DeepSWE 1.1 | Codex (lb) | Unreal Agent | Pi |
| Agents‘ Last Exam | Codex (lb) | Unreal Agent | Pi |
Getting Started
Unreal Labs hat ein SDK für Unreal Agent veröffentlicht, das eine Go-Bibliothek für die direkte Integration in Ihren Code umfasst, eine ausführbare Runner-Datei ähnlich claude -p /codex exec sowie einen Benchmark-Runner, der mit Harbor funktioniert. Für weitere Informationen wenden Sie sich bitte an contact@unreallabs.ai.
Die API-Limits
Die Dokumentation der Responses API spezifiziert nicht, wie zwei Tool-Call-Ergebnisobjekte innerhalb eines einzelnen Kontexts verwendet werden sollen, so Unreal Labs. Das Unternehmen stellte fest, dass einige Modelle solche Anfragen während des Testbetriebs ablehnten und das Feld function_call_output in diesen Situationen keinen Unterschied machte.
Das Team hinter Unreal Labs hat mehrere Agent-Produkte entwickelt und weiß aus erster Hand, dass Software Development Kits mit versteckten Kosten verbunden sind. Die Verwaltung des Produktlebenszyklus, die Aktualisierung von APIs und der Umgang mit Abhängigkeitsbäumen sind alles Aufgaben, die in der Werbematerial eines Anbieters nicht aufgeführt sind. Jeder kann die Benchmarks prüfen und den GitHub-Code selbst einsehen.
Sehen Sie sich das Video an, auf das sich die Geschichte stützt, unter unreallabs.ai.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

