Midterms 2026Wer nach unseren Maßstäben Ihre Stimme verdientZum Leitfaden →
GESCHRIEBEN IN KLAREM DEUTSCH.
CLAY TRIBUNE.
Anzeige

Unreal Labs baut Unreal Agent, eine Schnittstelle, die Tool-Aufrufe aus dem Kopf des Modells heraus verlagert.

Unreal Labs präsentiert Unreal Agent, eine Schnittstellen-Design für LLM-Agenten, die die Kosten um bis zu 40 % im Vergleich zu Codex reduziert, wobei der Code auf GitHub geteilt wird.

Von mitch·4 Min. Lesezeit
A scientist observes a glowing blue holographic interface in a futuristic laboratory, symbolizing the harness design for LLM agents.

Unreal Labs hat Unreal Agent entwickelt, ein System, das Tool-Aufrufe aus dem „Gedanken“ des Modells herausverlagert, und behauptet, diese Verlagerung die Kosten um bis zu 40 % gegenüber Codex bei Produktionsaufgaben und Coding-Tests reduziert. Das Unternehmen beschreibt die Anordnung als ein „Design für frontier-artige Kosteneffizienz“ und hat den Code auf GitHub zur Verfügung gestellt.

Der Kostenanspruch

Unreal Labs behauptet, Unreal Agent liefert bis zu 40 % Kosteneinsparungen gegenüber Codex und bis zu 20 % Kosteneinsparungen gegenüber Pi, gemessen an realen Arbeitslasten und agentenbezogenen Benchmarks. Das Unternehmen ließ GPT-6 Astra xhigh gegen Codex und Pi laufen, wobei die Testergebnisse in seinen eigenen Benchmarks veröffentlicht wurden.

Das Harness-Design

Unreal Agent handhabt Tool-Aufrufe vollständig asynchron, was das zugrunde liegende Modell von der Notwendigkeit befreit, Wartezeiten, Abfragen und Heartbeats für Tools zu verwalten. Dieses Design liefert zwei wesentliche Vorteile:

Anzeige
  1. Benutzer können den Agenten jederzeit steuern, ohne auf den Abschluss von Tool-Aufrufen warten zu müssen.
  2. Der Agent kann mehr nützliche Tool-Aufrufe zwischen Modell-Aufrufen unterbringen.

SDK-Kompromisse

Unreal Labs hat mehrere agentenbezogene Produkte entwickelt und dabei wertvolle Erkenntnisse über weit verbreitete SDKs gewonnen. SDKs, die auf CLIs basieren, wie z. B. Claudes Agent SDK, bringen Annahmen über lokale Sitzungen, Subprozesse und Ressourcenbeschränkungen mit sich, die sich nicht ohne weiteres in Produktionsumgebungen übertragen lassen. Um Completion, Cancellation und Hintergrundaufgaben zuverlässig am Laufen zu halten, bedeutet dies in der Regel, ein eigenes Lifecycle-Management um diese Tools herum aufzubauen.

Wechsel zwischen API-Modi kann dazu führen, dass Tools kaputt gehen oder Kompression beeinträchtigt wird, und die Änderung des SDK verändert die Art und Weise, wie Nachrichten erstellt werden, was erfordert, dass Integrationscode umgeschrieben wird. Genehmigungen und Sicherheitsmaßnahmen, die von Harness-Hooks und benutzerdefinierten Tools abhängen, erfordern in der Regel mehr Wartung und bieten einen schwächeren Schutz als Umgebung- oder Sandbox-Grenzen, die außerhalb des Harness festgelegt werden.

Die Aufschlüsselung der Kosteneinsparungen

Laut Unreal Labs resultieren die Kostensenkungen aus zwei Faktoren. Der erste ist ein geringer Footprint für das Harness in Kombination mit der gezielten Steuerung der Art und Weise, wie Tools verwendet werden, einschließlich grundlegender Prompts, auf Effizienz abgestimmter Ergebnisse und ohne Sub-Agenten oder Workflows. Der zweite Faktor ist, dass mehr Arbeit durch Tools während jedes Modellzugs geleistet wird. Da das Modell asynchron arbeitet, kann der Agent mehrere schwere Tool-Aufrufe tätigen, ohne Tokens für die Überprüfung der Vollständigkeit oder das Warten auszugeben.

Wie das Harness funktioniert

Wenn Unreal Agent einen Tool-Aufruf durchführt, zeichnet es den Event-Log-Eintrag für das Tool zurückgebend im „in-progress“-Status sofort auf, obwohl es im Hintergrund weiterläuft. Der tatsächliche Abschluss eines Tools fügt sein Ergebnis zum Session-Log hinzu und löst einen Aufruf eines LLM aus. Es war eine interessante technische Herausforderung, diesen gesamten Prozess funktionsfähig zu machen, ohne den Cache zu beeinträchtigen.

Die Benchmark-Ergebnisse

Das Testen von GPT-6 Astra xhigh durch Unreal Labs verglichen es mit Codex und Pi. Die Ergebnisse wurden auf der Website des Unternehmens veröffentlicht.

Benchmark Codex (lb) Unreal Agent Pi
Terminal-Bench 4.0 Codex (lb) Unreal Agent Pi
SWE-Atlas Codebase QnA Codex (lb) Unreal Agent Pi
DeepSWE 1.1 Codex (lb) Unreal Agent Pi
Agents‘ Last Exam Codex (lb) Unreal Agent Pi

Getting Started

Unreal Labs hat ein SDK für Unreal Agent veröffentlicht, das eine Go-Bibliothek für die direkte Integration in Ihren Code umfasst, eine ausführbare Runner-Datei ähnlich claude -p /codex exec sowie einen Benchmark-Runner, der mit Harbor funktioniert. Für weitere Informationen wenden Sie sich bitte an contact@unreallabs.ai.

Die API-Limits

Die Dokumentation der Responses API spezifiziert nicht, wie zwei Tool-Call-Ergebnisobjekte innerhalb eines einzelnen Kontexts verwendet werden sollen, so Unreal Labs. Das Unternehmen stellte fest, dass einige Modelle solche Anfragen während des Testbetriebs ablehnten und das Feld function_call_output in diesen Situationen keinen Unterschied machte.

Das Team hinter Unreal Labs hat mehrere Agent-Produkte entwickelt und weiß aus erster Hand, dass Software Development Kits mit versteckten Kosten verbunden sind. Die Verwaltung des Produktlebenszyklus, die Aktualisierung von APIs und der Umgang mit Abhängigkeitsbäumen sind alles Aufgaben, die in der Werbematerial eines Anbieters nicht aufgeführt sind. Jeder kann die Benchmarks prüfen und den GitHub-Code selbst einsehen.

Sehen Sie sich das Video an, auf das sich die Geschichte stützt, unter unreallabs.ai.

Das Notizbuch

Das Notizbuch abonnieren.

Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

Wir schicken eine Bestätigungsmail. Jede Ausgabe hat einen Abmeldelink, ein Klick genügt.

Anzeige

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Als Amazon-Partner verdient Clay Tribune an qualifizierten Verkäufen.