Unreal Labs ha desarrollado Unreal Agent, un sistema que mueve las llamadas de herramientas fuera de la mente del modelo, y afirma que este cambio reduce los costos hasta en un 40% en comparación con Codex en tareas de producción y pruebas de codificación. La compañía describe el arreglo como un diseño de «eficiencia de costos de frontera», y ha puesto el código a disposición en GitHub.
La Reivindicación de Costos
Unreal Labs afirma que Unreal Agent ofrece hasta un 40% de ahorro de costos en comparación con Codex y hasta un 20% de ahorro de costos en comparación con Pi cuando se mide contra cargas de trabajo del mundo real y puntos de referencia de agentes. La firma sometió a GPT-6 Astra xhigh a pruebas contra Codex y Pi, con los resultados de las pruebas publicados en sus propios puntos de referencia.
El Diseño del Arnés
Unreal Agent maneja las llamadas de herramientas completamente de forma asíncrona, lo que libera al modelo subyacente de la necesidad de administrar esperas, sondeos y latidos para las herramientas. Este diseño ofrece dos ventajas clave:
- Los usuarios siempre pueden guiar al agente sin tener que pausar para que se completen las llamadas de herramientas.
- El agente puede realizar más trabajo útil de llamadas de herramientas entre las llamadas del modelo.
Compensaciones del SDK
Unreal Labs ha desarrollado varios productos de agentes y ha aprendido lecciones sobre SDK ampliamente utilizados a medida que avanzaba. Los SDK que se basan en CLIs, como el Agent SDK de Claude, vienen con suposiciones sobre sesiones locales, subprocesos y límites de recursos que no se transfieren fácilmente al trabajo de producción. Mantener la finalización, la cancelación y las tareas en segundo plano funcionando de manera confiable generalmente significa construir su propio ciclo de vida alrededor de estas herramientas.
Moverse entre modos de API corre el riesgo de romper herramientas o arruinar la compactación, y cambiar el SDK cambia la forma en que se construyen los mensajes, lo que obliga a reescribir el código de integración. Las aprobaciones y las medidas de seguridad que dependen de los ganchos del arnés y las herramientas personalizadas generalmente requieren más mantenimiento y ofrecen una protección más débil en comparación con los límites del entorno o sandbox establecidos fuera del arnés.
Desglose del Ahorro de Costos
Según Unreal Labs, la reducción de costos proviene de dos factores. El primero es una pequeña huella para el arnés combinada con una gestión deliberada de cómo se utilizan las herramientas, incluyendo indicaciones básicas, resultados afinados para la eficiencia y sin sub-agentes ni flujos de trabajo. El segundo factor es que se realiza más trabajo a través de herramientas durante cada turno del modelo. Debido a que el modelo opera de forma asíncrona, el agente puede realizar múltiples llamadas pesadas a herramientas sin gastar tokens en verificar la finalización o esperar.
Cómo funciona el arnés
Cuando Unreal Agent realiza una llamada a una herramienta, registra la entrada del registro de eventos para la herramienta al regresar en el estado «en curso» de inmediato, aunque continúa en segundo plano. La finalización real de una herramienta es lo que agrega su resultado al registro de la sesión y desencadena una llamada a un LLM. Lograr que todo este proceso funcione sin interrumpir la caché fue un interesante desafío de ingeniería por sí solo.
Los resultados de la evaluación comparativa
La prueba de GPT-6 Astra xhigh por Unreal Labs la enfrentó contra Codex y Pi. Los resultados fueron publicados en el sitio web de la compañía.
| Evaluación comparativa | Codex (lb) | Unreal Agent | Pi |
|---|---|---|---|
| Terminal-Bench 4.0 | Codex (lb) | Unreal Agent | Pi |
| SWE-Atlas Codebase QnA | Codex (lb) | Unreal Agent | Pi |
| DeepSWE 1.1 | Codex (lb) | Unreal Agent | Pi |
| Agents’ Last Exam | Codex (lb) | Unreal Agent | Pi |
Empezando
Unreal Labs ha publicado un SDK para Unreal Agent que incluye una biblioteca de Go diseñada para integrarse directamente en su código base, un ejecutable runner similar a claude -p /codex exec, y un runner de benchmarks que funciona con Harbor. Quienes deseen más información pueden contactar a contact@unreallabs.ai.
Los Límites de la API
La documentación de la API de Responses no especifica cómo utilizar dos elementos de resultado de llamada de herramientas dentro de un único contexto, según Unreal Labs. La compañía descubrió que algunos modelos rechazaban tales solicitudes durante las pruebas, y el campo de estado function_call_output parecía no marcar ninguna diferencia en esas situaciones.
El equipo detrás de Unreal Labs ha desarrollado varios productos agentic, y saben de primera mano que los kits de desarrollo de software vienen con gastos ocultos. Gestionar el ciclo de vida del producto, mantener las APIs actualizadas y lidiar con árboles de dependencias son todas tareas que no aparecen en el material promocional de un vendedor. Cualquiera puede verificar los benchmarks e inspeccionar el código de GitHub por sí mismo.
Vea el video en el que se basa la historia en unreallabs.ai.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

