Según Johannes Hötter, VP de Crecimiento, y Marko Rosenmüller, PhD, Líder Técnico de IA, en Privatemode, un LLM ahora puede producir decisiones escritas en una sola pasada hacia adelante, igualando la precisión y el ritmo de Jev. La técnica transforma GLM-5.3-Flash en un modelo de toma de decisiones similar a Jev sin requerir ningún ajuste fino del LLM subyacente.
En principio, el enfoque es sencillo, aunque los detalles específicos puedan demostrar lo contrario. En lugar de solicitar que el LLM produzca una respuesta JSON completa, los investigadores diseñan indicaciones que obligan al modelo a elegir un índice de una lista numerada de opciones. Durante una ejecución, el LLM produce probabilidades para cada opción, que el sistema lee directamente sin tener que analizar una cadena de tokens generada. Esto produce una decisión junto con una puntuación de confianza, lista para su implementación a gran escala.
Cómo Funciona la Indicación
El punto principal es que un LLM nunca produce texto por sí solo. En cambio, proporciona una distribución de probabilidad en todo su vocabulario de tokens cuando se le presenta una indicación. Durante la creación de texto, se elige el token con la probabilidad más alta como el siguiente token en la secuencia. Este método se vuelve costoso y lento cuando todo lo que necesitas hacer es completar un puñado de campos dentro de un objeto JSON.
Los investigadores reconocieron que la tarea del LLM no requería predecir el objeto JSON completo, ya que el formato de la salida estaba predeterminado. Ellos diseñaron indicaciones que incorporaban el estado actual, la pregunta en cuestión y una lista de opciones con nombre, cada una asignada a un número de índice. La instrucción dirigió al modelo a responder con un choice_index seguido de su número de índice correspondiente.
La indicación finaliza con un choice_index, lo que obliga la salida inicial del modelo a señalar un índice dentro del conjunto de opciones disponibles. A partir de ahí, el sistema examina las probabilidades asociadas con cada índice de opción en ese punto, las ajusta en todo el conjunto de opciones y se decide por la que tiene la probabilidad más alta.
Por Qué Esto Importa para la Toma de Decisiones
Cuando se trata de resolver tickets de soporte o decidir qué equipo debe encargarse de ellos, la mayoría del software recurre a un LLM para el juicio. Lo mismo ocurre con las tareas de revisión de contratos, como determinar si una cláusula pertenece a la sección de responsabilidad. En ambos escenarios, el software espera que la salida del LLM se formatee como JSON y se restrinja a un conjunto fijo de posibles respuestas.
El método típico funciona bien cuando las instrucciones son correctas, pero avanza a un ritmo deliberado y cuesta dinero real. Cada elección obliga al LLM a componer un objeto JSON completo desde cero, mientras que un modelo de razonamiento podría deliberar sobre cientos de tokens antes de decidir una respuesta. Los puntajes de confianza no forman parte de la salida a menos que la solicitud específicamente los pida.
Jev y Laya son modelos de toma de decisiones especializados construidos en torno a este diseño. Toman un fragmento de estado junto con una lista de opciones con nombre y devuelven tanto la opción seleccionada como un puntaje de confianza para cada una. El nuevo enfoque está destinado a ofrecer las mismas cualidades utilizando un LLM ordinario en su lugar.
Lo que GLM-5.3-Flash ofrece
GLM-5.3-Flash se ejecutó a través de Privatemode durante la fase de pruebas, y su rendimiento se evaluó en comparación con un punto de referencia construido a partir de conjuntos de datos públicos. Los investigadores demostraron que la configuración coincide con Jev de TypeSafe en términos de precisión y velocidad de toma de decisiones.
Este acuerdo permite realizar juicios tipificados sobre imágenes, algo que Jev no puede hacer. Esto constituye una característica adicional en lugar del objetivo principal.
Los detalles técnicos
El equipo empleó vLLM, la biblioteca detrás de GLM-5.3-Flash, para llevar a cabo el método. Accedieron al endpoint /chat/completions mientras configuraban continue_final_message y add_generation_prompt en falso. Estas configuraciones permitieron que el modelo continuara a partir de donde ya había comenzado la respuesta del asistente en el paso dos en lugar de abrir uno nuevo, y permitieron enviar imágenes junto con el texto.
Varios detalles específicos del modelo importaron para la implementación:
- allowed_token_ids se puede utilizar para limitar el vocabulario de salida del LLM a solo las opciones permitidas. Reduce cada otro token a -inf.
- top_logprobs no es suficiente para el paso tres. Informa la distribución antes de que se aplique la restricción, por lo que los tokens de formato como un espacio inicial ocupan los primeros lugares y algunas opciones se eliminan de la lista.
- vLLM’s logprob_token_ids resuelve esto al devolver la probabilidad logarítmica de exactamente los identificadores de token que solicita.
- La biblioteca obtiene los identificadores de token del servidor, lo que simplifica su uso con cualquier modelo. Enviar un prompt a /completions con echo devuelve su tokenización exacta por el modelo que está sirviendo.
Los investigadores hicieron que el código estuviera disponible para todos, publicándolo en el repositorio edgelesssys/privatemode-decisions. Esa biblioteca de Python gestiona el oráculo de token, la construcción de prompts, el enmascaramiento y la renormalización contra cualquier punto final compatible con vLLM.
Probarlo Usted Mismo
Un playground en funcionamiento opera GLM-5.3-Flash con la configuración aplicada en Privatemode, lanzado directamente desde su ventana de navegador. Elija entre varios ejemplos, como una factura escaneada o una pregunta relacionada con su hora local, o componga sus propias consultas y adjunte imágenes.
Una respuesta generalmente se devuelve como un conjunto de probabilidades en sus posibles respuestas, a menudo llegando en unos pocos cientos de milisegundos. La visualización proporciona una cifra de probabilidad para cada opción junto con una indicación de certeza.
El sistema está encriptado de extremo a extremo, por lo que lo que escribe se mantiene privado.
Lo Que Esto Significa para el Despliegue de LLM
Los equipos ahora pueden usar un LLM como motor de decisiones sin tener que pagar por el ajuste fino o sufrir la latencia de la generación completa de tokens. El enfoque admite GLM-5.3-Flash y vLLM, y la biblioteca gestiona la tokenización entre bastidores para que los usuarios no necesiten gestionarla ellos mismos.
Marca un paso adelante genuino para el software que debe llegar a un gran número de conclusiones rápidamente, particularmente cuando los resultados potenciales están fijos desde el principio. El procesamiento de imágenes se presenta como un beneficio adicional, dado que Jev no tiene ninguna capacidad de manejo de imágenes.
Aquellos que estén interesados en probarlo pueden lanzar el playground ellos mismos, o pueden integrar la biblioteca en su propio flujo de trabajo de implementación.
«“Turning GLM-5.3-Flash into a Jev-like decision model,” privatemode.ai.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

