Laut Johannes Hötter, VP Growth, und Marko Rosenmüller, PhD, Technical Lead AI, bei Privatemode, kann ein LLM nun getippte Entscheidungen in einem einzigen Durchlauf rendern, was der Präzision und dem Tempo von Jev entspricht. Die Technik transformiert GLM-5.3-Flash in ein Jev-ähnliches Entscheidungsmodell, ohne dass eine Feinabstimmung des zugrunde liegenden LLM erforderlich ist.
Grundsätzlich ist der Ansatz unkompliziert, auch wenn die Details kompliziert sein mögen. Anstatt das LLM aufzufordern, eine vollständige JSON-Antwort zu erstellen, entwerfen die Forscher Prompts, die das Modell dazu zwingen, einen Index aus einer nummerierten Liste von Optionen auszuwählen. Während eines Durchlaufs erzeugt das LLM Wahrscheinlichkeiten für jede Option, die das System dann direkt liest, ohne einen generierten Token-String parsen zu müssen. Dies ergibt eine Entscheidung, die mit einem Konfidenzwert versehen ist und bereit für den Einsatz in großem Umfang ist.
Wie der Prompt funktioniert
Der Hauptpunkt ist, dass ein LLM niemals eigenständig Text produziert. Stattdessen liefert es bei der Präsentation eines Prompts eine Wahrscheinlichkeitsverteilung über sein gesamtes Vokabular von Token. Während der Textgenerierung wird das Token mit der höchsten Wahrscheinlichkeit als nächstes Token in der Sequenz ausgewählt. Diese Methode wird kostspielig und langsam, wenn man nur ein paar Felder innerhalb eines JSON-Objekts ausfüllen muss.
Die Ermittler erkannten, dass die Aufgabe des LLM nicht die Vorhersage des gesamten JSON-Objekts erfordert, da das Ausgabeformat vorgegeben war. Sie entwickelten Prompts, die den aktuellen Zustand, die Frage und eine Liste benannter Optionen enthalten, die jeweils eine Indexnummer zugewiesen wurde. Die Anweisung wies das Modell an, mit einem choice_index gefolgt von der entsprechenden Indexnummer zu antworten.
Der Prompt schließt mit einem choice_index ab, der zwingt, dass die anfängliche Ausgabe des Modells auf einen Index innerhalb des Sets verfügbarer Optionen verweist. Von dort aus untersucht das System die Wahrscheinlichkeiten, die jedem Optionsindex an diesem Punkt zugeordnet sind, passt sie über den gesamten Satz von Optionen an und entscheidet sich für die mit der höchsten Wahrscheinlichkeit.
Warum dies für die Entscheidungsfindung wichtig ist
Wenn es darum geht, Support-Tickets zu lösen oder zu entscheiden, welches Team sie bearbeiten sollte, greifen die meisten Softwarelösungen für Urteile auf ein LLM zurück. Das gilt auch für Aufgaben der Vertragsprüfung, wie beispielsweise die Feststellung, ob ein bestimmter Satz im Haftungsbereich hingehört. In beiden Szenarien erwartet die Software, dass die Ausgabe des LLMs im JSON-Format vorliegt und auf eine feste Menge möglicher Antworten beschränkt ist.
Die typische Methode funktioniert gut, wenn die Anweisungen korrekt sind, bewegt sich jedoch in einem gemächlichen Tempo und kostet echtes Geld. Jede Wahl zwingt das LLM, ein komplettes JSON-Objekt von Grund auf neu zu erstellen, während ein Reasoning-Modell hunderte von Token überlegen könnte, bevor es sich auf eine Antwort festlegt. Konfidenzwertungen sind nicht Teil der Ausgabe, es sei denn, die Anfrage fragt explizit danach.
Jev und Laya sind spezialisierte Entscheidungsmodelle, die auf diesem Design basieren. Sie nehmen einen Zustand sowie eine Liste benannter Optionen entgegen und geben sowohl die ausgewählte Option als auch eine Konfidenzwertung für jede Option zurück. Der frische Ansatz soll die gleichen Eigenschaften unter Verwendung eines gewöhnlichen LLMs bieten.
Was GLM-5.3-Flash bietet
GLM-5.3-Flash wurde während der Testphase in Privatemode ausgeführt, und seine Leistung wurde anhand eines Benchmarks beurteilt, der aus öffentlichen Datensätzen aufgebaut wurde. Die Forscher demonstrierten, dass diese Einrichtung sowohl in Bezug auf die Entscheidungsgenauigkeit als auch auf die Geschwindigkeit mit TypeSafes Jev übereinstimmt.
Diese Anordnung ermöglicht typisierte Urteile über Bilder, etwas, das Jev nicht kann. Es stellt eine zusätzliche Funktion dar und ist nicht das primäre Ziel.
Die technischen Details
Das Team verwendete vLLM, die Bibliothek hinter GLM-5.3-Flash, um die Methode durchzuführen. Sie greiften auf den Endpunkt /chat/completions zu und setzten continue_final_message und add_generation_prompt auf false. Diese Konfigurationen ermöglichten es dem Modell, dort fortzufahren, wo die Antwort des Assistenten bereits im zweiten Schritt begonnen hatte, anstatt eine neue zu öffnen, und sie erlaubten das Senden von Bildern zusammen mit dem Text.
Mehrere modellspezifische Details waren für die Implementierung relevant:
- allowed_token_ids kann verwendet werden, um das Ausgabe-Vokabular des LLMs auf nur zulässige Optionen zu beschränken. Es verwirft jedes andere Token auf -inf.
- top_logprobs ist nicht ausreichend für Schritt drei. Es meldet die Verteilung vor der Einschränkung, sodass Formatierungs-Token wie ein führender Leerzeichen die obersten Plätze einnehmen und einige Optionen von der Liste fallen.
- vLLM’s logprob_token_ids löst dies, indem es die Log-Wahrscheinlichkeit für genau die von Ihnen angeforderten Token-IDs zurückgibt.
- Die Bibliothek bezieht die Token-IDs vom Server, was es einfach macht, sie mit jedem Modell zu verwenden. Das Senden einer Eingabeaufforderung an /completions mit echo gibt deren genaue Tokenisierung durch das tatsächlich verwendete Modell zurück.
Die Forscher haben den Code für alle verfügbar gemacht und ihn im Repository edgelesssys/privatemode-decisions veröffentlicht. Diese Python-Bibliothek behandelt Token-Oracle, Eingabeaufforderungsaufbau, Maskierung und Renormalisierung gegen jeden vLLM-unterstützten Endpunkt.
Testen Sie es selbst
Eine laufende Spielwiese betreibt GLM-5.3-Flash mit der auf Privatemode angewendeten Einrichtung, die direkt aus Ihrem Browserfenster gestartet wird. Wählen Sie aus verschiedenen Beispielen aus, wie z. B. eine gescannte Rechnung oder eine Frage, die an Ihre lokale Zeit gebunden ist, oder erstellen Sie eigene Abfragen und fügen Sie Bilder hinzu.
Eine Antwort liefert in der Regel eine Reihe von Wahrscheinlichkeiten über ihre möglichen Antworten zurück, oft innerhalb weniger hundert Millisekunden. Die Anzeige gibt eine Wahrscheinlichkeit für jede Option zusammen mit einer Angabe der Sicherheit an.
Das System ist Ende-zu-Ende-verschlüsselt, sodass das, was Sie tippen, privat bleibt.
Was dies für die LLM-Bereitstellung bedeutet
Teams können jetzt ein LLM als Entscheidungsmaschine verwenden, ohne für Feinabstimmungen bezahlen oder die Latenz einer vollständigen Token-Generierung in Kauf nehmen zu müssen. Der Ansatz unterstützt GLM-5.3-Flash und vLLM, und die Bibliothek kümmert sich im Hintergrund um die Tokenisierung, sodass Benutzer diese nicht selbst verwalten müssen.
Es stellt einen echten Schritt nach vorne für Software dar, die eine große Anzahl von Schlussfolgerungen schnell ziehen muss, insbesondere wenn die potenziellen Ergebnisse von Anfang an festgelegt sind. Die Bildverarbeitung kommt als zusätzlicher Vorteil hinzu, da Jev überhaupt keine Bildverarbeitungsfunktion besitzt.
Wer daran interessiert ist, es auszuprobieren, kann die Spielwiese selbst starten oder die Bibliothek stattdessen in seine eigene Bereitstellungspipeline integrieren.
„Turning GLM-5.3-Flash into a Jev-like decision model“, privatemode.ai.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

