Midterms 2026Wer nach unseren Maßstäben Ihre Stimme verdientZum Leitfaden →
GESCHRIEBEN IN KLAREM DEUTSCH.
CLAY TRIBUNE.
Anzeige

TypeSafes Jev Model ist schnell und günstig – aber niemand prüft, ob er funktioniert. )

Eine Untersuchung von Jev, einem KI-Modell, dessen Konfidenzwerte wenig Trost spenden, wenn die Person hinter der Tür nicht untersucht wird.

Von mitch·3 Min. Lesezeit
A shadowy figure stands before a glowing terminal screen, as though confronting an unseen force behind the door.

Das Internet ist voller Begeisterung für Jev, ein KI-Modell von TypeSafe AI, das typisierte Werte mit Wahrscheinlichkeitsausgaben liefert. Das Unternehmen behauptet, es sei schnell und günstig. Die Frage ist, ob jemand sich überhaupt gefragt hat, ob es tatsächlich funktioniert.

Warum Türen Nicht Funktionieren

Der Autor beginnt mit einer Beschwerde über Türen. In einer Geschichte versagt eine Tür, weil sich ein Körper im Weg befindet. In einer anderen blockieren grob eine Milliarde Dollar Gold den Weg. Der Autor’s Modell von Türen ist einfach: Türen sollten nicht inexplicably „saugen“. Wenn der Charakter „dummes Ding saugt“ murmelt, findet der Autor es urkomisch, obwohl er zugibt, dass vielleicht sein Gehirn das Problem sein könnte.

Jev ist schneller und günstiger als andere Ansätze. Aber der Autor stellt eine praktische Frage: Was bedeutet es, zu wissen, dass Jev funktioniert?

Anzeige

Der Schwierige Teil, Den Niemand Überprüft

Der Autor vergleicht die Verwendung von Jev mit dem Erhalten eines FTP-Kontos, dem lokalen Mounten mit curlftpfs und der anschließenden Verwendung von SVN oder CVS auf dem gemounteten Dateisystem. Man muss trotzdem den schwierigen Teil erledigen. Um zu wissen, ob Jev funktioniert, muss man Tests und eine Wahrheitsprüf-Pipeline erstellen. Wenn man diese hat, ist man schon fast auf dem Weg, seine eigene Lösung zu bauen.

Niemand, der Jev kauft, führt diese Tests durch. Sie geben dem Modell undurchsichtige Fragen und erhalten undurchsichtige Antworten. Sie können das Kästchen „KI-gestützt“ abhaken und vor Freitag versenden. Wenn dies die nachgelagerte Logik unterbricht, zucken sie mit den Schultern und sagen: „Nun, KI macht Fehler“.

Konfidenzwerte Sind Schlimmer Als Nichts

Jev liefert Konfidenzwerte. Der Autor fragt sich, was man damit eigentlich anfangen soll. Man muss wissen, wie gut diese Werte kalibriert sind und wie die Kosten für Unsicherheit aussehen. Jev’s eigene Anzeigen konzentrieren sich auf Benchmark-Werte, nicht auf die Kalibrierung. Die Dokumentation schlägt einen Schwellenwert von 0,5 für „nichts tun“ und einen Schwellenwert von 0,9 für „Hochrisiko-Aktionen“ vor, wobei vermerkt wird, dass Schwellenwerte von der Domäne und der Leistung des Modells abhängen.

Der Autor beschreibt dies als Cargo-Cult-Verhalten im besten Fall und als Ausrede für ein Scheitern im schlimmsten Fall. Das Modell war nur zu 73 % sicher! Das bedeutet, dass das Fehlertbudget 27 % beträgt.

Wer Ist Für Das Scheitern Verantwortlich?

Wenn eine Schaltfläche auf einer Website kaputt geht, erwartet der Autor jemanden, der versteht, warum der Endpunkt fehlschlägt. Die Verantwortlichkeit ist klar definiert, wenn auch undurchsichtig. Mit Jev ist die Erfahrung: „Die dumme Sache ist schrecklich.“ Software fühlt sich bereits launisch an; mehr Ausfälle ändern lediglich die Frustrationsrate.

Der Autor befürchtet, dass „manchmal geht es einfach nicht“ zum akzeptierten Endpunkt von Untersuchungen werden könnte. Das ist bedauerlich, weil LLM-beschleunigte Entwicklung dazu beitragen könnte, einige dieser Probleme zu lösen. Automatisierte Test-Workflows existieren, werden aber aufgrund von fehlender Entwicklungszeit nicht geschrieben.

Die Tragödie der Softwareentwicklung heutzutage besteht darin, dass wir aktiv Systeme aufbauen, bei denen weder der Benutzer noch der Entwickler überprüft, ob sich hinter der Tür überhaupt etwas befindet. Wir zucken einfach mit den Schultern und schließen: „Die dumme Sache ist schrecklich.“

Stadium Aktivität
Einrichtung FTP-Konto besorgen, mit curlftpfs mounten
Alter Workflow SVN oder CVS auf dem gemounteten Dateisystem verwenden
Neuer Workflow Undurchsichtige Fragen an Jev weitergeben, undurchsichtige Antworten erhalten
Testen Build-Bewertungen und eine Ground-Truth-Pipeline erstellen.

Der Autor sorgt sich letztendlich darüber, dass die Branche nicht erklärbare Ausfälle normalisiert. Jev ist schnell und billig, aber niemand überprüft, ob es funktioniert. Die Konfidenzwerte sind keine Lösung. Das Ergebnis jeder Untersuchung ist kein Grundsatz; es ist eine Achselzuckung.

Quelle: „The Normalization of Inexplicable Failures,” ihatethefuture.com.

Das Notizbuch

Das Notizbuch abonnieren.

Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

Wir schicken eine Bestätigungsmail. Jede Ausgabe hat einen Abmeldelink, ein Klick genügt.

Anzeige

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Als Amazon-Partner verdient Clay Tribune an qualifizierten Verkäufen.