Midterms 2026Wer nach unseren Maßstäben Ihre Stimme verdientZum Leitfaden →
GESCHRIEBEN IN KLAREM DEUTSCH.
CLAY TRIBUNE.
Anzeige

Tokens zu billig, um sie zu messen: Warum der Zugang bald KI einschränken wird, nicht die Rechenleistung ()

Ein Entwickler argumentiert, dass der wirtschaftliche Engpass von KI sich von der Rechenleistung auf den Zugang und die Fähigkeiten verlagert, nicht auf Tokens.

Von mitch·4 Min. Lesezeit
A glowing neural network circuit board floats above a city skyline, symbolizing the shifting economics of artificial intelligence.

Der Preis für die Nutzung von maschineller Intelligenz sinkt jährlich um mehrere Größenordnungen, und es gibt keinen Anlass, davon auszugehen, dass dies nicht so weitergeht. Die eigene Analyse der Entwickler prognostiziert, dass LLMs innerhalb des nächsten Jahres oder zweier Jahre in jeden Bereich der Informatik integriert werden – als Infrastruktur, nicht nur als Produkt. Sie gehen davon aus, dass LLMs innerhalb von drei bis sechs Jahren lokal auf Standardhardware mit aktueller Spitzenqualität laufen werden. Und sie glauben, dass Qualität und Zugang der limitierende Faktor für KI-1-Anwendungen sein werden, nicht die reine Anzahl der Token.

Dieser letzte Punkt ist der Kern der Sache. Die Analyse argumentiert, dass der Engpass sich von der Frage verschiebt, wie viel Rechenleistung man kaufen kann, hin zur Frage, wie viel Können man sich leisten kann.

Die Kosten für ein Token

LLMs werden pro Token berechnet. Ein Token ist ein Fragment eines Wortes; es werden etwa 1,5 Token benötigt, um ein ganzes Wort darzustellen. Jedes Token, das ein Modell liest, kostet Geld, und jedes Token, das es ausgibt, kostet Geld. Der Modellanbieter – Anthropic oder OpenAI – berechnet einen festen Betrag für jedes Token.

Anzeige

Aber die Analyse macht eine wichtige Unterscheidung. Die Kosten pro Token für Modelle der Spitzenklasse sinken nicht durchweg. Kleinere Modelle mögen pro Token weniger kosten, verwenden aber insgesamt mehr Token für dieselbe Aufgabe, da sie mehr nachdenken oder ihre ersten Entwürfe korrigieren müssen. Entscheidend ist die Kosten für die Erledigung einer bestimmten Aufgabe, nicht der Rohpreis jedes Fragments.

Die untenstehende Grafik zeigt die „Pareto-Grenze“ der Kosten pro Aufgabe im aktuellen Stand. Die Y-Achse verfolgt die Qualität des Modells, gemessen anhand einer Reihe von Benchmarks. Die X-Achse verfolgt die Kosten für die Erledigung dieser Benchmarks. Die Grafik ist in einem logarithmischen Maßstab dargestellt, sodass größere Y-Achsen- und kleinere X-Achsen-Zahlen besser sind.

Im oberen rechten Bereich befindet sich Claude Fable-5.1, teuer und intelligent. Im mittleren linken Bereich befindet sich GPT-5.6 Luna, günstig und weniger intelligent. Modelle unterhalb der gestrichelten Linie sind im Grunde nicht erstrebenswert.

Vergleichen Sie das mit der Grafik für 2025. Die Y-Achse (Intelligenz) blieb etwa gleich, mit weniger Einbruch am günstigen Ende. Die X-Achse (Kosten) wurde um zwei Größenordnungen günstiger.

Hardware und Software zusammen

Die Analyse stützt sich auf zwei getrennte Trends, die in die gleiche Richtung verlaufen. Erstens die Hardware: GPUs werden mit jeder Generation exponentiell effizienter. Der folgende Graph zeigt die Energieeffizienz der GPU selbst, wobei die X-Achse die Zeit und die Y-Achse die Effizienz abbildet. Eine gerade Linie auf diesem logarithmischen Graph bedeutet, dass sich die Effizienz etwa alle zwei Jahre verdoppelt, eine Rate, die die Analyse für nicht seit dem Moore’schen Gesetz in den 1960er Jahren verzeichnet.

Zweitens die Software: Inferenz-Engines verbessern sich rasant. vLLM, eine Open-Source-Inferenz-Engine, verzeichnete in nur 15 Monaten eine Effizienzsteigerung von 40 %, von Version 0.5.4 im September 2024 bis Version 0.11.1 im Dezember 2025. NVIDIA zeigte Effizienzsteigerungen von bis zu 50 % auf seinem MLPerf-Stack von 2.0 auf 2.1. Intel zeigte eine Steigerung des Durchsatzes um das 2,4-fache zwischen MLPerf 6.0 und 6.1.

Die Analyse weist darauf hin, dass sich die Effizienz der Arbeitslasten schneller verbessert als bei der Offline-Inferenz, und dass die Hardware unverändert bleibt, während sich die Software ändert.

Was das für KI bedeutet

Die Analyse prognostiziert, dass Qualität und Zugang zum begrenzenden Faktor für KI-Anwendung werden, nicht die reine Anzahl der Token. Das ist eine bemerkenswerte Behauptung, und sie stützt sich auf die oben genannten Beweise: fallende Tokenpreise, effizientere Hardware und schnellere Inferenz-Engines.

Die Position der Analyse ist, dass sich der Engpass von der Rechenkapazität zur menschlichen Fähigkeit verlagert. Die Werkzeuge werden billiger und schneller, aber die Fähigkeit, sie effektiv zu nutzen, wächst nicht im gleichen Tempo.

Die Reihenfolge der Veränderung

Der Zeitplan der Analyse lässt sich in drei Phasen unterteilen:

  1. Das nächste Jahr oder zwei: LLMs werden in jeden Bereich der Computertechnik integriert, und zwar als Infrastruktur und nicht nur als Produkt.
  2. Die nächsten drei bis sechs Jahre: LLMs laufen lokal mit aktueller Spitzenqualität auf Standard-Hardware.
  3. Der Übergang zu Qualität und Zugang als begrenzendem Faktor für KI-Anwendung.

Jede Phase wird separat dargestellt, nicht als eine Kette, in der eine der anderen folgt. Die Analyse prognostiziert, dass die Hardware- und Software-Verbesserungen weiter vorangetrieben werden und dass die Zugangslücke infolgedessen wachsen kann.

Die Analyse stützt sich auf spezifische und quantitative Beweise. Das Diagramm der GPU-Effizienz, die Veröffentlichungsdaten von vLLM, die MLPerf-Zahlen – all das weist in die gleiche Richtung. Die Aussage der Analyse ist, dass die Zukunft der KI nicht davon abhängt, wer sich die meiste Rechenleistung leisten kann, sondern davon, wer den besten Zugang leisten kann.

Das ist eine bemerkenswerte Prognose. Ob sie sich bewahrheitet, hängt von den nächsten Jahren der Veröffentlichungen und Benchmarks ab.

Quellenmaterial: „Tokens zu billig, um sie zu messen“, jyn.dev.

Das Notizbuch

Das Notizbuch abonnieren.

Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

Wir schicken eine Bestätigungsmail. Jede Ausgabe hat einen Abmeldelink, ein Klick genügt.

Anzeige

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Als Amazon-Partner verdient Clay Tribune an qualifizierten Verkäufen.