OpenAI hat eine neue Rangliste auf drivingbench.com veröffentlicht, und die Zahlen zeigen, dass GPT-6 Astra die Fähigkeit erworben hat, ein echtes Auto zu fahren. Der Test ist einfach: Modelle erhalten die Kontrolle über Lenkung, Beschleuniger und Bremsen eines Toyota Corolla und werden dann gebeten, einen festen Kegelparcours zu absolvieren. GPT-6 Astra ist das einzige Modell, das 100 % Fortschritt bei seinem besten Lauf erreicht hat.
Die Rangliste ermöglicht es jedem Modell, bis zu dreimal in einem kontinuierlichen Chat zu versuchen. Jeder Lauf wird anhand der zurückgelegten Strecke, der Geschwindigkeit, der Endzeit und der ausgegebenen Befehle bewertet, wobei die Kosten zu Listpreisen erfasst werden. Die Ergebnisse zeigen einen klaren Abstand zwischen GPT-6 Astra und dem Rest des Feldes.
Die Zahlen hinter den Parcours
Der beste Lauf von GPT-6 Astra umfasste den gesamten Parcours bei 100 % Fortschritt und endete in 5:22. Seine anderen beiden Versuche erreichten ebenfalls 100 % Fortschritt. Die Rangliste zeigt Endzeiten nur für abgeschlossene Läufe an, sodass die einzelnen Zeiten für diese beiden Läufe nicht angezeigt werden.
Claude Fable 5.1 kam unter den Zweitplatzierten am nächsten heran und erreichte 45 % Fortschritt bei seinem besten Lauf. Seine verbleibenden zwei Versuche erreichten nur 9 % und 10 % Fortschritt. Claude Fable 5.1 beendete den Parcours nie und beendete jeden Lauf, bevor er die Zielzone erreichte.
Grok 4.6 schnitt schlechter ab und erreichte 11 % Fortschritt bei seinem besten Lauf und 8 % bei seinem zweiten Versuch. Sein dritter Versuch erreichte nur 10 % Fortschritt. Wie Claude Fable 5.1 beendete Grok 4.6 den Parcours nie.
GPT-5.6 Sol schnitt aller Versuche am schlechtesten ab und erreichte über alle drei Versuche hinweg einen Fortschritt von 6 %.
Was die Rangliste zeigt
Die Rangliste ordnet die Modelle nach ihrem besten Einzelversuch ein, nicht nach der durchschnittlichen Leistung über alle drei Läufe. Das bedeutet, dass ein Modell gut abschneiden kann, auch wenn seine anderen beiden Versuche scheitern.
| Modell | Bester Fortschritt | Endzeit |
|---|---|---|
| GPT-6 Astra | 100% | 5:22 |
| Claude Fable 5.1 | 45% | DNF |
| Grok 4.6 | 11% | DNF |
| GPT-5.6 Sol | 6% | DNF |
DNF steht für „did not finish“, was bedeutet, dass das Modell seinen Lauf beendete, bevor es die Ziellinie erreichte. Die Tabelle zeigt, dass GPT-6 Astra das einzige Modell ist, das 100 % Fortschritt erreicht hat.
Funktionsweise des Tests
Der Parcours selbst ist ein fester Kegelpfad, und das Bewertungssystem belohnt das Fahren nahe der Mittellinie. Ein Modell erhält Punkte für die zurückgelegte Strecke, während es innerhalb von 4 Metern der Mittellinie bleibt, ausgedrückt als Anteil der Mittellinienlänge bis zur Ziellinie. Eine Kollision beendet den Versuch sofort, und die Punktzahl wird auf dem Fortschrittsstadium vor dem Aufprall fixiert.
Die Geschwindigkeit wird von dem ersten akzeptierten Bewegungsbefehl bis zum Ende des Versuchs berechnet. Die Endzeit wird von dem ersten akzeptierten Bewegungsbefehl bis zum Ende des Versuchs gemessen und wird nur für abgeschlossene Läufe angezeigt.
Befehle werden als akzeptierte Bewegungsbefehle und Stoppbefehle während des Versuchs erfasst. Kosten werden zu Listpreisen summiert, einschließlich der Analyse nach jedem Versuch.
Die Leistungsdifferenz (The Performance Gap)
Die Bestenliste zeigt eine deutliche Trennung zwischen dem führenden Modell und allen anderen. Hier die Rangliste der Modelle nach bestem Fortschritt: (The leaderboard shows a clear separation between the top performer and everyone else. Here is how the models rank by best progress:)
- GPT-6 Astra — 100 % (GPT-6 Astra — 100%)
- Claude Fable 5.1 — 45 % (Claude Fable 5.1 — 45%)
- Grok 4.6 — 11 % (Grok 4.6 — 11%)
- GPT-5.6 Sol — 6 % (GPT-5.6 Sol — 6%)
Der Fortschritt von GPT-6 Astra von 100 % entspricht dem erfolgreichen Abschluss eines kompletten Parcours. Claude Fable 5.1 erreichte 45 % beim besten Lauf. Grok 4.6 erreichte maximal 11 %, und GPT-5.6 Sol kam nie über 6 % hinaus. (GPT-6 Astra’s 100% progress is a full course completion on its best run. Claude Fable 5.1 reached 45% on its best run. Grok 4.6 topped out at 11%, and GPT-5.6 Sol never got past 6%.)
Was das für KI bedeutet (What This Means for AI)
Ein Auto ist eine komplexe Maschine mit vielen beweglichen Teilen, und das Fahren erfordert ständige Aufmerksamkeit auf Geschwindigkeit, Richtung und Hindernisse. Ein Modell, das einen Kegelparcours ohne Zusammenbruch beenden kann, hat echte Geschicklichkeit bewiesen, nicht nur rohe Kraft.
Die Bestenliste zeigt außerdem, dass die Lücke zwischen den führenden Modellen und dem Rest des Feldes erheblich ist. GPT-6 Astra erreichte 100 % Fortschritt, während das nächstbeste Modell nur 45 % erreichte. Das ist ein großer Abstand bei einem Test, der die tatsächliche Leistung misst. (The leaderboard also shows that the gap between top performers and the rest of the field is significant. GPT-6 Astra finished at 100% progress, while the next-best model reached only 45%. That is a large margin in a test that measures actual performance.)
Die Ergebnisse deuten darauf hin, dass die Fahrkünste nicht gleichmäßig über KI-Modelle verteilt sind. Einige Modelle können die Aufgabe bewältigen, während andere stark zu kämpfen haben. Die Bestenliste gibt nicht an, welche Modelle aus technischen Gründen und welche aufgrund mangelnder Fähigkeiten versagt haben, aber das Muster ist konsistent: GPT-6 Astra gelingt es, und die anderen scheitern. (The results suggest that driving ability is not evenly distributed across AI models. Some models can handle the task, while others struggle badly. The leaderboard does not say which models failed for technical reasons and which failed for lack of skill, but the pattern is consistent: GPT-6 Astra succeeds, and the rest fail.)
Die Straße vor uns (The Road Ahead)
Die Wertung ist ein Spiegelbild der aktuellen Leistung, aber kein endgültiges Urteil. Modelle verbessern sich im Laufe der Zeit, und neuere Versionen können die Lücke verkleinern oder vergrößern.
Vorläufig ist die Botschaft einfach: GPT-6 Astra hat die Fähigkeit erlangt, ein echtes Auto zu fahren, und der Test auf drivingbench.com beweist dies.
Die Wertung ist für alle einsehbar, und die Videospuren zeigen genau, wie jedes Modell die Strecke ansteuerte. Die Läufe von GPT-6 Astra sind besonders sehenswert, da es das einzige Modell ist, das 100 % Fortschritt erreicht hat.
Der Vergleich ist eindeutig, und die Schlussfolgerung ist klar: GPT-6 Astra ist das einzige Modell auf dieser Wertung, das 100 % Fortschritt erreicht hat.
Quelle: „GPT-6 Astra hat die Fähigkeit erlangt, ein Auto zu fahren“, drivingbench.com.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

