Mercury 2.5 ist ein Reasoning-Modell, das von Inception entwickelt wurde, und es bietet eine reine Ausgabegeschwindigkeit, die es von seinen Mitbewerbern abhebt. Das Modell generiert Text mit 780,8 Token pro Sekunde, was ein echtes Maß dafür ist, wie schnell ein Modell Informationen verarbeitet. Diese Zahl stammt aus einer neuen Analyse der Modellleistung und kommt zu einem Zeitpunkt, an dem die KI-Branche voller Ankündigungen und Behauptungen ist.
Die Analyse von artificialanalysis.ai stammt von einem Benchmark namens Artificial Analysis Intelligence Index, der Modelle in den Bereichen Reasoning, Wissen, Mathematik und Programmierung misst. Mercury 2.5 erzielt auf diesem Index eine Punktzahl von 12, was unterdurchschnittlich im Vergleich zu vergleichbaren Modellen ist. Seine Vergleichsgruppe mit dem Median liegt bei 13.
Die Geschwindigkeitszahlen
Mercury 2.8 generiert Ausgaben mit 780,8 Token pro Sekunde, laut Inceptions API. Das liegt deutlich über dem Median von 111,9 Token pro Sekunde für Reasoning-Modelle in einer ähnlichen Preisklasse.
Die Zeit bis zum ersten Token – die Latenz zwischen der Frage und dem ersten Wort – beträgt 3,06 Sekunden. Das ist etwas höher als der Median von 2,21 Sekunden für Modelle in derselben Kategorie.
Hier ist, wie sich die drei Kernzahlen verhalten:
| Metrik | Mercury 2.5 | Median |
|---|---|---|
| Ausgabegeschwindigkeit | 780,8 Token pro Sekunde | 111,9 Token pro Sekunde |
| Zeit bis zum ersten Token) | 3,06 Sekunden) | 2,21 Sekunden) |
| Intelligenzwert) | 12 | 13 |
Was das Modell kann)
Mercury 2.5 ist ein Reasoning-Modell, das bedeutet, es verwendet ausgedehntes Denken oder Chain-of-Thought-Reasoning, um komplexe Probleme zu bearbeiten, bevor es eine Antwort liefert. Es unterstützt Texteingabe und Textausgabe. Es verarbeitet keine Bilder. Es ist nicht multimodal. Es hat ein Kontextfenster von 260k Token, das bestimmt, wie viel Text und Gesprächshistorie das Modell in einer einzigen Anfrage verarbeiten kann.
Das Modell wurde am 8. September 2026 veröffentlicht. Es ist proprietär, was bedeutet, dass die Modellgewichte nicht öffentlich verfügbar sind. Inception hat die Modellgröße oder die Parameteranzahl nicht offengelegt.
Der Intelligenztest)
Bei der Auswertung im Intelligence Index erzeugte Mercury 2.5 35 Millionen Ausgabetoken. Das ist besser als der Durchschnitt im Vergleich zum Median von 85 Millionen Token. Die 35 Millionen Ausgabetoken des Modells sind relativ prägnant, was ein bemerkenswertes Ergebnis für ein Modell ist, das außerdem bemerkenswert schnell ist.
Der Intelligence Index ist ein zusammengesetzter Benchmark, der Modelle in den Bereichen Reasoning, Wissen, Mathematik und Programmierung testet. Er umfasst spezifische Subtests, wie z. B. professionelles Dokumenten-Reasoning, Physik-Reasoning, quantitative Analyse in Tabellenkalkulationen und Dokumenten sowie medizinisches Long-Context-Reasoning.
Mercury 2.5 ist über eine API bei einem Anbieter verfügbar. Die Preisgestaltung beträgt 0,25 US-Dollar pro 1 Million Eingabetoken und 0,75 US-Dollar pro 1 Million Ausgabetoken, basierend auf Inceptions API. Bei einer gemischten Rate – einem Verhältnis von 7:2:1 Cache-Treffer/Eingabe/Ausgabe – ergeben sich 0,14 US-Dollar pro 1 Million Token. Die Preisgestaltung kann je nach Anbieter variieren.
Das Preisbild
1) Die Preisgestaltung ist der Punkt, an dem Mercury 2.5 am stärksten überzeugt. Bei 0,25 US-Dollar pro 1 Million Eingabetoken liegt das Modell im Medianbereich für Reasoning-Modelle seiner Kategorie. Der Medianpreis für Ausgabetoken liegt bei 0,92 US-Dollar.
2) Im Durchschnitt kostet die Auswertung von Mercury 2.5 anhand des Intelligence Index 0,06 US-Dollar pro Aufgabe. Das ist ein geringer Betrag und spiegelt die moderaten Preise des Modells insgesamt wider.
3) Das Modell ist außerdem bemerkenswert schnell und relativ prägnant, was eine Kombination ist, die für Nutzer wichtig ist, die schnelle Antworten benötigen und keine übermäßigen Ausgaben zahlen möchten. Die Analyse beschreibt das Modell als gut bepreist im Vergleich zu anderen Modellen ähnlicher Kosten.
4) Die Kompromisse
5) Jedes Modell hat eine Schwäche, und Mercury 2.5 ist keine Ausnahme. Sein Intelligenzwert von 12 liegt unter dem Durchschnitt im Artificial Analysis Intelligence Index. Das ist der Kompromiss für seine Geschwindigkeit und seinen Preis.
6) Die Latenz des Modells von 3,06 Sekunden ist etwas höher als der Median von 2,21 Sekunden. Das bedeutet, dass die erste Antwort länger dauert, obwohl die Quelle nicht beschreibt, wie sich nachfolgende Token verhalten.
7) Das 260k-Token-Kontextfenster des Modells ist großzügig, aber nicht unbegrenzt. Nutzer, die sehr lange Verläufe referenzieren müssen, werden dieses Limit irgendwann erreichen.
8) Bewertung der Kernmetriken
9) Die drei Metriken, die Mercury 2.5 definieren, sind Ausgabegeschwindigkeit, Latenz und Intelligenzwert. Hier ist die Bewertung im Vergleich zum Median für Reasoning-Modelle in einer ähnlichen Preiskategorie:
- 10) Ausgabegeschwindigkeit — 780,8 Token pro Sekunde gegenüber einem Median von 111,9 Token pro Sekunde. Deutlich überdurchschnittlich.
- 11) Latenz — 3,06 Sekunden gegenüber einem Median von 2,21 Sekunden. Etwas höher als der Durchschnitt.
- 12) Intelligenzwert — 12 gegenüber einem Median von 13. Unterdurchschnittlich.
Warum das wichtig ist ()
Die Geschwindigkeit eines Modells ist nicht nur eine Funktion. Sie bestimmt, wie schnell eine Anfrage beantwortet werden kann, wie rasch ein Workflow voranschreitet und wie lange ein Benutzer auf eine Antwort warten muss. Ein schnelles Modell kann ein Gespräch am Laufen halten, während ein langsames Modell es zum Stillstand bringen kann. ()
Die Zahl von 780,8 Token pro Sekunde ist ein reales Maß für die Rechenleistung. Sie sagt Ihnen, wie viel Text das Modell pro Sekunde ausgeben kann, was eine praktische Zahl für alle ist, die ein System darum herum aufbauen. ()
Das Endergebnis ()
Mercury 2.5 ist ein solides, preiswertes Reasoning-Modell, das zudem außergewöhnlich schnell ist. Sein Intelligenzwert von 12 liegt unterdurchschnittlich, aber seine Ausgabegeschwindigkeit von 780,8 Token pro Sekunde und seine Evaluierungskosten von 0,06 US-Dollar pro Aufgabe bieten ein starkes Wertversprechen. ()
Das Modell ist über eine API bei einem Anbieter verfügbar, und sein Eingabepreis von 0,25 US-Dollar entspricht dem Median für seine Kategorie. Die Latenz von 3,06 Sekunden ist zwar ein gewisses Problem, aber die Kombination aus Geschwindigkeit, Preis und Ausgabewirtschaftlichkeit macht es zu einer überzeugenden Option für Benutzer, die schnell Antworten benötigen, ohne einen Aufpreis zu zahlen. ()
Für alle, die auf der Suche nach einem Reasoning-Modell sind, verdient Mercury 2.5 eine Prüfung. Die Zahlen sind real, die Preisgestaltung ist fair, und die Geschwindigkeit ist eine Zahl, die ins Auge fällt. ()
Die leise Zahl – 780,8 Token pro Sekunde – ist die Geschichte. ()
Quellenmaterial: „Mercury 2.5 LLM erreicht 770 Token pro Sekunde“, artificialanalysis.ai. ()
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

