Die besten KI-Sprachmodelle nach Qualität

Sprachmodelle für Chat, Texte, Code und logisches Denken, verglichen nach der Qualität, für die Menschen in der Arena stimmen, dem Preis für 1 Mio. Token und der Qualität pro Dollar.

Die besten KI-Sprachmodelle nach Qualität

Sortiert nach Arena-Wertung, höchste zuerst. Modelle ohne Arena-Wertung folgen nach Preis.

Median der Arena-Wertungen hier: 1'442

Die besten KI-Sprachmodelle nach Qualität
01Arena1'494±4 · 61'128 Stimmen$ 12.00 / 1 Mio. Token$ 6.00 Eingabe · $ 30.00 Ausgabe4 Pkt./$+52 über MedianTesten
02
Gemini 3.1 Pro
Google DeepMind
Arena1'487±3 · 106'951 Stimmen$ 5.40 / 1 Mio. Token$ 2.40 Eingabe · $ 14.40 Ausgabe8 Pkt./$+45 über MedianTesten
03
GPT-5.5
OpenAI
Arena1'476±4 · 66'317 Stimmen$ 13.50 / 1 Mio. Token$ 6.00 Eingabe · $ 36.00 Ausgabe3 Pkt./$+34 über MedianTesten
04
Gemini 3 Flash
Google DeepMindLegacy
Arena1'474±4 · 30'225 Stimmen$ 1.35 / 1 Mio. Token$ 0.60 Eingabe · $ 3.60 Ausgabe23 Pkt./$+31 über MedianTesten
05Arena1'473±4 · 53'446 Stimmen$ 12.00 / 1 Mio. Token$ 6.00 Eingabe · $ 30.00 Ausgabe3 Pkt./$+31 über MedianTesten
06Arena1'473±4 · 66'208 Stimmen$ 7.20 / 1 Mio. Token$ 3.60 Eingabe · $ 18.00 Ausgabe4 Pkt./$+30 über MedianTesten
07
GPT-5.4
OpenAI
Arena1'466±4 · 63'526 Stimmen$ 6.75 / 1 Mio. Token$ 3.00 Eingabe · $ 18.00 Ausgabe3 Pkt./$+23 über MedianTesten
08
Gemini 2.5 Pro
Google DeepMindLegacy
Arena1'446±3 · 122'554 Stimmen$ 4.125 / 1 Mio. Token$ 1.50 Eingabe · $ 12.00 Ausgabe1 Pkt./$+3 über MedianTesten
09
GPT-5.1
OpenAI
Arena1'439±4 · 42'982 Stimmen$ 4.125 / 1 Mio. Token$ 1.50 Eingabe · $ 12.00 AusgabeNicht klar über dem MedianTesten
10
OpenAI o3
OpenAILegacy
Arena1'432±4 · 58'579 Stimmen$ 4.20 / 1 Mio. Token$ 2.40 Eingabe · $ 9.60 AusgabeNicht klar über dem MedianTesten
11Arena1'415±3 · 129'278 Stimmen$ 2.40 / 1 Mio. Token$ 1.20 Eingabe · $ 6.00 AusgabeNicht klar über dem MedianTesten
12
GPT-4.1
OpenAI
Arena1'415±4 · 49'941 Stimmen$ 4.20 / 1 Mio. Token$ 2.40 Eingabe · $ 9.60 AusgabeNicht klar über dem MedianTesten
13
OpenAI o4-mini
OpenAILegacy
Arena1'391±4 · 44'639 Stimmen$ 2.31 / 1 Mio. Token$ 1.32 Eingabe · $ 5.28 AusgabeNicht klar über dem MedianTesten
14
o3-mini
OpenAILegacy
Arena1'348±4 · 56'655 Stimmen$ 2.31 / 1 Mio. Token$ 1.32 Eingabe · $ 5.28 AusgabeNicht klar über dem MedianTesten
15
GPT-4o
OpenAI
Arena1'335±4 · 45'499 Stimmen$ 5.25 / 1 Mio. Token$ 3.00 Eingabe · $ 12.00 AusgabeNicht klar über dem MedianTesten
16Arena1'318±4 · 68'697 Stimmen$ 0.315 / 1 Mio. Token$ 0.18 Eingabe · $ 0.72 AusgabeNicht klar über dem MedianTesten
Ohne Arena-Wertung (14), nach Preis
–Keine Arena-Wertung$ 0.12 / 1 Mio. Token$ 0.060 Eingabe · $ 0.30 AusgabeTesten
–Keine Arena-Wertung$ 0.24 / 1 Mio. Token$ 0.12 Eingabe · $ 0.60 AusgabeTesten
–Keine Arena-Wertung$ 0.24 / 1 Mio. Token$ 0.12 Eingabe · $ 0.60 AusgabeTesten
–Keine Arena-Wertung$ 0.555 / 1 Mio. Token$ 0.24 Eingabe · $ 1.50 AusgabeTesten
–Keine Arena-Wertung$ 0.63 / 1 Mio. Token$ 0.36 Eingabe · $ 1.44 AusgabeTesten
–Keine Arena-Wertung$ 0.63 / 1 Mio. Token$ 0.36 Eingabe · $ 1.44 AusgabeTesten
–
GPT-5 Mini
OpenAILegacy
Keine Arena-Wertung$ 0.825 / 1 Mio. Token$ 0.30 Eingabe · $ 2.40 AusgabeTesten
–Keine Arena-Wertung$ 2.025 / 1 Mio. Token$ 0.90 Eingabe · $ 5.40 AusgabeTesten
–Keine Arena-Wertung$ 2.376 / 1 Mio. Token$ 1.584 Eingabe · $ 4.752 AusgabeTesten
–Keine Arena-Wertung$ 4.80 / 1 Mio. Token$ 2.40 Eingabe · $ 12.00 AusgabeTesten
–
GPT-6 Sol
OpenAI
Keine Arena-Wertung$ 4.80 / 1 Mio. Token$ 2.40 Eingabe · $ 12.00 AusgabeTesten
–Keine Arena-Wertung$ 9.60 / 1 Mio. Token$ 4.80 Eingabe · $ 24.00 AusgabeTesten
–Keine Arena-Wertung$ 24.00 / 1 Mio. Token$ 12.00 Eingabe · $ 60.00 AusgabeTesten
–Keine Arena-Wertung$ 24.00 / 1 Mio. Token$ 12.00 Eingabe · $ 60.00 AusgabeTesten

Preis-Leistung = Arena-Punkte über dem Median der bewerteten Modelle dieser Liste pro US-Dollar für 1 Mio. Token (3:1 Eingabe:Ausgabe); einen Rang bekommen nur Modelle, deren 95-%-Intervall ganz über dem Median liegt.

So liest du diese Rangliste

Arena-Wertung
Eine Wertung aus blinden Paarvergleichen in der öffentlichen Arena: Menschen vergleichen zwei anonyme Modelle mit demselben Prompt und wählen das bessere Ergebnis. Höher ist besser; ± ist das 95-%-Intervall, „Stimmen“ die Zahl der Duelle.
Preis
Der Mischpreis für 1 Mio. Token, 3 Teile Eingabe zu 1 Teil Ausgabe, aus denselben Preisregeln, nach denen deine Läufe abgerechnet werden (1 Credit = 0,01 $). Eingabe- und Ausgabepreis stehen darunter.
Preis-Leistung
Preis-Leistung = Arena-Punkte über dem Median der bewerteten Modelle dieser Liste pro US-Dollar für 1 Mio. Token (3:1 Eingabe:Ausgabe); einen Rang bekommen nur Modelle, deren 95-%-Intervall ganz über dem Median liegt.
Wer aufgeführt ist
Jedes Modell dieser Kategorie, das du jetzt auf Railwail nutzen kannst.
Keine Arena-Wertung
Die Arena hat keinen Eintrag für genau dieses Modell in der Einstellung, die wir ausführen (zum Beispiel ist nur ein Lauf mit hohem Denkaufwand oder in 1080p bewertet). Wir schätzen nie eine Wertung.
Rang
Die Position in dieser Liste, nicht der Rang in der Arena.

Quelle

Qualitätswerte: Text Arena-Leaderboard, veröffentlicht am 13.09.2026, abgerufen am 24.09.2026 aus dem Leaderboard-Datensatz von LMArena. Genutzt unter CC BY 4.0; wir zeigen die Gesamtwertung der Modelle, die wir einem Railwail-Modell zuordnen können, und ordnen sie innerhalb dieser Liste.

arena.ai-LeaderboardDatensatzCC BY 4.0

Fragen zu dieser Rangliste

Welches KI-Sprachmodell hat auf Railwail die höchste Arena-Wertung?

Gemini 3.1 Pro von Google DeepMind mit einer Arena-Wertung von 1'487 (Text Arena, veröffentlicht am 13.09.2026). Danach folgen Gemini 3.1 Pro (1'487) und GPT-5.5 (1'476).

Welches KI-Sprachmodell ist auf Railwail am günstigsten?

Granite Code 8B von IBM für $ 0.12 / 1 Mio. Token. Die Preise kommen aus denselben Preisregeln, nach denen deine Läufe abgerechnet werden.

Welches KI-Sprachmodell bietet die meiste Qualität pro Dollar?

Gemini 3.1 Pro: 45 Arena-Punkte über dem Median dieser Liste (1'442) für $ 5.40 / 1 Mio. Token, also 8 Punkte pro Dollar.

Wie wird die Preis-Leistung (Qualität pro Dollar) berechnet?

Preis-Leistung = Arena-Punkte über dem Median der bewerteten Modelle dieser Liste pro US-Dollar für 1 Mio. Token (3:1 Eingabe:Ausgabe); einen Rang bekommen nur Modelle, deren 95-%-Intervall ganz über dem Median liegt.

Warum haben manche Modelle keine Arena-Wertung?

Die öffentliche Arena bewertet viele Modelle nur in einer Einstellung, etwa mit hohem Denkaufwand, mit Websuche oder in 1080p. Wir zeigen eine Wertung nur, wenn der bewertete Eintrag genau das Modell mit der Standardeinstellung ist, die auf Railwail läuft; sonst steht das Modell ohne Wertung in der Liste.

Beste KI-Sprachmodelle nach Qualität, Preis und Preis-Leistung | Railwail