Die besten KI-Sprachmodelle nach Qualität
Sprachmodelle für Chat, Texte, Code und logisches Denken, verglichen nach der Qualität, für die Menschen in der Arena stimmen, dem Preis für 1 Mio. Token und der Qualität pro Dollar.
Die besten KI-Sprachmodelle nach Qualität
Sortiert nach Arena-Wertung, höchste zuerst. Modelle ohne Arena-Wertung folgen nach Preis.
Median der Arena-Wertungen hier: 1'442
| # | Modell | Arena-Wertung | Preis | Preis-Leistung | Aktionen |
|---|---|---|---|---|---|
| 01 | Arena1'494±4 · 61'128 Stimmen | $ 12.00 / 1 Mio. Token$ 6.00 Eingabe · $ 30.00 Ausgabe | 4 Pkt./$+52 über Median | Testen | |
| 02 | Gemini 3.1 Pro Google DeepMind | Arena1'487±3 · 106'951 Stimmen | $ 5.40 / 1 Mio. Token$ 2.40 Eingabe · $ 14.40 Ausgabe | 8 Pkt./$+45 über Median | Testen |
| 03 | GPT-5.5 OpenAI | Arena1'476±4 · 66'317 Stimmen | $ 13.50 / 1 Mio. Token$ 6.00 Eingabe · $ 36.00 Ausgabe | 3 Pkt./$+34 über Median | Testen |
| 04 | Gemini 3 Flash Google DeepMindLegacy | Arena1'474±4 · 30'225 Stimmen | $ 1.35 / 1 Mio. Token$ 0.60 Eingabe · $ 3.60 Ausgabe | 23 Pkt./$+31 über Median | Testen |
| 05 | Arena1'473±4 · 53'446 Stimmen | $ 12.00 / 1 Mio. Token$ 6.00 Eingabe · $ 30.00 Ausgabe | 3 Pkt./$+31 über Median | Testen | |
| 06 | Arena1'473±4 · 66'208 Stimmen | $ 7.20 / 1 Mio. Token$ 3.60 Eingabe · $ 18.00 Ausgabe | 4 Pkt./$+30 über Median | Testen | |
| 07 | GPT-5.4 OpenAI | Arena1'466±4 · 63'526 Stimmen | $ 6.75 / 1 Mio. Token$ 3.00 Eingabe · $ 18.00 Ausgabe | 3 Pkt./$+23 über Median | Testen |
| 08 | Gemini 2.5 Pro Google DeepMindLegacy | Arena1'446±3 · 122'554 Stimmen | $ 4.125 / 1 Mio. Token$ 1.50 Eingabe · $ 12.00 Ausgabe | 1 Pkt./$+3 über Median | Testen |
| 09 | GPT-5.1 OpenAI | Arena1'439±4 · 42'982 Stimmen | $ 4.125 / 1 Mio. Token$ 1.50 Eingabe · $ 12.00 Ausgabe | Nicht klar über dem Median | Testen |
| 10 | OpenAI o3 OpenAILegacy | Arena1'432±4 · 58'579 Stimmen | $ 4.20 / 1 Mio. Token$ 2.40 Eingabe · $ 9.60 Ausgabe | Nicht klar über dem Median | Testen |
| 11 | Claude Haiku 4.5 Anthropic | Arena1'415±3 · 129'278 Stimmen | $ 2.40 / 1 Mio. Token$ 1.20 Eingabe · $ 6.00 Ausgabe | Nicht klar über dem Median | Testen |
| 12 | GPT-4.1 OpenAI | Arena1'415±4 · 49'941 Stimmen | $ 4.20 / 1 Mio. Token$ 2.40 Eingabe · $ 9.60 Ausgabe | Nicht klar über dem Median | Testen |
| 13 | OpenAI o4-mini OpenAILegacy | Arena1'391±4 · 44'639 Stimmen | $ 2.31 / 1 Mio. Token$ 1.32 Eingabe · $ 5.28 Ausgabe | Nicht klar über dem Median | Testen |
| 14 | o3-mini OpenAILegacy | Arena1'348±4 · 56'655 Stimmen | $ 2.31 / 1 Mio. Token$ 1.32 Eingabe · $ 5.28 Ausgabe | Nicht klar über dem Median | Testen |
| 15 | GPT-4o OpenAI | Arena1'335±4 · 45'499 Stimmen | $ 5.25 / 1 Mio. Token$ 3.00 Eingabe · $ 12.00 Ausgabe | Nicht klar über dem Median | Testen |
| 16 | GPT-4o Mini OpenAI | Arena1'318±4 · 68'697 Stimmen | $ 0.315 / 1 Mio. Token$ 0.18 Eingabe · $ 0.72 Ausgabe | Nicht klar über dem Median | Testen |
| Ohne Arena-Wertung (14), nach Preis | |||||
| – | Keine Arena-Wertung | $ 0.12 / 1 Mio. Token$ 0.060 Eingabe · $ 0.30 Ausgabe | Testen | ||
| – | GPT-6 Luna OpenAI | Keine Arena-Wertung | $ 0.24 / 1 Mio. Token$ 0.12 Eingabe · $ 0.60 Ausgabe | Testen | |
| – | Keine Arena-Wertung | $ 0.24 / 1 Mio. Token$ 0.12 Eingabe · $ 0.60 Ausgabe | Testen | ||
| – | GPT-5.4 Nano OpenAI | Keine Arena-Wertung | $ 0.555 / 1 Mio. Token$ 0.24 Eingabe · $ 1.50 Ausgabe | Testen | |
| – | Keine Arena-Wertung | $ 0.63 / 1 Mio. Token$ 0.36 Eingabe · $ 1.44 Ausgabe | Testen | ||
| – | DeepSeek V4.1 Flash DeepSeek | Keine Arena-Wertung | $ 0.63 / 1 Mio. Token$ 0.36 Eingabe · $ 1.44 Ausgabe | Testen | |
| – | GPT-5 Mini OpenAILegacy | Keine Arena-Wertung | $ 0.825 / 1 Mio. Token$ 0.30 Eingabe · $ 2.40 Ausgabe | Testen | |
| – | GPT-5.4 Mini OpenAI | Keine Arena-Wertung | $ 2.025 / 1 Mio. Token$ 0.90 Eingabe · $ 5.40 Ausgabe | Testen | |
| – | DeepSeek V4 Pro DeepSeek | Keine Arena-Wertung | $ 2.376 / 1 Mio. Token$ 1.584 Eingabe · $ 4.752 Ausgabe | Testen | |
| – | Claude Sonnet 5 Anthropic | Keine Arena-Wertung | $ 4.80 / 1 Mio. Token$ 2.40 Eingabe · $ 12.00 Ausgabe | Testen | |
| – | GPT-6 Sol OpenAI | Keine Arena-Wertung | $ 4.80 / 1 Mio. Token$ 2.40 Eingabe · $ 12.00 Ausgabe | Testen | |
| – | Claude Opus 5.5 Anthropic | Keine Arena-Wertung | $ 9.60 / 1 Mio. Token$ 4.80 Eingabe · $ 24.00 Ausgabe | Testen | |
| – | Claude Fable 5.1 Anthropic | Keine Arena-Wertung | $ 24.00 / 1 Mio. Token$ 12.00 Eingabe · $ 60.00 Ausgabe | Testen | |
| – | GPT-6 Astra OpenAI | Keine Arena-Wertung | $ 24.00 / 1 Mio. Token$ 12.00 Eingabe · $ 60.00 Ausgabe | Testen | |
Preis-Leistung = Arena-Punkte über dem Median der bewerteten Modelle dieser Liste pro US-Dollar für 1 Mio. Token (3:1 Eingabe:Ausgabe); einen Rang bekommen nur Modelle, deren 95-%-Intervall ganz über dem Median liegt.
So liest du diese Rangliste
- Arena-Wertung
- Eine Wertung aus blinden Paarvergleichen in der öffentlichen Arena: Menschen vergleichen zwei anonyme Modelle mit demselben Prompt und wählen das bessere Ergebnis. Höher ist besser; ± ist das 95-%-Intervall, „Stimmen“ die Zahl der Duelle.
- Preis
- Der Mischpreis für 1 Mio. Token, 3 Teile Eingabe zu 1 Teil Ausgabe, aus denselben Preisregeln, nach denen deine Läufe abgerechnet werden (1 Credit = 0,01 $). Eingabe- und Ausgabepreis stehen darunter.
- Preis-Leistung
- Preis-Leistung = Arena-Punkte über dem Median der bewerteten Modelle dieser Liste pro US-Dollar für 1 Mio. Token (3:1 Eingabe:Ausgabe); einen Rang bekommen nur Modelle, deren 95-%-Intervall ganz über dem Median liegt.
- Wer aufgeführt ist
- Jedes Modell dieser Kategorie, das du jetzt auf Railwail nutzen kannst.
- Keine Arena-Wertung
- Die Arena hat keinen Eintrag für genau dieses Modell in der Einstellung, die wir ausführen (zum Beispiel ist nur ein Lauf mit hohem Denkaufwand oder in 1080p bewertet). Wir schätzen nie eine Wertung.
- Rang
- Die Position in dieser Liste, nicht der Rang in der Arena.
Quelle
Qualitätswerte: Text Arena-Leaderboard, veröffentlicht am 13.09.2026, abgerufen am 24.09.2026 aus dem Leaderboard-Datensatz von LMArena. Genutzt unter CC BY 4.0; wir zeigen die Gesamtwertung der Modelle, die wir einem Railwail-Modell zuordnen können, und ordnen sie innerhalb dieser Liste.
Fragen zu dieser Rangliste
Welches KI-Sprachmodell hat auf Railwail die höchste Arena-Wertung?
Gemini 3.1 Pro von Google DeepMind mit einer Arena-Wertung von 1'487 (Text Arena, veröffentlicht am 13.09.2026). Danach folgen Gemini 3.1 Pro (1'487) und GPT-5.5 (1'476).
Welches KI-Sprachmodell ist auf Railwail am günstigsten?
Granite Code 8B von IBM für $ 0.12 / 1 Mio. Token. Die Preise kommen aus denselben Preisregeln, nach denen deine Läufe abgerechnet werden.
Welches KI-Sprachmodell bietet die meiste Qualität pro Dollar?
Gemini 3.1 Pro: 45 Arena-Punkte über dem Median dieser Liste (1'442) für $ 5.40 / 1 Mio. Token, also 8 Punkte pro Dollar.
Wie wird die Preis-Leistung (Qualität pro Dollar) berechnet?
Preis-Leistung = Arena-Punkte über dem Median der bewerteten Modelle dieser Liste pro US-Dollar für 1 Mio. Token (3:1 Eingabe:Ausgabe); einen Rang bekommen nur Modelle, deren 95-%-Intervall ganz über dem Median liegt.
Warum haben manche Modelle keine Arena-Wertung?
Die öffentliche Arena bewertet viele Modelle nur in einer Einstellung, etwa mit hohem Denkaufwand, mit Websuche oder in 1080p. Wir zeigen eine Wertung nur, wenn der bewertete Eintrag genau das Modell mit der Standardeinstellung ist, die auf Railwail läuft; sonst steht das Modell ohne Wertung in der Liste.