Zum Hauptinhalt springen

LLM-Vergleich 2026: 43 KI-Modelle im direkten Duell

Dieser LLM-Vergleich stellt 43 aktuelle Sprachmodelle in 903 direkten Duellen gegenüber. Du bekommst gemeinsame Benchmark-Messreihen, aktuelle API-Preise, Kontextfenster, Parameter, Verfügbarkeit und die jeweilige Quelle.

Modelle
43
direkte Vergleiche
903
aktive Benchmarks
83
aktive Messwerte
14.315

Benchmarkübergreifende Einordnung

LLM-Gesamtbestenliste

Der Index nutzt 4 Benchmark-Kohorten mit vergleichbarem dokumentiertem Testaufbau. Er rechnet die Werte der Vergleichsmodelle in Rangperzentile um und mittelt sie anschließend gleich gewichtet. Nur die 26 Modelle mit Ergebnissen in jeder Kohorte erhalten einen Gesamtrang. Modelle ohne vollständige Abdeckung bleiben ausgeblendet. Fehlende Daten werden nicht als Nachteil gewertet.

1.Claude Opus 588,9 / 100, Platz 1
2.Gemini 3.8 Flash88,5 / 100
3.Claude Fable 583,2 / 100
4.GPT-5.6 Sol81,7 / 100
5.Gemini 3.7 Flash76,4 / 100
6.Kimi K374,5 / 100
7.Grok 4.670,2 / 100
8.GPT-5.6 Luna66,8 / 100
9.Gemini 3.6 Flash63,0 / 100
10.GPT-5.6 Terra59,1 / 100
11.Gemini 3.5 Flash58,7 / 100
12.Claude Sonnet 557,7 / 100
13.GPT-5.557,2 / 100
14.GLM-5.354,8 / 100
15.Grok 4.546,2 / 100
16.Gemini 3.1 Pro Preview41,3 / 100
17.GLM-5.3-Flash35,6 / 100
18.GLM-5.234,1 / 100
19.DeepSeek-V4-Pro24,5 / 100
20.Kimi K2.623,1 / 100
21.GPT-5.4 mini20,2 / 100
22.Gemini 3.5 Flash-Lite16,8 / 100
23.GLM-5.115,4 / 100
24.MiMo-V2.513,5 / 100
25.Grok 4.312,5 / 100
25.MiMo-V2.5-Pro12,5 / 100

Das ist ein transparenter Orientierungsindex, kein zusätzlicher Benchmark. Preis, Geschwindigkeit, Kontextfenster und Ergebnisse außerhalb der aufgeführten 4 Benchmark-Kohorten fließen nicht ein.

Quellwerte mit nicht vergleichbaren dokumentierten Konfigurationen fließen nicht in den Index ein, statt sie auf ihr stärkstes Ergebnis zu reduzieren.

Aktuelle Spitzenreiter

Welche LLMs führen in den wichtigsten Benchmarks?

Die fünf Charts halten die Benchmarks bewusst getrennt. Jede Rangliste nutzt genau eine veröffentlichte Kohorte, eine Aufgabe und eine Metrik. Modelle ohne eindeutig veröffentlichten Wert in der jeweiligen Kohorte bleiben ausgeblendet, statt einen geschätzten Wert zu erhalten.

Gesamtpräferenz

LMArena Text, Style Control

Stilbereinigte Bewertung aus anonymen Paarvergleichen.

1.Claude Fable 51.507,4 Punkte, Platz 1
2.Kimi K31.489 Punkte
3.Gemini 3.1 Pro Preview1.486,7 Punkte
4.GPT-5.6 Sol1.482,9 Punkte
5.Gemini 3.6 Flash1.480,2 Punkte
6.GLM-5.21.471,9 Punkte
7.Grok 4.51.470 Punkte
8.MiMo-V2.5-Pro1.468,3 Punkte
9.GPT-5.6 Terra1.466,2 Punkte
10.GLM-5.11.466 Punkte
11.Claude Sonnet 51.462,2 Punkte
12.Grok 4.61.461,1 Punkte
13.Kimi K2.61.460,6 Punkte
14.Gemini 3.5 Flash-Lite1.456,8 Punkte
15.GPT-5.6 Luna1.452,4 Punkte
16.GPT-5.4 mini1.448,1 Punkte
17.Grok 4.31.442,6 Punkte
18.MiMo-V2.51.433,8 Punkte
19.Mistral Medium 3.51.427 Punkte
20.Mistral Large 31.413,6 Punkte
LMArenaAktualisiert 01.09.2026 · 20 von 43 Vergleichsmodellen mit eindeutigem Quellwert

Das veröffentlichte Leaderboard dokumentiert modellabhängige Testeinstellungen. 6 Vergleichsmodelle haben mehr als einen nicht vergleichbaren Testaufbau. Sie bleiben in dieser Rangliste ausgeblendet, statt das beste Ergebnis auszuwählen.

Reasoning

GPQA Diamond

Schwierige, wissenschaftliche Fragen aus dem GPQA-Diamond-Datensatz.

1.Gemini 3.1 Pro Preview95,5 %, Platz 1
2.GPT-5.6 Sol95,2 %
3.Grok 4.694,7 %
4.Gemini 3.8 Flash94,4 %
5.Gemini 3.7 Flash93,9 %
6.Claude Opus 593,4 %
6.Gemini 3.6 Flash93,4 %
8.Claude Fable 593,2 %
8.GPT-5.593,2 %
10.Grok 4.592,9 %
10.Kimi K392,9 %
12.Gemini 3.5 Flash92,7 %
13.GPT-5.491,7 %
13.GPT-5.6 Luna91,7 %
15.Grok 4.391,4 %
16.GPT-5.6 Terra90,9 %
17.DeepSeek-V4-Pro89,4 %
18.Kimi K2.689,1 %
19.Claude Sonnet 588,9 %
20.GLM-5.388,1 %
21.GLM-5.3-Flash86,4 %
22.GLM-5.285,6 %
23.GLM-5.184,5 %
24.Gemini 3.5 Flash-Lite83,8 %
25.GPT-5.4 mini83,1 %
26.MiMo-V2.5-Pro82,6 %
27.MiMo-V2.581,6 %
Vals AIAktualisiert 01.09.2026 · 27 von 43 Vergleichsmodellen mit eindeutigem Quellwert

Coding

Vibe Code Bench v1.1

Praktische Programmieraufgaben aus Vibe Code Bench v1.1.

1.Claude Fable 590,4 %, Platz 1
2.GPT-6 Astra89,6 %
3.Claude Opus 588,4 %
4.Kimi K385 %
5.Claude Sonnet 581,3 %
6.GPT-5.6 Sol80,5 %
7.Gemini 3.8 Flash78,7 %
8.GLM-5.378,1 %
9.GPT-5.6 Luna77,1 %
10.Grok 4.676,2 %
11.GPT-5.6 Terra74,6 %
12.Gemini 3.7 Flash70,4 %
13.GPT-5.569,8 %
14.Grok 4.569 %
15.Gemini 3.6 Flash64 %
16.GLM-5.264 %
17.DeepSeek-V4-Pro49,9 %
18.Gemini 3.5 Flash48,7 %
19.GPT-5.4 mini48 %
20.MiMo-V2.542,2 %
21.Kimi K2.637,9 %
22.Gemini 3.5 Flash-Lite37,2 %
23.MiMo-V2.5-Pro34,1 %
24.Gemini 3.1 Pro Preview32 %
25.GLM-5.131,5 %
26.GLM-5.3-Flash30,8 %
27.Grok 4.319,4 %
Vals AIAktualisiert 03.09.2026 · 27 von 43 Vergleichsmodellen mit eindeutigem Quellwert

Das veröffentlichte Leaderboard dokumentiert modellabhängige Testeinstellungen. 1 Vergleichsmodell hat mehr als einen nicht vergleichbaren Testaufbau. Es bleibt in dieser Rangliste ausgeblendet, statt das beste Ergebnis auszuwählen.

Agenten

Terminal-Bench 2.1

Mehrstufige Aufgaben in einer realen Terminal-Umgebung.

1.GPT-6 Astra87,3 %, Platz 1
2.GPT-5.6 Sol85,8 %
3.Claude Opus 584,6 %
4.Gemini 3.8 Flash81,3 %
5.Kimi K380,9 %
6.Claude Fable 580,5 %
7.GPT-5.6 Luna79 %
8.Grok 4.678,3 %
9.Gemini 3.7 Flash77,5 %
9.GPT-5.6 Terra77,5 %
11.GPT-5.576,4 %
12.Claude Sonnet 574,5 %
13.Gemini 3.5 Flash74,2 %
14.Gemini 3.6 Flash73,8 %
15.GLM-5.371,5 %
16.Gemini 3.1 Pro Preview70,8 %
17.GLM-5.267,8 %
17.Grok 4.567,8 %
19.GLM-5.3-Flash62,9 %
20.MiMo-V2.560,7 %
21.MiMo-V2.5-Pro57,3 %
22.GLM-5.156,9 %
23.GPT-5.4 mini54,7 %
24.Kimi K2.653,6 %
25.DeepSeek-V4-Pro50,2 %
25.Gemini 3.5 Flash-Lite50,2 %
27.Grok 4.341,9 %
Vals AIAktualisiert 03.09.2026 · 27 von 43 Vergleichsmodellen mit eindeutigem Quellwert

Finanzen

Finance Agent (v2)

Recherche- und Analyseaufgaben aus Finance Agent v2.

1.Gemini 3.8 Flash61,4 %, Platz 1
2.Gemini 3.7 Flash59 %
3.Claude Opus 558,6 %
4.Gemini 3.5 Flash57,9 %
5.GLM-5.3-Flash57,9 %
6.Claude Fable 556,3 %
7.Gemini 3.6 Flash56,3 %
8.GLM-5.355,8 %
9.GPT-5.6 Luna55 %
10.GPT-5.6 Terra54,4 %
11.Kimi K354,4 %
12.Claude Sonnet 553,9 %
13.GPT-5.6 Sol53,8 %
14.Grok 4.653,7 %
15.GPT-6 Astra53,5 %
16.GPT-5.551,8 %
17.GLM-5.249,7 %
18.Grok 4.548,3 %
19.Gemini 3.5 Flash-Lite47,4 %
20.GPT-5.4 mini45,4 %
21.Kimi K2.644,9 %
22.GLM-5.144,8 %
23.DeepSeek-V4-Pro44,1 %
24.Gemini 3.1 Pro Preview43 %
25.MiMo-V2.5-Pro41,5 %
26.Grok 4.337,7 %
27.MiMo-V2.536,7 %
Vals AIAktualisiert 03.09.2026 · 27 von 43 Vergleichsmodellen mit eindeutigem Quellwert

Ein erster Platz gilt nur für den genannten Benchmark. Er ist kein Gesamtscore und sagt allein nichts über Preis, Geschwindigkeit, Kontextlänge oder deinen eigenen Einsatzzweck aus.

Entscheidungskriterien

Was du im LLM-Vergleich prüfen kannst

Benchmarks
Gemeinsame Aufgaben und Versionen für Reasoning, Coding, Agenten, Recherche und weitere Fähigkeiten.
API-Preise
Input, Output, Cache-Lesen und Cache-Schreiben, sofern der Anbieter diese Preise veröffentlicht.
Kontext
Veröffentlichte Kontextfenster und maximale Ausgabelängen ohne ungenaue Rundung.
Architektur
Bekannte Parameter, aktive Parameter, Dense oder MoE sowie der Open-Weight-Status.
Verfügbarkeit
API-Zugriff, Modellstatus, Erscheinungsdatum und dokumentierte Websuche.
Quellen
Ein Abruf- oder Prüfdatum und eine direkte Quelle für jeden volatilen Messwert.

Du suchst ein breiteres Verzeichnis? Dann sieh dir die Open-Source-LLMs im Vergleich an. Für konkrete Kosten pro Anwendung hilft der API-Kostenrechner.

Auswahl

Die wichtigsten 43 Modelle

Die Auswahl umfasst aktuelle Spitzenmodelle, günstigere Varianten und ausgewählte frühere Generationen. So kannst du auch Claude Opus 4.5 bis 4.8, Sonnet 4.5 und 4.6 sowie Haiku 4.5 mit neueren Modellen vergleichen.

Die vollständigen technischen Profile aller Modelle findest du im KI-Modelle-Verzeichnis.

Historische Einordnung

Ein Vergleich aus den frühen ChatGPT-Modellgenerationen

Die aktuelle Vergleichsmatrix konzentriert sich bewusst auf unterstützte Modelle. Diese historische Referenz hält die dokumentierten Unterschiede zwischen GPT-3.5 und GPT-4 für bestehende Anwendungen und Migrationsentscheidungen verfügbar.

GPT-3.5 vs. GPT-4: Was ist der Unterschied?

Häufige Fragen zum LLM-Vergleich

So funktionieren Benchmark-Zuordnung, Gewinner und Datenstand.

Changelog

Die neuesten Updates und Verbesserungen unseres LLM-Vergleichs
v1.94. September 2026

GPT-6 Astra ergänzt

  • GPT-6 Astra mit offiziellen technischen Daten, Preisen, Kontextfenster, Verfügbarkeit und Quellen ergänzt
  • Vergleich auf 36 Modelle und 630 direkte Duelle erweitert
v1.83. September 2026

Muse Spark 1.3 und Qwen 3.8 Max 0902 ergänzt

  • Muse Spark 1.3 mit aktuellen Preisen, Kontext, Verfügbarkeit und Quellen ergänzt
  • Qwen 3.8 Max auf den Snapshot 0902 aktualisiert und in die Vergleichsauswahl aufgenommen
  • Vergleich auf 35 Modelle und 595 direkte Duelle erweitert
v1.72. September 2026

Gemini 3.8 Flash ergänzt

  • Gemini 3.8 Flash mit offiziellen technischen Daten, Preisen, Wissensstand und Quellen ergänzt
  • Vergleich auf 33 Modelle und 528 direkte Duelle erweitert
v1.62. September 2026

Claude 5.1 und GLM-5.3 ergänzt

  • GLM-5.3 mit offiziellen technischen Daten, Preisen, Verfügbarkeit und Quellen ergänzt
  • Vergleich auf 32 Modelle und 496 direkte Duelle erweitert, einschließlich Claude Fable 5.1 und Mythos 5.1
v1.529. August 2026

GLM-5.3-Flash und aufgeräumte Bestenlisten

  • GLM-5.3-Flash mit offiziellen technischen Daten, Preisen und Quellen ergänzt
  • Vergleich auf 29 Modelle und 406 direkte Duelle erweitert
  • Modelle ohne veröffentlichten Wert aus den Bestenlisten entfernt
v1.428. August 2026

Vollständige und benchmarkübergreifende Ranglisten

  • Alle 28 Vergleichsmodelle in jede einzelne Benchmark-Rangliste aufgenommen
  • Orientierungsindex aus vier Kohorten mit vergleichbarem Testaufbau ergänzt
  • Mehrdeutige Modellvarianten ausgeschlossen und fehlende Werte ohne Schätzung sichtbar gelassen
v1.324. August 2026

Ähnliche Duelle, Anbieter-Icons und erweiterte FAQ

  • Jede LLM-Duellseite auf 14 ähnliche Duelle erweitert und den Hub-Button unter der Liste platziert
  • Lokale Anbieter-Icons ohne Platzhalter in alle 28 Modell-Badges aufgenommen
  • FAQ um Details zu Benchmarks, Preisen, Parametern und der Radar-Methodik erweitert
v1.221. August 2026

Benchmark-Ranglisten und Fähigkeitsprofile

  • Fünf getrennte Ranglisten für Gesamtpräferenz, Reasoning, Coding, Agenten und Finanzen ergänzt
  • Datengestützte Fähigkeitsprofile auf den direkten Duellseiten ergänzt
  • Jede Rangliste auf eine veröffentlichte Kohorte, Aufgabe, Metrik und einen Quellenstand begrenzt
v1.118. August 2026

FAQ, Changelog und interne Links

  • FAQ zu Benchmark-Abdeckung, Methodik und Datenstand ergänzt
  • Changelog für nachvollziehbare inhaltliche Updates ergänzt
  • Hub und Duellseiten in die Navigation, die Sitemap und die Rubrik „Ähnliche Vergleiche“ aufgenommen
v1.017. August 2026

Erstveröffentlichung

  • 28 aktuelle Modelle und 378 direkte Duelle veröffentlicht
  • Gemeinsame Benchmarks, API-Preise, technische Daten und Primärquellen zusammengeführt
  • Auswahlwerkzeug und zehn priorisierte Duelle ergänzt