Zum Hauptinhalt springen

Gradually LLM Index

LLMs vergleichen. Ohne Äpfel mit Birnen zu messen.

26 aktuelle Sprachmodelle, 325 direkte Duelle und eine zentrale Datenbasis. Du bekommst Benchmarks aus identischen Messreihen, aktuelle API-Preise und die wichtigsten technischen Daten.

Modelle
26
direkte Vergleiche
325
aktive Benchmarks
78
aktive Messwerte
13.152

Schnelleinstieg

Sechs Duelle, die gerade zählen

Jede Paarseite nutzt dieselbe Datenlogik. Ein Wert erscheint nur, wenn Benchmark, Version, Aufgabe und Testaufbau zusammenpassen.

Auswahl

Die wichtigsten 26 Modelle

Die Auswahl konzentriert sich auf aktuelle Spitzenmodelle und relevante günstigere Varianten. Veraltete Modellgenerationen bleiben außen vor.

Anthropic

Claude Opus 5Claude Fable 5Claude Sonnet 5Claude Mythos 5

OpenAI

GPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaGPT-5.5GPT-5.4GPT-5.4 mini

Google

Gemini 3.6 FlashGemini 3.5 FlashGemini 3.1 Pro PreviewGemini 3.5 Flash-Lite

xAI

Grok 4.5Grok 4.3

DeepSeek

DeepSeek-V4-ProDeepSeek-V4-Flash

Moonshot AI

Kimi K3Kimi K2.6

Z.ai

GLM-5.2GLM-5.1

Mistral AI

Mistral Large 3Mistral Medium 3.5

Xiaomi

MiMo-V2.5MiMo-V2.5-Pro

Methodik

Ein Vergleich ist nur so gut wie seine Kohorte

Zentrale Datenbank

27 Quellen, 13.152 aktive Messwerte und ein einheitliches Modell-Schema.

Gleicher Testaufbau

Wir vergleichen nur Ergebnisse derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte.

Fehlende Werte bleiben leer

Wenn zwei Modelle keine gemeinsame Messreihe haben, zeigen wir das offen. Es gibt keine Schätzwerte.

Daten statt Siegerliste

Benchmarks, Preise und technische Daten stehen nebeneinander. Der beste Kandidat hängt von deinem Einsatz ab.

Datenbank zuletzt abgerufen am 11.08.2026. Preise haben je Modell einen eigenen Prüfstand und eine verlinkte Primärquelle.