Benchmarks
GPQA Diamond und SWE-bench Verified testen unterschiedliche Fähigkeiten. Ergebnisse aus verschiedenen Konfigurationen und Setups lassen sich nicht beliebig zusammenrechnen.
Von 1950 bis 2026
Wie wurde aus einer Forschungsfrage ein Werkzeug für den Alltag? Entdecke die Meilensteine der KI, vergleiche die Entwicklung der Modelle und prüfe die Quellen hinter den Prognosen.
Redaktioneller Stand
Von den Grundlagen bis zu heutigen Modellen. Suche nach einem Thema oder grenze die Auswahl nach Fähigkeiten, Entwickler und Jahr ein. Prognosen findest du in einer eigenen Ansicht.
Anthropic veröffentlicht Claude Sonnet 5.5 als schnelleres und günstigeres Gegenstück zu Opus 5.5, mit 1 Million Token Kontext, Wissensstand Juni 2026 und unverändert 2 $ Input sowie 10 $ Output pro 1 Million Token.
Anthropic löst Claude Opus 5 durch Opus 5.5 als neues Spitzenmodell ab, mit 1 Million Token Kontext, Wissensstand Juni 2026 und 4 $ Input sowie 20 $ Output pro 1 Million Token, rund 40 % günstiger als der Vorgänger.
OpenAI veröffentlicht GPT-6 Sol und GPT-6 Luna als Nachfolger der GPT-5.6-Tarife Sol und Luna, mit je 1.050.000 Token Kontext. Sol kostet 2 $ / 10 $ pro 1 Million Token, Luna 0,10 $ / 0,50 $. GPT-6 Astra bleibt OpenAIs bestes Modell.
OpenAI stellt GPT-6 Astra als Spitzenmodell der GPT-6-Familie vor. Laut Anbieter bietet es 1,05 Millionen Token Kontext und wird seit September schrittweise freigeschaltet.
Google veröffentlicht Gemini 3.8 Flash als stabiles multimodales Modell. Es bietet 1.048.576 Token Kontext, bis zu 65.536 Token Ausgabe und verbessert laut Google besonders Coding- und Agentenaufgaben.
Google stellt Gemini 3.8 Flash Cyber für die Erkennung von Schwachstellen und automatisiertes Patchen vor. Der Zugang bleibt geprüften Verteidigern im Fairwind-Programm vorbehalten.
Meta veröffentlicht Muse Spark 1.3 für agentische und Coding-Aufgaben. Laut Meta benötigt es rund 20 % weniger Tool-Aufrufe und rund 25 % weniger Token als Muse Spark 1.2.
Alibaba veröffentlicht einen neuen Snapshot von Qwen 3.8 Max. Das Modell behält 1 Million Token Kontext und verbessert Coding, lange autonome Entwicklung, Agentenzusammenarbeit und visuelle Auswertung.
Anthropic veröffentlicht Fable 5.1 als allgemein verfügbares Spitzenmodell und Mythos 5.1 als eingeschränkte Project-Glasswing-Variante. Beide bieten 1 Million Token Kontext, 128.000 Output-Token und einen Wissensstand von Juni 2026.
Alibaba veröffentlicht Qwen 3.8 Flash als multimodales API-Modell mit nativem 1-Million-Token-Kontext für Deep Thinking, visuelles Verständnis, Coding und agentische Workflows.
Alibaba veröffentlicht Qwen 3.8 Flash Next als multimodales MoE unter der Qwen Community License 1.0. Das Modell aktiviert 6 Milliarden Parameter pro Token und verarbeitet nativ 262.144 Token Kontext.
Z.ai veröffentlicht GLM-5.3 als neues API-Modell für agentische Aufgaben. Das Modell erweitert die GLM-5-Reihe für professionelle Anwendungen.
GPQA Diamond prüft Fachwissen auf Doktorandenniveau. SWE-bench Verified prüft abgegrenzte Softwareaufgaben. Die Kurven zeigen dokumentierte Spitzenwerte aus verschiedenen Konfigurationen und Evaluierungen, keine normierte Rangliste und keine allgemeine KI-Note.
GPQA Diamond über die Zeit (Diagramm wird geladen)
SWE-bench Verified über die Zeit (Diagramm wird geladen)
Parameterzahl und Kontextfenster dokumentieren technische Rekorde. Beide Werte helfen beim Vergleich, sagen allein aber nicht voraus, wie zuverlässig ein Modell in deiner Aufgabe arbeitet.
Parameter-Wachstum (log) (Diagramm wird geladen)
Kontextfenster-Rekorde (log) (Diagramm wird geladen)
Preis und Leistung aktueller Modelle (Diagramm wird geladen)
Jede Zelle zählt die belegten, nicht prognostischen Einträge dieser kuratierten Zeitleiste pro Monat. Sie misst keine vollständige Marktstatistik.
Einträge pro Monat (Diagramm wird geladen)
Ein Modell kann bei einer Messung führen und bei einer anderen zurückliegen. Deshalb stehen Testprotokoll, Quelle und Zeitraum bei jeder Grafik dabei.
GPQA Diamond und SWE-bench Verified testen unterschiedliche Fähigkeiten. Ergebnisse aus verschiedenen Konfigurationen und Setups lassen sich nicht beliebig zusammenrechnen.
Viele aktuelle Anbieter veröffentlichen keine Parameterzahl. Die Kurve zeigt deshalb nur Modelle mit einer bestätigten oder geschätzten Gesamtparameterzahl. Diese Werte sind nicht durchgehend direkt vergleichbar.
Ein großes Kontextfenster beschreibt die maximale Eingabelänge. Es garantiert weder korrekte Antworten noch eine gleichbleibende Qualität über den gesamten Kontext.
Die Punktwolke vergleicht aktuelle API-Listenpreise mit einem Benchmark. Rabatte, Caching und weitere Tarife bleiben außerhalb dieser Ansicht.
Chatbot-Marktanteil nach Web-Traffic (Diagramm wird geladen)
Die Karten zeigen getrennte Datensätze. Die Modellkarte zählt ausschließlich die in der Gradually-Datenbank erfassten Modelle nach Entwicklerstandort.
Mit den Pfeiltasten drehst du den Globus. Mit Pos1 setzt du die Ausgangsansicht zurück.
| Land | Wert |
|---|---|
| China | 72 Modelle |
| Frankreich | 18 Modelle |
| Kanada | 4 Modelle |
| Vereinigte Arabische Emirate | 2 Modelle |
| Vereinigte Staaten | 135 Modelle |
Die gemessene Aufgabenreihe endet 2025. Die Fortsetzung macht ihre Annahmen sichtbar. Expertenprognosen beantworten zudem unterschiedliche Fragen, deshalb stehen sie nebeneinander statt in einer scheinpräzisen Zahl.
Ausgewählte veröffentlichte METR-Werte bis Ende 2025. Der Horizont beschreibt Aufgaben, die ein Modell mit 50 % Erfolgsquote löst, gemessen an der Arbeitszeit eines Menschen. Die Schattierung schreibt zwei beobachtete Verdopplungsraten fort. Sie ist weder ein Konfidenzintervall noch eine Zusage für reale Projekte. Logarithmische Zeitachse.
Die Punkte zeigen unterschiedliche Zieldefinitionen und stammen aus unterschiedlichen Jahren. Sie bilden weder einen Konsens noch ein gemeinsames Wahrscheinlichkeitsintervall ab. Ein Szenario beschreibt einen möglichen Verlauf, keine garantierte Entwicklung.
Die wichtigsten Fragen zur Entwicklung von KI-Modellen und Tools.