Zum Hauptinhalt springen

Direktvergleich

Grok 4.6 vs. GLM-5.1

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

35

gemeinsame Messreihen

17

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Grok 4.6 und GLM-5.1
MerkmalGrok 4.6GLM-5.1
AnbieterxAIZ.ai
Erschienen12. Aug. 20267. Apr. 2026
VerfügbarkeitAktivOpen Source
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht744 Mrd., 40 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster500.000 Token200.000 Token
Wissensstand1. Februar 2026Nicht veröffentlicht
Technische QuellenModellModell, Kontext
API-Preise pro 1 Mio. Token
API-Eingabe2 $ ≤200K / 4 $ >200K1,4 $
API-Ausgabe6 $ ≤200K / 12 $ >200K4,4 $
Cache lesen0,5 $ ≤200K / 1 $ >200K0,26 $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft16.08.2026Quelle30.07.2026Quelle
Grok 4.6GLM-5.1
API-EingabeUSD pro 1 Mio. Token, Basistarif
Grok 4.62 $
GLM-5.11,4 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Grok 4.66 $
GLM-5.14,4 $Günstiger
Cache lesenUSD pro 1 Mio. Token, Basistarif
Grok 4.60,5 $
GLM-5.10,26 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

35 gemeinsame Messreihen
Grok 4.6GLM-5.1
Arena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
Grok 4.61.464,323 Arena-Punkte
GLM-5.11.466,935 Arena-PunkteHöherer Messwert
Code MigrationOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.644,572 %Gewinner
GLM-5.125,768 %
CorpFin v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.666,161 %Gewinner
GLM-5.164,452 %
Finance Agent (v2)Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.653,682 %Gewinner
GLM-5.144,792 %
GPQA DiamondOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.694,697 %Gewinner
GLM-5.184,518 %
Harvey's Legal Agent BenchmarkOverall · Task fully resolved. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.615,833 %Gewinner
GLM-5.10 %
Legal Research BenchOverall · All-pass. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.648,077 %Gewinner
GLM-5.127,885 %
LegalBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.686,307 %Gewinner
GLM-5.184,394 %
LiveCodeBench v6Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.688,224 %Gewinner
GLM-5.181,38 %
MedCodeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.644,712 %Gewinner
GLM-5.141,604 %
MedScribeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.686,534 %Gewinner
GLM-5.172,27 %
MMLU-ProOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.689,4 %Gewinner
GLM-5.186,9 %
Benchmarkwerte von Grok 4.6 und GLM-5.1
Benchmark und AufgabeGrok 4.6GLM-5.1VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.464,323 Arena-Punkte
95-%-Konfidenzintervall: ±11,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.466,935 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±4,197Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 39.063 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Code MigrationOverall
44,572 %Gewinner
25,768 %
1accuracyMehr ist besserKohorte: vals-code-migration:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-code-migration-2026-08-16-107652dc6bfcAbgerufen am 16.08.2026
CorpFin v2Overall
66,161 %Gewinner
64,452 %
2accuracyMehr ist besserKohorte: vals-corp-fin-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-corp_fin_v2-2026-08-16-45bbf84f57abAbgerufen am 16.08.2026
Finance Agent (v2)Overall
53,682 %Gewinner
44,792 %
2accuracyMehr ist besserKohorte: vals-finance-agent-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-fabv2-2026-08-16-8853da43085dAbgerufen am 16.08.2026
GPQA DiamondOverall
94,697 %Gewinner
84,518 %
1accuracyMehr ist besserKohorte: vals-gpqa:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-gpqa-2026-08-16-7f8363eaa2dbAbgerufen am 16.08.2026
Harvey's Legal Agent BenchmarkOverall · Task fully resolved
15,833 %Gewinner
0 %
1task resolution rateMehr ist besserKohorte: vals-legal-agent-benchmark:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-hlab-2026-08-16-bae90566df2fAbgerufen am 16.08.2026
Legal Research BenchOverall · All-pass
48,077 %Gewinner
27,885 %
1all-pass rateMehr ist besserKohorte: vals-legal-research:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-legal_research-2026-08-16-af296c00ecaaAbgerufen am 16.08.2026
LegalBenchOverall
86,307 %Gewinner
84,394 %
1accuracyMehr ist besserKohorte: vals-legal-bench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-legal_bench-2026-08-16-d5b3b1b2b5c8Abgerufen am 16.08.2026
LiveCodeBench v6Overall
88,224 %Gewinner
81,38 %
1accuracyMehr ist besserKohorte: vals-lcb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-lcb-2026-08-16-17b9c147080dAbgerufen am 16.08.2026
MedCodeOverall
44,712 %Gewinner
41,604 %
1accuracyMehr ist besserKohorte: vals-medcode:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medcode-2026-08-16-524f7f474eacAbgerufen am 16.08.2026
MedScribeOverall
86,534 %Gewinner
72,27 %
1accuracyMehr ist besserKohorte: vals-medscribe:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medscribe-2026-08-16-c385354a7e62Abgerufen am 16.08.2026
MMLU-ProOverall
89,4 %Gewinner
86,9 %
1accuracyMehr ist besserKohorte: vals-mmlu-pro:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-mmlu_pro-2026-08-16-e14d5bb3a34cAbgerufen am 16.08.2026
Public Benefits Bench v1.1Overall
66,847 %Gewinner
61,84 %
1.1accuracyMehr ist besserKohorte: vals-snap:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-public-benefits-bench-2026-08-16-7ce68123c502Abgerufen am 16.08.2026
SWE-bench VerifiedOverall
95,6 %Gewinner
76,4 %
1accuracyMehr ist besserKohorte: vals-swebench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-swebench-2026-08-16-c133071b8167Abgerufen am 16.08.2026
TaxEval v2Overall
71,096 %
71,194 %Gewinner
2accuracyMehr ist besserKohorte: vals-tax-eval-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: GLM-5.1Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-tax_eval_v2-2026-08-16-5bbd495dac53Abgerufen am 16.08.2026
Terminal-Bench 2.1Overall
78,277 %Gewinner
56,929 %
2.1accuracyMehr ist besserKohorte: vals-terminal-bench-2-1:2.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
GLM-5.1: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-terminal-bench-2-1-2026-08-16-b3f38c18bea4Abgerufen am 16.08.2026
Vibe Code Bench v1.1Overall
76,239 %Gewinner
31,456 %
1.1accuracyMehr ist besserKohorte: vals-vibe-code-bench:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Harness: OpenHands
GLM-5.1: Harness: OpenHands
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-vibe-code-2026-08-16-a73c9770bcc4Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.455,102 Arena-Punkte
95-%-Konfidenzintervall: ±27,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.464,98 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,499Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 442 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 7.906 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.535,167 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±39,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.519,866 Arena-Punkte
95-%-Konfidenzintervall: ±13,198Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 215 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 2.373 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.511,77 Arena-Punkte
95-%-Konfidenzintervall: ±26,72Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.515,299 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,649Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 485 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 11.013 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.472,894 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,578Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.448,824 Arena-Punkte
95-%-Konfidenzintervall: ±8,067Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 379 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 6.969 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.459,266 Arena-Punkte
95-%-Konfidenzintervall: ±18,461Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.482,119 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,43Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 17.745 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.455,476 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±28,81Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.442,508 Arena-Punkte
95-%-Konfidenzintervall: ±7,369Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 448 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 8.637 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.469,633 Arena-Punkte
95-%-Konfidenzintervall: ±16,492Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,898 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.782 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 29.374 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.479,969 Arena-Punkte
95-%-Konfidenzintervall: ±34,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.499,568 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 272 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 4.037 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.488,551 Arena-Punkte
95-%-Konfidenzintervall: ±15,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.490,231 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±4,925Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 25.858 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.472,181 Arena-Punkte
95-%-Konfidenzintervall: ±25,031Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.499,62 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,387Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 12.052 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.460,755 Arena-Punkte
95-%-Konfidenzintervall: ±21,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.461,362 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,046Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 732 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 13.512 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.497,908 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,96Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.488,217 Arena-Punkte
95-%-Konfidenzintervall: ±8,001Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 335 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 6.456 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.485,451 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.482,089 Arena-Punkte
95-%-Konfidenzintervall: ±5,778Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.103 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 17.542 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.444,26 Arena-Punkte
95-%-Konfidenzintervall: ±31,774Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.480,773 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,13Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 352 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 6.441 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.461,99 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.450,78 Arena-Punkte
95-%-Konfidenzintervall: ±5,121Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.450 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 21.317 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.446,737 Arena-Punkte
95-%-Konfidenzintervall: ±34,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.462,261 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,716Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 4.158 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.511,885 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±20,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.502,911 Arena-Punkte
95-%-Konfidenzintervall: ±5,728Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 805 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 15.723 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.455,393 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±25,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.454,964 Arena-Punkte
95-%-Konfidenzintervall: ±6,919Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
GLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.GLM-5.1: Stilbereinigte Arena-Bewertung aus 9.833 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.