Direktvergleich
Grok 4.6 vs. GLM-5.2
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
37
gemeinsame Messreihen
19
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | Grok 4.6 | GLM-5.2 |
|---|---|---|
| Anbieter | xAI | Z.ai |
| Erschienen | 12. Aug. 2026 | 16. Juni 2026 |
| Verfügbarkeit | Aktiv | Open Source |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 744 Mrd., 40 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 500.000 Token | 1.000.000 Token |
| Wissensstand | 1. Februar 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell, Kontext |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 2 $ ≤200K / 4 $ >200K | 1,4 $ |
| API-Ausgabe | 6 $ ≤200K / 12 $ >200K | 4,4 $ |
| Cache lesen | 0,5 $ ≤200K / 1 $ >200K | 0,26 $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 16.08.2026Quelle | 30.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | Grok 4.6 | GLM-5.2 | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.464,323 Arena-Punkte 95-%-Konfidenzintervall: ±11,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,655 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,045Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 26.867 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Code MigrationOverall | 44,572 %Gewinner | 37,87 % | 1accuracyMehr ist besserKohorte: vals-code-migration:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-code-migration-2026-08-16-107652dc6bfcAbgerufen am 16.08.2026 |
| CorpFin v2Overall | 66,161 %Gewinner | 66,123 % | 2accuracyMehr ist besserKohorte: vals-corp-fin-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-corp_fin_v2-2026-08-16-45bbf84f57abAbgerufen am 16.08.2026 |
| EMBOverall | 62,727 %Gewinner | 61,532 % | 1accuracyMehr ist besserKohorte: vals-emb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-emb-2026-08-16-68d5d1d47a97Abgerufen am 16.08.2026 |
| Finance Agent (v2)Overall | 53,682 %Gewinner | 49,699 % | 2accuracyMehr ist besserKohorte: vals-finance-agent-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-fabv2-2026-08-16-8853da43085dAbgerufen am 16.08.2026 |
| GPQA DiamondOverall | 94,697 %Gewinner | 85,606 % | 1accuracyMehr ist besserKohorte: vals-gpqa:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-gpqa-2026-08-16-7f8363eaa2dbAbgerufen am 16.08.2026 |
| Harvey's Legal Agent BenchmarkOverall · Task fully resolved | 15,833 %Gewinner | 7,083 % | 1task resolution rateMehr ist besserKohorte: vals-legal-agent-benchmark:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-hlab-2026-08-16-bae90566df2fAbgerufen am 16.08.2026 |
| Legal Research BenchOverall · All-pass | 48,077 %Gewinner | 31,25 % | 1all-pass rateMehr ist besserKohorte: vals-legal-research:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-legal_research-2026-08-16-af296c00ecaaAbgerufen am 16.08.2026 |
| LegalBenchOverall | 86,307 %Gewinner | 84,073 % | 1accuracyMehr ist besserKohorte: vals-legal-bench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-legal_bench-2026-08-16-d5b3b1b2b5c8Abgerufen am 16.08.2026 |
| LiveCodeBench v6Overall | 88,224 %Gewinner | 69,5 % | 1accuracyMehr ist besserKohorte: vals-lcb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-lcb-2026-08-16-17b9c147080dAbgerufen am 16.08.2026 |
| MedCodeOverall | 44,712 %Gewinner | 40,771 % | 1accuracyMehr ist besserKohorte: vals-medcode:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medcode-2026-08-16-524f7f474eacAbgerufen am 16.08.2026 |
| MedScribeOverall | 86,534 %Gewinner | 83,534 % | 1accuracyMehr ist besserKohorte: vals-medscribe:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medscribe-2026-08-16-c385354a7e62Abgerufen am 16.08.2026 |
| MMLU-ProOverall | 89,4 %Gewinner | 86,714 % | 1accuracyMehr ist besserKohorte: vals-mmlu-pro:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-mmlu_pro-2026-08-16-e14d5bb3a34cAbgerufen am 16.08.2026 |
| SkillsBenchOverall | 55,766 %Gewinner | 45,077 % | 1accuracyMehr ist besserKohorte: vals-skillsbench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Harness: OpenHands GLM-5.2: Harness: OpenHands | Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-skillsbench-2026-08-16-4917a67268d2Abgerufen am 16.08.2026 |
| SWE-bench VerifiedOverall | 95,6 %Gewinner | 82,8 % | 1accuracyMehr ist besserKohorte: vals-swebench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-swebench-2026-08-16-c133071b8167Abgerufen am 16.08.2026 |
| TaxEval v2Overall | 71,096 % | 73,344 %Gewinner | 2accuracyMehr ist besserKohorte: vals-tax-eval-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: GLM-5.2Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-tax_eval_v2-2026-08-16-5bbd495dac53Abgerufen am 16.08.2026 |
| Terminal-Bench 2.1Overall | 78,277 %Gewinner | 67,79 % | 2.1accuracyMehr ist besserKohorte: vals-terminal-bench-2-1:2.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-terminal-bench-2-1-2026-08-16-b3f38c18bea4Abgerufen am 16.08.2026 |
| Vals IndexOverall | 59,167 %Gewinner | 53,122 % | 2weighted index scoreMehr ist besserKohorte: vals-vals-index:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen GLM-5.2: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-vals_index-2026-08-16-ab641d89d6edAbgerufen am 16.08.2026 |
| Vibe Code Bench v1.1Overall | 76,239 %Gewinner | 63,961 % | 1.1accuracyMehr ist besserKohorte: vals-vibe-code-bench:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Harness: OpenHands GLM-5.2: Harness: OpenHands | Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-vibe-code-2026-08-16-a73c9770bcc4Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.455,102 Arena-Punkte 95-%-Konfidenzintervall: ±27,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,883 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,752Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 442 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.374 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.535,167 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±39,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.521,061 Arena-Punkte 95-%-Konfidenzintervall: ±15,24Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 215 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.662 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.511,77 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±26,72Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.506,101 Arena-Punkte 95-%-Konfidenzintervall: ±7,714Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 485 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 7.692 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.472,894 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±31,578Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,311 Arena-Punkte 95-%-Konfidenzintervall: ±9,401Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 379 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 4.900 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.459,266 Arena-Punkte 95-%-Konfidenzintervall: ±18,461Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,647 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,503Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 11.738 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.455,476 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±28,81Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,31 Arena-Punkte 95-%-Konfidenzintervall: ±8,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 448 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 6.343 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.469,633 Arena-Punkte 95-%-Konfidenzintervall: ±16,492Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.478,207 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,648Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.782 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 19.914 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.479,969 Arena-Punkte 95-%-Konfidenzintervall: ±34,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.487,47 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,455Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 272 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.909 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.488,551 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.488,252 Arena-Punkte 95-%-Konfidenzintervall: ±5,839Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 17.841 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.472,181 Arena-Punkte 95-%-Konfidenzintervall: ±25,031Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.491,588 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,548Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 7.982 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.460,755 Arena-Punkte 95-%-Konfidenzintervall: ±21,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.464,375 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,12Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 732 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 9.386 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.497,908 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±31,96Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.493,732 Arena-Punkte 95-%-Konfidenzintervall: ±9,3Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 335 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 4.448 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.485,451 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,131 Arena-Punkte 95-%-Konfidenzintervall: ±6,674Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.103 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 12.386 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.444,26 Arena-Punkte 95-%-Konfidenzintervall: ±31,774Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,614 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,5Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 352 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 4.469 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.461,99 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.455,529 Arena-Punkte 95-%-Konfidenzintervall: ±6,021Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.450 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 15.126 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.446,737 Arena-Punkte 95-%-Konfidenzintervall: ±34,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,581 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,762Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.693 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.511,885 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±20,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.496,316 Arena-Punkte 95-%-Konfidenzintervall: ±6,759Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 805 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 10.881 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.455,393 Arena-Punkte 95-%-Konfidenzintervall: ±25,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.456,431 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,076Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 6.806 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Grok 4.6 und GLM-5.2 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich