Direktvergleich
Grok 4.6 vs. GLM-5.2
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 41
- verschiedene Benchmarks
- 19
- jüngster Abruf
- 04.09.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Grok 4.6 | GLM-5.2 |
|---|---|---|
| Anbieter | xAI | Z.ai |
| Erschienen | 12. Aug. 2026 | 16. Juni 2026 |
| Verfügbarkeit | Aktiv | Open Source |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 744 Mrd., 40 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 500.000 Token | 1.000.000 Token |
| Wissensstand | 1. Februar 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell, Kontext |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Grok 4.6 | GLM-5.2 |
|---|---|---|
| API-Eingabe | 2 $ ≤200K / 4 $ >200K | 1,4 $ |
| API-Ausgabe | 6 $ ≤200K / 12 $ >200K | 4,4 $ |
| Cache lesen | 0,5 $ ≤200K / 1 $ >200K | 0,26 $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 16.08.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Grok 4.6 | xAI | Direkt beim EntwicklerBis 200.000 Kontext-Token | Günstigster erfasster Preis: 2 $ | Günstigster erfasster Preis: 6 $ | Quelle16.08.2026 |
| xAI | Direkt beim EntwicklerÜber 200.000 Kontext-Token | 4 $ | 12 $ | Quelle16.08.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/us-west-2 | 2,2 $ | 6,6 $ | Quelle06.09.2026 | |
| xAI | Über OpenRouterxai | Günstigster erfasster Preis: 2 $ | Günstigster erfasster Preis: 6 $ | Quelle06.09.2026 | |
| xAI | Über OpenRouterxai/priority | 4 $ | 12 $ | Quelle06.09.2026 | |
| xAI | Über OpenRouterxai/zdr | Günstigster erfasster Preis: 2 $ | Günstigster erfasster Preis: 6 $ | Quelle06.09.2026 | |
| xAI | Über OpenRouterxai/zdr/priority | 4 $ | 12 $ | Quelle06.09.2026 | |
| GLM-5.2 | Z.ai | Direkt beim EntwicklerStandard-API | 1,4 $ | 4,4 $ | Quelle30.07.2026 |
| Alibaba | Über OpenRouteralibaba/fast | 2,31 $ | 7,26 $ | Quelle06.09.2026 | |
| Alibaba | Über OpenRouteralibaba/fp8 | 0,966 $ | 3,036 $ | Quelle06.09.2026 | |
| Ambient | Über OpenRouterambient/fp8 | 0,6 $ | 2 $ | Quelle06.09.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp8 | 0,938 $ | 2,948 $ | Quelle06.09.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 0,357 $ | 1,122 $ | Quelle06.09.2026 | |
| BaseTen | Über OpenRouterbaseten/fast#1 | 2,1 $ | 6,6 $ | Quelle06.09.2026 | |
| BaseTen | Über OpenRouterbaseten/fast#2 | 2,1 $ | 6,6 $ | Quelle06.09.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8#1 | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8#2 | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp4 | 0,76 $ | 2,42 $ | Quelle06.09.2026 | |
| Crusoe | Über OpenRoutercrusoe/fp8 | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Decart | Über OpenRouterdecart/fp4 | 0,684 $ | 2,28 $ | Quelle06.09.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp4 | 0,4875 $ | 1,56 $ | Quelle06.09.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,7 $ | 2,2 $ | Quelle06.09.2026 | |
| Fireworks | Über OpenRouterfireworks | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Fireworks | Über OpenRouterfireworks/fast | 2,1 $ | 6,6 $ | Quelle06.09.2026 | |
| Fireworks | Über OpenRouterfireworks/fast-us | 2,1 $ | 6,6 $ | Quelle06.09.2026 | |
| Friendli | Über OpenRouterfriendli | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp8 | 1,05 $ | 3,3 $ | Quelle06.09.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 1,25 $ | 2,99 $ | Quelle06.09.2026 | |
| Mistral | Über OpenRoutermistral | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Mistral | Über OpenRoutermistral/eu | 1,54 $ | 4,84 $ | Quelle06.09.2026 | |
| Mistral | Über OpenRoutermistral/zdr | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,5586 $ | 1,7556 $ | Quelle06.09.2026 | |
| Parasail | Über OpenRouterparasail/fp4 | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Phala | Über OpenRouterphala/fp8 | 1,26 $ | 3 $ | Quelle06.09.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 1,19 $ | 3,74 $ | Quelle06.09.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | Günstigster erfasster Preis: 0,343 $ | Günstigster erfasster Preis: 1,078 $ | Quelle06.09.2026 | |
| Together | Über OpenRoutertogether | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Venice | Über OpenRoutervenice/fp8 | 1,4 $ | 4,4 $ | Quelle06.09.2026 | |
| Z.AI | Über OpenRouterz-ai/fp8 | 1,4 $ | 4,4 $ | Quelle06.09.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
18 passende Messreihen aus 18 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 8 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Grok 4.6 | GLM-5.2 | Quelle |
|---|---|---|---|
Code MigrationOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner44,572 % | 37,87 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
CorpFin v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | Gewinner66,161 % | 66,123 % | Vals AIQuellendetailsDatenstand: 12.08.2026 |
EMBOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner62,727 % | 61,532 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Finance Agent (v2)OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | Gewinner53,682 % | 49,699 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner94,697 % | 85,606 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besser | Gewinner15,833 % | 7,083 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Legal Research BenchOverall · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besser | Gewinner48,077 % | 31,25 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner86,307 % | 84,073 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LiveCodeBench v6OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner88,224 % | 69,5 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 3.453 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 33.758 anonymen Paarvergleichen. | 1.461,115 95-%-Konfidenzintervall: ±10,144Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.471,886 95-%-Konfidenzintervall: ±4,729Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MedCodeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner44,712 % | 40,771 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
MedScribeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner86,534 % | 83,534 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner89,4 % | 86,714 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
SkillsBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | Gewinner55,766 % | 45,077 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner95,6 % | 82,8 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 71,096 % | Gewinner73,344 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner78,277 % | 67,79 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Vals IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: weighted index scoreBewertung: Mehr ist besser | Gewinner59,167 % | 53,122 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Vibe Code Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | Gewinner76,239 % | 63,961 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 705 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 6.609 anonymen Paarvergleichen. | Höherer Messwert1.467,318 95-%-Konfidenzintervall: ±22,146Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.460,145 95-%-Konfidenzintervall: ±8,046Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlChineseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 291 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.084 anonymen Paarvergleichen. | Höherer Messwert1.538,386 95-%-Konfidenzintervall: ±33,69Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.516,828 95-%-Konfidenzintervall: ±13,481Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCodingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 838 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 9.517 anonymen Paarvergleichen. | Höherer Messwert1.510,751 95-%-Konfidenzintervall: ±20,826Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.509,051 95-%-Konfidenzintervall: ±7,106Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCreative writingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 651 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 6.464 anonymen Paarvergleichen. | Höherer Messwert1.458,096 95-%-Konfidenzintervall: ±23,926Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.452,152 95-%-Konfidenzintervall: ±8,384Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.434 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 14.493 anonymen Paarvergleichen. | 1.459,46 95-%-Konfidenzintervall: ±15,407Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.479,42 95-%-Konfidenzintervall: ±6,007Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 777 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 8.237 anonymen Paarvergleichen. | Höherer Messwert1.443,149 95-%-Konfidenzintervall: ±21,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,6 95-%-Konfidenzintervall: ±7,595Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 2.522 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 25.084 anonymen Paarvergleichen. | 1.465,128 95-%-Konfidenzintervall: ±14,002Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.480,216 95-%-Konfidenzintervall: ±6,156Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 401 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 3.611 anonymen Paarvergleichen. | 1.479,844 95-%-Konfidenzintervall: ±28,841Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.490,497 95-%-Konfidenzintervall: ±10,359Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 2.312 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 22.303 anonymen Paarvergleichen. | 1.484,219 95-%-Konfidenzintervall: ±12,5Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.492,244 95-%-Konfidenzintervall: ±5,461Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 927 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 9.760 anonymen Paarvergleichen. | 1.475,235 95-%-Konfidenzintervall: ±19,394Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.493,409 95-%-Konfidenzintervall: ±6,978Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.223 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 11.818 anonymen Paarvergleichen. | 1.458,276 95-%-Konfidenzintervall: ±17,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.465,971 95-%-Konfidenzintervall: ±6,527Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 284 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.729 anonymen Paarvergleichen. | 1.475,664 95-%-Konfidenzintervall: ±33,128Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.480,415 95-%-Konfidenzintervall: ±11,911Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 512 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.513 anonymen Paarvergleichen. | Höherer Messwert1.492,359 95-%-Konfidenzintervall: ±25,684Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.490,799 95-%-Konfidenzintervall: ±8,502Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.609 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 15.559 anonymen Paarvergleichen. | 1.478,218 95-%-Konfidenzintervall: ±15,132Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.482,088 95-%-Konfidenzintervall: ±6,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 216 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.562 anonymen Paarvergleichen. | 1.426,012 95-%-Konfidenzintervall: ±40,021Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.475,761 95-%-Konfidenzintervall: ±14,884Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 212 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.839 anonymen Paarvergleichen. | 1.456,037 95-%-Konfidenzintervall: ±39,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.485,86 95-%-Konfidenzintervall: ±14,134Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 225 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen. | 1.460,477 95-%-Konfidenzintervall: ±37,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.485,043 95-%-Konfidenzintervall: ±12,667Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 569 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.576 anonymen Paarvergleichen. | 1.446,12 95-%-Konfidenzintervall: ±25,079Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.468,85 95-%-Konfidenzintervall: ±8,633Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 2.019 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 19.262 anonymen Paarvergleichen. | 1.456,123 95-%-Konfidenzintervall: ±13,128Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.457,477 95-%-Konfidenzintervall: ±5,556Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlRussianTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 413 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 3.522 anonymen Paarvergleichen. | 1.446,297 95-%-Konfidenzintervall: ±28,9Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.466,024 95-%-Konfidenzintervall: ±10,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.379 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 13.508 anonymen Paarvergleichen. | Höherer Messwert1.503,685 95-%-Konfidenzintervall: ±16,15Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.500,839 95-%-Konfidenzintervall: ±6,248Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 921 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 8.835 anonymen Paarvergleichen. | 1.445,223 95-%-Konfidenzintervall: ±19,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.456,422 95-%-Konfidenzintervall: ±7,279Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Grok 4.6 und GLM-5.2 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.