Zum Hauptinhalt springen

Direktvergleich

Grok 4.6 vs. DeepSeek-V4-Pro

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

58

gemeinsame Messreihen

21

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Grok 4.6 und DeepSeek-V4-Pro
MerkmalGrok 4.6DeepSeek-V4-Pro
AnbieterxAIDeepSeek
Erschienen12. Aug. 202624. Apr. 2026
VerfügbarkeitAktivPreview
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht1,6 Billionen, 49 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster500.000 Token1.000.000 Token
Wissensstand1. Februar 2026Nicht veröffentlicht
Technische QuellenModellModell, Kontext
API-Preise pro 1 Mio. Token
API-Eingabe2 $ ≤200K / 4 $ >200K0,43 $
API-Ausgabe6 $ ≤200K / 12 $ >200K0,87 $
Cache lesen0,5 $ ≤200K / 1 $ >200K0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft16.08.2026Quelle30.07.2026Quelle
Grok 4.6DeepSeek-V4-Pro
API-EingabeUSD pro 1 Mio. Token, Basistarif
Grok 4.62 $
DeepSeek-V4-Pro0,435 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Grok 4.66 $
DeepSeek-V4-Pro0,87 $Günstiger
Cache lesenUSD pro 1 Mio. Token, Basistarif
Grok 4.60,5 $
DeepSeek-V4-Pro0,004 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

58 gemeinsame Messreihen
Grok 4.6DeepSeek-V4-Pro
Arena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
Grok 4.61.464,323 Arena-PunkteHöherer Messwert
DeepSeek-V4-Pro1.458,103 Arena-Punkte
Code MigrationOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.644,572 %Gewinner
DeepSeek-V4-Pro26,201 %
CorpFin v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.666,161 %Gewinner
DeepSeek-V4-Pro61,383 %
EMBOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.662,727 %Gewinner
DeepSeek-V4-Pro51,623 %
Finance Agent (v2)Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.653,682 %Gewinner
DeepSeek-V4-Pro44,083 %
GPQA DiamondOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.694,697 %Gewinner
DeepSeek-V4-Pro89,394 %
Harvey's Legal Agent BenchmarkOverall · Task fully resolved. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.615,833 %Gewinner
DeepSeek-V4-Pro3,75 %
Legal Research BenchOverall · All-pass. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.648,077 %Gewinner
DeepSeek-V4-Pro23,077 %
LegalBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.686,307 %Gewinner
DeepSeek-V4-Pro80,323 %
LiveCodeBench v6Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.688,224 %Gewinner
DeepSeek-V4-Pro87,484 %
MedCodeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.644,712 %Gewinner
DeepSeek-V4-Pro40,455 %
MedScribeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.686,534 %Gewinner
DeepSeek-V4-Pro75,144 %
Benchmarkwerte von Grok 4.6 und DeepSeek-V4-Pro
Benchmark und AufgabeGrok 4.6DeepSeek-V4-ProVergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.464,323 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±11,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,103 Arena-Punkte
95-%-Konfidenzintervall: ±4,022Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 54.288 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Code MigrationOverall
44,572 %Gewinner
26,201 %
1accuracyMehr ist besserKohorte: vals-code-migration:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-code-migration-2026-08-16-107652dc6bfcAbgerufen am 16.08.2026
CorpFin v2Overall
66,161 %Gewinner
61,383 %
2accuracyMehr ist besserKohorte: vals-corp-fin-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-corp_fin_v2-2026-08-16-45bbf84f57abAbgerufen am 16.08.2026
EMBOverall
62,727 %Gewinner
51,623 %
1accuracyMehr ist besserKohorte: vals-emb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-emb-2026-08-16-68d5d1d47a97Abgerufen am 16.08.2026
Finance Agent (v2)Overall
53,682 %Gewinner
44,083 %
2accuracyMehr ist besserKohorte: vals-finance-agent-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-fabv2-2026-08-16-8853da43085dAbgerufen am 16.08.2026
GPQA DiamondOverall
94,697 %Gewinner
89,394 %
1accuracyMehr ist besserKohorte: vals-gpqa:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-gpqa-2026-08-16-7f8363eaa2dbAbgerufen am 16.08.2026
Harvey's Legal Agent BenchmarkOverall · Task fully resolved
15,833 %Gewinner
3,75 %
1task resolution rateMehr ist besserKohorte: vals-legal-agent-benchmark:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-hlab-2026-08-16-bae90566df2fAbgerufen am 16.08.2026
Legal Research BenchOverall · All-pass
48,077 %Gewinner
23,077 %
1all-pass rateMehr ist besserKohorte: vals-legal-research:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-legal_research-2026-08-16-af296c00ecaaAbgerufen am 16.08.2026
LegalBenchOverall
86,307 %Gewinner
80,323 %
1accuracyMehr ist besserKohorte: vals-legal-bench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-legal_bench-2026-08-16-d5b3b1b2b5c8Abgerufen am 16.08.2026
LiveCodeBench v6Overall
88,224 %Gewinner
87,484 %
1accuracyMehr ist besserKohorte: vals-lcb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-lcb-2026-08-16-17b9c147080dAbgerufen am 16.08.2026
MedCodeOverall
44,712 %Gewinner
40,455 %
1accuracyMehr ist besserKohorte: vals-medcode:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medcode-2026-08-16-524f7f474eacAbgerufen am 16.08.2026
MedScribeOverall
86,534 %Gewinner
75,144 %
1accuracyMehr ist besserKohorte: vals-medscribe:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medscribe-2026-08-16-c385354a7e62Abgerufen am 16.08.2026
MMLU-ProOverall
89,4 %Gewinner
87,249 %
1accuracyMehr ist besserKohorte: vals-mmlu-pro:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-mmlu_pro-2026-08-16-e14d5bb3a34cAbgerufen am 16.08.2026
ProofBenchOverall
51 %Gewinner
16 %
1.1accuracyMehr ist besserKohorte: vals-proof-bench:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-proof_bench-2026-08-16-14232db24de1Abgerufen am 16.08.2026
Public Benefits Bench v1.1Overall
66,847 %Gewinner
62,923 %
1.1accuracyMehr ist besserKohorte: vals-snap:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-public-benefits-bench-2026-08-16-7ce68123c502Abgerufen am 16.08.2026
SkillsBenchOverall
55,766 %Gewinner
51,274 %
1accuracyMehr ist besserKohorte: vals-skillsbench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Harness: OpenHands
DeepSeek-V4-Pro: Harness: OpenHands
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-skillsbench-2026-08-16-4917a67268d2Abgerufen am 16.08.2026
SWE-bench VerifiedOverall
95,6 %Gewinner
77,4 %
1accuracyMehr ist besserKohorte: vals-swebench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-swebench-2026-08-16-c133071b8167Abgerufen am 16.08.2026
TaxEval v2Overall
71,096 %
72,077 %Gewinner
2accuracyMehr ist besserKohorte: vals-tax-eval-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: DeepSeek-V4-ProGrok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-tax_eval_v2-2026-08-16-5bbd495dac53Abgerufen am 16.08.2026
Terminal-Bench 2.1Overall
78,277 %Gewinner
50,187 %
2.1accuracyMehr ist besserKohorte: vals-terminal-bench-2-1:2.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-terminal-bench-2-1-2026-08-16-b3f38c18bea4Abgerufen am 16.08.2026
Vals IndexOverall
59,167 %Gewinner
42,888 %
2weighted index scoreMehr ist besserKohorte: vals-vals-index:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Pro: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-vals_index-2026-08-16-ab641d89d6edAbgerufen am 16.08.2026
Vibe Code Bench v1.1Overall
76,239 %Gewinner
49,931 %
1.1accuracyMehr ist besserKohorte: vals-vibe-code-bench:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Harness: OpenHands
DeepSeek-V4-Pro: Harness: OpenHands
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-vibe-code-2026-08-16-a73c9770bcc4Abgerufen am 16.08.2026
Arena Text, Style ControlOverallReasoning: high
1.464,323 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±11,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.455,61 Arena-Punkte
95-%-Konfidenzintervall: ±4,089Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 51.670 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.455,102 Arena-Punkte
95-%-Konfidenzintervall: ±27,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.460,638 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,951Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 442 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 10.715 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and financeReasoning: high
1.455,102 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±27,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.447,754 Arena-Punkte
95-%-Konfidenzintervall: ±7,037Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 442 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 10.363 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.535,167 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±39,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.494,914 Arena-Punkte
95-%-Konfidenzintervall: ±12,109Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 215 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.881 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChineseReasoning: high
1.535,167 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±39,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.500,632 Arena-Punkte
95-%-Konfidenzintervall: ±12,361Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 215 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.780 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.511,77 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±26,72Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.502,053 Arena-Punkte
95-%-Konfidenzintervall: ±6,098Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 485 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 16.219 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCodingReasoning: high
1.511,77 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±26,72Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.488,583 Arena-Punkte
95-%-Konfidenzintervall: ±6,254Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 485 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 15.137 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.472,894 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,578Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,32 Arena-Punkte
95-%-Konfidenzintervall: ±7,549Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 379 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.993 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writingReasoning: high
1.472,894 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±31,578Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,915 Arena-Punkte
95-%-Konfidenzintervall: ±7,633Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 379 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.630 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.459,266 Arena-Punkte
95-%-Konfidenzintervall: ±18,461Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.467,841 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,232Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 23.938 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglishReasoning: high
1.459,266 Arena-Punkte
95-%-Konfidenzintervall: ±18,461Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.466,432 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,282Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 22.716 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.455,476 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±28,81Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,546 Arena-Punkte
95-%-Konfidenzintervall: ±6,838Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 448 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.864 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and mediaReasoning: high
1.455,476 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±28,81Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,998 Arena-Punkte
95-%-Konfidenzintervall: ±6,917Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 448 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.417 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.469,633 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±16,492Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.461,846 Arena-Punkte
95-%-Konfidenzintervall: ±5,269Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.782 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 41.089 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding tiesReasoning: high
1.469,633 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±16,492Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.457,694 Arena-Punkte
95-%-Konfidenzintervall: ±5,283Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.782 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 39.206 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.479,969 Arena-Punkte
95-%-Konfidenzintervall: ±34,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.482,281 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 272 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.438 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert promptsReasoning: high
1.479,969 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±34,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.474,832 Arena-Punkte
95-%-Konfidenzintervall: ±9,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 272 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.066 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.488,551 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.480,536 Arena-Punkte
95-%-Konfidenzintervall: ±4,713Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 36.125 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard promptsReasoning: high
1.488,551 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±15,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.474,247 Arena-Punkte
95-%-Konfidenzintervall: ±4,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 34.588 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.472,181 Arena-Punkte
95-%-Konfidenzintervall: ±25,031Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.484,514 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,003Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 16.817 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, EnglishReasoning: high
1.472,181 Arena-Punkte
95-%-Konfidenzintervall: ±25,031Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.482,312 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,088Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 15.915 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.460,755 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±21,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,655 Arena-Punkte
95-%-Konfidenzintervall: ±5,745Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 732 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 18.719 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction followingReasoning: high
1.460,755 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.449,35 Arena-Punkte
95-%-Konfidenzintervall: ±5,839Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 732 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 17.752 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.497,908 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,96Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.481,533 Arena-Punkte
95-%-Konfidenzintervall: ±7,371Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 335 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.617 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social scienceReasoning: high
1.497,908 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±31,96Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.478,57 Arena-Punkte
95-%-Konfidenzintervall: ±7,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 335 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.168 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.485,451 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.472,734 Arena-Punkte
95-%-Konfidenzintervall: ±5,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.103 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 24.005 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queriesReasoning: high
1.485,451 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±18,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.466,572 Arena-Punkte
95-%-Konfidenzintervall: ±5,598Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.103 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 22.884 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.444,26 Arena-Punkte
95-%-Konfidenzintervall: ±31,774Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.477,081 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,236Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 352 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.808 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turnReasoning: high
1.444,26 Arena-Punkte
95-%-Konfidenzintervall: ±31,774Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.455,791 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 352 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.151 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.461,99 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,283 Arena-Punkte
95-%-Konfidenzintervall: ±4,853Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.450 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 30.350 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-EnglishReasoning: high
1.461,99 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.441,433 Arena-Punkte
95-%-Konfidenzintervall: ±4,93Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.450 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 28.950 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.446,737 Arena-Punkte
95-%-Konfidenzintervall: ±34,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,488 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,692Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.725 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussianReasoning: high
1.446,737 Arena-Punkte
95-%-Konfidenzintervall: ±34,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.459,053 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±8,778Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.573 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.511,885 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±20,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.492,65 Arena-Punkte
95-%-Konfidenzintervall: ±5,414Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 805 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 22.338 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT servicesReasoning: high
1.511,885 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±20,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.483,295 Arena-Punkte
95-%-Konfidenzintervall: ±5,497Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 805 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 21.186 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.455,393 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±25,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.451,594 Arena-Punkte
95-%-Konfidenzintervall: ±6,517Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 13.160 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and languageReasoning: high
1.455,393 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±25,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.443,409 Arena-Punkte
95-%-Konfidenzintervall: ±6,601Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 12.742 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.