Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
gemeinsame Messreihen
79
verschiedene Benchmarks
22
jüngster Abruf
29.09.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
DeepSeek-V4-Pro: Spitzenpreise sind 1,32 $ Eingabe / 3,96 $ Ausgabe pro 1 Mio. Token während Mo, Di, Mi, Do, Fr, 01:00-04:00 UTC; Mo, Di, Mi, Do, Fr, 06:00-10:00 UTC; zu allen anderen Zeiten gelten Off-Peak-Preise.
Grok 4.6DeepSeek-V4-Pro
API-EingabeUSD pro 1 Mio. Token, Basistarif
Grok 4.62 $
DeepSeek-V4-ProGünstiger0,66 $
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Grok 4.66 $
DeepSeek-V4-ProGünstiger1,98 $
Cache lesenUSD pro 1 Mio. Token, Basistarif
Grok 4.60,5 $
DeepSeek-V4-ProGünstiger0,022 $
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
Grok 4.6
DeepSeek-V4-Pro
Coding: 100 / 80,6 (5 Benchmarkfamilien)
Reasoning: 99,9 / 97 (2 Benchmarkfamilien)
Mathematik: 99,6 / 65,4 (2 Benchmarkfamilien)
Wissen: 100 / 98,6 (2 Benchmarkfamilien)
Finanzen: 99,8 / 90 (6 Benchmarkfamilien)
Recht: 99,6 / 66,2 (4 Benchmarkfamilien)
Agenten-Aufgaben: 100 / 78 (2 Benchmarkfamilien)
Produktivität: 100 / 94,1 (1 Benchmarkfamilie)
50 passende Messreihen aus 22 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 11 vergleichbaren Kategorien.
Grok 4.6DeepSeek-V4-Pro
Code MigrationOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner44,572 %
DeepSeek-V4-Pro26,201 %
CorpFin v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner66,161 %
DeepSeek-V4-Pro61,383 %
EMBOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner62,727 %
DeepSeek-V4-Pro51,623 %
Finance Agent (v2)Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner53,682 %
DeepSeek-V4-Pro44,083 %
GPQA DiamondOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner94,697 %
DeepSeek-V4-Pro89,394 %
Harvey's Legal Agent BenchmarkOverall · Task fully resolved. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner15,833 %
DeepSeek-V4-Pro3,75 %
Legal Research BenchOverall · All-pass. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner48,077 %
DeepSeek-V4-Pro23,077 %
LegalBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner86,307 %
DeepSeek-V4-Pro80,323 %
LiveCodeBench v6Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner88,224 %
DeepSeek-V4-Pro87,484 %
LMArena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
Grok 4.61.453,397
DeepSeek-V4-ProHöherer Messwert1.457,519
MedCodeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner44,712 %
DeepSeek-V4-Pro40,455 %
MedScribeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.6Gewinner86,534 %
DeepSeek-V4-Pro75,144 %
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Benchmarkwerte von Grok 4.6 und DeepSeek-V4-Pro
Benchmark und Aufgabe
Grok 4.6
DeepSeek-V4-Pro
Quelle
Code MigrationOverallTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 21.380 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 57.564 anonymen Paarvergleichen.
1.453,397
95-%-Konfidenzintervall: ±5,242Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.457,519
95-%-Konfidenzintervall: ±3,905Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 21.380 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 54.884 anonymen Paarvergleichen.
1.453,397
95-%-Konfidenzintervall: ±5,242Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.454,675
95-%-Konfidenzintervall: ±3,973Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlBusiness, management and financeTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 4.164 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.411 anonymen Paarvergleichen.
1.447,416
95-%-Konfidenzintervall: ±9,612Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.459,704
95-%-Konfidenzintervall: ±6,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlBusiness, management and financeTestdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 4.164 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.076 anonymen Paarvergleichen.
1.447,416
95-%-Konfidenzintervall: ±9,612Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.448,077
95-%-Konfidenzintervall: ±6,825Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.707 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.408 anonymen Paarvergleichen.
Höherer Messwert1.502,981
95-%-Konfidenzintervall: ±14,739Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.488,151
95-%-Konfidenzintervall: ±10,761Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.707 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.360 anonymen Paarvergleichen.
Kein klarer Vorsprung1.502,981
95-%-Konfidenzintervall: ±14,739Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.499,718
95-%-Konfidenzintervall: ±10,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 5.539 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 17.165 anonymen Paarvergleichen.
Höherer Messwert1.507,402
95-%-Konfidenzintervall: ±8,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.500,462
95-%-Konfidenzintervall: ±5,93Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 5.539 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 16.030 anonymen Paarvergleichen.
Gewinner1.507,402
95-%-Konfidenzintervall: ±8,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.487,781
95-%-Konfidenzintervall: ±6,099Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 4.559 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.697 anonymen Paarvergleichen.
1.444,507
95-%-Konfidenzintervall: ±9,71Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.445,978
95-%-Konfidenzintervall: ±7,296Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 4.559 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.329 anonymen Paarvergleichen.
Kein klarer Vorsprung1.444,507
95-%-Konfidenzintervall: ±9,71Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,486
95-%-Konfidenzintervall: ±7,37Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 8.594 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 25.176 anonymen Paarvergleichen.
1.456,489
95-%-Konfidenzintervall: ±7,091Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.467,134
95-%-Konfidenzintervall: ±5,13Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 8.594 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 23.891 anonymen Paarvergleichen.
1.456,489
95-%-Konfidenzintervall: ±7,091Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.466,543
95-%-Konfidenzintervall: ±5,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlEntertainment, sports and mediaTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 5.466 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 12.738 anonymen Paarvergleichen.
Höherer Messwert1.440,971
95-%-Konfidenzintervall: ±8,913Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,725
95-%-Konfidenzintervall: ±6,63Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlEntertainment, sports and mediaTestdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 5.466 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 12.346 anonymen Paarvergleichen.
Kein klarer Vorsprung1.440,971
95-%-Konfidenzintervall: ±8,913Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,889
95-%-Konfidenzintervall: ±6,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 15.795 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 43.577 anonymen Paarvergleichen.
1.455,675
95-%-Konfidenzintervall: ±6,93Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.461,31
95-%-Konfidenzintervall: ±5,137Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 15.795 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 41.744 anonymen Paarvergleichen.
1.455,675
95-%-Konfidenzintervall: ±6,93Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.456,705
95-%-Konfidenzintervall: ±5,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 2.489 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.925 anonymen Paarvergleichen.
Höherer Messwert1.489,565
95-%-Konfidenzintervall: ±12,215Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,666
95-%-Konfidenzintervall: ±8,43Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 2.489 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.532 anonymen Paarvergleichen.
Kein klarer Vorsprung1.489,565
95-%-Konfidenzintervall: ±12,215Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.475,361
95-%-Konfidenzintervall: ±8,612Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 574 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.215 anonymen Paarvergleichen.
Höherer Messwert1.488,187
95-%-Konfidenzintervall: ±25,71Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.485,521
95-%-Konfidenzintervall: ±14,661Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 574 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.075 anonymen Paarvergleichen.
Kein klarer Vorsprung1.488,187
95-%-Konfidenzintervall: ±25,71Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.469,327
95-%-Konfidenzintervall: ±14,782Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 387 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.001 anonymen Paarvergleichen.
1.455,753
95-%-Konfidenzintervall: ±30,673Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.468,915
95-%-Konfidenzintervall: ±19,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 387 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 928 anonymen Paarvergleichen.
1.455,753
95-%-Konfidenzintervall: ±30,673Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.460,563
95-%-Konfidenzintervall: ±20,112Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 14.049 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 38.586 anonymen Paarvergleichen.
1.478,04
95-%-Konfidenzintervall: ±6,111Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.479,844
95-%-Konfidenzintervall: ±4,586Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 14.049 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 36.977 anonymen Paarvergleichen.
Kein klarer Vorsprung1.478,04
95-%-Konfidenzintervall: ±6,111Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,564
95-%-Konfidenzintervall: ±4,651Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 5.649 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 17.828 anonymen Paarvergleichen.
1.475,829
95-%-Konfidenzintervall: ±8,469Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.484,732
95-%-Konfidenzintervall: ±5,864Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 5.649 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 16.866 anonymen Paarvergleichen.
1.475,829
95-%-Konfidenzintervall: ±8,469Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.482,695
95-%-Konfidenzintervall: ±5,961Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 7.687 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 20.066 anonymen Paarvergleichen.
1.450,943
95-%-Konfidenzintervall: ±7,537Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.452,218
95-%-Konfidenzintervall: ±5,588Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 7.687 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 19.090 anonymen Paarvergleichen.
Kein klarer Vorsprung1.450,943
95-%-Konfidenzintervall: ±7,537Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.447,932
95-%-Konfidenzintervall: ±5,678Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 350 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 714 anonymen Paarvergleichen.
1.408,852
95-%-Konfidenzintervall: ±33,025Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.458,192
95-%-Konfidenzintervall: ±23,983Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 350 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 677 anonymen Paarvergleichen.
1.408,852
95-%-Konfidenzintervall: ±33,025Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.428,912
95-%-Konfidenzintervall: ±24,225Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 406 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.105 anonymen Paarvergleichen.
Höherer Messwert1.428,58
95-%-Konfidenzintervall: ±30,047Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.417,865
95-%-Konfidenzintervall: ±19,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 406 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 981 anonymen Paarvergleichen.
1.428,58
95-%-Konfidenzintervall: ±30,047Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.434,201
95-%-Konfidenzintervall: ±19,922Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLegal and governmentTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.884 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 4.506 anonymen Paarvergleichen.
1.452,3
95-%-Konfidenzintervall: ±14,019Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.473,908
95-%-Konfidenzintervall: ±9,549Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLegal and governmentTestdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.884 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 4.328 anonymen Paarvergleichen.
1.452,3
95-%-Konfidenzintervall: ±14,019Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.473,362
95-%-Konfidenzintervall: ±9,718Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLife, physical and social scienceTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 3.518 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.173 anonymen Paarvergleichen.
1.471,756
95-%-Konfidenzintervall: ±10,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.480,892
95-%-Konfidenzintervall: ±7,148Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLife, physical and social scienceTestdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 3.518 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.814 anonymen Paarvergleichen.
1.471,756
95-%-Konfidenzintervall: ±10,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.479,862
95-%-Konfidenzintervall: ±7,218Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 10.166 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 25.983 anonymen Paarvergleichen.
Höherer Messwert1.471,292
95-%-Konfidenzintervall: ±6,966Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.471,226
95-%-Konfidenzintervall: ±5,337Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 10.166 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 24.788 anonymen Paarvergleichen.
Kein klarer Vorsprung1.471,292
95-%-Konfidenzintervall: ±6,966Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.464,401
95-%-Konfidenzintervall: ±5,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.019 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.058 anonymen Paarvergleichen.
1.442,604
95-%-Konfidenzintervall: ±18,439Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.444,744
95-%-Konfidenzintervall: ±11,133Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.019 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.708 anonymen Paarvergleichen.
1.442,604
95-%-Konfidenzintervall: ±18,439Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.465,899
95-%-Konfidenzintervall: ±11,797Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.259 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.296 anonymen Paarvergleichen.
Höherer Messwert1.483,156
95-%-Konfidenzintervall: ±16,859Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.459,871
95-%-Konfidenzintervall: ±10,89Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.259 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.993 anonymen Paarvergleichen.
Kein klarer Vorsprung1.483,156
95-%-Konfidenzintervall: ±16,859Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.467,456
95-%-Konfidenzintervall: ±11,459Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlMedicine and healthcareTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style controlGrok 4.6: Stilbereinigte Arena-Bewertung aus 1.465 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 4.069 anonymen Paarvergleichen.
1.461,875
95-%-Konfidenzintervall: ±15,828Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Höherer Messwert1.477,327
95-%-Konfidenzintervall: ±10,122Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Eigene Modelltests
Unsere Tests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Pelikan auf dem Fahrrad
Community-Klassiker für eine freie SVG-Zeichnung.
Grok 4.6
In diesem Testlauf war kein API-Zugang verfügbar. Das Modell wurde nicht bewertet.
Reasoning (angefragt): high
Erster Versuch
Datum des Testlaufs
07.09.2026
API-Anbieter
openrouter
Angefragtes API-Modell
x-ai/grok-4.6
Reasoning-Einstellung
high
Festgelegter Endpunkt
xAI | x-ai/grok-4.6-20260810
Temperatur
Anbieterstandard
Tokenlimit inklusive Reasoning
8.192 Token
Testprotokoll
community-visual-tests-v1
Technische Prüfung
Nicht ausgeführt
Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.
DeepSeek-V4-Pro
In diesem Testlauf war kein API-Zugang verfügbar. Das Modell wurde nicht bewertet.
Reasoning (angefragt): high
Erster Versuch
Datum des Testlaufs
07.09.2026
API-Anbieter
openrouter
Angefragtes API-Modell
deepseek/deepseek-v4-pro-0813
Reasoning-Einstellung
high
Festgelegter Endpunkt
DeepSeek | deepseek/deepseek-v4-pro-20260813
Temperatur
Anbieterstandard
Tokenlimit inklusive Reasoning
8.192 Token
Testprotokoll
community-visual-tests-v1
Technische Prüfung
Nicht ausgeführt
Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Grok 4.6 und DeepSeek-V4-Pro mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.