Zum Hauptinhalt springen

Direktvergleich

Claude Opus 5 vs. DeepSeek-V4-Flash

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

35

gemeinsame Messreihen

3

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Claude Opus 5 und DeepSeek-V4-Flash
MerkmalClaude Opus 5DeepSeek-V4-Flash
AnbieterAnthropicDeepSeek
Erschienen24. Juli 202624. Apr. 2026
VerfügbarkeitAktivPreview
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht284 Mrd., 13 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster1.000.000 Token1.000.000 Token
WissensstandMai 2026Nicht veröffentlicht
Technische QuellenModell, WissensstandModell
API-Preise pro 1 Mio. Token
API-Eingabe5 $0,14 $
API-Ausgabe25 $0,28 $
Cache lesen0,5 $0, $
Cache schreiben (5 Min.)6,25 $Nicht ausgewiesen
Cache schreiben (1 Std.)10 $Nicht ausgewiesen
Preis geprüft30.07.2026Quelle30.07.2026Quelle
Claude Opus 5DeepSeek-V4-Flash
API-EingabeUSD pro 1 Mio. Token, Basistarif
Claude Opus 55 $
DeepSeek-V4-Flash0,14 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Claude Opus 525 $
DeepSeek-V4-Flash0,28 $Günstiger
Cache lesenUSD pro 1 Mio. Token, Basistarif
Claude Opus 50,5 $
DeepSeek-V4-Flash0,003 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

35 gemeinsame Messreihen
Claude Opus 5DeepSeek-V4-Flash
AlmanBench v0.1Accepted cases. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 594,947 %Gewinner
DeepSeek-V4-Flash93,003 %
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.493,745 Arena-PunkteGewinner
DeepSeek-V4-Flash1.438,304 Arena-Punkte
CyberBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 540,678 %
DeepSeek-V4-Flash66,716 %Gewinner
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.488,821 Arena-PunkteGewinner
DeepSeek-V4-Flash1.435,23 Arena-Punkte
CyberBenchPatch. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 581,356 %Gewinner
DeepSeek-V4-Flash72,414 %
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.575,542 Arena-PunkteGewinner
DeepSeek-V4-Flash1.481,177 Arena-Punkte
CyberBenchPoC. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 50 %
DeepSeek-V4-Flash61,017 %Gewinner
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.530,655 Arena-PunkteGewinner
DeepSeek-V4-Flash1.479,521 Arena-Punkte
Arena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.478,457 Arena-PunkteGewinner
DeepSeek-V4-Flash1.408,648 Arena-Punkte
Arena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.494,995 Arena-PunkteGewinner
DeepSeek-V4-Flash1.450,015 Arena-Punkte
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.466,098 Arena-PunkteGewinner
DeepSeek-V4-Flash1.405,113 Arena-Punkte
Arena Text, Style ControlExcluding ties. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Claude Opus 51.508,465 Arena-PunkteGewinner
DeepSeek-V4-Flash1.435,522 Arena-Punkte
Benchmarkwerte von Claude Opus 5 und DeepSeek-V4-Flash
Benchmark und AufgabeClaude Opus 5DeepSeek-V4-FlashVergleichbarkeitQuelle
AlmanBench v0.1Accepted casesReasoning: max
94,947 %Gewinner
93,003 %
v0.1, results commit f34ddbfaccepted casesMehr ist besserKohorte: almanbench-v0-1:official:overallKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Reasoning: max
DeepSeek-V4-Flash: Reasoning: max
1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation.
Alman InstitutTyp: Unabhängige EvaluationMessstand: 05.08.2026Import-ID: curated-alman-institut-2026-08-09-dae32c26388f / curated-alman-institut-2026-08-09-743e705129f5Abgerufen am 09.08.2026
Arena Text, Style ControlOverallReasoning: high
1.493,745 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.438,304 Arena-Punkte
95-%-Konfidenzintervall: ±4,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 19.792 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.789 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
CyberBenchOverall
40,678 %
66,716 %Gewinner
1accuracyMehr ist besserKohorte: vals-cyberbench:1:overallKein dokumentierter Setup-UnterschiedSieger: DeepSeek-V4-FlashClaude Opus 5: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-16-702acaee9aa9Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and financeReasoning: high
1.488,821 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,372Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,23 Arena-Punkte
95-%-Konfidenzintervall: ±7,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 3.811 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.055 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
CyberBenchPatch
81,356 %Gewinner
72,414 %
1accuracyMehr ist besserKohorte: vals-cyberbench:1:patchKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-11-1f20498a3dc1Abgerufen am 11.08.2026
Arena Text, Style ControlChineseReasoning: high
1.575,542 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±17,296Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.481,177 Arena-Punkte
95-%-Konfidenzintervall: ±12,66Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 1.411 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.529 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
CyberBenchPoC
0 %
61,017 %Gewinner
1accuracyMehr ist besserKohorte: vals-cyberbench:1:pocKein dokumentierter Setup-UnterschiedSieger: DeepSeek-V4-FlashClaude Opus 5: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-11-1f20498a3dc1Abgerufen am 11.08.2026
Arena Text, Style ControlCodingReasoning: high
1.530,655 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,967Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,521 Arena-Punkte
95-%-Konfidenzintervall: ±6,432Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 5.388 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.353 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writingReasoning: high
1.478,457 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,296Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,648 Arena-Punkte
95-%-Konfidenzintervall: ±7,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 4.082 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.019 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglishReasoning: high
1.494,995 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,427Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.450,015 Arena-Punkte
95-%-Konfidenzintervall: ±5,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 8.123 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.774 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and mediaReasoning: high
1.466,098 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,312Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,113 Arena-Punkte
95-%-Konfidenzintervall: ±7,086Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 5.063 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.654 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding tiesReasoning: high
1.508,465 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,522 Arena-Punkte
95-%-Konfidenzintervall: ±5,476Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 15.069 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.085 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert promptsReasoning: high
1.539,237 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±13,413Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.467,529 Arena-Punkte
95-%-Konfidenzintervall: ±9,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 2.255 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.924 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrenchReasoning: high
1.500,695 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±24,101Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,295 Arena-Punkte
95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 674 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.884 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGermanReasoning: high
1.498,048 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±35,155Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,281 Arena-Punkte
95-%-Konfidenzintervall: ±21,205Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 292 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 872 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard promptsReasoning: high
1.519,69 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,436Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,18 Arena-Punkte
95-%-Konfidenzintervall: ±4,95Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 13.214 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.535 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, EnglishReasoning: high
1.519,955 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,892Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.464,963 Arena-Punkte
95-%-Konfidenzintervall: ±6,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 5.370 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.145 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction followingReasoning: high
1.498,339 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,165 Arena-Punkte
95-%-Konfidenzintervall: ±6,039Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 7.090 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.841 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.481,552 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±37,236Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,126 Arena-Punkte
95-%-Konfidenzintervall: ±25,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 628 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapaneseReasoning: high
1.481,552 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±37,236Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,789 Arena-Punkte
95-%-Konfidenzintervall: ±26,437Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedKein klarer VorsprungClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 595 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKoreanReasoning: high
1.479,012 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±29,274Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.375,542 Arena-Punkte
95-%-Konfidenzintervall: ±21,534Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 438 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and governmentReasoning: high
1.514,502 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,238 Arena-Punkte
95-%-Konfidenzintervall: ±10,278Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 1.650 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.876 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social scienceReasoning: high
1.514,892 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,683Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.461,582 Arena-Punkte
95-%-Konfidenzintervall: ±7,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 3.447 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.985 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queriesReasoning: high
1.507,154 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,411Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.449,175 Arena-Punkte
95-%-Konfidenzintervall: ±5,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 9.479 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.682 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathReasoning: high
1.524,546 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±20,219Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,663 Arena-Punkte
95-%-Konfidenzintervall: ±12,368Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 915 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professionsReasoning: high
1.540,168 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±19,218Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.441,422 Arena-Punkte
95-%-Konfidenzintervall: ±12,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 1.064 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.588 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcareReasoning: high
1.501,189 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,955Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.463,011 Arena-Punkte
95-%-Konfidenzintervall: ±10,889Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 1.529 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.505 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turnReasoning: high
1.490,073 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±11,259Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.446,059 Arena-Punkte
95-%-Konfidenzintervall: ±7,528Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 3.169 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.708 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-EnglishReasoning: high
1.486,08 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,582Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,674 Arena-Punkte
95-%-Konfidenzintervall: ±5,146Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 11.669 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.013 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.498,593 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±33,628Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,239 Arena-Punkte
95-%-Konfidenzintervall: ±18,981Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 305 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.007 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolishReasoning: high
1.498,593 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±33,628Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.429,767 Arena-Punkte
95-%-Konfidenzintervall: ±18,83Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 305 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.019 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussianReasoning: high
1.498,889 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±13,596Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,146 Arena-Punkte
95-%-Konfidenzintervall: ±9,061Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 2.133 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.232 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT servicesReasoning: high
1.524,68 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,269 Arena-Punkte
95-%-Konfidenzintervall: ±5,679Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 7.730 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.086 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanishReasoning: high
1.483,936 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±27,307Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,679 Arena-Punkte
95-%-Konfidenzintervall: ±17,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 502 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.427 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and languageReasoning: high
1.489,379 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,922Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,414 Arena-Punkte
95-%-Konfidenzintervall: ±6,736Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: Claude Opus 5Claude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
Claude Opus 5: Stilbereinigte Arena-Bewertung aus 5.451 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.864 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.