Direktvergleich
Claude Opus 5 vs. DeepSeek-V4-Flash
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 33
- verschiedene Benchmarks
- 3
- jüngster Abruf
- 04.09.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Claude Opus 5 | DeepSeek-V4-Flash |
|---|---|---|
| Anbieter | Anthropic | DeepSeek |
| Erschienen | 24. Juli 2026 | 24. Apr. 2026 |
| Verfügbarkeit | Aktiv | Preview |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 284 Mrd., 13 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Wissensstand | Mai 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell, Wissensstand | Modell |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Claude Opus 5 | DeepSeek-V4-Flash |
|---|---|---|
| API-Eingabe | 5 $ | 0,14 $ |
| API-Ausgabe | 25 $ | 0,28 $ |
| Cache lesen | 0,5 $ | 0, $ |
| Cache schreiben (5 Min.) | 6,25 $ | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | 10 $ | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Claude Opus 5 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle07.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/us-east-1 | 5,5 $ | 27,5 $ | Quelle07.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle07.09.2026 | |
| Anthropic | Über OpenRouteranthropic/fast | 10 $ | 50 $ | Quelle07.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle07.09.2026 | |
| Azure | Über OpenRouterazure/us | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle07.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle07.09.2026 | |
| Über OpenRoutergoogle-vertex/europe | 5,5 $ | 27,5 $ | Quelle07.09.2026 | ||
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle07.09.2026 | ||
| Über OpenRoutergoogle-vertex/us | 5,5 $ | 27,5 $ | Quelle07.09.2026 | ||
| DeepSeek-V4-Flash | DeepSeek | Direkt beim EntwicklerStandard-API | 0,14 $ | 0,28 $ | Quelle30.07.2026 |
| Alibaba | Über OpenRouteralibaba | 0,352 $ | 1,056 $ | Quelle07.09.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp4 | 0,44 $ | 1,32 $ | Quelle07.09.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 0,14 $ | 0,28 $ | Quelle07.09.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8#1 | 0,13 $ | 0,26 $ | Quelle07.09.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8#2 | 0,13 $ | 0,26 $ | Quelle07.09.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 0,44 $ | 1,32 $ | Quelle07.09.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp8 | 0,13 $ | 0,28 $ | Quelle07.09.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp8 | 0,06 $ | 0,18 $ | Quelle07.09.2026 | |
| DeepSeek | Über OpenRouterdeepseek | 0,22 $ | 0,66 $ | Quelle07.09.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,08 $ | 0,252 $ | Quelle07.09.2026 | |
| Fireworks | Über OpenRouterfireworks | 0,22 $ | 0,66 $ | Quelle07.09.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp8 | 0,352 $ | 1,056 $ | Quelle07.09.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 0,13 $ | 0,28 $ | Quelle07.09.2026 | |
| Makora | Über OpenRoutermakora | 0,09 $ | 0,195 $ | Quelle07.09.2026 | |
| Mancer 2 | Über OpenRoutermancer/fp8 | 0,15 $ | 0,5 $ | Quelle07.09.2026 | |
| Morph | Über OpenRoutermorph/bf16 | 0,1234 $ | 0,3475 $ | Quelle07.09.2026 | |
| NextBit | Über OpenRouternextbit/fp8 | 0,4 $ | 1,2 $ | Quelle07.09.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,4092 $ | 1,2276 $ | Quelle07.09.2026 | |
| OpenInference | Über OpenRouteropen-inference/fp8 | 0,05 $ | 0,16 $ | Quelle07.09.2026 | |
| Parasail | Über OpenRouterparasail/fp8 | 0,14 $ | 0,28 $ | Quelle07.09.2026 | |
| Phala | Über OpenRouterphala | 0,44 $ | 1,32 $ | Quelle07.09.2026 | |
| Reka | Über OpenRouterreka/fp4 | 0,11 $ | 0,66 $ | Quelle07.09.2026 | |
| Relace | Über OpenRouterrelace/fp4 | Günstigster erfasster Preis: 0,045 $ | Günstigster erfasster Preis: 0,09 $ | Quelle07.09.2026 | |
| Sail Research | Über OpenRoutersail-research/fp4 | 0,065 $ | 0,18 $ | Quelle07.09.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 0,22 $ | 0,66 $ | Quelle07.09.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,088 $ | 0,264 $ | Quelle07.09.2026 | |
| Together | Über OpenRoutertogether | 0,14 $ | 0,28 $ | Quelle07.09.2026 | |
| Venice | Über OpenRoutervenice | 0,175 $ | 0,35 $ | Quelle07.09.2026 | |
| Wafer | Über OpenRouterwafer/fast | 0,1 $ | 0,25 $ | Quelle07.09.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
33 passende Messreihen aus 3 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 9 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Claude Opus 5 | DeepSeek-V4-Flash | Quelle |
|---|---|---|---|
AlmanBench v0.1Accepted casesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: v0.1, results commit f34ddbfMessgröße: accepted casesBewertung: Mehr ist besserEinstellungen: Reasoning: max1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation. | Gewinner94,947 % | 93,003 % | Alman InstitutQuellendetailsDatenstand: 05.08.2026 |
CyberBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 40,678 % | Gewinner66,716 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 34.617 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.705 anonymen Paarvergleichen. | Gewinner1.492,042 95-%-Konfidenzintervall: ±4,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,462 95-%-Konfidenzintervall: ±4,21Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
CyberBenchPatchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner81,356 % | 72,414 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 6.720 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.060 anonymen Paarvergleichen. | Gewinner1.487,981 95-%-Konfidenzintervall: ±8,263Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,968 95-%-Konfidenzintervall: ±7,142Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
CyberBenchPoCTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 0 % | Gewinner61,017 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 2.433 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.509 anonymen Paarvergleichen. | Gewinner1.560,338 95-%-Konfidenzintervall: ±13,197Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,62 95-%-Konfidenzintervall: ±12,459Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 9.211 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.310 anonymen Paarvergleichen. | Gewinner1.533,034 95-%-Konfidenzintervall: ±7,486Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,449 95-%-Konfidenzintervall: ±6,409Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 7.531 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.029 anonymen Paarvergleichen. | Gewinner1.473,728 95-%-Konfidenzintervall: ±8,228Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,903 95-%-Konfidenzintervall: ±7,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 14.349 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.747 anonymen Paarvergleichen. | Gewinner1.491,814 95-%-Konfidenzintervall: ±6,263Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,894 95-%-Konfidenzintervall: ±5,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 9.181 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.655 anonymen Paarvergleichen. | Gewinner1.465,034 95-%-Konfidenzintervall: ±7,594Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.406,152 95-%-Konfidenzintervall: ±7,06Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 26.397 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.039 anonymen Paarvergleichen. | Gewinner1.506,469 95-%-Konfidenzintervall: ±6,027Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,7 95-%-Konfidenzintervall: ±5,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 3.824 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.907 anonymen Paarvergleichen. | Gewinner1.539,803 95-%-Konfidenzintervall: ±10,626Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.467,744 95-%-Konfidenzintervall: ±9,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlFrenchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 1.139 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.872 anonymen Paarvergleichen. | Gewinner1.508,554 95-%-Konfidenzintervall: ±19,274Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.457,512 95-%-Konfidenzintervall: ±15,76Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlGermanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 546 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 881 anonymen Paarvergleichen. | Gewinner1.492,265 95-%-Konfidenzintervall: ±26,41Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,001 95-%-Konfidenzintervall: ±20,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 22.861 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.479 anonymen Paarvergleichen. | Gewinner1.517,361 95-%-Konfidenzintervall: ±5,496Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,492 95-%-Konfidenzintervall: ±4,934Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 9.347 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.135 anonymen Paarvergleichen. | Gewinner1.514,322 95-%-Konfidenzintervall: ±7,327Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.465,194 95-%-Konfidenzintervall: ±6,261Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 12.288 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.813 anonymen Paarvergleichen. | Gewinner1.497,4 95-%-Konfidenzintervall: ±6,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,908 95-%-Konfidenzintervall: ±6,024Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlJapaneseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 551 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 600 anonymen Paarvergleichen. | Gewinner1.500,289 95-%-Konfidenzintervall: ±28,154Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,217 95-%-Konfidenzintervall: ±25,99Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlKoreanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 685 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 909 anonymen Paarvergleichen. | Gewinner1.495,177 95-%-Konfidenzintervall: ±24,664Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,943 95-%-Konfidenzintervall: ±21,551Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 2.913 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.872 anonymen Paarvergleichen. | Gewinner1.505,46 95-%-Konfidenzintervall: ±11,934Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,091 95-%-Konfidenzintervall: ±10,242Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 6.030 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.968 anonymen Paarvergleichen. | Gewinner1.512,989 95-%-Konfidenzintervall: ±8,565Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.460,882 95-%-Konfidenzintervall: ±7,588Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 16.621 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.664 anonymen Paarvergleichen. | Gewinner1.507,118 95-%-Konfidenzintervall: ±6,336Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,036 95-%-Konfidenzintervall: ±5,731Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 1.500 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.459 anonymen Paarvergleichen. | Gewinner1.524,92 95-%-Konfidenzintervall: ±16,085Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,301 95-%-Konfidenzintervall: ±12,311Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 1.813 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.607 anonymen Paarvergleichen. | Gewinner1.536,772 95-%-Konfidenzintervall: ±15,115Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.443,348 95-%-Konfidenzintervall: ±12,313Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 2.671 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.495 anonymen Paarvergleichen. | Gewinner1.500,739 95-%-Konfidenzintervall: ±12,393Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.462,945 95-%-Konfidenzintervall: ±10,866Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 5.554 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.674 anonymen Paarvergleichen. | Gewinner1.485,325 95-%-Konfidenzintervall: ±8,848Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,683 95-%-Konfidenzintervall: ±7,508Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 20.268 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 26.956 anonymen Paarvergleichen. | Gewinner1.486,228 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,651 95-%-Konfidenzintervall: ±5,123Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlPolishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.014 anonymen Paarvergleichen. | Gewinner1.501,791 95-%-Konfidenzintervall: ±26,247Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,358 95-%-Konfidenzintervall: ±18,866Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlRussianTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 3.748 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.207 anonymen Paarvergleichen. | Gewinner1.501,362 95-%-Konfidenzintervall: ±10,435Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,38 95-%-Konfidenzintervall: ±8,983Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 13.210 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.031 anonymen Paarvergleichen. | Gewinner1.525,012 95-%-Konfidenzintervall: ±6,601Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.473,269 95-%-Konfidenzintervall: ±5,664Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSpanishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 952 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.443 anonymen Paarvergleichen. | Gewinner1.473,649 95-%-Konfidenzintervall: ±20,401Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,772 95-%-Konfidenzintervall: ±16,888Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 9.688 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.861 anonymen Paarvergleichen. | Gewinner1.488,93 95-%-Konfidenzintervall: ±7,393Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,395 95-%-Konfidenzintervall: ±6,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Claude Opus 5 und DeepSeek-V4-Flash mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.