Zum Hauptinhalt springen

Direktvergleich

GPT-5.5 vs. DeepSeek-V4-Flash

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

62

gemeinsame Messreihen

3

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von GPT-5.5 und DeepSeek-V4-Flash
MerkmalGPT-5.5DeepSeek-V4-Flash
AnbieterOpenAIDeepSeek
ErschienenApr. 202624. Apr. 2026
VerfügbarkeitAktivPreview
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht284 Mrd., 13 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster1.050.000 Token1.000.000 Token
Wissensstand1. Dezember 2025Nicht veröffentlicht
Technische QuellenModellModell
API-Preise pro 1 Mio. Token
API-Eingabe5 $ ≤272K / 10 $ >272K0,14 $
API-Ausgabe30 $ ≤272K / 45 $ >272K0,28 $
Cache lesen0,5 $ ≤272K / 1 $ >272K0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft30.07.2026Quelle30.07.2026Quelle
GPT-5.5DeepSeek-V4-Flash
API-EingabeUSD pro 1 Mio. Token, Basistarif
GPT-5.55 $
DeepSeek-V4-Flash0,14 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
GPT-5.530 $
DeepSeek-V4-Flash0,28 $Günstiger
Cache lesenUSD pro 1 Mio. Token, Basistarif
GPT-5.50,5 $
DeepSeek-V4-Flash0,003 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

62 gemeinsame Messreihen
GPT-5.5DeepSeek-V4-Flash
AlmanBench v0.1Accepted cases. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.595,432 %Höherer Messwert
DeepSeek-V4-Flash93,003 %
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.476,591 Arena-PunkteGewinner
DeepSeek-V4-Flash1.435,476 Arena-Punkte
CyberBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.580,508 %Gewinner
DeepSeek-V4-Flash66,716 %
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.481,794 Arena-PunkteGewinner
DeepSeek-V4-Flash1.438,304 Arena-Punkte
CyberBenchPatch. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.581,356 %Gewinner
DeepSeek-V4-Flash72,414 %
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.486,534 Arena-PunkteGewinner
DeepSeek-V4-Flash1.437,217 Arena-Punkte
CyberBenchPoC. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.579,661 %Gewinner
DeepSeek-V4-Flash61,017 %
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.489,293 Arena-PunkteGewinner
DeepSeek-V4-Flash1.435,23 Arena-Punkte
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.534,524 Arena-PunkteGewinner
DeepSeek-V4-Flash1.474,544 Arena-Punkte
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.520,315 Arena-PunkteGewinner
DeepSeek-V4-Flash1.481,177 Arena-Punkte
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.509,824 Arena-PunkteGewinner
DeepSeek-V4-Flash1.483,133 Arena-Punkte
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.51.519,725 Arena-PunkteGewinner
DeepSeek-V4-Flash1.479,521 Arena-Punkte
Benchmarkwerte von GPT-5.5 und DeepSeek-V4-Flash
Benchmark und AufgabeGPT-5.5DeepSeek-V4-FlashVergleichbarkeitQuelle
AlmanBench v0.1Accepted cases
95,432 %Höherer Messwert
93,003 %
v0.1, results commit f34ddbfaccepted casesMehr ist besserKohorte: almanbench-v0-1:official:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.5: Reasoning: xhigh
DeepSeek-V4-Flash: Reasoning: max
1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation.
Alman InstitutTyp: Unabhängige EvaluationMessstand: 05.08.2026Import-ID: curated-alman-institut-2026-08-09-92ad09f6268e / curated-alman-institut-2026-08-09-743e705129f5Abgerufen am 09.08.2026
Arena Text, Style ControlOverall
1.476,591 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,476 Arena-Punkte
95-%-Konfidenzintervall: ±4,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 56.647 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 49.096 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
CyberBenchOverall
80,508 %Gewinner
66,716 %
1accuracyMehr ist besserKohorte: vals-cyberbench:1:overallKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-16-702acaee9aa9Abgerufen am 16.08.2026
Arena Text, Style ControlOverallReasoning: high
1.481,794 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,053Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.438,304 Arena-Punkte
95-%-Konfidenzintervall: ±4,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 55.322 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.789 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
CyberBenchPatch
81,356 %Gewinner
72,414 %
1accuracyMehr ist besserKohorte: vals-cyberbench:1:patchKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-11-1f20498a3dc1Abgerufen am 11.08.2026
Arena Text, Style ControlBusiness, management and finance
1.486,534 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,991Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,217 Arena-Punkte
95-%-Konfidenzintervall: ±7,157Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 11.314 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 9.916 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
CyberBenchPoC
79,661 %Gewinner
61,017 %
1accuracyMehr ist besserKohorte: vals-cyberbench:1:pocKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Keine weiteren Einstellungen ausgewiesen
DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-11-1f20498a3dc1Abgerufen am 11.08.2026
Arena Text, Style ControlBusiness, management and financeReasoning: high
1.489,293 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,974Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,23 Arena-Punkte
95-%-Konfidenzintervall: ±7,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 11.166 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.055 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.534,524 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,143Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.474,544 Arena-Punkte
95-%-Konfidenzintervall: ±12,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.010 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.557 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChineseReasoning: high
1.520,315 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±11,711Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.481,177 Arena-Punkte
95-%-Konfidenzintervall: ±12,66Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.122 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.529 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.509,824 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,202Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.483,133 Arena-Punkte
95-%-Konfidenzintervall: ±6,395Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 16.157 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.397 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCodingReasoning: high
1.519,725 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,272Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,521 Arena-Punkte
95-%-Konfidenzintervall: ±6,432Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 15.497 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.353 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.446,547 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,366Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.407,934 Arena-Punkte
95-%-Konfidenzintervall: ±7,787Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 10.022 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.974 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writingReasoning: high
1.451,1 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,432Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,648 Arena-Punkte
95-%-Konfidenzintervall: ±7,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 9.696 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.019 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.481,062 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,194Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,34 Arena-Punkte
95-%-Konfidenzintervall: ±5,378Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 26.142 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.994 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglishReasoning: high
1.483,338 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,195Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.450,015 Arena-Punkte
95-%-Konfidenzintervall: ±5,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 25.476 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.774 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.445,056 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,522 Arena-Punkte
95-%-Konfidenzintervall: ±7,152Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 13.062 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.453 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and mediaReasoning: high
1.447,697 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,113 Arena-Punkte
95-%-Konfidenzintervall: ±7,086Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 12.637 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.654 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.485,713 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,277Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,81 Arena-Punkte
95-%-Konfidenzintervall: ±5,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 43.187 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.067 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding tiesReasoning: high
1.492,57 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,273Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,522 Arena-Punkte
95-%-Konfidenzintervall: ±5,476Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 41.983 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.085 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.511,036 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,798Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,397 Arena-Punkte
95-%-Konfidenzintervall: ±9,185Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.917 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.926 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert promptsReasoning: high
1.514,99 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,802Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.467,529 Arena-Punkte
95-%-Konfidenzintervall: ±9,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.748 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.924 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.502,215 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,102 Arena-Punkte
95-%-Konfidenzintervall: ±15,765Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 2.126 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.916 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrenchReasoning: high
1.491,399 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,438Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,295 Arena-Punkte
95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 2.074 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.884 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.486,769 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±21,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.423,659 Arena-Punkte
95-%-Konfidenzintervall: ±21,582Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 883 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 833 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGermanReasoning: high
1.471,992 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,515Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.435,281 Arena-Punkte
95-%-Konfidenzintervall: ±21,205Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedKein klarer VorsprungGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 839 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 872 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.496,801 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,747Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.459,153 Arena-Punkte
95-%-Konfidenzintervall: ±4,892Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 37.673 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.675 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard promptsReasoning: high
1.500,803 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,777Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,18 Arena-Punkte
95-%-Konfidenzintervall: ±4,95Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 36.328 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.535 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.496,122 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,987Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.464,017 Arena-Punkte
95-%-Konfidenzintervall: ±6,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 17.991 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.382 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, EnglishReasoning: high
1.499,408 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,008Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.464,963 Arena-Punkte
95-%-Konfidenzintervall: ±6,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 17.312 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.145 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.473,515 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,017 Arena-Punkte
95-%-Konfidenzintervall: ±5,969Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 19.486 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.832 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction followingReasoning: high
1.478,997 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,853Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,165 Arena-Punkte
95-%-Konfidenzintervall: ±6,039Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 18.929 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.841 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.493,316 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±27,703Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,126 Arena-Punkte
95-%-Konfidenzintervall: ±25,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 572 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 628 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapaneseReasoning: high
1.510,093 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±25,399Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,789 Arena-Punkte
95-%-Konfidenzintervall: ±26,437Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 656 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 595 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.425,641 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±20,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.393,857 Arena-Punkte
95-%-Konfidenzintervall: ±21,517Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedKein klarer VorsprungGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 966 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 869 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKoreanReasoning: high
1.443,155 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±20,59Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.375,542 Arena-Punkte
95-%-Konfidenzintervall: ±21,534Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 945 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.484,738 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,662Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.448,527 Arena-Punkte
95-%-Konfidenzintervall: ±10,217Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.657 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.907 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and governmentReasoning: high
1.495,659 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,8Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,238 Arena-Punkte
95-%-Konfidenzintervall: ±10,278Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.511 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.876 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.493,306 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,254Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,241 Arena-Punkte
95-%-Konfidenzintervall: ±7,633Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 9.301 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.812 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social scienceReasoning: high
1.497,397 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,287Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.461,582 Arena-Punkte
95-%-Konfidenzintervall: ±7,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 9.251 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.985 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.484,008 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,511Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.448,126 Arena-Punkte
95-%-Konfidenzintervall: ±5,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 25.843 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.643 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queriesReasoning: high
1.487,074 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,55Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.449,175 Arena-Punkte
95-%-Konfidenzintervall: ±5,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 24.872 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.682 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.498,554 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±11,687Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.425,263 Arena-Punkte
95-%-Konfidenzintervall: ±12,232Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 2.859 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.516 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathReasoning: high
1.491,328 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±11,513Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,663 Arena-Punkte
95-%-Konfidenzintervall: ±12,368Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 2.818 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.497,291 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±11,557Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,855 Arena-Punkte
95-%-Konfidenzintervall: ±11,996Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.142 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.738 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professionsReasoning: high
1.501,238 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±11,449Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.441,422 Arena-Punkte
95-%-Konfidenzintervall: ±12,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.100 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.588 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.486,115 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,125Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.459,52 Arena-Punkte
95-%-Konfidenzintervall: ±10,979Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.270 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.440 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcareReasoning: high
1.477,019 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±10,053Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.463,011 Arena-Punkte
95-%-Konfidenzintervall: ±10,889Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedKein klarer VorsprungGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.204 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.505 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.481,736 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,274Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.452,835 Arena-Punkte
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 10.010 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.848 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turnReasoning: high
1.491,471 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,403Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.446,059 Arena-Punkte
95-%-Konfidenzintervall: ±7,528Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 9.553 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.708 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.466,966 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,936Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,787 Arena-Punkte
95-%-Konfidenzintervall: ±5,078Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 30.504 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.100 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-EnglishReasoning: high
1.475,773 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,975Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,674 Arena-Punkte
95-%-Konfidenzintervall: ±5,146Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 29.845 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.013 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.469,664 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±19,112Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,239 Arena-Punkte
95-%-Konfidenzintervall: ±18,981Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.022 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.007 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolishReasoning: high
1.481,175 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±19,368Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.429,767 Arena-Punkte
95-%-Konfidenzintervall: ±18,83Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 980 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.019 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.478,51 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,713Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,925 Arena-Punkte
95-%-Konfidenzintervall: ±8,941Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.720 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.272 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussianReasoning: high
1.485,05 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,805Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,146 Arena-Punkte
95-%-Konfidenzintervall: ±9,061Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.634 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.232 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.505,386 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,502Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.470,809 Arena-Punkte
95-%-Konfidenzintervall: ±5,639Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 22.733 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.180 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT servicesReasoning: high
1.510,679 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,515Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,269 Arena-Punkte
95-%-Konfidenzintervall: ±5,679Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 22.016 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.086 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.457,959 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±16,208Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,449 Arena-Punkte
95-%-Konfidenzintervall: ±16,767Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.702 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.532 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanishReasoning: high
1.464,66 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±16,376Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,679 Arena-Punkte
95-%-Konfidenzintervall: ±17,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.600 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.427 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.465,463 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,104 Arena-Punkte
95-%-Konfidenzintervall: ±6,732Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 14.253 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.766 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and languageReasoning: high
1.471,554 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,474Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,414 Arena-Punkte
95-%-Konfidenzintervall: ±6,736Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: GPT-5.5GPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 13.874 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.864 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.