Direktvergleich
GPT-5.6 Luna vs. DeepSeek-V4-Flash
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
61
gemeinsame Messreihen
2
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | GPT-5.6 Luna | DeepSeek-V4-Flash |
|---|---|---|
| Anbieter | OpenAI | DeepSeek |
| Erschienen | 26. Juni 2026 | 24. Apr. 2026 |
| Verfügbarkeit | Aktiv | Preview |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 284 Mrd., 13 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 1.050.000 Token | 1.000.000 Token |
| Wissensstand | 16. Februar 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext, Wissensstand | Modell |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 0,2 $ ≤272K / 0,4 $ >272K | 0,14 $ |
| API-Ausgabe | 1,2 $ ≤272K / 1,8 $ >272K | 0,28 $ |
| Cache lesen | 0,02 $ ≤272K / 0,04 $ >272K | 0, $ |
| Cache schreiben (5 Min.) | 0,25 $ ≤272K / 0,5 $ >272K | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 11.08.2026Quelle | 30.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | GPT-5.6 Luna | DeepSeek-V4-Flash | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.450,561 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,476 Arena-Punkte 95-%-Konfidenzintervall: ±4,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 16.419 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 49.096 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| CyberBenchOverall | 83,898 %Gewinner | 66,716 % | 1accuracyMehr ist besserKohorte: vals-cyberbench:1:overallKein dokumentierter Setup-UnterschiedSieger: GPT-5.6 LunaGPT-5.6 Luna: Keine weiteren Einstellungen ausgewiesen DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-16-702acaee9aa9Abgerufen am 16.08.2026 |
| Arena Text, Style ControlOverall | 1.450,561 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,304 Arena-Punkte 95-%-Konfidenzintervall: ±4,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 16.419 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.789 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| CyberBenchPatch | 79,661 %Gewinner | 72,414 % | 1accuracyMehr ist besserKohorte: vals-cyberbench:1:patchKein dokumentierter Setup-UnterschiedSieger: GPT-5.6 LunaGPT-5.6 Luna: Keine weiteren Einstellungen ausgewiesen DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-11-1f20498a3dc1Abgerufen am 11.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.465,32 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,098Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,217 Arena-Punkte 95-%-Konfidenzintervall: ±7,157Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 3.171 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 9.916 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| CyberBenchPoC | 88,136 %Gewinner | 61,017 % | 1accuracyMehr ist besserKohorte: vals-cyberbench:1:pocKein dokumentierter Setup-UnterschiedSieger: GPT-5.6 LunaGPT-5.6 Luna: Keine weiteren Einstellungen ausgewiesen DeepSeek-V4-Flash: Keine weiteren Einstellungen ausgewiesen | Vals AITyp: Unabhängige EvaluationMessstand: 03.08.2026Import-ID: vals-cyber-2026-08-11-1f20498a3dc1Abgerufen am 11.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.465,32 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,098Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,23 Arena-Punkte 95-%-Konfidenzintervall: ±7,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 3.171 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.055 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.485,14 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,537Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.474,544 Arena-Punkte 95-%-Konfidenzintervall: ±12,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.179 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.557 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.485,14 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,537Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.481,177 Arena-Punkte 95-%-Konfidenzintervall: ±12,66Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.179 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.529 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.498,496 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,171Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.483,133 Arena-Punkte 95-%-Konfidenzintervall: ±6,395Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.743 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.397 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.498,496 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,171Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,521 Arena-Punkte 95-%-Konfidenzintervall: ±6,432Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.743 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.353 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.413,67 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,521Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.407,934 Arena-Punkte 95-%-Konfidenzintervall: ±7,787Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 3.074 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.974 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.413,67 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,521Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,648 Arena-Punkte 95-%-Konfidenzintervall: ±7,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 3.074 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.019 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.467,903 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,784Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,34 Arena-Punkte 95-%-Konfidenzintervall: ±5,378Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 6.691 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.994 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.467,903 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,784Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.450,015 Arena-Punkte 95-%-Konfidenzintervall: ±5,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 6.691 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.774 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.425,084 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,093Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,522 Arena-Punkte 95-%-Konfidenzintervall: ±7,152Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.027 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.453 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.425,084 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,093Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,113 Arena-Punkte 95-%-Konfidenzintervall: ±7,086Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.027 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.654 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.453,512 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,354Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,81 Arena-Punkte 95-%-Konfidenzintervall: ±5,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 12.388 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.067 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.453,512 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,354Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,522 Arena-Punkte 95-%-Konfidenzintervall: ±5,476Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 12.388 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.085 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.485,913 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±14,333Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,397 Arena-Punkte 95-%-Konfidenzintervall: ±9,185Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.786 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.926 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.485,913 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±14,333Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.467,529 Arena-Punkte 95-%-Konfidenzintervall: ±9,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.786 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.924 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.457,035 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±25,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,102 Arena-Punkte 95-%-Konfidenzintervall: ±15,765Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 579 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.916 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.457,035 Arena-Punkte 95-%-Konfidenzintervall: ±25,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,295 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 579 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.884 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.499,364 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±36,569Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,659 Arena-Punkte 95-%-Konfidenzintervall: ±21,582Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 266 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 833 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.499,364 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±36,569Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,281 Arena-Punkte 95-%-Konfidenzintervall: ±21,205Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 266 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 872 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.470,97 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,62Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,153 Arena-Punkte 95-%-Konfidenzintervall: ±4,892Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 11.043 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.675 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.470,97 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,62Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,18 Arena-Punkte 95-%-Konfidenzintervall: ±4,95Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 11.043 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.535 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.486,256 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.464,017 Arena-Punkte 95-%-Konfidenzintervall: ±6,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.500 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.382 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.486,256 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.464,963 Arena-Punkte 95-%-Konfidenzintervall: ±6,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.500 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.145 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.442,032 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,307Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,017 Arena-Punkte 95-%-Konfidenzintervall: ±5,969Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 5.883 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.832 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.442,032 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,307Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,165 Arena-Punkte 95-%-Konfidenzintervall: ±6,039Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 5.883 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.841 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlJapanese | 1.439,431 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±42,412Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,126 Arena-Punkte 95-%-Konfidenzintervall: ±25,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 207 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 628 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlJapanese | 1.439,431 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±42,412Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,789 Arena-Punkte 95-%-Konfidenzintervall: ±26,437Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 207 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 595 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.386,735 Arena-Punkte 95-%-Konfidenzintervall: ±30,324Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.393,857 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±21,517Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 363 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 869 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.386,735 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±30,324Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.375,542 Arena-Punkte 95-%-Konfidenzintervall: ±21,534Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 363 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.460,755 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±16,612Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.448,527 Arena-Punkte 95-%-Konfidenzintervall: ±10,217Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.372 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.907 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.460,755 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±16,612Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,238 Arena-Punkte 95-%-Konfidenzintervall: ±10,278Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.372 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.876 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.454,714 Arena-Punkte 95-%-Konfidenzintervall: ±11,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,241 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,633Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 2.634 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.812 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.454,714 Arena-Punkte 95-%-Konfidenzintervall: ±11,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.461,582 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 2.634 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.985 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.450,194 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.448,126 Arena-Punkte 95-%-Konfidenzintervall: ±5,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 7.739 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.643 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.450,194 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,175 Arena-Punkte 95-%-Konfidenzintervall: ±5,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 7.739 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.682 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.484,009 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±21,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.425,263 Arena-Punkte 95-%-Konfidenzintervall: ±12,232Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 764 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.516 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.484,009 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±21,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.440,663 Arena-Punkte 95-%-Konfidenzintervall: ±12,368Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 764 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.477,929 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±20,986Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,855 Arena-Punkte 95-%-Konfidenzintervall: ±11,996Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 835 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.738 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.477,929 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±20,986Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,422 Arena-Punkte 95-%-Konfidenzintervall: ±12,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 835 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.588 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.433,741 Arena-Punkte 95-%-Konfidenzintervall: ±17,642Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,52 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,979Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.234 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.440 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.433,741 Arena-Punkte 95-%-Konfidenzintervall: ±17,642Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.463,011 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,889Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.234 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.505 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.455,655 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,753Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.452,835 Arena-Punkte 95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 2.815 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.848 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.455,655 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,753Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.446,059 Arena-Punkte 95-%-Konfidenzintervall: ±7,528Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 2.815 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.708 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.433,062 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,787 Arena-Punkte 95-%-Konfidenzintervall: ±5,078Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 9.725 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.100 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.433,062 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,674 Arena-Punkte 95-%-Konfidenzintervall: ±5,146Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 9.725 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.013 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.430,299 Arena-Punkte 95-%-Konfidenzintervall: ±34,831Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,239 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,981Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 285 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.007 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.430,299 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±34,831Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,767 Arena-Punkte 95-%-Konfidenzintervall: ±18,83Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 285 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.019 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.449,175 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±14,826Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,925 Arena-Punkte 95-%-Konfidenzintervall: ±8,941Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.654 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.272 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.449,175 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±14,826Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,146 Arena-Punkte 95-%-Konfidenzintervall: ±9,061Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 1.654 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.232 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.490,948 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,94Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,809 Arena-Punkte 95-%-Konfidenzintervall: ±5,639Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 6.687 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.180 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.490,948 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,94Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.473,269 Arena-Punkte 95-%-Konfidenzintervall: ±5,679Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 6.687 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.086 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.450,132 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±30,269Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,449 Arena-Punkte 95-%-Konfidenzintervall: ±16,767Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 413 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.532 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.450,132 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±30,269Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,679 Arena-Punkte 95-%-Konfidenzintervall: ±17,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 413 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.427 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.439,47 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,762Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,104 Arena-Punkte 95-%-Konfidenzintervall: ±6,732Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.231 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.766 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.439,47 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,762Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,414 Arena-Punkte 95-%-Konfidenzintervall: ±6,736Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.231 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.864 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche GPT-5.6 Luna und DeepSeek-V4-Flash mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich