Direktvergleich
GPT-5.4 vs. Mistral Large 3
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
58
gemeinsame Messreihen
1
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | GPT-5.4 | Mistral Large 3 |
|---|---|---|
| Anbieter | OpenAI | Mistral AI |
| Erschienen | März 2026 | 2. Dez. 2025 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 675 Mrd., 41 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 1.050.000 Token | 256.000 Token |
| Wissensstand | 31. August 2025 | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 2,5 $ ≤272K / 5 $ >272K | 0,5 $ |
| API-Ausgabe | 15 $ ≤272K / 22,5 $ >272K | 1,5 $ |
| Cache lesen | 0,25 $ ≤272K / 0,5 $ >272K | Nicht ausgewiesen |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026Quelle | 30.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | GPT-5.4 | Mistral Large 3 | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.465,439 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±3,814Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,798 Arena-Punkte 95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 63.759 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlOverall | 1.476,571 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±3,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,798 Arena-Punkte 95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 60.819 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.474,218 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,56Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.412,96 Arena-Punkte 95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 13.072 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.483,617 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,683Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.412,96 Arena-Punkte 95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 12.373 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.496,688 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±11,202Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,195 Arena-Punkte 95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 3.574 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.506,007 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,398Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,195 Arena-Punkte 95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 3.369 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.513,75 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,977Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,172 Arena-Punkte 95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 17.752 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.520,704 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,02Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,172 Arena-Punkte 95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 16.515 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.436,291 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±7,077Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,812 Arena-Punkte 95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 10.314 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.444,387 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,221Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,812 Arena-Punkte 95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 10.119 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.468,758 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,955Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,092 Arena-Punkte 95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 29.658 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.478,413 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,006Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,092 Arena-Punkte 95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 28.120 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.433,639 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,465Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,062 Arena-Punkte 95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 13.629 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.443,099 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,632Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,062 Arena-Punkte 95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 12.966 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.471,723 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,974Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.402,073 Arena-Punkte 95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 48.930 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.486,146 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,068Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.402,073 Arena-Punkte 95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 46.537 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.490,915 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±8,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.425,617 Arena-Punkte 95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 6.142 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.516,663 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.425,617 Arena-Punkte 95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 5.794 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.484,736 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±14,945Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,959 Arena-Punkte 95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 2.316 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.501,631 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,039Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,959 Arena-Punkte 95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 2.293 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.448,583 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±20,526Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.404,865 Arena-Punkte 95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 956 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.466,734 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±19,582Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.404,865 Arena-Punkte 95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.054 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.487,682 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,603Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,831 Arena-Punkte 95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 41.916 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.498,61 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±4,64Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,831 Arena-Punkte 95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 39.412 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.486,794 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,668Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,235 Arena-Punkte 95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 20.340 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.495,669 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,735Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,235 Arena-Punkte 95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 18.992 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.461,6 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,543Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.401,455 Arena-Punkte 95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 21.791 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.473,561 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.401,455 Arena-Punkte 95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 20.349 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlJapanese | 1.449,226 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±25,524Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,852 Arena-Punkte 95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 639 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlJapanese | 1.479,952 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±26,264Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,852 Arena-Punkte 95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 634 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.424,77 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±19,666Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.347,595 Arena-Punkte 95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.139 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.434,311 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±20,242Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.347,595 Arena-Punkte 95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.079 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.475,533 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±9,326Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,186 Arena-Punkte 95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 5.076 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.491,12 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,472Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,186 Arena-Punkte 95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 4.913 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.478,92 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,927Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,837 Arena-Punkte 95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 10.340 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.488,258 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,837 Arena-Punkte 95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 9.911 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.478,227 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,383Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,594 Arena-Punkte 95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 27.468 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.483,605 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,458Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,594 Arena-Punkte 95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 26.121 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.460,364 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±10,712Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.404,068 Arena-Punkte 95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 3.344 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.494,026 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,982Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.404,068 Arena-Punkte 95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 3.186 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.471,203 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±11,023Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,682 Arena-Punkte 95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 3.417 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.499,572 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,221Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,682 Arena-Punkte 95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 3.238 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.467,799 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±9,744Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,596 Arena-Punkte 95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 4.695 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.476,198 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,964Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,596 Arena-Punkte 95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 4.483 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.481,026 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,924 Arena-Punkte 95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 12.008 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.494,427 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,811Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,924 Arena-Punkte 95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 11.302 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.458,043 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,754Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.398,241 Arena-Punkte 95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 34.099 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.468,846 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±4,8Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.398,241 Arena-Punkte 95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 32.699 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.473,179 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±17,291Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.419,007 Arena-Punkte 95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.250 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.482,154 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±17,152Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.419,007 Arena-Punkte 95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.298 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.471,407 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±8,204Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,573 Arena-Punkte 95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 6.797 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.490,981 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,413Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,573 Arena-Punkte 95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 6.401 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.498,772 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,275Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.456,428 Arena-Punkte 95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 25.369 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.506,788 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,317Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.456,428 Arena-Punkte 95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 23.913 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.461,205 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±15,24Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.411,23 Arena-Punkte 95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.932 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.456,765 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,141Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.411,23 Arena-Punkte 95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 1.975 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.459,832 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,107Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.389,648 Arena-Punkte 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: GPT-5.4GPT-5.4: Snapshot: gpt-5.4, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 15.400 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.466,108 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.389,648 Arena-Punkte 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.4: Snapshot: gpt-5.4-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.4: Stilbereinigte Arena-Bewertung aus 15.044 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche GPT-5.4 und Mistral Large 3 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich