Direktvergleich
Claude Sonnet 5 vs. Mistral Large 3
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
29
gemeinsame Messreihen
1
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | Claude Sonnet 5 | Mistral Large 3 |
|---|---|---|
| Anbieter | Anthropic | Mistral AI |
| Erschienen | 30. Juni 2026 | 2. Dez. 2025 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 675 Mrd., 41 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 1.000.000 Token | 256.000 Token |
| Wissensstand | Januar 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext | Modell |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 2 $ | 0,5 $ |
| API-Ausgabe | 10 $ | 1,5 $ |
| Cache lesen | 0,2 $ | Nicht ausgewiesen |
| Cache schreiben (5 Min.) | 2,5 $ | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | 4 $ | Nicht ausgewiesen |
| Preis geprüft | 11.08.2026Quelle | 30.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | Claude Sonnet 5 | Mistral Large 3 | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.462,192 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,168Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,798 Arena-Punkte 95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 23.138 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.464,884 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,253Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.412,96 Arena-Punkte 95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 4.692 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.501,752 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,966Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,195 Arena-Punkte 95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 1.508 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.522,518 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,172 Arena-Punkte 95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 6.492 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.434,634 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,772Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,812 Arena-Punkte 95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 4.272 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.475,41 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,092 Arena-Punkte 95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 10.063 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.431,714 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,79Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,062 Arena-Punkte 95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 5.565 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.468,432 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,733Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.402,073 Arena-Punkte 95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 17.313 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.508,759 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±12,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.425,617 Arena-Punkte 95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 2.506 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.484,171 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±22,086Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,959 Arena-Punkte 95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 846 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.472,538 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±31,151Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.404,865 Arena-Punkte 95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 383 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.490,612 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,831 Arena-Punkte 95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 15.412 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.496,828 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,235 Arena-Punkte 95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 6.779 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.467,438 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,382Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.401,455 Arena-Punkte 95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 8.083 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlJapanese | 1.452,999 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±34,296Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,852 Arena-Punkte 95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 304 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.430,248 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±29,002Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.347,595 Arena-Punkte 95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 437 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.478,657 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±13,766Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,186 Arena-Punkte 95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 2.001 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.488,593 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,037Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,837 Arena-Punkte 95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 3.793 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.482,865 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,937Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,594 Arena-Punkte 95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 10.639 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.468,427 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.404,068 Arena-Punkte 95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 1.038 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.482,779 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±16,906Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.418,682 Arena-Punkte 95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 1.242 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.478,281 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±15,305Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,596 Arena-Punkte 95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 1.675 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.472,783 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,844Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,924 Arena-Punkte 95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 4.105 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.446,895 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,216Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.398,241 Arena-Punkte 95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 13.075 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.446,915 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±30,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.419,007 Arena-Punkte 95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 358 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.469,476 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±12,527Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,573 Arena-Punkte 95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 2.351 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.505,705 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.456,428 Arena-Punkte 95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 9.332 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.453,128 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±23,832Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.411,23 Arena-Punkte 95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 665 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.450,334 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,329Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.389,648 Arena-Punkte 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerClaude Sonnet 5: Snapshot: claude-sonnet-5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlClaude Sonnet 5: Stilbereinigte Arena-Bewertung aus 5.997 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Claude Sonnet 5 und Mistral Large 3 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich