Zum Hauptinhalt springen

Direktvergleich

GPT-5.6 Sol vs. Mistral Medium 3.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

28

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von GPT-5.6 Sol und Mistral Medium 3.5
MerkmalGPT-5.6 SolMistral Medium 3.5
AnbieterOpenAIMistral AI
Erschienen26. Juni 202628. Apr. 2026
VerfügbarkeitAktivAktiv
ModelltypProprietärOpen Weights
ParameterNicht veröffentlichtNicht veröffentlicht
ArchitekturNicht veröffentlichtNicht veröffentlicht
Kontextfenster1.050.000 Token256.000 Token
Wissensstand16. Februar 2026Nicht veröffentlicht
Technische QuellenModell, Kontext, WissensstandModell
API-Preise pro 1 Mio. Token
API-Eingabe5 $ ≤272K / 10 $ >272K1,5 $
API-Ausgabe30 $ ≤272K / 45 $ >272K7,5 $
Cache lesen0,5 $ ≤272K / 1 $ >272KNicht ausgewiesen
Cache schreiben (5 Min.)6,25 $ ≤272K / 12,5 $ >272KNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft11.08.2026Quelle30.07.2026Quelle
GPT-5.6 SolMistral Medium 3.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
GPT-5.6 Sol5 $
Mistral Medium 3.51,5 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
GPT-5.6 Sol30 $
Mistral Medium 3.57,5 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

28 gemeinsame Messreihen
GPT-5.6 SolMistral Medium 3.5
Arena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.480,992 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.427,008 Arena-Punkte
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.482,723 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.430,152 Arena-Punkte
Arena Text, Style ControlChinese. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.542,002 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.450,261 Arena-Punkte
Arena Text, Style ControlCoding. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.526,407 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.478,733 Arena-Punkte
Arena Text, Style ControlCreative writing. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.476,286 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.396,218 Arena-Punkte
Arena Text, Style ControlEnglish. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.487,866 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.444,801 Arena-Punkte
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.471,101 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.396,264 Arena-Punkte
Arena Text, Style ControlExcluding ties. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.494,057 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.421,102 Arena-Punkte
Arena Text, Style ControlExpert prompts. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.523,061 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.437,963 Arena-Punkte
Arena Text, Style ControlFrench. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.513,424 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.437,162 Arena-Punkte
Arena Text, Style ControlGerman. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.488,717 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.441,705 Arena-Punkte
Arena Text, Style ControlHard prompts. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Sol1.503,869 Arena-PunkteHöherer Messwert
Mistral Medium 3.51.445,368 Arena-Punkte
Benchmarkwerte von GPT-5.6 Sol und Mistral Medium 3.5
Benchmark und AufgabeGPT-5.6 SolMistral Medium 3.5VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.480,992 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,733Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,008 Arena-Punkte
95-%-Konfidenzintervall: ±6,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 15.450 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.022 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.482,723 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±11,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,152 Arena-Punkte
95-%-Konfidenzintervall: ±13,219Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.027 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.143 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.542,002 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±19,125Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.450,261 Arena-Punkte
95-%-Konfidenzintervall: ±26,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.063 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 502 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.526,407 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.478,733 Arena-Punkte
95-%-Konfidenzintervall: ±11,154Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 4.417 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.082 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.476,286 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±11,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,218 Arena-Punkte
95-%-Konfidenzintervall: ±14,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 2.871 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.861 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.487,866 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,891Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.444,801 Arena-Punkte
95-%-Konfidenzintervall: ±8,671Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 6.370 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.311 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.471,101 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±10,47Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,264 Arena-Punkte
95-%-Konfidenzintervall: ±12,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.689 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.442 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.494,057 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,449Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,102 Arena-Punkte
95-%-Konfidenzintervall: ±8,693Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 11.663 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.302 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.523,061 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±14,681Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,963 Arena-Punkte
95-%-Konfidenzintervall: ±17,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.692 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.109 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.513,424 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±26,631Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,162 Arena-Punkte
95-%-Konfidenzintervall: ±30,614Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 544 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 440 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.488,717 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±36,486Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.441,705 Arena-Punkte
95-%-Konfidenzintervall: ±44,46Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 236 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.503,869 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,754Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,368 Arena-Punkte
95-%-Konfidenzintervall: ±7,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 10.232 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.159 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.506,105 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,506Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.457,822 Arena-Punkte
95-%-Konfidenzintervall: ±10,361Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 4.231 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.642 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.480,688 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,72Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,086 Arena-Punkte
95-%-Konfidenzintervall: ±10,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 5.277 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.557 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.444,413 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±33,308Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.392,952 Arena-Punkte
95-%-Konfidenzintervall: ±44,647Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 330 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.489,35 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±17,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.438,388 Arena-Punkte
95-%-Konfidenzintervall: ±21,256Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.268 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 844 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.484,626 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±12,176Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.433,414 Arena-Punkte
95-%-Konfidenzintervall: ±14,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 2.519 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.489,833 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,944Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,645 Arena-Punkte
95-%-Konfidenzintervall: ±9,453Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 7.036 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.657 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.478,232 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±21,703Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.429,157 Arena-Punkte
95-%-Konfidenzintervall: ±24,882Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 715 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.504,825 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±20,293Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,68 Arena-Punkte
95-%-Konfidenzintervall: ±24,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 864 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 590 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.486,374 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,092Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.423,156 Arena-Punkte
95-%-Konfidenzintervall: ±21,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.156 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 807 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.490,59 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±12,365Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,607 Arena-Punkte
95-%-Konfidenzintervall: ±14,403Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 2.558 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.812 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.471,085 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,988Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.406,489 Arena-Punkte
95-%-Konfidenzintervall: ±8,386Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 9.079 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.711 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.497,55 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±36,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,19 Arena-Punkte
95-%-Konfidenzintervall: ±38,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 256 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.495,425 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,16Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.416,701 Arena-Punkte
95-%-Konfidenzintervall: ±17,895Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.630 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.140 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.516,753 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,07Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.470,303 Arena-Punkte
95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 6.316 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.328 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.448,875 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±29,918Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.387,211 Arena-Punkte
95-%-Konfidenzintervall: ±32,775Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 427 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.482,134 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±10,093Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,854 Arena-Punkte
95-%-Konfidenzintervall: ±11,763Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.911 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.730 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.