Zum Hauptinhalt springen

Direktvergleich

GPT-5.6 Terra vs. Mistral Large 3

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

29

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von GPT-5.6 Terra und Mistral Large 3
MerkmalGPT-5.6 TerraMistral Large 3
AnbieterOpenAIMistral AI
Erschienen26. Juni 20262. Dez. 2025
VerfügbarkeitAktivAktiv
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht675 Mrd., 41 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster1.050.000 Token256.000 Token
Wissensstand16. Februar 2026Nicht veröffentlicht
Technische QuellenModell, Kontext, WissensstandModell
API-Preise pro 1 Mio. Token
API-Eingabe2 $ ≤272K / 4 $ >272K0,5 $
API-Ausgabe12 $ ≤272K / 18 $ >272K1,5 $
Cache lesen0,2 $ ≤272K / 0,4 $ >272KNicht ausgewiesen
Cache schreiben (5 Min.)2,5 $ ≤272K / 5 $ >272KNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft11.08.2026Quelle30.07.2026Quelle
GPT-5.6 TerraMistral Large 3
API-EingabeUSD pro 1 Mio. Token, Basistarif
GPT-5.6 Terra2 $
Mistral Large 30,5 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
GPT-5.6 Terra12 $
Mistral Large 31,5 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

29 gemeinsame Messreihen
GPT-5.6 TerraMistral Large 3
Arena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.464,935 Arena-PunkteHöherer Messwert
Mistral Large 31.414,798 Arena-Punkte
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.468,921 Arena-PunkteHöherer Messwert
Mistral Large 31.412,96 Arena-Punkte
Arena Text, Style ControlChinese. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.517,892 Arena-PunkteHöherer Messwert
Mistral Large 31.429,195 Arena-Punkte
Arena Text, Style ControlCoding. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.515,671 Arena-PunkteHöherer Messwert
Mistral Large 31.468,172 Arena-Punkte
Arena Text, Style ControlCreative writing. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.425,741 Arena-PunkteHöherer Messwert
Mistral Large 31.374,812 Arena-Punkte
Arena Text, Style ControlEnglish. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.466,356 Arena-PunkteHöherer Messwert
Mistral Large 31.428,092 Arena-Punkte
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.434,399 Arena-PunkteHöherer Messwert
Mistral Large 31.374,062 Arena-Punkte
Arena Text, Style ControlExcluding ties. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.471,787 Arena-PunkteHöherer Messwert
Mistral Large 31.402,073 Arena-Punkte
Arena Text, Style ControlExpert prompts. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.504,819 Arena-PunkteHöherer Messwert
Mistral Large 31.425,617 Arena-Punkte
Arena Text, Style ControlFrench. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.507,696 Arena-PunkteHöherer Messwert
Mistral Large 31.436,959 Arena-Punkte
Arena Text, Style ControlGerman. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.482,141 Arena-PunkteHöherer Messwert
Mistral Large 31.404,865 Arena-Punkte
Arena Text, Style ControlHard prompts. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 Terra1.486,524 Arena-PunkteHöherer Messwert
Mistral Large 31.431,831 Arena-Punkte
Benchmarkwerte von GPT-5.6 Terra und Mistral Large 3
Benchmark und AufgabeGPT-5.6 TerraMistral Large 3VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.464,935 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,798 Arena-Punkte
95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 16.008 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.468,921 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±11,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.412,96 Arena-Punkte
95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 3.050 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.517,892 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,554Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.429,195 Arena-Punkte
95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.102 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.515,671 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.468,172 Arena-Punkte
95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 4.522 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.425,741 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±11,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.374,812 Arena-Punkte
95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 3.032 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.466,356 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,092 Arena-Punkte
95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 6.578 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.434,399 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±10,168Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.374,062 Arena-Punkte
95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 3.847 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.471,787 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,47Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.402,073 Arena-Punkte
95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 11.978 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.504,819 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±14,166Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.425,617 Arena-Punkte
95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.866 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.507,696 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±27,753Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.436,959 Arena-Punkte
95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 524 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.482,141 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±37,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.404,865 Arena-Punkte
95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 248 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.486,524 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,675Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,831 Arena-Punkte
95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 10.667 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.483,794 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,452Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,235 Arena-Punkte
95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 4.327 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.461,747 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.401,455 Arena-Punkte
95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 5.666 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.473,665 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±42,126Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,852 Arena-Punkte
95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 198 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.417,457 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,187Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.347,595 Arena-Punkte
95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.480,882 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±17,189Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,186 Arena-Punkte
95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.308 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.466,997 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±12,184Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,837 Arena-Punkte
95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 2.539 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.465,975 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,594 Arena-Punkte
95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 7.381 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.483,003 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±21,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.404,068 Arena-Punkte
95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 717 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.483,608 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±20,011Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,682 Arena-Punkte
95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 868 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.459,245 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,101Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,596 Arena-Punkte
95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.196 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.472,708 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±12,008Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,924 Arena-Punkte
95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 2.693 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.458,564 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,923Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.398,241 Arena-Punkte
95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 9.428 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.433,151 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±34,603Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.419,007 Arena-Punkte
95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 256 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.467,406 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±14,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,573 Arena-Punkte
95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.672 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.500,751 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±8,018Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.456,428 Arena-Punkte
95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 6.444 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.476,968 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±29,446Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,23 Arena-Punkte
95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 425 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.451,154 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,749Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.389,648 Arena-Punkte
95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 4.149 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.