Direktvergleich
GPT-5.6 Terra vs. Mistral Medium 3.5
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
28
gemeinsame Messreihen
1
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | GPT-5.6 Terra | Mistral Medium 3.5 |
|---|---|---|
| Anbieter | OpenAI | Mistral AI |
| Erschienen | 26. Juni 2026 | 28. Apr. 2026 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 1.050.000 Token | 256.000 Token |
| Wissensstand | 16. Februar 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext, Wissensstand | Modell |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 2 $ ≤272K / 4 $ >272K | 1,5 $ |
| API-Ausgabe | 12 $ ≤272K / 18 $ >272K | 7,5 $ |
| Cache lesen | 0,2 $ ≤272K / 0,4 $ >272K | Nicht ausgewiesen |
| Cache schreiben (5 Min.) | 2,5 $ ≤272K / 5 $ >272K | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 11.08.2026Quelle | 30.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | GPT-5.6 Terra | Mistral Medium 3.5 | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.464,935 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±5,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,008 Arena-Punkte 95-%-Konfidenzintervall: ±6,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 16.008 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.022 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.468,921 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,152 Arena-Punkte 95-%-Konfidenzintervall: ±13,219Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 3.050 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.143 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.517,892 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,554Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.450,261 Arena-Punkte 95-%-Konfidenzintervall: ±26,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.102 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 502 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.515,671 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.478,733 Arena-Punkte 95-%-Konfidenzintervall: ±11,154Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 4.522 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.082 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.425,741 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±11,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,218 Arena-Punkte 95-%-Konfidenzintervall: ±14,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 3.032 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.861 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.466,356 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.444,801 Arena-Punkte 95-%-Konfidenzintervall: ±8,671Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 6.578 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.311 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.434,399 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±10,168Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,264 Arena-Punkte 95-%-Konfidenzintervall: ±12,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 3.847 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.442 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.471,787 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,47Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,102 Arena-Punkte 95-%-Konfidenzintervall: ±8,693Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 11.978 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.302 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.504,819 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±14,166Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,963 Arena-Punkte 95-%-Konfidenzintervall: ±17,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.866 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.109 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.507,696 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±27,753Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,162 Arena-Punkte 95-%-Konfidenzintervall: ±30,614Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 524 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 440 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.482,141 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±37,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,705 Arena-Punkte 95-%-Konfidenzintervall: ±44,46Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 248 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.486,524 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,675Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,368 Arena-Punkte 95-%-Konfidenzintervall: ±7,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 10.667 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.159 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.483,794 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,452Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.457,822 Arena-Punkte 95-%-Konfidenzintervall: ±10,361Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 4.327 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.642 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.461,747 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,086 Arena-Punkte 95-%-Konfidenzintervall: ±10,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 5.666 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.557 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.417,457 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±31,187Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.392,952 Arena-Punkte 95-%-Konfidenzintervall: ±44,647Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.480,882 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±17,189Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,388 Arena-Punkte 95-%-Konfidenzintervall: ±21,256Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.308 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 844 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.466,997 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±12,184Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,414 Arena-Punkte 95-%-Konfidenzintervall: ±14,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 2.539 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.465,975 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±7,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,645 Arena-Punkte 95-%-Konfidenzintervall: ±9,453Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 7.381 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.657 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.483,003 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±21,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,157 Arena-Punkte 95-%-Konfidenzintervall: ±24,882Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 717 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.483,608 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±20,011Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,68 Arena-Punkte 95-%-Konfidenzintervall: ±24,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 868 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 590 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.459,245 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±18,101Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,156 Arena-Punkte 95-%-Konfidenzintervall: ±21,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.196 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 807 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.472,708 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±12,008Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,607 Arena-Punkte 95-%-Konfidenzintervall: ±14,403Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 2.693 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.812 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.458,564 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±6,923Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.406,489 Arena-Punkte 95-%-Konfidenzintervall: ±8,386Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 9.428 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.711 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.433,151 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±34,603Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,19 Arena-Punkte 95-%-Konfidenzintervall: ±38,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 256 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.467,406 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±14,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.416,701 Arena-Punkte 95-%-Konfidenzintervall: ±17,895Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 1.672 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.140 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.500,751 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±8,018Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,303 Arena-Punkte 95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 6.444 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.328 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.476,968 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±29,446Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.387,211 Arena-Punkte 95-%-Konfidenzintervall: ±32,775Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 425 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.451,154 Arena-PunkteHöherer Messwert 95-%-Konfidenzintervall: ±9,749Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,854 Arena-Punkte 95-%-Konfidenzintervall: ±11,763Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGPT-5.6 Terra: Snapshot: gpt-5.6-terra-xhigh, Reasoning: xhigh, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGPT-5.6 Terra: Stilbereinigte Arena-Bewertung aus 4.149 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.730 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche GPT-5.6 Terra und Mistral Medium 3.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich