Zum Hauptinhalt springen

Direktvergleich

Grok 4.3 vs. Mistral Medium 3.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

28

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Grok 4.3 und Mistral Medium 3.5
MerkmalGrok 4.3Mistral Medium 3.5
AnbieterxAIMistral AI
Erschienen6. Mai 202628. Apr. 2026
VerfügbarkeitAktivAktiv
ModelltypProprietärOpen Weights
ParameterNicht veröffentlichtNicht veröffentlicht
ArchitekturNicht veröffentlichtNicht veröffentlicht
Kontextfenster1.000.000 Token256.000 Token
WissensstandNicht veröffentlichtNicht veröffentlicht
Technische QuellenModellModell
API-Preise pro 1 Mio. Token
API-Eingabe1,25 $ ≤200K / 2,5 $ >200K1,5 $
API-Ausgabe2,5 $ ≤200K / 5 $ >200K7,5 $
Cache lesen0,2 $ ≤200K / 0,4 $ >200KNicht ausgewiesen
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft11.08.2026Quelle30.07.2026Quelle
Grok 4.3Mistral Medium 3.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
Grok 4.31,25 $Günstiger
Mistral Medium 3.51,5 $
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Grok 4.32,5 $Günstiger
Mistral Medium 3.57,5 $

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

28 gemeinsame Messreihen
Grok 4.3Mistral Medium 3.5
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.441,442 Arena-PunkteGewinner
Mistral Medium 3.51.427,008 Arena-Punkte
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.438,629 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.430,152 Arena-Punkte
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.484,029 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.450,261 Arena-Punkte
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.488,18 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.478,733 Arena-Punkte
Arena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.427,704 Arena-PunkteGewinner
Mistral Medium 3.51.396,218 Arena-Punkte
Arena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.450,687 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.444,801 Arena-Punkte
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.417,222 Arena-PunkteGewinner
Mistral Medium 3.51.396,264 Arena-Punkte
Arena Text, Style ControlExcluding ties. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.440,416 Arena-PunkteGewinner
Mistral Medium 3.51.421,102 Arena-Punkte
Arena Text, Style ControlExpert prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.449,849 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.437,963 Arena-Punkte
Arena Text, Style ControlFrench. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.462,256 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.437,162 Arena-Punkte
Arena Text, Style ControlGerman. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.440,961 Arena-Punkte
Mistral Medium 3.51.441,705 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlHard prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.31.456,447 Arena-PunkteKein klarer Vorsprung
Mistral Medium 3.51.445,368 Arena-Punkte
Benchmarkwerte von Grok 4.3 und Mistral Medium 3.5
Benchmark und AufgabeGrok 4.3Mistral Medium 3.5VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.441,442 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±3,977Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,008 Arena-Punkte
95-%-Konfidenzintervall: ±6,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 56.645 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.022 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.438,629 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,95Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,152 Arena-Punkte
95-%-Konfidenzintervall: ±13,219Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 11.449 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.143 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.484,029 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±11,768Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.450,261 Arena-Punkte
95-%-Konfidenzintervall: ±26,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 3.105 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 502 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.488,18 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,181Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.478,733 Arena-Punkte
95-%-Konfidenzintervall: ±11,154Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 16.059 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.082 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.427,704 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,364Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,218 Arena-Punkte
95-%-Konfidenzintervall: ±14,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 9.750 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.861 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.450,687 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,148Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.444,801 Arena-Punkte
95-%-Konfidenzintervall: ±8,671Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 26.444 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.311 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.417,222 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,666Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,264 Arena-Punkte
95-%-Konfidenzintervall: ±12,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 13.017 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.442 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.440,416 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,102 Arena-Punkte
95-%-Konfidenzintervall: ±8,693Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 43.375 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.302 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.449,849 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±8,813Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,963 Arena-Punkte
95-%-Konfidenzintervall: ±17,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 5.843 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.109 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.462,256 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±15,331Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,162 Arena-Punkte
95-%-Konfidenzintervall: ±30,614Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 2.163 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 440 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.440,961 Arena-Punkte
95-%-Konfidenzintervall: ±21,657Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.441,705 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±44,46Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 827 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.456,447 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±4,75Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,368 Arena-Punkte
95-%-Konfidenzintervall: ±7,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 37.785 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.159 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.460,354 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.457,822 Arena-Punkte
95-%-Konfidenzintervall: ±10,361Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 18.220 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.642 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.414,396 Arena-Punkte
95-%-Konfidenzintervall: ±5,804Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,086 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±10,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 19.672 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.557 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.398,231 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,569Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.392,952 Arena-Punkte
95-%-Konfidenzintervall: ±44,647Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 890 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.438,593 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±9,805Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.438,388 Arena-Punkte
95-%-Konfidenzintervall: ±21,256Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 4.590 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 844 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.457,838 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,349Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.433,414 Arena-Punkte
95-%-Konfidenzintervall: ±14,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 9.369 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.444,933 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,507Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,645 Arena-Punkte
95-%-Konfidenzintervall: ±9,453Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 25.707 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.657 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.418,736 Arena-Punkte
95-%-Konfidenzintervall: ±12,019Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.429,157 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±24,882Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 2.723 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.432,345 Arena-Punkte
95-%-Konfidenzintervall: ±11,638Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,68 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±24,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 3.003 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 590 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.454,637 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±10,209Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.423,156 Arena-Punkte
95-%-Konfidenzintervall: ±21,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 4.239 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 807 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.446,05 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,217Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,607 Arena-Punkte
95-%-Konfidenzintervall: ±14,403Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 10.326 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.812 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.428,608 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,955Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.406,489 Arena-Punkte
95-%-Konfidenzintervall: ±8,386Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 30.200 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.711 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.443,718 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±19,166Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,19 Arena-Punkte
95-%-Konfidenzintervall: ±38,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 1.018 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.444,533 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,757Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.416,701 Arena-Punkte
95-%-Konfidenzintervall: ±17,895Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 5.692 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.140 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.478,011 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.470,303 Arena-Punkte
95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedKein klarer VorsprungGrok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 22.831 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.328 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.437,309 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±16,38Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.387,211 Arena-Punkte
95-%-Konfidenzintervall: ±32,775Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 1.648 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.424,09 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,854 Arena-Punkte
95-%-Konfidenzintervall: ±11,763Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: Grok 4.3Grok 4.3: Snapshot: grok-4.3, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
Grok 4.3: Stilbereinigte Arena-Bewertung aus 14.137 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.730 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.