Zum Hauptinhalt springen

Direktvergleich

Mistral Medium 3.5 vs. MiMo-V2.5-Pro

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

28

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Mistral Medium 3.5 und MiMo-V2.5-Pro
MerkmalMistral Medium 3.5MiMo-V2.5-Pro
AnbieterMistral AIXiaomi
Erschienen28. Apr. 202623. Apr. 2026
VerfügbarkeitAktivOpen Source
ModelltypOpen WeightsOpen Weights
ParameterNicht veröffentlicht1 Billionen, 42 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster256.000 Token1.000.000 Token
WissensstandNicht veröffentlichtNicht veröffentlicht
Technische QuellenModellModell
API-Preise pro 1 Mio. Token
API-Eingabe1,5 $0,43 $
API-Ausgabe7,5 $0,87 $
Cache lesenNicht ausgewiesen0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft30.07.2026Quelle31.07.2026Quelle
Mistral Medium 3.5MiMo-V2.5-Pro
API-EingabeUSD pro 1 Mio. Token, Basistarif
Mistral Medium 3.51,5 $
MiMo-V2.5-Pro0,435 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Mistral Medium 3.57,5 $
MiMo-V2.5-Pro0,87 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

28 gemeinsame Messreihen
Mistral Medium 3.5MiMo-V2.5-Pro
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.427,008 Arena-Punkte
MiMo-V2.5-Pro1.467,876 Arena-PunkteGewinner
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.430,152 Arena-Punkte
MiMo-V2.5-Pro1.470,913 Arena-PunkteGewinner
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.450,261 Arena-Punkte
MiMo-V2.5-Pro1.511,817 Arena-PunkteGewinner
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.478,733 Arena-Punkte
MiMo-V2.5-Pro1.520,126 Arena-PunkteGewinner
Arena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.396,218 Arena-Punkte
MiMo-V2.5-Pro1.433,675 Arena-PunkteGewinner
Arena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.444,801 Arena-Punkte
MiMo-V2.5-Pro1.482,21 Arena-PunkteGewinner
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.396,264 Arena-Punkte
MiMo-V2.5-Pro1.437,359 Arena-PunkteGewinner
Arena Text, Style ControlExcluding ties. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.421,102 Arena-Punkte
MiMo-V2.5-Pro1.473,091 Arena-PunkteGewinner
Arena Text, Style ControlExpert prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.437,963 Arena-Punkte
MiMo-V2.5-Pro1.507,898 Arena-PunkteGewinner
Arena Text, Style ControlFrench. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.437,162 Arena-Punkte
MiMo-V2.5-Pro1.493,735 Arena-PunkteGewinner
Arena Text, Style ControlGerman. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.441,705 Arena-Punkte
MiMo-V2.5-Pro1.462,577 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlHard prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.445,368 Arena-Punkte
MiMo-V2.5-Pro1.496,485 Arena-PunkteGewinner
Benchmarkwerte von Mistral Medium 3.5 und MiMo-V2.5-Pro
Benchmark und AufgabeMistral Medium 3.5MiMo-V2.5-ProVergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.427,008 Arena-Punkte
95-%-Konfidenzintervall: ±6,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.467,876 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,128Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.022 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 50.613 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.430,152 Arena-Punkte
95-%-Konfidenzintervall: ±13,219Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.470,913 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,118Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.143 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 10.018 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.450,261 Arena-Punkte
95-%-Konfidenzintervall: ±26,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.511,817 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 502 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 2.736 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.478,733 Arena-Punkte
95-%-Konfidenzintervall: ±11,154Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.520,126 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,518Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.082 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 13.962 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.396,218 Arena-Punkte
95-%-Konfidenzintervall: ±14,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.433,675 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,575Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.861 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 8.652 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.444,801 Arena-Punkte
95-%-Konfidenzintervall: ±8,671Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.482,21 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.311 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 22.059 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.396,264 Arena-Punkte
95-%-Konfidenzintervall: ±12,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,359 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,985Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.442 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 11.124 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.421,102 Arena-Punkte
95-%-Konfidenzintervall: ±8,693Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,091 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,304Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.302 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 38.559 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.437,963 Arena-Punkte
95-%-Konfidenzintervall: ±17,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.507,898 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.109 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 4.771 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.437,162 Arena-Punkte
95-%-Konfidenzintervall: ±30,614Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.493,735 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,782Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 440 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 1.958 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.441,705 Arena-Punkte
95-%-Konfidenzintervall: ±44,46Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.462,577 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,484Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 871 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.445,368 Arena-Punkte
95-%-Konfidenzintervall: ±7,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.496,485 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.159 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 33.240 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.457,822 Arena-Punkte
95-%-Konfidenzintervall: ±10,361Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.504,521 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,248Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.642 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 15.161 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.422,086 Arena-Punkte
95-%-Konfidenzintervall: ±10,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.470,045 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,995Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.557 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 16.727 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.392,952 Arena-Punkte
95-%-Konfidenzintervall: ±44,647Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,478 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±20,598Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 974 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.438,388 Arena-Punkte
95-%-Konfidenzintervall: ±21,256Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.475,088 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,148Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 844 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 4.078 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.433,414 Arena-Punkte
95-%-Konfidenzintervall: ±14,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.491,082 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 8.201 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.430,645 Arena-Punkte
95-%-Konfidenzintervall: ±9,453Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.488,315 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,711Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.657 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 22.183 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.429,157 Arena-Punkte
95-%-Konfidenzintervall: ±24,882Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.476,815 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 2.451 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.439,68 Arena-Punkte
95-%-Konfidenzintervall: ±24,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.492,723 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 590 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 2.699 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.423,156 Arena-Punkte
95-%-Konfidenzintervall: ±21,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.487,792 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 807 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 3.634 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.431,607 Arena-Punkte
95-%-Konfidenzintervall: ±14,403Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.476,696 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,473Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.812 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 8.895 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.406,489 Arena-Punkte
95-%-Konfidenzintervall: ±8,386Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.450,003 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,973Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.711 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 28.554 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.408,19 Arena-Punkte
95-%-Konfidenzintervall: ±38,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.471,18 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±19,227Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 984 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.416,701 Arena-Punkte
95-%-Konfidenzintervall: ±17,895Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.460,247 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,721Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.140 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 5.622 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.470,303 Arena-Punkte
95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.508,566 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,682Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.328 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 20.205 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.387,211 Arena-Punkte
95-%-Konfidenzintervall: ±32,775Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.459,305 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±16,799Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 1.539 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.405,854 Arena-Punkte
95-%-Konfidenzintervall: ±11,763Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.452,429 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,563Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.730 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 12.618 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.