Zum Hauptinhalt springen

Direktvergleich

Mistral Medium 3.5 vs. MiMo-V2.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

gemeinsame Messreihen
28
verschiedene Benchmarks
1
jüngster Abruf
04.09.2026

Modellauswahl ändern

Steckbrief

Allgemeine Daten

Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.

Allgemeine Daten von Mistral Medium 3.5 und MiMo-V2.5
MerkmalMistral Medium 3.5MiMo-V2.5
AnbieterMistral AIXiaomi
Erschienen28. Apr. 202623. Apr. 2026
VerfügbarkeitAktivOpen Source
ModelltypOpen WeightsOpen Weights
ParameterNicht veröffentlichtNicht veröffentlicht
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster256.000 Token1.000.000 Token
WissensstandNicht veröffentlichtNicht veröffentlicht
Technische QuellenModellModell, Kontext

Kosten

API-Preise im Vergleich

Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

API-Preise von Mistral Medium 3.5 und MiMo-V2.5
PreisartMistral Medium 3.5MiMo-V2.5
API-Eingabe1,5 $0,14 $
API-Ausgabe7,5 $0,28 $
Cache lesenNicht ausgewiesen0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft30.07.2026 Quelle31.07.2026 Quelle
Mistral Medium 3.5MiMo-V2.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
Mistral Medium 3.51,5 $
MiMo-V2.5Günstiger0,14 $
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Mistral Medium 3.57,5 $
MiMo-V2.5Günstiger0,28 $

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Preise nach Anbieter

Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.

Anbieterpreise von Mistral Medium 3.5 und MiMo-V2.5
ModellAnbieterBezugsweg und TarifEingabe pro 1 Mio. TokenAusgabe pro 1 Mio. TokenQuelle
Mistral Medium 3.5Mistral AIDirekt beim EntwicklerStandard-APIGünstigster erfasster Preis: 1,5 $Günstigster erfasster Preis: 7,5 $Quelle30.07.2026
MistralÜber OpenRoutermistralGünstigster erfasster Preis: 1,5 $Günstigster erfasster Preis: 7,5 $Quelle07.09.2026
MistralÜber OpenRoutermistral/eu1,65 $8,25 $Quelle07.09.2026
MistralÜber OpenRoutermistral/zdrGünstigster erfasster Preis: 1,5 $Günstigster erfasster Preis: 7,5 $Quelle07.09.2026
MiMo-V2.5XiaomiDirekt beim EntwicklerStandard-API0,14 $0,28 $Quelle31.07.2026
DeepInfraÜber OpenRouterdeepinfra/fp80,13 $0,65 $Quelle07.09.2026
GMICloudÜber OpenRoutergmicloud/fp8Günstigster erfasster Preis: 0,119 $Günstigster erfasster Preis: 0,238 $Quelle07.09.2026
NovitaÜber OpenRouternovita/fp80,168 $0,336 $Quelle07.09.2026
StreamLakeÜber OpenRouterstreamlake0,168 $0,336 $Quelle07.09.2026
XiaomiÜber OpenRouterxiaomi/fp80,14 $0,28 $Quelle07.09.2026

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

Fähigkeitsprofil aus vergleichbaren Benchmarks

Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.

255075100CodingReasoningMathematikWissenFinanzenRechtGesundheitAllgemein
Mistral Medium 3.5
MiMo-V2.5
Coding: 99,2 / 100 (1 Benchmarkfamilie)
Reasoning: 98,5 / 100 (1 Benchmarkfamilie)
Mathematik: 99,2 / 100 (1 Benchmarkfamilie)
Wissen: 98,5 / 100 (1 Benchmarkfamilie)
Finanzen: 99,3 / 100 (1 Benchmarkfamilie)
Recht: 100 / 99,3 (1 Benchmarkfamilie)
Gesundheit: 98,3 / 100 (1 Benchmarkfamilie)
Allgemein: 99,3 / 99,8 (1 Benchmarkfamilie)

28 passende Messreihen aus 1 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 8 vergleichbaren Kategorien.

Mistral Medium 3.5MiMo-V2.5
LMArena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.426,98
MiMo-V2.5Kein klarer Vorsprung1.433,798
LMArena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.431,113
MiMo-V2.5Kein klarer Vorsprung1.441,542
LMArena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.448,299
MiMo-V2.5Kein klarer Vorsprung1.483,45
LMArena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.478,845
MiMo-V2.5Kein klarer Vorsprung1.491,02
LMArena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.5Kein klarer Vorsprung1.396,971
MiMo-V2.51.392,817
LMArena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.444,656
MiMo-V2.5Kein klarer Vorsprung1.452,388
LMArena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.396,875
MiMo-V2.5Kein klarer Vorsprung1.401,59
LMArena Text, Style ControlExcluding ties. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.421,17
MiMo-V2.5Kein klarer Vorsprung1.427,481
LMArena Text, Style ControlExpert prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.438,278
MiMo-V2.5Gewinner1.474,263
LMArena Text, Style ControlFrench. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.436,08
MiMo-V2.5Kein klarer Vorsprung1.454,676
LMArena Text, Style ControlGerman. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.5Kein klarer Vorsprung1.442,607
MiMo-V2.51.421,467
LMArena Text, Style ControlHard prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Medium 3.51.445,592
MiMo-V2.5Gewinner1.461,799

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Benchmarkwerte von Mistral Medium 3.5 und MiMo-V2.5
Benchmark und AufgabeMistral Medium 3.5MiMo-V2.5Quelle
LMArena Text, Style ControlOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.017 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.540 anonymen Paarvergleichen.
1.426,98
95-%-Konfidenzintervall: ±6,556Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.433,798
95-%-Konfidenzintervall: ±4,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlBusiness, management and finance
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.148 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.127 anonymen Paarvergleichen.
1.431,113
95-%-Konfidenzintervall: ±13,17Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.441,542
95-%-Konfidenzintervall: ±7,42Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlChinese
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 500 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.140 anonymen Paarvergleichen.
1.448,299
95-%-Konfidenzintervall: ±26,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.483,45
95-%-Konfidenzintervall: ±13,352Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlCoding
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.079 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.854 anonymen Paarvergleichen.
1.478,845
95-%-Konfidenzintervall: ±11,157Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.491,02
95-%-Konfidenzintervall: ±6,676Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlCreative writing
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.862 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.343 anonymen Paarvergleichen.
Kein klarer Vorsprung1.396,971
95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.392,817
95-%-Konfidenzintervall: ±8,004Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlEnglish
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.299 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.213 anonymen Paarvergleichen.
1.444,656
95-%-Konfidenzintervall: ±8,682Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.452,388
95-%-Konfidenzintervall: ±5,607Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlEntertainment, sports and media
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.453 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.698 anonymen Paarvergleichen.
1.396,875
95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.401,59
95-%-Konfidenzintervall: ±7,383Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlExcluding ties
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.299 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 34.136 anonymen Paarvergleichen.
1.421,17
95-%-Konfidenzintervall: ±8,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.427,481
95-%-Konfidenzintervall: ±5,599Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlExpert prompts
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.110 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.401 anonymen Paarvergleichen.
1.438,278
95-%-Konfidenzintervall: ±17,831Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Gewinner1.474,263
95-%-Konfidenzintervall: ±9,645Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlFrench
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 438 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.754 anonymen Paarvergleichen.
1.436,08
95-%-Konfidenzintervall: ±30,551Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.454,676
95-%-Konfidenzintervall: ±16,333Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlGerman
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 759 anonymen Paarvergleichen.
Kein klarer Vorsprung1.442,607
95-%-Konfidenzintervall: ±44,317Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,467
95-%-Konfidenzintervall: ±22,574Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlHard prompts
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.154 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 29.811 anonymen Paarvergleichen.
1.445,592
95-%-Konfidenzintervall: ±7,857Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Gewinner1.461,799
95-%-Konfidenzintervall: ±5,088Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlHard prompts, English
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.629 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.215 anonymen Paarvergleichen.
1.458,246
95-%-Konfidenzintervall: ±10,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.471,581
95-%-Konfidenzintervall: ±6,423Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlInstruction following
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.561 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.987 anonymen Paarvergleichen.
1.422,491
95-%-Konfidenzintervall: ±10,335Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.431,463
95-%-Konfidenzintervall: ±6,27Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlKorean
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 784 anonymen Paarvergleichen.
Kein klarer Vorsprung1.394,42
95-%-Konfidenzintervall: ±44,572Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.373,664
95-%-Konfidenzintervall: ±22,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlLegal and government
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 839 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.566 anonymen Paarvergleichen.
Kein klarer Vorsprung1.437,785
95-%-Konfidenzintervall: ±21,302Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,361
95-%-Konfidenzintervall: ±10,778Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlLife, physical and social science
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.207 anonymen Paarvergleichen.
1.433,494
95-%-Konfidenzintervall: ±14,359Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.452,891
95-%-Konfidenzintervall: ±7,882Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlLonger queries
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.661 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 19.717 anonymen Paarvergleichen.
1.430,723
95-%-Konfidenzintervall: ±9,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Gewinner1.452,091
95-%-Konfidenzintervall: ±5,953Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlMath
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.327 anonymen Paarvergleichen.
1.429,582
95-%-Konfidenzintervall: ±24,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.440,393
95-%-Konfidenzintervall: ±12,473Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlMathematical professions
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 597 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.441 anonymen Paarvergleichen.
1.442,192
95-%-Konfidenzintervall: ±23,932Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.454,25
95-%-Konfidenzintervall: ±12,776Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlMedicine and healthcare
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 802 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.164 anonymen Paarvergleichen.
1.423,47
95-%-Konfidenzintervall: ±21,791Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.448,067
95-%-Konfidenzintervall: ±11,459Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlMulti-turn
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.803 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.901 anonymen Paarvergleichen.
1.431,302
95-%-Konfidenzintervall: ±14,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.450,214
95-%-Konfidenzintervall: ±7,779Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlNon-English
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.718 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 24.326 anonymen Paarvergleichen.
1.406,687
95-%-Konfidenzintervall: ±8,36Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.411,361
95-%-Konfidenzintervall: ±5,294Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlPolish
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 929 anonymen Paarvergleichen.
1.407,955
95-%-Konfidenzintervall: ±38,858Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.420,076
95-%-Konfidenzintervall: ±19,427Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlRussian
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.143 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.772 anonymen Paarvergleichen.
Kein klarer Vorsprung1.415,692
95-%-Konfidenzintervall: ±17,832Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.404,83
95-%-Konfidenzintervall: ±9,316Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlSoftware and IT services
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.320 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 18.163 anonymen Paarvergleichen.
1.470,76
95-%-Konfidenzintervall: ±9,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.479,843
95-%-Konfidenzintervall: ±5,913Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlSpanish
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 377 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.414 anonymen Paarvergleichen.
1.386,845
95-%-Konfidenzintervall: ±32,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.411,308
95-%-Konfidenzintervall: ±17,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlWriting, literature and language
Testdetails
Kein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.734 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 10.784 anonymen Paarvergleichen.
1.405,944
95-%-Konfidenzintervall: ±11,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein klarer Vorsprung1.411,069
95-%-Konfidenzintervall: ±6,937Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 01.09.2026

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.

Weitere Duelle

Vergleiche Mistral Medium 3.5 und MiMo-V2.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.

Zum vollständigen LLM-Vergleich