Direktvergleich
Mistral Medium 3.5 vs. MiMo-V2.5
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
28
gemeinsame Messreihen
1
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | Mistral Medium 3.5 | MiMo-V2.5 |
|---|---|---|
| Anbieter | Mistral AI | Xiaomi |
| Erschienen | 28. Apr. 2026 | 23. Apr. 2026 |
| Verfügbarkeit | Aktiv | Open Source |
| Modelltyp | Open Weights | Open Weights |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 256.000 Token | 1.000.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell, Kontext |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 1,5 $ | 0,14 $ |
| API-Ausgabe | 7,5 $ | 0,28 $ |
| Cache lesen | Nicht ausgewiesen | 0, $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026Quelle | 31.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | Mistral Medium 3.5 | MiMo-V2.5 | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.427,008 Arena-Punkte 95-%-Konfidenzintervall: ±6,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,021 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±4,35Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.022 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.628 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.430,152 Arena-Punkte 95-%-Konfidenzintervall: ±13,219Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.442,81 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±7,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.143 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.122 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.450,261 Arena-Punkte 95-%-Konfidenzintervall: ±26,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.484,784 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±13,546Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 502 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.159 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.478,733 Arena-Punkte 95-%-Konfidenzintervall: ±11,154Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.491,103 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±6,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.082 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.905 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.396,218 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±14,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.393,97 Arena-Punkte 95-%-Konfidenzintervall: ±8,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.861 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.336 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.444,801 Arena-Punkte 95-%-Konfidenzintervall: ±8,671Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.453,043 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±5,602Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.311 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.269 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.396,264 Arena-Punkte 95-%-Konfidenzintervall: ±12,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.402,193 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±7,408Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.442 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.719 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.421,102 Arena-Punkte 95-%-Konfidenzintervall: ±8,693Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,715 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±5,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.302 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 34.194 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.437,963 Arena-Punkte 95-%-Konfidenzintervall: ±17,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.473,954 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±9,68Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.109 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.419 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.437,162 Arena-Punkte 95-%-Konfidenzintervall: ±30,614Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.453,306 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±16,559Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 440 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.758 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.441,705 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±44,46Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.420,083 Arena-Punkte 95-%-Konfidenzintervall: ±22,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 757 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.445,368 Arena-Punkte 95-%-Konfidenzintervall: ±7,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.462,147 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,102Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.159 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 29.865 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.457,822 Arena-Punkte 95-%-Konfidenzintervall: ±10,361Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.471,998 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±6,411Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.642 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.254 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.422,086 Arena-Punkte 95-%-Konfidenzintervall: ±10,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,009 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±6,284Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.557 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 15.020 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.392,952 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±44,647Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,425 Arena-Punkte 95-%-Konfidenzintervall: ±22,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 790 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.438,388 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±21,256Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,834 Arena-Punkte 95-%-Konfidenzintervall: ±10,807Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 844 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.581 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.433,414 Arena-Punkte 95-%-Konfidenzintervall: ±14,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.453,457 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±7,903Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.227 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.430,645 Arena-Punkte 95-%-Konfidenzintervall: ±9,453Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.452,716 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,971Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.657 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 19.760 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.429,157 Arena-Punkte 95-%-Konfidenzintervall: ±24,882Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.440,844 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.329 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.439,68 Arena-Punkte 95-%-Konfidenzintervall: ±24,051Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.454,436 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±12,842Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 590 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.436 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.423,156 Arena-Punkte 95-%-Konfidenzintervall: ±21,773Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.447,784 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±11,502Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 807 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.165 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.431,607 Arena-Punkte 95-%-Konfidenzintervall: ±14,403Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.451,055 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±7,792Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.812 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.925 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.406,489 Arena-Punkte 95-%-Konfidenzintervall: ±8,386Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.411,225 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±5,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.711 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 24.358 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.408,19 Arena-Punkte 95-%-Konfidenzintervall: ±38,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.420,099 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±19,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 942 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.416,701 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±17,895Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,419 Arena-Punkte 95-%-Konfidenzintervall: ±9,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.140 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.775 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.470,303 Arena-Punkte 95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,792 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±5,928Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.328 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 18.204 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.387,211 Arena-Punkte 95-%-Konfidenzintervall: ±32,775Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,18 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±17,562Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 373 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.405,854 Arena-Punkte 95-%-Konfidenzintervall: ±11,763Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.411,569 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±6,951Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style controlMistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.730 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 10.793 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Mistral Medium 3.5 und MiMo-V2.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich