Direktvergleich
Mistral Large 3 vs. MiMo-V2.5-Pro
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
29
gemeinsame Messreihen
1
verschiedene Benchmarks
16.08.2026
jüngster Abruf
Modellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und Standard-API-Preise
Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Merkmal | Mistral Large 3 | MiMo-V2.5-Pro |
|---|---|---|
| Anbieter | Mistral AI | Xiaomi |
| Erschienen | 2. Dez. 2025 | 23. Apr. 2026 |
| Verfügbarkeit | Aktiv | Open Source |
| Modelltyp | Open Weights | Open Weights |
| Parameter | 675 Mrd., 41 Mrd. aktiv | 1 Billionen, 42 Mrd. aktiv |
| Architektur | Mixture of Experts | Mixture of Experts |
| Kontextfenster | 256.000 Token | 1.000.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell |
| API-Preise pro 1 Mio. Token | ||
| API-Eingabe | 0,5 $ | 0,43 $ |
| API-Ausgabe | 1,5 $ | 0,87 $ |
| Cache lesen | Nicht ausgewiesen | 0, $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026Quelle | 31.07.2026Quelle |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
| Benchmark und Aufgabe | Mistral Large 3 | MiMo-V2.5-Pro | Vergleichbarkeit | Quelle |
|---|---|---|---|---|
| Arena Text, Style ControlOverall | 1.414,798 Arena-Punkte 95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.467,876 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,128Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 50.613 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlBusiness, management and finance | 1.412,96 Arena-Punkte 95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,913 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±7,118Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 10.018 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlChinese | 1.429,195 Arena-Punkte 95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.511,817 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±12,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 2.736 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCoding | 1.468,172 Arena-Punkte 95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.520,126 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,518Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 13.962 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlCreative writing | 1.374,812 Arena-Punkte 95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,675 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±7,575Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 8.652 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEnglish | 1.428,092 Arena-Punkte 95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.482,21 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 22.059 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlEntertainment, sports and media | 1.374,062 Arena-Punkte 95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,359 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,985Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 11.124 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExcluding ties | 1.402,073 Arena-Punkte 95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.473,091 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,304Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 38.559 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlExpert prompts | 1.425,617 Arena-Punkte 95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.507,898 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±9,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 4.771 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlFrench | 1.436,959 Arena-Punkte 95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.493,735 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±15,782Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 1.958 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlGerman | 1.404,865 Arena-Punkte 95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.462,577 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±21,484Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 871 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts | 1.431,831 Arena-Punkte 95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.496,485 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,871Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 33.240 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlHard prompts, English | 1.439,235 Arena-Punkte 95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.504,521 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,248Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 15.161 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlInstruction following | 1.401,455 Arena-Punkte 95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,045 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,995Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 16.727 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlJapanese | 1.372,852 Arena-Punkte 95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.416,884 Arena-PunkteKein klarer Vorsprung 95-%-Konfidenzintervall: ±26,457Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 589 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlKorean | 1.347,595 Arena-Punkte 95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,478 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±20,598Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 974 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLegal and government | 1.422,186 Arena-Punkte 95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.475,088 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±10,148Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 4.078 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLife, physical and social science | 1.427,837 Arena-Punkte 95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.491,082 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 8.201 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlLonger queries | 1.418,594 Arena-Punkte 95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.488,315 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,711Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 22.183 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMath | 1.404,068 Arena-Punkte 95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.476,815 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±12,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 2.451 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMathematical professions | 1.418,682 Arena-Punkte 95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.492,723 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±12,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 2.699 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMedicine and healthcare | 1.432,596 Arena-Punkte 95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.487,792 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±10,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 3.634 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlMulti-turn | 1.421,924 Arena-Punkte 95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.476,696 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±7,473Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 8.895 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlNon-English | 1.398,241 Arena-Punkte 95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.450,003 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±4,973Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 28.554 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlPolish | 1.419,007 Arena-Punkte 95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.471,18 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±19,227Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 984 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlRussian | 1.409,573 Arena-Punkte 95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.460,247 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±8,721Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 5.622 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSoftware and IT services | 1.456,428 Arena-Punkte 95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.508,566 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±5,682Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 20.205 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlSpanish | 1.411,23 Arena-Punkte 95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,305 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±16,799Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 1.539 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
| Arena Text, Style ControlWriting, literature and language | 1.389,648 Arena-Punkte 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.452,429 Arena-PunkteGewinner 95-%-Konfidenzintervall: ±6,563Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5-ProMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 12.618 anonymen Paarvergleichen. | ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026 |
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Mistral Large 3 und MiMo-V2.5-Pro mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.
Zum vollständigen LLM-Vergleich