Zum Hauptinhalt springen

Direktvergleich

Mistral Large 3 vs. MiMo-V2.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

29

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Mistral Large 3 und MiMo-V2.5
MerkmalMistral Large 3MiMo-V2.5
AnbieterMistral AIXiaomi
Erschienen2. Dez. 202523. Apr. 2026
VerfügbarkeitAktivOpen Source
ModelltypOpen WeightsOpen Weights
Parameter675 Mrd., 41 Mrd. aktivNicht veröffentlicht
ArchitekturMixture of ExpertsMixture of Experts
Kontextfenster256.000 Token1.000.000 Token
WissensstandNicht veröffentlichtNicht veröffentlicht
Technische QuellenModellModell, Kontext
API-Preise pro 1 Mio. Token
API-Eingabe0,5 $0,14 $
API-Ausgabe1,5 $0,28 $
Cache lesenNicht ausgewiesen0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft30.07.2026Quelle31.07.2026Quelle
Mistral Large 3MiMo-V2.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
Mistral Large 30,5 $
MiMo-V2.50,14 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Mistral Large 31,5 $
MiMo-V2.50,28 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

29 gemeinsame Messreihen
Mistral Large 3MiMo-V2.5
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.414,798 Arena-Punkte
MiMo-V2.51.434,021 Arena-PunkteGewinner
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.412,96 Arena-Punkte
MiMo-V2.51.442,81 Arena-PunkteGewinner
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.429,195 Arena-Punkte
MiMo-V2.51.484,784 Arena-PunkteGewinner
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.468,172 Arena-Punkte
MiMo-V2.51.491,103 Arena-PunkteGewinner
Arena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.374,812 Arena-Punkte
MiMo-V2.51.393,97 Arena-PunkteGewinner
Arena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.428,092 Arena-Punkte
MiMo-V2.51.453,043 Arena-PunkteGewinner
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.374,062 Arena-Punkte
MiMo-V2.51.402,193 Arena-PunkteGewinner
Arena Text, Style ControlExcluding ties. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.402,073 Arena-Punkte
MiMo-V2.51.427,715 Arena-PunkteGewinner
Arena Text, Style ControlExpert prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.425,617 Arena-Punkte
MiMo-V2.51.473,954 Arena-PunkteGewinner
Arena Text, Style ControlFrench. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.436,959 Arena-Punkte
MiMo-V2.51.453,306 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlGerman. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.404,865 Arena-Punkte
MiMo-V2.51.420,083 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlHard prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Mistral Large 31.431,831 Arena-Punkte
MiMo-V2.51.462,147 Arena-PunkteGewinner
Benchmarkwerte von Mistral Large 3 und MiMo-V2.5
Benchmark und AufgabeMistral Large 3MiMo-V2.5VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.414,798 Arena-Punkte
95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,021 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±4,35Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.628 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.412,96 Arena-Punkte
95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.442,81 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.122 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.429,195 Arena-Punkte
95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.484,784 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±13,546Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.159 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.468,172 Arena-Punkte
95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.491,103 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.905 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.374,812 Arena-Punkte
95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.393,97 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.336 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.428,092 Arena-Punkte
95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,043 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,602Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.269 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.374,062 Arena-Punkte
95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.402,193 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,408Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.719 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.402,073 Arena-Punkte
95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,715 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 34.194 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.425,617 Arena-Punkte
95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,954 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,68Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.419 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.436,959 Arena-Punkte
95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,306 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±16,559Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.758 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.404,865 Arena-Punkte
95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,083 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±22,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 757 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.431,831 Arena-Punkte
95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.462,147 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,102Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 29.865 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.439,235 Arena-Punkte
95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.471,998 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,411Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.254 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.401,455 Arena-Punkte
95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,009 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,284Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 15.020 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.372,852 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.320,455 Arena-Punkte
95-%-Konfidenzintervall: ±29,007Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 511 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.347,595 Arena-Punkte
95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,425 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±22,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 790 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.422,186 Arena-Punkte
95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,834 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±10,807Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.581 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.427,837 Arena-Punkte
95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,457 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,903Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.227 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.418,594 Arena-Punkte
95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.452,716 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,971Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 19.760 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.404,068 Arena-Punkte
95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,844 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.329 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.418,682 Arena-Punkte
95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.454,436 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,842Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.436 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.432,596 Arena-Punkte
95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.447,784 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±11,502Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.165 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.421,924 Arena-Punkte
95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.451,055 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,792Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.925 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.398,241 Arena-Punkte
95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,225 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 24.358 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.419,007 Arena-Punkte
95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,099 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±19,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 942 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.409,573 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,419 Arena-Punkte
95-%-Konfidenzintervall: ±9,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.775 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.456,428 Arena-Punkte
95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,792 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,928Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 18.204 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.411,23 Arena-Punkte
95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,18 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±17,562Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedKein klarer VorsprungMistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.389,648 Arena-Punkte
95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,569 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±6,951Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 10.793 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.