Zum Hauptinhalt springen

Direktvergleich

DeepSeek-V4-Flash vs. MiMo-V2.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

58

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von DeepSeek-V4-Flash und MiMo-V2.5
MerkmalDeepSeek-V4-FlashMiMo-V2.5
AnbieterDeepSeekXiaomi
Erschienen24. Apr. 202623. Apr. 2026
VerfügbarkeitPreviewOpen Source
ModelltypOpen WeightsOpen Weights
Parameter284 Mrd., 13 Mrd. aktivNicht veröffentlicht
ArchitekturMixture of ExpertsMixture of Experts
Kontextfenster1.000.000 Token1.000.000 Token
WissensstandNicht veröffentlichtNicht veröffentlicht
Technische QuellenModellModell, Kontext
API-Preise pro 1 Mio. Token
API-Eingabe0,14 $0,14 $
API-Ausgabe0,28 $0,28 $
Cache lesen0, $0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft30.07.2026Quelle31.07.2026Quelle
DeepSeek-V4-FlashMiMo-V2.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
DeepSeek-V4-Flash0,14 $Gleichstand
MiMo-V2.50,14 $Gleichstand
API-AusgabeUSD pro 1 Mio. Token, Basistarif
DeepSeek-V4-Flash0,28 $Gleichstand
MiMo-V2.50,28 $Gleichstand
Cache lesenUSD pro 1 Mio. Token, Basistarif
DeepSeek-V4-Flash0,003 $Gleichstand
MiMo-V2.50,003 $Gleichstand

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

58 gemeinsame Messreihen
DeepSeek-V4-FlashMiMo-V2.5
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
DeepSeek-V4-Flash1.435,476 Arena-PunkteKein klarer Vorsprung
MiMo-V2.51.434,021 Arena-Punkte
Arena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
DeepSeek-V4-Flash1.438,304 Arena-PunkteHöherer Messwert
MiMo-V2.51.434,021 Arena-Punkte
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
DeepSeek-V4-Flash1.437,217 Arena-Punkte
MiMo-V2.51.442,81 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Testaufbau nicht identisch dokumentiert
DeepSeek-V4-Flash1.435,23 Arena-Punkte
MiMo-V2.51.442,81 Arena-PunkteHöherer Messwert
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
DeepSeek-V4-Flash1.474,544 Arena-Punkte
MiMo-V2.51.484,784 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlChinese. Mehr ist besser. Testaufbau nicht identisch dokumentiert
DeepSeek-V4-Flash1.481,177 Arena-Punkte
MiMo-V2.51.484,784 Arena-PunkteHöherer Messwert
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
DeepSeek-V4-Flash1.483,133 Arena-Punkte
MiMo-V2.51.491,103 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlCoding. Mehr ist besser. Testaufbau nicht identisch dokumentiert
DeepSeek-V4-Flash1.479,521 Arena-Punkte
MiMo-V2.51.491,103 Arena-PunkteHöherer Messwert
Arena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
DeepSeek-V4-Flash1.407,934 Arena-PunkteKein klarer Vorsprung
MiMo-V2.51.393,97 Arena-Punkte
Arena Text, Style ControlCreative writing. Mehr ist besser. Testaufbau nicht identisch dokumentiert
DeepSeek-V4-Flash1.408,648 Arena-PunkteHöherer Messwert
MiMo-V2.51.393,97 Arena-Punkte
Arena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
DeepSeek-V4-Flash1.445,34 Arena-Punkte
MiMo-V2.51.453,043 Arena-PunkteKein klarer Vorsprung
Arena Text, Style ControlEnglish. Mehr ist besser. Testaufbau nicht identisch dokumentiert
DeepSeek-V4-Flash1.450,015 Arena-Punkte
MiMo-V2.51.453,043 Arena-PunkteHöherer Messwert
Benchmarkwerte von DeepSeek-V4-Flash und MiMo-V2.5
Benchmark und AufgabeDeepSeek-V4-FlashMiMo-V2.5VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.435,476 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±4,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,021 Arena-Punkte
95-%-Konfidenzintervall: ±4,35Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 49.096 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.628 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlOverall
1.438,304 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±4,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,021 Arena-Punkte
95-%-Konfidenzintervall: ±4,35Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.789 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.628 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.437,217 Arena-Punkte
95-%-Konfidenzintervall: ±7,157Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.442,81 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 9.916 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.122 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.435,23 Arena-Punkte
95-%-Konfidenzintervall: ±7,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.442,81 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.055 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.122 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.474,544 Arena-Punkte
95-%-Konfidenzintervall: ±12,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.484,784 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±13,546Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.557 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.159 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.481,177 Arena-Punkte
95-%-Konfidenzintervall: ±12,66Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.484,784 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±13,546Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.529 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.159 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.483,133 Arena-Punkte
95-%-Konfidenzintervall: ±6,395Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.491,103 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.397 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.905 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.479,521 Arena-Punkte
95-%-Konfidenzintervall: ±6,432Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.491,103 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.353 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.905 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.407,934 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,787Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.393,97 Arena-Punkte
95-%-Konfidenzintervall: ±8,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.974 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.336 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.408,648 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.393,97 Arena-Punkte
95-%-Konfidenzintervall: ±8,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.019 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.336 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.445,34 Arena-Punkte
95-%-Konfidenzintervall: ±5,378Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,043 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,602Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.994 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.269 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.450,015 Arena-Punkte
95-%-Konfidenzintervall: ±5,421Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,043 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,602Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.774 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.269 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.405,522 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,152Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.402,193 Arena-Punkte
95-%-Konfidenzintervall: ±7,408Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.453 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.719 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.405,113 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,086Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.402,193 Arena-Punkte
95-%-Konfidenzintervall: ±7,408Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.654 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.719 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.430,81 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,715 Arena-Punkte
95-%-Konfidenzintervall: ±5,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.067 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 34.194 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.435,522 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,476Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,715 Arena-Punkte
95-%-Konfidenzintervall: ±5,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.085 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 34.194 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.458,397 Arena-Punkte
95-%-Konfidenzintervall: ±9,185Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,954 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±9,68Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.926 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.419 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.467,529 Arena-Punkte
95-%-Konfidenzintervall: ±9,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,954 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,68Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.924 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.419 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.445,102 Arena-Punkte
95-%-Konfidenzintervall: ±15,765Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,306 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±16,559Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.916 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.758 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.458,295 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,306 Arena-Punkte
95-%-Konfidenzintervall: ±16,559Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.884 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.758 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.423,659 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,582Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,083 Arena-Punkte
95-%-Konfidenzintervall: ±22,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 833 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 757 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.435,281 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±21,205Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,083 Arena-Punkte
95-%-Konfidenzintervall: ±22,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 872 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 757 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.459,153 Arena-Punkte
95-%-Konfidenzintervall: ±4,892Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.462,147 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,102Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.675 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 29.865 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.458,18 Arena-Punkte
95-%-Konfidenzintervall: ±4,95Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.462,147 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,102Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.535 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 29.865 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.464,017 Arena-Punkte
95-%-Konfidenzintervall: ±6,178Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.471,998 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,411Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.382 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.254 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.464,963 Arena-Punkte
95-%-Konfidenzintervall: ±6,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.471,998 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,411Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.145 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.254 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.428,017 Arena-Punkte
95-%-Konfidenzintervall: ±5,969Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,009 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,284Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.832 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 15.020 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.434,165 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,039Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,009 Arena-Punkte
95-%-Konfidenzintervall: ±6,284Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.841 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 15.020 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.396,126 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±25,789Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.320,455 Arena-Punkte
95-%-Konfidenzintervall: ±29,007Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedSieger: DeepSeek-V4-FlashDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 628 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 511 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.418,789 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±26,437Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.320,455 Arena-Punkte
95-%-Konfidenzintervall: ±29,007Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 595 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 511 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.393,857 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,517Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,425 Arena-Punkte
95-%-Konfidenzintervall: ±22,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 869 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 790 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.375,542 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±21,534Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,425 Arena-Punkte
95-%-Konfidenzintervall: ±22,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 790 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.448,527 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±10,217Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,834 Arena-Punkte
95-%-Konfidenzintervall: ±10,807Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.907 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.581 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.458,238 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±10,278Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,834 Arena-Punkte
95-%-Konfidenzintervall: ±10,807Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.876 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.581 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.458,241 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,633Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,457 Arena-Punkte
95-%-Konfidenzintervall: ±7,903Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.812 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.227 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.461,582 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,457 Arena-Punkte
95-%-Konfidenzintervall: ±7,903Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.985 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.227 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.448,126 Arena-Punkte
95-%-Konfidenzintervall: ±5,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.452,716 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,971Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.643 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 19.760 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.449,175 Arena-Punkte
95-%-Konfidenzintervall: ±5,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.452,716 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,971Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.682 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 19.760 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.425,263 Arena-Punkte
95-%-Konfidenzintervall: ±12,232Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,844 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.516 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.329 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.440,663 Arena-Punkte
95-%-Konfidenzintervall: ±12,368Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.440,844 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.329 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.431,855 Arena-Punkte
95-%-Konfidenzintervall: ±11,996Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.454,436 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±12,842Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.738 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.436 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.441,422 Arena-Punkte
95-%-Konfidenzintervall: ±12,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.454,436 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±12,842Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.588 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.436 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.459,52 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±10,979Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.447,784 Arena-Punkte
95-%-Konfidenzintervall: ±11,502Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.440 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.165 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.463,011 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±10,889Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.447,784 Arena-Punkte
95-%-Konfidenzintervall: ±11,502Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.505 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 3.165 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.452,835 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.451,055 Arena-Punkte
95-%-Konfidenzintervall: ±7,792Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.848 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.925 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.446,059 Arena-Punkte
95-%-Konfidenzintervall: ±7,528Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.451,055 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,792Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.708 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.925 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.422,787 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,078Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,225 Arena-Punkte
95-%-Konfidenzintervall: ±5,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: DeepSeek-V4-FlashDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.100 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 24.358 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.422,674 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,146Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,225 Arena-Punkte
95-%-Konfidenzintervall: ±5,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.013 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 24.358 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.439,239 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±18,981Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,099 Arena-Punkte
95-%-Konfidenzintervall: ±19,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.007 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 942 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.429,767 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,83Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,099 Arena-Punkte
95-%-Konfidenzintervall: ±19,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.019 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 942 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.432,925 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,941Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,419 Arena-Punkte
95-%-Konfidenzintervall: ±9,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: DeepSeek-V4-FlashDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.272 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.775 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.437,146 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±9,061Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,419 Arena-Punkte
95-%-Konfidenzintervall: ±9,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.232 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.775 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.470,809 Arena-Punkte
95-%-Konfidenzintervall: ±5,639Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,792 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±5,928Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.180 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 18.204 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.473,269 Arena-Punkte
95-%-Konfidenzintervall: ±5,679Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,792 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±5,928Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.086 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 18.204 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.432,449 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±16,767Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,18 Arena-Punkte
95-%-Konfidenzintervall: ±17,562Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.532 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.432,679 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±17,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,18 Arena-Punkte
95-%-Konfidenzintervall: ±17,562Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.427 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.418,104 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±6,732Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,569 Arena-Punkte
95-%-Konfidenzintervall: ±6,951Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedKein klarer VorsprungDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.766 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 10.793 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.421,414 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±6,736Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,569 Arena-Punkte
95-%-Konfidenzintervall: ±6,951Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.864 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 10.793 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.