Zum Hauptinhalt springen

Direktvergleich

Grok 4.6 vs. MiMo-V2.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

39

gemeinsame Messreihen

21

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Grok 4.6 und MiMo-V2.5
MerkmalGrok 4.6MiMo-V2.5
AnbieterxAIXiaomi
Erschienen12. Aug. 202623. Apr. 2026
VerfügbarkeitAktivOpen Source
ModelltypProprietärOpen Weights
ParameterNicht veröffentlichtNicht veröffentlicht
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster500.000 Token1.000.000 Token
Wissensstand1. Februar 2026Nicht veröffentlicht
Technische QuellenModellModell, Kontext
API-Preise pro 1 Mio. Token
API-Eingabe2 $ ≤200K / 4 $ >200K0,14 $
API-Ausgabe6 $ ≤200K / 12 $ >200K0,28 $
Cache lesen0,5 $ ≤200K / 1 $ >200K0, $
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft16.08.2026Quelle31.07.2026Quelle
Grok 4.6MiMo-V2.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
Grok 4.62 $
MiMo-V2.50,14 $Günstiger
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Grok 4.66 $
MiMo-V2.50,28 $Günstiger
Cache lesenUSD pro 1 Mio. Token, Basistarif
Grok 4.60,5 $
MiMo-V2.50,003 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

39 gemeinsame Messreihen
Grok 4.6MiMo-V2.5
Arena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
Grok 4.61.464,323 Arena-PunkteHöherer Messwert
MiMo-V2.51.434,021 Arena-Punkte
Code MigrationOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.644,572 %Gewinner
MiMo-V2.514,228 %
CorpFin v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.666,161 %Gewinner
MiMo-V2.559,907 %
EMBOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.662,727 %Gewinner
MiMo-V2.555,092 %
Finance Agent (v2)Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.653,682 %Gewinner
MiMo-V2.536,728 %
GPQA DiamondOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.694,697 %Gewinner
MiMo-V2.581,566 %
Harvey's Legal Agent BenchmarkOverall · Task fully resolved. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.615,833 %Gewinner
MiMo-V2.51,667 %
Legal Research BenchOverall · All-pass. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.648,077 %Gewinner
MiMo-V2.59,135 %
LegalBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.686,307 %Gewinner
MiMo-V2.578,886 %
LiveCodeBench v6Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.688,224 %Gewinner
MiMo-V2.581,512 %
MedCodeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.644,712 %Gewinner
MiMo-V2.531,895 %
MedScribeOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Grok 4.686,534 %Gewinner
MiMo-V2.572,151 %
Benchmarkwerte von Grok 4.6 und MiMo-V2.5
Benchmark und AufgabeGrok 4.6MiMo-V2.5VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.464,323 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±11,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,021 Arena-Punkte
95-%-Konfidenzintervall: ±4,35Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 2.448 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.628 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Code MigrationOverall
44,572 %Gewinner
14,228 %
1accuracyMehr ist besserKohorte: vals-code-migration:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-code-migration-2026-08-16-107652dc6bfcAbgerufen am 16.08.2026
CorpFin v2Overall
66,161 %Gewinner
59,907 %
2accuracyMehr ist besserKohorte: vals-corp-fin-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-corp_fin_v2-2026-08-16-45bbf84f57abAbgerufen am 16.08.2026
EMBOverall
62,727 %Gewinner
55,092 %
1accuracyMehr ist besserKohorte: vals-emb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-emb-2026-08-16-68d5d1d47a97Abgerufen am 16.08.2026
Finance Agent (v2)Overall
53,682 %Gewinner
36,728 %
2accuracyMehr ist besserKohorte: vals-finance-agent-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-fabv2-2026-08-16-8853da43085dAbgerufen am 16.08.2026
GPQA DiamondOverall
94,697 %Gewinner
81,566 %
1accuracyMehr ist besserKohorte: vals-gpqa:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-gpqa-2026-08-16-7f8363eaa2dbAbgerufen am 16.08.2026
Harvey's Legal Agent BenchmarkOverall · Task fully resolved
15,833 %Gewinner
1,667 %
1task resolution rateMehr ist besserKohorte: vals-legal-agent-benchmark:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-hlab-2026-08-16-bae90566df2fAbgerufen am 16.08.2026
Legal Research BenchOverall · All-pass
48,077 %Gewinner
9,135 %
1all-pass rateMehr ist besserKohorte: vals-legal-research:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-legal_research-2026-08-16-af296c00ecaaAbgerufen am 16.08.2026
LegalBenchOverall
86,307 %Gewinner
78,886 %
1accuracyMehr ist besserKohorte: vals-legal-bench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-legal_bench-2026-08-16-d5b3b1b2b5c8Abgerufen am 16.08.2026
LiveCodeBench v6Overall
88,224 %Gewinner
81,512 %
1accuracyMehr ist besserKohorte: vals-lcb:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-lcb-2026-08-16-17b9c147080dAbgerufen am 16.08.2026
MedCodeOverall
44,712 %Gewinner
31,895 %
1accuracyMehr ist besserKohorte: vals-medcode:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medcode-2026-08-16-524f7f474eacAbgerufen am 16.08.2026
MedScribeOverall
86,534 %Gewinner
72,151 %
1accuracyMehr ist besserKohorte: vals-medscribe:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-medscribe-2026-08-16-c385354a7e62Abgerufen am 16.08.2026
MMLU-ProOverall
89,4 %Gewinner
82,931 %
1accuracyMehr ist besserKohorte: vals-mmlu-pro:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-mmlu_pro-2026-08-16-e14d5bb3a34cAbgerufen am 16.08.2026
MortgageTaxOverall
64,189 %Gewinner
59,26 %
1accuracyMehr ist besserKohorte: vals-mortgage-tax:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-mortgage_tax-2026-08-16-e78c985dbb1cAbgerufen am 16.08.2026
ProofBenchOverall
51 %Gewinner
16 %
1.1accuracyMehr ist besserKohorte: vals-proof-bench:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-proof_bench-2026-08-16-14232db24de1Abgerufen am 16.08.2026
SAGEOverall
28,9 %
43,265 %Gewinner
1accuracyMehr ist besserKohorte: vals-sage:1:overallKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-sage-2026-08-16-a416dd25affbAbgerufen am 16.08.2026
SWE-bench VerifiedOverall
95,6 %Gewinner
71 %
1accuracyMehr ist besserKohorte: vals-swebench:1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-swebench-2026-08-16-c133071b8167Abgerufen am 16.08.2026
TaxEval v2Overall
71,096 %
71,832 %Gewinner
2accuracyMehr ist besserKohorte: vals-tax-eval-v2:2:overallKein dokumentierter Setup-UnterschiedSieger: MiMo-V2.5Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 12.08.2026Import-ID: vals-tax_eval_v2-2026-08-16-5bbd495dac53Abgerufen am 16.08.2026
Terminal-Bench 2.1Overall
78,277 %Gewinner
60,674 %
2.1accuracyMehr ist besserKohorte: vals-terminal-bench-2-1:2.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-terminal-bench-2-1-2026-08-16-b3f38c18bea4Abgerufen am 16.08.2026
Vals IndexOverall
59,167 %Gewinner
39,91 %
2weighted index scoreMehr ist besserKohorte: vals-vals-index:2:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Keine weiteren Einstellungen ausgewiesen
MiMo-V2.5: Keine weiteren Einstellungen ausgewiesen
Vals AITyp: Unabhängige EvaluationMessstand: 14.08.2026Import-ID: vals-vals_index-2026-08-16-ab641d89d6edAbgerufen am 16.08.2026
Vibe Code Bench v1.1Overall
76,239 %Gewinner
42,174 %
1.1accuracyMehr ist besserKohorte: vals-vibe-code-bench:1.1:overallKein dokumentierter Setup-UnterschiedSieger: Grok 4.6Grok 4.6: Harness: OpenHands
MiMo-V2.5: Harness: OpenHands
Vals AITyp: Unabhängige EvaluationMessstand: 13.08.2026Import-ID: vals-vibe-code-2026-08-16-a73c9770bcc4Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.455,102 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±27,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.442,81 Arena-Punkte
95-%-Konfidenzintervall: ±7,454Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 442 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.122 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.535,167 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±39,462Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.484,784 Arena-Punkte
95-%-Konfidenzintervall: ±13,546Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 215 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.159 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.511,77 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±26,72Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.491,103 Arena-Punkte
95-%-Konfidenzintervall: ±6,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 485 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.905 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.472,894 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,578Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.393,97 Arena-Punkte
95-%-Konfidenzintervall: ±8,032Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 379 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.336 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.459,266 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,461Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,043 Arena-Punkte
95-%-Konfidenzintervall: ±5,602Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.269 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.455,476 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±28,81Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.402,193 Arena-Punkte
95-%-Konfidenzintervall: ±7,408Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 448 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.719 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.469,633 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±16,492Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,715 Arena-Punkte
95-%-Konfidenzintervall: ±5,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.782 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 34.194 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.479,969 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±34,191Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.473,954 Arena-Punkte
95-%-Konfidenzintervall: ±9,68Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 272 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.419 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.488,551 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,88Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.462,147 Arena-Punkte
95-%-Konfidenzintervall: ±5,102Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.397 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 29.865 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.472,181 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±25,031Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.471,998 Arena-Punkte
95-%-Konfidenzintervall: ±6,411Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 14.254 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.460,755 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±21,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,009 Arena-Punkte
95-%-Konfidenzintervall: ±6,284Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 732 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 15.020 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.497,908 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±31,96Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.453,457 Arena-Punkte
95-%-Konfidenzintervall: ±7,903Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 335 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.227 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.485,451 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±18,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.452,716 Arena-Punkte
95-%-Konfidenzintervall: ±5,971Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.103 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 19.760 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.444,26 Arena-Punkte
95-%-Konfidenzintervall: ±31,774Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.451,055 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±7,792Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 352 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.925 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.461,99 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±15,246Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,225 Arena-Punkte
95-%-Konfidenzintervall: ±5,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 1.450 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 24.358 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.446,737 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±34,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,419 Arena-Punkte
95-%-Konfidenzintervall: ±9,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 275 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 4.775 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.511,885 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±20,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,792 Arena-Punkte
95-%-Konfidenzintervall: ±5,928Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 805 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 18.204 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.455,393 Arena-PunkteHöherer Messwert
95-%-Konfidenzintervall: ±25,717Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,569 Arena-Punkte
95-%-Konfidenzintervall: ±6,951Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageTestaufbau nicht identisch dokumentiertKein direkter SiegerGrok 4.6: Snapshot: grok-4.6-high, Reasoning: high, Harness: Arena text, style control
MiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control
Grok 4.6: Stilbereinigte Arena-Bewertung aus 543 anonymen Paarvergleichen.MiMo-V2.5: Stilbereinigte Arena-Bewertung aus 10.793 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.