CorpFin v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 61,033 % | Vals AIQuellendetailsDatenstand: 12.08.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 68,434 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 79,138 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
LiveCodeBench v6OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 55,337 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 119.196 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 77.456 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±3,034Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.413,254 95-%-Konfidenzintervall: ±2,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
MedQAOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 82,233 % | Vals AIQuellendetailsDatenstand: 16.04.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 79,823 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MMMU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 66,185 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MortgageTaxOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 52,106 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
SAGEOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 24,595 % | Vals AIQuellendetailsDatenstand: 26.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 41,4 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 72,882 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.0OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.0Messgröße: accuracyBewertung: Mehr ist besser | | 8,989 % | Vals AIQuellendetailsDatenstand: 04.06.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 23.398 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.597 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±5,145Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,446 95-%-Konfidenzintervall: ±5,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 8.183 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.845 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±7,531Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,058 95-%-Konfidenzintervall: ±8,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 33.049 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.574 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.469,182 95-%-Konfidenzintervall: ±4,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 21.305 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.448 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±5,535Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,648 95-%-Konfidenzintervall: ±5,824Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 52.351 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.060 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,036Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.426,615 95-%-Konfidenzintervall: ±4,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 27.013 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.716 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±5,112Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.371,316 95-%-Konfidenzintervall: ±5,299Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 89.549 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 56.501 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,1Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.400,18 95-%-Konfidenzintervall: ±4,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 12.336 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 7.295 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±6,452Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,543 95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlFrenchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 3.917 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.181 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±11,678Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,389 95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlGermanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 1.979 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.257 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±14,89Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,467 95-%-Konfidenzintervall: ±17,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlHard promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 77.865 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 47.316 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±3,69Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,274 95-%-Konfidenzintervall: ±3,63Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 35.115 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.638 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,646Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,274 95-%-Konfidenzintervall: ±4,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 40.860 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 24.861 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,393Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.400,115 95-%-Konfidenzintervall: ±4,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlJapaneseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 1.365 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 830 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±18,293Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.382,659 95-%-Konfidenzintervall: ±22,106Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlKoreanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 2.108 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.318 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±14,845Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.356,821 95-%-Konfidenzintervall: ±17,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 9.836 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.879 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±7,024Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,357 95-%-Konfidenzintervall: ±8,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 19.920 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.690 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±5,358Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,685 95-%-Konfidenzintervall: ±5,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 52.750 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.146 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,296Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.417,29 95-%-Konfidenzintervall: ±4,417Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlMathTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 6.192 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.411 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±8,229Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.401,493 95-%-Konfidenzintervall: ±9,177Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 6.656 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.047 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±8,227Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.413,935 95-%-Konfidenzintervall: ±9,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 8.930 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.443 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±7,351Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,076 95-%-Konfidenzintervall: ±8,59Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 20.555 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.164 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±5,404Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.419,382 95-%-Konfidenzintervall: ±5,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 66.835 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.384 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±3,741Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.397,089 95-%-Konfidenzintervall: ±3,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlPolishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 2.318 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.754 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±12,764Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,116 95-%-Konfidenzintervall: ±14,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlRussianTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 13.461 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.292 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±6,15Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,043 95-%-Konfidenzintervall: ±6,505Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 47.251 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.068 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,177Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.455,584 95-%-Konfidenzintervall: ±4,237Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlSpanishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 3.879 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.328 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±10,938Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,285 95-%-Konfidenzintervall: ±13,338Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGemini 3.1 Pro Preview: Stilbereinigte Arena-Bewertung aus 29.992 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.002 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±4,855Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.388,294 95-%-Konfidenzintervall: ±4,988Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |