Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
gemeinsame Messreihen
69
verschiedene Benchmarks
12
jüngster Abruf
29.09.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
GPT-5.5
Mistral Large 3
Coding: 100 / 70,8 (3 Benchmarkfamilien)
Reasoning: 100 / 84,4 (2 Benchmarkfamilien)
Mathematik: 100 / 93,9 (1 Benchmarkfamilie)
Wissen: 100 / 92,9 (2 Benchmarkfamilien)
Finanzen: 100 / 89,3 (4 Benchmarkfamilien)
Recht: 100 / 93,6 (2 Benchmarkfamilien)
Agenten-Aufgaben: 100 / 12,3 (1 Benchmarkfamilie)
Multimodal: 100 / 75 (1 Benchmarkfamilie)
40 passende Messreihen aus 12 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 11 vergleichbaren Kategorien.
GPT-5.5Mistral Large 3
CorpFin v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner68,415 %
Mistral Large 361,033 %
GPQA DiamondOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner93,182 %
Mistral Large 368,434 %
LegalBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner86,515 %
Mistral Large 379,138 %
LiveCodeBench v6Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner85,296 %
Mistral Large 355,337 %
LMArena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner1.476,671
Mistral Large 31.413,254
MMLU-ProOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner88,144 %
Mistral Large 379,823 %
MMMU-ProOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner88,266 %
Mistral Large 366,185 %
MortgageTaxOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner68,76 %
Mistral Large 352,106 %
SAGEOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner51,532 %
Mistral Large 324,595 %
SWE-bench VerifiedOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner82,6 %
Mistral Large 341,4 %
TaxEval v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner74,98 %
Mistral Large 373,058 %
Terminal-Bench 2.0Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner73,202 %
Mistral Large 38,989 %
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Benchmarkwerte von GPT-5.5 und Mistral Large 3
Benchmark und Aufgabe
GPT-5.5
Mistral Large 3
Quelle
CorpFin v2OverallTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 70.635 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 77.456 anonymen Paarvergleichen.
Gewinner1.476,671
95-%-Konfidenzintervall: ±3,701Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,254
95-%-Konfidenzintervall: ±2,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 69.008 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 77.456 anonymen Paarvergleichen.
Höherer Messwert1.481,397
95-%-Konfidenzintervall: ±3,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,254
95-%-Konfidenzintervall: ±2,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlBusiness, management and financeTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 14.097 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.597 anonymen Paarvergleichen.
Gewinner1.485,504
95-%-Konfidenzintervall: ±6,33Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,446
95-%-Konfidenzintervall: ±5,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlBusiness, management and financeTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 13.739 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.597 anonymen Paarvergleichen.
Höherer Messwert1.489,4
95-%-Konfidenzintervall: ±6,348Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,446
95-%-Konfidenzintervall: ±5,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 4.480 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.845 anonymen Paarvergleichen.
Gewinner1.526,973
95-%-Konfidenzintervall: ±9,82Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,058
95-%-Konfidenzintervall: ±8,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 4.507 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.845 anonymen Paarvergleichen.
Höherer Messwert1.517,408
95-%-Konfidenzintervall: ±9,644Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,058
95-%-Konfidenzintervall: ±8,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 20.022 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.574 anonymen Paarvergleichen.
Gewinner1.510,389
95-%-Konfidenzintervall: ±5,641Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.469,182
95-%-Konfidenzintervall: ±4,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 19.166 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.574 anonymen Paarvergleichen.
Höherer Messwert1.518,674
95-%-Konfidenzintervall: ±5,731Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.469,182
95-%-Konfidenzintervall: ±4,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 13.078 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.448 anonymen Paarvergleichen.
Gewinner1.448,977
95-%-Konfidenzintervall: ±6,62Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,648
95-%-Konfidenzintervall: ±5,824Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 12.802 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.448 anonymen Paarvergleichen.
Höherer Messwert1.451,747
95-%-Konfidenzintervall: ±6,64Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,648
95-%-Konfidenzintervall: ±5,824Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 31.818 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.060 anonymen Paarvergleichen.
Gewinner1.482,617
95-%-Konfidenzintervall: ±4,8Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.426,615
95-%-Konfidenzintervall: ±4,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 31.089 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.060 anonymen Paarvergleichen.
Höherer Messwert1.484,099
95-%-Konfidenzintervall: ±4,815Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.426,615
95-%-Konfidenzintervall: ±4,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlEntertainment, sports and mediaTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 16.859 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.716 anonymen Paarvergleichen.
Gewinner1.447,733
95-%-Konfidenzintervall: ±6,067Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.371,316
95-%-Konfidenzintervall: ±5,299Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlEntertainment, sports and mediaTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 16.373 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.716 anonymen Paarvergleichen.
Höherer Messwert1.448,374
95-%-Konfidenzintervall: ±6,114Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.371,316
95-%-Konfidenzintervall: ±5,299Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 53.872 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 56.501 anonymen Paarvergleichen.
Gewinner1.486,08
95-%-Konfidenzintervall: ±4,841Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,18
95-%-Konfidenzintervall: ±4,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 52.376 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 56.501 anonymen Paarvergleichen.
Höherer Messwert1.492,092
95-%-Konfidenzintervall: ±4,849Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,18
95-%-Konfidenzintervall: ±4,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 7.644 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 7.295 anonymen Paarvergleichen.
Gewinner1.511,193
95-%-Konfidenzintervall: ±7,816Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,543
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 7.384 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 7.295 anonymen Paarvergleichen.
Höherer Messwert1.512,621
95-%-Konfidenzintervall: ±7,838Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,543
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 2.515 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.181 anonymen Paarvergleichen.
Gewinner1.501,116
95-%-Konfidenzintervall: ±14,009Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,389
95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 2.522 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.181 anonymen Paarvergleichen.
Höherer Messwert1.496,18
95-%-Konfidenzintervall: ±13,947Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,389
95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 1.104 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.257 anonymen Paarvergleichen.
Gewinner1.487,952
95-%-Konfidenzintervall: ±19,226Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,467
95-%-Konfidenzintervall: ±17,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 1.052 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.257 anonymen Paarvergleichen.
Höherer Messwert1.470,538
95-%-Konfidenzintervall: ±19,232Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,467
95-%-Konfidenzintervall: ±17,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 47.240 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 47.316 anonymen Paarvergleichen.
Gewinner1.499,213
95-%-Konfidenzintervall: ±4,37Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,274
95-%-Konfidenzintervall: ±3,63Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 45.517 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 47.316 anonymen Paarvergleichen.
Höherer Messwert1.501,268
95-%-Konfidenzintervall: ±4,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,274
95-%-Konfidenzintervall: ±3,63Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 21.852 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.638 anonymen Paarvergleichen.
Gewinner1.500,03
95-%-Konfidenzintervall: ±5,513Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,274
95-%-Konfidenzintervall: ±4,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 21.097 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.638 anonymen Paarvergleichen.
Höherer Messwert1.499
95-%-Konfidenzintervall: ±5,544Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,274
95-%-Konfidenzintervall: ±4,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 24.807 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 24.861 anonymen Paarvergleichen.
Gewinner1.475,139
95-%-Konfidenzintervall: ±5,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,115
95-%-Konfidenzintervall: ±4,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 24.017 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 24.861 anonymen Paarvergleichen.
Höherer Messwert1.477,914
95-%-Konfidenzintervall: ±5,323Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,115
95-%-Konfidenzintervall: ±4,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 799 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 830 anonymen Paarvergleichen.
Gewinner1.478,913
95-%-Konfidenzintervall: ±23,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.382,659
95-%-Konfidenzintervall: ±22,106Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 899 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 830 anonymen Paarvergleichen.
Höherer Messwert1.504,533
95-%-Konfidenzintervall: ±21,865Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.382,659
95-%-Konfidenzintervall: ±22,106Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 1.178 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.318 anonymen Paarvergleichen.
Gewinner1.430,608
95-%-Konfidenzintervall: ±18,898Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.356,821
95-%-Konfidenzintervall: ±17,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 1.184 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.318 anonymen Paarvergleichen.
Höherer Messwert1.445,57
95-%-Konfidenzintervall: ±18,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.356,821
95-%-Konfidenzintervall: ±17,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLegal and governmentTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 5.923 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.879 anonymen Paarvergleichen.
Gewinner1.485,605
95-%-Konfidenzintervall: ±8,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,357
95-%-Konfidenzintervall: ±8,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLegal and governmentTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 5.605 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.879 anonymen Paarvergleichen.
Höherer Messwert1.494,595
95-%-Konfidenzintervall: ±8,853Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,357
95-%-Konfidenzintervall: ±8,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLife, physical and social scienceTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 11.817 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.690 anonymen Paarvergleichen.
Gewinner1.496,608
95-%-Konfidenzintervall: ±6,545Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,685
95-%-Konfidenzintervall: ±5,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlLife, physical and social scienceTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 11.621 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.690 anonymen Paarvergleichen.
Höherer Messwert1.498,219
95-%-Konfidenzintervall: ±6,591Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,685
95-%-Konfidenzintervall: ±5,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 33.297 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.146 anonymen Paarvergleichen.
Gewinner1.486,565
95-%-Konfidenzintervall: ±5,004Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.417,29
95-%-Konfidenzintervall: ±4,417Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 31.935 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.146 anonymen Paarvergleichen.
Höherer Messwert1.487,567
95-%-Konfidenzintervall: ±5,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.417,29
95-%-Konfidenzintervall: ±4,417Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 3.498 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.411 anonymen Paarvergleichen.
Gewinner1.499,959
95-%-Konfidenzintervall: ±10,564Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.401,493
95-%-Konfidenzintervall: ±9,177Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 3.474 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.411 anonymen Paarvergleichen.
Höherer Messwert1.493,341
95-%-Konfidenzintervall: ±10,42Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.401,493
95-%-Konfidenzintervall: ±9,177Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 4.066 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.047 anonymen Paarvergleichen.
Gewinner1.499,198
95-%-Konfidenzintervall: ±10,183Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,935
95-%-Konfidenzintervall: ±9,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 3.995 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.047 anonymen Paarvergleichen.
Höherer Messwert1.506,624
95-%-Konfidenzintervall: ±10,147Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,935
95-%-Konfidenzintervall: ±9,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlMedicine and healthcareTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 5.331 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.443 anonymen Paarvergleichen.
Gewinner1.486,508
95-%-Konfidenzintervall: ±9,127Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,076
95-%-Konfidenzintervall: ±8,59Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlMedicine and healthcareTestdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 5.219 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.443 anonymen Paarvergleichen.
Höherer Messwert1.476,143
95-%-Konfidenzintervall: ±9,066Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,076
95-%-Konfidenzintervall: ±8,59Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 12.377 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.164 anonymen Paarvergleichen.
Gewinner1.483,927
95-%-Konfidenzintervall: ±6,623Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.419,382
95-%-Konfidenzintervall: ±5,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 11.834 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.164 anonymen Paarvergleichen.
Höherer Messwert1.487,824
95-%-Konfidenzintervall: ±6,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.419,382
95-%-Konfidenzintervall: ±5,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 38.816 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.384 anonymen Paarvergleichen.
Gewinner1.466,059
95-%-Konfidenzintervall: ±4,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.397,089
95-%-Konfidenzintervall: ±3,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 37.918 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.384 anonymen Paarvergleichen.
Höherer Messwert1.473,724
95-%-Konfidenzintervall: ±4,54Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.397,089
95-%-Konfidenzintervall: ±3,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 1.199 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.754 anonymen Paarvergleichen.
Gewinner1.471,041
95-%-Konfidenzintervall: ±17,669Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,116
95-%-Konfidenzintervall: ±14,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 1.168 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.754 anonymen Paarvergleichen.
Höherer Messwert1.479,177
95-%-Konfidenzintervall: ±17,666Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,116
95-%-Konfidenzintervall: ±14,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 7.408 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.292 anonymen Paarvergleichen.
Gewinner1.478,651
95-%-Konfidenzintervall: ±7,718Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,043
95-%-Konfidenzintervall: ±6,505Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 7.356 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.292 anonymen Paarvergleichen.
Höherer Messwert1.481,011
95-%-Konfidenzintervall: ±7,716Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,043
95-%-Konfidenzintervall: ±6,505Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena Text, Style ControlSoftware and IT servicesTestdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGPT-5.5: Stilbereinigte Arena-Bewertung aus 28.314 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.068 anonymen Paarvergleichen.
Gewinner1.505,747
95-%-Konfidenzintervall: ±5,024Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.455,584
95-%-Konfidenzintervall: ±4,237Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Eigene Modelltests
Unsere Tests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Pelikan auf dem Fahrrad
Community-Klassiker für eine freie SVG-Zeichnung.
GPT-5.5
Die API-Antwort wurde nicht vollständig übertragen. Das Modell wurde nicht bewertet.
Reasoning (angefragt): high
Erster Versuch
Datum des Testlaufs
07.09.2026
API-Anbieter
openrouter
Angefragtes API-Modell
openai/gpt-5.5
Reasoning-Einstellung
high
Festgelegter Endpunkt
OpenAI | openai/gpt-5.5-20260423
Temperatur
Anbieterstandard
Tokenlimit inklusive Reasoning
8.192 Token
Testprotokoll
community-visual-tests-v1
Technische Prüfung
Nicht bestanden
Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.
Mistral Large 3
In diesem Testlauf war kein API-Zugang verfügbar. Das Modell wurde nicht bewertet.
Reasoning (Modellstandard): kein Reasoning-Modus Quelle
Erster Versuch
Datum des Testlaufs
07.09.2026
API-Anbieter
openrouter
Angefragtes API-Modell
mistralai/mistral-large-2512
Reasoning-Einstellung
nicht vorgegeben
Festgelegter Endpunkt
Mistral | mistralai/mistral-large-2512
Temperatur
Anbieterstandard
Tokenlimit inklusive Reasoning
8.192 Token
Testprotokoll
community-visual-tests-v1
Technische Prüfung
Nicht ausgeführt
Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche GPT-5.5 und Mistral Large 3 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.