Zum Hauptinhalt springen

Direktvergleich

GPT-5.5 vs. Mistral Large 3

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

gemeinsame Messreihen
69
verschiedene Benchmarks
12
jüngster Abruf
29.09.2026

Modellauswahl ändern

Steckbrief

Allgemeine Daten

Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.

Allgemeine Daten von GPT-5.5 und Mistral Large 3
MerkmalGPT-5.5Mistral Large 3
AnbieterOpenAIMistral AI
Erschienen23. Apr. 20262. Dez. 2025
VerfügbarkeitAktivAktiv
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht675 Mrd., 41 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster1.050.000 Token262.144 Token
Wissensstand1. Dezember 2025Nicht veröffentlicht
Technische QuellenModellModell, Kontext

Kosten

API-Preise im Vergleich

Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

API-Preise von GPT-5.5 und Mistral Large 3
PreisartGPT-5.5Mistral Large 3
API-Eingabe5 $ ≤272K / 10 $ >272K0,5 $
API-Ausgabe30 $ ≤272K / 45 $ >272K1,5 $
Cache lesen0,5 $ ≤272K / 1 $ >272KNicht ausgewiesen
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft22.09.2026 Quelle22.09.2026 Quelle
GPT-5.5Mistral Large 3
API-EingabeUSD pro 1 Mio. Token, Basistarif
GPT-5.55 $
Mistral Large 3Günstiger0,5 $
API-AusgabeUSD pro 1 Mio. Token, Basistarif
GPT-5.530 $
Mistral Large 3Günstiger1,5 $

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Preise nach Anbieter

Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.

Anbieterpreise von GPT-5.5 und Mistral Large 3
ModellAnbieterBezugsweg und TarifEingabe pro 1 Mio. TokenAusgabe pro 1 Mio. TokenQuelle
GPT-5.5OpenAIDirekt beim EntwicklerBis 272.000 Kontext-Token5 $30 $Quelle22.09.2026
OpenAIDirekt beim EntwicklerÜber 272.000 Kontext-Token10 $45 $Quelle22.09.2026
Amazon BedrockÜber OpenRouteramazon-bedrock/us-east-15,5 $33 $Quelle02.10.2026
AzureÜber OpenRouterazure5 $30 $Quelle02.10.2026
AzureÜber OpenRouterazure/eu5,5 $33 $Quelle02.10.2026
AzureÜber OpenRouterazure/us5,5 $33 $Quelle02.10.2026
OpenAIÜber OpenRouteropenai5 $30 $Quelle02.10.2026
OpenAIÜber OpenRouteropenai/fast12,5 $75 $Quelle02.10.2026
OpenAIÜber OpenRouteropenai/flexGünstigster erfasster Preis: 2,5 $Günstigster erfasster Preis: 15 $Quelle02.10.2026
Mistral Large 3Mistral AIDirekt beim EntwicklerStandard-APIGünstigster erfasster Preis: 0,5 $Günstigster erfasster Preis: 1,5 $Quelle22.09.2026
MistralÜber OpenRoutermistral/eu0,55 $1,65 $Quelle02.10.2026
MistralÜber OpenRoutermistral/zdrGünstigster erfasster Preis: 0,5 $Günstigster erfasster Preis: 1,5 $Quelle02.10.2026

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

Fähigkeitsprofil aus vergleichbaren Benchmarks

Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.

255075100CodingReasoningMathematikWissenFinanzenRechtAgenten-AufgabenMultimodal
GPT-5.5
Mistral Large 3
Coding: 100 / 70,8 (3 Benchmarkfamilien)
Reasoning: 100 / 84,4 (2 Benchmarkfamilien)
Mathematik: 100 / 93,9 (1 Benchmarkfamilie)
Wissen: 100 / 92,9 (2 Benchmarkfamilien)
Finanzen: 100 / 89,3 (4 Benchmarkfamilien)
Recht: 100 / 93,6 (2 Benchmarkfamilien)
Agenten-Aufgaben: 100 / 12,3 (1 Benchmarkfamilie)
Multimodal: 100 / 75 (1 Benchmarkfamilie)

40 passende Messreihen aus 12 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 11 vergleichbaren Kategorien.

GPT-5.5Mistral Large 3
CorpFin v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner68,415 %
Mistral Large 361,033 %
GPQA DiamondOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner93,182 %
Mistral Large 368,434 %
LegalBenchOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner86,515 %
Mistral Large 379,138 %
LiveCodeBench v6Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner85,296 %
Mistral Large 355,337 %
LMArena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner1.476,671
Mistral Large 31.413,254
MMLU-ProOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner88,144 %
Mistral Large 379,823 %
MMMU-ProOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner88,266 %
Mistral Large 366,185 %
MortgageTaxOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner68,76 %
Mistral Large 352,106 %
SAGEOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner51,532 %
Mistral Large 324,595 %
SWE-bench VerifiedOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner82,6 %
Mistral Large 341,4 %
TaxEval v2Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner74,98 %
Mistral Large 373,058 %
Terminal-Bench 2.0Overall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
GPT-5.5Gewinner73,202 %
Mistral Large 38,989 %

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Benchmarkwerte von GPT-5.5 und Mistral Large 3
Benchmark und AufgabeGPT-5.5Mistral Large 3Quelle
CorpFin v2Overall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser
Gewinner68,415 %
61,033 %
Vals AI
Quellendetails
Datenstand: 12.08.2026
GPQA DiamondOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner93,182 %
68,434 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
LegalBenchOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner86,515 %
79,138 %
Vals AI
Quellendetails
Datenstand: 27.09.2026
LiveCodeBench v6Overall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner85,296 %
55,337 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
LMArena Text, Style ControlOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 70.635 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 77.456 anonymen Paarvergleichen.
Gewinner1.476,671
95-%-Konfidenzintervall: ±3,701Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,254
95-%-Konfidenzintervall: ±2,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
MMLU-ProOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner88,144 %
79,823 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
MMMU-ProOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner88,266 %
66,185 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
MortgageTaxOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner68,76 %
52,106 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
SAGEOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner51,532 %
24,595 %
Vals AI
Quellendetails
Datenstand: 26.09.2026
SWE-bench VerifiedOverall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser
Gewinner82,6 %
41,4 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
TaxEval v2Overall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser
Gewinner74,98 %
73,058 %
Vals AI
Quellendetails
Datenstand: 01.09.2026
Terminal-Bench 2.0Overall
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: 2.0Messgröße: accuracyBewertung: Mehr ist besser
Gewinner73,202 %
8,989 %
Vals AI
Quellendetails
Datenstand: 04.06.2026
LMArena Text, Style ControlOverall
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 69.008 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 77.456 anonymen Paarvergleichen.
Höherer Messwert1.481,397
95-%-Konfidenzintervall: ±3,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,254
95-%-Konfidenzintervall: ±2,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlBusiness, management and finance
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 14.097 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.597 anonymen Paarvergleichen.
Gewinner1.485,504
95-%-Konfidenzintervall: ±6,33Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,446
95-%-Konfidenzintervall: ±5,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlBusiness, management and finance
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 13.739 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.597 anonymen Paarvergleichen.
Höherer Messwert1.489,4
95-%-Konfidenzintervall: ±6,348Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,446
95-%-Konfidenzintervall: ±5,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlChinese
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.480 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.845 anonymen Paarvergleichen.
Gewinner1.526,973
95-%-Konfidenzintervall: ±9,82Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,058
95-%-Konfidenzintervall: ±8,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlChinese
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.507 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.845 anonymen Paarvergleichen.
Höherer Messwert1.517,408
95-%-Konfidenzintervall: ±9,644Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.434,058
95-%-Konfidenzintervall: ±8,22Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlCoding
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 20.022 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.574 anonymen Paarvergleichen.
Gewinner1.510,389
95-%-Konfidenzintervall: ±5,641Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.469,182
95-%-Konfidenzintervall: ±4,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlCoding
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 19.166 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.574 anonymen Paarvergleichen.
Höherer Messwert1.518,674
95-%-Konfidenzintervall: ±5,731Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.469,182
95-%-Konfidenzintervall: ±4,902Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlCreative writing
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 13.078 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.448 anonymen Paarvergleichen.
Gewinner1.448,977
95-%-Konfidenzintervall: ±6,62Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,648
95-%-Konfidenzintervall: ±5,824Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlCreative writing
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 12.802 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.448 anonymen Paarvergleichen.
Höherer Messwert1.451,747
95-%-Konfidenzintervall: ±6,64Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,648
95-%-Konfidenzintervall: ±5,824Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlEnglish
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 31.818 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.060 anonymen Paarvergleichen.
Gewinner1.482,617
95-%-Konfidenzintervall: ±4,8Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.426,615
95-%-Konfidenzintervall: ±4,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlEnglish
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 31.089 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.060 anonymen Paarvergleichen.
Höherer Messwert1.484,099
95-%-Konfidenzintervall: ±4,815Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.426,615
95-%-Konfidenzintervall: ±4,05Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlEntertainment, sports and media
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 16.859 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.716 anonymen Paarvergleichen.
Gewinner1.447,733
95-%-Konfidenzintervall: ±6,067Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.371,316
95-%-Konfidenzintervall: ±5,299Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlEntertainment, sports and media
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 16.373 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.716 anonymen Paarvergleichen.
Höherer Messwert1.448,374
95-%-Konfidenzintervall: ±6,114Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.371,316
95-%-Konfidenzintervall: ±5,299Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlExcluding ties
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 53.872 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 56.501 anonymen Paarvergleichen.
Gewinner1.486,08
95-%-Konfidenzintervall: ±4,841Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,18
95-%-Konfidenzintervall: ±4,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlExcluding ties
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 52.376 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 56.501 anonymen Paarvergleichen.
Höherer Messwert1.492,092
95-%-Konfidenzintervall: ±4,849Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,18
95-%-Konfidenzintervall: ±4,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlExpert prompts
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 7.644 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 7.295 anonymen Paarvergleichen.
Gewinner1.511,193
95-%-Konfidenzintervall: ±7,816Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,543
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlExpert prompts
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 7.384 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 7.295 anonymen Paarvergleichen.
Höherer Messwert1.512,621
95-%-Konfidenzintervall: ±7,838Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,543
95-%-Konfidenzintervall: ±7,482Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlFrench
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 2.515 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.181 anonymen Paarvergleichen.
Gewinner1.501,116
95-%-Konfidenzintervall: ±14,009Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,389
95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlFrench
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 2.522 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.181 anonymen Paarvergleichen.
Höherer Messwert1.496,18
95-%-Konfidenzintervall: ±13,947Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,389
95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlGerman
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.104 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.257 anonymen Paarvergleichen.
Gewinner1.487,952
95-%-Konfidenzintervall: ±19,226Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,467
95-%-Konfidenzintervall: ±17,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlGerman
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.052 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.257 anonymen Paarvergleichen.
Höherer Messwert1.470,538
95-%-Konfidenzintervall: ±19,232Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,467
95-%-Konfidenzintervall: ±17,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlHard prompts
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 47.240 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 47.316 anonymen Paarvergleichen.
Gewinner1.499,213
95-%-Konfidenzintervall: ±4,37Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,274
95-%-Konfidenzintervall: ±3,63Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlHard prompts
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 45.517 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 47.316 anonymen Paarvergleichen.
Höherer Messwert1.501,268
95-%-Konfidenzintervall: ±4,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,274
95-%-Konfidenzintervall: ±3,63Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlHard prompts, English
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 21.852 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.638 anonymen Paarvergleichen.
Gewinner1.500,03
95-%-Konfidenzintervall: ±5,513Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,274
95-%-Konfidenzintervall: ±4,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlHard prompts, English
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 21.097 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.638 anonymen Paarvergleichen.
Höherer Messwert1.499
95-%-Konfidenzintervall: ±5,544Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,274
95-%-Konfidenzintervall: ±4,91Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlInstruction following
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 24.807 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 24.861 anonymen Paarvergleichen.
Gewinner1.475,139
95-%-Konfidenzintervall: ±5,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,115
95-%-Konfidenzintervall: ±4,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlInstruction following
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 24.017 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 24.861 anonymen Paarvergleichen.
Höherer Messwert1.477,914
95-%-Konfidenzintervall: ±5,323Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.400,115
95-%-Konfidenzintervall: ±4,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlJapanese
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 799 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 830 anonymen Paarvergleichen.
Gewinner1.478,913
95-%-Konfidenzintervall: ±23,332Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.382,659
95-%-Konfidenzintervall: ±22,106Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlJapanese
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 899 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 830 anonymen Paarvergleichen.
Höherer Messwert1.504,533
95-%-Konfidenzintervall: ±21,865Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.382,659
95-%-Konfidenzintervall: ±22,106Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlKorean
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.178 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.318 anonymen Paarvergleichen.
Gewinner1.430,608
95-%-Konfidenzintervall: ±18,898Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.356,821
95-%-Konfidenzintervall: ±17,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlKorean
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.184 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.318 anonymen Paarvergleichen.
Höherer Messwert1.445,57
95-%-Konfidenzintervall: ±18,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.356,821
95-%-Konfidenzintervall: ±17,794Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlLegal and government
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.923 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.879 anonymen Paarvergleichen.
Gewinner1.485,605
95-%-Konfidenzintervall: ±8,635Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,357
95-%-Konfidenzintervall: ±8,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlLegal and government
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.605 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.879 anonymen Paarvergleichen.
Höherer Messwert1.494,595
95-%-Konfidenzintervall: ±8,853Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,357
95-%-Konfidenzintervall: ±8,211Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlLife, physical and social science
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 11.817 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.690 anonymen Paarvergleichen.
Gewinner1.496,608
95-%-Konfidenzintervall: ±6,545Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,685
95-%-Konfidenzintervall: ±5,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlLife, physical and social science
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 11.621 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.690 anonymen Paarvergleichen.
Höherer Messwert1.498,219
95-%-Konfidenzintervall: ±6,591Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,685
95-%-Konfidenzintervall: ±5,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlLonger queries
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 33.297 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.146 anonymen Paarvergleichen.
Gewinner1.486,565
95-%-Konfidenzintervall: ±5,004Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.417,29
95-%-Konfidenzintervall: ±4,417Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlLonger queries
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 31.935 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.146 anonymen Paarvergleichen.
Höherer Messwert1.487,567
95-%-Konfidenzintervall: ±5,058Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.417,29
95-%-Konfidenzintervall: ±4,417Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMath
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.498 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.411 anonymen Paarvergleichen.
Gewinner1.499,959
95-%-Konfidenzintervall: ±10,564Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.401,493
95-%-Konfidenzintervall: ±9,177Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMath
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.474 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.411 anonymen Paarvergleichen.
Höherer Messwert1.493,341
95-%-Konfidenzintervall: ±10,42Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.401,493
95-%-Konfidenzintervall: ±9,177Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMathematical professions
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 4.066 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.047 anonymen Paarvergleichen.
Gewinner1.499,198
95-%-Konfidenzintervall: ±10,183Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,935
95-%-Konfidenzintervall: ±9,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMathematical professions
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 3.995 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.047 anonymen Paarvergleichen.
Höherer Messwert1.506,624
95-%-Konfidenzintervall: ±10,147Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.413,935
95-%-Konfidenzintervall: ±9,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMedicine and healthcare
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.331 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.443 anonymen Paarvergleichen.
Gewinner1.486,508
95-%-Konfidenzintervall: ±9,127Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,076
95-%-Konfidenzintervall: ±8,59Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMedicine and healthcare
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 5.219 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.443 anonymen Paarvergleichen.
Höherer Messwert1.476,143
95-%-Konfidenzintervall: ±9,066Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,076
95-%-Konfidenzintervall: ±8,59Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMulti-turn
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 12.377 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.164 anonymen Paarvergleichen.
Gewinner1.483,927
95-%-Konfidenzintervall: ±6,623Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.419,382
95-%-Konfidenzintervall: ±5,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlMulti-turn
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 11.834 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.164 anonymen Paarvergleichen.
Höherer Messwert1.487,824
95-%-Konfidenzintervall: ±6,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.419,382
95-%-Konfidenzintervall: ±5,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlNon-English
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 38.816 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.384 anonymen Paarvergleichen.
Gewinner1.466,059
95-%-Konfidenzintervall: ±4,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.397,089
95-%-Konfidenzintervall: ±3,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlNon-English
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 37.918 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.384 anonymen Paarvergleichen.
Höherer Messwert1.473,724
95-%-Konfidenzintervall: ±4,54Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.397,089
95-%-Konfidenzintervall: ±3,587Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlPolish
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.199 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.754 anonymen Paarvergleichen.
Gewinner1.471,041
95-%-Konfidenzintervall: ±17,669Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,116
95-%-Konfidenzintervall: ±14,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlPolish
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 1.168 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.754 anonymen Paarvergleichen.
Höherer Messwert1.479,177
95-%-Konfidenzintervall: ±17,666Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,116
95-%-Konfidenzintervall: ±14,298Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlRussian
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 7.408 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.292 anonymen Paarvergleichen.
Gewinner1.478,651
95-%-Konfidenzintervall: ±7,718Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,043
95-%-Konfidenzintervall: ±6,505Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlRussian
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5-high, Reasoning: high, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 7.356 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.292 anonymen Paarvergleichen.
Höherer Messwert1.481,011
95-%-Konfidenzintervall: ±7,716Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.408,043
95-%-Konfidenzintervall: ±6,505Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026
LMArena Text, Style ControlSoftware and IT services
Testdetails
Kein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.5: Snapshot: gpt-5.5, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
GPT-5.5: Stilbereinigte Arena-Bewertung aus 28.314 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 29.068 anonymen Paarvergleichen.
Gewinner1.505,747
95-%-Konfidenzintervall: ±5,024Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.455,584
95-%-Konfidenzintervall: ±4,237Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 25.09.2026

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Eigene Modelltests

Unsere Tests

Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.

Pelikan auf dem Fahrrad

Community-Klassiker für eine freie SVG-Zeichnung.

GPT-5.5

Die API-Antwort wurde nicht vollständig übertragen. Das Modell wurde nicht bewertet.

Reasoning (angefragt): high

Erster Versuch
Datum des Testlaufs
07.09.2026
API-Anbieter
openrouter
Angefragtes API-Modell
openai/gpt-5.5
Reasoning-Einstellung
high
Festgelegter Endpunkt
OpenAI | openai/gpt-5.5-20260423
Temperatur
Anbieterstandard
Tokenlimit inklusive Reasoning
8.192 Token
Testprotokoll
community-visual-tests-v1
Technische Prüfung
Nicht bestanden

Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.

Mistral Large 3

In diesem Testlauf war kein API-Zugang verfügbar. Das Modell wurde nicht bewertet.

Reasoning (Modellstandard): kein Reasoning-Modus Quelle

Erster Versuch
Datum des Testlaufs
07.09.2026
API-Anbieter
openrouter
Angefragtes API-Modell
mistralai/mistral-large-2512
Reasoning-Einstellung
nicht vorgegeben
Festgelegter Endpunkt
Mistral | mistralai/mistral-large-2512
Temperatur
Anbieterstandard
Tokenlimit inklusive Reasoning
8.192 Token
Testprotokoll
community-visual-tests-v1
Technische Prüfung
Nicht ausgeführt

Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.

Prompt und Testbedingungen

Generate an SVG of a pelican riding a bicycle

Tokenlimit inklusive Reasoning: 8.192 Token

Ursprung der Aufgabe (Simon Willison)

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.

Weitere Duelle

Vergleiche GPT-5.5 und Mistral Large 3 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.

Zum vollständigen LLM-Vergleich