Direktvergleich
Gemini 3.5 Flash vs. Mistral Medium 3.5
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 56
- verschiedene Benchmarks
- 1
- jüngster Abruf
- 04.09.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Gemini 3.5 Flash | Mistral Medium 3.5 |
|---|---|---|
| Anbieter | Mistral AI | |
| Erschienen | 19. Mai 2026 | 28. Apr. 2026 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 1.048.576 Token | 256.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Gemini 3.5 Flash | Mistral Medium 3.5 |
|---|---|---|
| API-Eingabe | 1,5 $ | 1,5 $ |
| API-Ausgabe | 9 $ | 7,5 $ |
| Cache lesen | 0,15 $ | Nicht ausgewiesen |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Gemini 3.5 Flash | Direkt beim EntwicklerStandard-API | 1,5 $ | 9 $ | Quelle30.07.2026 | |
| Über OpenRoutergoogle-vertex/global | 1,5 $ | 9 $ | Quelle06.09.2026 | ||
| Über OpenRoutergoogle-vertex/global/flex | Günstigster erfasster Preis: 0,75 $ | Günstigster erfasster Preis: 4,5 $ | Quelle06.09.2026 | ||
| Über OpenRoutergoogle-vertex/global/priority | 2,7 $ | 16,2 $ | Quelle06.09.2026 | ||
| Über OpenRoutergoogle-vertex/us | 1,65 $ | 9,9 $ | Quelle06.09.2026 | ||
| Google AI Studio | Über OpenRoutergoogle-ai-studio | 1,5 $ | 9 $ | Quelle06.09.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/flex | Günstigster erfasster Preis: 0,75 $ | Günstigster erfasster Preis: 4,5 $ | Quelle06.09.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/priority | 2,7 $ | 16,2 $ | Quelle06.09.2026 | |
| Mistral Medium 3.5 | Mistral AI | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 1,5 $ | Günstigster erfasster Preis: 7,5 $ | Quelle30.07.2026 |
| Mistral | Über OpenRoutermistral | Günstigster erfasster Preis: 1,5 $ | Günstigster erfasster Preis: 7,5 $ | Quelle06.09.2026 | |
| Mistral | Über OpenRoutermistral/eu | 1,65 $ | 8,25 $ | Quelle06.09.2026 | |
| Mistral | Über OpenRoutermistral/zdr | Günstigster erfasster Preis: 1,5 $ | Günstigster erfasster Preis: 7,5 $ | Quelle06.09.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
Nicht genug direkt vergleichbare Kategorien für ein belastbares Radar
Nur 0 von mindestens 5 Kategorien enthalten direkt vergleichbare Modellmessungen. Die Benchmarktabellen darunter zeigen die vorhandenen Belege, ohne fehlende Achsen aufzufüllen.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Gemini 3.5 Flash | Mistral Medium 3.5 | Quelle |
|---|---|---|---|
LMArena Text, Style ControlOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 33.874 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.017 anonymen Paarvergleichen. | Höherer Messwert1.479,148 95-%-Konfidenzintervall: ±4,345Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.426,98 95-%-Konfidenzintervall: ±6,556Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 32.274 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.017 anonymen Paarvergleichen. | Höherer Messwert1.474,438 95-%-Konfidenzintervall: ±4,676Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.426,98 95-%-Konfidenzintervall: ±6,556Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 6.750 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.148 anonymen Paarvergleichen. | Höherer Messwert1.465,666 95-%-Konfidenzintervall: ±7,938Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,113 95-%-Konfidenzintervall: ±13,17Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 6.429 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.148 anonymen Paarvergleichen. | Höherer Messwert1.460,515 95-%-Konfidenzintervall: ±8,197Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,113 95-%-Konfidenzintervall: ±13,17Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlChineseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.185 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 500 anonymen Paarvergleichen. | Höherer Messwert1.523,785 95-%-Konfidenzintervall: ±13,691Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.448,299 95-%-Konfidenzintervall: ±26,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlChineseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.995 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 500 anonymen Paarvergleichen. | Höherer Messwert1.511,537 95-%-Konfidenzintervall: ±14,076Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.448,299 95-%-Konfidenzintervall: ±26,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCodingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 9.858 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.079 anonymen Paarvergleichen. | Höherer Messwert1.507,896 95-%-Konfidenzintervall: ±6,918Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.478,845 95-%-Konfidenzintervall: ±11,157Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCodingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 9.502 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.079 anonymen Paarvergleichen. | Höherer Messwert1.503,02 95-%-Konfidenzintervall: ±7,086Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.478,845 95-%-Konfidenzintervall: ±11,157Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCreative writingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 6.261 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.862 anonymen Paarvergleichen. | Höherer Messwert1.464,209 95-%-Konfidenzintervall: ±8,449Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,971 95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlCreative writingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 6.181 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.862 anonymen Paarvergleichen. | Höherer Messwert1.466,381 95-%-Konfidenzintervall: ±8,668Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,971 95-%-Konfidenzintervall: ±14,389Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 14.760 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.299 anonymen Paarvergleichen. | Höherer Messwert1.477,601 95-%-Konfidenzintervall: ±5,811Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.444,656 95-%-Konfidenzintervall: ±8,682Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 13.969 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.299 anonymen Paarvergleichen. | Höherer Messwert1.477,927 95-%-Konfidenzintervall: ±6,021Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.444,656 95-%-Konfidenzintervall: ±8,682Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 8.008 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.453 anonymen Paarvergleichen. | Höherer Messwert1.455,503 95-%-Konfidenzintervall: ±7,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,875 95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 8.080 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.453 anonymen Paarvergleichen. | Höherer Messwert1.453,176 95-%-Konfidenzintervall: ±7,743Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,875 95-%-Konfidenzintervall: ±12,491Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 25.685 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.299 anonymen Paarvergleichen. | Höherer Messwert1.489,285 95-%-Konfidenzintervall: ±5,708Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,17 95-%-Konfidenzintervall: ±8,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 24.291 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.299 anonymen Paarvergleichen. | Höherer Messwert1.484,217 95-%-Konfidenzintervall: ±6,104Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,17 95-%-Konfidenzintervall: ±8,686Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 3.765 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.110 anonymen Paarvergleichen. | Höherer Messwert1.491,166 95-%-Konfidenzintervall: ±10,263Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,278 95-%-Konfidenzintervall: ±17,831Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 3.630 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.110 anonymen Paarvergleichen. | Höherer Messwert1.486,377 95-%-Konfidenzintervall: ±10,426Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,278 95-%-Konfidenzintervall: ±17,831Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlFrenchTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.143 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 438 anonymen Paarvergleichen. | Höherer Messwert1.482,891 95-%-Konfidenzintervall: ±19,135Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,08 95-%-Konfidenzintervall: ±30,551Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlFrenchTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.091 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 438 anonymen Paarvergleichen. | Höherer Messwert1.484,3 95-%-Konfidenzintervall: ±19,784Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,08 95-%-Konfidenzintervall: ±30,551Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlGermanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 554 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen. | Höherer Messwert1.472,702 95-%-Konfidenzintervall: ±25,747Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.442,607 95-%-Konfidenzintervall: ±44,317Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlGermanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 518 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 170 anonymen Paarvergleichen. | Höherer Messwert1.499,776 95-%-Konfidenzintervall: ±26,725Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.442,607 95-%-Konfidenzintervall: ±44,317Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 22.707 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.154 anonymen Paarvergleichen. | Höherer Messwert1.497,725 95-%-Konfidenzintervall: ±5,13Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,592 95-%-Konfidenzintervall: ±7,857Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 21.743 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.154 anonymen Paarvergleichen. | Höherer Messwert1.492,408 95-%-Konfidenzintervall: ±5,431Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,592 95-%-Konfidenzintervall: ±7,857Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 9.989 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.629 anonymen Paarvergleichen. | Höherer Messwert1.491,638 95-%-Konfidenzintervall: ±6,84Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,246 95-%-Konfidenzintervall: ±10,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 9.430 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.629 anonymen Paarvergleichen. | Höherer Messwert1.489,936 95-%-Konfidenzintervall: ±7,027Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,246 95-%-Konfidenzintervall: ±10,39Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 12.015 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.561 anonymen Paarvergleichen. | Höherer Messwert1.466,61 95-%-Konfidenzintervall: ±6,374Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,491 95-%-Konfidenzintervall: ±10,335Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 11.631 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.561 anonymen Paarvergleichen. | Höherer Messwert1.463,044 95-%-Konfidenzintervall: ±6,57Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,491 95-%-Konfidenzintervall: ±10,335Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlKoreanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 707 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen. | Höherer Messwert1.442,218 95-%-Konfidenzintervall: ±22,67Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.394,42 95-%-Konfidenzintervall: ±44,572Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlKoreanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 616 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen. | Höherer Messwert1.436,863 95-%-Konfidenzintervall: ±24,771Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.394,42 95-%-Konfidenzintervall: ±44,572Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.816 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 839 anonymen Paarvergleichen. | Höherer Messwert1.473,514 95-%-Konfidenzintervall: ±11,897Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,785 95-%-Konfidenzintervall: ±21,302Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.606 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 839 anonymen Paarvergleichen. | Höherer Messwert1.485,22 95-%-Konfidenzintervall: ±12,369Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,785 95-%-Konfidenzintervall: ±21,302Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.533 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen. | Höherer Messwert1.488,436 95-%-Konfidenzintervall: ±8,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,494 95-%-Konfidenzintervall: ±14,359Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.219 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.823 anonymen Paarvergleichen. | Höherer Messwert1.492,855 95-%-Konfidenzintervall: ±8,828Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,494 95-%-Konfidenzintervall: ±14,359Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 15.749 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.661 anonymen Paarvergleichen. | Höherer Messwert1.482,425 95-%-Konfidenzintervall: ±6,06Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,723 95-%-Konfidenzintervall: ±9,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 15.472 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.661 anonymen Paarvergleichen. | Höherer Messwert1.476,768 95-%-Konfidenzintervall: ±6,209Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,723 95-%-Konfidenzintervall: ±9,428Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.638 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen. | Höherer Messwert1.504,032 95-%-Konfidenzintervall: ±14,9Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,582 95-%-Konfidenzintervall: ±24,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.466 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 539 anonymen Paarvergleichen. | Höherer Messwert1.477,944 95-%-Konfidenzintervall: ±15,611Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.429,582 95-%-Konfidenzintervall: ±24,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.911 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 597 anonymen Paarvergleichen. | Höherer Messwert1.485,634 95-%-Konfidenzintervall: ±14,143Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.442,192 95-%-Konfidenzintervall: ±23,932Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.705 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 597 anonymen Paarvergleichen. | Höherer Messwert1.483,603 95-%-Konfidenzintervall: ±14,956Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.442,192 95-%-Konfidenzintervall: ±23,932Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.508 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 802 anonymen Paarvergleichen. | Höherer Messwert1.492,702 95-%-Konfidenzintervall: ±12,721Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,47 95-%-Konfidenzintervall: ±21,791Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.358 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 802 anonymen Paarvergleichen. | Höherer Messwert1.481,624 95-%-Konfidenzintervall: ±13,127Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,47 95-%-Konfidenzintervall: ±21,791Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.775 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.803 anonymen Paarvergleichen. | Höherer Messwert1.485,062 95-%-Konfidenzintervall: ±8,535Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,302 95-%-Konfidenzintervall: ±14,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.415 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.803 anonymen Paarvergleichen. | Höherer Messwert1.476,95 95-%-Konfidenzintervall: ±8,834Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,302 95-%-Konfidenzintervall: ±14,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 19.113 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.718 anonymen Paarvergleichen. | Höherer Messwert1.472,208 95-%-Konfidenzintervall: ±5,341Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.406,687 95-%-Konfidenzintervall: ±8,36Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 18.303 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.718 anonymen Paarvergleichen. | Höherer Messwert1.465,266 95-%-Konfidenzintervall: ±5,602Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.406,687 95-%-Konfidenzintervall: ±8,36Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlPolishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 616 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen. | Höherer Messwert1.511,042 95-%-Konfidenzintervall: ±24,474Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.407,955 95-%-Konfidenzintervall: ±38,858Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlPolishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 490 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen. | Höherer Messwert1.495,138 95-%-Konfidenzintervall: ±26,833Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.407,955 95-%-Konfidenzintervall: ±38,858Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlRussianTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 3.509 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.143 anonymen Paarvergleichen. | Höherer Messwert1.490,286 95-%-Konfidenzintervall: ±10,554Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.415,692 95-%-Konfidenzintervall: ±17,832Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlRussianTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 3.399 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.143 anonymen Paarvergleichen. | Höherer Messwert1.490,675 95-%-Konfidenzintervall: ±10,793Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.415,692 95-%-Konfidenzintervall: ±17,832Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 13.719 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.320 anonymen Paarvergleichen. | Höherer Messwert1.501,285 95-%-Konfidenzintervall: ±6,083Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,76 95-%-Konfidenzintervall: ±9,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 13.118 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.320 anonymen Paarvergleichen. | Höherer Messwert1.494,103 95-%-Konfidenzintervall: ±6,268Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,76 95-%-Konfidenzintervall: ±9,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSpanishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.041 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 377 anonymen Paarvergleichen. | Höherer Messwert1.465,869 95-%-Konfidenzintervall: ±19,365Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.386,845 95-%-Konfidenzintervall: ±32,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlSpanishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 910 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 377 anonymen Paarvergleichen. | Höherer Messwert1.470,863 95-%-Konfidenzintervall: ±20,514Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.386,845 95-%-Konfidenzintervall: ±32,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 8.587 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.734 anonymen Paarvergleichen. | Höherer Messwert1.475,15 95-%-Konfidenzintervall: ±7,28Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,944 95-%-Konfidenzintervall: ±11,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-medium, Reasoning: medium, Harness: Arena text, style control Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 8.534 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.734 anonymen Paarvergleichen. | Höherer Messwert1.470,606 95-%-Konfidenzintervall: ±7,492Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,944 95-%-Konfidenzintervall: ±11,74Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Gemini 3.5 Flash und Mistral Medium 3.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.