Zum Hauptinhalt springen

Direktvergleich

Gemini 3.5 Flash-Lite vs. Mistral Large 3

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

29

gemeinsame Messreihen

1

verschiedene Benchmarks

16.08.2026

jüngster Abruf

Modellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und Standard-API-Preise

Nicht veröffentlichte Parameterzahlen oder Wissensstände bleiben als solche markiert. Die Tabelle zeigt direkte Standardtarife pro Token einschließlich hinterlegter Kontextstufen. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

Allgemeine Daten und API-Preise von Gemini 3.5 Flash-Lite und Mistral Large 3
MerkmalGemini 3.5 Flash-LiteMistral Large 3
AnbieterGoogleMistral AI
Erschienen21. Juli 20262. Dez. 2025
VerfügbarkeitAktivAktiv
ModelltypProprietärOpen Weights
ParameterNicht veröffentlicht675 Mrd., 41 Mrd. aktiv
ArchitekturNicht veröffentlichtMixture of Experts
Kontextfenster1.048.576 Token256.000 Token
WissensstandNicht veröffentlichtNicht veröffentlicht
Technische QuellenModellModell
API-Preise pro 1 Mio. Token
API-Eingabe0,3 $0,5 $
API-Ausgabe2,5 $1,5 $
Cache lesen0,03 $Nicht ausgewiesen
Cache schreiben (5 Min.)Nicht ausgewiesenNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft30.07.2026Quelle30.07.2026Quelle
Gemini 3.5 Flash-LiteMistral Large 3
API-EingabeUSD pro 1 Mio. Token, Basistarif
Gemini 3.5 Flash-Lite0,3 $Günstiger
Mistral Large 30,5 $
API-AusgabeUSD pro 1 Mio. Token, Basistarif
Gemini 3.5 Flash-Lite2,5 $
Mistral Large 31,5 $Günstiger

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

29 gemeinsame Messreihen
Gemini 3.5 Flash-LiteMistral Large 3
Arena Text, Style ControlOverall. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.457,988 Arena-PunkteGewinner
Mistral Large 31.414,798 Arena-Punkte
Arena Text, Style ControlBusiness, management and finance. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.459,06 Arena-PunkteGewinner
Mistral Large 31.412,96 Arena-Punkte
Arena Text, Style ControlChinese. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.494,257 Arena-PunkteGewinner
Mistral Large 31.429,195 Arena-Punkte
Arena Text, Style ControlCoding. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.502,808 Arena-PunkteGewinner
Mistral Large 31.468,172 Arena-Punkte
Arena Text, Style ControlCreative writing. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.440,5 Arena-PunkteGewinner
Mistral Large 31.374,812 Arena-Punkte
Arena Text, Style ControlEnglish. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.463,386 Arena-PunkteGewinner
Mistral Large 31.428,092 Arena-Punkte
Arena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.436,106 Arena-PunkteGewinner
Mistral Large 31.374,062 Arena-Punkte
Arena Text, Style ControlExcluding ties. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.461,861 Arena-PunkteGewinner
Mistral Large 31.402,073 Arena-Punkte
Arena Text, Style ControlExpert prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.465,928 Arena-PunkteGewinner
Mistral Large 31.425,617 Arena-Punkte
Arena Text, Style ControlFrench. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.478,889 Arena-PunkteKein klarer Vorsprung
Mistral Large 31.436,959 Arena-Punkte
Arena Text, Style ControlGerman. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.464,148 Arena-PunkteGewinner
Mistral Large 31.404,865 Arena-Punkte
Arena Text, Style ControlHard prompts. Mehr ist besser. Kein dokumentierter Setup-Unterschied
Gemini 3.5 Flash-Lite1.477,266 Arena-PunkteGewinner
Mistral Large 31.431,831 Arena-Punkte
Benchmarkwerte von Gemini 3.5 Flash-Lite und Mistral Large 3
Benchmark und AufgabeGemini 3.5 Flash-LiteMistral Large 3VergleichbarkeitQuelle
Arena Text, Style ControlOverall
1.457,988 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±5,907Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.414,798 Arena-Punkte
95-%-Konfidenzintervall: ±3,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:overallKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 13.676 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 59.196 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlBusiness, management and finance
1.459,06 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,079Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.412,96 Arena-Punkte
95-%-Konfidenzintervall: ±6,188Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_business_and_management_and_financial_operationsKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 2.561 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.241 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlChinese
1.494,257 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±19,894Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.429,195 Arena-Punkte
95-%-Konfidenzintervall: ±11,167Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:chineseKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 977 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.176 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCoding
1.502,808 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,913Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.468,172 Arena-Punkte
95-%-Konfidenzintervall: ±5,487Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:codingKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 3.938 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.576 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlCreative writing
1.440,5 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,26Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.374,812 Arena-Punkte
95-%-Konfidenzintervall: ±6,696Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:creative_writingKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 2.656 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.516 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEnglish
1.463,386 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,255Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,092 Arena-Punkte
95-%-Konfidenzintervall: ±4,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:englishKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 5.654 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 27.057 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlEntertainment, sports and media
1.436,106 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,895Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.374,062 Arena-Punkte
95-%-Konfidenzintervall: ±6,028Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_entertainment_and_sports_and_mediaKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 3.404 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.988 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExcluding ties
1.461,861 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,808Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.402,073 Arena-Punkte
95-%-Konfidenzintervall: ±4,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:exclude_tiesKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 10.267 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 42.743 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlExpert prompts
1.465,928 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±15,249Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.425,617 Arena-Punkte
95-%-Konfidenzintervall: ±8,821Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:expertKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 1.549 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.022 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlFrench
1.478,889 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±28,346Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.436,959 Arena-Punkte
95-%-Konfidenzintervall: ±16,748Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:frenchKein dokumentierter Setup-UnterschiedKein klarer VorsprungGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 468 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.573 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlGerman
1.464,148 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±36,529Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.404,865 Arena-Punkte
95-%-Konfidenzintervall: ±20,292Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:germanKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 250 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 938 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts
1.477,266 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,044Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,831 Arena-Punkte
95-%-Konfidenzintervall: ±3,992Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_promptsKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 9.230 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 35.076 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlHard prompts, English
1.480,104 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,997Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.439,235 Arena-Punkte
95-%-Konfidenzintervall: ±5,258Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:hard_prompts_englishKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 3.771 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 16.489 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlInstruction following
1.441,878 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±9,021Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.401,455 Arena-Punkte
95-%-Konfidenzintervall: ±5,054Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:instruction_followingKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 4.869 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.943 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlJapanese
1.436,151 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±41,04Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.372,852 Arena-Punkte
95-%-Konfidenzintervall: ±27,094Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:japaneseKein dokumentierter Setup-UnterschiedKein klarer VorsprungGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 212 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 532 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlKorean
1.434,218 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±34,367Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.347,595 Arena-Punkte
95-%-Konfidenzintervall: ±20,301Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:koreanKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 292 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 983 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLegal and government
1.464,31 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±17,776Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,186 Arena-Punkte
95-%-Konfidenzintervall: ±9,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_legal_and_governmentKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 1.172 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.397 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLife, physical and social science
1.485,638 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±12,568Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.427,837 Arena-Punkte
95-%-Konfidenzintervall: ±6,466Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_life_and_physical_and_social_scienceKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 2.266 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 9.572 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlLonger queries
1.465,55 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,24Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,594 Arena-Punkte
95-%-Konfidenzintervall: ±4,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:longer_queryKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 6.547 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 20.121 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMath
1.423,216 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±24,255Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.404,068 Arena-Punkte
95-%-Konfidenzintervall: ±10,174Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:mathKein dokumentierter Setup-UnterschiedKein klarer VorsprungGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 573 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.533 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMathematical professions
1.446,525 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±21,811Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.418,682 Arena-Punkte
95-%-Konfidenzintervall: ±11,451Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_mathematicalKein dokumentierter Setup-UnterschiedKein klarer VorsprungGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 732 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMedicine and healthcare
1.475,956 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±19,108Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.432,596 Arena-Punkte
95-%-Konfidenzintervall: ±9,78Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_medicine_and_healthcareKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 1.025 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.088 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlMulti-turn
1.464,693 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±13,089Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.421,924 Arena-Punkte
95-%-Konfidenzintervall: ±6,397Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:multi_turnKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 2.267 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.237 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlNon-English
1.447,634 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±7,331Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.398,241 Arena-Punkte
95-%-Konfidenzintervall: ±4,043Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:non_englishKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 8.020 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 32.134 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlPolish
1.458,083 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±38,26Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.419,007 Arena-Punkte
95-%-Konfidenzintervall: ±15,852Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:polishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 216 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.417 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlRussian
1.466,233 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±16,568Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.409,573 Arena-Punkte
95-%-Konfidenzintervall: ±7,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:russianKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 1.327 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.987 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSoftware and IT services
1.490,246 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±8,396Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.456,428 Arena-Punkte
95-%-Konfidenzintervall: ±4,685Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_software_and_it_servicesKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 5.692 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 22.035 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlSpanish
1.452,624 Arena-PunkteKein klarer Vorsprung
95-%-Konfidenzintervall: ±34,33Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.411,23 Arena-Punkte
95-%-Konfidenzintervall: ±16,163Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:spanishKein dokumentierter Setup-UnterschiedKein klarer VorsprungGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 308 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.603 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026
Arena Text, Style ControlWriting, literature and language
1.447,796 Arena-PunkteGewinner
95-%-Konfidenzintervall: ±10,535Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.389,648 Arena-Punkte
95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
style-control-v1style-controlled Bradley-Terry ratingMehr ist besserKohorte: lmarena-text-style-control:2026-08-12:industry_writing_and_literature_and_languageKein dokumentierter Setup-UnterschiedSieger: Gemini 3.5 Flash-LiteGemini 3.5 Flash-Lite: Snapshot: gemini-3.5-flash-lite, Harness: Arena text, style control
Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style control
Gemini 3.5 Flash-Lite: Stilbereinigte Arena-Bewertung aus 3.556 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 13.904 anonymen Paarvergleichen.
ArenaTyp: Offizielles Benchmark-LeaderboardMessstand: 12.08.2026Import-ID: lmarena-eeedf9209373a7f9b324bfb839e7b02fedacd1e5-1611ed64f3f1Abgerufen am 16.08.2026

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Preise beziehen sich auf die offiziellen API-Tarife pro 1 Mio. Token. Web-Abos und Cloud-Aufschläge können davon abweichen.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.