Zum Hauptinhalt springen
SprachmodellAktiv

Gemini 3.5 Flash

Google

Veröffentlicht
19. Mai 2026
Datenstand
30. Juli 2026

Einordnung

Position in der Kategorie

Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.

Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.

Position
Platz 11 von 26
Indexwert
58,7 / 100
Abdeckung
4 / 4

Bestenliste

1Claude Opus 588,9 / 100
2Gemini 3.8 Flash88,5 / 100
3Claude Fable 583,2 / 100
10GPT-5.6 Terra59,1 / 100
11Gemini 3.5 Flash, Aktuelles Modell58,7 / 100
12Claude Sonnet 557,7 / 100
25MiMo-V2.5-Pro12,5 / 100

Messreihen

Vergleichbare Benchmarkwerte

Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.

τ-bench Airline Clean

80,8 % · Platz 2 von 3

Aufgabe: Trefferquote · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-overall · Datenstand: 5. August 2026

1.Gemini 3.1 Pro Preview82,1 %
2.Gemini 3.5 Flash, Aktuelles Modell80,8 %
3.GPT-5.579,5 %

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,86 Bewertung · Platz 2 von 3

Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-reliability · Datenstand: 5. August 2026

1.GPT-5.50,89 Bewertung
2.Gemini 3.1 Pro Preview0,86 Bewertung
2.Gemini 3.5 Flash, Aktuelles Modell0,86 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,78 Bewertung · Platz 3 von 3

Aufgabe: Konsistenz · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-consistency · Datenstand: 5. August 2026

1.GPT-5.50,84 Bewertung
2.Gemini 3.1 Pro Preview0,81 Bewertung
3.Gemini 3.5 Flash, Aktuelles Modell0,78 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,82 Bewertung · Platz 3 von 3

Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-predictability · Datenstand: 5. August 2026

1.GPT-5.50,84 Bewertung
2.Gemini 3.1 Pro Preview0,83 Bewertung
3.Gemini 3.5 Flash, Aktuelles Modell0,82 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,97 Bewertung · Platz 1 von 3

Aufgabe: Robustheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-robustness · Datenstand: 5. August 2026

1.Gemini 3.5 Flash, Aktuelles Modell0,97 Bewertung
1.GPT-5.50,97 Bewertung
3.Gemini 3.1 Pro Preview0,94 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,99 Bewertung · Platz 1 von 3

Aufgabe: Sicherheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-safety · Datenstand: 5. August 2026

1.Gemini 3.5 Flash, Aktuelles Modell0,99 Bewertung
2.Gemini 3.1 Pro Preview0,97 Bewertung
3.GPT-5.50,96 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

GAIA Reliability

79,2 % · Platz 1 von 3

Aufgabe: Trefferquote · Vergleichskohorte: hal-gaia-reliability-hal-reliability-overall · Datenstand: 6. August 2026

1.Gemini 3.5 Flash, Aktuelles Modell79,2 %
2.Gemini 3.1 Pro Preview76,2 %
3.GPT-5.562,8 %

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,84 Bewertung · Platz 1 von 3

Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-reliability · Datenstand: 6. August 2026

1.Gemini 3.5 Flash, Aktuelles Modell0,84 Bewertung
2.Gemini 3.1 Pro Preview0,82 Bewertung
3.GPT-5.50,79 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,75 Bewertung · Platz 2 von 3

Aufgabe: Konsistenz · Vergleichskohorte: hal-gaia-reliability-hal-reliability-consistency · Datenstand: 6. August 2026

1.Gemini 3.1 Pro Preview0,76 Bewertung
2.Gemini 3.5 Flash, Aktuelles Modell0,75 Bewertung
3.GPT-5.50,61 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,8 Bewertung · Platz 1 von 3

Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-predictability · Datenstand: 6. August 2026

1.Gemini 3.5 Flash, Aktuelles Modell0,8 Bewertung
1.GPT-5.50,8 Bewertung
3.Gemini 3.1 Pro Preview0,78 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,96 Bewertung · Platz 1 von 3

Aufgabe: Robustheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-robustness · Datenstand: 6. August 2026

1.Gemini 3.5 Flash, Aktuelles Modell0,96 Bewertung
2.GPT-5.50,95 Bewertung
3.Gemini 3.1 Pro Preview0,94 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

1 Bewertung · Platz 1 von 3

Aufgabe: Sicherheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-safety · Datenstand: 6. August 2026

1.Gemini 3.1 Pro Preview1 Bewertung
1.Gemini 3.5 Flash, Aktuelles Modell1 Bewertung
1.GPT-5.51 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

SimpleQA Verified v2

70,4 % · Platz 2 von 5

Aufgabe: Kaggle-Score · Vergleichskohorte: simpleqa-verified-v2:official:overall · Datenstand: 9. August 2026

1.Gemini 3.1 Pro Preview77,5 %
2.Gemini 3.5 Flash, Aktuelles Modell70,4 %
3.GPT-5.6 Sol69,2 %
4.Claude Opus 563,3 %
5.Grok 4.553,8 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.000 verifizierte Prompts ohne Werkzeuge. Kaggle hat die Ergebnisse unabhängig reproduziert.

Quelle: KaggleTeilnehmer: 5

SWE-Marathon v1.0

7 % · Platz 4 von 4

Aufgabe: Binäre Lösung, Pass@1 · Vergleichskohorte: swe-marathon-v1-0:official:pass1 · Datenstand: 9. August 2026

1.Grok 4.529 %
2.Claude Fable 524 %
3.GPT-5.512 %
4.Gemini 3.5 Flash, Aktuelles Modell7 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

20 mehrstündige Aufgaben. Der benannte Coding-Agent ist Teil jeder Ergebniszeile.

EnigmaEval

25,41 % · Platz 4 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-enigma-eval-2026-07-23 · Datenstand: 26. August 2026

1.Claude Fable 539,28 %
2.GPT-5.6 Sol37,12 %
3.Gemini 3.1 Pro Preview36,78 %
4.Gemini 3.5 Flash, Aktuelles Modell25,41 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Komplexe multimodale Rätsel mit exaktem Antwortabgleich und einem Versuch.

Quelle: Scale AITeilnehmer: 4

Steckbrief

Technische Daten und Zugang

Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.

Modelltyp
ProprietärQuelle
Kontextfenster
1.048.576 TokenQuelle
Hinweise
Veröffentlicht am 19. Mai 2026. Google veröffentlicht weder Parameterzahl noch Architektur oder Wissensstand.Quelle

Kosten

Veröffentlichte Preise

Preise bleiben an die dokumentierte Einheit und Quelle gebunden.

API-Eingabe
1,5 $ pro 1 Mio. TokenQuelle
API-Ausgabe
9 $ pro 1 Mio. TokenQuelle
Cache lesen
0,15 $ pro 1 Mio. TokenQuelle

Direkte Vergleiche

Dieses Modell im Vergleich

Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.

Weitere Modelle

Modelle derselben Auswahl

Alle KI-Modelle

Nachweise

Primärquellen und Datenstand

Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.

  • ModellmetadatenQuelle
  • API-PreiseQuelle
  • Princeton HAL (abgerufen 5. August 2026)Quelle
  • Princeton HAL (abgerufen 6. August 2026)Quelle
  • Kaggle (abgerufen 9. August 2026)Quelle
  • SWE-Marathon (abgerufen 9. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle