- Startseite
- KI-Modelle
- Gemini 3.5 Flash
Gemini 3.5 Flash
- Veröffentlicht
- 19. Mai 2026
- Datenstand
- 30. Juli 2026
Einordnung
Position in der Kategorie
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.
- Position
- Platz 11 von 26
- Indexwert
- 58,7 / 100
- Abdeckung
- 4 / 4
Bestenliste
Messreihen
Vergleichbare Benchmarkwerte
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
τ-bench Airline Clean
80,8 % · Platz 2 von 3
Aufgabe: Trefferquote · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-overall · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
τ-bench Airline Clean
0,86 Bewertung · Platz 2 von 3
Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-reliability · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
τ-bench Airline Clean
0,78 Bewertung · Platz 3 von 3
Aufgabe: Konsistenz · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-consistency · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
τ-bench Airline Clean
0,82 Bewertung · Platz 3 von 3
Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-predictability · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
τ-bench Airline Clean
0,97 Bewertung · Platz 1 von 3
Aufgabe: Robustheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-robustness · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
τ-bench Airline Clean
0,99 Bewertung · Platz 1 von 3
Aufgabe: Sicherheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-safety · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
GAIA Reliability
79,2 % · Platz 1 von 3
Aufgabe: Trefferquote · Vergleichskohorte: hal-gaia-reliability-hal-reliability-overall · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
GAIA Reliability
0,84 Bewertung · Platz 1 von 3
Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-reliability · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
GAIA Reliability
0,75 Bewertung · Platz 2 von 3
Aufgabe: Konsistenz · Vergleichskohorte: hal-gaia-reliability-hal-reliability-consistency · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
GAIA Reliability
0,8 Bewertung · Platz 1 von 3
Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-predictability · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
GAIA Reliability
0,96 Bewertung · Platz 1 von 3
Aufgabe: Robustheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-robustness · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
GAIA Reliability
1 Bewertung · Platz 1 von 3
Aufgabe: Sicherheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-safety · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
SimpleQA Verified v2
70,4 % · Platz 2 von 5
Aufgabe: Kaggle-Score · Vergleichskohorte: simpleqa-verified-v2:official:overall · Datenstand: 9. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 verifizierte Prompts ohne Werkzeuge. Kaggle hat die Ergebnisse unabhängig reproduziert.
SWE-Marathon v1.0
7 % · Platz 4 von 4
Aufgabe: Binäre Lösung, Pass@1 · Vergleichskohorte: swe-marathon-v1-0:official:pass1 · Datenstand: 9. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
20 mehrstündige Aufgaben. Der benannte Coding-Agent ist Teil jeder Ergebniszeile.
EnigmaEval
25,41 % · Platz 4 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-enigma-eval-2026-07-23 · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Komplexe multimodale Rätsel mit exaktem Antwortabgleich und einem Versuch.
Steckbrief
Technische Daten und Zugang
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Veröffentlichte Preise
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Direkte Vergleiche
Dieses Modell im Vergleich
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Modelle derselben Auswahl
Alle KI-Modelle
Nachweise
Primärquellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.