Zum Hauptinhalt springen
SprachmodellVorschau

Gemini 3.1 Pro Preview

Google

Veröffentlicht
19. Februar 2026
Datenstand
30. Juli 2026

Einordnung

Position in der Kategorie

Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.

Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.

Position
Platz 16 von 26
Indexwert
41,3 / 100
Abdeckung
4 / 4

Bestenliste

1Claude Opus 588,9 / 100
2Gemini 3.8 Flash88,5 / 100
3Claude Fable 583,2 / 100
15Grok 4.546,2 / 100
16Gemini 3.1 Pro Preview, Aktuelles Modell41,3 / 100
17GLM-5.3-Flash35,6 / 100
25MiMo-V2.5-Pro12,5 / 100

Messreihen

Vergleichbare Benchmarkwerte

Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.

τ-bench Airline Clean

82,1 % · Platz 1 von 3

Aufgabe: Trefferquote · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-overall · Datenstand: 5. August 2026

1.Gemini 3.1 Pro Preview, Aktuelles Modell82,1 %
2.Gemini 3.5 Flash80,8 %
3.GPT-5.579,5 %

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,86 Bewertung · Platz 2 von 3

Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-reliability · Datenstand: 5. August 2026

1.GPT-5.50,89 Bewertung
2.Gemini 3.1 Pro Preview, Aktuelles Modell0,86 Bewertung
2.Gemini 3.5 Flash0,86 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,81 Bewertung · Platz 2 von 3

Aufgabe: Konsistenz · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-consistency · Datenstand: 5. August 2026

1.GPT-5.50,84 Bewertung
2.Gemini 3.1 Pro Preview, Aktuelles Modell0,81 Bewertung
3.Gemini 3.5 Flash0,78 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,83 Bewertung · Platz 2 von 3

Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-predictability · Datenstand: 5. August 2026

1.GPT-5.50,84 Bewertung
2.Gemini 3.1 Pro Preview, Aktuelles Modell0,83 Bewertung
3.Gemini 3.5 Flash0,82 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,94 Bewertung · Platz 3 von 3

Aufgabe: Robustheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-robustness · Datenstand: 5. August 2026

1.Gemini 3.5 Flash0,97 Bewertung
1.GPT-5.50,97 Bewertung
3.Gemini 3.1 Pro Preview, Aktuelles Modell0,94 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,97 Bewertung · Platz 2 von 3

Aufgabe: Sicherheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-safety · Datenstand: 5. August 2026

1.Gemini 3.5 Flash0,99 Bewertung
2.Gemini 3.1 Pro Preview, Aktuelles Modell0,97 Bewertung
3.GPT-5.50,96 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

GAIA Reliability

76,2 % · Platz 2 von 3

Aufgabe: Trefferquote · Vergleichskohorte: hal-gaia-reliability-hal-reliability-overall · Datenstand: 6. August 2026

1.Gemini 3.5 Flash79,2 %
2.Gemini 3.1 Pro Preview, Aktuelles Modell76,2 %
3.GPT-5.562,8 %

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,82 Bewertung · Platz 2 von 3

Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-reliability · Datenstand: 6. August 2026

1.Gemini 3.5 Flash0,84 Bewertung
2.Gemini 3.1 Pro Preview, Aktuelles Modell0,82 Bewertung
3.GPT-5.50,79 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,76 Bewertung · Platz 1 von 3

Aufgabe: Konsistenz · Vergleichskohorte: hal-gaia-reliability-hal-reliability-consistency · Datenstand: 6. August 2026

1.Gemini 3.1 Pro Preview, Aktuelles Modell0,76 Bewertung
2.Gemini 3.5 Flash0,75 Bewertung
3.GPT-5.50,61 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,78 Bewertung · Platz 3 von 3

Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-predictability · Datenstand: 6. August 2026

1.Gemini 3.5 Flash0,8 Bewertung
1.GPT-5.50,8 Bewertung
3.Gemini 3.1 Pro Preview, Aktuelles Modell0,78 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,94 Bewertung · Platz 3 von 3

Aufgabe: Robustheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-robustness · Datenstand: 6. August 2026

1.Gemini 3.5 Flash0,96 Bewertung
2.GPT-5.50,95 Bewertung
3.Gemini 3.1 Pro Preview, Aktuelles Modell0,94 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

1 Bewertung · Platz 1 von 3

Aufgabe: Sicherheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-safety · Datenstand: 6. August 2026

1.Gemini 3.1 Pro Preview, Aktuelles Modell1 Bewertung
1.Gemini 3.5 Flash1 Bewertung
1.GPT-5.51 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

SimpleQA Verified v2

77,5 % · Platz 1 von 5

Aufgabe: Kaggle-Score · Vergleichskohorte: simpleqa-verified-v2:official:overall · Datenstand: 9. August 2026

1.Gemini 3.1 Pro Preview, Aktuelles Modell77,5 %
2.Gemini 3.5 Flash70,4 %
3.GPT-5.6 Sol69,2 %
4.Claude Opus 563,3 %
5.Grok 4.553,8 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.000 verifizierte Prompts ohne Werkzeuge. Kaggle hat die Ergebnisse unabhängig reproduziert.

Quelle: KaggleTeilnehmer: 5

Humanity's Last Exam

46,44 % · Platz 1 von 2

Vergleichskohorte: hle-final-scale-public-temperature-0 · Datenstand: 2. September 2026

1.Gemini 3.1 Pro Preview, Aktuelles Modell46,44 %
2.GPT-5.436,24 %

2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Alle 2.500 öffentlichen Fragen, Temperatur 0 und automatischer Antwort-Extraktor.

Quelle: Scale AITeilnehmer: 2

BrowseComp

85,9 % · Platz 3 von 5

Vergleichskohorte: browsecomp-openai-gpt-5-6-table · Datenstand: 2. September 2026

1.Claude Mythos 588 %
2.GPT-5.6 Terra87,5 %
3.Gemini 3.1 Pro Preview, Aktuelles Modell85,9 %
4.GPT-5.584,4 %
5.GPT-5.6 Luna83,3 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Herstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich.

Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.

Quelle: OpenAITeilnehmer: 5

PRBench Finance

41,87 % · Platz 4 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-finance-full · Datenstand: 26. August 2026

1.Claude Fable 553,86 %
2.GPT-5.6 Sol50,45 %
3.GPT-5.445,63 %
4.Gemini 3.1 Pro Preview, Aktuelles Modell41,87 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.

Quelle: Scale AITeilnehmer: 4

44,02 % · Platz 4 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-legal-full · Datenstand: 26. August 2026

1.Claude Fable 552,56 %
2.GPT-5.6 Sol50,5 %
3.GPT-5.444,35 %
4.Gemini 3.1 Pro Preview, Aktuelles Modell44,02 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.

Quelle: Scale AITeilnehmer: 4

MultiNRC

64,74 % · Platz 1 von 2

Aufgabe: Gesamt · Vergleichskohorte: scale-multinrc-native-languages · Datenstand: 26. August 2026

1.Gemini 3.1 Pro Preview, Aktuelles Modell64,74 %
2.GPT-5.458,29 %

2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung.

Quelle: Scale AITeilnehmer: 2

EnigmaEval

36,78 % · Platz 3 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-enigma-eval-2026-07-23 · Datenstand: 26. August 2026

1.Claude Fable 539,28 %
2.GPT-5.6 Sol37,12 %
3.Gemini 3.1 Pro Preview, Aktuelles Modell36,78 %
4.Gemini 3.5 Flash25,41 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Komplexe multimodale Rätsel mit exaktem Antwortabgleich und einem Versuch.

Quelle: Scale AITeilnehmer: 4

VisualToolBench

28,97 % · Platz 2 von 2

Aufgabe: Gesamt · Vergleichskohorte: scale-visual-toolbench-apr · Datenstand: 26. August 2026

1.GPT-5.429,17 %
2.Gemini 3.1 Pro Preview, Aktuelles Modell28,97 %

2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe.

Quelle: Scale AITeilnehmer: 2

Einzelwerte

Veröffentlichte Einzelwerte

Für diese Messwerte liegt keine exakt passende veröffentlichte Vergleichskohorte vor. Der Balken zeigt nur die dokumentierte Skala, keine Rangposition.

MultiChallenge

Aufgabe: Gesamt · Datenstand: 26. August 2026

MultiChallenge71,37 %

Skala 0 bis 100. Kein Rang

Mehrstufige Gespräche mit binären, aufgabenspezifischen Rubriken.

TutorBench

Aufgabe: Gesamt · Datenstand: 26. August 2026

TutorBench52,99 %

Skala 0 bis 100. Kein Rang

1.490 Aufgaben mit gewichteten Rubriken und Claude 4 Sonnet als Juror.

Steckbrief

Technische Daten und Zugang

Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.

Modelltyp
ProprietärQuelle
Kontextfenster
1.048.576 TokenQuelle
Hinweise
2-fache Verbesserung des Reasonings gegenüber Gemini 3 Pro, GPQA Diamond 94,3 %, SWE-bench 80,6 %Quelle

Kosten

Veröffentlichte Preise

Preise bleiben an die dokumentierte Einheit und Quelle gebunden.

API-Eingabe
2 $ pro 1 Mio. TokenQuelle
API-Eingabe
4 $ pro 1 Mio. Token (über 200.000 Kontext-Token)Quelle
API-Ausgabe
12 $ pro 1 Mio. TokenQuelle
API-Ausgabe
18 $ pro 1 Mio. Token (über 200.000 Kontext-Token)Quelle
Cache lesen
0,2 $ pro 1 Mio. TokenQuelle
Cache lesen
0,4 $ pro 1 Mio. Token (über 200.000 Kontext-Token)Quelle

Messwerte

Weitere veröffentlichte Benchmarks

Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.

METR Time Horizon

384,15 Minuten

Abgerufen 26. August 2026

METR

METR Time Horizon

89,8 Minuten

Abgerufen 26. August 2026

METR

Direkte Vergleiche

Dieses Modell im Vergleich

Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.

Weitere Modelle

Modelle derselben Auswahl

Alle KI-Modelle

Nachweise

Primärquellen und Datenstand

Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.

  • ModellmetadatenQuelle
  • API-PreiseQuelle
  • Princeton HAL (abgerufen 5. August 2026)Quelle
  • Princeton HAL (abgerufen 6. August 2026)Quelle
  • METR (abgerufen 26. August 2026)Quelle
  • Kaggle (abgerufen 9. August 2026)Quelle
  • Scale AI (abgerufen 2. September 2026)Quelle
  • OpenAI (abgerufen 2. September 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle