Zum Hauptinhalt springen
SprachmodellAktiv

GPT-5.5

OpenAI

Veröffentlicht
April 2026
Datenstand
30. Juli 2026

Einordnung

Position in der Kategorie

Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.

Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.

Position
Platz 13 von 26
Indexwert
57,2 / 100
Abdeckung
4 / 4

Bestenliste

1Claude Opus 588,9 / 100
2Gemini 3.8 Flash88,5 / 100
3Claude Fable 583,2 / 100
12Claude Sonnet 557,7 / 100
13GPT-5.5, Aktuelles Modell57,2 / 100
14GLM-5.354,8 / 100
25MiMo-V2.5-Pro12,5 / 100

Messreihen

Vergleichbare Benchmarkwerte

Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.

τ-bench Airline Clean

79,5 % · Platz 3 von 3

Aufgabe: Trefferquote · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-overall · Datenstand: 5. August 2026

1.Gemini 3.1 Pro Preview82,1 %
2.Gemini 3.5 Flash80,8 %
3.GPT-5.5, Aktuelles Modell79,5 %

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,89 Bewertung · Platz 1 von 3

Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-reliability · Datenstand: 5. August 2026

1.GPT-5.5, Aktuelles Modell0,89 Bewertung
2.Gemini 3.1 Pro Preview0,86 Bewertung
2.Gemini 3.5 Flash0,86 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,84 Bewertung · Platz 1 von 3

Aufgabe: Konsistenz · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-consistency · Datenstand: 5. August 2026

1.GPT-5.5, Aktuelles Modell0,84 Bewertung
2.Gemini 3.1 Pro Preview0,81 Bewertung
3.Gemini 3.5 Flash0,78 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,84 Bewertung · Platz 1 von 3

Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-predictability · Datenstand: 5. August 2026

1.GPT-5.5, Aktuelles Modell0,84 Bewertung
2.Gemini 3.1 Pro Preview0,83 Bewertung
3.Gemini 3.5 Flash0,82 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,97 Bewertung · Platz 1 von 3

Aufgabe: Robustheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-robustness · Datenstand: 5. August 2026

1.Gemini 3.5 Flash0,97 Bewertung
1.GPT-5.5, Aktuelles Modell0,97 Bewertung
3.Gemini 3.1 Pro Preview0,94 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

τ-bench Airline Clean

0,96 Bewertung · Platz 3 von 3

Aufgabe: Sicherheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-safety · Datenstand: 5. August 2026

1.Gemini 3.5 Flash0,99 Bewertung
2.Gemini 3.1 Pro Preview0,97 Bewertung
3.GPT-5.5, Aktuelles Modell0,96 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.

GAIA Reliability

62,8 % · Platz 3 von 3

Aufgabe: Trefferquote · Vergleichskohorte: hal-gaia-reliability-hal-reliability-overall · Datenstand: 6. August 2026

1.Gemini 3.5 Flash79,2 %
2.Gemini 3.1 Pro Preview76,2 %
3.GPT-5.5, Aktuelles Modell62,8 %

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,79 Bewertung · Platz 3 von 3

Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-reliability · Datenstand: 6. August 2026

1.Gemini 3.5 Flash0,84 Bewertung
2.Gemini 3.1 Pro Preview0,82 Bewertung
3.GPT-5.5, Aktuelles Modell0,79 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,61 Bewertung · Platz 3 von 3

Aufgabe: Konsistenz · Vergleichskohorte: hal-gaia-reliability-hal-reliability-consistency · Datenstand: 6. August 2026

1.Gemini 3.1 Pro Preview0,76 Bewertung
2.Gemini 3.5 Flash0,75 Bewertung
3.GPT-5.5, Aktuelles Modell0,61 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,8 Bewertung · Platz 1 von 3

Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-predictability · Datenstand: 6. August 2026

1.Gemini 3.5 Flash0,8 Bewertung
1.GPT-5.5, Aktuelles Modell0,8 Bewertung
3.Gemini 3.1 Pro Preview0,78 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

0,95 Bewertung · Platz 2 von 3

Aufgabe: Robustheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-robustness · Datenstand: 6. August 2026

1.Gemini 3.5 Flash0,96 Bewertung
2.GPT-5.5, Aktuelles Modell0,95 Bewertung
3.Gemini 3.1 Pro Preview0,94 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

GAIA Reliability

1 Bewertung · Platz 1 von 3

Aufgabe: Sicherheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-safety · Datenstand: 6. August 2026

1.Gemini 3.1 Pro Preview1 Bewertung
1.Gemini 3.5 Flash1 Bewertung
1.GPT-5.5, Aktuelles Modell1 Bewertung

3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.

AlmanBench v0.1

95,43 % · Platz 1 von 5

Aufgabe: Akzeptierte Fälle · Vergleichskohorte: almanbench-v0-1:official:overall · Datenstand: 9. August 2026

1.GPT-5.5, Aktuelles Modell95,43 %
2.GPT-5.6 Sol95,14 %
3.Claude Opus 594,95 %
4.DeepSeek-V4-Flash93 %
5.Kimi K390,96 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation.

SWE-Marathon v1.0

12 % · Platz 3 von 4

Aufgabe: Binäre Lösung, Pass@1 · Vergleichskohorte: swe-marathon-v1-0:official:pass1 · Datenstand: 9. August 2026

1.Grok 4.529 %
2.Claude Fable 524 %
3.GPT-5.5, Aktuelles Modell12 %
4.Gemini 3.5 Flash7 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

20 mehrstündige Aufgaben. Der benannte Coding-Agent ist Teil jeder Ergebniszeile.

LiveBench

80,19 Punkte · Platz 3 von 4

Vergleichskohorte: livebench-2026-06-25-max · Datenstand: 2. September 2026

1.Claude Fable 582,97 Punkte
2.GPT-5.6 Sol81,05 Punkte
3.GPT-5.5, Aktuelles Modell80,19 Punkte
4.GPT-5.6 Terra77,94 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

23 objektiv bewertete Aufgaben in sieben Kategorien.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

89,7 Punkte · Platz 3 von 4

Aufgabe: Reasoning · Vergleichskohorte: livebench-2026-06-25-reasoning-max · Datenstand: 2. September 2026

1.GPT-5.6 Sol91,7 Punkte
2.GPT-5.6 Terra90,6 Punkte
3.Claude Fable 589,7 Punkte
3.GPT-5.5, Aktuelles Modell89,7 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Reasoning innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

82,1 Punkte · Platz 3 von 4

Aufgabe: Coding · Vergleichskohorte: livebench-2026-06-25-coding-max · Datenstand: 2. September 2026

1.Claude Fable 586 Punkte
2.GPT-5.6 Sol83,9 Punkte
3.GPT-5.5, Aktuelles Modell82,1 Punkte
4.GPT-5.6 Terra78,2 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Coding innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

54 Punkte · Platz 4 von 4

Aufgabe: Agentisches Coding · Vergleichskohorte: livebench-2026-06-25-agentic-coding-max · Datenstand: 2. September 2026

1.Claude Fable 562,2 Punkte
2.GPT-5.6 Sol56,2 Punkte
3.GPT-5.6 Terra54,9 Punkte
4.GPT-5.5, Aktuelles Modell54 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Agentisches Coding innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

95,9 Punkte · Platz 3 von 4

Aufgabe: Mathematik · Vergleichskohorte: livebench-2026-06-25-mathematics-max · Datenstand: 2. September 2026

1.GPT-5.6 Sol96,2 Punkte
2.Claude Fable 596 Punkte
3.GPT-5.5, Aktuelles Modell95,9 Punkte
4.GPT-5.6 Terra94,9 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Mathematik innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

81,6 Punkte · Platz 1 von 4

Aufgabe: Datenanalyse · Vergleichskohorte: livebench-2026-06-25-data-analysis-max · Datenstand: 2. September 2026

1.GPT-5.5, Aktuelles Modell81,6 Punkte
2.Claude Fable 580,5 Punkte
3.GPT-5.6 Sol79,8 Punkte
4.GPT-5.6 Terra79,3 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Datenanalyse innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

87,4 Punkte · Platz 3 von 4

Aufgabe: Sprache · Vergleichskohorte: livebench-2026-06-25-language-max · Datenstand: 2. September 2026

1.Claude Fable 590,7 Punkte
2.GPT-5.6 Sol87,7 Punkte
3.GPT-5.5, Aktuelles Modell87,4 Punkte
4.GPT-5.6 Terra82,9 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Sprache innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

70,7 Punkte · Platz 3 von 4

Aufgabe: Anweisungsbefolgung · Vergleichskohorte: livebench-2026-06-25-instruction-following-max · Datenstand: 2. September 2026

1.Claude Fable 575,8 Punkte
2.GPT-5.6 Sol71,8 Punkte
3.GPT-5.5, Aktuelles Modell70,7 Punkte
4.GPT-5.6 Terra64,6 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Anweisungsbefolgung innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

BrowseComp

84,4 % · Platz 4 von 5

Vergleichskohorte: browsecomp-openai-gpt-5-6-table · Datenstand: 2. September 2026

1.Claude Mythos 588 %
2.GPT-5.6 Terra87,5 %
3.Gemini 3.1 Pro Preview85,9 %
4.GPT-5.5, Aktuelles Modell84,4 %
5.GPT-5.6 Luna83,3 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Herstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich.

Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.

Quelle: OpenAITeilnehmer: 5

Einzelwerte

Veröffentlichte Einzelwerte

Für diese Messwerte liegt keine exakt passende veröffentlichte Vergleichskohorte vor. Der Balken zeigt nur die dokumentierte Skala, keine Rangposition.

OSWorld 2.0

Datenstand: 26. August 2026

OSWorld 2.013 %

Skala 0 bis 100. Kein Rang

Vollständiges Agentensystem bei bis zu 500 Schritten.

Claude verwendete ungefähr 244.000 Output-Tokens. Das ist ein Systemwert, kein isolierter Modellscore.

SWE-Bench Pro

Datenstand: 2. September 2026

SWE-Bench Pro58,6 %

Skala 0 bis 100. Kein Rang

Von Anthropic veröffentlichte Vergleichstabelle. Kein Gradually-Test.

OpenAI schätzt nach einer Prüfung, dass rund 30 % der öffentlichen Aufgaben fehlerhaft sind. Der Wert bleibt deshalb ein umstrittenes Zusatzsignal. Die Zeilen sind eine redaktionelle Auswahl aus der jeweiligen Vergleichstabelle.

Steckbrief

Technische Daten und Zugang

Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.

Modelltyp
ProprietärQuelle
Kontextfenster
1.050.000 TokenQuelle
Knowledge Cutoff
1. Dezember 2025Quelle
Hinweise
1M Kontext, agentische Workflows, Terminal-Bench 2.0 82,7 %, Parameterzahl nicht veröffentlichtQuelle

Kosten

Veröffentlichte Preise

Preise bleiben an die dokumentierte Einheit und Quelle gebunden.

API-Eingabe
5 $ pro 1 Mio. TokenQuelle
API-Eingabe
10 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
API-Ausgabe
30 $ pro 1 Mio. TokenQuelle
API-Ausgabe
45 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
Cache lesen
0,5 $ pro 1 Mio. TokenQuelle
Cache lesen
1 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle

Messwerte

Weitere veröffentlichte Benchmarks

Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.

TUA-Bench

64,7 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

57,7 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

68,3 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

42,5 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

64,2 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

57,2 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

66,7 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

46,7 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

62,4 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

54,2 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

67,5 %

Abgerufen 9. August 2026

TUA-Bench

TUA-Bench

40 %

Abgerufen 9. August 2026

TUA-Bench

Direkte Vergleiche

Dieses Modell im Vergleich

Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.

Weitere Modelle

Modelle derselben Auswahl

Alle KI-Modelle

Nachweise

Primärquellen und Datenstand

Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.

  • ModellmetadatenQuelle
  • API-PreiseQuelle
  • Princeton HAL (abgerufen 5. August 2026)Quelle
  • Princeton HAL (abgerufen 6. August 2026)Quelle
  • Alman Institut (abgerufen 9. August 2026)Quelle
  • TUA-Bench (abgerufen 9. August 2026)Quelle
  • SWE-Marathon (abgerufen 9. August 2026)Quelle
  • LiveBench (abgerufen 2. September 2026)Quelle
  • OpenAI (abgerufen 2. September 2026)Quelle
  • OSWorld 2.0 (abgerufen 26. August 2026)Quelle
  • Anthropic (abgerufen 2. September 2026)Quelle