Zum Hauptinhalt springen
SprachmodellAktiv

GPT-5.4

OpenAI

Veröffentlicht
März 2026
Datenstand
30. Juli 2026

Einordnung

Position in der Kategorie

Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.

Für dieses Modell reichen die veröffentlichten Werte noch nicht für einen Gesamtrang. Es deckt 1 von 4 erforderlichen Vergleichskohorten ab.

Abdeckung
1 / 4

Bestenliste

1Claude Opus 588,9 / 100
2Gemini 3.8 Flash88,5 / 100
3Claude Fable 583,2 / 100
25MiMo-V2.5-Pro12,5 / 100
GPT-5.4, Aktuelles ModellNicht gerankt

Messreihen

Vergleichbare Benchmarkwerte

Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.

Humanity's Last Exam

36,24 % · Platz 2 von 2

Vergleichskohorte: hle-final-scale-public-temperature-0 · Datenstand: 2. September 2026

1.Gemini 3.1 Pro Preview46,44 %
2.GPT-5.4, Aktuelles Modell36,24 %

2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Alle 2.500 öffentlichen Fragen, Temperatur 0 und automatischer Antwort-Extraktor.

Quelle: Scale AITeilnehmer: 2

PRBench Finance

45,63 % · Platz 3 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-finance-full · Datenstand: 26. August 2026

1.Claude Fable 553,86 %
2.GPT-5.6 Sol50,45 %
3.GPT-5.4, Aktuelles Modell45,63 %
4.Gemini 3.1 Pro Preview41,87 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.

Quelle: Scale AITeilnehmer: 4

44,35 % · Platz 3 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-legal-full · Datenstand: 26. August 2026

1.Claude Fable 552,56 %
2.GPT-5.6 Sol50,5 %
3.GPT-5.4, Aktuelles Modell44,35 %
4.Gemini 3.1 Pro Preview44,02 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.

Quelle: Scale AITeilnehmer: 4

MultiNRC

58,29 % · Platz 2 von 2

Aufgabe: Gesamt · Vergleichskohorte: scale-multinrc-native-languages · Datenstand: 26. August 2026

1.Gemini 3.1 Pro Preview64,74 %
2.GPT-5.4, Aktuelles Modell58,29 %

2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung.

Quelle: Scale AITeilnehmer: 2

VisualToolBench

29,17 % · Platz 1 von 2

Aufgabe: Gesamt · Vergleichskohorte: scale-visual-toolbench-apr · Datenstand: 26. August 2026

1.GPT-5.4, Aktuelles Modell29,17 %
2.Gemini 3.1 Pro Preview28,97 %

2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe.

Quelle: Scale AITeilnehmer: 2

Einzelwerte

Veröffentlichte Einzelwerte

Für diese Messwerte liegt keine exakt passende veröffentlichte Vergleichskohorte vor. Der Balken zeigt nur die dokumentierte Skala, keine Rangposition.

SecCodeBench-V2

Aufgabe: Gewichteter Gesamtscore · Datenstand: 9. August 2026

SecCodeBench-V259,74 %

Skala 0 bis 100. Kein Rang

98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.

SecCodeBench-V2

Aufgabe: Reparatur ohne Hinweise · Datenstand: 9. August 2026

SecCodeBench-V261,41 %

Skala 0 bis 100. Kein Rang

98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.

SecCodeBench-V2

Aufgabe: Reparatur mit Sicherheitshinweisen · Datenstand: 9. August 2026

SecCodeBench-V280,04 %

Skala 0 bis 100. Kein Rang

98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.

SecCodeBench-V2

Aufgabe: Generierung ohne Hinweise · Datenstand: 9. August 2026

SecCodeBench-V250,97 %

Skala 0 bis 100. Kein Rang

98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.

SecCodeBench-V2

Aufgabe: Generierung mit Sicherheitshinweisen · Datenstand: 9. August 2026

SecCodeBench-V267,82 %

Skala 0 bis 100. Kein Rang

98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.

VISTA

Aufgabe: Gesamt · Datenstand: 26. August 2026

VISTA50,89 %

Skala 0 bis 100. Kein Rang

758 einzelne Bild-Text-Aufgaben mit strukturierten Ja-Nein-Rubriken.

Steckbrief

Technische Daten und Zugang

Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.

Modelltyp
ProprietärQuelle
Kontextfenster
1.050.000 TokenQuelle
Knowledge Cutoff
31. August 2025Quelle
Hinweise
1M Kontext, Parameterzahl nicht veröffentlichtQuelle

Kosten

Veröffentlichte Preise

Preise bleiben an die dokumentierte Einheit und Quelle gebunden.

API-Eingabe
2,5 $ pro 1 Mio. TokenQuelle
API-Eingabe
5 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
API-Ausgabe
15 $ pro 1 Mio. TokenQuelle
API-Ausgabe
22,5 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
Cache lesen
0,25 $ pro 1 Mio. TokenQuelle
Cache lesen
0,5 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle

Messwerte

Weitere veröffentlichte Benchmarks

Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.

METR Time Horizon

341,74 Minuten

Abgerufen 26. August 2026

METR

METR Time Horizon

53,88 Minuten

Abgerufen 26. August 2026

METR

SWE-EVO

25 %

Abgerufen 9. August 2026

SWE-EVO

SWE-EVO

33,89 %

Abgerufen 9. August 2026

SWE-EVO

SWE-EVO

25 %

Abgerufen 9. August 2026

SWE-EVO

SWE-EVO

33,98 %

Abgerufen 9. August 2026

SWE-EVO

Direkte Vergleiche

Dieses Modell im Vergleich

Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.

Weitere Modelle

Modelle derselben Auswahl

Alle KI-Modelle

Nachweise

Primärquellen und Datenstand

Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.

  • ModellmetadatenQuelle
  • API-PreiseQuelle
  • METR (abgerufen 26. August 2026)Quelle
  • SecCodeBench (abgerufen 9. August 2026)Quelle
  • EnterpriseRAG-Bench (abgerufen 9. August 2026)Quelle
  • SWE-EVO (abgerufen 9. August 2026)Quelle
  • Scale AI (abgerufen 2. September 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle