Zum Hauptinhalt springen
SprachmodellAktiv

GPT-5.6 Sol

OpenAI

Veröffentlicht
26. Juni 2026
Datenstand
24. August 2026

Einordnung

Position in der Kategorie

Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.

Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.

Position
Platz 4 von 26
Indexwert
81,7 / 100
Abdeckung
4 / 4

Bestenliste

1Claude Opus 588,9 / 100
2Gemini 3.8 Flash88,5 / 100
3Claude Fable 583,2 / 100
4GPT-5.6 Sol, Aktuelles Modell81,7 / 100
5Gemini 3.7 Flash76,4 / 100
25MiMo-V2.5-Pro12,5 / 100

Messreihen

Vergleichbare Benchmarkwerte

Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.

SimpleQA Verified v2

69,2 % · Platz 3 von 5

Aufgabe: Kaggle-Score · Vergleichskohorte: simpleqa-verified-v2:official:overall · Datenstand: 9. August 2026

1.Gemini 3.1 Pro Preview77,5 %
2.Gemini 3.5 Flash70,4 %
3.GPT-5.6 Sol, Aktuelles Modell69,2 %
4.Claude Opus 563,3 %
5.Grok 4.553,8 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.000 verifizierte Prompts ohne Werkzeuge. Kaggle hat die Ergebnisse unabhängig reproduziert.

Quelle: KaggleTeilnehmer: 5

AlmanBench v0.1

95,14 % · Platz 2 von 5

Aufgabe: Akzeptierte Fälle · Vergleichskohorte: almanbench-v0-1:official:overall · Datenstand: 9. August 2026

1.GPT-5.595,43 %
2.GPT-5.6 Sol, Aktuelles Modell95,14 %
3.Claude Opus 594,95 %
4.DeepSeek-V4-Flash93 %
5.Kimi K390,96 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation.

LiveBench

81,05 Punkte · Platz 2 von 4

Vergleichskohorte: livebench-2026-06-25-max · Datenstand: 2. September 2026

1.Claude Fable 582,97 Punkte
2.GPT-5.6 Sol, Aktuelles Modell81,05 Punkte
3.GPT-5.580,19 Punkte
4.GPT-5.6 Terra77,94 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

23 objektiv bewertete Aufgaben in sieben Kategorien.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

91,7 Punkte · Platz 1 von 4

Aufgabe: Reasoning · Vergleichskohorte: livebench-2026-06-25-reasoning-max · Datenstand: 2. September 2026

1.GPT-5.6 Sol, Aktuelles Modell91,7 Punkte
2.GPT-5.6 Terra90,6 Punkte
3.Claude Fable 589,7 Punkte
3.GPT-5.589,7 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Reasoning innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

83,9 Punkte · Platz 2 von 4

Aufgabe: Coding · Vergleichskohorte: livebench-2026-06-25-coding-max · Datenstand: 2. September 2026

1.Claude Fable 586 Punkte
2.GPT-5.6 Sol, Aktuelles Modell83,9 Punkte
3.GPT-5.582,1 Punkte
4.GPT-5.6 Terra78,2 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Coding innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

56,2 Punkte · Platz 2 von 4

Aufgabe: Agentisches Coding · Vergleichskohorte: livebench-2026-06-25-agentic-coding-max · Datenstand: 2. September 2026

1.Claude Fable 562,2 Punkte
2.GPT-5.6 Sol, Aktuelles Modell56,2 Punkte
3.GPT-5.6 Terra54,9 Punkte
4.GPT-5.554 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Agentisches Coding innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

96,2 Punkte · Platz 1 von 4

Aufgabe: Mathematik · Vergleichskohorte: livebench-2026-06-25-mathematics-max · Datenstand: 2. September 2026

1.GPT-5.6 Sol, Aktuelles Modell96,2 Punkte
2.Claude Fable 596 Punkte
3.GPT-5.595,9 Punkte
4.GPT-5.6 Terra94,9 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Mathematik innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

79,8 Punkte · Platz 3 von 4

Aufgabe: Datenanalyse · Vergleichskohorte: livebench-2026-06-25-data-analysis-max · Datenstand: 2. September 2026

1.GPT-5.581,6 Punkte
2.Claude Fable 580,5 Punkte
3.GPT-5.6 Sol, Aktuelles Modell79,8 Punkte
4.GPT-5.6 Terra79,3 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Datenanalyse innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

87,7 Punkte · Platz 2 von 4

Aufgabe: Sprache · Vergleichskohorte: livebench-2026-06-25-language-max · Datenstand: 2. September 2026

1.Claude Fable 590,7 Punkte
2.GPT-5.6 Sol, Aktuelles Modell87,7 Punkte
3.GPT-5.587,4 Punkte
4.GPT-5.6 Terra82,9 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Sprache innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

LiveBench

71,8 Punkte · Platz 2 von 4

Aufgabe: Anweisungsbefolgung · Vergleichskohorte: livebench-2026-06-25-instruction-following-max · Datenstand: 2. September 2026

1.Claude Fable 575,8 Punkte
2.GPT-5.6 Sol, Aktuelles Modell71,8 Punkte
3.GPT-5.570,7 Punkte
4.GPT-5.6 Terra64,6 Punkte

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Kategorie Anweisungsbefolgung innerhalb desselben LiveBench-Releases.

Quelle: LiveBenchTeilnehmer: 4

SWE-Bench Pro

64,6 % · Platz 3 von 5

Vergleichskohorte: swe-pro-openai-gpt-5-6-release · Datenstand: 2. September 2026

1.Claude Mythos 580,3 %
2.Claude Fable 580 %
3.GPT-5.6 Sol, Aktuelles Modell64,6 %
4.GPT-5.6 Terra63,4 %
5.GPT-5.6 Luna62,7 %

5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Von OpenAI veröffentlichte Vergleichstabelle. Kein Gradually-Test.

OpenAI schätzt nach einer Prüfung, dass rund 30 % der öffentlichen Aufgaben fehlerhaft sind. Der Wert bleibt deshalb ein umstrittenes Zusatzsignal. Die Zeilen sind eine redaktionelle Auswahl aus der jeweiligen Vergleichstabelle.

Quelle: OpenAITeilnehmer: 5

PRBench Finance

50,45 % · Platz 2 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-finance-full · Datenstand: 26. August 2026

1.Claude Fable 553,86 %
2.GPT-5.6 Sol, Aktuelles Modell50,45 %
3.GPT-5.445,63 %
4.Gemini 3.1 Pro Preview41,87 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.

Quelle: Scale AITeilnehmer: 4

50,5 % · Platz 2 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-legal-full · Datenstand: 26. August 2026

1.Claude Fable 552,56 %
2.GPT-5.6 Sol, Aktuelles Modell50,5 %
3.GPT-5.444,35 %
4.Gemini 3.1 Pro Preview44,02 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.

Quelle: Scale AITeilnehmer: 4

EnigmaEval

37,12 % · Platz 2 von 4

Aufgabe: Gesamt · Vergleichskohorte: scale-enigma-eval-2026-07-23 · Datenstand: 26. August 2026

1.Claude Fable 539,28 %
2.GPT-5.6 Sol, Aktuelles Modell37,12 %
3.Gemini 3.1 Pro Preview36,78 %
4.Gemini 3.5 Flash25,41 %

4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.

Komplexe multimodale Rätsel mit exaktem Antwortabgleich und einem Versuch.

Quelle: Scale AITeilnehmer: 4

Steckbrief

Technische Daten und Zugang

Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.

Modelltyp
ProprietärQuelle
Kontextfenster
1.050.000 TokenQuelle
Knowledge Cutoff
16. Februar 2026Quelle
Hinweise
Flaggschiff der GPT-5.6-Familie (Sol, Terra, Luna). Vorschau am 26. Juni 2026, allgemein verfügbar seit dem 9. Juli 2026, nachdem die US-Regierung das Rahmenwerk für eingeschränkten Zugang aufgehoben hat. Verfügbar in ChatGPT (Plus, Pro, Business, Enterprise ab der Effort-Stufe Medium; Pro und Enterprise erhalten zusätzlich Sol Pro), Codex und der API. Terminal-Bench 2.1 88,8 % (im Sol-Ultra-Modus mit vier parallelen Subagenten: 91,9 %), Artificial Analysis Coding Agent Index 80, SWE-Bench Pro 64,6 % (etwa 15 Punkte hinter Claude Mythos 5 und Fable 5). Neu bei der allgemeinen Verfügbarkeit: programmatisches Tool-Calling mit vom Modell geschriebenem JavaScript in einer V8-Sandbox.Quelle

Kosten

Veröffentlichte Preise

Preise bleiben an die dokumentierte Einheit und Quelle gebunden.

API-Eingabe
4 $ pro 1 Mio. TokenQuelle
API-Eingabe
8 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
API-Ausgabe
20 $ pro 1 Mio. TokenQuelle
API-Ausgabe
30 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
Cache schreiben
5 $ pro 1 Mio. TokenQuelle
Cache schreiben
10 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle
Cache lesen
0,4 $ pro 1 Mio. TokenQuelle
Cache lesen
0,8 $ pro 1 Mio. Token (über 272.000 Kontext-Token)Quelle

Messwerte

Weitere veröffentlichte Benchmarks

Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.

ARC-AGI-3

7,78 %

Abgerufen 26. August 2026

ARC Prize

ARC-AGI-3

6,99 %

Abgerufen 26. August 2026

ARC Prize

ARC-AGI-3

2,15 %

Abgerufen 26. August 2026

ARC Prize

ARC-AGI-3

1,07 %

Abgerufen 26. August 2026

ARC Prize

ARC-AGI-3

0,33 %

Abgerufen 26. August 2026

ARC Prize

ARC-AGI-2

92,5 %

Abgerufen 2. September 2026

ARC Prize

ARC-AGI-2

90 %

Abgerufen 2. September 2026

ARC Prize

ARC-AGI-2

85,4 %

Abgerufen 2. September 2026

ARC Prize

ARC-AGI-2

67,1 %

Abgerufen 2. September 2026

ARC Prize

ARC-AGI-2

42,5 %

Abgerufen 2. September 2026

ARC Prize

BrowseComp

92,2 %

Abgerufen 2. September 2026 · Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.

OpenAI

BrowseComp

90,4 %

Abgerufen 2. September 2026 · Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.

OpenAI

Direkte Vergleiche

Dieses Modell im Vergleich

Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.

Weitere Modelle

Modelle derselben Auswahl

Alle KI-Modelle

Nachweise

Primärquellen und Datenstand

Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.

  • ModellmetadatenQuelle
  • Kontextfenster-DatenQuelle
  • Wissensstand-DatenQuelle
  • API-PreiseQuelle
  • ARC Prize (abgerufen 26. August 2026)Quelle
  • Kaggle (abgerufen 9. August 2026)Quelle
  • Alman Institut (abgerufen 9. August 2026)Quelle
  • LiveBench (abgerufen 2. September 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle
  • Scale AI (abgerufen 26. August 2026)Quelle