ARC-AGI-3
0,8 %
Abgerufen 26. August 2026
ARC PrizeOpenAI
Einordnung
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.
Messreihen
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
77,94 Punkte · Platz 4 von 4
Vergleichskohorte: livebench-2026-06-25-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
23 objektiv bewertete Aufgaben in sieben Kategorien.
90,6 Punkte · Platz 2 von 4
Aufgabe: Reasoning · Vergleichskohorte: livebench-2026-06-25-reasoning-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Reasoning innerhalb desselben LiveBench-Releases.
78,2 Punkte · Platz 4 von 4
Aufgabe: Coding · Vergleichskohorte: livebench-2026-06-25-coding-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Coding innerhalb desselben LiveBench-Releases.
54,9 Punkte · Platz 3 von 4
Aufgabe: Agentisches Coding · Vergleichskohorte: livebench-2026-06-25-agentic-coding-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Agentisches Coding innerhalb desselben LiveBench-Releases.
94,9 Punkte · Platz 4 von 4
Aufgabe: Mathematik · Vergleichskohorte: livebench-2026-06-25-mathematics-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Mathematik innerhalb desselben LiveBench-Releases.
79,3 Punkte · Platz 4 von 4
Aufgabe: Datenanalyse · Vergleichskohorte: livebench-2026-06-25-data-analysis-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Datenanalyse innerhalb desselben LiveBench-Releases.
82,9 Punkte · Platz 4 von 4
Aufgabe: Sprache · Vergleichskohorte: livebench-2026-06-25-language-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Sprache innerhalb desselben LiveBench-Releases.
64,6 Punkte · Platz 4 von 4
Aufgabe: Anweisungsbefolgung · Vergleichskohorte: livebench-2026-06-25-instruction-following-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Anweisungsbefolgung innerhalb desselben LiveBench-Releases.
87,5 % · Platz 2 von 5
Vergleichskohorte: browsecomp-openai-gpt-5-6-table · Datenstand: 2. September 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Herstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich.
Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
63,4 % · Platz 4 von 5
Vergleichskohorte: swe-pro-openai-gpt-5-6-release · Datenstand: 2. September 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Von OpenAI veröffentlichte Vergleichstabelle. Kein Gradually-Test.
OpenAI schätzt nach einer Prüfung, dass rund 30 % der öffentlichen Aufgaben fehlerhaft sind. Der Wert bleibt deshalb ein umstrittenes Zusatzsignal. Die Zeilen sind eine redaktionelle Auswahl aus der jeweiligen Vergleichstabelle.
Steckbrief
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Messwerte
Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.
0,8 %
Abgerufen 26. August 2026
ARC Prize0,65 %
Abgerufen 26. August 2026
ARC Prize0,49 %
Abgerufen 26. August 2026
ARC Prize83,9 %
Abgerufen 2. September 2026
ARC Prize74,2 %
Abgerufen 2. September 2026
ARC Prize67,1 %
Abgerufen 2. September 2026
ARC Prize37,5 %
Abgerufen 2. September 2026
ARC Prize18,8 %
Abgerufen 2. September 2026
ARC PrizeDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Alle KI-Modelle
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.