ARC-AGI-3
7,78 %
Abgerufen 26. August 2026
ARC PrizeOpenAI
Einordnung
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.
Messreihen
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
69,2 % · Platz 3 von 5
Aufgabe: Kaggle-Score · Vergleichskohorte: simpleqa-verified-v2:official:overall · Datenstand: 9. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 verifizierte Prompts ohne Werkzeuge. Kaggle hat die Ergebnisse unabhängig reproduziert.
95,14 % · Platz 2 von 5
Aufgabe: Akzeptierte Fälle · Vergleichskohorte: almanbench-v0-1:official:overall · Datenstand: 9. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation.
81,05 Punkte · Platz 2 von 4
Vergleichskohorte: livebench-2026-06-25-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
23 objektiv bewertete Aufgaben in sieben Kategorien.
91,7 Punkte · Platz 1 von 4
Aufgabe: Reasoning · Vergleichskohorte: livebench-2026-06-25-reasoning-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Reasoning innerhalb desselben LiveBench-Releases.
83,9 Punkte · Platz 2 von 4
Aufgabe: Coding · Vergleichskohorte: livebench-2026-06-25-coding-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Coding innerhalb desselben LiveBench-Releases.
56,2 Punkte · Platz 2 von 4
Aufgabe: Agentisches Coding · Vergleichskohorte: livebench-2026-06-25-agentic-coding-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Agentisches Coding innerhalb desselben LiveBench-Releases.
96,2 Punkte · Platz 1 von 4
Aufgabe: Mathematik · Vergleichskohorte: livebench-2026-06-25-mathematics-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Mathematik innerhalb desselben LiveBench-Releases.
79,8 Punkte · Platz 3 von 4
Aufgabe: Datenanalyse · Vergleichskohorte: livebench-2026-06-25-data-analysis-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Datenanalyse innerhalb desselben LiveBench-Releases.
87,7 Punkte · Platz 2 von 4
Aufgabe: Sprache · Vergleichskohorte: livebench-2026-06-25-language-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Sprache innerhalb desselben LiveBench-Releases.
71,8 Punkte · Platz 2 von 4
Aufgabe: Anweisungsbefolgung · Vergleichskohorte: livebench-2026-06-25-instruction-following-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Anweisungsbefolgung innerhalb desselben LiveBench-Releases.
64,6 % · Platz 3 von 5
Vergleichskohorte: swe-pro-openai-gpt-5-6-release · Datenstand: 2. September 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Von OpenAI veröffentlichte Vergleichstabelle. Kein Gradually-Test.
OpenAI schätzt nach einer Prüfung, dass rund 30 % der öffentlichen Aufgaben fehlerhaft sind. Der Wert bleibt deshalb ein umstrittenes Zusatzsignal. Die Zeilen sind eine redaktionelle Auswahl aus der jeweiligen Vergleichstabelle.
50,45 % · Platz 2 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-finance-full · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.
50,5 % · Platz 2 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-legal-full · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.
37,12 % · Platz 2 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-enigma-eval-2026-07-23 · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Komplexe multimodale Rätsel mit exaktem Antwortabgleich und einem Versuch.
Steckbrief
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Messwerte
Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.
7,78 %
Abgerufen 26. August 2026
ARC Prize6,99 %
Abgerufen 26. August 2026
ARC Prize2,15 %
Abgerufen 26. August 2026
ARC Prize1,07 %
Abgerufen 26. August 2026
ARC Prize0,33 %
Abgerufen 26. August 2026
ARC Prize92,5 %
Abgerufen 2. September 2026
ARC Prize90 %
Abgerufen 2. September 2026
ARC Prize85,4 %
Abgerufen 2. September 2026
ARC Prize67,1 %
Abgerufen 2. September 2026
ARC Prize42,5 %
Abgerufen 2. September 2026
ARC Prize92,2 %
Abgerufen 2. September 2026 · Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
OpenAI90,4 %
Abgerufen 2. September 2026 · Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
OpenAIDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Alle KI-Modelle
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.