TUA-Bench
64,7 %
Abgerufen 9. August 2026
TUA-BenchOpenAI
Einordnung
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.
Messreihen
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
79,5 % · Platz 3 von 3
Aufgabe: Trefferquote · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-overall · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,89 Bewertung · Platz 1 von 3
Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-reliability · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,84 Bewertung · Platz 1 von 3
Aufgabe: Konsistenz · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-consistency · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,84 Bewertung · Platz 1 von 3
Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-predictability · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,97 Bewertung · Platz 1 von 3
Aufgabe: Robustheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-robustness · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,96 Bewertung · Platz 3 von 3
Aufgabe: Sicherheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-safety · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
62,8 % · Platz 3 von 3
Aufgabe: Trefferquote · Vergleichskohorte: hal-gaia-reliability-hal-reliability-overall · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,79 Bewertung · Platz 3 von 3
Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-reliability · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,61 Bewertung · Platz 3 von 3
Aufgabe: Konsistenz · Vergleichskohorte: hal-gaia-reliability-hal-reliability-consistency · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,8 Bewertung · Platz 1 von 3
Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-predictability · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,95 Bewertung · Platz 2 von 3
Aufgabe: Robustheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-robustness · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
1 Bewertung · Platz 1 von 3
Aufgabe: Sicherheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-safety · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
95,43 % · Platz 1 von 5
Aufgabe: Akzeptierte Fälle · Vergleichskohorte: almanbench-v0-1:official:overall · Datenstand: 9. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.029 öffentliche Aufgaben, ein direkter Lauf je Zeile. Gemessen wird die Alman-Sprachspezifikation.
12 % · Platz 3 von 4
Aufgabe: Binäre Lösung, Pass@1 · Vergleichskohorte: swe-marathon-v1-0:official:pass1 · Datenstand: 9. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
20 mehrstündige Aufgaben. Der benannte Coding-Agent ist Teil jeder Ergebniszeile.
80,19 Punkte · Platz 3 von 4
Vergleichskohorte: livebench-2026-06-25-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
23 objektiv bewertete Aufgaben in sieben Kategorien.
89,7 Punkte · Platz 3 von 4
Aufgabe: Reasoning · Vergleichskohorte: livebench-2026-06-25-reasoning-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Reasoning innerhalb desselben LiveBench-Releases.
82,1 Punkte · Platz 3 von 4
Aufgabe: Coding · Vergleichskohorte: livebench-2026-06-25-coding-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Coding innerhalb desselben LiveBench-Releases.
54 Punkte · Platz 4 von 4
Aufgabe: Agentisches Coding · Vergleichskohorte: livebench-2026-06-25-agentic-coding-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Agentisches Coding innerhalb desselben LiveBench-Releases.
95,9 Punkte · Platz 3 von 4
Aufgabe: Mathematik · Vergleichskohorte: livebench-2026-06-25-mathematics-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Mathematik innerhalb desselben LiveBench-Releases.
81,6 Punkte · Platz 1 von 4
Aufgabe: Datenanalyse · Vergleichskohorte: livebench-2026-06-25-data-analysis-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Datenanalyse innerhalb desselben LiveBench-Releases.
87,4 Punkte · Platz 3 von 4
Aufgabe: Sprache · Vergleichskohorte: livebench-2026-06-25-language-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Sprache innerhalb desselben LiveBench-Releases.
70,7 Punkte · Platz 3 von 4
Aufgabe: Anweisungsbefolgung · Vergleichskohorte: livebench-2026-06-25-instruction-following-max · Datenstand: 2. September 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Kategorie Anweisungsbefolgung innerhalb desselben LiveBench-Releases.
84,4 % · Platz 4 von 5
Vergleichskohorte: browsecomp-openai-gpt-5-6-table · Datenstand: 2. September 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Herstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich.
Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Einzelwerte
Für diese Messwerte liegt keine exakt passende veröffentlichte Vergleichskohorte vor. Der Balken zeigt nur die dokumentierte Skala, keine Rangposition.
Datenstand: 26. August 2026
Skala 0 bis 100. Kein Rang
Vollständiges Agentensystem bei bis zu 500 Schritten.
Claude verwendete ungefähr 244.000 Output-Tokens. Das ist ein Systemwert, kein isolierter Modellscore.
Datenstand: 2. September 2026
Skala 0 bis 100. Kein Rang
Von Anthropic veröffentlichte Vergleichstabelle. Kein Gradually-Test.
OpenAI schätzt nach einer Prüfung, dass rund 30 % der öffentlichen Aufgaben fehlerhaft sind. Der Wert bleibt deshalb ein umstrittenes Zusatzsignal. Die Zeilen sind eine redaktionelle Auswahl aus der jeweiligen Vergleichstabelle.
Steckbrief
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Messwerte
Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.
64,7 %
Abgerufen 9. August 2026
TUA-Bench57,7 %
Abgerufen 9. August 2026
TUA-Bench68,3 %
Abgerufen 9. August 2026
TUA-Bench42,5 %
Abgerufen 9. August 2026
TUA-Bench64,2 %
Abgerufen 9. August 2026
TUA-Bench57,2 %
Abgerufen 9. August 2026
TUA-Bench66,7 %
Abgerufen 9. August 2026
TUA-Bench46,7 %
Abgerufen 9. August 2026
TUA-Bench62,4 %
Abgerufen 9. August 2026
TUA-Bench54,2 %
Abgerufen 9. August 2026
TUA-Bench67,5 %
Abgerufen 9. August 2026
TUA-Bench40 %
Abgerufen 9. August 2026
TUA-BenchDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Alle KI-Modelle
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.