METR Time Horizon
384,15 Minuten
Abgerufen 26. August 2026
METREinordnung
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten. Nur Modelle mit vollständiger Abdeckung erhalten eine Position.
Messreihen
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
82,1 % · Platz 1 von 3
Aufgabe: Trefferquote · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-overall · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,86 Bewertung · Platz 2 von 3
Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-reliability · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,81 Bewertung · Platz 2 von 3
Aufgabe: Konsistenz · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-consistency · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,83 Bewertung · Platz 2 von 3
Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-predictability · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,94 Bewertung · Platz 3 von 3
Aufgabe: Robustheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-robustness · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
0,97 Bewertung · Platz 2 von 3
Aufgabe: Sicherheit · Vergleichskohorte: hal-tau-airline-clean-hal-reliability-safety · Datenstand: 5. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet.
76,2 % · Platz 2 von 3
Aufgabe: Trefferquote · Vergleichskohorte: hal-gaia-reliability-hal-reliability-overall · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,82 Bewertung · Platz 2 von 3
Aufgabe: Zuverlässigkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-reliability · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,76 Bewertung · Platz 1 von 3
Aufgabe: Konsistenz · Vergleichskohorte: hal-gaia-reliability-hal-reliability-consistency · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,78 Bewertung · Platz 3 von 3
Aufgabe: Vorhersagbarkeit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-predictability · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
0,94 Bewertung · Platz 3 von 3
Aufgabe: Robustheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-robustness · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
1 Bewertung · Platz 1 von 3
Aufgabe: Sicherheit · Vergleichskohorte: hal-gaia-reliability-hal-reliability-safety · Datenstand: 6. August 2026
3 von 3 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht.
77,5 % · Platz 1 von 5
Aufgabe: Kaggle-Score · Vergleichskohorte: simpleqa-verified-v2:official:overall · Datenstand: 9. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 verifizierte Prompts ohne Werkzeuge. Kaggle hat die Ergebnisse unabhängig reproduziert.
46,44 % · Platz 1 von 2
Vergleichskohorte: hle-final-scale-public-temperature-0 · Datenstand: 2. September 2026
2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Alle 2.500 öffentlichen Fragen, Temperatur 0 und automatischer Antwort-Extraktor.
85,9 % · Platz 3 von 5
Vergleichskohorte: browsecomp-openai-gpt-5-6-table · Datenstand: 2. September 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Herstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich.
Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
41,87 % · Platz 4 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-finance-full · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.
44,02 % · Platz 4 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-legal-full · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.
64,74 % · Platz 1 von 2
Aufgabe: Gesamt · Vergleichskohorte: scale-multinrc-native-languages · Datenstand: 26. August 2026
2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung.
36,78 % · Platz 3 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-enigma-eval-2026-07-23 · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Komplexe multimodale Rätsel mit exaktem Antwortabgleich und einem Versuch.
28,97 % · Platz 2 von 2
Aufgabe: Gesamt · Vergleichskohorte: scale-visual-toolbench-apr · Datenstand: 26. August 2026
2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe.
Einzelwerte
Für diese Messwerte liegt keine exakt passende veröffentlichte Vergleichskohorte vor. Der Balken zeigt nur die dokumentierte Skala, keine Rangposition.
Aufgabe: Gesamt · Datenstand: 26. August 2026
Skala 0 bis 100. Kein Rang
Mehrstufige Gespräche mit binären, aufgabenspezifischen Rubriken.
Aufgabe: Gesamt · Datenstand: 26. August 2026
Skala 0 bis 100. Kein Rang
1.490 Aufgaben mit gewichteten Rubriken und Claude 4 Sonnet als Juror.
Steckbrief
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Messwerte
Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.
Direkte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Alle KI-Modelle
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.