METR Time Horizon
341,74 Minuten
Abgerufen 26. August 2026
METROpenAI
Einordnung
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Für dieses Modell reichen die veröffentlichten Werte noch nicht für einen Gesamtrang. Es deckt 1 von 4 erforderlichen Vergleichskohorten ab.
Messreihen
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
36,24 % · Platz 2 von 2
Vergleichskohorte: hle-final-scale-public-temperature-0 · Datenstand: 2. September 2026
2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Alle 2.500 öffentlichen Fragen, Temperatur 0 und automatischer Antwort-Extraktor.
45,63 % · Platz 3 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-finance-full · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.
44,35 % · Platz 3 von 4
Aufgabe: Gesamt · Vergleichskohorte: scale-prbench-legal-full · Datenstand: 26. August 2026
4 von 4 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror.
58,29 % · Platz 2 von 2
Aufgabe: Gesamt · Vergleichskohorte: scale-multinrc-native-languages · Datenstand: 26. August 2026
2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung.
29,17 % · Platz 1 von 2
Aufgabe: Gesamt · Vergleichskohorte: scale-visual-toolbench-apr · Datenstand: 26. August 2026
2 von 2 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe.
Einzelwerte
Für diese Messwerte liegt keine exakt passende veröffentlichte Vergleichskohorte vor. Der Balken zeigt nur die dokumentierte Skala, keine Rangposition.
Aufgabe: Gewichteter Gesamtscore · Datenstand: 9. August 2026
Skala 0 bis 100. Kein Rang
98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.
Aufgabe: Reparatur ohne Hinweise · Datenstand: 9. August 2026
Skala 0 bis 100. Kein Rang
98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.
Aufgabe: Reparatur mit Sicherheitshinweisen · Datenstand: 9. August 2026
Skala 0 bis 100. Kein Rang
98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.
Aufgabe: Generierung ohne Hinweise · Datenstand: 9. August 2026
Skala 0 bis 100. Kein Rang
98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.
Aufgabe: Generierung mit Sicherheitshinweisen · Datenstand: 9. August 2026
Skala 0 bis 100. Kein Rang
98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung.
Aufgabe: Gesamt · Datenstand: 26. August 2026
Skala 0 bis 100. Kein Rang
758 einzelne Bild-Text-Aufgaben mit strukturierten Ja-Nein-Rubriken.
Steckbrief
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Messwerte
Für diese Werte liegt im gespeicherten Datenbestand keine exakt gleiche Vergleichskohorte vor.
341,74 Minuten
Abgerufen 26. August 2026
METR53,88 Minuten
Abgerufen 26. August 2026
METR68,8 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench55,95 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench68,41 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench9,01 Punkte
Abgerufen 9. August 2026
EnterpriseRAG-Bench51,4 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench42,94 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench46,03 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench9,32 Punkte
Abgerufen 9. August 2026
EnterpriseRAG-Bench60,6 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench61,12 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench55,76 %
Abgerufen 9. August 2026
EnterpriseRAG-Bench2 Punkte
Abgerufen 9. August 2026
EnterpriseRAG-Bench25 %
Abgerufen 9. August 2026
SWE-EVO33,89 %
Abgerufen 9. August 2026
SWE-EVO25 %
Abgerufen 9. August 2026
SWE-EVO33,98 %
Abgerufen 9. August 2026
SWE-EVODirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Alle KI-Modelle
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.