ARC-AGI-2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: exact task accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: high, Versuche: two exact output guesses per taskDerselbe verifizierte Test mit fünf Reasoning-Stufen je Modell. | | 29,3 % | ARC PrizeQuellendetailsDatenstand: 09.07.2026 |
ARC-AGI-3RHAE overall scoreTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: ARC-AGI-3 2026 verifiedMessgröße: RHAE scoreBewertung: Mehr ist besserGPT-5.6 Sol: Reasoning: high, Agent: ARC Prize official harness, Harness: ARC Prize official harness GPT-5.6 Luna: Reasoning: max, Agent: ARC Prize official harness, Harness: ARC Prize official harnessOffizieller ARC-Prize-Harness auf unbekannten interaktiven Umgebungen. Reasoning-Stufen bleiben getrennt. | | 0,18 % | ARC PrizeQuellendetailsDatenstand: 26.08.2026 |
BioMysteryBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: Terminus 2 | | 61,481 % | Vals AIQuellendetailsDatenstand: 02.09.2026 |
BrowseCompOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1,266 tasksMessgröße: accuracyBewertung: Mehr ist besserHerstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich. | Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe. | 83,3 % Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe. | OpenAIQuellendetailsDatenstand: 09.07.2026 |
Code MigrationOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 44,55 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
CorpFin v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 64,219 % | Vals AIQuellendetailsDatenstand: 12.08.2026 |
CyberBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 83,898 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
EMBOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 67,116 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Finance Agent (v2)OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 53,756 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 91,666 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besser | | 1,25 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
IOIOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 72,917 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Legal Research BenchOverall · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besser | | 36,538 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 84,034 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control GPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style controlGPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 23.153 anonymen Paarvergleichen.GPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 24.433 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±5,12Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.452,364 95-%-Konfidenzintervall: ±5,03Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MedCodeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 42,391 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
MedScribeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 84,391 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 86,036 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MMMU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 85,029 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MortgageTaxOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 67,289 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
ProgramBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 0 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
ProofBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 60 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Public Benefits Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 61,164 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
SAGEOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 44,22 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
SkillsBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | 54,1 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 93 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 74,775 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besser | | 79,026 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Vals IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: weighted index scoreBewertung: Mehr ist besser | | 59,881 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Vals Multimodal IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: weighted index scoreBewertung: Mehr ist besser | | 69,058 % | Vals AIQuellendetailsDatenstand: 11.08.2026 |
Vibe Code Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | | 77,055 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
ARC-AGI-2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: exact task accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: low, Versuche: two exact output guesses per taskDerselbe verifizierte Test mit fünf Reasoning-Stufen je Modell. | | 5,1 % | ARC PrizeQuellendetailsDatenstand: 09.07.2026 |
ARC-AGI-3RHAE overall scoreTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: ARC-AGI-3 2026 verifiedMessgröße: RHAE scoreBewertung: Mehr ist besserGPT-5.6 Sol: Reasoning: low, Agent: ARC Prize official harness, Harness: ARC Prize official harness GPT-5.6 Luna: Reasoning: max, Agent: ARC Prize official harness, Harness: ARC Prize official harnessOffizieller ARC-Prize-Harness auf unbekannten interaktiven Umgebungen. Reasoning-Stufen bleiben getrennt. | | 0,18 % | ARC PrizeQuellendetailsDatenstand: 26.08.2026 |
BrowseCompOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1,266 tasksMessgröße: accuracyBewertung: Mehr ist besserGPT-5.6 Sol: Reasoning: ultraHerstellerübergreifende Vergleichstabelle mit Browser-Werkzeugen. Die genauen Agentensysteme unterscheiden sich. | Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe. | 83,3 % Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe. | OpenAIQuellendetailsDatenstand: 09.07.2026 |
Code MigrationCLITestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 36,067 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Exact PagesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | 61,538 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
CyberBenchPatchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 79,661 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
EMBCompsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 54,573 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)AdjustmentsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | 49,233 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
GPQA DiamondFew-Shot CoTTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 92,424 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Harvey's Legal Agent BenchmarkAntitrust Competition · Criteria passedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: criteria pass rateBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | 78,623 % | | Vals AIQuellendetailsDatenstand: 07.08.2026 |
IOIIOI 2024TestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 78 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Legal Research BenchAdministrative / Regulatory · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 48,485 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
LegalBenchConclusion TasksTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 88,864 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control GPT-5.6 Luna: Snapshot: gpt-5.6-luna-xhigh, Reasoning: xhigh, Harness: Arena text, style controlGPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 4.509 anonymen Paarvergleichen.GPT-5.6 Luna: Stilbereinigte Arena-Bewertung aus 4.691 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±9,485Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.461,709 95-%-Konfidenzintervall: ±9,371Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MMLU-ProBiologyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 93,305 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
MortgageTaxNumerical ExtractionTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | 75,119 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
ProgramBenchAlmost ResolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 9 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SAGEAutomataTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 30.000 tokens | | 31,35 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SkillsBenchNo SkillsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Harness: OpenHands, Ausgabegrenze: 128.000 tokens | 43,312 % | | Vals AIQuellendetailsDatenstand: 07.08.2026 |
SWE-bench Verified<15 min fixTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 96,392 % | Vals AIQuellendetailsDatenstand: 08.08.2026 |
TaxEval v2CorrectnessTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | 65,004 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Terminal-Bench 2.1EasyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 83,333 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Vals IndexCorpFin v2TestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 65,035 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Vals Multimodal IndexCorpFin v2TestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 65,035 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
ARC-AGI-2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: exact task accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Versuche: two exact output guesses per taskDerselbe verifizierte Test mit fünf Reasoning-Stufen je Modell. | | 59,5 % | ARC PrizeQuellendetailsDatenstand: 09.07.2026 |
ARC-AGI-3RHAE overall scoreTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: ARC-AGI-3 2026 verifiedMessgröße: RHAE scoreBewertung: Mehr ist besserEinstellungen: Reasoning: max, Agent: ARC Prize official harness, Harness: ARC Prize official harnessOffizieller ARC-Prize-Harness auf unbekannten interaktiven Umgebungen. Reasoning-Stufen bleiben getrennt. | | 0,18 % | ARC PrizeQuellendetailsDatenstand: 26.08.2026 |
Code MigrationCOBOLTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Max Fitting ContextTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 64,103 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
CyberBenchPoCTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 88,136 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
EMBDataroomTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 83,009 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)All-PassTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | 41,362 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
GPQA DiamondZero-Shot CoTTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 90,909 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Harvey's Legal Agent BenchmarkAntitrust Competition · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besserEinstellungen: Reasoning: max, Ausgabegrenze: 128.000 tokens | | | Vals AIQuellendetailsDatenstand: 07.08.2026 |