Code MigrationOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 34,8 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
CyberBench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 43,75 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
EMBOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 67,116 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Finance Agent (v2)OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 55,044 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 91,666 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besser | 1,25 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
IOIOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 61,778 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Legal Research BenchOverall · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besser | | 34,615 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 84,034 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
MedCodeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 42,391 % | | Vals AIQuellendetailsDatenstand: 26.09.2026 |
MedScribeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 83,942 % | Vals AIQuellendetailsDatenstand: 26.09.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 86,036 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MMMU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 85,029 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MortgageTaxOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 66,654 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
ProgramBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
ProofBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 58 % | Vals AIQuellendetailsDatenstand: 28.09.2026 |
SAGEOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 44,22 % | | Vals AIQuellendetailsDatenstand: 26.09.2026 |
SkillsBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | 60,447 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 80,8 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Tax Agent BenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 57,665 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 74,734 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besser | | 77,528 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Terminal-Bench 4.0OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 4.0Messgröße: accuracyBewertung: Mehr ist besser | 4,545 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Terminal-Bench ScienceOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 0.1Messgröße: accuracyBewertung: Mehr ist besser | | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Vals IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: weighted index scoreBewertung: Mehr ist besser | | 59,307 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Vibe Code Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | | 70,395 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |