Code MigrationOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 34,8 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
CyberBench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 43,75 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
EMBOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 66,205 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Finance Agent (v2)OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 54,436 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 90,909 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besser | 0,833 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
IOIOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 67,833 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Legal Research BenchOverall · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besser | | 34,615 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 85,105 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
LiveCodeBench v6OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 85,93 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MedCodeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 43,414 % | | Vals AIQuellendetailsDatenstand: 26.09.2026 |
MedScribeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 82,869 % | | Vals AIQuellendetailsDatenstand: 26.09.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 86,659 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MMMU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 86,474 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
MortgageTaxOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 66,654 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
ProgramBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 0 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
ProofBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 58 % | Vals AIQuellendetailsDatenstand: 28.09.2026 |
SAGEOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 47,003 % | | Vals AIQuellendetailsDatenstand: 26.09.2026 |
SkillsBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | 58,895 % | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 80,8 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Tax Agent BenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 57,665 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 74,734 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besser | | | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Terminal-Bench 4.0OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 4.0Messgröße: accuracyBewertung: Mehr ist besser | | 6,061 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Terminal-Bench ScienceOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 0.1Messgröße: accuracyBewertung: Mehr ist besser | | 5,714 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Vals IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: weighted index scoreBewertung: Mehr ist besser | | 59,307 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Vibe Code Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | | 70,395 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |