Code MigrationOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 20.515 % | Vals AISource detailsData as of: 09/03/2026 |
EMBOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 55.932 % | Vals AISource detailsData as of: 09/03/2026 |
Finance Agent (v2)OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | 54.436 % | | Vals AISource detailsData as of: 09/03/2026 |
GPQA DiamondOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 86.364 % | Vals AISource detailsData as of: 09/01/2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTest detailsNo documented difference in the test setupVersion: 1Metric: task resolution rateScoring: Higher is better | 0.833 % | | Vals AISource detailsData as of: 09/03/2026 |
Legal Research BenchOverall · All-passTest detailsNo documented difference in the test setupVersion: 1Metric: all-pass rateScoring: Higher is better | 41.346 % | | Vals AISource detailsData as of: 09/03/2026 |
LegalBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 83.928 % | Vals AISource detailsData as of: 09/01/2026 |
LiveCodeBench v6OverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 80.51 % | Vals AISource detailsData as of: 09/01/2026 |
MedScribeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 82.869 % | | Vals AISource detailsData as of: 09/03/2026 |
MMLU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 86.059 % | Vals AISource detailsData as of: 09/01/2026 |
MMMU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 86.012 % | Vals AISource detailsData as of: 09/01/2026 |
ProofBenchOverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | | 21 % | Vals AISource detailsData as of: 09/01/2026 |
SkillsBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 40.159 % | Vals AISource detailsData as of: 09/01/2026 |
SWE-bench VerifiedOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 92 % | Vals AISource detailsData as of: 09/01/2026 |
TaxEval v2OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 75.593 % | Vals AISource detailsData as of: 09/01/2026 |
Terminal-Bench 2.1OverallTest detailsNo documented difference in the test setupVersion: 2.1Metric: accuracyScoring: Higher is better | | 62.921 % | Vals AISource detailsData as of: 09/03/2026 |
Vals IndexOverallTest detailsNo documented difference in the test setupVersion: 2Metric: weighted index scoreScoring: Higher is better | | 47.216 % | Vals AISource detailsData as of: 09/03/2026 |
Vibe Code Bench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 30.759 % | Vals AISource detailsData as of: 09/03/2026 |