Code MigrationOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 26.745 % | Vals AISource detailsData as of: 09/27/2026 |
EMBOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 63.548 % | Vals AISource detailsData as of: 09/27/2026 |
Finance Agent (v2)OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 57.861 % | Vals AISource detailsData as of: 09/27/2026 |
GPQA DiamondOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 92.676 % | Vals AISource detailsData as of: 09/01/2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTest detailsNo documented difference in the test setupVersion: 1Metric: task resolution rateScoring: Higher is better | | 2.5 % | Vals AISource detailsData as of: 09/27/2026 |
Legal Research BenchOverall · All-passTest detailsNo documented difference in the test setupVersion: 1Metric: all-pass rateScoring: Higher is better | | 30.769 % | Vals AISource detailsData as of: 09/27/2026 |
LegalBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 83.602 % | Vals AISource detailsData as of: 09/27/2026 |
LiveCodeBench v6OverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 87.604 % | Vals AISource detailsData as of: 09/01/2026 |
MedCodeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 53.39 % | | Vals AISource detailsData as of: 09/26/2026 |
MedScribeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 76.574 % | Vals AISource detailsData as of: 09/26/2026 |
MMLU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 89.515 % | Vals AISource detailsData as of: 09/01/2026 |
MMMU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 88.266 % | Vals AISource detailsData as of: 09/01/2026 |
MortgageTaxOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 66.654 % | | Vals AISource detailsData as of: 09/01/2026 |
ProgramBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | | Vals AISource detailsData as of: 09/27/2026 |
ProofBenchOverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | | 31 % | Vals AISource detailsData as of: 09/28/2026 |
SAGEOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 49.232 % | | Vals AISource detailsData as of: 09/26/2026 |
SkillsBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 52.737 % | Vals AISource detailsData as of: 09/27/2026 |
SWE-bench VerifiedOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 78.8 % | Vals AISource detailsData as of: 09/01/2026 |
Tax Agent BenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 53.526 % | Vals AISource detailsData as of: 09/27/2026 |
TaxEval v2OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 74.366 % | Vals AISource detailsData as of: 09/01/2026 |
Terminal-Bench 2.1OverallTest detailsNo documented difference in the test setupVersion: 2.1Metric: accuracyScoring: Higher is better | | 74.157 % | Vals AISource detailsData as of: 09/27/2026 |
Terminal-Bench 4.0OverallTest detailsNo documented difference in the test setupVersion: 4.0Metric: accuracyScoring: Higher is better | | 4.04 % | Vals AISource detailsData as of: 09/27/2026 |
Terminal-Bench ScienceOverallTest detailsNo documented difference in the test setupVersion: 0.1Metric: accuracyScoring: Higher is better | | 4.286 % | Vals AISource detailsData as of: 09/27/2026 |
Vals IndexOverallTest detailsNo documented difference in the test setupVersion: 2Metric: weighted index scoreScoring: Higher is better | | 53.079 % | Vals AISource detailsData as of: 09/27/2026 |
Vibe Code Bench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 48.683 % | Vals AISource detailsData as of: 09/27/2026 |